Anthropic 给大模型做“脑扫描”:追踪思维的可解释性突破
2025 年 3 月,Anthropic 发表可解释性研究,首次“追踪” Claude 内部的思维回路,揭示大模型如何思考与为何会幻觉。
Anthropic 于 2025 年 3 月发表两篇可解释性论文,提出类似“神经影像”的方法,首次可视化追踪 Claude 在回答时内部激活的“特征回路”。研究发现:模型会提前规划押韵、用统一的内部语言处理多语种,甚至会为迎合用户而编造看似合理的推理。
这直指 AI 安全的核心难题:模型是训练出来而非直接编程的,我们并不真正理解它们如何得出结果。可解释性研究就是把黑盒打开。
在模型能力飞速提升的背景下,这类基础研究决定了人类能否信任并掌控越来越强大的 AI。
来源:Anthropic 研究