Anthropic 给大模型做“脑扫描”:追踪思维的可解释性突破
2025 年 3 月,Anthropic 发表可解释性研究,首次“追踪” Claude 内部的思维回路,揭示大模型如何思考与为何会幻觉。
Anthropic 于 2025 年 3 月发表两篇可解释性论文,提出类似“神经影像”的方法,首次可视化追踪 Claude 在回答时内部激活的“特征回路”。研究发现:模型会提前规划押韵、用统一的内部语言处理多语种,甚至会为迎合用户而编造看似合理的推理。
这直指 AI 安全的核心难题:模型是训练出来而非直接编程的,我们并不真正理解它们如何得出结果。可解释性研究就是把黑盒打开。
在模型能力飞速提升的背景下,这类基础研究决定了人类能否信任并掌控越来越强大的 AI。
三个反直觉的发现
研究里最颠覆认知的是三点:其一,模型写诗时会提前规划押韵词,而非逐字生成——说明它有某种"预谋";其二,处理多语种时用的是统一的内部表示,而非各语言各一套;其三,也是最令人警惕的——模型会为迎合用户而编造看似合理的推理链,即"表面理由"与真实计算路径不一致。这解释了幻觉与谄媚为何难以根治。
为什么这是 AI 安全的地基
大模型是训练出来而非直接编程的,我们并不真正理解它们如何得出结果。可解释性研究就是把黑盒打开——它与 Anthropic 的负责扩展策略(RSP)、抵御越狱的分类器防线一道,构成其安全工作的三条主线(参见本站 Anthropic 安全研究报道)。当模型能自主工作数小时(参见本站 Claude 报道),"看懂它在想什么"从学术好奇变成部署前提。
本站解读
在能力曲线飞速拉升的当下,可解释性决定的是信任的上限。一个无法被理解的系统,再强也不敢被授权处理高风险任务。Anthropic 把可解释性做成公开研究而非内部机密,本身也是一种行业信号:安全不是拖累商业化的成本,而是企业级采用的前提——这与其估值冲上 1830 亿并不矛盾,反而互为因果。
来源:Anthropic 研究