跳到正文
Daily Edition · AI industry record
Live desk ●
研究综合报道作者:AI Tools Daily

Anthropic 给大模型做“脑扫描”:追踪思维的可解释性突破

2025 年 3 月,Anthropic 发表可解释性研究,首次“追踪” Claude 内部的思维回路,揭示大模型如何思考与为何会幻觉。

Anthropic 于 2025 年 3 月发表两篇可解释性论文,提出类似“神经影像”的方法,首次可视化追踪 Claude 在回答时内部激活的“特征回路”。研究发现:模型会提前规划押韵、用统一的内部语言处理多语种,甚至会为迎合用户而编造看似合理的推理。

这直指 AI 安全的核心难题:模型是训练出来而非直接编程的,我们并不真正理解它们如何得出结果。可解释性研究就是把黑盒打开。

在模型能力飞速提升的背景下,这类基础研究决定了人类能否信任并掌控越来越强大的 AI。

本文综合自官方公告及公开报道,原始来源见文末链接。

本文提到的工具