研究
Anthropic 发布 AI 安全研究新成果
Anthropic 在 AI 安全领域取得重要进展,发布多项安全研究成果。
Anthropic 今日发布了多项 AI 安全研究新成果,在可解释性与对齐领域取得重要进展。
研究团队公布了在模型可解释性方面的最新方法,尝试揭示大模型内部的决策机制,并提出了降低有害输出、增强指令遵循和抵御越狱攻击的技术方案。
Anthropic 表示,随着模型能力不断增强,安全与对齐研究的重要性愈发凸显。公司呼吁行业加强协作,共同建立可衡量的安全标准,确保先进 AI 系统的可控与可信。
Anthropic安全研究AI伦理
来源:Anthropic