跳到正文
Daily Edition · AI industry record
Live desk ●
发布综合报道2 分钟阅读更新于作者:AI Tools Daily

Claude Sonnet 4.5 发布:可连续自主工作 30 小时的编程模型

Anthropic 于 2025 年 9 月 29 日发布 Claude Sonnet 4.5,号称当时世界最强编程模型,长任务自主性大幅提升。

Anthropic 于 2025 年 9 月 29 日发布 Claude Sonnet 4.5,官方称其为当时世界最强的编程模型:在 SWE-bench Verified 等基准登顶,并可在复杂任务上连续自主工作 30 小时以上——长任务自主性成为新的竞争维度。

同期 Anthropic 升级了 Claude Code(检查点、子 Agent)并推出浏览器扩展,Sonnet 4.5 以中档定价提供旗舰级编程能力,迅速成为 Cursor、Windsurf 等工具的默认首选。

从 Sonnet 4.5(9 月)到 Haiku 4.5(10 月)再到 Opus 4.5(11 月),Anthropic 三月三发,把“编程最强”的心智牢牢地钉在了自己身上。

30 小时自主性意味着什么

“连续自主工作 30 小时”不只是一个时长数字,而是竞争维度的切换:它衡量的不是单次回答质量,而是模型在长链条任务中不偏航、不失忆、遇错能自行回滚重试的工程可靠性。这正是 Agent 产品化的真实瓶颈(参见本站 Devin 2.0 报道):演示里人人都能跑通五分钟,产品里拼的是第二十个小时的稳定性。配套的 Claude Code 检查点与子 Agent 机制,本质上是为长任务提供“存档—分工—回滚”的工程脚手架。

中档定价同样是精心设计:旗舰级编程能力下沉到 Sonnet 价位,意味着 Cursor、Windsurf 等工具可以把它设为默认模型而不击穿订阅毛利(参见本站 Windsurf 收购报道)——这步棋直接把 Claude 钉进了编程工具的供应链默认项。

本站解读

Sonnet 4.5 是 2025 年下半年竞争叙事换轨的标志:基准分数之外,“能自主工作多久”成为新的硬指标,而这个指标直接决定 Agent 能否从演示走向生产(参见本站 AI 编程工具战争报道)。它也为两个月后 Opus 4.5 的降价登顶埋下伏笔(参见本站报道):先用中档机型占领工具链默认位,再用旗舰价格战收割心智——Anthropic 这套组合拳,是 2025 年模型厂商商业打法最清晰的样本。

本文综合自官方公告及公开报道,原始来源见文末链接。

本文提到的工具