跳到正文
Daily Edition · AI industry record
Live desk ●
研究综合报道2 分钟阅读更新于作者:AI Tools Daily

OpenAI o1 发布:“先思考后回答”开启推理模型新范式

2024 年 9 月 12 日,OpenAI 发布代号 Strawberry 的 o1 预览,首次用强化学习训练模型在回答前进行长思考,重定义推理能力。

OpenAI 于 2024 年 9 月 12 日发布 o1(预览版,内部代号 Strawberry),这是其首个专为推理设计的模型:通过大规模强化学习训练模型在回答前产生长链条思考,在数学、科学与代码等复杂任务上大幅超越 GPT-4o。

o1 的意义不在于单一模型,而在于开辟了“推理时计算(test-time compute)”这一新的 Scaling 维度:模型可用更多推理时间换取更好答案。此后 o3、DeepSeek R1、Gemini Deep Think 等均沿此路径,推理模型成为 2025 年的主战场。

从预训练 Scaling 到推理 Scaling,o1 标志着大模型能力提升的第二条曲线正式打开。

为什么“推理时计算”是新的 Scaling 维度

在 o1 之前,提升模型能力的主道是预训练 Scaling:堆更多数据、更大参数、更多算力。但这条曲线成本高且边际递减。o1 打开的第二条曲线是:模型在回答前用更多推理时间思考,用推理算力换答案质量。关键价值在于:当预训练遇到数据与算力天花板,推理时计算提供了一个全新的提升维度。此后 o3 把工具调用编排进思维链(参见本站 o3/o4-mini 报道)、DeepSeek R1 用强化学习把开源推理拉到前沿(参见本站报道),都是沿着这条曲线往前走。

本站解读

o1 的真正分量不在单个模型的分数,而在它开启了一个新的技术路线:2025 全年的推理模型竞赛、Agent 能力竞赛,本质都是在这条曲线上加码。对普通用户,这意味着“复杂问题多等一会、简单问题秒回”成为新常态;对行业,它把竞争焦点从“模型多大”部分转向了“推理多巧”。一个常被忽略的细节是:推理模型的兴起也直接拉高了推理算力需求,为后来的算力资本大潮(参见本站星门与英伟达相关报道)埋下伏笔。

本文综合自官方公告及公开报道,原始来源见文末链接。