跳到正文
Daily Edition · AI industry record
Live desk ●
研究综合报道作者:AI Tools Daily

OpenAI o1 发布:“先思考后回答”开启推理模型新范式

2024 年 9 月 12 日,OpenAI 发布代号 Strawberry 的 o1 预览,首次用强化学习训练模型在回答前进行长思考,重定义推理能力。

OpenAI 于 2024 年 9 月 12 日发布 o1(预览版,内部代号 Strawberry),这是其首个专为推理设计的模型:通过大规模强化学习训练模型在回答前产生长链条思考,在数学、科学与代码等复杂任务上大幅超越 GPT-4o。

o1 的意义不在于单一模型,而在于开辟了“推理时计算(test-time compute)”这一新的 Scaling 维度:模型可用更多推理时间换取更好答案。此后 o3、DeepSeek R1、Gemini Deep Think 等均沿此路径,推理模型成为 2025 年的主战场。

从预训练 Scaling 到推理 Scaling,o1 标志着大模型能力提升的第二条曲线正式打开。

本文综合自官方公告及公开报道,原始来源见文末链接。