AI 首次拿下国际数学奥林匹克金牌:Google 与 OpenAI 双双达标
2025 年 7 月,Google DeepMind 的 Gemini Deep Think 与 OpenAI 的实验模型均在 IMO 上达到金牌水平,大模型首次与金牌得主比肩。
2025 年 7 月,在国际数学奥林匹克(IMO)上,Google DeepMind 的 Gemini Deep Think 完美解出六道题中的五道,拿下 35 分达到金牌标准;OpenAI 的实验推理模型也声称达到金牌水平。据 Nature 报道,这是大模型首次在 IMO 上与金牌得主同台竞技。
IMO 题目需要创造性的多步骤证明,长期被视为机器难以跨越的推理高地。两家都强调用的是通用模型而非专用解题器,展现了推理能力的泛化。
不过学界也提醒:评测方式与人类考生不完全可比。无论如何,AI 攻克 IMO 金牌是推理模型能力的一个象征性里程碑。
为什么 IMO 金牌比基准分更有说服力
大模型在各类基准测试上刷高分已不稀奇,但 IMO 不同:题目没有标准答案模板,需要创造性的多步骤证明,历来被视为机器难以跨越的推理高地。两家都强调用的是通用模型而非专用解题器,这才是关键:它证明推理能力可以泛化,而非针对特定题型过拟合。这一能力直接建立在 o1 开启的推理时计算范式之上(参见本站 o1 与推理模型报道):Gemini Deep Think 的“深度思考”正是用更长的推理时间换取更高质量的证明。
本站解读
IMO 金牌的象征意义大于实用意义:它不会立即改变任何产品,却回答了一个关键问题——推理模型的能力天花板到底在哪里。当 AI 能完成需要真正创造性的数学证明,“它只是在背训练数据”的质疑就站不住脚了。但需要清醒:竞赛数学有明确答案与评分标准,与现实世界的开放性难题仍有距离——从 IMO 金牌到真正的科学发现,中间还隔着“问题本身无人知晓正确答案”这道真正的鸿沟。