跳到正文
每日版 · AI 行业记录本期 2026年9月21日星期一
实时更新 ●
趋势综合报道2 分钟阅读作者:AI Tools Daily

独家:开源与中国模型把前沿差距缩至约 4.4 个月

Ars 拿到 Mozilla《开源 AI 现状报告》:中国开源模型与闭源前沿的能力差距已缩至约 4.4 个月;为闭源付费只在约 8–12 小时的任务上,才值回约 5 倍单价。

分享XLinkedIn

Ars Technica 独家,Mozilla 于 9 月 15 日发布的《开源 AI 现状(State of Open Source AI)》报告称,美国闭源前沿模型与中国最佳开源权重模型之间的性能差距,已缩小到约 4.4 个月。

数字怎么说

Ars 转述报告:Moonshot 的开源模型 Kimi K3 在 Artificial Analysis 智能指数上的综合得分,仅落后 Anthropic 的闭源前沿模型 Fable 5 三分,成本却只有后者的约 30%。Mozilla CTO Raffi Krikorian 对 Ars 表示,闭源“在少数场景值回溢价:专家级专业工作、高强度检索与长上下文”,付费决策“是按工作负载、而非按整个组织来定的”。

“值不值”的边界

Ars 援引研究机构 METR 的“时间跨度(time horizon)”口径:目前最佳闭源模型能可靠完成的任务长度,是最佳开源模型的约 1.7 倍。Krikorian 举例说,若开源能做完 7 小时的活、闭源能做 12 小时,那么四个月后开源也能做 12 小时。结论是:为闭源付费,买的是约四个月的先发优势、以及约 5 倍的每任务成本——且只对 8 至 12 小时的任务成立。评测公司 Vals AI 用统一“中立外壳”复测发现,中国 Z.ai(智谱)的开源 GLM 5.2 在 Terminal-Bench 2.1 上,与 Anthropic 的 Claude Opus 4.7、4.8 相差不到一分,成本却低约五倍。

权力集中度

Ars 说,OpenRouter 8 月按 token 量排名前十里有八款提供开源权重;但 Linux 基金会一项研究(Nagle 与 Yue)显示,2025 年 5 至 9 月开源模型只占整体收入的 4%。Krikorian 提醒“当今世界跑的大多是中国的开源模型”,并称这既是“多数”也是“集中”;他呼吁美欧实验室进入同一条“开源赛道”,以免“由单一国家设定世界默认值”。

本站解读: 一个务实的采购结论是:把 8 小时以下的日常任务交给便宜的开源模型,只在 8 至 12 小时、且截止期赶在开源追平之前的高价值任务上为闭源付费——超过 12 小时,目前两类模型都还做不靠谱。

本文综合自官方公告及公开报道,原始来源见文末链接。

来源:Ars Technica

AI Tools Daily 是中英双语新闻室,追踪 AI 工具发布、产品更新与行业趋势。 编辑准则 · 提交更正

本栏目全部报道 · 趋势