Grok 4 发布:xAI 用 20 万卡集群冲击基准榜首,Heavy 版月费 300 美元
xAI 于 2025 年 7 月发布 Grok 4,在 GPQA 等高难基准上刷新纪录,并推出多 Agent 的 Heavy 版本。
xAI 于 2025 年 7 月 9 日发布 Grok 4,基于约 20 万块 GPU 的 Colossus 集群训练,在 GPQA Diamond(约 88%)等高难度基准上刷新当时纪录,Artificial Analysis 智能指数登顶。
同期推出的 Grok 4 Heavy 采用多 Agent 并行推理架构,随月费 300 美元的 SuperGrok Heavy 订阅提供,开创了消费级 AI 的超高定价档位。
不过外界也指出,xAI 未发布训练数据与安全评估细节,透明度不及同行;而随后 Gemini 3、Opus 4.5 的发布也很快刷新了榜单——前沿模型的领先窗口期已缩短到数月。
暴力美学:算力入场券的极限测试
Grok 4 是“算力即正义”路线的极端样本:xAI 用不到两年时间建成 20 万卡 Colossus 集群,绕过了其他实验室多年积累的基础设施壁垒,直接用资本开支换时间。这条路径验证了一件事:只要算力和人才到位,后发者可以在两年内挤进第一梯队;但它同时划出了新门槛——前沿竞争的入场券已是十万卡级集群,这正是全球算力军备竞赛的微观注脚(参见本站星门计划报道)。
Grok 4 Heavy 的 300 美元月费则是另一重试探:多 Agent 并行推理把单次查询成本抬高数倍,厂商必须验证高端用户愿为“极致智能”付多少溢价。此后 OpenAI、Anthropic 的高端订阅档位纷纷跟进,消费级 AI 的价格天花板被正式打开。
本站解读
Grok 4 的登顶与被超越,共同构成 2025 年前沿竞争的真实图景:基准榜首从护城河变成了租期数月的广告位(参见本站 Opus 4.5 报道)。xAI 真正的差异化不在分数而在资源整合速度——自建超大集群加 X 平台的实时数据。而透明度短板提醒我们:在基准分之外,安全披露与可复现性正在成为企业选型的第二把尺子,榜单名次买不来采购合同。
来源:The Decoder