跳到正文
Daily Edition · AI industry record
Live desk ●
发布综合报道2 分钟阅读更新于作者:AI Tools Daily

DeepSeek V3 发布:671B MoE 模型以极低成本震动业界

DeepSeek 于 2024 年 12 月 26 日发布 V3:671B 总参数、37B 激活,训练成本仅为同级闭源模型的零头,开源可商用。

DeepSeek 于 2024 年 12 月 26 日发布 V3 大模型:采用 MoE 架构,总参数 671B、每 token 激活 37B,基于 14.8 万亿高质量 token 训练,在多项基准上达到当时开源最强水平。

V3 最震撼业界的是极致的训练效率——官方技术报告披露完整训练仅耗费约 557 万美元 GPU 成本,远低于同级闭源模型动辄数亿美元的投入。

557 万美元怎么做到的

技术报告给出了答案的轮廓:MoE 稀疏激活(671B 总参数仅激活 37B)把每 token 计算量压到密集模型的零头,FP8 混合精度训练、多 token 预测等工程优化层层叠加。关键启示不是某项单点魔法,而是系统工程:在出口管制限制高端芯片供给的约束下,把每一分算力都榨到极限反而成了比较优势。

争议与澄清:557 万不是全部成本

需要澄清的是,557 万美元仅指最终那次完整训练的 GPU 租赁成本,不含前期实验、数据建设、团队与基础设施——把它直接对比闭源厂商的全口径投入并不公平。但即便考虑口径差异,量级差距依然真实,足以引发全球关于成本范式的讨论。

V3 是地基,R1 是引爆

回看时间线,V3(2024-12)是基座,一个月后的 R1(2025-01)在其上用强化学习点燃推理能力,才有了英伟达单日蒸发 5890 亿的历史性震荡(参见本站报道)。V3 发布时市场反应平静,但行家已从技术报告里读出信号——真正的拐点往往在爆发前一个版本就已埋下。

开源可商用:被低估的另一半决定

与成本数字同样重要的,是 V3 选择了权重开放且允许商用——这意味着任何团队都能在自己的基础设施上部署、微调、蒸馏这个当时最强的开源基座。对云厂商,它直接变成了推理 API 的价格锚点;对中小团队,它把“用上前沿模型”的门槛从谈商务合作降到了下载权重;对后来的开源梯队,它定义了“发布即开源 + 技术报告详尽”的默认动作——Llama 系开了头,V3 把标准拉到了前沿水位。后来 gpt-oss 的发布(参见本站报道)也可以看作对这一水位的回应:当开源前沿被中国模型占据,闭源阵营也不得不重新下场。

本站解读

模型权重与技术报告全部开源,V3 证明精细工程优化可以大幅降低前沿模型门槛。更深的影响是方法论层面的:它把“算力不够”从借口变成了工程命题,此后 Qwen、Kimi 的 MoE 路线接力(参见本站报道),中国开源梯队的成本优势成为系统性能力——而这一切的方法论源头,都可以追溯到 V3 的技术报告。

本文综合自官方公告及公开报道,原始来源见文末链接。

本文提到的工具