Kimi K2.5 发布:万亿参数 MoE 加持,15 万亿视觉文本混合训练
月之暗面于 2026 年 1 月 27 日发布并开源 Kimi K2.5,在 K2 万亿参数基座上引入大规模视觉数据,Agent 能力继续进化。
月之暗面于 2026 年 1 月 27 日正式发布新一代开源模型 Kimi K2.5:基于万亿参数 MoE 架构,采用 15 万亿视觉与文本混合 token 训练,在多模态理解与 Agent 任务上较 K2 显著提升。
自 2025 年 7 月 K2 以全球最大开源模型身份登场后,月之暗面保持了半年一代的节奏:K2.5 之后,K2.6 也于 2026 年 4 月接棒。开源阵营的中国力量——DeepSeek、Qwen、Kimi——已形成稳定的三强轮动。
对开发者而言,K2.5 延续开源可商用策略,可通过 Kimi 开放平台与主流推理框架部署。
视觉混入预训练:开源阵营补齐多模态短板
K2.5 最值得注意的不是参数量——万亿 MoE 基座沿自 K2(参见本站 K2 报道)——而是 15 万亿视觉与文本混合 token 的训练配方。此前中国开源三强的强项集中在文本推理与编程,多模态理解一直是与闭源旗舰的主要差距;把视觉数据直接混入预训练而非后接适配器,意味着 Agent 可以原生地“看屏幕、读图表、操作界面”——这正是浏览器操作、电脑使用类 Agent 任务的前置条件。
半年一代的节奏同样是信号:从 2025 年 7 月 K2、2026 年 1 月 K2.5 到 4 月 K2.6,月之暗面把开源旗舰的更新频率拉到了与闭源厂商同档,而 DeepSeek、Qwen 亦在同期各自迭代(参见本站 R1、Qwen3 报道)——三强轮动让“开源落后闭源半年”的旧共识不断被压缩。
本站解读
K2.5 是开源军备竞赛从“拼参数”转向“拼模态与 Agent 实用性”的标本:参数规模已非新闻,训练数据的模态配比才是差异化所在。对选型者的启示是:需要视觉理解的 Agent 工作流,开源选项已从“凑合能用”进入“可认真评估”阶段;而对行业而言,中国开源三强的半年节奏意味着任何闭源厂商的领先窗口都在缩短,推理价格战只会继续加剧(参见本站 DeepSeek R2 报道)。
来源:北京市科学技术委员会报道