通义千问 Qwen 3 发布:MoE 架构引领开源新高度
阿里发布 Qwen 3 系列模型,采用混合专家架构,旗舰版 Qwen3-235B-A22B 性能媲美 DeepSeek-R1、o1 等顶级模型。
阿里云于 2025 年 4 月 29 日正式发布通义千问 Qwen 3 系列模型,旗舰版 Qwen3-235B-A22B 采用混合专家(MoE)架构,总参数 2350 亿、激活参数 220 亿,在代码、数学和通用能力基准上媲美 DeepSeek-R1、o1 等顶级模型。
Qwen 3 一次性开源 8 款模型:2 个 MoE 模型和 6 个 Dense 模型(从 0.6B 到 235B),覆盖从端侧到云端的全场景部署需求。新版本首创混合推理模式,可在思考与快速响应间无缝切换,并原生支持 119 种语言和方言。
全尺寸矩阵:生态打法而非单点爆发
一次放出 8 款、从 0.6B 端侧到 235B 旗舰全覆盖,这是 Qwen 与单点型选手最大的打法差异:开发者无论跑在手机、单卡还是集群上,都能在同一个技术栈内找到尺寸——这种“全家族锁定”正是 Llama 当年建立生态的方式,如今被 Qwen 以更密的节奏复制。Hugging Face 衍生模型榜上,Qwen 系长期占据下载与微调榜前列。
混合推理:把思考变成开关
首创的混合推理模式让同一个模型可在深度思考与快速响应间切换——把 o1 开创的推理范式(参见本站报道)做成可控选项而非独立产品线。这比 GPT-5 的自动路由早了三个月,思路异曲同工:推理能力终将是所有模型的内置能力,而非单独品类。
成本牌:四分之一的部署价格
官方宣称部署成本仅为同类性能模型的约 1/4,加上 Apache 2.0 可商用,直接命中企业私有化部署的核心诉求(参见本站本地部署横评)。与 DeepSeek 的低价 API、Kimi 的万亿开源一道,中国梯队把开源竞争从“能力对标”押向“性价比碾压”(参见本站相关报道)。
本站解读
全部模型 Apache 2.0 开源可商用,业界认为 Qwen 3 标志着中国开源大模型正式进入全球第一梯队。更深的启示是生态位的争夺逻辑:基准分会被下一个发布覆盖,但开发者一旦基于你的全尺寸矩阵搭建工具链、训练衍生模型,迁移成本就会指数级上升——Qwen 赢的不是某一场发布,而是生态位的长期占领。
来源:通义千问官方博客