6. Qwen3
通义千问团队始终持续输出高质量的开源权重大语言模型。我还记得 2023 年 NeurIPS 大会期间,我参与联合指导大语言模型效率挑战赛,最终所有夺冠方案均基于 Qwen2 搭建。
如今的 Qwen3 是又一标杆级模型系列,在各自参数量级的排行榜上都位居头部。该系列包含 7 款稠密模型,参数量分别为 0.6B、1.7B、4B、8B、14B 和 32B;另有 2 款混合专家(MoE)模型:30B-A3B 与 235B-A22B。
(顺带说明:“Qwen3” 中间未加空格并非笔误,我只是尽量保留通义千问开发团队选定的原始拼写。)
6.1 Qwen3(稠密版本)
我们先来看稠密模型的架构。截至本文撰写时,0.6B 参数版本很可能是当前新一代开源模型中参数规模最小的。以我的实际体验来看,在如此小的体量下,它的表现十分出色。如果要在本地运行,它的 token 生成吞吐量高,内存占用低;更重要的是,参数量小也意味着它很适合在本地开展训练(用于教学研究目的)。
因此在大多数场景下,我已经用 Qwen3 0.6B 替代了 Llama 3 1B。二者的架构对比如下图所示。

如果你想查看不依赖任何第三方大模型库、可读性良好的 Qwen3 实现,我最近刚用纯 PyTorch 从零完成了一版 Qwen3 的代码实现。
上图中的性能数据,是我在 A100 GPU 上运行这套从零实现的 PyTorch 代码测得的结果。可以看到,Qwen3 整体架构规模更小,隐藏层维度更低、注意力头数量更少,因此内存占用更小;但它的 Transformer 模块数量多于 Llama 3,因此运行速度更慢(每秒生成的 token 数更低)。
6.2 Qwen3(混合专家版本)
如前文所述,Qwen3 同时推出了两款混合专家(MoE)版本:30B-A3B 和 235B-A22B。为什么 Qwen3 这类架构会同时提供常规(稠密)版本和 MoE(稀疏)版本?
正如本文开头提到的,MoE 变体有助于降低大基座模型的推理成本。同时提供稠密版与 MoE 版,用户可以根据自身目标和资源约束灵活选择。
稠密模型的优势在于,在各类硬件上的微调、部署与优化通常都更简单直接。
而 MoE 模型则是面向推理规模化做了优化。举例来说,在推理预算固定的情况下,MoE 模型能实现更高的整体模型容量 —— 凭借更大的总参数量,训练阶段能容纳更多知识 —— 同时不会让推理成本同比例增长。
通过同时发布两类模型,Qwen3 系列能够覆盖更广泛的使用场景:稠密模型兼顾稳定性、易用性与微调友好性,MoE 模型则适合大规模高效推理服务。
本节最后,我们将 Qwen3 235B-A22B(其中 A22B 代表 “220 亿激活参数”)与 DeepSeek V3 做个对比,后者的激活参数量几乎是前者的两倍(370 亿)。

如上图所示,DeepSeek V3 与 Qwen3 235B-A22B 的架构高度相似。但值得注意的是,Qwen3 不再采用共享专家设计(而更早的 Qwen 模型,比如 Qwen2.5-MoE,是使用共享专家的)。
遗憾的是,Qwen3 团队并未公开说明取消共享专家的原因。如果让我推测,或许是当专家数量从 Qwen2.5-MoE 的 2 个增加到 Qwen3 的 8 个后,共享专家对他们的训练方案而言,已经不再是维持训练稳定的必要设计。这样只使用 8 个专家而非 8+1 个,还能节省额外的计算与内存开销。(不过这无法解释为什么 DeepSeek V3 仍然保留了共享专家。)
补充:Qwen3 的开发者之一 Junyang Lin 对此回应如下:
“当时我们没有发现共享专家能带来足够显著的效果提升,同时也担心共享专家会给推理优化带来麻烦。说实话,这个问题没有绝对的标准答案。”