12. Qwen3-Next
2025 年 9 月 11 日,通义千问团队发布了 Qwen3 Next 80B-A3B(见图 35),提供指令微调版(Instruct)与思考版(Thinking)两种形态。尽管其设计基于前文介绍的 Qwen3 架构,但我将它单独列为一节,一是保持图号的连贯性,二是突出其部分设计上的改动。
12.1 专家规模与数量
全新的 Qwen3 Next 架构有一个突出特点:尽管总参数量仅为前代 235B-A22B 模型的三分之一(见图 35),但专家数量提升至原来的四倍,还额外加入了共享专家。这两项设计选择(高专家数量 + 引入共享专家),正是我在本次发布前就指出过的行业未来方向,尤其是在本文开头链接的视频版本中曾重点提及。

12.2 门控 DeltaNet + 门控注意力混合架构
另一大亮点是,团队用「门控 DeltaNet + 门控注意力」的混合方案替代了传统注意力机制。从内存占用角度,这一设计让模型原生支持 26.2 万 token 的上下文长度(前代 235B-A22B 原生支持 3.2 万 token,通过 YaRN 扩展可达到 13.1 万 token)。
那么这套全新的混合注意力是如何工作的?分组查询注意力(GQA)本质上仍是标准的缩放点积注意力 —— 如前文所述,它通过让多组查询头共享键值对来压缩 KV 缓存体积、降低内存带宽开销,但其解码成本与缓存占用仍会随序列长度增长。而 Qwen3 的混合机制则将门控 DeltaNet 模块与门控注意力模块按 3:1 的比例组合,如图 36 所示。

我们可以将门控注意力块理解为可适配 GQA 的标准缩放点积注意力,但在此基础上做了几处优化。门控注意力与普通 GQA 模块的核心差异在于:
-
输出门控:由 sigmoid 控制(通常为逐通道维度),在注意力结果加回残差连接前对其做缩放;
-
QK 归一化采用零中心 RMSNorm,而非标准 RMSNorm;
-
仅对部分维度施加旋转位置编码(RoPE)。
需要注意的是,这些本质上都是针对 GQA 的训练稳定性优化。
门控 DeltaNet 则是更具颠覆性的改动。在 DeltaNet 模块中,查询(q)、键(k)、值(v)以及两个门控参数(α、β),由带归一化的线性层与轻量卷积层共同生成;该层用快速权重 delta 规则更新机制替代了传统注意力计算。
但权衡之处在于,与全注意力相比,DeltaNet 基于内容的检索精度更低,这也是模型保留一层门控注意力的原因。
由于传统注意力的开销随序列长度呈二次方增长,加入 DeltaNet 组件的核心目的是提升内存效率。在「线性时间、无需缓存」的技术路线中,DeltaNet 模块本质上是 Mamba 的替代方案。Mamba 通过可学习的状态空间滤波器维护状态(本质是沿时间维度的动态卷积);而 DeltaNet 则通过 α 和 β 维护一个极小的快速权重记忆体,并通过 q 进行读取,仅在生成 q、k、v、α、β 时用到小型卷积辅助计算。
12.3 多 Token 预测
上述两节介绍了两项面向效率的架构设计。好事成三,Qwen3 还叠加了另一项效率优化技术:多 Token 预测(Multi-Token Prediction, MTP)。
(注:DeepSeek V3/V3.2,以及后续的 GLM-4.5、MiniMax-M2,训练阶段均采用了 MTP;但由于它属于训练技巧,我并未在架构对比中专门展开。)
多 Token 预测的思路是,训练大语言模型在每一步同时预测未来的多个 Token,而非仅预测下一个。具体来说,在每个位置 t,模型通过额外的小型预测头(线性层)输出 t+1 到 t+k 位置的 logits,并对这些偏移位置的交叉熵损失求和(在 MTP 原论文中,研究人员推荐 k=4)。这一额外监督信号能加快训练收敛,推理阶段仍可保持单 Token 生成。不过,这些额外预测头也可用于推测式多 Token 解码 ——Qwen3-Next 似乎正是采用了这一方案,但目前公开的细节还比较有限:
Qwen3-Next 原生引入了多 Token 预测(MTP)机制,不仅打造出接受率优异的推测解码 MTP 模块,还提升了模型整体性能。此外,Qwen3-Next 专门优化了 MTP 的多步推理表现,通过保持训练与推理一致性的多步训练,进一步提升了真实场景下推测解码的接受率。
来源:Qwen3-Next 官方博客
12.4 Qwen3-Coder-Next
2026 年 2 月初,通义千问团队推出了 800 亿总参数的 Qwen3-Coder-Next 模型(激活参数 30 亿)。该模型在代码任务上超越了 DeepSeek V3.2(激活参数 370 亿)、Kimi K2.5 与 GLM-7.5(二者激活参数均为 320 亿)等规模大得多的模型,引发了广泛关注。
此外,Qwen3-Coder-Next 在 SWE-Bench Pro 上的表现与 Claude-Sonnet-4.5 基本持平(仅略低于 Claude-Opus-4.5),对于开源权重模型而言成绩十分亮眼。
需要说明的是,Qwen3-Coder-Next 的底层架构与上文介绍的 Qwen3-Next 80B 完全一致 —— 实际上,团队正是以 Qwen3-Next 为基座训练出了 Qwen3-Coder-Next。由于本文聚焦大语言模型架构,训练细节不在讨论范围内。感兴趣的读者可在 GitHub 上查阅其详细技术报告获取更多信息。