【转载】现代大语言模型注意力机制变体可视化指南

原文地址:A Visual Guide to Attention Variants in Modern LLMs,by Sebastian Raschka, on 2026-03-22

现代大语言模型注意力机制变体可视化指南

从 MHA、GQA 到 MLA、稀疏注意力与混合架构

我原本计划撰写关于 DeepSeek V4 的内容。由于该模型尚未发布,我便利用这段时间整理了一项计划已久的工作:收集、梳理并细化过去几年我研究过的各类 LLM 架构。

在过去两周里,我将这项工作整理成了一个LLM 架构图库(撰写本文时已收录 45 个模型),整合了早期文章的资料,以及数个此前未整理的重要架构。每个模型都配有可视化模型卡片,我也计划定期更新这个图库。
你可以在此访问图库:https://sebastianraschka.com/llm-architecture-gallery/

figure01

图 1:LLM 架构图库及其可视化模型卡片概览
https://sebastianraschka.com/llm-architecture-gallery/

分享初始版本后,有读者询问是否有海报版本。因此我也制作了海报版,可在此查看:https://www.redbubble.com/i/poster/LLM-Architecture-Gallery-by-Ahead-of-AI/179274487/flk2
我订购了中号尺寸(26.9×23.4 英寸)来验证打印效果,成品清晰锐利。不过该尺寸下部分最小的文字已经很小了,如果希望所有内容都清晰可读,不建议选择更小的尺寸。

figure02

图 2:架构图库海报与日常物品的尺寸对比
https://www.redbubble.com/i/poster/LLM-Architecture-Gallery-by-Ahead-of-AI/179274487/flk2

在搭建图库的同时,我也在为几个 LLM 核心概念制作简短讲解。
因此在本文中,我想系统梳理近年主流开源架构中发展并应用的各类注意力变体。
我的目标是让这份资料既能作为参考手册,也能作为轻量化的学习资源。希望对你有所帮助!


1. 多头注意力(Multi-Head Attention, MHA)

自注意力让序列中的每个令牌都能观察其他可见令牌,为其分配权重,并通过这些权重生成具备上下文感知能力的新输入表示。
多头注意力(MHA)是 Transformer 对这一思想的标准实现。它并行运行多个自注意力头,每个头使用不同的可学习投影矩阵,再将所有头的输出融合,得到更丰富的特征表示。

figure03

图 3:采用 MHA 架构的示例 ——OLMo 2
https://sebastianraschka.com/llm-architecture-gallery/#card-olmo-2-7b

下文会先快速回顾自注意力的原理,为介绍分组查询注意力、滑动窗口注意力等相关概念铺垫基础。如果你希望更深入、详细地学习自注意力,可以参考我的长文:https://magazine.sebastianraschka.com/p/understanding-and-coding-self-attention

代表架构

1.2 历史背景与注意力机制的发明动因

注意力机制的出现早于 Transformer 和 MHA,其直接前身是用于机器翻译的编码器 – 解码器循环神经网络(RNN)。

在这类早期系统中,编码器 RNN 逐个令牌读取源语句,将其压缩为一系列隐藏状态,最简版本中则压缩为单个最终状态。随后解码器 RNN 基于这份有限的摘要生成目标语句。
这种机制在短句子、简单场景下可以运行,但当下一个输出词的相关信息位于输入语句的其他位置时,就会出现明显的瓶颈。
简而言之,局限在于:隐藏状态无法存储无限多的信息或上下文,而很多时候直接回溯完整的输入序列会更高效。

下面的翻译例子体现了这种局限。比如,逐词翻译可以保证单个词的选择看似合理,但整句的翻译结果却可能出错 —— 因为模型把问题当成了逐词映射。(上图是夸张的逐词翻译示例,显然生成句子的语法是错误的。)
现实中,正确的下一个词取决于整句结构,也取决于该步骤中哪些源语言单词更重要。当然,RNN 也能完成翻译,但面对更长的序列或知识检索任务时会力不从心,因为如前所述,隐藏状态的存储容量有限。

figure04

图 4:即便单个词的选择看似合理,翻译仍可能失败 —— 因为句子层面的结构同样重要
来源:https://github.com/rasbt/LLMs-from-scratch

下图更直观地展示了这种变化。当解码器生成输出令牌时,它不应该受限于单条压缩的记忆路径,而应该能直接回溯到最相关的输入令牌。

figure05

图 5:注意力机制打破了 RNN 的瓶颈 —— 让当前输出位置可以直接回溯完整输入序列,而非仅依赖单个压缩状态
来源:https://github.com/rasbt/LLMs-from-scratch

Transformer 保留了上述带注意力机制的 RNN 的核心思想,但去掉了循环结构。在经典论文《Attention Is All You Need》(https://arxiv.org/abs/1706.03762)中,注意力本身成为了序列处理的核心机制,而非只是 RNN 编码器 – 解码器的一部分。

在 Transformer 中,该机制被称为自注意力:序列中的每个令牌都会计算对其他所有令牌的权重,并用这些权重融合来自其他令牌的信息,生成新的表示。多头注意力就是将该机制并行运行多次。

1.3 掩码注意力矩阵

对于长度为 T 的令牌序列,注意力机制为每个令牌生成一行权重,最终得到一个 T×T 的矩阵。
每一行都回答一个简单的问题:更新当前令牌时,每个可见令牌的重要性有多大?
在仅解码器架构的 LLM 中,未来位置会被掩码屏蔽,这也是下图中矩阵右上角被置灰的原因。

自注意力的本质,就是在因果掩码的约束下学习这些令牌间的权重模式,再基于这些模式构建具备上下文感知能力的令牌表示。

figure06

图 6:具体的掩码注意力矩阵:每一行对应一个令牌,每个元素是注意力权重,因果掩码会移除未来令牌的对应项
来源:https://magazine.sebastianraschka.com/p/understanding-and-coding-self-attention

1.4 自注意力内部原理

下图展示了 Transformer 如何从输入嵌入 X 计算注意力矩阵 A,再通过注意力矩阵生成变换后的输出 Z。
其中 Q、K、V 分别代表查询(Queries)键(Keys)和值(Values)

  • 令牌的查询代表它 “想要寻找” 的信息;

  • 键代表每个令牌 “可供匹配” 的特征;

  • 值则代表计算完注意力权重后,会被融合进输出的信息内容。

计算步骤如下:

  1. Wq、Wk、Wv 是权重矩阵,将输入嵌入投影为 Q、K、V;

  2. Q 与 K 的转置相乘,得到原始的令牌间相关性得分;

  3. Softmax 函数将得分归一化为我们前文提到的注意力矩阵 A;

  4. 将注意力矩阵 A 作用于 V,得到输出矩阵 Z。

注意:注意力矩阵不是独立设计的结构,而是从 Q、K 和 softmax 中自然衍生出来的。

figure07

图 7:完整的单头注意力流程 —— 从输入嵌入 X 到归一化注意力矩阵 A,再到输出表示 Z
来源:https://magazine.sebastianraschka.com/p/understanding-and-coding-self-attention

下图表达的概念和上图一致,但将注意力矩阵计算封装在 “缩放点积注意力” 模块中,且仅针对单个输入令牌进行计算。这是为了展示单头自注意力的精简形式,为下一节扩展到多头注意力做铺垫。

figure08

图 8:单个注意力头本身就是完整的机制。一组可学习投影生成一个注意力矩阵和一路上下文感知输出流
来源:https://magazine.sebastianraschka.com/p/understanding-and-coding-self-attention

1.5 从单头注意力到多头注意力

一组 Wq/Wk/Wv 矩阵对应一个注意力头,也就是一个注意力矩阵和一个输出矩阵 Z(上一节已经说明该概念)。
多头注意力就是用多组不同的可学习投影矩阵,并行运行多个这样的注意力头。

这种设计的价值在于:不同的头可以专注于不同的令牌间关系。比如一个头可能关注短距离的局部依赖,另一个头关注更广的语义关联,还有的头负责位置或句法结构。

figure09

图 9:多头注意力保留了基础的注意力计算逻辑,但跨多个头并行重复,让模型可以同时学习多种令牌间的关联模式
来源:https://magazine.sebastianraschka.com/p/understanding-and-coding-self-attention


2. 分组查询注意力(Grouped-Query Attention, GQA)

分组查询注意力是从标准 MHA 衍生出的注意力变体,由 Joshua Ainslie 等人在 2023 年的论文(https://arxiv.org/abs/2305.13245)中提出。

它不为每个查询头单独分配键和值,而是让多个查询头共享同一组键值投影。这大幅降低了推理时KV 缓存的开销(主要是减少内存占用),同时几乎不需要改动整体解码器架构。

figure10

图 10:GQA 保留了与 MHA 一致的整体注意力模式,但通过多个查询头共享键值头,减少了键值头的数量
来源:https://magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison

代表架构

2.1 GQA 流行的原因

在《大语言模型架构对比》一文中,我将 GQA 定位为经典多头注意力(MHA)的新一代标准替代方案。
原因在于:标准 MHA 为每个头都配备独立的键和值,从建模角度看是最优的,但推理时需要缓存所有这些状态,成本很高。

而 GQA 保留了较多的查询头,但减少了键值头的数量,让多个查询共享键值。这既降低了参数量,也减少了 KV 缓存的流量,同时又不需要像多头潜在注意力(MLA)那样做大幅的架构改动(后文会介绍 MLA)。

实际应用中,对于希望成本低于 MHA、实现又比 MLA 等新型压缩方案更简单的研究团队来说,GQA 过去是、现在也依然是非常受欢迎的选择。

2.2 GQA 的内存节省效果

GQA 能大幅节省 KV 存储空间 —— 每层保留的键值头越少,每个令牌需要缓存的状态就越少。这也是序列长度越长,GQA 的优势越明显的原因。

GQA 本身也是一个可调节的区间。如果一直减少到只剩一组共享的 K/V,就进入了多查询注意力的范畴 —— 成本更低,但对建模效果的影响也更明显。
最佳平衡点通常在多查询注意力(1 组共享)和 MHA(K/V 组数等于查询数)之间:此时缓存节省幅度很大,而相对于 MHA 的建模效果下降又很有限。

figure11

图 11:数值越低越好。随着上下文窗口增大,KV 缓存的节省效果会愈发显著
来源:https://github.com/rasbt/LLMs-from-scratch/tree/main/ch04/04_gqa

2.3 2026 年 GQA 仍具价值的原因

MLA 等更先进的变体正在普及 —— 它们在同等 KV 效率下能提供更好的建模性能(如相关消融研究所示,https://arxiv.org/abs/2405.04434),但 MLA 实现更复杂,注意力栈的设计也更繁琐。

GQA 的吸引力在于它鲁棒性强、易实现,也更容易训练(根据我的经验,需要调优的超参数更少)。
这也是部分新发布的模型仍然刻意采用经典架构的原因。比如在《开源大模型的春天》一文中我提到,MiniMax M2.5 和 Nanbeige 4.1 都走经典路线,只使用分组查询注意力,没有叠加其他效率技巧。
Sarvam 也是很有参考价值的对比案例:它的 30B 版本保留经典 GQA,而 105B 版本则切换为 MLA。

figure12

图 12:105B Sarvam(采用 MLA)、30B Sarvam(采用 GQA)与标准 MHA 的 KV 缓存总大小对比


3. 多头潜在注意力(Multi-Head Latent Attention, MLA)

多头潜在注意力(MLA)的出发点和分组查询注意力(GQA)类似,两者都是降低 KV 缓存内存需求的方案。
两者的区别在于:GQA 通过共享头来减少存储的 K/V 数量,而 MLA 通过压缩存储的内容来缩小缓存。

figure13

图 13:与 GQA 不同,MLA 不是通过分组头来降低 KV 成本,而是通过缓存压缩的潜在表示来降低成本。注意该机制也作用于查询端,为简化图示未画出
来源:https://magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison

MLA 最初在论文(https://arxiv.org/abs/2405.04434)中提出,之后随着 DeepSeek V3、R1 等模型成为 DeepSeek 时代的标志性技术。
它比 GQA 实现更复杂,部署门槛更高,但如今当模型规模和上下文长度大到缓存流量成为主导瓶颈时,MLA 往往更有优势 —— 在同等内存缩减率下,它能更好地保留建模性能(后文详述)。

代表架构
https://sebastianraschka.com/llm-architecture-gallery/#card-deepseek-v3
https://sebastianraschka.com/llm-architecture-gallery/#card-kimi-k2
https://sebastianraschka.com/llm-architecture-gallery/#card-glm-5-744b
https://sebastianraschka.com/llm-architecture-gallery/#card-ling-2-5-1t
https://sebastianraschka.com/llm-architecture-gallery/#card-mistral-large-3
https://sebastianraschka.com/llm-architecture-gallery/#card-sarvam-105b

3.1 是压缩,而非共享

MHA 和 GQA 都会缓存完整分辨率的键和值张量,而 MLA 存储的是潜在表示,需要时再重建可用状态。本质上,这是一种嵌入在注意力内部的缓存压缩策略,如上图所示。
下图展示了它相对于常规 MHA 的节省效果。

figure14

图 14:随着上下文长度增长,缓存潜在表示而非完整 K/V 张量带来的节省效果会非常明显
来源:https://github.com/rasbt/LLMs-from-scratch/tree/main/ch04/05_mla

3.2 MLA 消融实验

DeepSeek V2 的论文提供了消融实验数据:GQA 的建模表现比 MHA 差,而 MLA 不仅表现好得多,经过精细调优后甚至能超过 MHA。
这比 “它也能省内存” 的说服力要强得多。
换句话说,对 DeepSeek 来说,MLA 作为注意力机制的优势不只是高效,更是在大模型规模下,这是一种兼顾质量的效率优化
(不过也有同行告诉我,MLA 只在一定规模下效果好。对于小于 100B 的小模型,GQA 表现更好,或者至少更容易调优、更容易出效果。)

figure15

图 15:该实验中 GQA 表现低于 MHA,而 MLA 保持竞争力,甚至能小幅超过 MHA
底层论文:https://arxiv.org/abs/2405.04434

下图再次对比了 30B Sarvam 的 GQA 与 105B Sarvam 的 MLA。

figure16

图 16:GQA 和 MLA 从不同方向解决同一个瓶颈。权衡的核心是:简单性,还是大模型下更优的建模表现

3.3 MLA 在 DeepSeek 之后的普及路径

DeepSeek V3/R1、V3.1 等模型在 V2 引入 MLA 后将其标准化,随后第二波架构开始广泛采用该设计:

  • Kimi K2 沿用 DeepSeek 的方案并向上缩放;

  • GLM-5 同时采用 MLA 和 DeepSeek 稀疏注意力(来自 DeepSeek V3.2);

  • Ling 2.5 将 MLA 与线性注意力混合架构结合;

  • Sarvam 发布了两个版本:30B 模型保留经典 GQA,105B 模型切换为 MLA。

最后这组对比尤其有价值,因为它跳出了技术复杂度的讨论:Sarvam 团队实现了两种方案,并有意识地为不同版本选择不同的注意力机制。
某种意义上,这说明 MLA 不再只是理论上的备选方案,而是模型家族规模扩大后,一条切实可行的架构升级路径。


4. 滑动窗口注意力(Sliding Window Attention, SWA)

滑动窗口注意力通过限制每个位置能关注的历史令牌数量,降低长上下文推理的内存和计算成本。
每个令牌不再关注全部前缀,而只关注自身位置附近固定窗口内的最近令牌。由于注意力被限制在局部令牌邻域内,该机制也常被称为局部注意力

部分架构会将这些局部层与少量全局注意力层结合,让信息仍然可以在整个序列中传递。

figure17

图 17:概念转变很简单:常规注意力是全局注意力,滑动窗口注意力是局部注意力。全局注意力让每个令牌都能看到完整前缀;SWA 将其中很多层替换为局部注意力层
来源:https://magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison

代表架构
https://sebastianraschka.com/llm-architecture-gallery/#card-gemma-3-27b
https://sebastianraschka.com/llm-architecture-gallery/#card-olmo-3-32b
https://sebastianraschka.com/llm-architecture-gallery/#card-xiaomi-mimo-v2-flash-309b
https://sebastianraschka.com/llm-architecture-gallery/#card-arcee-ai-trinity-large-400b
https://sebastianraschka.com/llm-architecture-gallery/#card-step-3-5-flash-196b
https://sebastianraschka.com/llm-architecture-gallery/#card-tiny-aya-3-35b

4.1 以 Gemma 3 为参考案例

Gemma 3 是近期最清晰的 SWA 案例之一,因为很容易和 Gemma 2 做对比。
Gemma 2 已经采用混合注意力结构,局部层与全局层比例为 1:1,窗口大小为 4096 令牌。Gemma 3 将比例提升到 5:1,窗口缩小到 1024。

关键结论并不是 “局部注意力更便宜”—— 这一点早已为人所知。Gemma 3 消融实验更有意思的发现是:如此激进地提升局部注意力占比,对建模性能的影响非常小。

figure18

图 18:Gemma 消融实验表明,更小的窗口和更激进的局部 – 全局比例,对困惑度的影响很小
底层论文:https://arxiv.org/abs/2503.19786
来源:https://magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison

4.2 比例与窗口大小

实际应用中,说一个模型 “使用 SWA” 并不代表它只依赖 SWA。真正起作用的是局部 – 全局层的配比注意力窗口大小。例如:

  • Gemma 3 和小米采用 5:1 的局部 – 全局模式;

  • OLMo 3 和 Arcee Trinity 采用 3:1 的模式;

  • 小米还采用了 128 的窗口大小,比 Gemma 的 1024 小得多,也更激进。

SWA 本质上是一个可以调节激进程度的旋钮。

figure19

图 19:长上下文的节省来自于将大量全注意力层替换为局部层,这减少了这些层需要考虑的缓存上下文量
来源:https://github.com/rasbt/LLMs-from-scratch/tree/main/ch04/06_swa

4.3 SWA 与 GQA 的结合

SWA 经常和 GQA 同时出现,因为两者解决的是同一个推理问题的不同部分:

  • SWA 减少了局部层需要考虑的上下文长度;

  • GQA 减少了每个令牌贡献给缓存的键值状态量。

这也是近年很多密集模型同时采用两者、而非二选一的原因。Gemma 3 又是很好的参考 —— 它在同一架构中同时结合了滑动窗口注意力和分组查询注意力。


5. DeepSeek 稀疏注意力(DeepSeek Sparse Attention, DSA)

DeepSeek 稀疏注意力是论文(https://arxiv.org/abs/2512.02556)提出的架构改进之一,之后也被 GLM-5 采用。
具体来说,DeepSeek V3.2 将它与 MLA 结合使用,GLM-5 也出于同样的原因采用了同一组合 —— 降低长上下文下的推理成本。

代表架构
https://sebastianraschka.com/llm-architecture-gallery/#card-deepseek-v3-2
https://sebastianraschka.com/llm-architecture-gallery/#card-glm-5-744b

5.1 相对于滑动窗口注意力的改进

在滑动窗口注意力中,当前令牌不关注完整前缀,只关注固定的局部窗口。
DeepSeek 稀疏注意力的核心思路和它类似:每个令牌也只关注历史令牌的一个子集。

但选中的令牌不是由固定宽度的局部窗口决定的。DeepSeek 稀疏注意力使用可学习的稀疏模式:简而言之,它采用 “索引器 + 选择器” 的结构,由闪电索引器计算相关性得分,再由令牌选择器只保留得分最高的一小部分历史位置。

令牌子集的选择方式,是它和滑动窗口注意力的核心区别:

  • 滑动窗口注意力是硬编码的局部性;

  • DeepSeek 稀疏注意力同样限制注意力的范围,但让模型自己决定哪些历史令牌值得回溯。

figure20

图 20:和滑动窗口注意力类似,DeepSeek 稀疏注意力也将每个令牌的注意力限制在历史令牌的子集内,但不使用固定的局部窗口
来源:https://magazine.sebastianraschka.com/p/technical-deepseek

5.2 DeepSeek 稀疏注意力与 MLA

DeepSeek V3.2 同时使用了多头潜在注意力(MLA)和 DeepSeek 稀疏注意力。

  • MLA 通过压缩存储内容来降低 KV 缓存成本;

  • DeepSeek 稀疏注意力减少了模型需要回溯的历史上下文量。

换句话说,一个优化缓存的表示形式,另一个在此基础上优化注意力的模式。

figure21

图 21:DeepSeek V3.2 是最典型的参考案例,因为这个模型家族和稀疏注意力的关联最紧密

稀疏模式不是随机的。第一阶段是闪电索引器,它为每个新的查询令牌计算历史令牌的得分。它利用 MLA 的压缩令牌表示,在历史上下文上计算可学习的相似度得分,从而对历史位置的重要性排序。
第二阶段是令牌选择器,它只保留少量高分子集(比如前 k 个历史位置),并将该子集转化为稀疏注意力掩码。
核心要点是:DeepSeek 稀疏注意力不会硬编码稀疏模式,而是学习该保留哪些历史令牌。

figure22

图 22:该机制由两部分组成:对历史令牌打分的闪电索引器,以及只保留少量子集用于注意力计算的选择器
来源:https://magazine.sebastianraschka.com/p/technical-deepseek

DeepSeek 稀疏注意力相对较新,实现也更复杂,这也是它还没有像分组查询注意力(GQA)那样被广泛采用的原因。


6. 门控注意力(Gated Attention)

门控注意力最好被理解为一种改进的全注意力模块,而非独立的注意力家族。
它通常出现在混合架构中:这类架构仍然保留少量全注意力层用于精确内容检索,但在原本熟悉的缩放点积注意力模块基础上,增加了一些面向稳定性的改进。

figure23

图 23:Trinity Large 是很好的对比案例,因为门控注意力并非 Qwen 独有。在另一种长上下文架构中,门控出现在缩放点积注意力输出之后、输出投影之前
来源:https://magazine.sebastianraschka.com/p/a-dream-of-spring-for-open-weight

6.1 门控注意力的应用场景

Qwen3-Next 和 Qwen3.5 的架构表明,近年的混合架构(下一节会讲)并没有在所有位置替换注意力。
相反,它们用更便宜的方案替换大多数注意力层,只在栈中保留少量全注意力层。

这些保留下来的全注意力层,就是门控注意力的典型应用位置。Qwen3-Next 和 Qwen3.5 将它与门控 DeltaNet 以 3:1 的比例搭配使用。
不过抛开混合架构,Trinity 在更传统的注意力栈中也使用了类似的门控思想,如上图所示。

6.2 门控注意力与标准注意力的对比

Qwen 风格混合架构或 Trinity 中的门控注意力模块,本质上是标准缩放点积注意力加上了几层改进。
在原始论文(https://arxiv.org/abs/2505.06708)中,这些改进的定位是:让保留的全注意力层在混合栈中表现得更稳定。

该模块看起来仍然和标准(全)注意力类似,但增加了:

  1. 输出门:在注意力结果加回残差之前对其进行缩放;

  2. 零中心化 QK-Norm 变体:替代 q 和 k 的标准 RMSNorm;

  3. 部分 RoPE(旋转位置编码)。

这些改动不像 MLA 或线性注意力那样是架构级的变化,而只是在熟悉的注意力模块上做的稳定性和控制力优化。

figure24

图 24:在 Qwen3-Next 和 Qwen3.5 中,门控注意力作为全注意力层,周期性地穿插在成组的门控 DeltaNet 模块之间

注:上图也包含了门控 DeltaNet,我们将在下一节介绍。


7. 混合注意力(Hybrid Attention)

混合注意力是一种更宏观的设计模式,而非单一的特定机制。
整体思路是:保留类 Transformer 的堆叠结构,但将大部分昂贵的全注意力层替换为更便宜的线性或状态空间序列模块。

其动机是长上下文效率。全注意力的计算量随序列长度呈二次增长,因此当模型上下文扩展到 128k、256k 甚至 1M 令牌时,注意力的内存和计算成本会高到让 “大部分层用更便宜的序列模块、只保留少量重型检索层” 的方案变得更划算。(当然,这会带来一定的建模性能取舍。)

在 Qwen3-Next 中,该模式体现为 3:1 比例的门控 DeltaNet 与门控注意力模块组合。
门控 DeltaNet 和 Mamba-2 也有紧密关联(可参考论文https://arxiv.org/abs/2412.06464),该机制可以看作是 DeltaNet 风格的快速权重更新加上 Mamba 风格的门控。
后续的架构保留了整体思路,但替换成了其他轻量序列混合器,比如 Kimi Delta 注意力、闪电注意力,或者标准 Mamba-2。

figure25

图 25:基础混合模式:大部分模块是更便宜的序列混合器,每四个模块恢复一个重型注意力层
来源:https://magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison

7.1 Qwen3-Next 中的门控 DeltaNet

据我所知,首个接近旗舰级别的混合注意力 LLM 是 2025 年的 Qwen3-Next。它没有完全去掉注意力,而是将三个门控 DeltaNet 模块与一个门控注意力模块混合排布。

其中,轻量的门控 DeltaNet 模块承担大部分长上下文工作,让内存增长比全注意力平缓得多;而更重的门控注意力层得以保留,因为 DeltaNet 在基于内容的检索上精度稍弱。

在门控 DeltaNet 模块内部,模型计算查询、键、值向量,同时还有两个可学习的门(α、β)。
它不生成常规的令牌间注意力矩阵,而是用 delta 规则更新一个小型的快速权重记忆。
粗略来说,记忆存储的是过去信息的压缩运行摘要,门控则控制新信息的加入量和旧状态的保留量。

这使得门控 DeltaNet 属于线性注意力或循环类机制,而非对 MHA 的简单微调。
和 Mamba-2 的紧密联系在于:两者都属于线性时间的门控序列模型家族,但门控 DeltaNet 使用 DeltaNet 风格的快速权重记忆更新,而非 Mamba 的状态空间更新。

figure26

图 26:混合架构的实际动机体现在内存曲线上。带门控 DeltaNet 的混合栈,内存随上下文长度的增长远慢于普通全注意力
来源:https://github.com/rasbt/LLMs-from-scratch/tree/main/ch04/08_deltanet

Qwen3.5 将原本的 Qwen3-Next 混合架构纳入了 Qwen 的主力旗舰系列,这是一个值得关注的动向。这基本标志着混合策略的成功,未来我们可能会看到更多采用该架构的模型。

figure27

图 27:Qwen3.5 表明 Qwen 团队将原 Qwen3-Next 的支线架构升级为主线模型,而非仅作为一次性的效率变体
来源:https://magazine.sebastianraschka.com/p/a-dream-of-spring-for-open-weight

7.2 Kimi Linear 与改进型 Delta 注意力

Kimi Linear 保留了同样的 Transformer 骨架和 3:1 的模式,但对两部分都做了改进。

  • 轻量侧:Kimi Delta 注意力是对门控 DeltaNet 的改进。Qwen3-Next 每个头使用标量门控制记忆衰减,而 Kimi 使用通道级门控,对记忆更新的控制更精细。

  • 重型侧:Kimi 将门控注意力层替换为门控 MLA 层。

所以它和 Qwen3-Next、Qwen3.5 的宏观模式完全一致,只是两个组成部分都做了微调:大部分层仍由更便宜的线性类机制处理,周期性的重型层仍然保留,以保障更强的检索能力。

figure28

图 28:Kimi Linear 保留了整体混合模式,同时改动了栈的轻量侧和重型注意力侧
来源:https://magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison

7.3 Ling 2.5 与闪电注意力

Ling 2.5 在轻量侧提供了另一种技术路线。它没有采用门控 DeltaNet,而是使用了一种更精简的循环线性注意力变体 ——闪电注意力(Lightning Attention);在重负载模块侧,则沿用了 DeepSeek 的多头潜在注意力(MLA)。

绝大多数序列信息交互由成本更低的线性注意力块完成,仅保留少量重负载层来保障更强的内容检索能力。核心区别在于,此处的轻量机制是闪电注意力,而非 DeltaNet 或 Kimi Delta 注意力。

figure29

图 29:Ling 2.5 与 Qwen3.5 均属于线性注意力混合架构,区别在于 Ling 用闪电注意力和 MLA 替换了 Qwen 的技术方案
来源:https://magazine.sebastianraschka.com/p/a-dream-of-spring-for-open-weight

Ling 2.5 的设计更偏向长上下文效率,而非追求绝对的基准测试性能领先。据 Ling 团队公布,在 32k 令牌上下文长度下,其推理速度显著快于 Kimi K2—— 这正是这类混合架构追求的实际落地收益。

figure30

图 30:Ling 2.5 被定位为效率大幅升级的版本;在同为 1 万亿参数规模下,其 32k 令牌吞吐量远高于 Kimi K2
来源:https://huggingface.co/inclusionAI/Ling-2.5-1T

Nemotron 与 Mamba-2

Nemotron 将这一设计模式进一步推离 Transformer 的经典基线。Nemotron 3 Nano 是一种Mamba-Transformer 混合架构,它将 Mamba-2 序列建模模块与稀疏 MoE 层交错排布,仅在极少部分层中使用自注意力机制。

这是对上述同一基础权衡的更极端演绎。此处的轻量序列模块是 Mamba-2 状态空间块,而非 DeltaNet 风格的快速权重更新,但其底层 “效率换效果” 的核心逻辑是一致的。

figure31

图 31:Nemotron 3 Nano 将大部分序列建模工作交由 Mamba-2 完成,自注意力仅出现在很小一部分层中
来源:https://magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison

规模更大的 Nemotron 3 Super 延续了 Mamba-2 混合注意力架构,并在此基础上增加了更多面向效率的优化,例如潜在 MoE以及用于推测解码的共享权重多令牌预测(MTP)

figure32

图 32:Nemotron 3 Super 保留了 Mamba-2 混合注意力模式,同时额外加入了潜在 MoE 与共享权重 MTP 机制
来源:https://magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison


结语

当然,学术文献中还有更多(大多属于细分方向的)注意力变体,本文并未全部涵盖。本文的聚焦点,是那些当前在前沿开源权重模型中已落地应用的技术方案。

我个人尤其期待两个方向的发展:

  1. 最新论文(https://arxiv.org/abs/2603.15569)提出的层结构能被整合进上述混合架构中,替代门控 DeltaNet;

  2. 论文(https://arxiv.org/abs/2603.15031)的技术能得到更广泛的行业应用。

在实际应用中,你可能也会好奇:目前 “最好” 的架构是什么?这个问题很难给出定论,因为目前没有公开实验在相同训练数据等控制变量下,对不同架构做对等训练对比。

因此我们当前只能判断:针对特定的应用场景,哪一个经过训练的模型是更优选择。
在我看来,混合架构仍然属于新兴技术,其核心卖点主要是长上下文效率,而非单纯的建模效果。也正因此,我认为它们非常适合智能体应用场景(例如 OpenClaw)。

就个人使用体验而言,混合架构的问题还在于其推理栈目前的优化程度尚不足。我在本地运行大语言模型时发现,采用 GPT-OSS 这类分组查询注意力的经典架构,反而能获得更高的每秒令牌数(tok/sec)吞吐量。

无论如何,我都十分好奇 DeepSeek V4 会带来哪些新的技术突破 —— 毕竟在过去两年中,DeepSeek 一直是相当可靠的行业趋势引领者。

Leave a Reply

Your email address will not be published. Required fields are marked *

*