【转载】Kimi Linear

原文地址 第14章 Kimi Linear

14. Kimi Linear

近年来,为提升大语言模型(LLM)的运行效率,线性注意力机制迎来了新一轮复兴。

2017 年《Attention Is All You Need》论文中提出的注意力机制(即缩放点积注意力),仍是当前大语言模型中应用最广泛的注意力变体。除传统的多头注意力外,它也衍生出了多种更高效的实现形式,例如分组查询注意力、滑动窗口注意力以及多头潜在注意力。

14.1 传统注意力与二次方开销

原生注意力机制的计算开销随序列长度呈二次方增长:

\(\text{Attention}(Q, K, V) = \text{softmax}\!\left(\frac{QK^\top}{\sqrt{d}}\right)V\)

原因在于查询(Q)、键(K)、值(V)均为 n×d 维矩阵,其中 d 是嵌入维度(模型超参数),n 是序列长度(即 token 数量)。

关于注意力机制的更多细节,可参考我的另一篇文章:
《大语言模型中自注意力、多头注意力、因果注意力与交叉注意力的原理与代码实现》

figure40

图 40:注意力机制随序列长度 n 产生二次方开销的示意图

14.2 线性注意力

线性注意力的各类变体由来已久,我记得 2020 年代就涌现了大量相关论文。例如我印象中最早的相关工作之一,是 2020 年的《Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention》,研究人员在文中对注意力机制做了近似处理:

\(\text{Attention}(Q, K, V) = \text{softmax}\!\left(\frac{QK^\top}{\sqrt{d}}\right)V \approx \phi(Q)\big(\phi(K)^\top V\big)\)

其中 φ(・) 为核特征函数,具体形式为 φ(x) = elu (x) + 1。

这种近似方式的高效之处在于,它避免了显式计算 n×n 维的注意力矩阵 QKᵀ,无需执行所有 token 之间的两两交互(该操作的时间与内存复杂度为 O (n²d))。

我不想过多赘述这些早期的探索。但核心结论是:它们将时间和内存复杂度从 O (n²) 降至 O (n),大幅提升了长序列场景下注意力的运行效率。

不过这类方案始终没有普及开来,因为会降低模型精度。我也从未见过哪款开源的顶尖大语言模型采用过这类注意力变体。

14.3 线性注意力的复兴

今年下半年,线性注意力变体迎来了一波复兴浪潮。首个值得关注的模型是 6 月发布的 MiniMax-M1,它搭载了闪电注意力(lightning attention),这是一个参数量达 4560 亿的混合专家(MoE)模型,其中激活参数量为 460 亿。

随后在 8 月,通义千问 3 团队推出了 Qwen3-Next(前文已做详细介绍);9 月,深度求索团队发布了 DeepSeek V3.2。这三款模型(MiniMax-M1、Qwen3-Next、DeepSeek V3.2)均在大部分或全部网络层中,用高效的线性注意力变体替代了传统的二次方注意力。

有意思的是,近期出现了反转:MiniMax 团队发布的全新 2300 亿参数 M2 模型(详见第 13 节)并未采用线性注意力,而是回归了常规注意力方案。团队表示,线性注意力在生产级大语言模型中落地难度较高:它在常规提示词场景下表现正常,但在推理和多轮对话任务上精度较差 —— 而这类任务不仅对普通聊天场景很重要,对智能体(Agent)应用更是关键。

这原本可能成为一个转折点,让业界认为线性注意力终究不值得投入。但事情后续更有戏剧性:10 月,Kimi 团队发布了搭载线性注意力的全新 Kimi Linear 模型。

figure41

图 41:线性注意力混合架构总览

旁注:我本可以将 Qwen3-Next 和 Kimi Linear 归入总览图中的 “Transformer – 状态空间模型(SSM)混合架构” 类别。在我看来,其他 Transformer-SSM 混合架构更偏向 “带 Transformer 组件的 SSM”,而本节讨论的模型(Qwen3-Next、Kimi Linear)更偏向 “带 SSM 组件的 Transformer”。不过既然我已经把 IBM Granite 4.0 和 NVIDIA Nemotron Nano 2 归在了 Transformer-SSM 分类下,把它们都归为同一类也说得通。

14.4 Kimi Linear 与 Qwen3-Next 的对比

Kimi Linear 与 Qwen3-Next 在结构上有不少相似之处。二者都采用混合注意力策略,具体来说,是将轻量的线性注意力与算力开销更高的全注意力层结合使用。特别的是,两者都采用 3:1 的比例:即每 3 个采用线性门控 DeltaNet 变体的 Transformer 模块,搭配 1 个使用全注意力的模块,如下图所示。

figure42

图 42:Qwen3-Next 与 Kimi Linear 结构对比

门控 DeltaNet(Gated DeltaNet)是一种受循环神经网络启发的线性注意力变体,借鉴了 《Gated Delta Networks: Improving Mamba2 with Delta Rule》 论文中的门控机制。从某种意义上说,门控 DeltaNet 是带有 Mamba 风格门控的 DeltaNet,而 DeltaNet 本身就是一种线性注意力机制。受限于本文的综述定位,DeltaNet 更适合未来单独撰文介绍。

注意,上图中 Kimi Linear 部分省略了 RoPE 模块是有意为之。Kimi 在多头潜在注意力(MLA,即全局注意力)层中采用了 \\ 无位置编码(NoPE)\\ 方案。据作者介绍,这让 MLA 在推理时可以以纯多查询注意力的形式运行,并且在扩展长上下文时无需重新调整 RoPE 参数(位置偏置据称由 Kimi Delta 注意力模块处理)。关于 MLA 和多查询注意力(分组查询注意力的一种特例)的更多信息,可参考我的《大语言模型架构全面对比》一文。

此外,我还在另一篇文章中详细介绍过门控 DeltaNet。

14.5 Kimi Delta 注意力

Kimi Linear 在 Qwen3-Next 的线性注意力基础上,提出了 \\Kimi Delta 注意力(KDA)\\ 机制,本质上是对门控 DeltaNet 的优化改进。Qwen3-Next 使用标量门控(每个注意力头对应一个数值)来控制记忆衰减速率,而 Kimi Linear 则替换为逐通道门控,对每个特征维度单独控制。据作者称,这种设计能更精细地管控记忆,进而提升长上下文推理能力。

除此之外,在全注意力层上,Kimi Linear 没有沿用 Qwen3-Next 的门控注意力层(本质是带输出门控的标准多头注意力层),而是替换为多头潜在注意力(MLA)。这套 MLA 机制和前文 DeepSeek V3/R1 章节介绍的是同一种,只是额外增加了门控结构。(回顾一下:MLA 通过压缩键值空间来减小 KV 缓存的体积。)

目前没有 Kimi Linear 与 Qwen3-Next 的直接对比数据,但与门控 DeltaNet 论文中的 Gated DeltaNet-H1 模型(本质是带滑动窗口注意力的门控 DeltaNet)相比,Kimi Linear 在保持相同 token 生成速度的前提下,实现了更高的建模精度。

figure43

图 43:摘自 Kimi Linear 论文的标注图,显示 Kimi Linear 的速度与 GatedDeltaNet 持平,远快于搭载多头潜在注意力的架构(如 DeepSeek V3/R1),同时基准测试表现更优。

此外,DeepSeek-V2 论文中的消融实验表明,只要精心选择超参数,MLA 的效果与常规全注意力相当。

而 Kimi Linear 在长上下文和推理基准测试上的表现优于 MLA,这让线性注意力变体再次展现出在大规模顶尖模型中的应用潜力。话虽如此,Kimi Linear 的参数量为 480 亿,比 Kimi K2 小 20 倍。Kimi 团队是否会在下一代 K3 模型中沿用这套方案,值得期待。

原文地址

Leave a Reply

Your email address will not be published. Required fields are marked *

*