【转载】大语言模型架构全面对比06:Qwen3

原文地址 第6章 Qwen3

6. Qwen3

通义千问团队始终持续输出高质量的开源权重大语言模型。我还记得 2023 年 NeurIPS 大会期间,我参与联合指导大语言模型效率挑战赛,最终所有夺冠方案均基于 Qwen2 搭建。

如今的 Qwen3 是又一标杆级模型系列,在各自参数量级的排行榜上都位居头部。该系列包含 7 款稠密模型,参数量分别为 0.6B、1.7B、4B、8B、14B 和 32B;另有 2 款混合专家(MoE)模型:30B-A3B 与 235B-A22B。

(顺带说明:“Qwen3” 中间未加空格并非笔误,我只是尽量保留通义千问开发团队选定的原始拼写。)

6.1 Qwen3(稠密版本)

我们先来看稠密模型的架构。截至本文撰写时,0.6B 参数版本很可能是当前新一代开源模型中参数规模最小的。以我的实际体验来看,在如此小的体量下,它的表现十分出色。如果要在本地运行,它的 token 生成吞吐量高,内存占用低;更重要的是,参数量小也意味着它很适合在本地开展训练(用于教学研究目的)。

因此在大多数场景下,我已经用 Qwen3 0.6B 替代了 Llama 3 1B。二者的架构对比如下图所示。

figure18

图 18:Qwen3 0.6B 与 Llama 3 1B 架构对比。可见 Qwen3 属于 “更深” 的架构,层数更多;而 Llama 3 属于 “更宽” 的架构,注意力头数量更多。

如果你想查看不依赖任何第三方大模型库、可读性良好的 Qwen3 实现,我最近刚用纯 PyTorch 从零完成了一版 Qwen3 的代码实现

上图中的性能数据,是我在 A100 GPU 上运行这套从零实现的 PyTorch 代码测得的结果。可以看到,Qwen3 整体架构规模更小,隐藏层维度更低、注意力头数量更少,因此内存占用更小;但它的 Transformer 模块数量多于 Llama 3,因此运行速度更慢(每秒生成的 token 数更低)。

6.2 Qwen3(混合专家版本)

如前文所述,Qwen3 同时推出了两款混合专家(MoE)版本:30B-A3B 和 235B-A22B。为什么 Qwen3 这类架构会同时提供常规(稠密)版本和 MoE(稀疏)版本?

正如本文开头提到的,MoE 变体有助于降低大基座模型的推理成本。同时提供稠密版与 MoE 版,用户可以根据自身目标和资源约束灵活选择。

稠密模型的优势在于,在各类硬件上的微调、部署与优化通常都更简单直接。

而 MoE 模型则是面向推理规模化做了优化。举例来说,在推理预算固定的情况下,MoE 模型能实现更高的整体模型容量 —— 凭借更大的总参数量,训练阶段能容纳更多知识 —— 同时不会让推理成本同比例增长。

通过同时发布两类模型,Qwen3 系列能够覆盖更广泛的使用场景:稠密模型兼顾稳定性、易用性与微调友好性,MoE 模型则适合大规模高效推理服务。

本节最后,我们将 Qwen3 235B-A22B(其中 A22B 代表 “220 亿激活参数”)与 DeepSeek V3 做个对比,后者的激活参数量几乎是前者的两倍(370 亿)。

figure19

图 19:DeepSeek V3 与 Qwen3 235B-A22B 架构对比

如上图所示,DeepSeek V3 与 Qwen3 235B-A22B 的架构高度相似。但值得注意的是,Qwen3 不再采用共享专家设计(而更早的 Qwen 模型,比如 Qwen2.5-MoE,是使用共享专家的)。

遗憾的是,Qwen3 团队并未公开说明取消共享专家的原因。如果让我推测,或许是当专家数量从 Qwen2.5-MoE 的 2 个增加到 Qwen3 的 8 个后,共享专家对他们的训练方案而言,已经不再是维持训练稳定的必要设计。这样只使用 8 个专家而非 8+1 个,还能节省额外的计算与内存开销。(不过这无法解释为什么 DeepSeek V3 仍然保留了共享专家。)

补充:Qwen3 的开发者之一 Junyang Lin 对此回应如下:
“当时我们没有发现共享专家能带来足够显著的效果提升,同时也担心共享专家会给推理优化带来麻烦。说实话,这个问题没有绝对的标准答案。”

【转载】从DeepSeek V3到V3.2:架构、稀疏注意力与强化学习更新

原文地址:From DeepSeek V3 to V3.2: Architecture, Sparse Attention, and RL Updates,by Sebastian Raschka, on 2026-01-01

从DeepSeek V3到V3.2:架构、稀疏注意力与强化学习更新

解读 DeepSeek 旗舰开源权重模型的演进之路

与 DeepSeek V3 的发布节奏类似,团队选择在美国一个重要假期的周末推出了这款全新旗舰模型。DeepSeek V3.2 的性能达到了 GPT-5 与 Gemini 3.0 Pro 的级别,同时还是一款开源权重模型,绝对值得深入研究。

figure01

图 1:DeepSeek V3.2 与闭源旗舰模型的基准测试对比。本图为 DeepSeek V3.2 报告的标注版插图。

我曾在《LLM 架构大盘点》一文的开篇详细介绍过其前身 DeepSeek V3,过去几个月里,随着新架构不断发布,我也一直在持续更新这篇文章。原本刚和家人过完感恩节假期回来,我只打算给这篇文章新增一个小节,补充 DeepSeek V3.2 的相关内容,但后来发现值得探讨的亮点太多,便决定单独写一篇更完整的长文。

他们的技术报告中有大量值得挖掘的内容与经验,我们这就开始。

1. DeepSeek 发布时间线

尽管 DeepSeek V3 在 2024 年 12 月发布之初并未迅速走红,但基于同款架构、以 DeepSeek V3 为基座的 DeepSeek R1 推理模型,让 DeepSeek 跻身最受欢迎的开源权重模型行列,成为 OpenAI、Google、xAI、Anthropic 等闭源模型的有力替代方案。

figure02

图 2:2024 年 12 月发布的 DeepSeek V3/R1 架构。我们将在后续章节回顾并详细拆解其架构细节。

那么,自 V3/R1 之后,DeepSeek 有哪些新进展?可以肯定的是,DeepSeek 团队这一年一定非常忙碌。但自 DeepSeek R1 发布以来,过去 10 到 11 个月里都没有重大版本更新。

在我看来,大型语言模型的重大版本间隔约 1 年是合理的,毕竟研发工作量极大。但我在各大社交平台上看到,不少人已经开始断言这个团队 “销声匿迹”,认为他们只是昙花一现。

我相信 DeepSeek 团队也一直在忙于适配从英伟达到华为芯片的切换。顺便说明,我与该团队无任何关联,也未与他们有过交流,本文所有内容均基于公开信息。据我所知,他们目前已重新使用英伟达芯片。

另外,他们也并非完全没有发布新产品,今年陆续推出了几个小型版本,比如 DeepSeek V3.1 和 V3.2-Exp。

figure03

图 3:去年至今 DeepSeek 的发布历程。核心模型以红色标注。

正如我今年 9 月的预测,DeepSeek V3.2-Exp 的发布,目的是让生态与推理基础设施提前适配,为刚推出的 V3.2 模型铺路。

V3.2-Exp 与 V3.2 采用了一种非标准的稀疏注意力变体,需要自定义代码实现,该机制的细节我们稍后展开。(我原本想在上一篇《超越标准 LLM》的文章中介绍它,但当时恰逢 Kimi Linear 发布,我便优先在新注意力变体章节讲解了 Kimi Linear。)

2. 混合推理模型 vs 专用推理模型

在深入讲解模型细节之前,我们先梳理一下模型的整体类型。最初,DeepSeek V3 以基座模型的形式发布,而 DeepSeek R1 则在其基础上经过额外后训练,成为专用推理模型。整个流程如下图所示。

figure04

图 4:DeepSeek R1 训练流程概览。该图出自我的《深度解读推理型 LLM》一文,文中有更详细的说明。

你可以在《深度解读推理型 LLM》一文中,了解上图训练流程的更多细节。

这里需要明确:DeepSeek V3 是基座模型,DeepSeek R1 是专用推理模型。

与 DeepSeek 同期,其他团队也推出了多款性能强劲的开源推理模型。今年表现最突出的开源模型之一是 Qwen3,它最初以混合推理模型的形式发布 —— 用户可以在同一个模型内切换推理与非推理模式。(Qwen3 通过分词器添加或移除 \\ 标签来实现模式切换。)

此后,各个 LLM 团队陆续推出了专用推理模型和指令 / 推理混合模型,部分团队还在两种路线之间反复调整,时间线如下。

figure05

图 5:今年部分推理模型与混合模型的发布时间线。

比如 Qwen3 最初是混合模型,但通义团队后续拆分出了独立的指令模型和推理模型 —— 拆分后开发难度更低,且在各自场景下的性能表现更优。

而 OpenAI 的 gpt-oss 等模型仅提供混合版本,用户可以通过系统提示词控制推理强度(我推测 GPT-5 和 GPT-5.1 也采用了类似的实现方式)。

而 DeepSeek 的路线恰好相反:从专用推理模型(R1)转向了混合模型(V3.1 与 V3.2)。不过我认为,R1 本质上是一个研究项目,目的是探索推理方法、打造当时最优的推理模型;而 V3.2 的发布,更偏向于打造适配多场景的综合最优模型。(从这个角度看,R1 更像是一个试验台或原型模型。)

另外我推测,尽管 DeepSeek 团队在 V3.1 和 V3.2 中集成了推理能力,但他们可能仍在研发专用的 R2 模型。

3. 从 DeepSeek V3 到 V3.1 的演进

在详细讲解全新的 DeepSeek V3.2 之前,先梳理 V3 到 V3.1 的核心变化,会更有助于理解。

3.1 DeepSeek V3 概览与多头潜注意力(MLA)

我已在多篇文章中详细拆解过 DeepSeek V3 与 R1。概括来说,DeepSeek V3 作为基座模型,有两大核心架构亮点:混合专家(MoE)与多头潜注意力(MLA)。

相信大家对 MoE 已经比较熟悉,这里就不再展开介绍。如果想了解更多,可以参考我《LLM 架构大盘点》一文中的简要概述,获取更多背景信息。

另一大亮点是 MLA 的应用。DeepSeek V2、V3 与 R1 均采用了 MLA,它是一种显存优化策略,与 KV 缓存的适配性极佳。MLA 的核心思路是:先将键(K)和值(V)张量压缩到低维空间,再存入 KV 缓存。

推理时,再将这些压缩后的张量投影回原始维度后使用,如下图所示。这一过程会增加一次矩阵乘法,但能显著降低显存占用。

(补充说明:查询(Q)向量也会被压缩,但仅在训练阶段执行,推理阶段不压缩。)

figure06

图 6:DeepSeek V3/R1 中的多头潜注意力(MLA)。(为简化图示,未画出查询向量的压缩空间。)

上图阐释了 MLA 的核心原理:键和值先被投影为潜向量,再存入 KV 缓存以降低显存需求;后续使用时需要再通过上投影还原到原始键值空间。整体而言,这种设计提升了运行效率(可以类比 LoRA 中的降维投影与升维投影)。

注意,查询向量也会被投影到独立的压缩空间,原理与键、值的压缩类似;为了图示简洁,上图中省略了这部分。

顺便一提,如前所述,MLA 并非 DeepSeek V3 的首创,其前身 DeepSeek V2 就已经采用(甚至是首创)了这一机制。

3.2 DeepSeek R1 概览与可验证奖励强化学习(RLVR)

DeepSeek R1 与上述 DeepSeek V3 架构完全一致,差异在于训练方案。具体来说,DeepSeek R1 以 V3 为基座,重点采用可验证奖励强化学习(RLVR)方法,来提升模型的推理能力。

RLVR 的核心思想是:让模型从可通过符号或程序验证的回复中学习,比如数学题和代码题(当然,该方法也可拓展到这两个领域之外)。

figure07

图 7:可验证任务示例

组相对策略优化(GRPO)算法,本质上是近端策略优化(PPO)的简化版本。PPO 是人类反馈强化学习(RLHF)中的主流算法,广泛用于大语言模型的对齐。

figure08

图 8:LLM 训练中不同强化学习方案的对比。传统基于 PPO 的 RLHF 同时使用奖励模型(基于人类偏好训练)和评判模型(价值模型)来引导学习;GRPO 去掉了评判模型;而结合 GRPO 的 RLVR 更进一步,移除了奖励模型,转而依赖计算器、编译器等符号工具提供的可验证奖励。

如果你想了解更多细节,可以参考我《LLM 推理强化学习现状》一文,其中详细讲解了结合 GRPO 的 RLVR 训练方法,包括背后的数学原理。

3.3 DeepSeek R1-0528 版本升级

正如 DeepSeek 团队所言,DeepSeek R1-0528 本质上是一次 “小版本升级”。

架构与 DeepSeek V3/R1 保持一致,性能提升主要来自训练侧的优化,使其在当时能追平 OpenAI o3 与 Gemini 2.5 Pro 的水平。

遗憾的是,DeepSeek 团队并未公开具体的实现细节,仅表示部分提升来自后训练流程的优化。另外根据公开信息推测,其云端部署版本在推理时会调用更多算力,执行更长的推理过程。

3.4 DeepSeek V3.1 混合推理能力

DeepSeek V3.1 是一款同时具备通用对话(指令)与推理能力的混合模型。也就是说,团队不再开发两个独立模型,而是用单一模型承载两种能力,用户可通过对话提示模板切换模式(与初代 Qwen3 的设计类似)。

DeepSeek V3.1 基于 DeepSeek V3.1-Base 开发,而后者又以 DeepSeek V3 为基座,三者架构完全相同。

4. DeepSeek V3.2-Exp 与稀疏注意力

2025 年 9 月发布的 DeepSeek V3.2-Exp,是更值得关注的版本。

DeepSeek V3.2-Exp 发布之初,基准测试成绩并未登顶,因此当时并未引发太多关注。但正如我 9 月的推测,这大概率是一次早期实验性发布,目的是让基础设施(尤其是推理与部署工具)提前适配后续的重大版本 —— 因为 V3.2-Exp 包含了几项架构改动。而真正的重大版本是 DeepSeek V3.2(而非 V4),细节我们稍后展开。

那么 DeepSeek V3.2-Exp 有哪些新特性?首先,它以 DeepSeek V3.1-Terminus 为基座进行训练。什么是 V3.1-Terminus?它就是上一节提到的 V3.1 检查点的小幅优化版本。

技术报告中提到:

DeepSeek-V3.2-Exp 是一款实验性稀疏注意力模型,通过持续训练为 DeepSeek-V3.1-Terminus 集成了 DeepSeek 稀疏注意力(DSA)机制。DSA 是一种由闪电索引器驱动的细粒度稀疏注意力机制,让 DeepSeek-V3.2-Exp 在训练和推理阶段均实现了显著的效率提升,在长上下文场景下尤为明显。

如上文所述,核心创新在于 DeepSeek 稀疏注意力(DSA)机制 —— 团队先给 V3.1-Terminus 加入 DSA,再基于该检查点做进一步训练。

DSA 由两部分组成:1)闪电索引器;2)令牌选择器,目标是选择性地缩减上下文,从而提升效率。

要解释它的工作原理,我们先从滑动窗口注意力说起。滑动窗口注意力是近年 Gemma 3、Olmo 3 等模型采用的技术,它将注意力窗口限制在固定大小内,如下图所示。

figure09

图 9:在滑动窗口注意力中,当前查询令牌不会关注所有历史令牌,而只关注其中一部分。

DSA 与滑动窗口注意力的核心思路一致:仅让模型关注部分历史令牌。但不同的是,DSA 并非通过固定宽度的滑动窗口选择令牌,而是通过索引器和令牌选择器动态决定要关注哪些历史令牌。换句话说,被关注的令牌分布更灵活,如下图所示。

figure10

图 10:在 DSA 中,当前令牌仅能关注选定的少量历史令牌(而非普通因果注意力中的全部令牌)。

不过,我刚才说的 “灵活” 并非随机,历史令牌的选择模式是模型学习得到的。

实际运行中,DSA 通过所谓的 “闪电索引器”,基于所有历史令牌为每个新查询令牌计算相关性得分。计算时,闪电索引器利用 DeepSeek 多头潜注意力(MLA)中的压缩令牌表示,计算令牌之间的相似度。相似度得分本质上是查询向量与键向量经缩放点积后,再通过 ReLU 函数的结果。

如果你对数学细节感兴趣,闪电索引器相似度得分的公式(摘自论文)如下:

其中,w 是每个注意力头可学习的权重系数,决定每个索引头对最终相似度得分的贡献度;q 代表查询向量,k 代表键向量。各下标含义如下:

  • t:当前查询令牌的位置;

  • s:序列中历史令牌的位置(0 ≤ s < t);

  • j:不同索引头的索引(为简化,图 10 仅画出一个头),因此 qt, j 表示 “索引头 j 中当前令牌 t 的查询向量”。

你可能会注意到,索引器仅作用于查询向量,不作用于键向量。这是因为模型只需要判断每个新查询应该关注哪些历史令牌,而键向量已经被压缩并存入 KV 缓存,索引器无需再对它们分头打分或重复压缩。

这里的 ReLU 函数(f (x) = max (x, 0))会将负的点积结果置零,理论上能带来稀疏性,但由于要对多个头的结果求和,索引器得分实际为 0 的概率很低。真正的稀疏性来自独立的令牌选择器。

独立的令牌选择器仅保留少量高分令牌(例如前 k 个位置),并构建稀疏注意力掩码,屏蔽未被选中的其他令牌。(此处 top-k 的 k 是超参数,与上文公式中代表键的 k 无关;DeepSeek 团队公开的模型代码中,该值设为 2048。)

下图以流程图形式展示了完整过程。

figure11

图 11:DeepSeek V3.2 稀疏注意力机制可视化总结

总而言之,通过索引器与令牌选择器,每个令牌仅会关注模型判定为最相关的少量历史令牌,而非全部令牌,也不是固定的局部窗口。

该设计的目标并非超越 DeepSeek V3.1-Terminus 的性能,而是在享受效率提升的同时,尽可能降低稀疏注意力机制带来的性能损耗。

整体来看,DSA 将注意力机制的计算复杂度从序列长度 L 的平方级 O (L²),降低到了线性级 O (Lk),其中 k 远小于 L,为选中的令牌数量。

5. 具备自验证与自优化能力的 DeepSeekMath V2

讲完 DeepSeek V3.2-Exp,我们离本文核心 DeepSeek V3.2 就更近了。但在此之前,还有一块关键内容需要先铺垫。

2025 年 11 月 27 日(美国感恩节),也就是 DeepSeek V3.2 发布的 4 天前,DeepSeek 团队推出了基于 DeepSeek V3.2-Exp-Base 的 DeepSeekMath V2。

该模型专为数学场景研发,在多项数学竞赛中达到了金牌水平。本质上,它可以看作 DeepSeek V3.2 的概念验证模型,引入了又一项新技术。

这里的核心背景是:DeepSeek R1 这类推理模型,是借助外部验证器训练的,模型会自主学习在给出最终答案前写出推导过程。但这些推导过程可能存在错误。

正如 DeepSeek 团队简洁的总结,传统 RLVR 存在两大短板:

…… 答案正确不代表推理过程正确。
…… 模型可能通过错误的逻辑或巧合的计算得到正确答案。

他们希望解决的 DeepSeek R1 RLVR 方案的另一局限是:

…… 定理证明等许多数学任务需要严谨的逐步推导,而非单纯的数值答案,因此基于最终答案的奖励机制不再适用。

为了弥补上述两大短板,论文中训练了两个模型:

  1. 基于大语言模型的定理证明验证器。

  2. 作为主模型的证明生成器,将上述 LLM 验证器当作奖励模型使用(替代传统的符号验证器)。

除了上述基于 LLM 的自验证,他们还采用了自优化技术(我即将出版的《从零构建推理模型》第 5 章会详细讲解),让大模型迭代优化自己的答案。

5.1 自验证

让大语言模型为中间步骤打分并非新鲜事,所谓的 “过程奖励模型” 领域已有大量相关研究,比如 2022 年的《基于过程与结果反馈的数学应用题求解》、2023 年的《逐步验证》等,相关文献非常多。

过程奖励模型的难点在于:中间奖励的正确性难以校验,还可能引发奖励破解问题。

在 2025 年 1 月的 DeepSeek R1 论文中,团队并未使用过程奖励模型,因为他们发现:

在我们的实验中,相比于它在大规模强化学习过程中带来的额外计算开销,其收益十分有限。

而在这篇论文中,他们以自验证的形式重新探索了这一方向。其核心动机是:即使没有参考答案,人类在阅读证明、发现问题时也能自我修正。

因此,为了打造更优秀的数学证明生成模型(下图中的 LLM 1),他们开发了一个证明验证器(下图中的 LLM 2),以 “大模型裁判” 的身份为证明生成器(LLM 1)的输出打分。

figure12

图 12:数学证明生成器(LLM 1)与验证器(LLM 2)的通用架构

验证器 LLM(LLM 2)依据评分标准为生成的证明打分,评分规则为:

  • 1 分:证明完整严谨,所有逻辑步骤均有清晰依据;

  • 0.5 分:整体逻辑成立,但存在少量错误或细节缺失;

  • 0 分:证明存在根本性缺陷,包含致命逻辑错误或关键推导断层。

证明验证器模型以 DeepSeek V3.2-Exp-SFT 为起点 —— 后者是基于 V3.2-Exp、在数学与代码推理数据上做监督微调得到的模型。随后,团队通过强化学习进一步训练验证器:一方面采用格式奖励(检查解答是否符合预期格式),另一方面采用得分奖励(基于预测分与人类数学专家标注的真实分的贴合度)。

证明验证器(LLM 2)的作用是校验生成器(LLM 1)的证明,那谁来校验验证器本身?为了提升证明验证器的鲁棒性,避免它 “臆造” 问题,团队又开发了第三个大模型:元验证器。

figure13

图 13:元验证器(LLM 3)校验验证器(LLM 2)对生成器(LLM 1)的验证是否准确。

元验证器(LLM 3)同样通过强化学习开发,训练方式与 LLM 2 类似。尽管元验证器并非必需组件,但 DeepSeek 团队表示:

经元验证器评估,验证器的证明分析平均质量分从 0.85 提升至 0.96,同时证明分数预测的准确率保持不变。

这套架构其实很有意思。如果你熟悉生成对抗网络(GAN),会发现二者有异曲同工之妙:证明验证器相当于 GAN 的判别器,推动证明生成器提升质量;而生成器产出更优质的证明后,又会反过来倒逼验证器进步。

元分数仅用于验证器(LLM 2)与生成器(LLM 1)的训练阶段,不会在推理阶段的自优化循环中使用,自优化我们将在下一节讲解。

5.2 自优化

上一节我们讲了自验证,也就是分析解答的质量。而自验证的目的是实现自优化 —— 让大模型能根据反馈修正自己的答案。

自优化是一种成熟且主流的推理缩放技术。传统的自优化方案中,生成解答、校验解答、优化解答都用同一个大模型。换句话说,在前面的图 12 和图 13 中,LLM 1 和 LLM 2 是同一个模型。传统自优化流程如下:

figure14

图 14:经典自优化迭代:用同一个大模型完成初始回复生成(Output 1)、评估(Eval)和答案优化(Output 2)。

但 DeepSeek 团队在实践中发现,用同一个模型兼顾生成与验证,存在一个关键问题:

当要求模型一次性完成证明生成与自我分析时,即便外部验证器能轻易发现漏洞,生成器也往往会判定自己的证明正确。换句话说,生成器能基于外部反馈优化证明,却无法像专用验证器那样严格地评判自己的输出。

按这个逻辑,大家可能会以为他们用了独立的证明生成器(LLM 1)和证明验证器(LLM 2),自优化循环也会类似下图。注意,图中省略了 LLM 3,因为它仅用于验证器(LLM 2)的研发阶段。

figure15

图 15:采用独立验证器 LLM(LLM 2)的自优化流程

但实际情况与图 15 不同,DeepSeek 团队最终采用的是和经典自优化循环(图 14)一样的方案 —— 生成与验证共用同一个大模型:

“所有实验均使用单一模型,即我们最终的证明生成器,它同时承担证明生成与验证两项工作。”

也就是说,独立验证器是训练阶段提升生成器能力的关键,但当生成器能力足够强后,推理阶段就不再需要它了。而与朴素的单模型自优化相比,核心区别在于:最终的证明生成器,是在更强的验证器与元验证器指导下训练出来的,因此它已经学会用专业的评分标准来审视自己的输出。

此外,推理阶段使用这种二合一的 DeepSeekMath V2 验证器,在资源与成本上也更有优势 —— 相比额外运行一个验证大模型,它的复杂度和算力需求都更低。

回到图 14 和图 15 中的通用自优化概念,两张图都展示了 2 轮迭代的自优化(初始答案 + 一次优化)。当然,我们可以增加更多迭代轮次。这是典型的推理缩放权衡:迭代轮次越多,生成答案的成本越高,但整体准确率也越高。

论文中,DeepSeek 团队最多用到了 8 轮迭代,此时准确率仍未出现饱和。

figure16

图 16:增加自优化迭代轮次可提升准确率。本图为 DeepSeekMath V2 论文的标注版插图。其中 Best@32 多数投票准确率法也叫 “自一致性”,我在《从零构建推理模型》第 4 章中有详细讲解。

6. DeepSeek V3.2(2025 年 12 月 1 日)

上一节花大量篇幅讲解 DeepSeekMath V2,原因有二:其一,它是非常有价值的概念验证,通过自验证与自优化技术,进一步拓展了可验证奖励强化学习(RLVR)的边界;其二,自验证与自优化技术也被应用到了 DeepSeek V3.2 中。

在讲这部分之前,我们先对 DeepSeek V3.2 做一个整体概览。这款模型意义重大,因为它的性能足以比肩当前的旗舰级模型。

figure17

图 17:DeepSeek V3.2 与闭源旗舰模型的基准测试对比。本图为 DeepSeek V3.2 报告的标注版插图。

和 DeepSeek 的多款模型一样,V3.2 也附带了一份详实的技术报告,接下来的章节我会逐一解读。

6.1 DeepSeek V3.2 架构

研发这款模型的核心目标,自然是提升综合性能。比如,它和 DeepSeekMath V2 一样,在数学基准测试中达到了金牌水平;同时,模型在训练中也融入了工具使用能力,在代码、智能体等其他任务上同样表现出色。

同时,DeepSeek 团队也将计算效率作为核心设计目标。因此,他们沿用了 V2、V3 中的多头潜注意力(MLA),并在 V3.2 中新增了 DeepSeek 稀疏注意力(DSA)。事实上,论文明确提到 “DeepSeek-V3.2 与 DeepSeek-V3.2-Exp 架构完全一致”,也就是我们之前讨论过的架构。

figure18

图 18:DeepSeek V3.2 架构

正如我之前所说,DeepSeek V3.2-Exp 的发布,大概率是为了让生态与推理基础设施提前适配,为刚推出的 V3.2 模型铺路。

figure19

图 19:DeepSeek 稀疏注意力(DSA)带来的推理成本节省。本图为 DeepSeek V3.2 报告的标注版插图。

有意思的是,从上图的论文截图可以看出,DeepSeek 团队已重新使用英伟达芯片(此前有传闻称他们曾尝试用华为芯片训练模型)。

既然架构与 V3.2-Exp 完全一致,真正的亮点就在于训练方法,我们将在后续章节展开。

6.2 强化学习更新

整体而言,DeepSeek 团队延续了 DeepSeek R1 的方案,采用基于组相对策略优化(GRPO)的可验证奖励强化学习(RLVR)流程,但也做了几项值得关注的更新。

最初,DeepSeek R1 采用三类奖励:

  • 格式奖励:确保答案格式规范;

  • 语言一致性奖励:避免模型在回复中混用多种语言;

  • 核心验证奖励:判断数学、代码题的答案是否正确。

而 DeepSeek V3.2 对奖励机制做了调整:

针对推理与智能体任务,我们采用基于规则的结果奖励、长度惩罚与语言一致性奖励;针对通用任务,我们采用生成式奖励模型,每个提示词都有对应的评估标准。

比如,他们移除了格式奖励,为智能体任务新增了长度惩罚;而对于没有符号验证器(数学)或代码解释器可校验答案的通用任务,则采用奖励模型(另一个训练后可输出奖励分数的大语言模型)。

因此,这套训练流程不再像 DeepSeek R1 那样是纯粹的基于验证器的 RLVR,而是混合方案:可验证的领域沿用 RLVR,其余场景则采用更标准的 “大模型裁判” 奖励建模。

在数学领域,他们表示还 “融合了 DeepSeekMath-V2 的数据集与奖励方法”,也就是我们前文讲过的方案。

6.3 GRPO 算法更新

作为 RLVR 流程中的核心学习算法,GRPO 本身相比 DeepSeek R1 论文中的原始版本,也做了若干改动。

过去几个月里,已有数十篇论文提出 GRPO 的改进方案,旨在提升稳定性与效率。今年早些时候,我在《LLM 推理强化学习现状》一文中介绍过其中两个主流方案:DAPO 和 Dr. GRPO。

不深入 GRPO 的数学细节,简单来说:DAPO 通过非对称裁剪、动态采样、令牌级损失和显式长度奖励塑形来改进 GRPO;而 Dr. GRPO 则直接修改 GRPO 的目标函数,移除了长度归一化与标准差归一化。

近期发布的 Olmo 3 论文也采用了类似的改进,我摘录如下:

  • 零梯度信号过滤:移除组内奖励完全相同的样本(即优势函数标准差为 0 的批次),避免在无梯度贡献的样本上训练,思路与 DAPO 类似(Yu 等人,2025)。[对应 DAPO]

  • 主动采样:即便经过零梯度过滤,也通过一种更高效的新型动态采样方式保持批次大小稳定(Yu 等人,2025),详见 OlmoRL 基础设施说明。[对应 DAPO]

  • 令牌级损失:采用令牌级损失,按批次内总令牌数归一化损失(Yu 等人,2025),而非按样本归一化,以避免长度偏差。[对应 DAPO]

  • 移除 KL 损失:遵循业界通用做法移除 KL 损失(GLM-4.5 团队等,2025;Yu 等人,2025;Liu 等人,2025b),移除后策略更新的约束更少,且不会导致过优化或训练不稳定。[对应 DAPO 与 Dr. GRPO]

  • 上界放宽裁剪:将损失的上界裁剪阈值设为略高于下界,允许令牌进行更大幅度的更新,思路来自 Yu 等人(2025)。[对应 DAPO]

  • 截断重要性采样:为修正推理引擎与训练引擎输出的对数概率差异,按 Yao 等人(2025)的方法,将损失乘以截断重要性采样比率。

  • 无标准差归一化:计算优势函数时,不按组内标准差做归一化,遵循 Liu 等人(2025b)的方案。这消除了难度偏差 —— 原本奖励标准差低的题目(比如过难或过易的题),其优势会被归一化项显著放大。[对应 Dr. GRPO]

DeepSeek V3.2 对 GRPO 的改动相对保守,我参照 Olmo 3 的风格总结如下:

  • 分领域调整 KL 强度(数学场景可设为 0):DAPO 和 Dr. GRPO 在数学类强化学习中会直接移除 KL 项,而 DeepSeek V3.2 保留了目标函数中的 KL 项,但会针对不同领域调整权重。不过团队也指出,数学场景下 KL 权重极弱甚至为 0 时效果通常最好 —— 只是没有直接移除,而是将其作为超参数调优。

  • 无偏 KL 估计:如前所述,V3.2 没有移除 KL 惩罚。除了将其作为调参旋钮,团队还修正了 GRPO 中 KL 惩罚的估算方式:用主损失相同的重要性采样比率对 KL 项重新加权,让 KL 梯度真正匹配 “样本来自旧策略而非当前策略” 的事实。

  • 离策略序列掩码:当生成序列数据在多个梯度步中被复用时,DeepSeek V3.2 会计算当前策略与生成策略在每个完整答案上的偏移程度,直接丢弃那些优势为负且 “严重离策略” 的序列,避免模型从过旧或偏离过大的数据中学习。

  • 保留 MoE 路由结果:针对混合专家主干网络,团队会记录生成阶段激活的专家,并在训练时强制使用相同的路由模式,确保梯度更新作用于生成采样答案的那些专家。

  • 保留 top-p/top-k 采样掩码:当生成阶段采用 top-p 或 top-k 采样时,V3.2 会保存选择掩码,在计算 GRPO 损失与 KL 时重新应用,确保训练时的动作空间与采样时的实际空间一致。

  • 保留原始 GRPO 优势归一化:Dr. GRPO 的研究表明,GRPO 的长度归一化与组内标准差归一化项,会导致优化偏向于过长的错误答案,同时过度放大多过难或过易题目的权重。Dr. GRPO 的解决方案是移除这两项,回归无偏的 PPO 式目标函数;DAPO 则转向令牌级损失,以此调整长短答案的权重。而 DeepSeek V3.2 保留了原始 GRPO 的归一化方式,转而从上述其他方面进行优化。

总体而言,相比近期其他一些模型,DeepSeek V3.2 更贴近原始 GRPO 算法,同时加入了一些符合逻辑的微调。

6.4 DeepSeek V3.2-Speciale 与扩展思考

DeepSeek V3.2 还有一个极致的扩展思考版本,名为 DeepSeek V3.2-Speciale。它在强化学习阶段仅使用推理数据训练,定位更接近 DeepSeek R1。除了仅用推理数据训练,团队还降低了强化学习中的长度惩罚,允许模型输出更长的回复。

生成长回复是一种推理缩放手段:更长的输出会提升推理成本,但换来了更好的效果。

figure20

图 20:“扩展思考” 的 Speciale 版本准确率更高,但生成的令牌数也更多。

7. 总结

本文并未覆盖 DeepSeek V3.2 训练方法的所有细节,但希望通过与前代 DeepSeek 模型的对比,能帮大家理清核心要点与创新之处。

简而言之,核心结论如下:

  • DeepSeek V3.2 与 DeepSeek V3 以来的所有前代模型架构相近;

  • 主要架构改动是加入了 DeepSeek V3.2-Exp 中的稀疏注意力机制,以提升效率;

  • 为提升数学能力,模型采纳了 DeepSeekMath V2 的自验证方案;

  • 训练流程有多项优化,比如 GRPO 的稳定性升级(注:论文还涉及蒸馏、长上下文训练、类 gpt-oss 的工具使用集成等其他内容,本文未展开)。

无论与其他小型开源权重模型,或是 GPT-5.1、Gemini 3.0 Pro 这类闭源模型相比,DeepSeek 的市场份额如何,有一点可以肯定:DeepSeek 的每次发布都颇具看点,其开源权重检查点附带的技术报告,总能带来很多值得学习的内容。

希望这篇概览对你有帮助!

8. DeepSeek 的 mHC:流形约束超连接

Transformer 架构的效率与性能优化,通常都围绕归一化、注意力和前馈网络(FFN)三大模块展开。

例如:

  • 归一化:LayerNorm → RMSNorm → Dynamic TanH

  • 注意力:分组查询注意力、滑动窗口、多头潜注意力、稀疏注意力

  • 前馈网络:GeLU → SiLU,SiLU → SwiGLU,混合专家。

2025 年 12 月 31 日,DeepSeek 分享了一项针对残差路径优化的有趣新研究:mHC—— 流形约束超连接。

简而言之,mHC 建立在超连接(HC)方法的基础上。超连接将常规的恒等残差连接拓展为可学习的连接方式:通过多条并行路径拓宽残差流,并允许信息在这些并行层之间交互融合。

团队在 HC 的基础上更进一步,提出了 mHC:将残差融合约束在结构化、保范数的流形上。他们发现,加入这个 “m” 改进后,训练稳定性得到了提升。

该方案会增加少量计算开销,但能显著提升训练稳定性与收敛效果。

figure21

图 21:mHC 方法示意图。右侧子图为 mHC 论文的标注版插图。

【转载】大语言模型架构全面对比16:DeepSeek V3.2

原文地址 第16章 DeepSeek V3.2

16. DeepSeek V3.2

本文以 2024 年 12 月发布的 DeepSeek V3 开篇。那段时间 DeepSeek 陆续推出了多款模型,但我大多没有展开介绍,因为它们都不属于 DeepSeek V3、DeepSeek R1 这类重磅旗舰级模型发布。

figure47

图 47:自 DeepSeek V3 起 DeepSeek 系列模型的发布时间线。核心模型以红色标注。

Continue reading 【转载】大语言模型架构全面对比16:DeepSeek V3.2

【转载】大语言模型架构全面对比01:DeepSeek V3/R1

原文地址 第1章 DeepSeek V3/R1

1. DeepSeek V3/R1

想必大家已经多次听闻,DeepSeek R1 在 2025 年 1 月发布时引发了巨大反响。DeepSeek R1 是基于 DeepSeek V3 架构打造的推理模型,而 DeepSeek V3 架构 于 2024 年 12 月首次推出。

尽管本文的核心关注点是 2025 年发布的架构,但将 DeepSeek V3 纳入讨论是合理的 —— 它是在 2025 年 DeepSeek R1 推出后,才真正获得广泛关注与应用。

Continue reading 【转载】大语言模型架构全面对比01:DeepSeek V3/R1

【转载】Kimi K3 架构笔记

原文地址

Kimi K3 架构笔记

作者:Sebastian Raschka

本文整理了昨日重磅发布的开源权重模型 Kimi K3 的架构示意图,以及我个人的一些观察与思考。

1、诚然,它的结构看起来相对复杂,但本质上是去年发布的 Kimi Linear 模型的规模化生产版本 —— 参数量从 480 亿扩容至 2.8 万亿,K3 也是目前全球规模最大的开源权重模型。

Continue reading 【转载】Kimi K3 架构笔记

【转载】大语言模型架构全面对比14:Kimi Linear

原文地址 第14章 Kimi Linear

14. Kimi Linear

近年来,为提升大语言模型(LLM)的运行效率,线性注意力机制迎来了新一轮复兴。

2017 年《Attention Is All You Need》论文中提出的注意力机制(即缩放点积注意力),仍是当前大语言模型中应用最广泛的注意力变体。除传统的多头注意力外,它也衍生出了多种更高效的实现形式,例如分组查询注意力、滑动窗口注意力以及多头潜在注意力。

Continue reading 【转载】大语言模型架构全面对比14:Kimi Linear

【转载】大语言模型架构全面对比08:Kimi K2 and Kimi K2 Thinking

原文地址 第8章 Kimi K2 and Kimi K2 Thinking

8. Kimi K2 and Kimi K2 Thinking

Kimi K2 近期在 AI 领域引发了巨大反响:作为一款开源权重模型,它的性能表现极为突出。多项基准测试显示,其水平已与谷歌 Gemini、Anthropic Claude、OpenAI ChatGPT 等顶尖闭源模型不相上下。

一个值得关注的设计特点是,它采用了较新的 Muon 优化器 变体,而非行业通用的 AdamW。据我所知,这是 Muon 优化器首次在如此规模的生产级模型中替代 AdamW 落地(此前仅在最高 160 亿参数的模型上验证过可扩展性)。这一方案带来了表现优异的训练损失曲线,大概率是推动该模型登顶上述基准榜单的重要助力。

Continue reading 【转载】大语言模型架构全面对比08:Kimi K2 and Kimi K2 Thinking

【转载】大语言模型架构全面对比00:引言

最近在读Sebastian Raschka博士的文章,内容十分的详实,收获很多。

国内很多朋友没有读过,网络也有些受限,于是准备用LLM翻译成中文,自己读的时候,也方便一下其他有需要的伙伴。

本文只翻译了文章的引言部分,后续将把相同模型的内容,放到一起翻译,顺序和原文地址不太一样,主要是读起来更方便一些。如果你等不及,可以直接看英文原文(如果语言不是障碍,强烈推荐读原文):

原文地址

Continue reading 【转载】大语言模型架构全面对比00:引言

【转载】大语言模型研究论文:2026年精选清单(1-5月)

LLM Research Papers: The 2026 List (January to May),by Sebastian Raschka, on 2026-06-06

大语言模型研究论文:2026年精选清单(1-5月)

很多读者可能知道,我一直有个长期习惯:会持续整理一份研究论文清单,收录那些我想研读、复盘,或是未来写文章、做项目时会引用的文献。

去年我分享过两份整理好的论文清单,分别覆盖上半年(1-6 月)和下半年(7-12 月)。

不少读者反馈这些清单非常实用,因此我沿用同样的思路,整理了 2026 年上半年的新清单,收录了 2026 年 1 月至 5 月我标记的论文。

请注意,这并非今年所有发表论文的完整汇总 —— 每天都有大量论文发布,做完整汇总完全不现实。这份清单是基于我个人认为有趣、或与自身工作相关的论文筛选而成的精选参考列表。整理时我仔细核对了每篇论文的标题、摘要与主题定位,但坦白说,我也只深入精读了其中一部分。

为什么要做这些清单?每当我撰写文章、书稿章节、代码示例或是备课时,常会想起 “之前在哪看到过一篇相关论文”,但回头去找往往格外麻烦。一份分类清晰的 Markdown 清单就能解决这个问题,希望对你们也同样有用。(即便在如今大模型网页搜索的时代,一份有明确语境的专题清单依然很有价值。)

今年的清单依然偏重推理模型、强化学习与高效推理方向 —— 毕竟我个人更倾向于收藏和当前工作相关的论文。不过和 2025 年的清单相比,我也新增了更多关于智能体框架、工具调用、长上下文、扩散语言模型以及实际服务部署基础设施的论文,这既是我当下重点关注的方向,也是整个领域的发展趋势。

本研究论文清单分为以下类别。

  • 架构与模型设计

  • 高效训练与规模化

  • 推理效率与 KV 缓存

  • 稀疏注意力与长上下文

  • 推理与测试时计算

  • 强化学习与可验证奖励强化学习(RLVR)

  • 智能体系统与工具调用

  • 代码智能体与软件工程

  • 扩散语言模型

  • 模型评估与基准测试


1. 架构与模型设计

第一部分收录了模型架构相关论文、模型发布技术报告,以及有助于解释当前大语言模型形态成因的研究。

2026 年至今一个有意思的趋势是:架构研究不再局限于单纯放大 Transformer 规模,而是涌现了大量围绕以下方向的工作:

  • 混合架构(例如 Nemotron 3、Arcee Trinity)

  • 状态空间层(Nemotron 3 与 Mamba-3)

  • MoE 容量分配(《扩大嵌入层效果优于扩大专家层》、Step 3.5 Flash)

  • 激活行为(《尖峰、稀疏与汇点:大规模激活与注意力汇点剖析》)

  • 表征几何(《语言统计中的对称性塑造模型表征的几何结构》)

这些论文都很有价值,也是我最初收藏它们的原因。如果要选出一篇必读论文,我会推荐Nemotron 3 Super—— 这篇技术报告内容极其详实,介绍了一款已落地生产的模型所采用的技术,而且它是同参数级别中表现最好的模型之一。

Nemotron 3 的一大亮点是混合架构设计:它交替使用常规注意力层与 Mamba-2(状态空间模型)层,以此提升长上下文效率。2026 年,长上下文效率是核心命题 —— 越来越多大语言模型被接入智能体框架(如 OpenClaw 等),对上下文长度的要求越来越高。

诚然,120B-A12B 规格对于普通消费级硬件做本地推理来说可能偏大,但该系列也有 Nemotron 3 Nano(4B)版本。

image01

图 1:Nemotron-3 Super 架构,采用 Mamba-2 层的混合架构

补充说明:就在两天前,英伟达还发布了其放大版本 Nemotron 3 Ultra(550B-A55B),它扩大了嵌入层与投影维度,但基础构建模块保持一致。如果想看可视化示意图,我在 Substack Notes 上发过相关内容。

这种 “注意力层 + 替代层交替堆叠” 的混合架构趋势,是今年相当热门的发展方向。采用类似混合设计的开源大模型系列中,最知名的大概是 Qwen3.6—— 它在非注意力部分使用门控 DeltaNet 层,而非 Mamba-2 层。更多相关内容可以看我写的《混合注意力》专题文章,其中整合了我此前多篇 Substack 文章中关于这类架构的内容。

另外在下面的论文列表中你会发现,如今已经有了 Mamba-3 与门控 DeltaNet-2(即 Mamba-2 与门控 DeltaNet 的升级版本),很期待它们在后续开源大模型(比如 Nemotron-4、Qwen4?)中的落地应用。

除了混合架构设计之外,Nemotron-3 论文还包含大量其他有意思的消融实验,例如针对推测解码的多 token 预测、NVFP4 预训练对比 BF16、合成 MMLU 风格数据,以及训练后量化方案等等,但详细展开这些内容就超出本篇概览的范围了。


2. 高效训练与规模化

本部分聚焦训练系统、适配方法与规模化方案。这些论文并非全部围绕从零开始预训练,其中不少关注微调、蒸馏、测试时训练,或是在受限硬件上优化训练效果。

【以下为付费内容,请跳转至原文付费订阅,6$,两杯咖啡钱】
LLM Research Papers: The 2026 List (January to May),by Sebastian Raschka, on 2026-06-06

=== 以下为付费内容 ===

【转载】大语言模型架构最新进展:KV共享、mHC与压缩注意力

原文地址:Recent Developments in LLM Architectures: KV Sharing, mHC, and Compressed Attention,by Sebastian Raschka, 2025-05-16

大语言模型架构最新进展:KV共享、mHC与压缩注意力

从 Gemma 4 到 DeepSeek V4:开源大模型如何降低长上下文成本

短暂休假陪伴家人后,我很高兴回归,跟进这几周密集发布的开源大语言模型。其中最突出的一点是,新一代架构都将重心放在了长上下文效率优化上。

随着推理模型与智能体工作流需要保留更多 token(且保留时长更长),KV 缓存大小、内存带宽与注意力计算成本很快成为核心瓶颈。为此,大模型开发者正在引入越来越多的架构技巧来降低这些开销。

本文重点分析四个典型设计:Gemma 4 的 KV 共享与逐层嵌入、Laguna XS.2 的逐层注意力配额、ZAYA1-8B 的压缩卷积注意力,以及 DeepSeek V4 的流形约束超连接(mHC)+ 压缩注意力方案。

在我的架构示意图里,这些改动大多看起来只是微调,但其中不少是相当精巧的设计变更,值得展开详细讨论。


figure01

图 1 2026 年 4-5 月发布的主流开源大模型架构示意图。完整图片与更多细节可在我的大模型架构图库中查看。图中未列出所有模型尺寸;Qwen3.6 包含 27B 与 35B-A3B 版本,ZAYA1 以 8B 模型为代表(省略 ZAYA1-base 与 ZAYA1-reasoning-base 版本)。虚线框标注的架构将在本文中详细解读。

需要说明的是,本文聚焦架构设计,因此不会过多讨论数据集配比、训练调度、训练后优化、RLHF 方案、基准测试榜单与产品对比。即便限定了范围,内容依然十分丰富。和往常一样,这篇文章的篇幅最终超出了我的预期,因此我会把重点放在 Transformer 块、残差流、KV 缓存与注意力计算内部的改动上。

另外请注意,我只介绍那些具备创新性、且我此前未在其他文章中讲解过的设计。具体包括:

  • Gemma 4 的 KV 共享与逐层嵌入

  • ZAYA1 的压缩卷积注意力

  • Laguna XS.2 的注意力配额机制

  • DeepSeek V4 的 mHC 与压缩注意力

往期内容

在进入新主题之前,先列出两篇会反复引用的往期文章。第一篇系统介绍了近期 MoE 模型的架构背景、专家路由、激活参数与模型尺寸对比;第二篇覆盖了下文会频繁提到的注意力基础概念,包括 MHA、MQA、GQA、MLA、滑动窗口注意力、稀疏注意力与混合注意力设计。

  • 《大语言模型架构大盘点》,塞巴斯蒂安・拉施卡博士,2025 年 7 月 19 日
    最后更新:2026 年 4 月 2 日(第 23 节新增 Gemma 4)

  • 《现代大模型注意力变体可视化指南》,塞巴斯蒂安・拉施卡博士,3 月 22 日

我原本计划写 DeepSeek V4,但它至今尚未正式发布,于是我利用这段时间整理了过去几年讲解过的各类大模型架构,把它们系统化地梳理完善。

我还把其中不少知识点做成了独立的短篇教程,放在大模型架构图库中。例如读者可以在对应模型卡片与概念标签下,找到关于 GQA、MLA、滑动窗口注意力、DeepSeek 稀疏注意力、MoE 路由等概念的精简讲解。


1. 跨层复用 KV 张量以缩减缓存(Gemma 4)

我们的架构演进之旅从 4 月初说起 —— 当时谷歌发布了全新的开源 Gemma 4 系列模型。该系列主要分为三大类:

  • Gemma 4 E2B 与 E4B:面向移动端与小型本地(嵌入式)设备(即物联网场景)

  • Gemma 4 26B 混合专家(MoE)模型:面向高效本地推理优化

  • Gemma 4 31B 稠密模型:追求最高效果,且训练后优化更便捷(MoE 模型的调优复杂度更高)

figure02

图 2:Gemma 4 架构示意图

E2B 与 E4B 版本的第一个架构小改动,是采用了共享 KV 缓存机制:后续层复用前面层的键值状态,以此降低长上下文下的内存占用与计算量。

这种 KV 共享并非 Gemma 4 首创。例如 Brandon 等人在 NeurIPS 2024 发表的《通过跨层注意力缩减 Transformer 键值缓存》中就提出了该思路。但 Gemma 4 是首个将这一概念落地的主流架构。(注意:跨层注意力与交叉注意力是两个不同概念。)

在深入讲解 KV 共享之前,先简单说说背后的动机。正如我近几个月多次提到的,当前大模型架构设计的核心主题之一就是缩减 KV 缓存体积,而缩减 KV 缓存的根本目的是降低内存需求,从而支持更长的上下文 —— 这在推理模型与智能体时代尤为重要。关于 KV 缓存的更多背景,可参考我的文章《从零理解并实现大模型 KV 缓存》。

我在上一篇《现代大模型注意力变体可视化指南》中介绍的主流注意力变体,几乎都是为缩减 KV 缓存设计的。

举个经典例子(Gemma 4 也在使用):分组查询注意力(GQA)通过让多个查询头共享同一组键值(KV)头,来减小 KV 缓存体积,如下图所示。

figure03

图 3:分组查询注意力(GQA)在多个查询(Q)头之间共享同一组键(K)与值(V)头

如前所述,Gemma 4 采用了 GQA。但除此之外,它还进一步在不同层之间共享 KV 投影,而非每层的注意力模块都独立计算 KV。这种 KV 共享机制也被称为跨层注意力,原理如下图所示。

figure04

图 4:常规 Transformer 块在每个注意力模块中独立计算 Q、K、V 投影(左);跨层注意力设计在多层之间共享同一组 K、V 投影(右)

正如图 2 架构概览所暗示的,Gemma 4 E2B 采用常规 GQA,并以 4:1 的比例搭配滑动窗口注意力。(更准确地说,Gemma 4 E2B 使用的是 MQA,即 GQA 单 KV 头的特例。)

在 GQA(或 MQA)基础上,KV 共享的运行逻辑是:后续层不再独立计算自身的键值投影,而是复用同类型注意力中最近一个非共享层的 KV 张量。也就是说,滑动窗口层复用前一个滑动窗口层的 KV,全注意力层复用前一个全注意力层的 KV。各层依然会独立计算查询投影,因此每层都能形成自己的注意力模式,但开销大、占内存的 KV 缓存可以在多层之间复用。

举例来说,Gemma 4 E2B 共有 35 个 Transformer 层,其中仅前 15 层独立计算 KV 投影,后 20 层复用同类型注意力中最近非共享层的 KV 张量。类似地,Gemma 4 E4B 有 42 层,其中 24 层独立计算 KV,最后 18 层共享 KV。

这种设计到底能省多少?由于约一半的 KV 在层间共享,KV 缓存体积大约能减少一半。以最小的 E2B 模型为例,在 128K 长上下文、bfloat16 精度下,可节省 2.7GB 显存(E4B 版本在 128K 上下文下约节省 6GB)。

figure05

图 5:类 Gemma 4 E2B 配置下,GQA 与跨层 KV 共享带来的 KV 缓存显存节省。为简化示意,未计入滑动窗口注意力的额外节省

当然,KV 共享的缺点也很明显:它本质是对完整注意力的 “近似”,或者更准确地说,会降低模型容量。不过根据跨层注意力论文的结论,(在已测试的小模型上)这种影响可以非常微弱。


2. 逐层嵌入与 “有效” 参数量(Gemma 4 E2B/E4B)

Gemma 4 E2B 与 E4B 还有第二项效率导向的设计,叫做逐层嵌入(Per-Layer Embeddings, PLE),它和前面的 KV 共享是相互独立的机制。

KV 共享用于缩减 KV 缓存,而 PLE 聚焦于参数效率:它让小型 Gemma 4 模型能够利用更多 token 专属信息,同时不会让 Transformer 主干的计算成本膨胀到同总参数量稠密模型的水平。

例如,Gemma 4 E2B 与 E4B 中的 “E” 代表 “有效(effective)”。具体来说,Gemma 4 E2B 标注的有效参数量为 23 亿,若计入嵌入层则总参数量为 51 亿;同理,Gemma 4 E4B 有效参数量为 45 亿,含嵌入层总参数量为 80 亿。

简而言之,“E” 系列模型的 Transformer 主干计算量接近较小的有效参数量,而更大的数字包含了额外的嵌入表层。(关于嵌入层的工作原理,可参考我的代码笔记《理解嵌入层与线性层的区别》。)

从概念上看,新增的 PLE 路径如下:

figure06

图 6:带 PLE 残差路径的简化 Gemma 4 块。常规块先计算注意力与前馈网络的残差更新,得到的隐状态对层专属 PLE 向量做门控,再将投影后的 PLE 更新作为额外残差项加在块末尾

PLE 向量本身在重复的 Transformer 块之外预先构造。简化来看,PLE 的生成有两个输入:其一,token ID 经过逐层嵌入查表;其二,常规 token 嵌入经过线性投影,映射到同一个打包后的 PLE 空间。两部分相加、缩放并重塑为张量,每层对应一个切片,每个 Transformer 块获取自己的那一片。

figure07

图 7:PLE 构造简化示意。token ID 提供逐层嵌入查表,常规 token 嵌入投影到同一空间,两者结合后重塑,使每个 Transformer 块获得专属的层 PLE 切片

关键细节在于:PLE 并不是给每个 Transformer 块都配一套完整独立的常规 token 嵌入层,而是只做一次逐层嵌入查表,再通过 “重塑 / 选取第 l 层” 的方式,给每层分配一小段 token 专属嵌入切片。

也就是说,对每个输入 token,Gemma 4 会生成一个打包的 PLE 张量,其中每个解码层对应一个小向量。在前向传播时,第 l 层只读取自己对应的切片(即图 6 中 Gemma4WithPLEBlock 里的 ple_l)。

在 Transformer 块内部,常规的注意力与前馈分支照常运行:块先计算注意力残差更新,再计算前馈残差更新;在第二次残差相加后,得到的隐状态(图 6 伪代码中记为 z)用于对层专属 PLE 向量做门控。经过门控的 PLE 向量再投影回模型隐层维度,做归一化后,作为额外的残差项相加。

可以这样直观理解:Transformer 块的主干依然是注意力 + 前馈网络的主路径,而 Gemma 4 在前馈分支之后追加了一个小型的层专属 token 向量。它通过嵌入参数与小型投影提升表征能力,只增加少量计算开销,避免了把整个 Transformer 栈都扩容到大参数量级的成本。

为什么要做 PLE?更简单的方案是直接缩小稠密模型,比如减少层数、收窄隐状态或缩小前馈网络。这确实能降低显存与延迟,但也会削弱模型核心计算部分的容量。

PLE 设计让高成本的 Transformer 块保持在较小的 “有效” 规模,同时把额外容量放在逐层嵌入表中。这些嵌入参数以查表为主,可被缓存,成本远低于新增注意力或前馈网络权重。

当然,这一设计的有效性还需以谷歌的实验为准。如果能有对比研究,看看 E2B 设计与常规 23 亿、51 亿参数量的 Gemma 4 模型表现差异,会很有参考价值。

另外,PLE 原则上并不局限于小模型,大模型也可以附加逐层嵌入切片。但大模型本身容量已经充足,这些额外嵌入的增益可能有限;而且对于大模型,我们通常用 MoE 设计来提升容量、同时控制计算规模。

顺便一提,如果想看相对简洁易读的代码实现,我从零实现了 Gemma 4 E2B 与 E4B 模型,可在这里查看。

figure08

图 8:我从零实现的 Gemma 4 代码截图


3. 逐层注意力配额(Laguna XS.2)

Laguna 是欧洲公司 Poolside 推出的首个开源模型,该公司专注于训练代码领域大模型。我有几位前同事近年加入了 Poolside,团队实力很强。看到更多企业开源自家模型,是件值得高兴的事。

乍看之下,Laguna XS.2 的架构非常标准,但有一个细节我没在图里塞进去,我们可以称之为 “逐层注意力配额”。

figure09

图 9:Poolside 的 Laguna XS.2 架构

注意力配额的核心思路是:不给每个 Transformer 层分配完全相同的注意力预算,而是让不同层的注意力开销有所差异。该模型共 40 层,其中 30 层为滑动窗口注意力,10 层为全局 / 全注意力。和通常设计一样,滑动窗口层只在局部窗口内做注意力(此处窗口为 512 token),因此 KV 缓存与注意力计算成本更低;全局层成本更高,但保留了访问上下文窗口内全部信息的能力。

这种滑动窗口 + 全局 / 全注意力的混合模式并非 Laguna XS.2 独有,Gemma 4 等很多架构都在使用。

真正的创新点在于每层查询头数量可调。例如 Hugging Face 模型库的 config.json 里有num_attention_heads_per_layer配置项,允许不同层拥有不同数量的查询头,同时保持 KV 缓存的形状兼容。

figure10

图 10:Laguna 的逐层查询头配额:全注意力层每个 KV 头对应 6 个查询头,滑动窗口注意力层每个 KV 头对应 8 个查询头

也就是说,Laguna XS.2 给滑动窗口层分配更多查询头,给全局层分配更少查询头,同时 KV 头固定为 8 个 —— 这就是配置文件里真正的逐层头配额机制。

Laguna XS.2 是近期生产级开源模型中,逐层查询头配额设计最具代表性的案例。但 “按层调整模型容量” 这一思路,至少可以追溯到苹果 2024 年的 OpenELM。

再说回这种设计的意义:和 KV 共享类似,核心是把注意力容量用在最有价值的地方,而非每层平均分配。具体来说,全注意力层需要遍历整个上下文,成本很高,因此 Laguna 相比滑动窗口注意力模块,给它们分配了更少的查询头。

(补充一个小实现细节:Laguna 还对每个注意力头的输出做门控,这和 Qwen3-Next 等模型的设计有些相似。由于我在往期文章中已经讲过,这里就不再展开。)


4. 压缩卷积注意力(ZAYA1-8B)

和 Laguna 类似,ZAYA1-8B 是开源模型赛道的新选手,由 Zyphra 公司开发。这次发布的一个有意思的细节是:该模型是在 AMD GPU 上训练的,而非更主流的 NVIDIA GPU 或谷歌 TPU。

而它最核心的架构特点,是压缩卷积注意力(CCA)与分组查询注意力结合使用。和 MLA 类设计主要用潜表征作为紧凑 KV 缓存格式不同,CCA 直接在压缩后的潜空间内完成完整的注意力运算,后文会详细说明。

(注:ZAYA1-8B 的 config.json 里列出了 80 个交替的层条目,而非传统的 40 个 Transformer 块。这些条目在 CCA/GQA 注意力层与 MoE 前馈层之间交替。但在架构图中,更方便的画法是 40 个重复的 “注意力 + MoE” 单元,两者在概念上是等价的。)

figure11

图 11:Zaya1(8B)的 Transformer 块采用压缩卷积注意力

正如图中所示,ZAYA1-8B 将压缩卷积注意力(CCA)与 4:1 比例的 GQA 结合使用。核心在于它的注意力块以 CCA 为核心,而非常规的滑动窗口注意力块。

什么是压缩卷积注意力?

我认为 CCA 在思路上和 DeepSeek 模型的多头潜注意力(MLA)相近 —— 两者都在注意力块中引入了压缩的潜表征,但对潜空间的使用方式不同。MLA 主要用潜表征来减小 KV 缓存:KV 张量以紧凑形式存储,在实际计算注意力时再投影到注意力头空间。

figure12

图 12:常规多头注意力(MHA)与多头潜注意力(MLA)对比

而 CCA 会对 Q、K、V 全部做压缩,并且直接在压缩后的潜空间内执行注意力运算。这也是为什么 CCA 不仅能缩减 KV 缓存体积,还能降低预填充与训练阶段的注意力浮点运算量(FLOPs)。

图 13:多头潜注意力(MLA)与压缩卷积注意力(CCA)对比

figure13

如图 13 所示,在 CCA 中,压缩后的潜表征直接输入注意力机制,得到的压缩注意力向量再做上投影。

注意它之所以叫 “压缩卷积注意力” 而非单纯的 “压缩注意力”,是因为在潜空间的 K、Q 表征上还额外做了卷积混合。图 12 里没画出卷积混合部分,不然画面会太挤,但原理并不复杂。

正如图 13 暗示的,卷积混合直接作用在压缩后的 Q、K 张量上。压缩会让 Q、K、V 的维度变窄,从而节省计算与缓存,但也会降低注意力的表达能力。卷积是一种低成本方式,能在压缩后的 Q、K 向量用于计算注意力分数之前,给它们补充局部上下文信息。(卷积混合只作用于 Q 和 K,不作用于 V—— 因为 Q 和 K 决定注意力分数,而 V 是通过分数加权求和的内容。)

figure14

图 14:序列混合卷积的概念示意

除了图 14 的序列混合,还有通道混合组件,原理类似,这里就不放图了。

CCA 看起来是 Zyphra 提出的注意力机制,在 ZAYA1-8B 技术报告发布之前就已存在。独立的 CCA 论文《压缩卷积注意力:在压缩潜空间中实现高效注意力》于 2025 年 10 月首次发布,正式提出了 CCA 机制,而 ZAYA1-8B 将其作为核心组件之一。

但问题来了:它比 MLA 更好吗?根据 CCA 论文的实验结果,是的 —— 在同等压缩比例下,CCA 的表现优于 MLA。

figure15

图 15:CCA 论文配图标注,来源:https://arxiv.org/abs/2510.04476

总的来说,最值得关注的就是这种新型注意力机制。该模型还采用了非常极端(极高稀疏度)的 MoE 配置,每个 token 仅激活一个路由专家,但这部分设计我们更熟悉。CCA 的特别之处在于,它直接在压缩潜空间内执行注意力运算,并通过对压缩 Q、K 做卷积混合来缓解压缩带来的表达力限制。简言之,ZAYA1-8B 不仅在前馈层省计算,也在注意力机制本身做优化。


5. CSA/HCA、mHC 与压缩注意力缓存(DeepSeek V4)

DeepSeek V4 是今年迄今为止热度最高、模型规模最大的发布。有意思的是,在下表的所有模型中,DeepSeek V4-Pro 也是激活参数占比最低的 MoE 模型。

figure16

图 16:MoE 模型激活参数占比图。可在此查看 HTML 版本:https://sebastianraschka.com/llm-architecture-gallery/active-parameter-ratio/

注:激活参数占比只是观察维度之一,它无法反映 KV 缓存大小、注意力模式、上下文长度、路由开销、硬件效率与训练质量,但用于快速对比稀疏模型很有帮助。

关于 DeepSeek V4 可以聊的内容很多,但既然它已经被大量报道,且本文聚焦架构微调,我会重点讲两个相比前代架构的全新核心改动:

  • 用于拓宽残差通路的 mHC

  • 用于长上下文注意力压缩与稀疏化的 CSA/HCA

看下面的 DeepSeek V4 架构图,会觉得设计很复杂。理解它的有效方式是:把残差路径的改动(mHC),与注意力路径的改动(CSA/HCA、压缩注意力缓存)分开来看。

figure17

图 17:DeepSeek V4-Pro 架构概览

5.1 流形约束超连接(mHC)

先从 DeepSeek V4 的 mHC 组件说起。这项技术源自 DeepSeek 团队去年(2025 年 12 月 31 日)发布的研究论文《mHC:流形约束超连接》。不过在那篇论文中,该技术仅在 27B 规模的实验模型上验证过,如今出现在他们的旗舰产品中,说明这一思路在生产环境中表现良好。

mHC 的核心思路,是对 Transformer 块内部的残差连接设计做现代化改造 —— 这一点很有新意,因为架构微调通常都集中在注意力机制、归一化层位置与 MoE 部分。

mHC 建立在先前的超连接(Hyper-Connections)研究基础上(Zhu 等人 2024 年提出),我们先简单介绍一下超连接。超连接本质上是对 Transformer 块内单条残差流的改造:将其替换为多条并行残差流,并在流之间加入可学习的映射。

(对残差连接不熟悉的读者,可以看我多年前做的残差神经网络视频,里面讲解了基本原理。)

超连接的核心目标是拓宽残差流。我们可以把它理解为保留多条并行残差流,再通过额外的残差映射线性变换在层间混合这些流。由于注意力或 MoE 层本身仍在常规隐层维度上运算,超连接还会加入前置映射,把多条并行残差流合并为单个常规隐向量输入给层;再加后置映射,把层的输出重新分发回各条并行残差流。整体结构如下图所示。

figure18

图 18:常规 Transformer 块(上)与带超连接的 Transformer 块(下),图标注来自 mHC 论文:https://arxiv.org/abs/2512.24880

下图聚焦于 Transformer 块的注意力部分,但同样的概念也适用于 MoE 层周围的第二条残差分支。

超连接的作用是:在不拓宽注意力或 MoE 层本身的前提下,提升残差通路的表达能力。它带来的浮点运算增量很小,因为额外的映射只在残差流维度上运算 —— 比如 DeepSeek V4 中 n=4 条残差流,而非巨大的隐层维度。

在原始超连接论文中,7B OLMo MoE 实验里,每 token 浮点运算量从 133.6 亿仅增加到 133.8 亿,几乎没有变化。而效果方面,模型获得了稳定且小幅的提升,如下图所示。

(不过只看浮点运算量有些片面。拓宽后的残差状态依然需要存储、在内存中搬运、做混合等。因此实际开销更多来自内存带宽与实现复杂度,而非算术运算本身,这一点没有被明确测量。但考虑到 DeepSeek V4 全程主打效率,说明这项设计的收益值得投入。)

figure19

图 19:超连接相比基线的性能表现,图标注来自超连接论文:https://arxiv.org/abs/2409.19606

另外如图所示,模型仅用约一半的训练 token 数,就追平了基线模型的指标。

从常规超连接(HC)到流形约束超连接(mHC),核心变化是:映射不再是无约束的。在常规 HC 中,残差映射是一个可学习矩阵,负责混合并行残差流;但堆叠大量这样的矩阵,可能导致信号被不可控地放大或缩小。

而在 mHC 中,残差映射被投影到双随机矩阵构成的流形上 —— 即所有元素非负,且每行、每列的和均为 1。这让残差混合更像是在各流之间稳定地重新分配信息。前置映射与后置映射也被约束为非负有界,避免从拓宽的残差状态中读写时出现信号抵消。简言之,mHC 保留了 HC 丰富的残差混合能力,同时加入约束以提升可扩展性,这对更大(更深)的模型尤为重要。

除此之外,并行残差流的核心思路保持不变,如下图所示。

figure20

图 20:带超连接(HC)与流形约束超连接(mHC)的 Transformer 块,图标注来自 mHC 论文:https://arxiv.org/abs/2512.24880

在 mHC 论文中,DeepSeek 团队基于 27B 参数模型实验,经过融合、重计算与流水线调度优化后的实现,在所有 Transformer 块中采用 4 条残差流(n=4)时,相比单流基线仅增加 6.7% 的训练时间开销。

总结一下这部分:HC/mHC 改变了层之间的信息传递方式 —— 将单条残差流替换为多条相互作用的残差流,mHC 在此基础上增加了稳定性约束,同时计算开销极低。而且它和 CSA/HCA 注意力改动可以很好地搭配,后者改造的是 Transformer 块的其他部分,我们接下来会讲。

5.2 通过 CSA 与 HCA 实现压缩注意力

DeepSeek V4 另一项重大架构改动在注意力侧。同样,背后的动机是:当上下文极长时,注意力的高昂成本不仅来自注意力分数计算,也来自 KV 缓存随序列长度增长。DeepSeek V4 通过两种压缩注意力机制的混合方案来解决这个问题:压缩稀疏注意力(Compressed Sparse Attention, CSA)与重度压缩注意力(Heavily Compressed Attention, HCA)。

如果需要复习背景,推荐看我之前的《现代大模型注意力变体可视化指南》,其中讲解了多头潜注意力(MLA)、DeepSeek 稀疏注意力(DSA)等内容。

首先要明确:DeepSeek V4 的 CSA/HCA,和 DeepSeek V2/V3 使用的 MLA 式压缩不是同一类压缩。MLA 主要压缩每个 token 的 KV 表征,而 CSA 与 HCA 是沿序列维度做压缩。也就是说,它们不再为每个历史 token 保留一条完整(或压缩)的 KV 条目,而是将成组的 token 汇总为更少的压缩 KV 条目,从而缩短缓存长度。

DeepSeek V4 也使用了紧凑的压缩条目与共享 KV 注意力,但和 MLA 最核心的区别是对序列长度的压缩,如下图所示。

figure21

图 21:MLA 式每 token 潜缓存、CSA 与 HCA 的概念对比。MLA 压缩存储的 KV 表征,但每个 token 保留一条潜条目;CSA 以 m=4 的比例做轻度序列压缩 + 稀疏 Top-K 选择;HCA 以 m’=128 的比例做重度序列压缩,并在缩短后的缓存上做稠密注意力

CSA/HCA 的效果权衡也和 MLA 不同。如图所示,MLA 压缩每个 token 存储的表征,但仍为每个 token 保留一条潜 KV 条目;CSA、尤其是 HCA 更进一步,直接减少序列条目数量,模型牺牲部分 token 级信息,换取大幅降低的长上下文成本。

归根结底都是为了降低长上下文开销,但压缩过度会损害建模质量,因此 DeepSeek V4 没有单一依赖某一种压缩方案,而是在 CSA 与 HCA 之间交替使用。CSA 压缩比例更温和,搭配 DeepSeek 稀疏注意力(DSA)式的选择器;HCA 压缩强度大得多,以更低成本实现全局覆盖;两者都保留了局部滑动窗口分支,用于处理近期未压缩的 token。CSA 中的稀疏选择机制建立在 DeepSeek 稀疏注意力(DSA)基础上,我在之前的 DeepSeek V3.2 解读中做过详细讲解。

HCA 是两者中更激进的变体:它将每 128 个 token 压缩为一条 KV 条目,但随后在这些重度压缩的条目上做稠密注意力。换言之,CSA 保留更多细节但采用稀疏选择,HCA 保留的条目少得多,因此可以承受稠密注意力计算,如下图所示。两种机制形成互补,这也是 DeepSeek V4 交替堆叠 CSA 与 HCA 层,而非只使用其中一种的原因。

figure22

图 22:CSA 选择稀疏的压缩历史块集合,HCA 则在重度压缩后的块上做稠密注意力。两条路径都通过 128 token 滑动窗口分支,保留近期未压缩的 KV 条目

DeepSeek V4 论文报告:在 100 万 token 上下文长度下,相比采用 MLA 与 DeepSeek 稀疏注意力(DSA)的 DeepSeek V3.2,DeepSeek V4-Pro 的单 token 推理浮点运算量仅为前者的 27%,KV 缓存体积仅为 10%;DeepSeek V4-Flash 则更极致,运算量与 KV 缓存分别仅为 V3.2 的 10% 与 7%。

figure23

图 23:DeepSeek V4 论文报告的 100 万上下文效率数据,以 DeepSeek V3.2 为基准

顺便一提,我不会笼统地说 CSA/HCA “优于” MLA。CSA/HCA 是更激进的长上下文优化设计,而且实现复杂度肯定更高。遗憾的是论文中没有做消融实验。不过整体来看,论文报告了出色的建模效果:DeepSeek V4-Flash-Base 在多数基础模型基准上超越 DeepSeek V3.2-Base,100 万 token 检索表现也很强;但这些结果是 DeepSeek V4 完整方案的综合效果,其中还包括更优的数据、Muon 优化器、mHC、精度 / 存储优化以及训练 / 推理系统的改进。

就目前而言,我认为 CSA/HCA 是一种以效率为核心的长上下文设计,在他们的大型旗舰模型中能很好地保留建模质量,但未必在所有场景下都普遍优于 MLA。


6. 结论

总的来说,今年一个值得关注的趋势是:多数新开源模型都在努力降低长上下文推理成本,而不是单纯缩减模型总参数量。例如:

  • Gemma 4 通过跨层 KV 共享降低 KV 缓存显存占用,并通过逐层嵌入提升模型容量;

  • Laguna XS.2 精细化调配每层的注意力容量;

  • ZAYA1-8B 将注意力运算迁移到压缩潜空间;

  • DeepSeek V4 加入了约束化的残差流混合,以及压缩长上下文注意力。

所有这些微调都让架构变得更复杂 —— 这似乎也是当前大模型架构的发展方向。

我的核心感受是:Transformer 块仍在演进,但都是相当有针对性的优化。基本框架依然建立在原始 GPT 纯解码 Transformer 架构之上,但很多部件都得到了升级或替换,越来越向长上下文、高效推理的方向专门化;而模型的定性表现,似乎主要由数据质量(与数量)以及训练策略决定。

过去很多人问我,Transformer 会不会、或者什么时候会被其他架构取代。当然,扩散模型等其他设计确实存在,但在当前最先进的架构发布中,Transformer 依然是主流。

不过,随着每一轮发布都带来越来越多的微调设计,实现的复杂度也在攀升。过去用 50-100 行 PyTorch 代码就能写出一个基础 Transformer 块,而如今这些优化(尤其是注意力变体)大概让代码复杂度翻了 10 倍。这本身未必是坏事 —— 因为这些优化降低了(而非提升了)运行时成本。但想要清晰理解每个组件及其相互作用,正变得越来越困难。

figure24

图 24:从 GPT-2(2019)到 DeepSeek V4-Pro(2026)的演进

例如,我敢肯定,初次接触大模型架构的人看到 DeepSeek V4 的源码时,一定会感到完全无从下手。但如果从原始解码式大模型(GPT/GPT-2)起步,再逐步逐个学习这些新增组件,学习难度就会可控很多。我想,道理就是:保持学习,逐个吃透每一种架构。