【转载】大语言模型架构全面对比23:Gemma 4

原文地址 第23章 Gemma 4

23. Gemma 4

继 3 月 Nemotron 3 Super 发布后,当月剩余时间里旗舰开源权重模型的发布节奏相对平缓。我仍在等待 DeepSeek-V4 的推出,而 4 月至少迎来了谷歌的 Gemma 4。

架构层面,如下图所示,310 亿参数的 Gemma 4 与 270 亿参数的 Gemma 3 相比几乎没有改动。

figure58

图 58:Gemma 3(27B)与 Gemma 4(31B)架构并排对比
(注:Gemma 4 现已支持多模态能力,但图像编码器部分我会留到未来单独撰文介绍;本文仅聚焦文本模型部分。)

从上图可以看出,Gemma 4 保留了相对独特的前后归一化设计,整体架构仍偏经典,采用 5:1 比例的混合注意力机制,由滑动窗口(局部)层与全注意力(全局)层组合而成,注意力本身也仍是经典的分组查询注意力(GQA)。

不过,Gemma 4 相比 Gemma 3 有一处极易被忽略的细微改动:在全局(全量)注意力层中,对注意力机制的键做了复用 —— 也就是将值向量设为与键向量完全相同,这一设计能进一步压缩 KV 缓存的体积。

此外,Gemma 4 还采用了部分旋转位置编码(p-RoPE),仅 25% 的频率对承载位置信息,有助于减少长上下文场景下的位置噪声。

但我们不能因为架构上没有大刀阔斧的改动就低估它的提升。从基准测试成绩来看,Gemma 4 相比 Gemma 3 实现了巨大的性能飞跃。例如在 AI Arena 排行榜上,310 亿参数的 Gemma 4 排名与参数量远大于它的 Qwen3.5-397B-A17B 相近。不过正如我在模型评测文章中讨论过的,竞技场评分存在一定局限性:容易被针对性优化,且结果更偏向人类的风格偏好。

《从零理解大语言模型评测的 4 种主流方法》

但从下图我整理的其他主流基准测试结果来看,它相比 Gemma 3 的提升十分明确,整体性能与 Qwen3.5 27B 基本持平。

figure59

图 59:Gemma 3、Gemma 4 与 Qwen3.5 性能对比(数据取自 Gemma 4Qwen3.5 的模型官方主页)

值得一提的是,Gemma 4 还有混合专家(MoE)版本,下图将它与同规模的 Qwen3 模型做了对比。

figure60

图 60:Qwen3 Coder Flash 与 Gemma 4 MoE 架构对比

如上图所示,二者的技术路线较为相近,核心区别仅在于 Gemma 4 采用了前文提到的独特前后归一化排布。

从基准成绩来看,Gemma 4 MoE 版本的总参数量比稠密版 Gemma 4(31B)少 40 亿,但二者的实际性能相差不大。

figure61

图 61:Gemma 4 MoE(26B-A4B)的表现仅略逊于稠密版 Gemma 4(31B)

【转载】大语言模型架构全面对比03:Gemma 3

原文地址 第3章 Gemma 3

3. Gemma 3

谷歌推出的 Gemma 系列模型一直表现优异,在我看来,和 Llama 系列等热门模型相比,它的市场热度始终被有所低估。

Gemma 的一大鲜明特征是词表规模较大,以此更好地支持多语言;同时产品线更侧重 270 亿参数规格,而非 80 亿或 700 亿档位。不过需要说明的是,Gemma 2 也提供更小的参数版本:10 亿、40 亿和 120 亿。

270 亿这个规格刚好卡在非常理想的平衡点:能力远强于 80 亿参数模型,资源消耗又远低于 700 亿参数模型,在我的 Mac Mini 上就能顺畅本地运行。

那么 Gemma 3 还有哪些值得关注的设计?如前文所述,DeepSeek V3/R1 等模型采用混合专家(MoE)架构,在模型总规模固定的前提下降低推理时的内存占用 —— 后文要介绍的多款模型也都沿用了 MoE 方案。
而 Gemma 3 选择了另一种技术路径来压缩计算成本:滑动窗口注意力

3.1 滑动窗口注意力

滑动窗口注意力最早于 2020 年在《LongFormer》论文中提出,Gemma 2 也已采用该技术。借助滑动窗口注意力,Gemma 3 团队大幅降低了 KV 缓存的内存占用,如下图所示。

figure11

图 11:摘自 Gemma 3 论文(https://arxiv.org/abs/2503.19786)的标注图,展示滑动窗口注意力带来的 KV 缓存内存节省效果

那么什么是滑动窗口注意力?如果把常规自注意力视为全局注意力机制 —— 序列中每个 token 都能访问其他所有 token—— 那么滑动窗口注意力就属于局部注意力,它会限制当前查询位置周围的上下文范围,如下图所示。

figure12

图 12:常规注意力(左)与滑动窗口注意力(右)对比

需要说明的是,滑动窗口注意力既可搭配多头注意力,也可搭配分组查询注意力;Gemma 3 采用的是分组查询注意力。

如上文所说,滑动窗口注意力也叫局部注意力,因为窗口会围绕当前查询位置并随之移动。与之相对,常规注意力是全局的,每个 token 都能访问全部其他 token。

前文简要提到,前代 Gemma 2 的架构也已经使用了滑动窗口注意力。Gemma 3 的变化在于,调整了全局(常规)注意力与局部(滑动)注意力的比例。

比如,Gemma 2 采用混合注意力机制,滑动窗口(局部)注意力与全局注意力按 1:1 比例混合,每个 token 可访问邻近 4k token 的窗口上下文。

Gemma 2 是每隔一层使用一次滑动窗口注意力,而 Gemma 3 将比例调整为 5:1—— 即每 5 层滑动窗口(局部)注意力,才搭配 1 层全量注意力;此外,滑动窗口的大小也从 Gemma 2 的 4096 缩小到了仅 1024。这种设计让模型更偏向高效的局部计算。

根据团队的消融实验,使用滑动窗口注意力对建模性能的影响极小,如下图所示。

figure13

图 13:摘自 Gemma 3 论文(https://arxiv.org/abs/2503.19786)的标注图,展示滑动窗口注意力对大语言模型生成结果的困惑度几乎没有影响

滑动窗口注意力是 Gemma 3 最核心的架构特点,不过承接上一节 OLMo 2 的内容,我也想简单聊聊它的归一化层排布设计。

3.2 Gemma 3 的归一化层排布

有个细节很有意思:Gemma 3 在其分组查询注意力模块的前后,同时使用了前置与后置两种 RMSNorm。

这一点和 Gemma 2 一脉相承,但依然值得单独拎出来说 —— 它既不同于《Attention Is All You Need》中原生 Transformer 的后归一化,也不同于 GPT-2 带火、后续大量架构沿用的前归一化,更和我们前面看到的 OLMo 2 的后归一化变体有区别。

figure14

图 14:OLMo 2 与 Gemma 3 的架构对比;注意 Gemma 3 中额外的归一化层

我认为这种归一化层排布的思路很直观,相当于兼顾了前归一化与后归一化的优势。在我看来,多做一点归一化总归没坏处。最坏的情况无非是额外的归一化存在冗余,带来一点低效的开销。但实际上,RMSNorm 在整体计算中成本很低,基本不会造成可感知的影响。

3.3 Gemma 3 小结

Gemma 3 是一款性能优秀的开源权重大语言模型,在我看来,它在开源社区的价值有些被低估。其最核心的亮点是采用滑动窗口注意力来提升效率,未来如果能和 MoE 结合会很值得期待。

此外,Gemma 3 的归一化层排布也很有特点,在注意力与前馈网络模块的前后都设置了 RMSNorm 层。

3.4 补充:Gemma 3n

在 Gemma 3 发布数月后,谷歌推出了 Gemma 3n。这是针对小型设备效率优化的 Gemma 3 模型,目标是能够在手机端运行。

为了实现更高的效率,Gemma 3n 的一项改动是引入了 \\ 逐层嵌入(Per-Layer Embedding, PLE)\\ 参数层。核心思路是只将模型的部分参数保留在 GPU 显存中,而文本、音频、视觉等模态的、与 token 层相关的特定嵌入,则按需从 CPU 或固态硬盘中流式加载。

下图展示了 PLE 带来的显存节省效果,图中标注标准 Gemma 3 模型有 54.4 亿参数,这大概率对应的是 Gemma 3 40 亿参数版本。

figure15

图 15:摘自谷歌 Gemma 3n 官方博客的标注图,展示 PLE 的显存节省效果https://developers.googleblog.com/en/introducing-gemma-3n/

之所以会出现 54.4 亿与 40 亿参数的数值差异,是因为谷歌统计大语言模型参数量的方式比较特别:他们通常会排除嵌入层参数,让模型看起来参数更少;但像这种需要凸显优化效果的场景,又会把嵌入层算进去,让基数显得更大。这种做法并非谷歌独有,已经成了行业内的普遍操作。

另一项有意思的技术是MatFormer,即「套娃 Transformer」的缩写。举例来说,Gemma 3n 采用单一共享的大语言模型(Transformer)架构,但可以「切分」出多个更小的、可独立使用的模型。每个切片都经过独立训练,推理时我们只需要运行对应规模的部分即可,无需加载完整的大模型。

【转载】大语言模型架构全面对比19:Xiaomi MiMo-V2-Flash

原文地址 第19章 Xiaomi MiMo-V2-Flash

19. 小米 MiMo-V2-Flash

2025 年 12 月又诞生了一款表现亮眼的模型。小米发布了全新的小米 MiMo-V2-Flash,其基准测试成绩与 DeepSeek V3.2 持平,但总参数量仅为后者的一半,推理速度也更快。这是一款总参数量 3090 亿的混合专家(MoE)模型,每个 token 的激活参数量为 150 亿。

有意思的是,它采用滑动窗口注意力(SWA)与全局(常规)注意力按 5:1 比例混合的设计,与 Gemma 3 的思路类似(见第 3 节)。不过它的滑动窗口尺寸设置得更为激进,仅为 128,是 Gemma 3(1024)的八分之一。

figure52

图 52:基准性能相近的小米 MiMo-V2-Flash 与 DeepSeek V3.2 对比

据我所知,这是目前规模最大的滑动窗口注意力模型。

此外,这款小米模型还采用了多 Token 预测(MTP)技术,具体介绍详见 12.3 节。

【转载】大语言模型架构全面对比13:MiniMax-M2

原文地址 第13章 MiniMax-M2

13. MiniMax-M2

近期,各开源大语言模型厂商纷纷推出了面向效率优化的核心架构变体。例如上一节介绍的 Qwen3-Next,用高速门控 DeltaNet 模块替换了部分全注意力块;再如 DeepSeek V3.2 采用了稀疏注意力 —— 这是一种线性注意力变体,以牺牲部分建模性能为代价换取计算性能的提升(后续我会专门撰文详细介绍该机制)。

MiniMax-M1 也属于这类效率优化的模型路线,它采用的闪电注意力(lightning attention)是一种线性注意力变体,效率高于常规全注意力。我最初没有专门介绍 MiniMax M1,因为它的知名度不及本文讨论的其他部分模型。但全新发布的 MiniMax-M2 目前被认为是性能最强的开源权重模型(按基准测试成绩衡量),分量十足,不容忽视。

figure37

图 37:MiniMax-M2 与其他主流开源、闭源大语言模型的基准性能对比。图片取自官方模型库发布说明文档。

如下图总览所示,我将 MiniMax-M2 归为常规解码器式 Transformer 大语言模型,因为它没有沿用 MiniMax-M1 提出的高效闪电注意力变体。开发团队反而回归了全注意力方案,大概率是为了提升建模(以及基准测试)性能。

figure38

图 38:本文涵盖的主流大语言模型时间线,以及部分效率优先的注意力混合模型(后者以牺牲部分建模性能为代价换取效率提升)。

整体来看,MiniMax-M2 与 Qwen3 的相似度高得出人意料。除了层数、维度等规模参数不同,二者的核心组件基本一致。

13.1 逐层 QK 归一化(Per-Layer QK-Norm)

该模型最值得关注的设计亮点,或许是它采用了「逐层」QK 归一化,而非常规的 QK 归一化。深入代码可以看到,它在注意力机制内部的实现如下:

self.q_norm = MiniMaxText01RMSNormTP(self.head_dim * self.total_num_heads, eps=...)
self.k_norm = MiniMaxText01RMSNormTP(self.head_dim * self.total_num_kv_heads, eps=...)

此处隐藏层维度等于所有注意力头拼接后的总维度(头数 × 单头维度),因此 RMSNorm 的缩放向量会为每个注意力头、以及头内的每个维度都分配独立的参数。

所谓「逐层」,是指用于 QK 归一化的 RMSNorm 和常规 QK 归一化一样,定义在每个 Transformer 块内部;但额外的区别是,它不在多个注意力头之间共享参数,而是为每个注意力头都配备了专属的 QK 归一化。

模型配置文件中也包含滑动窗口注意力设置(与第 3 节的 Gemma 3 类似),但和第 4 节介绍的 Mistral 3.1 一样,该功能默认处于关闭状态。

除此之外,除了逐层 QK 归一化的差异,二者的架构高度相似,如下图所示。

figure39

图 39:Qwen3 与 MiniMax-M2 架构对比

13.2 混合专家稀疏度

下图还能看出另一个有意思的细节:该模型没有使用共享专家(这一点与 Qwen3 一致,但和 Qwen3-Next 不同)。如前文所述,在我看来,共享专家的价值在于能够减少其他专家之间的知识冗余。

此外,从上图中可以明显看出,MiniMax-M2 的「稀疏程度」是 Qwen3 的两倍。也就是说,在总参数量与 Qwen3 235B-A22B 大致相当的情况下,MiniMax-M2 每个 token 仅激活 100 亿参数的专家,而非 220 亿 —— 换算下来,MiniMax-M2 每个推理步骤仅调用总参数的 4.37%,而 Qwen3 的激活参数占比为 9.36%。

13.3 部分旋转位置编码(Partial RoPE)

最后,与 MiniMax-M1 一样,MiniMax-M2 在注意力模块内部采用「部分」旋转位置编码来编码位置信息,而非完整的 RoPE。和常规 RoPE 类似,旋转操作会在 QK 归一化之后施加到查询向量与键向量上。

此处的「部分 RoPE」,是指每个注意力头中,只有前rotary_dim个通道会施加旋转位置编码,剩余的head_dim - rotary_dim个通道保持不变。

在 M1 的官方 README 文件中,开发团队提到:

旋转位置编码(RoPE)施加于半数注意力头维度,基频为 10,000,000

我们可以这样直观理解二者的区别:

  • 完整 RoPE:[r r r r r r r r]

  • 部分 RoPE:[r r r r — — — —]

在上述概念示意图中,r代表经过旋转(位置编码)的维度,横线代表未做处理的维度。

这么设计的意义是什么?在 M1 论文中,研究人员表示:

…… 对半数的 softmax 注意力维度施加 RoPE,能够在不损失性能的前提下实现长度外推。

我的推测是,这种设计可以避免长序列下出现「过度旋转」的问题,尤其是当序列长度超过训练数据集中最长文档时。换言之,其背后的逻辑可能是:与其施加模型在训练中从未见过的「失真」或「幅度过大」的旋转,不如保留部分维度不做位置编码。

【转载】大语言模型架构全面对比21:GLM-5

原文地址 第21章 GLM-5

21. GLM-5

春节假期已经成为开源重磅模型发布的一个出人意料的稳定窗口期。比如 2024 年 1—2 月有 GLM-4 与 Qwen 1.5,2025 年则有 DeepSeek R1 与 Qwen 2.5。

今年,智谱 AI([z.AI](z.AI))再度抢跑,于 2026 年 2 月 11 日推出 GLM-5,距离 2 月 17 日的农历新年约一周时间。

与我在本文第 11 节介绍的、2025 年夏季发布的 GLM-4.5 相比,新一代 GLM-5 的规模翻倍:总参数量从 3550 亿提升至 7440 亿,体量介于 DeepSeek-V3.2 与 Kimi K2 之间。

和 GLM-4.5 一样,GLM-5 采用混合专家(MoE,见 1.2 节)架构,单 token 激活参数量仅小幅上涨:GLM-4.5 为 320 亿,GLM-5 为 400 亿。

figure56

图 56:GLM-5 与 GLM-4.5 架构并排对比

Continue reading 【转载】大语言模型架构全面对比21:GLM-5

【转载】大语言模型架构全面对比11:GLM-4.5

原文地址 第11章 LM-4.5

11. GLM-4.5

GLM-4.5 是今年又一款重磅发布的模型。

它与 Qwen3 类似,属于指令微调与推理能力一体化的混合模型,但在函数调用与智能体场景下的优化更为出色。

figure33

图 33:GLM-4.5 基准测试成绩,来自官方 GitHub 仓库:https://github.com/zai-org/GLM-4.5

Continue reading 【转载】大语言模型架构全面对比11:GLM-4.5

【转载】大语言模型架构全面对比12:Qwen3-Next

原文地址 第16章 DeepSeek V3.2

12. Qwen3-Next

2025 年 9 月 11 日,通义千问团队发布了 Qwen3 Next 80B-A3B(见图 35),提供指令微调版(Instruct)与思考版(Thinking)两种形态。尽管其设计基于前文介绍的 Qwen3 架构,但我将它单独列为一节,一是保持图号的连贯性,二是突出其部分设计上的改动。

12.1 专家规模与数量

全新的 Qwen3 Next 架构有一个突出特点:尽管总参数量仅为前代 235B-A22B 模型的三分之一(见图 35),但专家数量提升至原来的四倍,还额外加入了共享专家。这两项设计选择(高专家数量 + 引入共享专家),正是我在本次发布前就指出过的行业未来方向,尤其是在本文开头链接的视频版本中曾重点提及。

figure35

图 35:5 月发布的初代 Qwen3 模型(左)与 9 月发布的 Qwen3 Next 模型(右)对比

Continue reading 【转载】大语言模型架构全面对比12:Qwen3-Next

【转载】大语言模型架构全面对比06:Qwen3

原文地址 第6章 Qwen3

6. Qwen3

通义千问团队始终持续输出高质量的开源权重大语言模型。我还记得 2023 年 NeurIPS 大会期间,我参与联合指导大语言模型效率挑战赛,最终所有夺冠方案均基于 Qwen2 搭建。

如今的 Qwen3 是又一标杆级模型系列,在各自参数量级的排行榜上都位居头部。该系列包含 7 款稠密模型,参数量分别为 0.6B、1.7B、4B、8B、14B 和 32B;另有 2 款混合专家(MoE)模型:30B-A3B 与 235B-A22B。

(顺带说明:“Qwen3” 中间未加空格并非笔误,我只是尽量保留通义千问开发团队选定的原始拼写。)

6.1 Qwen3(稠密版本)

我们先来看稠密模型的架构。截至本文撰写时,0.6B 参数版本很可能是当前新一代开源模型中参数规模最小的。以我的实际体验来看,在如此小的体量下,它的表现十分出色。如果要在本地运行,它的 token 生成吞吐量高,内存占用低;更重要的是,参数量小也意味着它很适合在本地开展训练(用于教学研究目的)。

因此在大多数场景下,我已经用 Qwen3 0.6B 替代了 Llama 3 1B。二者的架构对比如下图所示。

figure18

Continue reading 【转载】大语言模型架构全面对比06:Qwen3

【转载】从DeepSeek V3到V3.2:架构、稀疏注意力与强化学习更新

原文地址:From DeepSeek V3 to V3.2: Architecture, Sparse Attention, and RL Updates,by Sebastian Raschka, on 2026-01-01

从DeepSeek V3到V3.2:架构、稀疏注意力与强化学习更新

解读 DeepSeek 旗舰开源权重模型的演进之路

与 DeepSeek V3 的发布节奏类似,团队选择在美国一个重要假期的周末推出了这款全新旗舰模型。DeepSeek V3.2 的性能达到了 GPT-5 与 Gemini 3.0 Pro 的级别,同时还是一款开源权重模型,绝对值得深入研究。

figure01

图 1:DeepSeek V3.2 与闭源旗舰模型的基准测试对比。本图为 DeepSeek V3.2 报告的标注版插图。

我曾在《LLM 架构大盘点》一文的开篇详细介绍过其前身 DeepSeek V3,过去几个月里,随着新架构不断发布,我也一直在持续更新这篇文章。原本刚和家人过完感恩节假期回来,我只打算给这篇文章新增一个小节,补充 DeepSeek V3.2 的相关内容,但后来发现值得探讨的亮点太多,便决定单独写一篇更完整的长文。

他们的技术报告中有大量值得挖掘的内容与经验,我们这就开始。

Continue reading 【转载】从DeepSeek V3到V3.2:架构、稀疏注意力与强化学习更新

【转载】大语言模型架构全面对比16:DeepSeek V3.2

原文地址 第16章 DeepSeek V3.2

16. DeepSeek V3.2

本文以 2024 年 12 月发布的 DeepSeek V3 开篇。那段时间 DeepSeek 陆续推出了多款模型,但我大多没有展开介绍,因为它们都不属于 DeepSeek V3、DeepSeek R1 这类重磅旗舰级模型发布。

figure47

图 47:自 DeepSeek V3 起 DeepSeek 系列模型的发布时间线。核心模型以红色标注。

Continue reading 【转载】大语言模型架构全面对比16:DeepSeek V3.2