【转载】大语言模型架构全面对比23:Gemma 4

原文地址 第23章 Gemma 4

23. Gemma 4

继 3 月 Nemotron 3 Super 发布后,当月剩余时间里旗舰开源权重模型的发布节奏相对平缓。我仍在等待 DeepSeek-V4 的推出,而 4 月至少迎来了谷歌的 Gemma 4。

架构层面,如下图所示,310 亿参数的 Gemma 4 与 270 亿参数的 Gemma 3 相比几乎没有改动。

figure58

图 58:Gemma 3(27B)与 Gemma 4(31B)架构并排对比
(注:Gemma 4 现已支持多模态能力,但图像编码器部分我会留到未来单独撰文介绍;本文仅聚焦文本模型部分。)

从上图可以看出,Gemma 4 保留了相对独特的前后归一化设计,整体架构仍偏经典,采用 5:1 比例的混合注意力机制,由滑动窗口(局部)层与全注意力(全局)层组合而成,注意力本身也仍是经典的分组查询注意力(GQA)。

不过,Gemma 4 相比 Gemma 3 有一处极易被忽略的细微改动:在全局(全量)注意力层中,对注意力机制的键做了复用 —— 也就是将值向量设为与键向量完全相同,这一设计能进一步压缩 KV 缓存的体积。

此外,Gemma 4 还采用了部分旋转位置编码(p-RoPE),仅 25% 的频率对承载位置信息,有助于减少长上下文场景下的位置噪声。

但我们不能因为架构上没有大刀阔斧的改动就低估它的提升。从基准测试成绩来看,Gemma 4 相比 Gemma 3 实现了巨大的性能飞跃。例如在 AI Arena 排行榜上,310 亿参数的 Gemma 4 排名与参数量远大于它的 Qwen3.5-397B-A17B 相近。不过正如我在模型评测文章中讨论过的,竞技场评分存在一定局限性:容易被针对性优化,且结果更偏向人类的风格偏好。

《从零理解大语言模型评测的 4 种主流方法》

但从下图我整理的其他主流基准测试结果来看,它相比 Gemma 3 的提升十分明确,整体性能与 Qwen3.5 27B 基本持平。

figure59

图 59:Gemma 3、Gemma 4 与 Qwen3.5 性能对比(数据取自 Gemma 4Qwen3.5 的模型官方主页)

值得一提的是,Gemma 4 还有混合专家(MoE)版本,下图将它与同规模的 Qwen3 模型做了对比。

figure60

图 60:Qwen3 Coder Flash 与 Gemma 4 MoE 架构对比

如上图所示,二者的技术路线较为相近,核心区别仅在于 Gemma 4 采用了前文提到的独特前后归一化排布。

从基准成绩来看,Gemma 4 MoE 版本的总参数量比稠密版 Gemma 4(31B)少 40 亿,但二者的实际性能相差不大。

figure61

图 61:Gemma 4 MoE(26B-A4B)的表现仅略逊于稠密版 Gemma 4(31B)

Leave a Reply

Your email address will not be published. Required fields are marked *

*