23. Gemma 4
继 3 月 Nemotron 3 Super 发布后,当月剩余时间里旗舰开源权重模型的发布节奏相对平缓。我仍在等待 DeepSeek-V4 的推出,而 4 月至少迎来了谷歌的 Gemma 4。
架构层面,如下图所示,310 亿参数的 Gemma 4 与 270 亿参数的 Gemma 3 相比几乎没有改动。

(注:Gemma 4 现已支持多模态能力,但图像编码器部分我会留到未来单独撰文介绍;本文仅聚焦文本模型部分。)
从上图可以看出,Gemma 4 保留了相对独特的前后归一化设计,整体架构仍偏经典,采用 5:1 比例的混合注意力机制,由滑动窗口(局部)层与全注意力(全局)层组合而成,注意力本身也仍是经典的分组查询注意力(GQA)。
不过,Gemma 4 相比 Gemma 3 有一处极易被忽略的细微改动:在全局(全量)注意力层中,对注意力机制的键做了复用 —— 也就是将值向量设为与键向量完全相同,这一设计能进一步压缩 KV 缓存的体积。
此外,Gemma 4 还采用了部分旋转位置编码(p-RoPE),仅 25% 的频率对承载位置信息,有助于减少长上下文场景下的位置噪声。
但我们不能因为架构上没有大刀阔斧的改动就低估它的提升。从基准测试成绩来看,Gemma 4 相比 Gemma 3 实现了巨大的性能飞跃。例如在 AI Arena 排行榜上,310 亿参数的 Gemma 4 排名与参数量远大于它的 Qwen3.5-397B-A17B 相近。不过正如我在模型评测文章中讨论过的,竞技场评分存在一定局限性:容易被针对性优化,且结果更偏向人类的风格偏好。
但从下图我整理的其他主流基准测试结果来看,它相比 Gemma 3 的提升十分明确,整体性能与 Qwen3.5 27B 基本持平。

值得一提的是,Gemma 4 还有混合专家(MoE)版本,下图将它与同规模的 Qwen3 模型做了对比。

如上图所示,二者的技术路线较为相近,核心区别仅在于 Gemma 4 采用了前文提到的独特前后归一化排布。
从基准成绩来看,Gemma 4 MoE 版本的总参数量比稠密版 Gemma 4(31B)少 40 亿,但二者的实际性能相差不大。
