23. Gemma 4
继 3 月 Nemotron 3 Super 发布后,当月剩余时间里旗舰开源权重模型的发布节奏相对平缓。我仍在等待 DeepSeek-V4 的推出,而 4 月至少迎来了谷歌的 Gemma 4。
架构层面,如下图所示,310 亿参数的 Gemma 4 与 270 亿参数的 Gemma 3 相比几乎没有改动。

(注:Gemma 4 现已支持多模态能力,但图像编码器部分我会留到未来单独撰文介绍;本文仅聚焦文本模型部分。)
Learn and share.
继 3 月 Nemotron 3 Super 发布后,当月剩余时间里旗舰开源权重模型的发布节奏相对平缓。我仍在等待 DeepSeek-V4 的推出,而 4 月至少迎来了谷歌的 Gemma 4。
架构层面,如下图所示,310 亿参数的 Gemma 4 与 270 亿参数的 Gemma 3 相比几乎没有改动。

原文地址 第22章 2026年2月更多新模型一览:从Kimi K2.5到Tiny Aya
2026 年 1—2 月共有 10 款颇具参考价值的开源权重大语言模型密集发布,完整名单如下:
Arcee AI Trinity Large(2026 年 1 月 27 日)
月之暗面(Moonshot AI)Kimi K2.5(2026 年 1 月 27 日)
阶跃星辰(StepFun)Step 3.5 Flash(2026 年 2 月 1 日)
通义千问 Qwen3-Coder-Next(2026 年 2 月 3 日)
[z.AI](z.AI) GLM-5(2026 年 2 月 12 日)
MiniMax M2.5(2026 年 2 月 12 日)
Nanbeige 4.1 3B(2026 年 2 月 13 日)
通义千问 Qwen 3.5(2026 年 2 月 15 日)
蚂蚁集团 Ling 2.5 1T 与 Ring 2.5 1T(2026 年 2 月 16 日)
Cohere Tiny Aya(2026 年 2 月 17 日)
除此之外,2026 年 3 月 6 日还发布了 Sarvam 30B 与 105B 两款模型。
我已在前文第 19、20 节分别拆解了 Arcee AI Trinity Large 与 [z.AI](z.AI) GLM-5。由于 1—2 月的新模型内容丰富、架构细节较多,我专门撰写了一篇独立长文,对上述 10 款模型的架构设计做了全面分析,可通过以下链接阅读:
《开源权重大模型的春日序章:2026 年 1—2 月 10 款架构全盘点》
如果你觉得本月开源模型迭代节奏过快、难以逐一跟进,这篇文章能帮你快速梳理核心趋势与技术亮点。
春节假期已经成为开源重磅模型发布的一个出人意料的稳定窗口期。比如 2024 年 1—2 月有 GLM-4 与 Qwen 1.5,2025 年则有 DeepSeek R1 与 Qwen 2.5。
今年,智谱 AI([z.AI](z.AI))再度抢跑,于 2026 年 2 月 11 日推出 GLM-5,距离 2 月 17 日的农历新年约一周时间。
与我在本文第 11 节介绍的、2025 年夏季发布的 GLM-4.5 相比,新一代 GLM-5 的规模翻倍:总参数量从 3550 亿提升至 7440 亿,体量介于 DeepSeek-V3.2 与 Kimi K2 之间。
和 GLM-4.5 一样,GLM-5 采用混合专家(MoE,见 1.2 节)架构,单 token 激活参数量仅小幅上涨:GLM-4.5 为 320 亿,GLM-5 为 400 亿。

原文地址 第20章 Arcee AI Trinity Large
距离上次新增大语言模型架构盘点已有一段时间。1 月 27 日,Arcee AI(在此之前我并未关注到这家公司)开始在模型平台发布其开源权重的 4000 亿参数 Trinity Large 大语言模型,同步推出的还有两款更小参数的变体。
其旗舰大模型为总参数 4000 亿的 MoE 架构(激活参数仅 130 亿);两款小型变体分别是 Trinity Mini(总参数 260 亿,激活参数 30 亿)与 Trinity Nano(总参数 60 亿,激活参数 10 亿)。

图 53:Trinity Large 架构概览(基于模型平台配置文件整理)
除模型权重外,Arcee AI 还发布了一份细节详实的技术报告。
接下来我们深入拆解这款 4000 亿参数的旗舰模型。下图将它与前文第 11 节介绍过的 GLM 4.5 做了对比 —— 二者规模最为接近,都属于相对轻量的大模型。此外,Trinity 的技术报告显示,Trinity Large 与 GLM-4.5 的基础模型性能几乎持平(我推测他们没有和更新的基础模型做对比,因为如今很多厂商仅公开微调后的模型版本)。

图 54:Arcee AI Trinity Large 与规模相近的 GLM 4.5 并列对比(4000 亿 vs 3550 亿参数)
但从图中可以看到,Trinity 模型加入了多项颇具亮点的架构设计。
首先是交替排布的局部 – 全局(滑动窗口)注意力层,这一设计思路与前文介绍的 Gemma 3、Olmo 3、小米 MiMo 等模型一致。不过 Gemma 3 和小米普遍采用 5:1 的排布比例,而 Trinity 选择了与 Olmo 3 相近的 3:1 比例,同时滑动窗口尺寸设为 4096,同样和 Olmo 3 的设计接近。
除了 QK 归一化(QK-Norm,第 2 节 Olmo 2 部分有详细介绍)之外,模型还在全局注意力层中应用了 NoPE(无位置嵌入,第 7 节 SmolLM3 部分有相关讨论)。
模型还采用了一种门控注意力机制。它并非完整的门控 DeltaNet(GatedDeltaNet,第 12 节有介绍),而是使用了与 Qwen3-Next 注意力机制类似的门控设计。
具体来说,团队对标准注意力做了修改:在输出线性投影之前,对缩放点积结果加入了逐元素门控(如下图所示)。这一设计能够缓解注意力沉陷(attention sinks)现象,提升长序列泛化能力,同时还有助于增强训练稳定性。

图 55:Trinity Large 注意力机制中门控模块的原理示意图
你可能已经注意到,前面的 Trinity Large 架构图中,使用了 4 层 RMSNorm(均方根归一化),而非常规的 2 层。这就是该模型所谓的深度缩放三明治归一化(depth-scaled sandwich norm)—— 该设计基于已有研究,但我在主流大模型架构中还是首次见到。整体来看,它的 RMSNorm 排布方式和 Gemma 3 类似,但特殊之处在于,每个模块中第二层 RMSNorm 的增益系数是深度缩放的,即初始值约为 1/√L(L 为总层数)。这样设计的效果是:训练初期残差更新的幅度很小,随着模型学习到合适的数值尺度,更新幅度会逐渐增大。
模型的 MoE 模块参考了 DeepSeek 的设计,采用大量小型专家,但做了粗粒度优化以提升推理吞吐量 —— 这一优化思路,我们在 Mistral 3 Large 采用 DeepSeek V3 架构时也见到过。
最后,该模型在训练优化上也有一些有意思的细节(全新的 MoE 负载均衡策略,以及采用 MuOpt 优化器),但本文聚焦架构分析,因此不展开讨论。
原文地址 第19章 Xiaomi MiMo-V2-Flash
2025 年 12 月又诞生了一款表现亮眼的模型。小米发布了全新的小米 MiMo-V2-Flash,其基准测试成绩与 DeepSeek V3.2 持平,但总参数量仅为后者的一半,推理速度也更快。这是一款总参数量 3090 亿的混合专家(MoE)模型,每个 token 的激活参数量为 150 亿。
有意思的是,它采用滑动窗口注意力(SWA)与全局(常规)注意力按 5:1 比例混合的设计,与 Gemma 3 的思路类似(见第 3 节)。不过它的滑动窗口尺寸设置得更为激进,仅为 128,是 Gemma 3(1024)的八分之一。

据我所知,这是目前规模最大的滑动窗口注意力模型。
此外,这款小米模型还采用了多 Token 预测(MTP)技术,具体介绍详见 12.3 节。
原文地址 第18章 Nemotron 3 Nano 与 Super
本文并非对市面上所有大语言模型的完整罗列。为了控制篇幅,我只聚焦核心代表性模型。这里的 “代表性” 指的是模型要么受众广泛、性能顶尖,要么在架构设计上有独到之处。
言归正传,是时候将英伟达的一款模型纳入这份清单了。2025 年 12 月 15 日,英伟达发布了 Nemotron 系列的最新产品 ——Nemotron 3。Nemotron 系列的可贵之处在于,它不仅开放了模型权重与技术报告,还像 Olmo 3 一样同步公开了训练数据集与训练代码。
据官方发布文章介绍,Nemotron 3 分为三个参数量版本:
Nano 版(30B-A3B)
Super 版(初始标注为 100B,后更新为 120B,详见 18.1 节)
Ultra 版(500B)
在架构层面,该系列模型采用混合专家(MoE)+ Mamba-Transformer 的混合架构。截至本文撰写时(12 月 17 日),仅有 Nano 版本开放了权重,因此下文的讨论将围绕该版本展开,其架构如下图所示。

图 51.1:Nemotron 3 Nano 模型架构概览,为 Transformer-Mamba 混合架构
如上图所示,Nemotron 3 Nano(30B-A3B)是一款 52 层的 Mamba-Transformer 混合模型,它将 Mamba-2 序列建模模块与稀疏混合专家(MoE)前馈层交替排布,仅在极少部分层中使用自注意力机制。
上图的结构细节较为丰富,简而言之,整个架构由 13 个宏块组成,每个宏块内重复排布「Mamba-2 → MoE」子模块,另外还搭配了若干分组查询注意力层。将宏块与子模块的层数累计计算,整个架构共 52 层。
在 MoE 模块方面,每一层 MoE 包含 128 个专家,但每个 token 仅会激活 1 个共享专家与 6 个路由专家。
Mamba-2 层的原理足以单独用一篇文章展开讲解(或许后续可以单独撰文介绍)。就目前而言,从概念上你可以将它类比为前文介绍过的、Qwen3-Next 与 Kimi-Linear 采用的门控 DeltaNet 方案。你也可以在我的另一篇文章《超越标准大语言模型》中了解更多相关内容:
门控 DeltaNet 与 Mamba-2 层的共通之处在于,二者都用门控状态空间更新机制替代了标准注意力机制。这类状态空间风格模块的核心思路是:维护一个持续更新的隐藏状态,通过可学习的门控机制融合新的输入信息。与注意力机制相比,它的计算复杂度随输入序列长度呈线性增长,而非二次增长。
该架构最值得关注的亮点在于:与同等规模的纯 Transformer 架构相比,它不仅性能表现出色,还能实现高得多的每秒 token 处理吞吐量。
整体而言,这是一个很有探索价值的技术方向 —— 它仅保留极少注意力层,设计上比 Qwen3-Next 和 Kimi-Linear 更为激进。不过,Transformer 架构的核心优势之一正是在超大规模下的性能表现。Nemotron 3 Super,尤其是 Ultra 版本,和 DeepSeek V3.2 这类模型相比表现如何,非常值得期待。
2026 年 3 月 11 日,英伟达在 Hugging Face 模型库开放了 120B 参数的 Super 版本权重,同时发布了一份针对该版本的全新技术报告。
与 Nano 版本相比,Super 版本除了扩大架构规模外,还有两处核心的架构改动。
第一,Nemotron 3 Super 采用了多 token 预测(Multi-Token Prediction, MTP)技术。该技术会训练模型在每一步同时预测未来的多个 token,而非仅预测下一个。
MTP 不再仅使用标准的下一个 token 预测作为训练目标,而是让模型从同一个位置出发,预测未来多个偏移位置的 token。这能提供更丰富的训练信号,据 Super 版本的技术报告显示,该技术同时提升了模型质量与推理效率。

图 51.2:多 token 预测与常规单 token 预测的对比(左子图参考自 MTP 相关论文)
传统的 MTP 仅应用于训练阶段,推理阶段不使用;因此图中下方的推理步骤仍展示为单 token 预测。
与上图所示的标准 MTP 用法不同,Nemotron 3 Super 并非只在训练时使用该技术。
Nemotron 3 Super 将 MTP 也应用到了推理阶段:权重共享的 MTP 输出头可作为内置的草稿模型,实现原生的推测解码。生成文本时,该模块可以先生成候选续写内容,再由主模型做验证,无需额外接入外部草稿模型就能降低推理延迟。
由于这并非标准的 MTP 用法,因此将 Nemotron 3 Super 的方案描述为「基于权重共享 MTP 的推测解码」会更准确,而不宜像其他架构那样称之为「MTP-3」(比如我之前介绍过的 Step 3.5 Flash)。
第二处和 Nano 版本的核心差异是,Super 版本采用了隐空间专家设计,即专家模块在隐空间中运行:MoE 层的输入会先从 4096 维降维至 1024 维,经过专家计算后,输出再从 1024 维升维回到 4096 维。

图 51.3:Nemotron 3 Super 120B-A12B 架构,集成隐空间 MoE 层、多 token 预测与 Mamba-2 混合注意力机制
在基准测试表现上,Nemotron 3 Super 与 Qwen3.5 122B-A10B、GPT-OSS 120B 处于同一水平;但得益于上述几项优化技术(MTP、隐空间 MoE、混合注意力),它的吞吐量表现十分突出:速度是 Qwen3.5 122B-A10B 的 2 倍,其 NVFP4 量化版本的速度则是 GPT-OSS 120B 的 2.2 倍。

图 51.4:Hugging Face 模型库页面中的 Nemotron 3 Super 基准测试对比
2025 年 12 月 2 日,也就是 DeepSeek V3.2 发布的次日,Mistral 团队推出了全新的 Mistral 3 模型系列。该系列包含三款以 Ministral 3 命名的小参数量稠密模型(3B、8B 和 14B),以及全新旗舰模型 Mistral 3 Large—— 这是一款总参数 6750 亿的 MoE 模型(激活参数 410 亿)。更具体地说,Mistral 3 Large 由两部分构成:
总参数 6730 亿、激活参数 390 亿的 MoE 语言模型
一个 25 亿参数的视觉编码器
(注:本文聚焦大语言模型相关内容,因此本节将略过视觉编码器部分。不过后续我或许会更新多模态大语言模型的相关文章。)
首先值得关注的是,这是 Mistral 自 2023 年 Mixtral 之后推出的首款 MoE 模型(本文前文曾提到,Mistral 一度放弃了 MoE 路线,而去年的 DeepSeek V3 带动了 MoE 技术的复兴)。
官方发布博客称,全尺寸模型均提供基础版、指令微调版和推理版三个版本,这一设置颇为贴心。不过其 6750 亿参数模型的推理版本目前尚未开放。
另一个值得一提的细节是,据官方公告,Mistral 此次与英伟达合作,针对 Blackwell 芯片优化了每秒 token 吞吐量。这点很有实际价值,意味着在我的 DGX Spark 设备上,Ministral 系列模型的运行速度会比同级别模型更快(这点我还需要实际测试验证)。
除了每秒 token 处理速度的优势外,从基准测试成绩来看,其小模型系列 Ministral 的表现与 Qwen3 基本持平,旗舰大模型的性能则与 DeepSeek V3.1 相当。
由于 Mistral 3 仅比 DeepSeek V3.2 晚一天发布,因此官方文章中没有纳入与 V3.2 的全面对比,仅在 LMArena Elo 评分中有体现 ——DeepSeek V3.2 以 1423 分小幅领先 Mistral 3 的 1418 分。
遗憾的是,目前无法做到完全对等的横向对比:Mistral 3 Large 暂未推出推理版本,而 DeepSeek V3.2 也没有公布非思考模式下的基准测试成绩。不过如果你感兴趣,我将 DeepSeek V3.2 报告中的「思考模式」测试数据,叠加到了 Mistral 3 Large 的基准测试图表中。

图 49:Mistral 3 官方公告中的 Mistral 3 Large 基准测试成绩,叠加深浦 V3.2 论文中的 DeepSeek V3.2 测试结果
本文以 2024 年 12 月发布的 DeepSeek V3 开篇。那段时间 DeepSeek 陆续推出了多款模型,但我大多没有展开介绍,因为它们都不属于 DeepSeek V3、DeepSeek R1 这类重磅旗舰级模型发布。

艾伦人工智能研究院(Allen AI)于 11 月 20 日发布了全新的 Olmo 3 7B 与 32B 模型。(官方拼写已从 OLMo 调整为 Olmo,本节将沿用这一新版命名。)
如前文所述,Olmo 系列模型一直具备特殊的研究价值,核心原因在于它的完全开源属性。这里的 “完全开源” 指团队同步公开了详细训练报告、多轮训练检查点、训练数据集信息等全部研发资料。换言之,Olmo 模型具备完整的技术透明度。
本次 Olmo 模型家族在基础版、指令微调版之外,新增了推理版本;Olmo 3 的技术报告中也收录了大量训练相关的细节。但本文聚焦架构对比主题,因此本节仅围绕 Olmo 3 的架构设计展开分析。
与 Olmo 3 最具横向可比性的参照模型是 Qwen3——Qwen3 系列有两款参数量相近的模型,且整体性能处于同一梯队。
首先我们来看两款中参数量更小的 Olmo 3 7B。

图 44:Olmo 3 7B 与 Qwen3 8B 架构对照
近年来,为提升大语言模型(LLM)的运行效率,线性注意力机制迎来了新一轮复兴。
2017 年《Attention Is All You Need》论文中提出的注意力机制(即缩放点积注意力),仍是当前大语言模型中应用最广泛的注意力变体。除传统的多头注意力外,它也衍生出了多种更高效的实现形式,例如分组查询注意力、滑动窗口注意力以及多头潜在注意力。