【转载】大语言模型架构全面对比18:Nemotron 3 Nano 与 Super

原文地址 第18章 Nemotron 3 Nano 与 Super

18. Nemotron 3 Nano 与 Super

本文并非对市面上所有大语言模型的完整罗列。为了控制篇幅,我只聚焦核心代表性模型。这里的 “代表性” 指的是模型要么受众广泛、性能顶尖,要么在架构设计上有独到之处。

言归正传,是时候将英伟达的一款模型纳入这份清单了。2025 年 12 月 15 日,英伟达发布了 Nemotron 系列的最新产品 ——Nemotron 3。Nemotron 系列的可贵之处在于,它不仅开放了模型权重与技术报告,还像 Olmo 3 一样同步公开了训练数据集训练代码

据官方发布文章介绍,Nemotron 3 分为三个参数量版本:

  1. Nano 版(30B-A3B)

  2. Super 版(初始标注为 100B,后更新为 120B,详见 18.1 节)

  3. Ultra 版(500B)

18.1 Nemotron 3 Nano

在架构层面,该系列模型采用混合专家(MoE)+ Mamba-Transformer 的混合架构。截至本文撰写时(12 月 17 日),仅有 Nano 版本开放了权重,因此下文的讨论将围绕该版本展开,其架构如下图所示。

figure51.1

图 51.1:Nemotron 3 Nano 模型架构概览,为 Transformer-Mamba 混合架构

如上图所示,Nemotron 3 Nano(30B-A3B)是一款 52 层的 Mamba-Transformer 混合模型,它将 Mamba-2 序列建模模块与稀疏混合专家(MoE)前馈层交替排布,仅在极少部分层中使用自注意力机制。

上图的结构细节较为丰富,简而言之,整个架构由 13 个宏块组成,每个宏块内重复排布「Mamba-2 → MoE」子模块,另外还搭配了若干分组查询注意力层。将宏块与子模块的层数累计计算,整个架构共 52 层。

在 MoE 模块方面,每一层 MoE 包含 128 个专家,但每个 token 仅会激活 1 个共享专家与 6 个路由专家。

Mamba-2 层的原理足以单独用一篇文章展开讲解(或许后续可以单独撰文介绍)。就目前而言,从概念上你可以将它类比为前文介绍过的、Qwen3-Next 与 Kimi-Linear 采用的门控 DeltaNet 方案。你也可以在我的另一篇文章《超越标准大语言模型》中了解更多相关内容:

《超越标准大语言模型》

门控 DeltaNet 与 Mamba-2 层的共通之处在于,二者都用门控状态空间更新机制替代了标准注意力机制。这类状态空间风格模块的核心思路是:维护一个持续更新的隐藏状态,通过可学习的门控机制融合新的输入信息。与注意力机制相比,它的计算复杂度随输入序列长度呈线性增长,而非二次增长。

该架构最值得关注的亮点在于:与同等规模的纯 Transformer 架构相比,它不仅性能表现出色,还能实现高得多的每秒 token 处理吞吐量。

整体而言,这是一个很有探索价值的技术方向 —— 它仅保留极少注意力层,设计上比 Qwen3-Next 和 Kimi-Linear 更为激进。不过,Transformer 架构的核心优势之一正是在超大规模下的性能表现。Nemotron 3 Super,尤其是 Ultra 版本,和 DeepSeek V3.2 这类模型相比表现如何,非常值得期待。

18.2 Nemotron 3 Super

2026 年 3 月 11 日,英伟达在 Hugging Face 模型库开放了 120B 参数的 Super 版本权重,同时发布了一份针对该版本的全新技术报告

与 Nano 版本相比,Super 版本除了扩大架构规模外,还有两处核心的架构改动。

第一,Nemotron 3 Super 采用了多 token 预测(Multi-Token Prediction, MTP)技术。该技术会训练模型在每一步同时预测未来的多个 token,而非仅预测下一个。

MTP 不再仅使用标准的下一个 token 预测作为训练目标,而是让模型从同一个位置出发,预测未来多个偏移位置的 token。这能提供更丰富的训练信号,据 Super 版本的技术报告显示,该技术同时提升了模型质量与推理效率。

figure51.2

图 51.2:多 token 预测与常规单 token 预测的对比(左子图参考自 MTP 相关论文
传统的 MTP 仅应用于训练阶段,推理阶段不使用;因此图中下方的推理步骤仍展示为单 token 预测。

与上图所示的标准 MTP 用法不同,Nemotron 3 Super 并非只在训练时使用该技术。

Nemotron 3 Super 将 MTP 也应用到了推理阶段:权重共享的 MTP 输出头可作为内置的草稿模型,实现原生的推测解码。生成文本时,该模块可以先生成候选续写内容,再由主模型做验证,无需额外接入外部草稿模型就能降低推理延迟。

由于这并非标准的 MTP 用法,因此将 Nemotron 3 Super 的方案描述为「基于权重共享 MTP 的推测解码」会更准确,而不宜像其他架构那样称之为「MTP-3」(比如我之前介绍过的 Step 3.5 Flash)。

第二处和 Nano 版本的核心差异是,Super 版本采用了隐空间专家设计,即专家模块在隐空间中运行:MoE 层的输入会先从 4096 维降维至 1024 维,经过专家计算后,输出再从 1024 维升维回到 4096 维。

figure51.3

图 51.3:Nemotron 3 Super 120B-A12B 架构,集成隐空间 MoE 层、多 token 预测与 Mamba-2 混合注意力机制

在基准测试表现上,Nemotron 3 Super 与 Qwen3.5 122B-A10B、GPT-OSS 120B 处于同一水平;但得益于上述几项优化技术(MTP、隐空间 MoE、混合注意力),它的吞吐量表现十分突出:速度是 Qwen3.5 122B-A10B 的 2 倍,其 NVFP4 量化版本的速度则是 GPT-OSS 120B 的 2.2 倍。

figure51.4

图 51.4:Hugging Face 模型库页面中的 Nemotron 3 Super 基准测试对比

Leave a Reply

Your email address will not be published. Required fields are marked *

*