【转载】大语言模型架构全面对比20:Arcee AI Trinity Large

原文地址 第20章 Arcee AI Trinity Large

20. Arcee AI Trinity Large

距离上次新增大语言模型架构盘点已有一段时间。1 月 27 日,Arcee AI(在此之前我并未关注到这家公司)开始在模型平台发布其开源权重的 4000 亿参数 Trinity Large 大语言模型,同步推出的还有两款更小参数的变体。

其旗舰大模型为总参数 4000 亿的 MoE 架构(激活参数仅 130 亿);两款小型变体分别是 Trinity Mini(总参数 260 亿,激活参数 30 亿)与 Trinity Nano(总参数 60 亿,激活参数 10 亿)。

figure53

图 53:Trinity Large 架构概览(基于模型平台配置文件整理)

除模型权重外,Arcee AI 还发布了一份细节详实的技术报告

接下来我们深入拆解这款 4000 亿参数的旗舰模型。下图将它与前文第 11 节介绍过的 GLM 4.5 做了对比 —— 二者规模最为接近,都属于相对轻量的大模型。此外,Trinity 的技术报告显示,Trinity Large 与 GLM-4.5 的基础模型性能几乎持平(我推测他们没有和更新的基础模型做对比,因为如今很多厂商仅公开微调后的模型版本)。

figure54

图 54:Arcee AI Trinity Large 与规模相近的 GLM 4.5 并列对比(4000 亿 vs 3550 亿参数)

但从图中可以看到,Trinity 模型加入了多项颇具亮点的架构设计。

首先是交替排布的局部 – 全局(滑动窗口)注意力层,这一设计思路与前文介绍的 Gemma 3、Olmo 3、小米 MiMo 等模型一致。不过 Gemma 3 和小米普遍采用 5:1 的排布比例,而 Trinity 选择了与 Olmo 3 相近的 3:1 比例,同时滑动窗口尺寸设为 4096,同样和 Olmo 3 的设计接近。

除了 QK 归一化(QK-Norm,第 2 节 Olmo 2 部分有详细介绍)之外,模型还在全局注意力层中应用了 NoPE(无位置嵌入,第 7 节 SmolLM3 部分有相关讨论)。

模型还采用了一种门控注意力机制。它并非完整的门控 DeltaNet(GatedDeltaNet,第 12 节有介绍),而是使用了与 Qwen3-Next 注意力机制类似的门控设计。

具体来说,团队对标准注意力做了修改:在输出线性投影之前,对缩放点积结果加入了逐元素门控(如下图所示)。这一设计能够缓解注意力沉陷(attention sinks)现象,提升长序列泛化能力,同时还有助于增强训练稳定性。

figure55

图 55:Trinity Large 注意力机制中门控模块的原理示意图

你可能已经注意到,前面的 Trinity Large 架构图中,使用了 4 层 RMSNorm(均方根归一化),而非常规的 2 层。这就是该模型所谓的深度缩放三明治归一化(depth-scaled sandwich norm)—— 该设计基于已有研究,但我在主流大模型架构中还是首次见到。整体来看,它的 RMSNorm 排布方式和 Gemma 3 类似,但特殊之处在于,每个模块中第二层 RMSNorm 的增益系数是深度缩放的,即初始值约为 1/√L(L 为总层数)。这样设计的效果是:训练初期残差更新的幅度很小,随着模型学习到合适的数值尺度,更新幅度会逐渐增大。

模型的 MoE 模块参考了 DeepSeek 的设计,采用大量小型专家,但做了粗粒度优化以提升推理吞吐量 —— 这一优化思路,我们在 Mistral 3 Large 采用 DeepSeek V3 架构时也见到过。

最后,该模型在训练优化上也有一些有意思的细节(全新的 MoE 负载均衡策略,以及采用 MuOpt 优化器),但本文聚焦架构分析,因此不展开讨论。

Leave a Reply

Your email address will not be published. Required fields are marked *

*