【转载】大语言模型架构全面对比05:Llama 4

原文地址 第5章 Llama 4

5. Llama 4

本文前面对混合专家模型(MoE)的详细铺垫在这里又派上了用场。Llama 4 同样采用了 MoE 架构,其余部分则沿用了与 DeepSeek V3 高度相似的相对标准架构,如下图所示。(Llama 4 原生支持多模态能力,与 Gemma、Mistral 等模型类似。但由于本文聚焦语言建模方向,因此仅讨论其文本模型部分。)

image17

图 17:DeepSeek V3(6710 亿参数)与 Llama 4 Maverick(4000 亿参数)架构对比

尽管 Llama 4 Maverick 的整体架构与 DeepSeek V3 十分相近,但仍有几处值得关注的差异。

首先,Llama 4 延续了前代的分组查询注意力(GQA),而 DeepSeek V3 采用的是本文开头介绍过的多头潜注意力(MLA)。两者均为超大规模架构:DeepSeek V3 的总参数量比 Llama 4 Maverick 高出约 68%;但从激活参数量来看,DeepSeek V3 为 370 亿,是 Llama 4 Maverick(170 亿)的两倍以上。

Llama 4 Maverick 采用更经典的 MoE 配置:专家数量更少但单个专家规模更大 —— 每步激活 2 个专家,每个专家隐层维度为 8192;而 DeepSeek V3 每步激活 9 个专家,每个专家隐层维度为 2048。此外,DeepSeek 除前 3 个 Transformer 块外,其余每个块都包含 MoE 层;Llama 4 则采用交替设计,每隔一个 Transformer 块轮换使用 MoE 模块与稠密模块。

由于架构之间存在诸多细微差异,很难判定这些设计对模型最终性能的具体影响。但核心结论是:2025 年 MoE 架构的普及度已出现显著提升。

Leave a Reply

Your email address will not be published. Required fields are marked *

*