【转载】大语言模型架构全面对比17:Mistral 3

原文地址 第17章 Mistral 3

17. Mistral 3

2025 年 12 月 2 日,也就是 DeepSeek V3.2 发布的次日,Mistral 团队推出了全新的 Mistral 3 模型系列。该系列包含三款以 Ministral 3 命名的小参数量稠密模型(3B、8B 和 14B),以及全新旗舰模型 Mistral 3 Large—— 这是一款总参数 6750 亿的 MoE 模型(激活参数 410 亿)。更具体地说,Mistral 3 Large 由两部分构成:

  • 总参数 6730 亿、激活参数 390 亿的 MoE 语言模型

  • 一个 25 亿参数的视觉编码器

(注:本文聚焦大语言模型相关内容,因此本节将略过视觉编码器部分。不过后续我或许会更新多模态大语言模型的相关文章。)

首先值得关注的是,这是 Mistral 自 2023 年 Mixtral 之后推出的首款 MoE 模型(本文前文曾提到,Mistral 一度放弃了 MoE 路线,而去年的 DeepSeek V3 带动了 MoE 技术的复兴)。

官方发布博客称,全尺寸模型均提供基础版、指令微调版和推理版三个版本,这一设置颇为贴心。不过其 6750 亿参数模型的推理版本目前尚未开放。

另一个值得一提的细节是,据官方公告,Mistral 此次与英伟达合作,针对 Blackwell 芯片优化了每秒 token 吞吐量。这点很有实际价值,意味着在我的 DGX Spark 设备上,Ministral 系列模型的运行速度会比同级别模型更快(这点我还需要实际测试验证)。

除了每秒 token 处理速度的优势外,从基准测试成绩来看,其小模型系列 Ministral 的表现与 Qwen3 基本持平,旗舰大模型的性能则与 DeepSeek V3.1 相当。

由于 Mistral 3 仅比 DeepSeek V3.2 晚一天发布,因此官方文章中没有纳入与 V3.2 的全面对比,仅在 LMArena Elo 评分中有体现 ——DeepSeek V3.2 以 1423 分小幅领先 Mistral 3 的 1418 分。

遗憾的是,目前无法做到完全对等的横向对比:Mistral 3 Large 暂未推出推理版本,而 DeepSeek V3.2 也没有公布非思考模式下的基准测试成绩。不过如果你感兴趣,我将 DeepSeek V3.2 报告中的「思考模式」测试数据,叠加到了 Mistral 3 Large 的基准测试图表中。

figure49

图 49:Mistral 3 官方公告中的 Mistral 3 Large 基准测试成绩,叠加深浦 V3.2 论文中的 DeepSeek V3.2 测试结果

将 Mistral Large 3 Instruct 模型与 DeepSeek V3.2-Thinking 模型放在一起对比(数据来自 DeepSeek V3.2 论文),后者的表现显然优异得多。因此我会持续关注 Mistral 3 Large 推理版本的发布,期待看到更新后的对比数据!

所以就目前来看,得益于各项优化,Mistral 3 Large 非常适合追求高性价比、低延迟的部署场景;而如果你追求极致的回答质量,DeepSeek V3.2-Thinking 会是更优选择。Mistral 3 Large 的另一大卖点是它同时支持多模态能力(DeepSeek V3.2 仅支持文本)。

顺便一提,我在本节重点对比 DeepSeek V3.2,一方面是因为两款模型发布时间极其接近,前后只差一天;另一方面二者的参数量规模几乎完全一致,分别为 6710 亿和 6730 亿,对比起来很有参考价值。

遗憾的是,目前没有包含更多模型研发细节的技术报告。不过作为一款开源权重模型,我们可以在 Hugging Face 模型库中获取权重进行分析。接下来我们就深入拆解 Mistral 3 Large 的架构细节。

事实证明,Mistral 3 Large 的架构与 DeepSeek V3、V3.1 完全一致!唯一的区别在于,Mistral 将单个专家的参数量扩大了一倍,同时将专家数量按同等比例缩减。

figure50

图 50:DeepSeek V3 与 Mistral 3 Large 架构对照

不过尽管架构本质上相同,但 Mistral 团队应该是从零开始训练的 Mistral 3,而非基于 DeepSeek V3 的权重做继续训练 —— 因为 Mistral 使用了自研的分词器。

继 Kimi K2 之后,Mistral 3 成为第二款采用 DeepSeek V3 架构的模型系列。不同的是,Kimi K2 团队将模型总参数量从 6710 亿扩容到了 1 万亿,而 Mistral 3 团队仅调整了专家的规模比例,并新增了视觉编码器以支持多模态。但话说回来,这样的选择也完全合理:DeepSeek V3 本身就是非常成熟扎实的架构设计,在 MoE 和 MLA 效率方面都有出色的表现,既然方案本身没有问题,何必要刻意改动呢?如今模型的核心竞争力,很大程度上也体现在训练流程与推理扩容策略上。

Leave a Reply

Your email address will not be published. Required fields are marked *

*