4. Mistral Small 3.1
Mistral Small 3.1(240 亿参数)于 3 月发布,上线时间紧随 Gemma 3 之后。该模型值得关注的核心特点是:除数学能力外,它在多项基准测试中表现优于 Gemma 3 27B,同时推理速度更快。
Mistral Small 3.1 的推理延迟低于 Gemma 3,原因大概率在于其定制化自研分词器,以及更小的 KV 缓存规模与更少的网络层数。除此之外,它采用的是下图所示的标准架构。

图 16:Gemma 3 27B 与 Mistral 3.1 Small 24B 架构对比
有意思的是,Mistral 早期的模型均采用了滑动窗口注意力机制,但从官方模型仓库配置文件的默认参数("sliding_window": null)来看,Mistral Small 3.1 似乎已经放弃了这一设计,其模型卡片中也完全没有提及该机制。
因此,Mistral 采用的是常规分组查询注意力(GQA),而非 Gemma 3 使用的带滑动窗口的分组查询注意力。得益于这一改动,模型可以适配高度优化的算子实现(例如 FlashAttention),或许能进一步压缩推理计算开销。笔者推测:滑动窗口注意力虽能降低显存占用,但未必能缩短推理延迟,而低延迟正是 Mistral Small 3.1 的核心优化目标。