原文地址 第19章 Xiaomi MiMo-V2-Flash
19. 小米 MiMo-V2-Flash
2025 年 12 月又诞生了一款表现亮眼的模型。小米发布了全新的小米 MiMo-V2-Flash,其基准测试成绩与 DeepSeek V3.2 持平,但总参数量仅为后者的一半,推理速度也更快。这是一款总参数量 3090 亿的混合专家(MoE)模型,每个 token 的激活参数量为 150 亿。
有意思的是,它采用滑动窗口注意力(SWA)与全局(常规)注意力按 5:1 比例混合的设计,与 Gemma 3 的思路类似(见第 3 节)。不过它的滑动窗口尺寸设置得更为激进,仅为 128,是 Gemma 3(1024)的八分之一。

据我所知,这是目前规模最大的滑动窗口注意力模型。
此外,这款小米模型还采用了多 Token 预测(MTP)技术,具体介绍详见 12.3 节。