【转载】8. Kimi K2 and Kimi K2 Thinking

原文地址 第8章 Kimi K2 and Kimi K2 Thinking

8. Kimi K2 and Kimi K2 Thinking

Kimi K2 近期在 AI 领域引发了巨大反响:作为一款开源权重模型,它的性能表现极为突出。多项基准测试显示,其水平已与谷歌 Gemini、Anthropic Claude、OpenAI ChatGPT 等顶尖闭源模型不相上下。

一个值得关注的设计特点是,它采用了较新的 Muon 优化器 变体,而非行业通用的 AdamW。据我所知,这是 Muon 优化器首次在如此规模的生产级模型中替代 AdamW 落地(此前仅在最高 160 亿参数的模型上验证过可扩展性)。这一方案带来了表现优异的训练损失曲线,大概率是推动该模型登顶上述基准榜单的重要助力。

不少评论认为其损失曲线异常平滑(几乎没有波动尖峰),但我认为它并不算格外突出 —— 比如可参考下图中的 OLMo 2 损失曲线;而且梯度的 L2 范数或许是衡量训练稳定性更合理的指标。不过真正值得称道的,是其损失曲线的下降效果非常出色。

但正如本文引言所述,训练方法论属于另一话题,此处不展开讨论。

figure24

图 24:摘自 Kimi K2 官方发布博客(https://moonshotai.github.io/Kimi-K2/)与 OLMo 2 论文(https://arxiv.org/abs/2305.19466)的图标注版

该模型总参数量高达 1 万亿,规模十分惊人。
截至本文撰写时,它或许是当前这一代模型中参数量最大的大语言模型(前提限定:Llama 4 Behemoth 尚未发布、闭源大模型不计入统计,且谷歌 1.6 万亿参数的 Switch Transformer 属于上一代的编码器 – 解码器架构,不纳入同代对比)。

Kimi K2 的架构与本文开头介绍的 DeepSeek V3 一脉相承,仅做了规模上的放大,如下图所示。

figure25.1

图 25.1:DeepSeek V3 与 Kimi K2 架构对比

如上图所示,Kimi K2 的基础架构与 DeepSeek V3 基本一致,差异仅在于 MoE 模块中专家数量更多,而多头潜在注意力(MLA)模块的注意力头数量更少。

Kimi K2 并非横空出世。此前论文《Kimi k1.5: Scaling Reinforcement Learning with LLMs》中介绍的 Kimi 1.5 模型,同样表现亮眼。但不巧的是,DeepSeek R1 的论文恰好也在 1 月 22 日同一天发布,盖过了它的关注度。此外,据我所知,Kimi 1.5 的模型权重从未对外公开。

因此,Kimi K2 团队很可能吸取了这一经验,选择在 DeepSeek R2 发布之前,就将 Kimi K2 以开源权重形式开放。截至本文撰写时,Kimi K2 是综合表现最亮眼的开源权重模型。

更新:2025 年 11 月 6 日,Kimi K2 团队还发布了全新的「Thinking(思考模式)」模型变体。该版本的基础架构与上述 Kimi K2 完全一致,仅将上下文窗口从 128k 扩展到了 256k。

据 Kimi 团队公布的基准测试结果,该模型的性能超越了主流闭源大语言模型。(遗憾的是,暂无与 DeepSeek R1 的直接对比数据。)

figure25.2

图 25.2:DeepSeek R1 与 Kimi K2 Thinking 架构对比(上)及 Kimi K2 Thinking 基准测试成绩(下)

Leave a Reply

Your email address will not be published. Required fields are marked *

*