【转载】Kimi K3 架构笔记

原文地址

Kimi K3 架构笔记

作者:Sebastian Raschka

本文整理了昨日重磅发布的开源权重模型 Kimi K3 的架构示意图,以及我个人的一些观察与思考。

1、诚然,它的结构看起来相对复杂,但本质上是去年发布的 Kimi Linear 模型的规模化生产版本 —— 参数量从 480 亿扩容至 2.8 万亿,K3 也是目前全球规模最大的开源权重模型。

2、相比 Kimi Linear,Kimi K3 唯一新增的核心组件是 LatentMoE(潜在混合专家)。由于下图的架构已经十分密集,我没有将它标注在图中,但它的设计本质上与 Nemotron 3 Ultra 中的 LatentMoE 完全一致(感兴趣的读者可以在我的大语言模型架构图集中查阅)。其核心思路与多头潜在注意力类似,是对大型线性层做压缩(向下投影)处理。

3、Kimi K3 的整体演进方向(与 Nemotron 3、DeepSeek V4 等模型的趋势一致),同样是向更高的推理效率优化。也就是说,模型中大量原有组件都被替换为效率优化版本:例如传统 MoE 升级为 LatentMoE,常规注意力替换为多头潜在注意力与 Kimi Delta 注意力。(如果想了解更多细节,我的架构图集中也配有对应的简短教程与技术解读。)

4、其中唯一一项并非出于效率优化的架构改动,是注意力残差连接。DeepSeek V4 是通过 mHC(流形约束超连接)来优化残差路径,而注意力残差同样是改进残差路径的技术,但实现逻辑有所不同:mHC 的做法是拓宽残差路径的维度;而注意力残差(Kimi Linear 中就已采用)则是跨层连接残差信号,跨层连接本身会通过注意力得分来计算各层的贡献权重。根据技术报告,该机制能持续、小幅地降低验证集损失、提升下游任务表现,同时仅增加约 4% 的训练成本与 2% 的推理成本。

5、有意思的是,Kimi K3 移除了所有 RoPE 层,全程采用 NoPE(无位置编码) 方案。(这一设计同样继承自 Kimi Linear。)在其他模型架构中,近期的主流趋势是局部注意力层(如滑动窗口注意力)保留 RoPE、全局层使用 NoPE。此前也有少数架构全程使用 NoPE,但据我所知,Kimi K3 是首款达到业界前沿水平的全 NoPE 架构模型。

6、此外,Kimi K3 现已原生支持多模态能力,这一点非常亮眼。

技术报告中还有不少值得关注的训练细节,但架构层面的核心变化基本就是以上内容。总体而言,这是一次完成度极高的模型发布。

kimi-k3-architecture

图 1:Kimi K3 架构示意与发布时基准测试成绩对比。更多细节可查看架构图集中的 K3 专题页。
(集成了 Kimi Delta 注意力、门控多头潜在注意力、注意力残差、LatentMoE 等组件,附基准测试对比)

Leave a Reply

Your email address will not be published. Required fields are marked *

*