21. GLM-5
春节假期已经成为开源重磅模型发布的一个出人意料的稳定窗口期。比如 2024 年 1—2 月有 GLM-4 与 Qwen 1.5,2025 年则有 DeepSeek R1 与 Qwen 2.5。
今年,智谱 AI([z.AI](z.AI))再度抢跑,于 2026 年 2 月 11 日推出 GLM-5,距离 2 月 17 日的农历新年约一周时间。
与我在本文第 11 节介绍的、2025 年夏季发布的 GLM-4.5 相比,新一代 GLM-5 的规模翻倍:总参数量从 3550 亿提升至 7440 亿,体量介于 DeepSeek-V3.2 与 Kimi K2 之间。
和 GLM-4.5 一样,GLM-5 采用混合专家(MoE,见 1.2 节)架构,单 token 激活参数量仅小幅上涨:GLM-4.5 为 320 亿,GLM-5 为 400 亿。

有意思的是,正如图 56 所示,GLM-5 同时采用了 DeepSeek 的多头潜在注意力(MLA,见 1.1 节)与 DeepSeek 稀疏注意力(我在 DeepSeek V3.2 的文章中有更详细的介绍)。做这些改动的核心目的,是降低长上下文场景下的推理成本。
除此之外,二者的整体架构较为相近。规模提升主要来自专家数量的增加(从 160 个增至 256 个),以及层维度的小幅上调。例如,嵌入维度与专家维度从 5120 提升至 6144,中间投影维度也从 1536 小幅升至 2048。
值得注意的是,层数(Transformer 模块数量)反而从 92 层减少到了 78 层。我推测这是为了降低推理成本、提升模型速度 —— 因为网络深度无法通过并行计算加速。
通常我不会在本文中列入基准测试结果,因为本文的核心聚焦于架构。如果加入训练细节与评测数据,文章的篇幅与范围会严重失控。不过既然 2025 年 7 月介绍 GLM-4.5 时我曾破例放过基准数据,这里就再破一次例 —— 它的测试成绩确实相当亮眼,比肩所有主流旗舰大语言模型(GPT-5.2 extra-high、Gemini Pro 3、Claude 4.6 Opus)。但还是要强调:基准测试表现并不等同于实际使用体验。
