【转载】大语言模型架构全面对比21:GLM-5

原文地址 第21章 GLM-5

21. GLM-5

春节假期已经成为开源重磅模型发布的一个出人意料的稳定窗口期。比如 2024 年 1—2 月有 GLM-4 与 Qwen 1.5,2025 年则有 DeepSeek R1 与 Qwen 2.5。

今年,智谱 AI([z.AI](z.AI))再度抢跑,于 2026 年 2 月 11 日推出 GLM-5,距离 2 月 17 日的农历新年约一周时间。

与我在本文第 11 节介绍的、2025 年夏季发布的 GLM-4.5 相比,新一代 GLM-5 的规模翻倍:总参数量从 3550 亿提升至 7440 亿,体量介于 DeepSeek-V3.2 与 Kimi K2 之间。

和 GLM-4.5 一样,GLM-5 采用混合专家(MoE,见 1.2 节)架构,单 token 激活参数量仅小幅上涨:GLM-4.5 为 320 亿,GLM-5 为 400 亿。

figure56

图 56:GLM-5 与 GLM-4.5 架构并排对比

有意思的是,正如图 56 所示,GLM-5 同时采用了 DeepSeek 的多头潜在注意力(MLA,见 1.1 节)与 DeepSeek 稀疏注意力(我在 DeepSeek V3.2 的文章中有更详细的介绍)。做这些改动的核心目的,是降低长上下文场景下的推理成本。

除此之外,二者的整体架构较为相近。规模提升主要来自专家数量的增加(从 160 个增至 256 个),以及层维度的小幅上调。例如,嵌入维度与专家维度从 5120 提升至 6144,中间投影维度也从 1536 小幅升至 2048。

值得注意的是,层数(Transformer 模块数量)反而从 92 层减少到了 78 层。我推测这是为了降低推理成本、提升模型速度 —— 因为网络深度无法通过并行计算加速。

通常我不会在本文中列入基准测试结果,因为本文的核心聚焦于架构。如果加入训练细节与评测数据,文章的篇幅与范围会严重失控。不过既然 2025 年 7 月介绍 GLM-4.5 时我曾破例放过基准数据,这里就再破一次例 —— 它的测试成绩确实相当亮眼,比肩所有主流旗舰大语言模型(GPT-5.2 extra-high、Gemini Pro 3、Claude 4.6 Opus)。但还是要强调:基准测试表现并不等同于实际使用体验。

figure57

图 57:GLM 系列架构与对应基准成绩对照。GLM-4.7 的架构与 GLM-4.5 相近。基准数据摘自 GLM-5 发布博客:https://z.ai/blog/glm-5

Leave a Reply

Your email address will not be published. Required fields are marked *

*