11. GLM-4.5
GLM-4.5 是今年又一款重磅发布的模型。
它与 Qwen3 类似,属于指令微调与推理能力一体化的混合模型,但在函数调用与智能体场景下的优化更为出色。

如图 33 所示,GLM-4.5 提供两个版本。旗舰版总参数量达 3550 亿,在 12 项基准测试中的平均表现超越 Claude 4 Opus,仅略逊于 OpenAI 的 o3 与 xAI 的 Grok 4。此外还有更轻量化的 GLM-4.5-Air 版本,总参数量 1060 亿,性能仅比 3550 亿版本小幅下降。
图 34 对比了 3550 亿参数版本与 Qwen3 的架构。

二者的设计整体相近,但 GLM-4.5 沿用了 DeepSeek V3 首创的架构设计:在混合专家(MoE)模块之前设置 3 层稠密层。这么设计的原因是什么?在大规模 MoE 系统中,先通过若干层稠密层做特征提取,能提升收敛稳定性与整体性能。如果一开始就引入 MoE 路由,稀疏专家选择带来的不稳定性会干扰早期句法与语义特征的提取。因此可以说,保持初始层为稠密结构,能确保模型在路由机制开始影响高层处理之前,先形成稳定的低层特征表示。
此外,与 DeepSeek V3 相同(而与 Qwen3 不同),GLM-4.5 也采用了共享专家设计。
(有意思的是,GLM-4.5 还保留了 GPT-2 与 gpt-oss 中使用的注意力偏置机制。)