【转载】大语言模型架构全面对比10:Grok 2.5

原文地址 第10章 Grok 2.5

10. Grok 2.5

本文首次上线几周后,xAI 发布了其 2700 亿参数 Grok 2.5 模型的权重。

我认为有必要把它补充进来,因为 Grok 2.5 是 xAI 去年的旗舰生产级模型。截至目前,我们讨论的所有模型从发布之初就是开源权重模型。例如,gpt-oss 大概率不是 GPT-4 的开源权重复刻版,而是专门为开源社区训练的定制模型。

借助 Grok 2.5,我们得以难得一窥真实生产级系统的面貌,尽管这是去年的模型。

架构层面,Grok 2.5 整体看起来相当标准(图 32),但仍有几个值得注意的细节。

image32

图 32:Grok 2.5 与同等规模的 Qwen3 模型对比

例如,Grok 2.5 采用「少量大专家」的配置(共 8 个专家),这是相对早期的设计思路。如前文所述,DeepSeekMoE 论文等更新的设计更倾向于「多而小」的专家配置,Qwen3 也采用了这种方案。

另一个有意思的设计是它采用了近似共享专家的机制。图 32 左侧所示的额外 SwiGLU 模块,作用相当于一个始终激活的共享专家。它和经典的共享专家设计并不完全一致 —— 其中间维度扩大了一倍,但核心思路相同。(Qwen3 没有采用共享专家这点我一直觉得很有意思,看看 Qwen4 及后续模型会不会改变这个设计,值得关注。)

Leave a Reply

Your email address will not be published. Required fields are marked *

*