15. Olmo 3 Thinking
艾伦人工智能研究院(Allen AI)于 11 月 20 日发布了全新的 Olmo 3 7B 与 32B 模型。(官方拼写已从 OLMo 调整为 Olmo,本节将沿用这一新版命名。)
如前文所述,Olmo 系列模型一直具备特殊的研究价值,核心原因在于它的完全开源属性。这里的 “完全开源” 指团队同步公开了详细训练报告、多轮训练检查点、训练数据集信息等全部研发资料。换言之,Olmo 模型具备完整的技术透明度。
本次 Olmo 模型家族在基础版、指令微调版之外,新增了推理版本;Olmo 3 的技术报告中也收录了大量训练相关的细节。但本文聚焦架构对比主题,因此本节仅围绕 Olmo 3 的架构设计展开分析。
与 Olmo 3 最具横向可比性的参照模型是 Qwen3——Qwen3 系列有两款参数量相近的模型,且整体性能处于同一梯队。
首先我们来看两款中参数量更小的 Olmo 3 7B。

图 44:Olmo 3 7B 与 Qwen3 8B 架构对照
可以看到,Olmo 3 的架构与 Qwen3 较为接近。但值得注意的是,这一设计大概率传承自前代 Olmo 2,并非参考 Qwen3 而来。
与 Olmo 2 保持一致,Olmo 3 仍然采用后归一化(post-norm)而非前归一化(pre-norm);研究团队在 Olmo 2 的论文中证实,该设计能够提升训练过程的稳定性。
有意思的是,7B 版本依然沿用了与 Olmo 2 类似的多头注意力机制;但为了提升运行效率、压缩 KV 缓存体积,该版本新增了滑动窗口注意力机制(设计思路与 Gemma 3 类似)。
接下来我们看 32B 版本的模型。

图 45:Olmo 3 32B 与 Qwen3 32B 架构对照
整体而言,二者架构逻辑一致,仅参数量规模有所放大。同时,模型各模块的维度比例(例如前馈层输入维度到中间维度的扩张比例等)也与 Qwen3 大致吻合。
我推测,由于词表规模更小,Olmo 3 的初始架构规模本应略小于 Qwen3;为了得到可直接对标对比的 32B 参数模型,团队将前馈层中间维度的扩张倍数,从 Qwen3 的 5 倍提升至了 Olmo 3 的 5.4 倍。
另外需要注意,32B 版本采用的是分组查询注意力(GQA)机制。
最后还有一处细节:Olmo 3 通过 YaRN 技术实现了 64k 的上下文长度扩展,但该技术仅应用于全局注意力层(非滑动窗口注意力层)。(YaRN 本质上是一种精细化的 RoPE 重缩放技术,能够在长上下文场景下更好地保留模型性能。)
在 Qwen3 中,YaRN 是可选功能,可将原生 32k token 的上下文长度扩展至 131k。
如果你想了解更多架构实现细节,我在这份独立的 Notebook 中从零复现了完整的 Olmo 3 模型。

图 46:从零实现的 Olmo 3 模型代码