【转载】The Big LLM Architecture Comparison

最近在读Sebastian Raschka博士的文章,内容十分的详实,收获很多。

国内很多朋友没有读过,网络也有些受限,于是准备用LLM翻译成中文,自己读的时候,也方便一下其他有需要的伙伴。

本文只翻译了文章的引言部分,后续将把相同模型的内容,放到一起翻译,顺序和原文地址不太一样,主要是读起来更方便一些。如果你等不及,可以直接看英文原文(如果语言不是障碍,强烈推荐读原文):

原文地址

如果你对Sebastian Raschka博士尚不熟悉,你大概听说过这两本书:

Build a Large Language Model (From Scratch)
Build a Reasoning Model (From Scratch)

或者见过这个图:

LLM architecture gallery

翻译开始咯:


大语言模型架构全面对比:从 DeepSeek V3 到 GLM-5:现代大语言模型架构设计纵览

初代 GPT 架构问世至今已有七年。回望 2019 年的 GPT-2,再看 2024 至 2025 年的 DeepSeek V3 与 Llama 4,乍看之下会发现这些模型的结构依然高度相似,这一点或许令人意外。

诚然,位置编码已从绝对位置编码演进为旋转位置编码(RoPE),多头注意力也基本被分组查询注意力所取代,效率更高的 SwiGLU 替代了 GELU 这类激活函数。但在这些细节优化之下,我们究竟是迎来了颠覆性的架构变革,还是仅仅在原有的架构基石上反复打磨?

想要通过对比不同大语言模型,找出决定性能优劣的核心因素,难度是出了名的大:数据集、训练技巧、超参数的差异极大,且相关信息往往缺乏完整公开的记录。

不过我认为,梳理架构本身的结构性演变,以此一窥 2025 年大语言模型开发者的技术方向,依然有很高的价值。(下图 1 展示了其中部分模型的架构。)

figure01

图 1:本文涵盖的部分模型架构

因此,本文不会讨论基准测试成绩或训练算法,而是聚焦于定义了当下旗舰开源模型的架构演进方向。

(大家可能还记得,不久前我刚写过多模态大语言模型相关内容;本文将聚焦近期模型的文本能力,多模态相关的讨论留待后续再展开。)

小贴士:本文内容较为详实,建议大家通过导航栏查看目录(将鼠标悬停在 Substack 页面左侧即可调出)来快速定位内容。

可选内容:下方视频是本文的配音精简版

Leave a Reply

Your email address will not be published. Required fields are marked *

*