【转载】我理解大语言模型架构的工作流程

My Workflow for Understanding LLM Architectures,by Sebastian Raschka, 2024-04-18

我理解大语言模型架构的工作流程

一套面向学习、用于解析新开源权重模型的工作方法

过去几个月里,很多人希望我分享一下,我是如何梳理出文章、演讲以及「大语言模型架构图鉴(LLM-Gallery)」里那些架构示意图的。因此我觉得,把自己常用的流程整理成文应该会有所帮助。

简而言之,我通常会从官方技术报告入手,但如今的论文往往不如以往详尽,产业实验室发布的绝大多数开源权重模型更是如此。

好在如果模型权重已在 Hugging Face 模型中心(Model Hub)公开,且 Python 的 transformers 库已支持该模型,我们通常可以直接查看配置文件与参考实现,获取更多架构细节。而能正常运行的代码从不会说谎。

figure01

图 1:这套工作流的核心出发点 —— 如今论文细节往往不足,但可运行的参考实现为我们提供了具象的研究对象。

需要说明的是,这套流程主要针对开源权重模型,并不适用于 ChatGPT、Claude、Gemini 这类权重与技术细节均为闭源的模型。

此外,这套流程刻意保留了较强的手动属性,其中部分环节可以自动化。但如果目标是真正理解这些架构的运行原理,在我看来,手动完成几次完整流程依然是最好的练习方式之一。

figure02

图 2:从宏观上看,这套工作流的路径是:从配置文件与代码出发,最终沉淀出架构层面的认知。

【以下为付费内容,请跳转至原文付费订阅,6$,两杯咖啡钱】
My Workflow for Understanding LLM Architectures,by Sebastian Raschka, 2024-04-18

=== 以下为付费内容 ===

Leave a Reply

Your email address will not be published. Required fields are marked *

*