【转载】从零理解并实现Qwen3

原文地址:Understanding and Implementing Qwen3 From Scratch,by Sebastian Raschka, on 2025-09-06

从零理解并实现Qwen3

深度解析主流开源大语言模型之一

此前,我在《大语言模型架构大比拼》一文中对比了2025年最具代表性的开源权重架构;随后又在《从GPT-2到gpt-oss:架构演进概念分析》中,从概念层面深入拆解了各类架构组件。

好事成三。在介绍今年夏天值得关注的研究亮点之前,我打算从代码层面动手实践,深入拆解这些架构。跟着本文一步步操作,你就能理解模型的底层运行原理,还能获得可复用的基础模块,适配到自己的实验或项目中。

为此我选择了Qwen3(5月首次发布,7月完成更新)——截至撰文时,它是最受青睐、应用最广的开源权重模型系列之一。

在我看来,Qwen3系列模型广受欢迎的原因如下:

  • 采用对开发者与商业应用友好的开源协议(Apache 2.0许可证),除开源许可证本身条款外无任何附加限制(其他部分开源大模型会额外设置使用约束)。

  • 性能表现优异:截至撰文时,开源权重的235B-Instruct版本在LMArena排行榜上位列第8,与闭源模型Claude Opus 4持平。排名更高的开源大模型仅有两款——参数量是其3倍的DeepSeek 3.1,以及参数量是其4倍的Kimi K2。9月5日,Qwen3在其平台发布了1万亿参数的“max”版本,在所有主流基准测试中均超越Kimi K2、DeepSeek 3.1与Claude Opus 4;不过该模型目前为闭源状态。

  • 覆盖多种模型尺寸,适配不同算力预算与应用场景,从0.6B稠密模型到480B参数的混合专家(MoE)模型一应俱全。

本文篇幅较长,因为包含纯PyTorch从零实现的完整代码。尽管代码部分看起来篇幅较多,但我相信相比单纯的概念示意图,代码能更好地帮你理解各个基础模块的原理。

提示1:如果你是在邮件收件箱中阅读本文,较窄的行宽可能导致代码片段换行错乱。为获得更好的阅读体验,建议在网页浏览器中打开本文。
提示2:你可以使用网站左侧的目录,在各章节间更便捷地跳转。

figure01

图1:本文将用纯PyTorch讲解并复现的Qwen3稠密架构与混合专家(MoE)架构示意图

=== 以下为付费内容 ===

Leave a Reply

Your email address will not be published. Required fields are marked *

*