【转载】大语言模型架构全面对比12:Qwen3-Next

原文地址 第16章 DeepSeek V3.2

12. Qwen3-Next

2025 年 9 月 11 日,通义千问团队发布了 Qwen3 Next 80B-A3B(见图 35),提供指令微调版(Instruct)与思考版(Thinking)两种形态。尽管其设计基于前文介绍的 Qwen3 架构,但我将它单独列为一节,一是保持图号的连贯性,二是突出其部分设计上的改动。

12.1 专家规模与数量

全新的 Qwen3 Next 架构有一个突出特点:尽管总参数量仅为前代 235B-A22B 模型的三分之一(见图 35),但专家数量提升至原来的四倍,还额外加入了共享专家。这两项设计选择(高专家数量 + 引入共享专家),正是我在本次发布前就指出过的行业未来方向,尤其是在本文开头链接的视频版本中曾重点提及。

figure35

图 35:5 月发布的初代 Qwen3 模型(左)与 9 月发布的 Qwen3 Next 模型(右)对比

Continue reading 【转载】大语言模型架构全面对比12:Qwen3-Next

【转载】大语言模型架构全面对比06:Qwen3

原文地址 第6章 Qwen3

6. Qwen3

通义千问团队始终持续输出高质量的开源权重大语言模型。我还记得 2023 年 NeurIPS 大会期间,我参与联合指导大语言模型效率挑战赛,最终所有夺冠方案均基于 Qwen2 搭建。

如今的 Qwen3 是又一标杆级模型系列,在各自参数量级的排行榜上都位居头部。该系列包含 7 款稠密模型,参数量分别为 0.6B、1.7B、4B、8B、14B 和 32B;另有 2 款混合专家(MoE)模型:30B-A3B 与 235B-A22B。

(顺带说明:“Qwen3” 中间未加空格并非笔误,我只是尽量保留通义千问开发团队选定的原始拼写。)

6.1 Qwen3(稠密版本)

我们先来看稠密模型的架构。截至本文撰写时,0.6B 参数版本很可能是当前新一代开源模型中参数规模最小的。以我的实际体验来看,在如此小的体量下,它的表现十分出色。如果要在本地运行,它的 token 生成吞吐量高,内存占用低;更重要的是,参数量小也意味着它很适合在本地开展训练(用于教学研究目的)。

因此在大多数场景下,我已经用 Qwen3 0.6B 替代了 Llama 3 1B。二者的架构对比如下图所示。

figure18

Continue reading 【转载】大语言模型架构全面对比06:Qwen3

【转载】从DeepSeek V3到V3.2:架构、稀疏注意力与强化学习更新

原文地址:From DeepSeek V3 to V3.2: Architecture, Sparse Attention, and RL Updates,by Sebastian Raschka, on 2026-01-01

从DeepSeek V3到V3.2:架构、稀疏注意力与强化学习更新

解读 DeepSeek 旗舰开源权重模型的演进之路

与 DeepSeek V3 的发布节奏类似,团队选择在美国一个重要假期的周末推出了这款全新旗舰模型。DeepSeek V3.2 的性能达到了 GPT-5 与 Gemini 3.0 Pro 的级别,同时还是一款开源权重模型,绝对值得深入研究。

figure01

图 1:DeepSeek V3.2 与闭源旗舰模型的基准测试对比。本图为 DeepSeek V3.2 报告的标注版插图。

我曾在《LLM 架构大盘点》一文的开篇详细介绍过其前身 DeepSeek V3,过去几个月里,随着新架构不断发布,我也一直在持续更新这篇文章。原本刚和家人过完感恩节假期回来,我只打算给这篇文章新增一个小节,补充 DeepSeek V3.2 的相关内容,但后来发现值得探讨的亮点太多,便决定单独写一篇更完整的长文。

他们的技术报告中有大量值得挖掘的内容与经验,我们这就开始。

Continue reading 【转载】从DeepSeek V3到V3.2:架构、稀疏注意力与强化学习更新

【转载】大语言模型架构全面对比16:DeepSeek V3.2

原文地址 第16章 DeepSeek V3.2

16. DeepSeek V3.2

本文以 2024 年 12 月发布的 DeepSeek V3 开篇。那段时间 DeepSeek 陆续推出了多款模型,但我大多没有展开介绍,因为它们都不属于 DeepSeek V3、DeepSeek R1 这类重磅旗舰级模型发布。

figure47

图 47:自 DeepSeek V3 起 DeepSeek 系列模型的发布时间线。核心模型以红色标注。

Continue reading 【转载】大语言模型架构全面对比16:DeepSeek V3.2

【转载】大语言模型架构全面对比01:DeepSeek V3/R1

原文地址 第1章 DeepSeek V3/R1

1. DeepSeek V3/R1

想必大家已经多次听闻,DeepSeek R1 在 2025 年 1 月发布时引发了巨大反响。DeepSeek R1 是基于 DeepSeek V3 架构打造的推理模型,而 DeepSeek V3 架构 于 2024 年 12 月首次推出。

尽管本文的核心关注点是 2025 年发布的架构,但将 DeepSeek V3 纳入讨论是合理的 —— 它是在 2025 年 DeepSeek R1 推出后,才真正获得广泛关注与应用。

Continue reading 【转载】大语言模型架构全面对比01:DeepSeek V3/R1

【转载】Kimi K3 架构笔记

原文地址

Kimi K3 架构笔记

作者:Sebastian Raschka

本文整理了昨日重磅发布的开源权重模型 Kimi K3 的架构示意图,以及我个人的一些观察与思考。

1、诚然,它的结构看起来相对复杂,但本质上是去年发布的 Kimi Linear 模型的规模化生产版本 —— 参数量从 480 亿扩容至 2.8 万亿,K3 也是目前全球规模最大的开源权重模型。

Continue reading 【转载】Kimi K3 架构笔记

【转载】大语言模型架构全面对比14:Kimi Linear

原文地址 第14章 Kimi Linear

14. Kimi Linear

近年来,为提升大语言模型(LLM)的运行效率,线性注意力机制迎来了新一轮复兴。

2017 年《Attention Is All You Need》论文中提出的注意力机制(即缩放点积注意力),仍是当前大语言模型中应用最广泛的注意力变体。除传统的多头注意力外,它也衍生出了多种更高效的实现形式,例如分组查询注意力、滑动窗口注意力以及多头潜在注意力。

Continue reading 【转载】大语言模型架构全面对比14:Kimi Linear

【转载】大语言模型架构全面对比08:Kimi K2 and Kimi K2 Thinking

原文地址 第8章 Kimi K2 and Kimi K2 Thinking

8. Kimi K2 and Kimi K2 Thinking

Kimi K2 近期在 AI 领域引发了巨大反响:作为一款开源权重模型,它的性能表现极为突出。多项基准测试显示,其水平已与谷歌 Gemini、Anthropic Claude、OpenAI ChatGPT 等顶尖闭源模型不相上下。

一个值得关注的设计特点是,它采用了较新的 Muon 优化器 变体,而非行业通用的 AdamW。据我所知,这是 Muon 优化器首次在如此规模的生产级模型中替代 AdamW 落地(此前仅在最高 160 亿参数的模型上验证过可扩展性)。这一方案带来了表现优异的训练损失曲线,大概率是推动该模型登顶上述基准榜单的重要助力。

Continue reading 【转载】大语言模型架构全面对比08:Kimi K2 and Kimi K2 Thinking

【转载】大语言模型架构全面对比00:引言

最近在读Sebastian Raschka博士的文章,内容十分的详实,收获很多。

国内很多朋友没有读过,网络也有些受限,于是准备用LLM翻译成中文,自己读的时候,也方便一下其他有需要的伙伴。

本文只翻译了文章的引言部分,后续将把相同模型的内容,放到一起翻译,顺序和原文地址不太一样,主要是读起来更方便一些。如果你等不及,可以直接看英文原文(如果语言不是障碍,强烈推荐读原文):

原文地址

Continue reading 【转载】大语言模型架构全面对比00:引言

【转载】大语言模型的推理强度调控

原文地址:Controlling Reasoning Effort in LLMs,by Sebastian Raschka, on 2026-07-18

大语言模型的推理强度调控

大模型如何习得低、中、高三档推理模式

OpenAI 发布 o1 模型、让 “基于大语言模型的推理模型” 概念普及至今,已过去近两年。约四个月后,DeepSeek-R1 问世,同时公开了训练这类推理模型的可验证奖励强化学习(RLVR) 完整方案。

上周,OpenAI 发布 GPT-5.6 模型系列,该系列包含三种参数量规格,每个规格均设有约 5-6 档推理强度可选。

figure01

图1:不同推理强度档位下的GPT 5.6 Sol模型表现。(Ultra档位的基准测试数据目前尚未公布,但性能应与Max档位接近——二者推理强度相当,只是Ultra通过4个子智能体并行加速了执行过程。)

Continue reading 【转载】大语言模型的推理强度调控