【转载】大语言模型架构全面对比01:DeepSeek V3/R1

原文地址 第1章 DeepSeek V3/R1

1. DeepSeek V3/R1

想必大家已经多次听闻,DeepSeek R1 在 2025 年 1 月发布时引发了巨大反响。DeepSeek R1 是基于 DeepSeek V3 架构打造的推理模型,而 DeepSeek V3 架构 于 2024 年 12 月首次推出。

尽管本文的核心关注点是 2025 年发布的架构,但将 DeepSeek V3 纳入讨论是合理的 —— 它是在 2025 年 DeepSeek R1 推出后,才真正获得广泛关注与应用。

Continue reading 【转载】大语言模型架构全面对比01:DeepSeek V3/R1

【转载】Kimi K3 架构笔记

原文地址

Kimi K3 架构笔记

作者:Sebastian Raschka

本文整理了昨日重磅发布的开源权重模型 Kimi K3 的架构示意图,以及我个人的一些观察与思考。

1、诚然,它的结构看起来相对复杂,但本质上是去年发布的 Kimi Linear 模型的规模化生产版本 —— 参数量从 480 亿扩容至 2.8 万亿,K3 也是目前全球规模最大的开源权重模型。

Continue reading 【转载】Kimi K3 架构笔记

【转载】大语言模型架构全面对比14:Kimi Linear

原文地址 第14章 Kimi Linear

14. Kimi Linear

近年来,为提升大语言模型(LLM)的运行效率,线性注意力机制迎来了新一轮复兴。

2017 年《Attention Is All You Need》论文中提出的注意力机制(即缩放点积注意力),仍是当前大语言模型中应用最广泛的注意力变体。除传统的多头注意力外,它也衍生出了多种更高效的实现形式,例如分组查询注意力、滑动窗口注意力以及多头潜在注意力。

Continue reading 【转载】大语言模型架构全面对比14:Kimi Linear

【转载】大语言模型架构全面对比08:Kimi K2 and Kimi K2 Thinking

原文地址 第8章 Kimi K2 and Kimi K2 Thinking

8. Kimi K2 and Kimi K2 Thinking

Kimi K2 近期在 AI 领域引发了巨大反响:作为一款开源权重模型,它的性能表现极为突出。多项基准测试显示,其水平已与谷歌 Gemini、Anthropic Claude、OpenAI ChatGPT 等顶尖闭源模型不相上下。

一个值得关注的设计特点是,它采用了较新的 Muon 优化器 变体,而非行业通用的 AdamW。据我所知,这是 Muon 优化器首次在如此规模的生产级模型中替代 AdamW 落地(此前仅在最高 160 亿参数的模型上验证过可扩展性)。这一方案带来了表现优异的训练损失曲线,大概率是推动该模型登顶上述基准榜单的重要助力。

Continue reading 【转载】大语言模型架构全面对比08:Kimi K2 and Kimi K2 Thinking

【转载】大语言模型架构全面对比00:引言

最近在读Sebastian Raschka博士的文章,内容十分的详实,收获很多。

国内很多朋友没有读过,网络也有些受限,于是准备用LLM翻译成中文,自己读的时候,也方便一下其他有需要的伙伴。

本文只翻译了文章的引言部分,后续将把相同模型的内容,放到一起翻译,顺序和原文地址不太一样,主要是读起来更方便一些。如果你等不及,可以直接看英文原文(如果语言不是障碍,强烈推荐读原文):

原文地址

Continue reading 【转载】大语言模型架构全面对比00:引言

【转载】大语言模型的推理强度调控

原文地址:Controlling Reasoning Effort in LLMs,by Sebastian Raschka, on 2026-07-18

大语言模型的推理强度调控

大模型如何习得低、中、高三档推理模式

OpenAI 发布 o1 模型、让 “基于大语言模型的推理模型” 概念普及至今,已过去近两年。约四个月后,DeepSeek-R1 问世,同时公开了训练这类推理模型的可验证奖励强化学习(RLVR) 完整方案。

上周,OpenAI 发布 GPT-5.6 模型系列,该系列包含三种参数量规格,每个规格均设有约 5-6 档推理强度可选。

figure01

图1:不同推理强度档位下的GPT 5.6 Sol模型表现。(Ultra档位的基准测试数据目前尚未公布,但性能应与Max档位接近——二者推理强度相当,只是Ultra通过4个子智能体并行加速了执行过程。)

可以说,推理模型已经成为行业常态,是当代大模型发布时的标准配置。

此前,我曾撰文讲解推理模型的技术方法(《读懂推理型大语言模型》),也梳理过相关研究论文(《大语言模型推理强化学习现状》《大语言模型推理模型推理侧技术现状》),甚至写了一本 440 页的专著《从零构建推理模型》,系统讲解推理模型的开发方法。

figure02

图2:我的新书《从零构建推理模型》,全彩印刷版

这些内容都聚焦于 “如何把普通大语言模型改造成推理模型”。而本文想要重点讲解的是:如何开发出支持多档推理强度的推理模型 —— 也就是文章开头图中展示的那种能力。

不用担心,本文可以独立阅读;当然,前面提到的资料也可以作为拓展参考。


1. 推理模型的简要定义

聊到几乎任何机器学习与 AI 技术方向时,有一个共识:不要把技术术语 “按字面意思” 理解。比如机器学习里的人工神经网络,并不是真的像人脑的生物神经网络那样工作。

同理,说到 “推理模型”,也不要指望它们真的像人类一样 “思考推理”。在 AI 与大语言模型研究语境中,推理模型指的是会输出中间推理轨迹的模型—— 也就是会分步拆解问题、逐步推导,再给出最终答案的中间响应过程。

用一个例子来解释最直观:

figure03

图3:普通大语言模型的回答(左)与推理模型的回答(右)对比示意


2. 推理模型的训练扩展与推理扩展简述

提升(推理类)任务性能本质上有两条路径:训练侧算力扩展推理侧算力扩展

figure04

图4:训练扩展与推理扩展是提升大语言模型、推理模型解题能力的两种路径,图基于《Learning to reason with LLMs》绘制

我们先简单讲训练部分。

2.1 推理模型的训练

简而言之,DeepSeek-R1 提出用可验证奖励强化学习(RLVR) 训练大语言模型,使其成为推理模型。RLVR 的核心是为可验证结果的任务领域提供奖励信号(答案错误得 0 分,正确得 1 分)。
这类可验证领域包括:数学(可以用 SymPy、WolframAlpha 等符号数学工具校验结果)、代码(可以用编译器、单元测试或 LeetCode 等平台校验正确性)。

figure05

图5:RLVR训练中的准确率奖励与格式奖励示意

值得注意的是,推理轨迹本身并不参与模型训练与参数更新。DeepSeek-R1 论文中提到,研究团队曾尝试把中间推导信息用于训练,但最终发现对模型训练没有帮助,因此没有采用。(如何通过过程奖励模型把中间推理轨迹融入训练信号,仍是当前活跃的研究方向。)

figure06

图6:RLVR训练中忽略中间推理轨迹;只有最终答案与响应格式决定奖励高低

2.2 “顿悟” 时刻

如图 7 所示,仅靠最终输出的奖励进行训练,就足以让模型学会逐步推导问题 —— 也就是学会写出中间解释、回溯步骤、自我修正。模型发现自己出错、自行改正的这些节点,就被称为 “顿悟(Aha)时刻”。

figure07

图7:顿悟时刻示例:推理模型发现中间推导中的错误,在输出最终答案前自行修正

顺带一提:DeepSeek-R1 无疑是更出圈、带动了 RLVR 与推理模型研发热潮的论文,但在同一天(2025 年 1 月 22 日)的 arXiv 上,还有一篇 Kimi K1.5 的论文同期发布。另外,“RLVR” 这个术语,其实早在两个月前的《Tülu 3: Pushing Frontiers in Open Language Model Post-Training》一文中就已被提出。

DeepSeek-R1 最终更受关注的原因之一,是它证明了纯强化学习(RL)就能催生推理行为

figure08

图8:DeepSeek-R1-Zero直接在预训练基座模型上应用RLVR,无需监督微调

比如 Tülu 3 与 Kimi K1.5 都是在监督微调(SFT)后的模型上再加强化学习;DeepSeek-R1 本身也是从 DeepSeek-V3 基座的 SFT 检查点开始训练,但它同时推出了纯 RLVR 训练的变体 DeepSeek-R1-Zero。
R1-Zero 的性能弱于完整的 R1 模型,但它证明了:仅靠 RLVR,就足以教会模型生成并使用推理轨迹。

尽管 R1-Zero 更偏向概念验证,但完整的 DeepSeek-R1 推理模型训练流程通常是多阶段的,也更复杂,如前文所述。

figure09

图9:更详细的推理模型训练流水线,图示为DeepSeek-R1系列模型。更多细节可参考我的另一篇文章《读懂推理型大语言模型》

顺带一提,如今绝大多数大语言模型本质上都已是推理模型 —— 它们都采用了与 DeepSeek-R1 类似的方式,通过某种形式的 RLVR 训练而成。

2.3 推理侧算力扩展简述

除了通过训练优化推理行为,另一条提升模型性能的路径是推理侧算力扩展。简单说,就是在模型训练完成后的使用阶段,投入更多算力来获得更好的答案。

这是一个很大的话题,更详细的梳理可以看我的另一篇文章《大语言模型推理模型推理侧技术现状》:

《大语言模型推理强化学习现状》
作者:Sebastian Raschka, PhD
2025 年 4 月 19 日

下面我只提炼最核心的背景信息。

第一,用 RLVR 训练模型本身就隐含了一种推理扩展 —— 因为推理模型在推理时输出的令牌数通常比普通大语言模型更多,也就意味着推理阶段消耗了更多算力。

第二,我们可以通过推理强度档位进一步调节输出长度,这点后面会详细讲。

第三,还有很多额外的推理扩展技术。其中很流行的一种是自一致性(self-consistency),通常以多数投票的形式实现:对同一个问题多次查询模型,最终通过投票选出出现次数最多的答案。

figure10

图10:自一致性示例——一种主流的推理侧扩展技术

这种方法既适用于普通大语言模型,也适用于推理模型;可以按需使用,也可以和推理训练叠加。典型例子是 DeepSeekMath-V2:研究人员在一个数学专用推理模型的基础上,叠加了极致的推理侧扩展,最终在高难度奥数类问题上取得了业界领先成绩。

figure11

图11:两种推理扩展技术(自一致性与自我精炼)结合使用以提升数学能力,图改自《DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning》

更多其他技术的概述,还是推荐参考我的另一篇文章《大语言模型推理模型推理侧技术现状》:

《大语言模型推理模型推理侧技术现状》
作者:Sebastian Raschka, PhD
2025 年 3 月 8 日


3. 思维标记符

你可能在前面 “顿悟时刻” 的图里见过 \\ 标记,我把对应图再放一遍,不用往上翻。

figure12

图12:推理模型中的常见格式标记

这些 标签对推理能力本身没有实质作用。它们不会让模型 “学会思考”,也不是达成优秀推理性能的必要条件。不用这些分隔符训练同一个模型,大概率也能达到相近的基准测试表现。

\\ 标记的主要作用,是标注推理轨迹的起止位置,方便训练流水线或用户界面把它和最终答案区分开,也可以选择对用户隐藏(ChatGPT、Codex 等界面通常就是这么做的)。

核心结论是:`标记并没有赋予模型“思考”或更强的推理能力。不用这类标记训练模型,也能达到相近的基准性能。
而且 和 \` 这两个字符串本身也没有特殊性,换成其他分隔符也能实现同样的功能。

顺带一提,它的实现方式通常是在 RLVR 阶段加入格式奖励:不只按答案正确性给奖励,还会对正确使用 \\ 标记的行为额外加分,从而引导模型使用这些标记。

比如在 DeepSeek-R1 中,总奖励计算公式为:
总奖励 = 准确率奖励 + 格式奖励

其中格式奖励是简单的规则校验,鼓励模型把推理内容放在:

推理轨迹

结构之内。


4. 推理模式的开关控制

第一代推理模型是 “专职推理” 的 —— 也就是说,有一个 DeepSeek-V3 基座模型,还有一个独立的 DeepSeek-R1 推理模型。

无论输入提示词是什么,R1 的回复通常都非常冗长、消耗大量令牌,哪怕是很简单的问题也一样;而且它没有内置的关闭推理模式的选项。

figure13

图13:哪怕是最简单的提示词,推理模型的回复也会非常冗长

后续的模型(比如 Qwen3 等)开始尝试混合方案:同一个模型可以按需切换,既可以像普通指令微调模型一样工作,也可以切换成推理模式。

注:有些厂商叫 “思考模式”,有些叫 “推理模式”,二者指代的是同一种行为。

在 Qwen3 中,这个功能通过分词器实现,对应参数为 enable_thinking=Trueenable_thinking=False。底层逻辑是:当设置为关闭时,系统会在助手回复的开头强制插入一段空的 \\ 片段,以此关闭 Qwen3 的推理(“思考”)模式。

figure14

图14:Qwen3 0.6B推理模型在thinking=False与thinking=True时的回复。(左侧界面中隐藏了空的\\标签,因为它们属于修改后的输入提示词的一部分,并非模型生成的答案。)

训练时是如何实现的,才能让模型在推理阶段支持这种开关切换?

简而言之,正如 Qwen3 技术报告所述,这种开关能力主要通过监督微调(SFT) 引入,并在最大的旗舰模型中通过通用强化学习进一步巩固。

比如,在通过长思维链 SFT 与推理强化学习训练出初始推理模型后,会加入一个 “思考模式融合” 阶段。在这个额外的 SFT 阶段,模型会同时接触带思考与不带思考的样本:

  • /think 模式:{推理内容}{答案}

  • /no_think 模式:{答案}

思考是默认行为,因此 /think 也可以省略。后续的通用强化学习阶段会进一步强化这种模式切换与格式遵循能力。

这些 /think/no_think 标志属于 “软开关”;而前面提到的 enable_thinking=False 设置 —— 也就是在关闭时强制插入空 \\—— 则相当于 “硬开关”。

figure15

图15:Qwen3训练流水线中的“思考模式融合”阶段,用于实现推理模式开关

换句话说,分词器并不会在查询里加入 /no_think,而是直接在助手回复的开头填充好空的 \\ 片段,模型只看到最终的令牌序列,然后直接继续生成答案。

这种开关切换,本质上就是 GPT-5.6 等模型中推理强度档位的简化版,下一节我们详细展开。


5. “推理强度” 档位的工作原理

本节将简要介绍多档推理强度切换的可能实现方式 —— 这类功能最早出现在 GPT 5 等模型上,如今几乎所有旗舰大模型都已配备。

具体来说,文章开头我放了一张 Codex 中 GPT 5.6 界面的图,用户可以选择多档推理 “强度”。

figure16

图16:GPT-5.6提供六档推理强度,从轻量(Light)到极致(Ultra)

下面先说明这些档位的可能实现逻辑,下一节再介绍相关的前沿研究论文。

5.1 推理强度与回复长度、质量的关系

遗憾的是,OpenAI 并没有公开强度档位的实现细节,但我们可以通过现有信息做合理推断。

比如从去年开源的 gpt-oss 模型(我曾在《从 GPT-2 到 gpt-oss:架构演进分析》中写过)中可以得知,OpenAI 通过系统提示词来切换推理强度:在每个用户提示前加上「推理强度:低 / 中 / 高」。

figure17

图17:gpt-oss的对话模板会把选中的推理强度插入系统消息,再把提示词发给同一个模型

和预期一致,推理强度会直接影响回复长度与准确率,如下图所示。

figure18

图18:不同推理强度下gpt-oss模型的回复长度与质量(基于模型卡的标注图)

据此推测,包括最新 GPT 5.6 在内的 GPT 5 系列模型,应该也采用了类似方案。

顺带一提,从上图可以看出不同强度档位如何缩放回复长度:强度等级似乎和令牌消耗量直接相关,而令牌消耗量又和准确率正相关。
理论上可以设置比 “高” 更高的强度档位,但性能最终会进入饱和区间。这种饱和效应在 GPT 5.6 Sol 模型上体现得更明显 —— 也说明当推理预算高到一定程度后,继续增加的性价比会越来越低。

figure19

图19:推理强度提升会同时增加API成本与编码智能体性能,在GPT-5.6最高档位出现收益递减。图基于Artificial Analysis编码智能体指数v1.1绘制

另一个很新的佐证,是本周 Thinking Machine Labs 发布的开源权重模型 Inkling,它清晰展示了推理强度、令牌消耗与基准性能之间的关系。

figure20

图20:提升Inkling的强度等级通常会增加生成令牌数与基准性能,高强度下收益递减或增长不均。图来自Inkling发布博客

如本节所述,推理时可以直接通过系统提示词控制强度(ChatGPT 界面应该就是把菜单选项映射成了对应的系统提示词)。
但这不是随便哪个模型都能用的,需要对训练流水线做特定改造,接下来就讲这部分。

5.2 强度档位的两种常见实现方案

尽管 GPT 5.6 与开源 gpt-oss 都没有公开训练细节,但通常做法是:在后训练阶段,把推理强度标签加入提示词中。

实现方式主要有两种:

第一种,把它融入 RLVR 流程,针对不同的系统提示词施加不同的长度惩罚。比如 “推理强度:低” 对应较高的长度惩罚,“推理强度:高” 对应较弱甚至无长度惩罚。

第二种,在 RLVR 之后,通过监督微调(SFT)让模型学会遵循不同的强度指令。

比如在核心 RLVR 阶段之后的 SFT 阶段,训练数据里的提示词会和对应强度的目标回复配对(目标回复可以是人工撰写、其他模型生成,或生成后再筛选得到)。

figure21

图21:强度条件化的RLVR与SFT示意(这是一种可行实现,并非OpenAI训练流水线的官方确认)

在 SFT 阶段,模型直接从训练样本中学习 “强度标签” 与 “目标推理长度” 的对应关系。
而基于强化学习的实现,则是把强度标签与预算感知奖励放在 RLVR 阶段。两种方法也可以结合 —— 我猜测 gpt-oss 和 GPT 5.6 都是这么做的(毕竟 GPT 5.6 的强度档位,本质上应该就是给用户查询修改系统提示词)。

5.3 Inkling 案例研究

刚发布的 Inkling 技术报告,给出了一个虽简短但相对具体的强度训练案例。

figure22

图22:Inkling在0.2到0.99之间连续调节强度值;强度越高,通常回复越长、基准分数越高

在大规模强化学习过程中,他们对每个样本做两件事:

  1. 在系统消息中指定目标强度等级

  2. 调整每个生成令牌对应的成本权重

概念上,奖励公式大致如下:

奖励 = 正确性奖励 – λ(e) × 令牌数量

其中 e 是要求的强度等级,λ(e) 控制令牌惩罚系数。

  • 低强度:单令牌成本更高,鼓励更短的推理轨迹

  • 高强度:单令牌成本更低,允许模型消耗更多令牌

推理时,Inkling 会收到类似「思考强度:0.8」的系统消息,并据此调整令牌消耗量。
Inkling 和 gpt-oss、GPT-5.6 的区别在于:它的强度标签是 0 到 1 之间的连续数值,而非低、中、高这样的离散档位。

这也意味着 Inkling 的强度条件化主要发生在推理强化学习阶段,而不只是后期的 SFT 阶段。
不过他们没有公开具体的奖励公式、令牌成本系数,也没有说明 SFT 阶段是否也加入了强度条件化。

5.4 推理扩展与训练扩展的一点辨析

在讲相关研究论文之前,我先把本节和前面 “2.3 推理侧算力扩展简述” 的内容做个衔接。

前面我把扩展分成了训练算力扩展与推理时算力扩展。GPT-5.6 的界面刚好能很直观地展示二者的区别。

  • 左侧选择 Luna、Terra、Sol,切换的是模型本身。粗略类比的话,这对应训练侧算力扩展—— 它们是各自训练完成的不同模型。在训练方案、数据集规模固定的前提下,参数量更大的模型需要更多训练算力,生成每个令牌也通常消耗更多算力。

  • 右侧保持模型不变,只改变推理强度。这属于推理时算力扩展—— 模型权重不变,但允许模型用多或少的令牌来推导答案。

figure23

图23:模型选择菜单与推理强度菜单对应两条不同的扩展轴。选Luna/Terra/Sol是换模型;改推理强度是在固定模型下调整推理时算力

有个术语上的小说明:从菜单选不同模型,并不等于 “当下在做训练扩展”—— 训练早就完成了。更准确的理解是:模型菜单让你在不同训练规模下产出的模型之间做选择。

下面的 Artificial Analysis 测试结果,展示了这两个维度在实际中的相互作用:

每条蓝色曲线对应一个模型(Luna、Terra、Sol)。沿着曲线向右移动(提高推理强度),就是推理扩展;从一条曲线跳到另一条曲线,就是模型规模扩展 —— 这里可以看作训练扩展的实际体现。

和预期一致,两种方式都能提升基准分数,但也都会增加成本。更有意思的是曲线之间存在重叠:比如小模型开高强度,有时能达到和大模型开低强度相近的分数。

figure24

图24:GPT-5.6模型家族在编码智能体指数上的训练扩展与推理扩展表现。沿单条曲线移动对应提升推理强度;跨Luna/Terra/Sol曲线对应切换不同模型

顺带一提,图中横轴是 API 成本而非原始算力。API 成本是很实用的衡量指标,但也受服务商定价、生成令牌数量影响。另外,这些曲线的具体形态也和基准测试任务相关。

总结来说:模型大小与推理强度是两个独立的调节旋钮。你可以选更大的模型、提高推理强度,或者两者结合。哪种组合最优,取决于你对准确率、成本、延迟的要求。

到这里,本文已经把推理强度模式的工作原理与实现方式讲得比较扎实了。如果时间有限,读到这里就可以。如果想深入了解近期开源权重模型的更多技术细节,请继续往下读。


6. 补充:旗舰开源大模型实现推理强度的不同方案

(如果对额外细节不感兴趣,可以跳过本节)

第 5 节介绍了两种训练推理强度控制的方法:强度条件化监督微调,以及搭配不同令牌成本的强化学习。
原本我打算讲一些 “替代实现方案” 的研究论文,但读下来发现大多还停留在概念验证阶段,实际效果存疑。

所以我换了个方向:讲讲当前业界顶尖、有代表性的开源旗舰大模型实际在用的方案 —— 这些方法至少已经被实践验证有效。

一共选了六个案例:DeepSeek V4、Nemotron 3 Ultra、Kimi K2.5、GLM-5、Qwen3、Inkling。它们公开的细节详略不一,但各有特色。(那些只在界面上有强度档位、完全没讲训练方法的模型,这里不纳入。)

6.1 DeepSeek V4:训练独立的强度专家模型

先从 DeepSeek V4 技术报告说起,它定义了三种模式:

  • 非思考模式:直接输出结果,没有推理轨迹

  • 高强度思考:经典方案,模型把推理轨迹放在 之间,和本文开头 DeepSeek R1 部分讲的类似

  • 极致思考:和上面一致,但会加上一条特殊的系统指令(后面详述)

极致思考的额外系统提示词开头是:“推理强度:绝对最大化,不允许任何走捷径。”

figure25

图25:DeepSeek V4文档中的推理强度控制总览

乍一听像是简单的提示词工程技巧,但这条指令背后其实对应着不同的训练配置:每种模式都有自己的上下文窗口与长度惩罚(遗憾的是报告没有细说长度惩罚的具体实现)。
极致思考比高强度思考的上下文窗口更大、长度惩罚更小,因此有更多空间持续推导。

也就是说,系统指令只是选出了后训练阶段就已经塑造好的行为。把同一条指令随便给一个模型,是达不到同样效果的。

figure26

图26:DeepSeek V4在报告不同部分分别描述了三种推理强度模式,以及规模更大的教师模型池(包含十余个领域专家模型)。报告没有说明这些教师模型如何对应到非思考、高强度思考、极致思考三个模式

尽管 DeepSeek V4 的公开报告已经非常详尽,但它没有把推理模式与领域专家模型的描述对应起来,我们无法还原出精确的教师分配方式。

不过报告明确提到:最终支持多档推理强度的单一模型,是通过上述教师模型的同策略蒸馏得到的。

总结一下:DeepSeek V4 在后训练阶段培养出三个推理专家模型。从基座模型出发,先做监督微调,再通过 GRPO 算法做 RLVR;每种模式的 RL 配置不同,尤其是各自的上下文窗口与长度惩罚不一样,极致思考还额外搭配了特殊系统指令。

随后,包括领域专家在内的不同推理模式专家,被蒸馏进同一个检查点,最终模型支持全部三种强度模式。

6.2 Nemotron 3 Ultra:结合习得模式与硬性预算

Nemotron 3 Ultra 技术报告描述了三档设置:关闭推理、常规、中等强度,和上一节的 DeepSeek V4 类似。其中中等强度是比常规更省成本的推理模式。
NVIDIA 在 SFT 阶段引入该模式:用 GPT-OSS-120B 中等强度模式生成的样本做训练数据,再在 RLVR 阶段进一步优化。约 2.5% 的 RLVR 提示词使用中等强度设置(对应在奖励中加入长度调节)。

6.2.1 推理时使用 Nemotron 推理预算

推理时,三种模式都通过对话模板切换。

figure27

图27:通过对话模板设置Nemotron 3 Ultra的推理档位(示例来自官方模型卡)

  1. 常规模式:默认选项,使用 enable_thinking=True,助手回复以 \\ 开头

  2. 中等强度:同时开启 enable_thinking=Truemedium_effort=True,后者会在最新一条用户消息后追加 {reasoning effort: efficient}

顺带一提,常规与中等强度模式还可以搭配独立的推理时硬性预算。这个预算相当于外部停止机制:在已开源的实现中,对话客户端会要求模型在接近令牌上限时结束推理轨迹;如果模型还没输出 \\,客户端会强制闭合推理块,让模型继续生成最终答案。

习得的强度模式决定了模型如何使用推理令牌,而预算限制了推理轨迹的最大长度。这样一来,两种模式都可以搭配更紧或更松的预算,按需平衡成本与准确率。

  1. 关闭推理:使用 enable_thinking=False,预先填充空的 \\ 块(和第 4 节讲的 Qwen3 类似),让模型直接输出最终回复。

所以这些都是对话模板层面的控制,而非系统提示词。

6.2.2 Nemotron 的预算感知推理训练

上述推理控制能力,由两个相关的 SFT 组件支撑。
第一个就是前面说的,用 GPT-OSS-120B 的推理轨迹引入中等强度行为。
第二个是让模型适应硬性推理预算。

构建这部分训练数据的方法是:取常规推理轨迹,在随机令牌预算处截断,保留原始最终答案;插入的 \\ 标记不计入 SFT 损失。
这样模型就会学到:当推理块被外部提前闭合时,如何从不完整的推理轨迹过渡到最终答案。

中等强度的训练在 RLVR 阶段继续推进:约 2.5% 的 RL 提示词使用中等强度设置,覆盖数学、STEM、编程任务。报告提到,可以通过奖励超参数校准模式 —— 基于长度的奖励调节,可以进一步控制成本与质量的权衡。

figure28

图28:Nemotron 3 Ultra引入中等强度的方案:教师生成SFT数据、随机预算截断、RLVR阶段混入少量中等强度样本

6.3 Kimi K2.5:交替进行预算约束与无约束强化学习

Kimi K2.5 技术报告提出了一种名为令牌高效强化学习的训练方法,用于实现更低的推理强度。
(虽然本周发布了 K3,但 K3 的推理强度方法尚未公开,不过可能与 K2.5 有相似或关联之处。)

6.3.1 Kimi 的 Toggle 方法

报告提到,固定令牌预算容易让推理模型 “过拟合到短解法”—— 模型会变得更简洁(更快、更便宜),但可能失去利用更多推理算力的能力,反而导致性能下降。

figure29

图29:提出的Toggle方法让Kimi K2.5令牌效率大幅提升,同时基准整体性能基本不变。标注图来自 https://arxiv.org/abs/2602.02276

Kimi K2.5 的方法叫做Toggle,每训练固定轮次就交替切换两种强化学习阶段:

  1. 预算约束阶段:鼓励正确解法控制在对应问题的令牌预算内

  2. 无约束阶段:恢复常规的最大生成长度,让模型仍然能从更长的解法中学习

每个问题的预算,是根据 RLVR 中正确采样推演的回复长度的特定分位数估算的。并且只有当该问题的平均准确率超过阈值后,才会激活预算约束 —— 避免在模型还没稳定解题时,就强行压缩推理长度。

figure30

图30:Toggle方法两阶段总览

报告在 K2 Thinking 上评测了 Toggle 方法,发现它能减少 25%-30% 的生成令牌数,而基准性能几乎没有变化。这种收益也能从数学、编程 RL 任务迁移到 GPQA、MMLU-Pro 等通用任务上。

Toggle 提供了一套经过旗舰模型验证的方案:在训练更省令牌的推理策略的同时,保留测试时的扩展能力。

6.3.2 Toggle 对推理阶段的影响

Toggle 完全作用于 RL 训练阶段。两个交替阶段更新的是同一个策略(也就是同一个大模型),最终的统一检查点并没有 “预算 / 无预算” 的选择开关。推理时,模型默认以思考模式运行。

不过有意思的是,我查了部分 API(比如 vLLM、SGLang),Kimi K2.5 本身提供了 “思考模式 / 即时模式” 的二选一开关,默认开启思考模式。
即时模式通过官方 API 里的 thinking: {"type": "disabled"},或通过 vLLM/SGLang 部署时的 chat_template_kwargs={"thinking": False} 来关闭推理轨迹。但这些设置和 Toggle 方法是相互独立的。

另外,Kimi 官方报告没有单独给出即时模式的训练方案。但 K2.5 的 SFT 数据同时来自两个模型:早期的 K2 模型(输出直接回复、无长推理)与 K2 Thinking(输出完整推理轨迹)。
这很可能让统一检查点接触到了两种回复格式 —— 和前面 Nemotron 3 的做法类似。推理时,对话模板通过预填充 开头(思考模式)或空 块(即时模式)来切换。
但遗憾的是,报告没有公开具体的数据混合比例,也没说是否做了额外的模式专属强化学习。

更新的 Kimi K3 提供了更直接的推理时强度界面。目前 Kimi Code 文档里列出了低、高、极致三档,默认极致,通过 reasoning_effort 参数传递。
不过月之暗面(Moonshot)还没有解释这三档强度是如何训练出来的。发布博文说相关细节会在未来的 K3 技术报告中公开,我也会持续关注。

6.3.3 Kimi K3(更新)

根据本文发布后放出的 Kimi K3 技术报告,Kimi K3 设有低、高、极致三档推理模式。

研究人员会先为每个训练问题估算初始令牌预算。在简单的可验证任务上,正确回复通常得 + 1 奖励,错误得 0;但如果回复超出选定的令牌预算,奖励会直接设为 – 1—— 这给了模型很强的预算约束动力。
(非可验证任务与智能体任务的奖励设置有所不同,Kimi 也使用了习得奖励模型与成对比较。)

为了让 Kimi K3 支持三档推理强度,训练流程大致如下:
先训练一个预算较宽松的极致强度版本(“专家模型”),再逐步降低预算,训练高强度与低强度版本。

这个过程在三个领域重复进行:通用任务、通用智能体、编码智能体;每个领域的每个强度都对应一个专家模型。
比如,一个专家模型学习低强度编码行为,另一个学习极致强度智能体行为 —— 总共 9 个专家模型。

随后,这 9 个专家模型的行为通过多教师同策略蒸馏合并到单个 Kimi K3 模型中。
推理时,提示词中的自然语言思考强度指令,就可以告诉模型使用哪一档强度。

6.4 GLM-5:通过 SFT 实现轮次级与交错式思考

GLM-5 技术报告把 GLM-4.5 引入的二元思考开关,拓展到了多轮对话与工具使用场景。它定义了三种相关行为(而非三个强度档位):

  • 交错式思考:在每次回复、每次工具调用前都插入推理块

  • 保留式思考:对话中保留历史轮次的推理块,供模型后续复用

  • 轮次级思考:对话中可以单独为某一次请求开启或关闭推理

推理时,轮次级思考就是实际的开关。在 [Z.ai](Z.ai) 的 API 中,思考默认开启,可以对单条请求用 thinking: {"type": "disabled"} 关闭。
托管部署的实现未公开,但开源的 GLM-5 对话模板展示了自托管(Transformers、vLLM、SGLang)时的等价机制:

  • 开启思考时,助手回复以 <|assistant|> 开头

  • 关闭思考时,助手回复以 <|assistant|> 开头 —— 立刻闭合推理块,直接生成最终答案

报告称这些行为都是在多任务 SFT 阶段,配合更新后的对话模板引入的。

SFT 之后,GLM-5 会经过推理强化学习、智能体强化学习与通用强化学习,最后还有一步同策略蒸馏 —— 用前面阶段的检查点当教师,帮助最终模型补回连续 RL 阶段可能弱化的能力。

figure31

图31:GLM-5训练流水线

6.5 Qwen3:模式融合 + 推理时截断

第 4 节已经讲过 Qwen3,这里只总结和本次对比相关的部分。
根据 Qwen3 技术报告,其后训练流水线分为四个阶段:长思维链监督微调、推理强化学习、思考模式融合、通用强化学习。

思考模式融合是实现推理开关的核心阶段:模型在 SFT 中混合学习带思考与不带思考的样本。
带思考样本包含完整推理轨迹;不带思考样本以空的 \\ 块开头,后面跟着简短答案。
后续的通用强化学习阶段会进一步巩固两种行为的指令遵循与格式遵循能力。

Qwen3 也支持硬性思考预算:到达阈值时强制停止推理,插入 “停止思考” 指令,再让模型继续输出最终答案。
报告称这种部分推理行为并没有专门训练,是思考模式融合之后自然涌现的能力。

总结来说,Qwen3 拥有习得式开关 + 推理时预算,方案比 DeepSeek V4 和 Nemotron 更简单。

6.6 Inkling:用连续强度值条件化强化学习

第 5.3 节已经讲过 Inkling,这里再精简总结:
它的技术报告提到,模型使用连续强度条件化(0.0 到 1.0 之间的数值),而非固定的档位标签。

经过一个规模较小的初始 SFT 阶段后,Inkling 的后训练主要来自异步强化学习,累计超过 3000 万次采样推演。
目标强度会写入系统消息,RL 过程中根据强度值调整令牌长度惩罚 —— 如前所述,令牌成本越高,回复越短;令牌成本越低,模型越有空间充分推理。

6.7 已知方案总览

下表汇总了六份技术报告中公开的训练机制与推理控制方式。

figure32

图32:六款支持推理强度设置的开源模型,其训练机制与推理控制方式对比

纵观这六款开源模型,可以提炼出一套共通框架:

第一,通过SFT 与对话模板引入强度模式控制。Qwen3 明确混合了思考与非思考样本,GLM-5 则加入了交错、保留、轮次级等思考模式。

第二,模式条件化的强化学习阶段:上下文窗口与长度惩罚会随要求的强度变化。DeepSeek V4、Nemotron 3 Ultra、Inkling 都采用了这种思路。

第三,提升明确预算下的鲁棒性。Nemotron 在随机截断的轨迹上训练,Qwen3 支持从强制中断的推理中继续,Kimi 则交替进行预算约束与无约束 RL。这些方法都能在推理长度变化、甚至被截断时,尽量保证答案质量。


7. 结语

本文介绍的开源模型案例,通过多种不同机制实现了推理强度控制。看似相似的档位标签,背后可能是独立专家模型、混合 SFT 数据、模式条件化奖励、硬性令牌预算,或是它们的组合。

很难说哪种方法最好。这些模型的基座检查点、训练数据、后训练算力、基准测试、服务目标都不一样,报告也省略了很多做受控对比所需的细节。而且很可能不存在 “万能方案”—— 适合交互式助手的方法,放到长时间运行的编码智能体上可能效果很差。

终极目标当然是自动选择推理强度。之前 GPT 5 的 Auto 模式就做过尝试,但这个问题并不好解,最终实现效果可能不尽如人意,所以后来从界面上下架了(至少我现在找不到了)。

短期内,我认为推理强度仍会是显式的模型输入,最常见的传递方式是系统提示词。
不过,大模型外层的智能体框架,或是内部路由模块,会越来越多地根据任务状态与可用资源,自动推断合适的模式与预算 —— 当然,仍然保留用户手动覆盖的权限。

我还是期待强度选择能变得更自动化。就像 GPT 5 的自动模式那样,用一个轻量模型或路由器,根据请求、工具状态、剩余时间 / 令牌预算选择模式,同时允许用户手动覆盖 —— 当你想优先优化延迟、成本,或是追求极致性能时,手动调整会很有用。

我知道这篇文章很长,话题也不算抢眼。但在大家都在聊大模型、推理模型、智能体的当下,推理强度的实现细节还很少被系统梳理过。希望这篇独有的综述能对你有所帮助!


拓展资源

如果你想动手实现推理模型的核心训练方法,我的《从零构建推理模型》一书会分步讲解可验证奖励强化学习与推理侧扩展,附带完整代码。

本文聚焦于 “训练好的推理模型如何支持多档强度”,而这本书会退一步,讲解如何从零把普通大语言模型改造成推理模型。它是《从零构建大语言模型》的续作,承接前作的内容继续深入。

纸质版现已开始发售:

《从零构建推理模型》[Manning 出版社] [亚马逊]
如果你喜欢我之前的《从零构建大语言模型》,这本就是它的续作,从零实现推理侧扩展技术与强化学习算法。

最后,非常感谢各位付费订阅者的支持 —— 你们的支持是我持续撰写深度独立分析、分享配套代码、图表与实验的最大动力。

【转载】大语言模型研究论文:2026年精选清单(1-5月)

LLM Research Papers: The 2026 List (January to May),by Sebastian Raschka, on 2026-06-06

大语言模型研究论文:2026年精选清单(1-5月)

很多读者可能知道,我一直有个长期习惯:会持续整理一份研究论文清单,收录那些我想研读、复盘,或是未来写文章、做项目时会引用的文献。

去年我分享过两份整理好的论文清单,分别覆盖上半年(1-6 月)和下半年(7-12 月)。

不少读者反馈这些清单非常实用,因此我沿用同样的思路,整理了 2026 年上半年的新清单,收录了 2026 年 1 月至 5 月我标记的论文。

请注意,这并非今年所有发表论文的完整汇总 —— 每天都有大量论文发布,做完整汇总完全不现实。这份清单是基于我个人认为有趣、或与自身工作相关的论文筛选而成的精选参考列表。整理时我仔细核对了每篇论文的标题、摘要与主题定位,但坦白说,我也只深入精读了其中一部分。

为什么要做这些清单?每当我撰写文章、书稿章节、代码示例或是备课时,常会想起 “之前在哪看到过一篇相关论文”,但回头去找往往格外麻烦。一份分类清晰的 Markdown 清单就能解决这个问题,希望对你们也同样有用。(即便在如今大模型网页搜索的时代,一份有明确语境的专题清单依然很有价值。)

今年的清单依然偏重推理模型、强化学习与高效推理方向 —— 毕竟我个人更倾向于收藏和当前工作相关的论文。不过和 2025 年的清单相比,我也新增了更多关于智能体框架、工具调用、长上下文、扩散语言模型以及实际服务部署基础设施的论文,这既是我当下重点关注的方向,也是整个领域的发展趋势。

本研究论文清单分为以下类别。

  • 架构与模型设计

  • 高效训练与规模化

  • 推理效率与 KV 缓存

  • 稀疏注意力与长上下文

  • 推理与测试时计算

  • 强化学习与可验证奖励强化学习(RLVR)

  • 智能体系统与工具调用

  • 代码智能体与软件工程

  • 扩散语言模型

  • 模型评估与基准测试


Continue reading 【转载】大语言模型研究论文:2026年精选清单(1-5月)

【转载】大语言模型架构最新进展:KV共享、mHC与压缩注意力

原文地址:Recent Developments in LLM Architectures: KV Sharing, mHC, and Compressed Attention,by Sebastian Raschka, 2025-05-16

大语言模型架构最新进展:KV共享、mHC与压缩注意力

从 Gemma 4 到 DeepSeek V4:开源大模型如何降低长上下文成本

短暂休假陪伴家人后,我很高兴回归,跟进这几周密集发布的开源大语言模型。其中最突出的一点是,新一代架构都将重心放在了长上下文效率优化上。

随着推理模型与智能体工作流需要保留更多 token(且保留时长更长),KV 缓存大小、内存带宽与注意力计算成本很快成为核心瓶颈。为此,大模型开发者正在引入越来越多的架构技巧来降低这些开销。

本文重点分析四个典型设计:Gemma 4 的 KV 共享与逐层嵌入、Laguna XS.2 的逐层注意力配额、ZAYA1-8B 的压缩卷积注意力,以及 DeepSeek V4 的流形约束超连接(mHC)+ 压缩注意力方案。

在我的架构示意图里,这些改动大多看起来只是微调,但其中不少是相当精巧的设计变更,值得展开详细讨论。


figure01

图 1 2026 年 4-5 月发布的主流开源大模型架构示意图。完整图片与更多细节可在我的大模型架构图库中查看。图中未列出所有模型尺寸;Qwen3.6 包含 27B 与 35B-A3B 版本,ZAYA1 以 8B 模型为代表(省略 ZAYA1-base 与 ZAYA1-reasoning-base 版本)。虚线框标注的架构将在本文中详细解读。

Continue reading 【转载】大语言模型架构最新进展:KV共享、mHC与压缩注意力

【转载】我理解大语言模型架构的工作流程

My Workflow for Understanding LLM Architectures,by Sebastian Raschka, 2024-04-18

我理解大语言模型架构的工作流程

一套面向学习、用于解析新开源权重模型的工作方法

过去几个月里,很多人希望我分享一下,我是如何梳理出文章、演讲以及「大语言模型架构图鉴(LLM-Gallery)」里那些架构示意图的。因此我觉得,把自己常用的流程整理成文应该会有所帮助。

简而言之,我通常会从官方技术报告入手,但如今的论文往往不如以往详尽,产业实验室发布的绝大多数开源权重模型更是如此。

好在如果模型权重已在 Hugging Face 模型中心(Model Hub)公开,且 Python 的 transformers 库已支持该模型,我们通常可以直接查看配置文件与参考实现,获取更多架构细节。而能正常运行的代码从不会说谎。

figure01

图 1:这套工作流的核心出发点 —— 如今论文细节往往不足,但可运行的参考实现为我们提供了具象的研究对象。

Continue reading 【转载】我理解大语言模型架构的工作流程

【转载】Karpathy LLM Wiki

2026年4月,前OpenAI创始成员Andrej Karpathy提出了一种新的个人知识管理新范式,核心是让大语言模型(LLM)充当 “知识编译器”,将零散原始资料(文章、论文、笔记等)自动生成结构化、可持久化、能复利增长的 Markdown 维基知识库。

它采用 Raw Sources(原始资料)、Wiki(LLM 生成的结构化知识库)、Schema(规范配置)三层架构,区别于传统 RAG 的 “运行时检索”,LLM Wiki 提前处理知识并持续维护更新,形成高密度互联的知识图谱(交叉引用的 Markdown Wiki),人类仅负责资料收集与判断,大幅降低知识维护成本。

Continue reading 【转载】Karpathy LLM Wiki