原文地址:The State of Reinforcement Learning for LLM Reasoning,by Sebastian Raschka, on 2025-04-19
大语言模型推理的强化学习现状
解读GRPO与推理模型论文的新洞见
这个月发生了不少大事,尤其是GPT-4.5和Llama 4等新一代旗舰模型相继发布。但你可能已经注意到,市场对这些发布的反响相对平淡。为什么?原因之一或许是GPT-4.5和Llama 4仍属于传统模型,也就是说它们的训练过程没有针对推理能力引入专门的强化学习。
与此同时,xAI和Anthropic等竞争对手已经在自家模型中加入了更多推理能力与功能。例如,xAI的Grok和Anthropic的Claude界面现在都为特定模型配备了“思考”(或“深度思考”)按钮,可以显式开启推理能力。
无论如何,市场对GPT-4.5和Llama 4这类非推理模型反响平淡,说明我们正在逼近仅靠扩大模型规模与数据量所能达到的性能上限。
不过,OpenAI近期发布的o3推理模型证明,只要有策略地投入算力,尤其是通过面向推理任务定制的强化学习方法,性能仍有相当大的提升空间。(根据OpenAI工作人员在近期直播中的透露,o3的训练算力是o1的10倍。)

虽然推理能力本身并非万能灵药,但迄今为止,它能稳定提升模型在高难度任务上的准确率与问题解决能力。而且我预计,聚焦推理的后训练将成为未来大语言模型流水线的标准操作。
因此,本文将探讨通过强化学习实现推理的最新进展。

由于文章篇幅较长,我在下方整理了目录概览。如需跳转目录,请使用网页视图左侧的滑动条。
-
理解推理模型
-
RLHF基础:一切的起点
-
PPO简介:强化学习的主力算法
-
强化学习算法:从PPO到GRPO
-
强化学习奖励建模:从RLHF到RLVR
-
DeepSeek-R1推理模型的训练方式
-
近期推理模型强化学习论文的经验教训
-
值得关注的推理模型训练研究论文
小贴士:如果你已经熟悉推理基础、强化学习、PPO和GRPO,可以直接跳转到“近期推理模型强化学习论文的经验教训”部分,该部分汇总了近期推理研究论文中的有趣洞见。
理解推理模型
绕不开的话题当然是“推理”的定义。简而言之,推理指的是让大语言模型更擅长处理复杂任务的推断方法与训练技术。
为了更详细地说明其实现原理(就目前的技术而言),我对推理的定义如下:
在大语言模型的语境下,推理指模型在给出最终答案之前生成中间步骤的能力。这一过程通常被称为思维链(Chain-of-Thought, CoT)推理。在思维链推理中,大语言模型会显式生成一系列结构化的陈述或计算过程,展示自己得出结论的推导路径。
下方是配合该定义的示意图。

如果你刚接触推理模型,想要更全面的入门介绍,推荐阅读我之前的文章:
https://magazine.sebastianraschka.com/p/first-look-at-reasoning-from-scratch
https://magazine.sebastianraschka.com/p/understanding-reasoning-llms
正如本节开头所暗示的,提升大语言模型的推理能力有两种途径,OpenAI一篇博客中的示意图很好地诠释了这一点:

准确率提升可通过增加训练算力或测试时算力实现,其中测试时算力与推理时算力、推理时扩展同义。
在我之前的文章中:
https://magazine.sebastianraschka.com/p/state-of-llm-reasoning-and-inference-scaling
我只重点讨论了测试时算力方法。而在本文中,我终于可以详细聊聊训练方法了。
RLHF基础:一切的起点
用于构建和优化推理模型的强化学习训练方法,或多或少都与用于开发和对齐传统大语言模型的**基于人类反馈的强化学习(Reinforcement Learning with Human Feedback, RLHF)**方法相关。因此,在讨论面向推理的强化学习训练变体之前,我先简要回顾一下RLHF的工作原理。
传统大语言模型通常经历三步训练流程:
-
预训练
-
监督微调
-
对齐(通常通过RLHF实现)
RLHF是“原版”的大语言模型对齐方法,是遵循InstructGPT论文开发大语言模型的标准流程之一,该论文描述了初代ChatGPT模型的训练方案。
RLHF的最初目标是让大语言模型对齐人类偏好。例如,假设你多次调用大语言模型,针对同一个提示生成多个答案,RLHF会引导模型生成更多你偏好风格的答案。(通常,RLHF也用于模型的安全对齐:避免泄露敏感信息、避免使用脏话等等。)
如果你刚接触RLHF,这里有我几年前一次演讲的片段,用不到5分钟讲解了RLHF:
或者,下文用文字形式描述RLHF。
RLHF流水线以预训练模型为起点,先进行监督式微调。这一步微调还不属于强化学习环节,而主要是前置准备。
随后,RLHF通过一种名为**近端策略优化(Proximal Policy Optimization, PPO)**的算法进一步对齐大语言模型。(注:也可以使用其他算法替代PPO;我这里专门讲PPO,是因为它是RLHF最初采用的算法,至今仍是最主流的选择。)
为简化起见,我们将RLHF流水线分为三个独立步骤:
-
RLHF第1步(前置准备):对预训练模型进行监督微调(Supervised Fine-Tuning, SFT)
-
RLHF第2步:构建奖励模型
-
RLHF第3步:通过近端策略优化(PPO)进行微调
RLHF第1步如下图所示,是一个监督微调步骤,用于创建后续RLHF微调的基础模型。

在RLHF第1步中,我们(例如从数据库中)构造或采样提示,然后让人工撰写高质量回复。接着用这个数据集以监督方式微调预训练基础模型。如前所述,严格来说这不属于强化学习训练,而只是前置条件。
在RLHF第2步中,我们利用监督微调(SFT)得到的模型来构建奖励模型,如下图所示。

如上图所示,针对每个提示,我们用上一步微调后的大语言模型生成四个回复。然后人工标注者根据偏好对这些回复进行排序。虽然排序过程耗时,但可能比创建监督微调数据集的工作量要小一些,因为对回复排序通常比撰写回复更简单。
整理好包含这些排序的数据集后,我们就可以设计一个奖励模型,为RLHF第3步的后续优化输出奖励分数。其核心思路是用奖励模型替代并自动化人力密集的人工排序,让大规模数据集上的训练变得可行。
这个奖励模型(Reward Model, RM)通常源自上一步监督微调(SFT)得到的大语言模型。要将RLHF第1步的模型转化为奖励模型,需要将其输出层(下一词分类层)替换为回归层,该层只有一个输出节点。
RLHF流水线的第三步是利用奖励模型(RM)微调上一步监督微调(SFT)得到的模型,如下图所示。

在RLHF的最终阶段(第3步),我们基于第2步创建的奖励模型输出的奖励分数,通过近端策略优化(PPO)更新SFT模型。
《Ahead of AI》是读者支持型出版物。想要接收新文章并支持我的创作,欢迎成为免费或付费订阅者。
PPO简介:强化学习的主力算法
如前所述,原版RLHF方法使用一种名为近端策略优化(PPO)的强化学习算法。
PPO的开发初衷是提升策略训练的稳定性与效率。(在强化学习中,“策略”就是我们想要训练的模型;在本文场景下,策略=大语言模型。)
PPO的核心思想之一是限制每次更新步中策略的变化幅度。这通过裁剪损失函数实现,有助于避免模型因更新幅度过大而导致训练失稳。
除此之外,PPO的损失中还包含KL散度惩罚项。该项将当前策略(正在训练的模型)与原始SFT模型进行对比,鼓励更新幅度保持在合理范围内。毕竟,我们的目标是对模型进行偏好微调,而不是完全重新训练。
这就是“近端策略优化”中“近端”一词的由来:算法在允许性能提升的同时,尽量让更新贴近现有模型。此外,为了鼓励一定程度的探索,PPO还加入了熵奖励项,鼓励模型在训练中丰富输出的多样性。
接下来,我会介绍更多术语,从较高层面讲解PPO的原理。不过涉及的专业术语较多,所以在继续之前,我先在下图中总结了关键术语。

下面,我将通过伪代码讲解PPO的关键步骤。
为了更直观,我还会用一个类比:想象你是一位经营小型外卖店的厨师,你不断尝试新的配方变体来提升顾客满意度。你的总体目标是根据顾客反馈(奖励)调整配方(策略)。
- 计算新策略与旧策略的下一词概率比值:
ratio = new_policy_prob / old_policy_prob
简而言之,这一步是检查新配方和旧配方的差异程度。
注:关于“new_policy_prob”,我们此时还没有使用最终更新后的策略,而是使用当前版本的策略(也就是正在训练过程中的模型)。但按照惯例,我们称之为“新”策略。所以即使你还在试验阶段,按照惯例我们也把当前的版本称为“新策略”。
- 将该比值乘以动作的优劣程度(称为优势值):
raw_score = ratio * advantage
为简化起见,我们可以假设优势值是基于奖励信号计算的:
advantage = actual_reward - expected_reward
在厨师的类比中,我们可以把优势值理解为新菜品的表现好坏:
advantage = 顾客评分 - 预期评分
例如,如果顾客给新菜品打了9/10分,而顾客通常给我们打7/10分,那么优势值就是+2。
注意这是简化说法。实际上这涉及广义优势估计(Generalized Advantage Estimation, GAE),为了不让文章过于冗长,我在此省略。不过有一个重要细节需要说明:预期奖励由所谓的“评判器”(critic,有时也称为价值模型)计算,而实际奖励由奖励模型计算。也就是说,优势值的计算涉及另外两个模型,通常与我们正在微调的原始模型规模相同。
在类比中,我们可以把评判器/价值模型想象成一位朋友,在把新菜品端给顾客之前先请他试吃,让他预估顾客会打多少分(也就是预期奖励)。而奖励模型就是实际给出反馈的顾客(也就是实际奖励)。
- 计算裁剪后的分数:
如果新策略变化过大(例如比值>1.2或<0.8),我们就对比值进行裁剪,如下所示:
clipped_ratio = clamp(ratio, 0.8, 1.2)
clipped_score = clipped_ratio * advantage
在类比中,想象新配方得到了特别好(或特别差)的评价,我们可能会忍不住直接 overhaul 整个菜单,但这样做风险很高。所以我们先限制配方的改动幅度。(比如,我们可能把菜品做辣了很多,刚好这位顾客爱吃辣,但这不代表所有人都爱吃。)
- 取原始分数与裁剪后分数中的较小值:
final_score = min(raw_score, clipped_score)
(感谢Johanna Reiml指出我之前关于PPO下界性质的问题,现已修正。)
这同样是出于谨慎的考虑。例如,如果优势值为正(新行为更好),我们会对奖励设置上限,因为我们不想过度信任一个可能只是巧合或运气带来的好结果。
如果优势值为负(新行为更差),我们会限制惩罚幅度。思路也是类似的:除非我们非常确定,否则不会因为一次坏结果就反应过度。
简而言之,当优势值为正时,我们取两个分数中的较小值(避免过度奖励);当优势值为负时,取较大值(避免过度惩罚)。
在类比中,这能确保如果配方表现超出预期,我们不会贸然重奖,除非我们有足够把握;如果配方表现不佳,我们也不会过度惩罚,除非它一直很差。
- 计算损失:
我们在训练中最大化这个最终分数(将分数取负后用梯度下降最小化)。此外,我们还加入KL惩罚项,其中β是惩罚强度的超参数:
loss = -final_score + β * KL(new_policy || reference_policy)
在类比中,我们加入惩罚项是为了确保新配方不会和我们原本的风格相差太远,避免你每周都“彻底颠覆厨房”。比如,我们不想突然把意大利餐厅改成烧烤店。
讲了这么多信息,我在下图中用大语言模型场景下的具体数值例子做了总结。如果觉得太复杂也可以跳过,不影响理解文章后续内容。

我承认刚才的PPO讲解可能有点太细了,但写都写了,舍不得删掉。希望你们当中有人能觉得有用!
话虽如此,下一节相关的核心结论是:PPO涉及多个模型:
-
策略模型:经过SFT训练、我们想要进一步对齐的大语言模型。
-
奖励模型:经过训练、用于预测奖励的模型(见RLHF第2步)。
-
评判器:用于估计奖励的可训练模型。
-
参考模型(原始策略):用于确保策略不会偏离太远。
顺便说一句,你可能会好奇,为什么我们同时需要奖励模型和评判器模型?奖励模型通常在使用PPO训练策略模型之前就训练好了,它的作用是替代人工标注者进行偏好标注,为策略大语言模型生成的完整回复打分。
而评判器则是对部分回复进行评判,我们用它来生成最终的回复。奖励模型通常保持冻结,而评判器模型会在训练过程中更新,以更好地估计奖励模型给出的奖励。
PPO的更多细节超出了本文范围,感兴趣的读者可以在早于InstructGPT论文的四篇论文中找到数学细节:
(1) https://arxiv.org/abs/1602.01783 (2016),Mnih、Badia、Mirza、Graves、Lillicrap、Harley、Silver和Kavukcuoglu提出了策略梯度方法,作为深度强化学习中Q学习的替代方案。
(2) https://arxiv.org/abs/1707.06347 (2017),Schulman、Wolski、Dhariwal、Radford和Klimov提出了一种改进的近端策略强化学习流程,比上述原版策略优化算法数据效率更高、可扩展性更强。
(3) https://arxiv.org/abs/1909.08593 (2020),Ziegler、Stiennon、Wu、Brown、Radford、Amodei、Christiano、Irving阐述了将PPO和奖励学习应用于预训练语言模型的概念,包括KL正则化以防止策略偏离自然语言过远。
(4) https://arxiv.org/abs/2009.01325 (2022),Stiennon、Ouyang、Wu、Ziegler、Lowe、Voss、Radford、Amodei、Christiano提出了流行的RLHF三步流程,该流程后来也被应用于https://arxiv.org/abs/2203.02155 论文中。
强化学习算法:从PPO到GRPO
如前所述,PPO是RLHF最初使用的算法。从技术角度看,它在用于开发推理模型的强化学习流水线中完全可以正常工作。不过,DeepSeek-R1在其强化学习流水线中使用了一种名为**组相对策略优化(Group Relative Policy Optimization, GRPO)**的算法,该算法最早在他们的一篇早期论文中提出:
https://arxiv.org/abs/2402.03300 (2024)
DeepSeek团队将GRPO介绍为:
近端策略优化(PPO)的一种变体,在提升数学推理能力的同时优化了PPO的内存占用。
所以,其核心动机是提升计算效率。
效率提升的实现方式是去掉了“评判器”(价值模型),也就是用于计算价值函数(即预期未来奖励)的大语言模型。
GRPO不再依赖这个额外的模型来计算估计奖励以得到优势值,而是采用了更简单的方法:从策略模型本身采样多个答案,利用它们的相对质量来计算优势值。
为了说明PPO和GRPO的区别,我借用了DeepSeekMath论文中的一张经典示意图:

《Ahead of AI》是读者支持型出版物。想要接收新文章并支持我的创作,欢迎成为免费或付费订阅者。
强化学习奖励建模:从RLHF到RLVR
到目前为止,我们介绍了RLHF流程,以及两种常用于RLHF的强化学习算法:PPO和GRPO。
但如果RLHF已经是大语言模型对齐工具包的核心部分,那这和推理又有什么关系呢?
RLHF和推理的关联,来自DeepSeek团队将类似的强化学习方法(搭配GRPO)应用于训练其R1和R1-Zero模型的推理能力。
区别在于,DeepSeek-R1团队没有依赖人类偏好并训练奖励模型,而是使用了可验证奖励。这种方法被称为基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards, RLVR)。
需要再次强调:与标准RLHF不同,RLVR不需要奖励模型。
也就是说,模型不需要从人工标注的示例中学习什么是“好”答案,而是从确定性工具(例如符号验证器或基于规则的工具)获得直接的二元反馈(正确或错误)。比如数学题用计算器、代码生成用编译器。

这么做的动机之一,是用自动正确性检查作为强化学习中的监督信号,避免嘈杂或昂贵的人工/学习型奖励。另一个动机是,通过使用计算器这类“低成本”工具,我们可以省去昂贵的奖励模型训练和奖励模型本身。由于奖励模型通常是完整的预训练模型(只是换成了回归头),RLVR的效率要高得多。
简而言之,DeepSeek-R1使用了搭配GRPO的RLVR,这在训练流程中省去了两个昂贵的模型:奖励模型和价值模型(评判器),如下图所示。

下一节,我将简要梳理DeepSeek-R1的训练流水线,并讨论DeepSeek团队使用的不同可验证奖励。
DeepSeek-R1推理模型的训练方式
既然我们已经厘清了RLHF和RLVR,以及PPO和GRPO的概念,下面结合强化学习与推理的语境,简要回顾DeepSeek-R1论文的核心结论。
首先,该系列有三类模型:
-
DeepSeek-R1-Zero:纯强化学习训练
-
DeepSeek-R1:指令微调(SFT)+强化学习训练
-
DeepSeek-Distill变体:通过指令微调(SFT)生成,无强化学习
我制作了一张DeepSeek-R1流水线示意图,说明这些模型之间的关系,如下所示。

DeepSeek-R1-Zero采用搭配GRPO的可验证奖励(RLVR)训练,事实证明这足以让模型通过生成中间步骤展现出推理能力。这说明跳过SFT阶段是可行的,模型通过探索而非从示例中学习来提升推理能力。
DeepSeek-R1是旗舰模型,性能最佳。与DeepSeek-R1-Zero的区别在于,它交替进行指令微调、RLVR和RLHF。
DeepSeek-Distill变体定位是更小、更易部署的模型;它们是用DeepSeek-R1模型的指令数据,对Llama 3和Qwen 2.5模型进行指令微调生成的。该方法在推理部分没有使用任何强化学习(不过Llama 3和Qwen 2.5基础模型本身是用RLHF训练的)。
关于DeepSeek-R1流水线的更多细节讲解,可以参见我之前的文章《理解推理型大语言模型》:
https://magazine.sebastianraschka.com/p/understanding-reasoning-llms
这里的核心结论是,DeepSeek团队训练DeepSeek-R1-Zero时没有使用基于大语言模型的奖励模型。相反,他们为DeepSeek-R1-Zero和DeepSeek-R1的推理训练使用了基于规则的奖励:
我们在开发DeepSeek-R1-Zero时没有应用结果型或过程型神经奖励模型,因为我们发现神经奖励模型在大规模强化学习过程中可能会出现奖励钻取问题……
为训练DeepSeek-R1-Zero,我们采用了一套基于规则的奖励系统,主要包含两类奖励:
(1)准确性奖励:准确性奖励模型评估回复是否正确。例如,对于有确定性结果的数学题,要求模型以指定格式(例如放在方框内)给出最终答案,从而实现可靠的基于规则的正确性验证。同理,对于LeetCode题目,可以用编译器基于预定义测试用例生成反馈。
(2)格式奖励:除了准确性奖励模型,我们还采用了格式奖励模型,强制模型将思考过程放在和标签之间。
近期推理模型强化学习论文的经验教训
我知道前面的引言部分比我预想的长得多。不过我觉得,要理解后面的经验教训,这段长篇引言或许是必要的。
上个月我研读了大量近期的推理模型论文,在本节汇总了其中最有意思的想法与洞见。(类似“[1]”的引用对应文末列出的相应论文。)
1. 强化学习可进一步提升蒸馏模型的性能
DeepSeek-R1的原始论文明确证明,监督微调(SFT)后接强化学习(RL)的效果优于纯强化学习。
基于这一观察,额外的强化学习理应能进一步提升蒸馏模型的性能(因为蒸馏模型本质上就是用更大模型生成的推理示例,通过SFT训练得到的模型)。
事实上,DeepSeek团队也明确观察到了这一现象:
此外,我们发现对这些蒸馏模型应用强化学习能带来显著的额外提升。我们认为这值得进一步探索,因此本文仅展示简单SFT蒸馏模型的结果。
多个团队独立验证了这些观察结果:
-
[8] 研究人员使用1.5B参数的DeepSeek-R1-Distill-Qwen模型,仅用7000个示例和42美元的算力预算,通过强化学习微调就实现了大幅性能提升。令人印象深刻的是,这个小模型在AIME24数学基准上超过了OpenAI的o1-preview。
-
[15] 但另一团队提醒说,这些提升可能并不总是具有统计显著性。这表明,虽然强化学习可以优化更小的蒸馏模型,但基准测试结果有时可能高估了提升幅度。

2. 错误长回复的问题
我之前提到,基于可验证奖励的强化学习(RLVR)并非必须搭配GRPO算法;DeepSeek的GRPO恰好效率高、表现好而已。
不过,[12]表明,原版PPO搭配基础的二元正确性奖励,就足以让模型在推理能力和回复长度上实现扩展。
更有意思的是,PPO和GRPO都存在长度偏差。多篇论文探讨了解决错误回复过长问题的方法:
- [14] 分析说明了PPO如何因损失计算中的数学偏差而无意中偏向更长的回复;GRPO可能也存在同样的问题。

承接上述结论,[7][10]明确指出了GRPO中的长度偏差与难度偏差。改进变体Dr. GRPO通过移除长度和标准差归一化来简化优势值计算,提供更清晰的训练信号。
-
[1] 在GRPO中明确惩罚冗长的错误回复,同时奖励简洁正确的回复。
-
[3][6] 没有在GRPO中直接控制回复长度,但发现token级奖励很有帮助,能让模型更好地聚焦关键推理步骤。
-
[5] 在GRPO中引入了对超出特定长度回复的明确惩罚,实现了推理过程中的精准长度控制。
3. 强化学习催生的涌现能力
除了DeepSeek-R1论文中提到的“顿悟”时刻,研究表明强化学习还能让模型产生宝贵的自我验证与反思推理能力[2][9]。有趣的是,和“顿悟”时刻类似,这些能力是在训练中自然涌现的,无需显式指令。
- [1] 表明扩展上下文长度(最高128k token)能进一步提升模型的自我反思与自我纠错能力。
4. 跨特定领域的泛化能力
目前大多数研究都聚焦于数学或编程场景下的推理任务。不过,[4]证明通过在逻辑谜题上训练模型,可以实现成功的泛化——在逻辑谜题上训练的模型,在数学推理任务上也取得了优异表现。这证明强化学习能够诱导出独立于特定领域知识的通用推理行为。
5. 向更广泛领域扩展
承接上一节,另一个有趣的洞见[11]是:推理能力可以自然延伸到数学、编程、逻辑等结构化领域之外。
模型成功将推理应用于医学、化学、心理学、经济学、教育等领域,利用生成式软评分方法有效处理自由形式的答案。
推理模型值得关注的下一步方向包括:
-
将现有推理模型(例如o1、DeepSeek-R1)与外部工具调用、检索增强生成(RAG)等能力结合;OpenAI刚发布的o3模型就在这方面做出了表率。
-
说到工具调用与搜索,[9]表明赋予推理模型搜索能力,会催生自我纠错、跨基准稳健泛化等行为,即便训练数据集很小也能实现。
从DeepSeek-R1团队为维持知识型任务性能所做的努力来看,我认为给推理模型增加搜索能力几乎是必然趋势。
6. 推理能力完全来自强化学习吗?
DeepSeek-R1(以及R1-Zero)的核心主张是,RLVR明确诱导出了推理能力。但近期研究[10]表明,包括“顿悟时刻”在内的推理行为,可能早已存在于基础模型中——因为预训练数据包含了大量思维链内容。
我最近对比DeepSeek V3基础版和R1的结果也印证了这一观察,更新后的基础模型也展现出类推理行为。例如,原版V3和R1模型的对比,清晰体现了非推理模型与推理模型的区别:

但如果对比更新后的V3基础模型和R1,这种差异就不再明显:

此外,[13]发现自我反思与自我纠错行为在预训练过程中,会跨不同领域、不同模型规模逐步涌现。这进一步让“推理能力完全来自强化学习”的归因变得复杂。
或许结论是:强化学习确实能将简单的基础模型转化为推理模型,但它并非诱导或提升推理能力的唯一途径。正如DeepSeek-R1团队所展示的,蒸馏也能提升推理能力。而本文中的蒸馏,指的是在思维链数据上进行指令微调——既然预训练和指令微调本质上都是基于下一词预测任务和损失函数,那么在包含思维链的数据上进行预训练,应该也能诱导出这些能力。(正如我在书中通过实战代码所讲的,预训练和指令微调终究是基于相同的下一词预测任务和损失函数。)
值得关注的推理模型训练研究论文
上个月我研读了大量推理论文,在上一节总结了最核心的收获。不过,对于想更深入了解来源的读者,我在本节列出了15篇相关论文作为选读。(为简便起见,以下总结按发表时间排序。)
请注意,这份列表并不全面(我限定在了15篇),因为本文已经够长了!
[1] 扩展强化学习(与上下文长度)
📄 1月22日,《Kimi k1.5: Scaling Reinforcement Learning with LLMs》,https://arxiv.org/abs/2501.12599
有意思的是,这篇论文和DeepSeek-R1论文同一天发布!作者们展示了一个用强化学习训练的多模态大语言模型。和DeepSeek-R1类似,他们没有使用过程奖励模型(PRM),而是采用了可验证奖励。过程奖励模型是强化学习(尤其是大语言模型训练)中使用的一类奖励模型,它不仅评估最终答案,还评估得出答案的推理步骤。
另一个核心思路是,扩展上下文长度(最高128k token)有助于模型在推理过程中进行规划、反思和自我纠错。因此,除了和DeepSeek-R1类似的正确性奖励,他们还加入了长度奖励。具体来说,他们鼓励更简短的正确回复,对冗长的错误回复施加更重的惩罚。
他们还提出了一种名为long2short的方法,将这些长思维链技能蒸馏为更高效的短思维链模型。(其实现方式是:通过模型合并、最短拒绝采样、DPO以及第二轮带更强长度惩罚的强化学习等方法,从长思维链模型中蒸馏出更短的正确回复。)

[2] 大型推理模型的竞技编程
📄 2月3日,《Competitive Programming with Large Reasoning Models》,https://arxiv.org/abs/2502.06807
这篇来自OpenAI的论文评估了他们的o系列模型(如o1、o1-ioi和o3)在竞技编程任务上的表现。虽然没有深入讲解强化学习的技术细节,但仍提供了一些有趣的结论。
首先,这些模型是用基于结果的强化学习训练的,而非基于过程的奖励模型。这和DeepSeek-R1、Kimi等方法类似。
其中一个有趣的发现是,o3可以自己学习测试时(即推理时扩展)策略。例如,它经常先写出问题的简单暴力解法(一种牺牲效率换正确性的做法),然后用它来验证自己更优解法的输出。这种策略不是人工编写的,而是模型自己摸索出来的。
总体而言,论文认为扩展通用型强化学习,能让模型发展出自己的推理与验证方法,无需任何人工启发式或特定领域的推理流水线。相比之下,o1-ioi等更早的模型依赖手工设计的测试时策略,比如对数千个样本聚类并重排序,这需要大量的人工设计与调优。

[3] 探索结果奖励的极限
📄 2月10日,《Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning》,https://arxiv.org/abs/2502.06781
这篇论文探究了仅靠二元“正确/错误”反馈的强化学习(就像DeepSeek-R1那样)在解决数学问题上能走多远。为此,他们首先使用最优N采样(Best-of-N sampling)收集正样本,并对其进行行为克隆,且从理论上证明这足以优化策略。
为了应对奖励稀疏的挑战(尤其是当长思维链包含部分正确步骤时),他们加入了一个token级奖励模型,学习为推理的不同部分分配重要性权重。这有助于模型在学习时聚焦最关键的步骤,从而提升整体性能。

[4] 基于规则强化学习的大语言模型推理(逻辑数据)
📄 2月20日,《Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning》,https://arxiv.org/abs/2502.14768
DeepSeek-R1聚焦于数学和编程任务,而这篇论文用逻辑谜题作为主要训练数据来训练7B模型。
研究人员采用了和DeepSeek-R1类似的基于规则的强化学习设置,但做了几处调整:
-
引入严格的格式奖励,惩罚走捷径的行为,确保模型用
和标签区分推理过程和最终答案。 -
还使用了系统提示,明确告诉模型在给出最终答案之前,先一步步思考问题。
即便只用了5000道合成逻辑题,模型也发展出了良好的推理能力,并且能很好地泛化到AIME、AMC等更难的数学基准上。
这一点尤其有意思,因为它表明基于逻辑的强化学习训练,能教会模型以可迁移到原领域之外的方式进行推理。

[5] 控制推理模型的思考长度
📄 3月6日,《L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning》,https://arxiv.org/abs/2503.04697
推理模型的一个显著特点是,由于思维链推理,它们往往会生成更长的输出。但默认情况下,没有明确的方法来控制回复长度。
这篇论文提出了长度控制策略优化(Length Controlled Policy Optimization, LCPO),这是一种简单的强化学习方法,能帮助模型在优化准确率的同时,遵守用户指定的长度约束。
简而言之,LCPO和GRPO类似,相当于“加入长度控制定制奖励的GRPO”,奖励公式为:
reward = reward_correctness - α * |target_length - actual_length|
其中目标长度作为用户提示的一部分提供。上述LCPO方法鼓励模型严格贴合给定的目标长度。
此外,他们还提出了LCPO-Max变体,它不鼓励模型精确匹配目标长度,而是鼓励模型保持在最大token长度以下:
reward = reward_correctness * clip(α * (target_length - actual_length) + δ, 0, 1)
作者用LCPO训练了一个名为L1的1.5B模型,它可以根据提示调整输出长度。这让用户可以根据任务在准确率和算力之间做权衡。有趣的是,论文还发现这些长思维链模型其实也非常擅长短推理,在相同token长度下甚至超过了GPT-4o等大得多的模型。

[6] 激励大语言模型的搜索能力
📄 3月10日,《R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning》,https://arxiv.org/abs/2503.05592
像DeepSeek-R1这类用强化学习训练的推理模型,依赖的是自身的内部知识。本文作者专注于提升这类模型在知识型任务上的表现——这些任务需要更多时效性或最新信息——方法是让模型接入外部搜索系统。
因此,本文通过教模型在推理过程中使用外部搜索系统来改进这些模型。作者没有依赖测试时策略或监督训练,而是采用两阶段强化学习方法,帮助模型自主学习搜索的时机与方式。模型先学习搜索格式,然后学习如何利用搜索结果找到正确答案。

[7] 规模化开源大语言模型强化学习
📄 3月18日,《DAPO: An Open-Source LLM Reinforcement Learning System at Scale》,https://arxiv.org/abs/2503.14476
虽然这篇论文主要围绕开发一套类DeepSeek-R1的训练流水线并将其开源,但它也对DeepSeek-R1训练中使用的GRPO算法提出了有趣的改进:
-
更高裁剪上限(Clip-higher):提高PPO裁剪范围的上限,鼓励探索并防止训练过程中的熵坍缩。
-
动态采样:过滤掉所有采样回复要么全对、要么全错的提示,提升训练效率。
-
Token级策略梯度损失:从样本级损失计算转为token级损失计算,让更长的回复对梯度更新产生更大影响。*
-
过长奖励塑形:对因过长而被截断的回复加入软惩罚,减少奖励噪声并帮助稳定训练。
*标准GRPO采用样本级损失计算:先对每个样本的token损失求平均,再对所有样本的损失求平均。由于每个样本权重相同,回复更长的样本中的token对整体损失的贡献可能不成比例地偏低。同时,研究人员观察到更长的回复在最终答案之前往往包含无意义内容,而在原版GRPO的样本级损失计算中,这些无意义内容不会得到足够的惩罚。

[8] 小型大语言模型的推理强化学习:有效与无效之处
📄 3月20日,《Reinforcement Learning for Reasoning in Small LLMs: What Works and What Doesn’t》,https://arxiv.org/abs/2503.16219
DeepSeek-R1的原始论文表明,开发小型推理模型时,蒸馏的效果优于纯强化学习。在这篇论文中,研究人员跟进了这一结论,研究如何用强化学习进一步优化小型蒸馏推理模型。
他们使用1.5B参数的DeepSeek-R1-Distill-Qwen模型,发现仅用7000个训练示例和42美元的算力预算,强化学习微调就能带来显著提升。例如,这种提升足以让模型在AIME24数学基准上超过OpenAI的o1-preview。
此外,论文还有3个有趣的发现:
-
小型大语言模型使用紧凑、高质量的数据集,在最初的50-100个训练步内就能快速获得推理提升。但如果训练时间过长,性能会迅速下降,主要原因是长度限制和输出不稳定。
-
混合简单题和难题有助于模型在训练早期生成更短、更稳定的回复,但长期来看性能仍会下降。
-
使用余弦形奖励函数能更有效地控制输出长度,提升训练一致性,但与标准的基于准确性的奖励相比,峰值性能会略有下降。

[9] 学会带着搜索进行推理
📄 3月25日,《ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning》,https://arxiv.org/abs/2503.19470
本文提出的ReSearch框架,将DeepSeek-R1论文的强化学习方法扩展为将搜索结果作为推理过程的一部分。模型会根据正在进行的推理链学习何时搜索、如何搜索,然后利用检索到的信息进行后续推理步骤。
这一切都无需推理步骤的监督数据。研究人员还表明,这种方法能催生出自我纠错、反思等有用行为,并且尽管只在一个数据集上训练,却能在多个基准上很好地泛化。

附:这种方法和之前讨论的R1-Searcher有什么区别?
R1-Searcher采用两阶段、基于结果的强化学习方法:第一阶段教模型如何调用外部检索;第二阶段学习利用检索到的信息回答问题。
而ReSearch将搜索直接整合到推理过程中,它通过强化学习端到端训练模型,不对推理步骤做任何监督。对错误查询进行反思并纠正等行为,是在训练中自然涌现的。
[10] 解读类R1-Zero训练:批判性视角
📄 3月26日,《Understanding R1-Zero-Like Training: A Critical Perspective》,https://arxiv.org/abs/2503.20783
这篇论文研究了为什么DeepSeek-R1-Zero的纯强化学习方法能有效提升推理能力。
作者发现,像Qwen2.5这样的一些基础模型,即使没有经过任何强化学习,也已经展现出很强的推理能力,甚至能出现“顿悟时刻”。所以“顿悟时刻”可能不是强化学习诱导的,而是从预训练中继承来的。这对“仅靠强化学习就能产生深度推理行为”的观点提出了挑战。
论文还指出了GRPO的两个偏差:
-
回复长度偏差:GRPO用回复长度对优势值做归一化,这使得长错误回复受到的惩罚更小,于是模型学会生成更长的错误答案。
-
难度级别偏差:GRPO还会按每个问题奖励的标准差做归一化,简单题或难题(奖励方差低)会被过度加权。
为了解决这个问题,作者提出了Dr. GRPO,这是标准GRPO的改进版本。他们在优势值计算中去掉了回复长度归一化,同时去掉了问题级的标准差。这会让训练更高效,减少不必要的长回复。尤其是当模型出错时,不再鼓励生成长答案。
[11] 跨多元领域扩展可验证奖励强化学习
📄 3月31日,《Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains》,https://arxiv.org/abs/2503.23829
DeepSeek-R1和后续大多数推理模型都聚焦于代码、数学等容易验证的领域的奖励信号。这篇论文探索了如何将这些方法扩展到医学、化学、心理学、经济学、教育等更复杂的领域——这些领域的答案通常是自由形式的,更难验证(不只是简单的对/错)。
作者发现,使用专家撰写的参考答案,能让评估在这些更广泛的领域中变得比预期更可行。为了提供奖励信号,他们引入了一种生成式软评分方法,不需要大量的特定领域标注。

[12] 用简单设置扩展强化学习
📄 3月31日,《Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model》,https://arxiv.org/abs/2503.24290
在这篇论文中,作者探索了一种极简的强化学习设置,用于在推理任务上训练大语言模型。他们使用原版PPO而非GRPO(DeepSeek-R1-Zero用的是GRPO),并且跳过了RLHF流水线中常见的KL正则化。
有趣的是,他们发现这种简单设置(原版PPO + 基于答案正确性的基础二元奖励函数)足以训练出在推理性能和回复长度上都能实现扩展的模型。
使用和DeepSeek-R1-Zero相同的Qwen-32B基础模型,他们的模型在多个推理基准上表现更优,而训练步数仅为后者的1/10。

[13] 重新思考预训练中的反思能力
📄 4月5日,《Rethinking Reflection in Pre-Training》,https://arxiv.org/abs/2504.04022
基于DeepSeek-R1论文的有趣洞见——即对基础模型应用纯强化学习,我们认为大语言模型的推理能力源自强化学习。而这篇论文带来了一点反转:它指出自我纠错其实在预训练阶段就已经更早出现了。
具体来说,作者通过在任务中引入故意出错的思维链,测试模型是否能识别并纠正这些错误。他们发现,显式和隐式形式的反思能力都会在预训练过程中稳步涌现,这一现象跨多个领域、多种模型规模都存在。即使是相对早期的检查点也表现出自我纠错的迹象,并且随着预训练算力的增加,这种能力会变得更强。

[14] 通过强化学习实现简洁推理
📄 4月7日,《Concise Reasoning via Reinforcement Learning》,https://arxiv.org/abs/2504.05185
众所周知,推理模型往往会生成更长的回复,这会推高算力成本。而这篇新论文表明,这种行为源于强化学习训练过程,而非因为长答案真的能提升准确率。当模型得到负奖励时,强化学习损失倾向于偏好更长的回复——我认为这解释了纯强化学习训练中出现的“顿悟”时刻和更长的思维链。
也就是说,如果模型得到负奖励(即答案错误),PPO背后的数学机制会让更长回复的平均每token损失变得更小。于是模型会间接地被鼓励拉长回复,即便这些额外的token其实对解决问题毫无帮助。
回复长度和损失有什么关系?当奖励为负时,更长的回复可以稀释单个token受到的惩罚,从而得到更低(也就是更好)的损失值(哪怕模型还是答错了)。
所以模型“学会了”:更长的回复能减轻惩罚,即便它们对提升正确率毫无帮助。
不过需要强调的是,这一分析是针对PPO的:
值得注意的是,我们目前的分析不适用于GRPO,对此类方法的精确分析留待未来工作。
此外,研究人员表明,第二轮强化学习(只用少量可解的问题)可以在保持甚至提升准确率的同时缩短回复长度。这对部署效率有重要意义。

[15] 理性看待大语言模型推理的进展
📄 4月9日,《A Sober Look at Progress in Language Model Reasoning: Pitfalls and Paths to Reproducibility》,https://arxiv.org/abs/2504.07086
这篇论文深入审视了近期“强化学习能提升蒸馏语言模型(比如基于DeepSeek-R1的模型)”的相关主张。
例如,我之前讨论过的3月20日那篇《小型大语言模型的推理强化学习:有效与无效之处》,就发现强化学习对蒸馏模型有效。
而DeepSeek-R1论文也提到:
此外,我们发现对这些蒸馏模型应用强化学习能带来显著的额外提升。我们认为这值得进一步探索,因此本文仅展示简单SFT蒸馏模型的结果。
虽然早期论文报告强化学习带来了大幅性能提升,但这项研究发现,其中很多提升可能只是噪声。作者表明,像AIME24这样的小型基准上的结果非常不稳定:仅仅改变随机种子,分数就可能波动好几个百分点。
在更受控、更标准化的设置下评估强化学习模型时,提升幅度远小于最初报告的数值,而且通常不具备统计显著性。不过,一些用强化学习训练的模型确实表现出适度提升,但通常弱于监督微调的效果,并且往往无法很好地泛化到新基准上。
因此,虽然强化学习在某些情况下确实能帮助优化更小的蒸馏模型,但这篇论文认为其益处被夸大了,我们需要更好的评估标准来理解真正起作用的是什么。

本杂志是一项个人热爱项目。如果你想支持我这位独立研究者,欢迎购买我的书:https://amzn.to/4fqvn0D ,或者订阅https://magazine.sebastianraschka.com/subscribe 。

如果你读过这本书,能抽出几分钟时间的话,我会非常感谢你留下评价:https://www.amazon.com/Build-Large-Language-Model-Scratch/dp/1633437167 。这对我们作者帮助很大!
非常感谢你的支持!