原文地址:The State of LLM Reasoning Model Inference,by Sebastian Raschka, on 2025-03-08
大语言模型推理模型的推理现状
提升推理模型的推理时计算扩展方法
2025年3月8日
提升大语言模型(LLM)的推理能力已成为2025年最热门的话题之一,这并非没有缘由。更强的推理能力让大语言模型能够解决更复杂的问题,使其在用户关心的各类任务中表现更出色。
过去几周,研究人员提出了大量提升推理能力的新策略,包括推理时计算扩展、强化学习、监督微调以及知识蒸馏。许多方法还会结合这些技术以实现更优效果。
本文探讨了推理优化型大语言模型的最新研究进展,重点关注自深度求索(DeepSeek)R1发布以来涌现的推理时计算扩展技术。

我在《理解推理型大语言模型》(https://magazine.sebastianraschka.com/p/understanding-reasoning-llms)一文中阐述的推理模型实现的四大类别。本文聚焦于推理时扩展方法。
在大语言模型中实现并优化推理:四大类别
由于大多数读者可能已经熟悉大语言模型推理模型,我将简而言之:基于大语言模型的推理模型是一类通过生成中间步骤或结构化“思考”过程来解决多步骤问题的大语言模型。与仅输出最终答案的简单问答类大语言模型不同,推理模型要么显式展示其思考过程,要么在内部完成处理,这让它们在谜题、编程挑战和数学问题等复杂任务中表现更优。

基础大语言模型的单行回答与推理型大语言模型的解释性回答的并排对比。
总体而言,提升推理能力主要有两种策略:(1)增加训练计算量;(2)增加推理计算量,也称为推理时扩展或测试时扩展。(推理计算量指的是训练完成后,模型响应用户查询生成输出所需的算力。)

可通过增加训练计算量或测试时计算量实现准确率提升,其中测试时计算量与推理时计算量、推理时扩展含义相同。来源:改编自《学会用大语言模型推理》(https://openai.com/index/learning-to-reason-with-llms/)中的配图。
需要注意的是,上图看起来似乎我们只能通过训练时计算量或测试时计算量其中一种方式来提升推理能力。但实际上,大语言模型通常会结合大量训练时计算(通常结合强化学习或专用数据进行大规模训练或微调)与增加的测试时计算(让模型“思考更久”或在推理过程中执行额外运算),共同提升推理能力。

与推理时扩展含义相近的诸多术语。
要理解推理模型的开发与优化路径,分别研究不同技术仍有其价值。在我之前的文章《理解推理型大语言模型》(https://magazine.sebastianraschka.com/p/understanding-reasoning-llms)中,我将其细分为四大类别,如下图所示。

上图中的第2-4类方法通常会让模型生成更长的回答,因为输出中包含了中间步骤和解释。由于推理成本随回答长度线性增长(例如,长度翻倍的回答需要两倍的计算量),这些训练方法本质上与推理扩展相关联。但在本节关于推理时计算扩展的内容中,我将专门聚焦于那些通过额外采样策略、自校正机制或其他方式,显式调控生成token数量的技术。
在本文中,我将重点介绍2025年1月22日深度求索R1发布之后,围绕推理时计算扩展涌现的最新研究论文与模型发布。(原本我打算在本文中涵盖所有类别的方法,但由于篇幅过长,我决定未来单独发布一篇聚焦训练时计算方法的文章。)

我在上一篇文章《理解推理型大语言模型》(https://magazine.sebastianraschka.com/p/understanding-reasoning-llms)中讨论的深度求索推理模型开发流程。
在深入探讨推理时计算扩展方法,以及推理模型在该领域的各项进展之前,我先简要概述一下所有四大类别。
1. 推理时计算扩展
该类别包含在推理阶段提升模型推理能力、无需训练或修改底层模型权重的方法。核心思路是以增加计算资源为代价换取性能提升,通过思维链推理、各类采样流程等技术,让固定参数的模型也能具备更强的能力。
尽管我将推理时计算扩展单独归类以便聚焦研究,但需要注意的是,该技术可应用于任何大语言模型。例如,OpenAI通过强化学习开发了o1模型,随后又额外运用了推理时计算扩展技术。有趣的是,正如我在上一篇关于推理模型的文章(https://magazine.sebastianraschka.com/p/understanding-reasoning-llms)中提到的,深度求索R1的论文明确将常见的推理时扩展方法(如基于过程奖励模型和蒙特卡洛树搜索的方法)归为“不成功的尝试”。这表明,除了模型本身生成长回答的自然倾向(这是相对于V3基座模型的一种隐式推理时扩展)之外,深度求索并未在R1中显式使用这些技术。不过,由于显式推理时扩展通常在应用层实现,而非大语言模型内部,深度求索也表示可以很轻松地将其集成到R1的部署或应用中。
2. 纯强化学习
该方法完全依靠强化学习(RL)来开发或提升推理能力,通常利用数学或编程领域中可验证的奖励信号训练模型。虽然强化学习能让模型形成更具策略性的思维和自我提升能力,但也存在奖励破解、训练不稳定、计算成本高等挑战。
3. 强化学习与监督微调结合
这种混合方法将强化学习与监督微调(SFT)相结合,相比纯强化学习能实现更稳定、泛化性更强的提升。通常先让模型在高质量指令数据上进行监督微调训练,再通过强化学习进一步优化特定行为。
4. 监督微调与模型蒸馏
该方法通过在高质量标注数据集上进行指令微调(SFT)来提升模型的推理能力。如果这份高质量数据集由更大的大语言模型生成,那么在大语言模型语境下,这种方法也被称为“知识蒸馏”或简称“蒸馏”。但需要注意,这与深度学习中的传统知识蒸馏略有不同——传统知识蒸馏通常不仅利用大模型的输出(标签),还会利用教师模型的logits(对数概率)来训练小模型。
《Ahead of AI》是一份读者支持的出版物。想要接收新文章并支持我的创作,欢迎成为免费或付费订阅者。
推理时计算扩展方法
上一节已经简要概述了推理时计算扩展。在讨论该领域的最新研究之前,我先更详细地介绍一下推理时扩展。
推理时扩展通过在推理阶段增加计算资源(“算力”)来提升大语言模型的推理能力。其背后的逻辑可以用一个简单的类比来解释:人类有更多时间思考时,会给出更优质的回答;同理,大语言模型也能通过鼓励生成过程中进行更多“思考”的技术来提升表现。
其中一种方法是提示工程,比如思维链(CoT)提示——通过“一步步思考”这类表述引导模型生成中间推理步骤。这能提升复杂问题的准确率,但对于简单的事实类查询则没有必要。由于思维链提示会生成更多token,实际上也推高了推理成本。

经典思维链提示示例,出自2022年论文《大语言模型是零样本推理器》(https://arxiv.org/abs/2205.11916)。
另一种方法是投票与搜索策略,比如多数投票或集束搜索,通过筛选最优输出来优化回答。

不同的基于搜索的方法依靠过程奖励模型来选择最佳答案。改编自论文《大语言模型的测试时计算》(https://arxiv.org/abs/2408.03314)中的配图。
1. “s1:简单测试时扩展”
本文余下部分将聚焦于提升大语言模型推理能力的推理时扩展领域的最新研究进展。我先详细讨论一篇论文,作为推理时扩展的典型案例。
该领域近期一篇有意思的论文是《通过预算强制实现大语言模型的可控推理》(https://arxiv.org/abs/2501.19393,2025年1月31日),文中提出了所谓的“等待”(wait)token,可以看作是前文提到的“一步步思考”提示修改方法的更现代版本。
需要注意的是,该方法需要通过监督微调生成初始模型,因此并非纯粹的推理时扩展方法。但其最终目标是通过推理时扩展主动调控推理行为,因此我将这篇论文归入“1. 推理时计算扩展”类别。
简而言之,他们的方法分为两部分:
- 构建一份经过筛选的监督微调数据集,包含1000个带推理轨迹的训练样本。
- 通过以下方式控制回答长度:
a) 追加“等待”token,让大语言模型生成更长的回答、进行自我验证与自我修正;
b) 添加思考结束标记分隔符(“最终答案:”)来终止生成。
他们将这种长度控制称为“预算强制”(budget forcing)。

插入“等待”token控制输出长度的示意图。改编自论文《通过预算强制实现大语言模型的可控推理》(https://arxiv.org/abs/2501.19393)中的配图。
预算强制可以看作一种串行推理扩展技术,因为它仍然是逐个生成token(只是生成更多)。与之相对的是多数投票这类并行技术,通过聚合多个独立生成的结果来实现扩展。

回答准确率与长度的相关性。改编自论文《通过预算强制实现大语言模型的可控推理》(https://arxiv.org/abs/2501.19393)中的配图。
他们发现,预算强制方法比我之前讨论过的多数投票等其他推理扩展技术效果更好。如果说有什么值得商榷或改进的地方,我希望能看到更复杂的并行推理扩展方法的结果,比如集束搜索、前瞻搜索,或是谷歌去年论文《大语言模型的测试时计算》(https://arxiv.org/abs/2408.03314)中提出的最优计算搜索方法。哪怕是和思维链提示(“一步步思考”)这种经典串行方法做个简单对比也好。
无论如何,这都是一篇非常有意思的论文,提出的方法也很有价值!
附:为什么是“等待”token?我猜研究人员是受到了深度求索R1论文中“顿悟时刻”配图的启发——研究人员观察到大语言模型会生成类似“等等,等等。等一下。这是一个顿悟时刻,我可以在这里标记一下。”的内容,这表明纯强化学习可以诱导大语言模型产生推理行为。
有趣的是,他们也尝试了“嗯(Hmm)”等其他token,但发现“等待”的表现略胜一筹。

“等待”与“嗯”token效果对比。改编自论文《通过预算强制实现大语言模型的可控推理》(https://arxiv.org/abs/2501.19393)中的配图。
其他值得关注的推理时计算扩展研究论文
近一个月推理模型研究领域非常活跃,为了控制文章篇幅,我需要简要概括其他论文。因此,以下是其他与推理时计算扩展相关的精彩研究的简介,按发表时间升序排列。
如前所述,并非所有论文都完全属于推理时计算扩展类别,部分研究也涉及特定的训练环节。但这些论文的共同点在于,对推理时计算量的调控是其核心作用机制。(我将在后续文章中介绍的许多蒸馏或监督微调方法也会让回答变长,这也可以看作一种推理时计算扩展。但它们不会在推理过程中主动控制长度,这是与本文介绍方法的核心区别。)
2. 测试时偏好优化
📄 1月22日,《测试时偏好优化:通过迭代文本反馈实现实时对齐》,https://arxiv.org/abs/2501.12895
测试时偏好优化(TPO)是一种在推理阶段让大语言模型输出对齐人类偏好的迭代过程(无需修改底层模型权重)。在每一轮迭代中,模型会:
- 针对给定提示生成多个回答;
- 用奖励模型对回答打分,选出得分最高和最低的回答,分别作为“选中”和“被拒”回答;
- 引导模型对比并点评“选中”与“被拒”的回答;
- 将点评转化为文本建议,以此优化模型最初的回答。
通过重复执行步骤1-4,模型不断打磨其原始回答。

改编自论文《测试时偏好优化:通过迭代文本反馈实现实时对齐》(https://arxiv.org/abs/2501.12895)中的配图。
3. 思考杂乱无章:o1类大语言模型的思考不足问题
📄 1月30日,《思考杂乱无章:o1类大语言模型的思考不足问题》,https://arxiv.org/abs/2501.18585
研究人员探究了一种名为“思考不足”(underthinking)的现象:推理模型会频繁在不同推理路径之间切换,而非专注深入探索有潜力的路径,从而降低了解题准确率。
为解决“思考不足”问题,他们提出了“思考切换惩罚”(TIP)方法,通过调整思考切换token的对数概率,抑制推理路径的过早跳转。
该方法无需模型微调,实验证明可在多个高难度测试集上提升准确率。

改编自论文《思考杂乱无章:o1类大语言模型的思考不足问题》(https://arxiv.org/abs/2501.18585)中的配图。
4. 以推理时计算换取对抗鲁棒性
📄 1月31日,《以推理时计算换取对抗鲁棒性》,https://arxiv.org/abs/2501.18841
在大多数情况下,增加推理时计算量能提升推理型大语言模型的对抗鲁棒性,降低攻击成功率。与对抗训练不同,该方法无需专门训练,也不需要提前了解具体的攻击类型。
但也存在一些重要的例外情况。例如,在涉及策略模糊性或漏洞利用的场景中,提升效果有限。此外,“少思考”“书呆子狙击”等新型攻击策略,也会削弱推理提升带来的鲁棒性增益。
因此,尽管研究表明扩展推理时计算量可以提升大语言模型的安全性,但仅凭这一点无法完全解决对抗鲁棒性问题。

改编自论文《以推理时计算换取对抗鲁棒性》(https://arxiv.org/abs/2501.18841)中的配图。
5. 关联思维链
📄 2月4日,《CoAT:提升大语言模型推理能力的关联思维链框架》,https://arxiv.org/abs/2502.02390
研究人员将经典的蒙特卡洛树搜索推理时扩展,与一种“联想记忆”相结合——后者在推理路径探索过程中充当大语言模型的知识库。借助这种联想记忆,大语言模型能更容易地回溯之前的推理路径,并在回答生成过程中运用动态演化的信息。

改编自论文《CoAT:提升大语言模型推理能力的关联思维链框架》(https://arxiv.org/abs/2502.02390)中的配图。
6. 退一步,进千里:通过自回溯提升语言模型推理能力
📄 2月6日,《退一步,进千里:通过自回溯提升语言模型推理能力》,https://arxiv.org/abs/2502.04404
本文提出了一种自回溯机制,让大语言模型通过在训练和推理阶段学习何时、何处回溯来提升推理能力。训练阶段通过<backtrack>标记教模型识别并修正欠佳的推理路径;而其核心贡献是一种推理时的树状搜索方法,利用习得的回溯能力探索备选解法。
其独特之处在于,这种探索无需依赖外部奖励模型(与本文“1. 推理时计算扩展方法”部分开头提到的基于过程奖励模型的搜索方法不同)。

改编自论文《退一步,进千里:通过自回溯提升语言模型推理能力》(https://arxiv.org/abs/2502.04404)中的配图。
我将这篇论文放在这里,是因为它重点聚焦于提出的回溯式推理时扩展方法——该方法通过动态调整搜索深度与广度提升推理能力,而非从根本上改变训练范式(尽管仍需要用<backtrack>标记进行训练)。
7. 基于隐式推理的测试时计算扩展:循环深度方法
📄 2月7日,《基于隐式推理的测试时计算扩展:循环深度方法》,https://arxiv.org/abs/2502.05171
研究人员没有通过生成更多token来提升推理能力,而是提出了一种模型,通过在隐空间中迭代循环深度模块来扩展推理时计算量。该模块的作用类似于循环神经网络(RNN)中的隐藏状态,让模型无需生成更长的token输出就能优化推理过程。
但一个关键缺点是缺乏显式的推理步骤——在我看来,显式步骤对人类可解释性很重要,也是思维链方法的一大优势。

改编自论文《基于隐式推理的测试时计算扩展:循环深度方法》(https://arxiv.org/abs/2502.05171)中的配图。
8. 10亿参数大语言模型能超越4050亿参数模型吗?
📄 2月10日,《10亿参数大语言模型能超越4050亿参数模型吗?重新思考计算最优的测试时扩展》,https://arxiv.org/abs/2502.06703
许多推理时扩展技术都依赖采样,需要过程奖励模型(PRM)来筛选最优解。本文系统分析了推理时计算扩展与过程奖励模型、问题难度之间的相互作用。
研究人员提出了一种计算最优的扩展策略,可根据过程奖励模型、策略模型和任务复杂度自适应调整。结果表明,采用合适的推理时扩展方法后,10亿参数模型的表现能超过未使用推理时扩展的4050亿参数Llama 3模型。
他们还证明,70亿参数模型结合推理时扩展后,性能超越深度求索R1,同时保持了更高的推理效率。
这些发现凸显了推理时扩展对大语言模型的显著提升作用——只要推理计算预算合理,小模型也能超越大得多的模型。

改编自论文《10亿参数大语言模型能超越4050亿参数模型吗?重新思考计算最优的测试时扩展》(https://arxiv.org/abs/2502.06703)中的配图。
9. 测试时从反馈中学习推理
📄 2月16日,《测试时从反馈中学习推理》,https://arxiv.org/abs/2502.15771
很难将该方法单纯归为推理时或训练时方法,因为它会在推理阶段优化大语言模型、修改其权重参数。
本文探究了一种让大语言模型在推理阶段从错误中学习的方法,无需将失败尝试存入提示(那样成本很高)。传统方法要么通过将之前的尝试加入上下文来修正答案(串行修正),要么盲目生成新答案(并行采样);而该方法会在推理时更新模型权重。
为此,作者提出了OpTune——一个小型可训练优化器,根据模型上一次尝试中的错误更新权重。这意味着模型能记住自己的错误,无需在提示/上下文中保留错误答案。

改编自论文《测试时从反馈中学习推理》(https://arxiv.org/abs/2502.15771)中的配图。
10. 面向大语言模型推理与规划的推理时计算
📄 2月18日,《面向大语言模型推理与规划的推理时计算:基准与洞见》,https://www.arxiv.org/abs/2502.12521
本文针对推理与规划任务,对多种推理时计算扩展技术进行了基准测试,重点分析了它们在计算成本与性能之间的权衡。
作者在算术推理、逻辑推理、常识推理、算法推理和规划五大类共11项任务上,评估了思维链、思维树、规划式推理等多种技术。
核心发现是,尽管扩展推理时计算量能提升推理能力,但没有任何一种技术能在所有任务上始终优于其他方法。

改编自论文《面向大语言模型推理与规划的推理时计算:基准与洞见》(https://www.arxiv.org/abs/2502.12521)中的配图。
11. 内思考Transformer
📄 2月19日,《内思考Transformer:利用动态深度扩展促进自适应内部思考》,https://arxiv.org/abs/2502.13842
内思考Transformer(ITT)会在推理阶段动态分配更多算力。标准Transformer架构的大语言模型对所有token都使用固定深度(即相同层数),而ITT采用自适应token路由,为难度更高的token分配更多算力。这些高难度token会多次经过同一层进行额外处理,从而增加了它们的推理计算预算。

改编自论文《内思考Transformer:利用动态深度扩展促进自适应内部思考》(https://arxiv.org/abs/2502.13842)中的配图。
12. 面向代码生成的测试时扩展
📄 2月20日,《S*:面向代码生成的测试时扩展》,https://arxiv.org/abs/2502.14382
推理时扩展可以通过并行扩展(生成多个答案)、串行扩展(迭代优化答案)实现,也可以两者结合,正如2024年夏季谷歌的论文(https://arxiv.org/abs/2408.03314)中所述。
S*是专门为代码生成设计的测试时计算扩展方法,同时优化了并行扩展(生成多个解法)和串行扩展(迭代调试)。

改编自论文《S*:面向代码生成的测试时扩展》(https://arxiv.org/abs/2502.14382)中的配图。
该方法分为两个阶段:
阶段1:生成阶段
模型生成多份代码解法,并利用执行结果与问题提示中的测试用例迭代优化。
这就像编程竞赛:模型提交解法、运行测试、修正错误:
- 模型生成多个候选解法;
- 每个解法在公开测试用例(预定义的输入输出对)上运行;
- 如果解法失败(输出错误或程序崩溃),模型分析执行结果(错误信息、输出内容)并修改代码以优化;
- 该优化过程持续迭代,直到模型找到能通过测试用例的解法。
例如,假设要求模型实现一个is_even(n)函数,偶数返回True,奇数返回False。
模型的第一次尝试可能是:
def is_even(n):
return n % 2 # ❌ 错误:应该是 `== 0`
模型用公开测试用例测试该实现:
| 输入 | 预期结果 | 模型输出 | 状态 |
|---|---|---|---|
| is_even(4) | True | False | ❌ 失败 |
| is_even(3) | False | True | ❌ 失败 |
查看结果后,模型意识到4 % 2返回的是0而非True,于是修改函数:
def is_even(n):
return n % 2 == 0 # ✅ 已修正
现在该函数通过了所有公开测试,调试阶段完成。
阶段2:筛选阶段
当多个解法都通过了公开测试,模型需要选出最优解(如果可行的话)。为此,S*提出了自适应输入合成方法,避免随机选择:
- 模型对比两份都通过公开测试的解法;
- 它自问:“我能不能生成一个输入,测出这两个解法的差异?”
- 构造新的测试输入,运行两个解法;
- 如果一个解法输出正确而另一个失败,模型选择更优的那个;
- 如果两个解法表现完全一致,模型随机选一个。
例如,考虑is_perfect_square(n)的两种不同实现:
import math
def is_perfect_square_A(n):
return math.isqrt(n) ** 2 == n
def is_perfect_square_B(n):
return math.sqrt(n).is_integer()
两者在简单示例上都通过了给定的测试用例:
n = 25 print(is_perfect_square_A(n)) # ✅ True(正确) print(is_perfect_square_B(n)) # ✅ True(正确)
但当大语言模型生成边界用例时,我们会发现其中一个失败了,因此这种情况下模型会选择解法A:
n = 10**16 + 1 print(is_perfect_square_A(n)) # ✅ False(正确) print(is_perfect_square_B(n)) # ❌ True(错误)
13. 草稿链
📄 2月25日,《草稿链:少写多思,提速推理》,https://arxiv.org/abs/2502.18600
研究人员观察到,推理型大语言模型通常会生成冗长的分步解释,而人类通常只依靠捕捉核心信息的简洁草稿。
受此启发,他们提出了草稿链(CoD)提示策略,通过生成极简但信息量大的中间步骤来降低冗余度。因此从某种意义上说,这是一种推理时扩展方法,通过生成更少的token提升推理时扩展的效率。

改编自论文《草稿链:少写多思,提速推理》(https://arxiv.org/abs/2502.18600)中的配图。
从结果来看,草稿链的简洁程度接近标准提示,准确率却和思维链提示相当。正如我之前所说,在我看来,推理模型的优势之一是用户可以阅读推理轨迹来学习,也能更好地评估和信任回答。草稿链一定程度上削弱了这一优势。但在不需要冗长中间步骤的场景中,它会非常实用——既提升了生成速度,又保持了思维链的准确率。
14. 更优质的反馈与编辑模型
📄 3月6日,《专用反馈与编辑模型赋能开放域通用任务的推理时扩展》,https://arxiv.org/abs/2503.04378
许多扩展推理时推理的技术都依赖答案可验证的任务(比如可以校验的数学和编程题),这让它们难以应用于写作、通用问题解决等开放式任务。
为解决答案可验证性带来的局限,研究人员构建了一套系统:一个模型生成初始回答,另一个提供反馈(“反馈模型”),第三个根据反馈优化回答(“编辑模型”)。
他们利用大规模人工标注的回答与反馈数据集,训练了这些专用的“反馈”和“编辑”模型。这些模型能在推理阶段生成更优质的反馈、做出更有效的修改,从而提升回答质量。
<
《Ahead of AI》是一份读者支持的出版物。想要接收新文章并支持我的创作,欢迎成为免费或付费订阅者。
结论
推理时计算扩展已成为今年最热门的研究方向之一,它无需修改模型权重,就能提升大语言模型的推理能力。
我在上文总结的技术种类繁多,从“等待”token这种简单的基于token的干预,到测试时偏好优化、关联思维链等复杂的基于搜索与优化的策略。
从宏观层面看,一个反复出现的结论是:与标准方法相比,增加推理时算力能让即便规模较小的模型也获得(推理基准上的)显著提升。
这表明,推理策略有助于缩小体积更小、成本更低的模型与大模型之间的性能差距。
成本警示
需要注意的是,推理时扩展会推高推理成本。因此,是选择搭配大量推理扩展的小模型,还是训练一个大模型、少用甚至不用推理扩展,需要根据模型的使用频率来权衡计算。
举例来说,大量使用推理时扩展的o1模型,实际上成本仍略低于可能未使用推理时扩展、规模更大的GPT-4.5模型。

(看看GPT-4.5搭配o1或o3风格的推理时扩展后表现如何,会是件有意思的事。)
该选哪种技术?
然而,推理时计算扩展并非万能良药。尽管蒙特卡洛树搜索、自回溯、动态深度扩展等方法能大幅提升推理性能,但效果仍取决于任务类型与难度。正如之前某篇论文所示,没有任何一种推理时计算扩展技术能在所有任务上都表现最优。
此外,许多这类方法都是以牺牲响应延迟为代价换取推理能力提升,而响应过慢可能会让部分用户感到困扰。比如我处理简单任务时,通常会从o1切换到GPT-4o,因为它响应速度更快。
未来展望
展望未来,我认为今年会有更多论文围绕“通过推理时计算扩展实现推理”的两大分支展开:
- 纯粹以打造榜单最优模型为核心的研究;
- 关注在不同推理任务中平衡成本与性能权衡的研究。
无论哪条路径,推理时计算扩展的优点在于,它可以应用于任何现有大语言模型,针对特定任务提升表现。
按需思考
产业界一个有意思的趋势,我称之为“按需思考”。深度求索R1发布后,各家公司似乎都在争相为自己的产品增加推理能力。
一个值得关注的进展是,大多数大语言模型服务商都开始为用户提供开启或关闭思考功能的选项。其底层机制尚未公开,但很可能是同一个模型,只是调低了推理时计算扩展的程度。
例如,Anthropic的Claude 3.7 Sonnet(https://www.anthropic.com/news/claude-3-7-sonnet)和xAI的Grok 3(https://x.ai/blog/grok-3)现在都支持用户为模型开启“思考”功能;而OpenAI则需要用户在不同模型间切换——比如想用显式推理模型,就要在GPT-4o/4.5与o1/o3-mini之间切换。不过OpenAI首席执行官提到,GPT-4.5可能会是他们最后一款没有显式推理或“思考”模式的模型。开源领域方面,就连IBM也在其Granite 3.2模型(https://www.ibm.com/new/announcements/ibm-granite-3-2-open-source-reasoning-and-vision)中加入了显式的“思考”开关。
总体而言,无论是通过推理时还是训练时计算扩展来增加推理能力,这一趋势都是2025年大语言模型发展的一大进步。
假以时日,我认为推理将不再是可选的特殊功能,而会成为标配——就像如今经过指令微调或RLHF训练的模型,早已取代原始预训练模型成为主流一样。
如前所述,由于推理领域研究非常活跃,本文篇幅已经很长,因此仅聚焦于推理时计算扩展。未来我计划写一篇文章,介绍所有精彩的训练时计算扩展推理方法。
这本杂志是我的个人兴趣项目。如果你愿意支持我这位独立研究者,可以考虑购买我的书(https://amzn.to/4fqvn0D),或者订阅我的杂志(https://magazine.sebastianraschka.com/subscribe)。

《从零构建大语言模型》现已上市:https://amzn.to/4fqvn0D
如果你读过这本书,并且能抽出几分钟时间,我会非常感谢你在亚马逊上留下评价(https://www.amazon.com/Build-Large-Language-Model-Scratch/dp/1633437167)。这对我们作者帮助很大!
你的支持意义重大!非常感谢!