提升大语言模型推理能力的推理时算力缩放分类

原文地址:Categories of Inference-Time Scaling for Improved LLM Reasoning,by Sebastian Raschka, on 2026-01-24

提升大语言模型推理能力的推理时算力缩放分类

兼述最新推理缩放研究论文(含递归语言模型)

推理缩放已经成为提升已部署大语言模型回答质量与准确率的最有效手段之一。

它的原理非常直白:如果我们愿意在推理阶段(即使用模型生成文本时)投入更多算力、花费更多时间,就能让模型输出更优质的答案。

如今,每一家主流大语言模型服务商都在采用某种形式的推理时算力缩放,学术界围绕这类方法的研究也在快速增长。

今年3月,我曾写过一篇推理缩放领域概览,总结了早期的部分技术。

《大语言模型推理模型的推理现状》

在本文中,我会在之前讨论的基础上做进一步延伸,将不同方法划分成更清晰的类别,同时重点介绍过去几个月涌现的最新研究成果。

在为《从零构建推理模型》一书撰写推理缩放完整章节的过程中,我亲自实验了这类方法的众多基础变体。为了调优超参数,我累计跑了数千次实验,花了大量精力斟酌哪些方法值得在章节中展开讲解。(这个章节最后篇幅过长,我最终拆成了两章,目前都已在抢先阅读计划中上线。)

附言:我对这两章的最终呈现非常满意。它们能把基础模型的准确率从约15%提升到52%左右,是目前整本书里成就感最强的内容之一。

本文整理了一些没有放进最终章节叙事、但仍然值得分享的思路、笔记与论文。
我也计划后续在GitHub的补充材料里加入更多代码实现。

目录概览

  1. 推理时算力缩放概述

  2. 思维链提示

  3. 自一致性

  4. N选优排序

  5. 带验证器的拒绝采样

  6. 自我精炼

  7. 解路径搜索

  8. 结论、分类与组合方式

  9. 番外:闭源大语言模型都用了哪些技术?

你可以在网页版阅读时使用左侧导航栏,直接跳转到任意章节。


1 推理时算力缩放概述

推理时算力缩放(也叫推理算力缩放、测试时缩放,或简称推理缩放)是一个统称,指代所有在推理阶段投入更多算力与时间来提升模型表现的方法。

这个概念由来已久,经典机器学习中的集成方法就可以看作推理时缩放的早期例子——使用多个模型会消耗更多算力,但能得到更好的结果。

即便在大语言模型领域,这个思路也早已存在。不过我印象中,它是去年OpenAI在o1的官宣博文《用大语言模型学习推理》里放出一张推理缩放与训练缩放的对比图后,才又一次彻底火了起来。

figure01

图1:在推理阶段(左)和训练阶段(右)投入更多资源,通常都能提升模型准确率。

我认为这张改自OpenAI博客的图,很好地概括了我们优化大模型的两个核心抓手:我们既可以在训练阶段投入更多资源(更多数据、更大模型、更多或更长的训练阶段),也可以在推理阶段做优化。

实际上,最优做法是双管齐下:先训练出更强的模型,再通过额外的推理缩放让它的表现更上一层楼。

本文只聚焦图的左半部分,也就是推理时缩放技术——即所有无需训练、不修改模型权重的方法。

=== 以下为付费内容 ===

Leave a Reply

Your email address will not be published. Required fields are marked *

*