【转载】提升大语言模型推理能力的推理时算力缩放分类

原文地址:Categories of Inference-Time Scaling for Improved LLM Reasoning,by Sebastian Raschka, on 2026-01-24

提升大语言模型推理能力的推理时算力缩放分类

兼述最新推理缩放研究论文(含递归语言模型)

推理缩放已经成为提升已部署大语言模型回答质量与准确率的最有效手段之一。

它的原理非常直白:如果我们愿意在推理阶段(即使用模型生成文本时)投入更多算力、花费更多时间,就能让模型输出更优质的答案。

如今,每一家主流大语言模型服务商都在采用某种形式的推理时算力缩放,学术界围绕这类方法的研究也在快速增长。

今年3月,我曾写过一篇推理缩放领域概览,总结了早期的部分技术。

《大语言模型推理模型的推理现状》

在本文中,我会在之前讨论的基础上做进一步延伸,将不同方法划分成更清晰的类别,同时重点介绍过去几个月涌现的最新研究成果。

在为《从零构建推理模型》一书撰写推理缩放完整章节的过程中,我亲自实验了这类方法的众多基础变体。为了调优超参数,我累计跑了数千次实验,花了大量精力斟酌哪些方法值得在章节中展开讲解。(这个章节最后篇幅过长,我最终拆成了两章,目前都已在抢先阅读计划中上线。)

附言:我对这两章的最终呈现非常满意。它们能把基础模型的准确率从约15%提升到52%左右,是目前整本书里成就感最强的内容之一。

本文整理了一些没有放进最终章节叙事、但仍然值得分享的思路、笔记与论文。
我也计划后续在GitHub的补充材料里加入更多代码实现。

目录概览

  1. 推理时算力缩放概述

  2. 思维链提示

  3. 自一致性

  4. N选优排序

  5. 带验证器的拒绝采样

  6. 自我精炼

  7. 解路径搜索

  8. 结论、分类与组合方式

  9. 番外:闭源大语言模型都用了哪些技术?

你可以在网页版阅读时使用左侧导航栏,直接跳转到任意章节。


1 推理时算力缩放概述

推理时算力缩放(也叫推理算力缩放、测试时缩放,或简称推理缩放)是一个统称,指代所有在推理阶段投入更多算力与时间来提升模型表现的方法。

这个概念由来已久,经典机器学习中的集成方法就可以看作推理时缩放的早期例子——使用多个模型会消耗更多算力,但能得到更好的结果。

即便在大语言模型领域,这个思路也早已存在。不过我印象中,它是去年OpenAI在o1的官宣博文《用大语言模型学习推理》里放出一张推理缩放与训练缩放的对比图后,才又一次彻底火了起来。

figure01

图1:在推理阶段(左)和训练阶段(右)投入更多资源,通常都能提升模型准确率。

Continue reading 【转载】提升大语言模型推理能力的推理时算力缩放分类

【转载】理解推理型大语言模型

原文地址:Understanding Reasoning LLMs,by Sebastian Raschka, on 2025-02-05

理解推理型大语言模型:构建与优化推理模型的方法与策略

本文将介绍构建推理模型的四种核心路径,阐释如何为大语言模型(LLM)赋予并强化推理能力。希望本文能提供有价值的洞见,帮你在该领域快速迭代的学术研究与行业热潮中理清脉络。

2024 年,大语言模型领域的专业化趋势愈发明显。除了预训练与微调技术的持续演进,检索增强生成(RAG)、代码助手等垂直场景应用也快速崛起。我预计这一趋势将在 2025 年进一步加速,行业会更聚焦于领域与场景专属的优化(即 “专业化”)。

figure01

图 1:第 1-3 阶段是大语言模型的通用开发流程,第 4 阶段则是针对具体场景对模型进行专业化定制

推理模型的开发正是这类专业化方向之一。我们通过优化模型,使其擅长解决需要中间推导步骤的复杂任务,比如逻辑谜题、高等数学与编程挑战。但这种专业化并不会替代其他大语言模型的应用场景;将通用大模型改造为推理模型也会带来一些短板,后文会详细展开。

先简要预告本文的核心内容:

  • 阐释 “推理模型” 的定义

  • 分析推理模型的优势与局限

  • 拆解 DeepSeek R1 的技术实现路径

  • 介绍构建与优化推理模型的四种主流方案

  • 分享 DeepSeek V3 与 R1 发布后,大语言模型行业格局的观察

  • 给出低成本开发推理模型的实践建议

希望在 AI 高速发展的 2025 年,本文能为你带来切实的帮助。

如何定义 “推理模型”?

如果你从事 AI(或广义的机器学习)相关工作,一定对各种模糊且充满争议的术语定义不陌生,“推理模型” 也不例外。总会有论文先给出一个正式定义,后续的研究又会重新改写定义,循环往复。

在本文中,我将 “推理” 定义为:回答问题时需要经过多步复杂生成、产出中间推导过程的能力。
举个例子,“法国的首都是哪里?” 这类事实性问答不涉及推理;而 “一列火车以 60 英里 / 小时的速度行驶 3 小时,总行驶距离是多少?” 就需要基础的推理 —— 模型需要先识别出距离、速度、时间三者的关系,再推导得出答案。

figure02

图 2:普通大语言模型可能只输出简短答案(左),而推理模型通常会给出中间步骤,展现部分思考过程。(注:很多未专门针对推理优化的大语言模型,同样能在回答中输出中间推理步骤。)

如今绝大多数大语言模型都具备基础推理能力,可以解答上述的火车行程类问题。因此当下我们所说的 “推理模型”,通常特指擅长解决更复杂推理任务的模型,比如逻辑解谜、智力问答、数学证明等。

此外,当前市面上标注为 “推理模型” 的产品,大多会在回复中包含 “思考” 过程。至于大语言模型是否真的在 “思考”,则是另一个独立的讨论议题。

推理模型的中间步骤有两种呈现形式:
第一种是显式输出,即像上图一样把推导过程直接展示在回复中;
第二种是隐式执行,比如 OpenAI 的 o1 模型,会在内部运行多轮带中间步骤的迭代,但过程不对用户可见。

figure03

图 3:“推理” 体现在两个层面:1)模型内部通过多步中间过程处理输入、生成结果;2)模型在面向用户的回复中呈现一定的推理逻辑。

什么时候该用推理模型?

明确了推理模型的定义后,我们可以进入更核心的话题:如何构建与优化面向推理任务的大语言模型。但在深入技术细节之前,有必要先厘清:推理模型的真实适用场景是什么。

推理模型专为复杂任务设计,比如解逻辑谜题、攻克高等数学问题、处理高难度编程任务。但对于摘要生成、翻译、知识类问答等简单任务,推理模型并非必需。
事实上,所有场景都强行使用推理模型反而会低效且昂贵:推理模型通常调用成本更高、输出更冗长,有时还会因为 “过度思考” 而更容易出错。这里也适用一个简单原则:根据任务选择合适的工具(或大语言模型类型)。

推理模型的核心优势与局限总结如下图:

figure04

图 4:推理模型的核心优劣势

DeepSeek 训练流程概览

在正式介绍四种构建推理模型的主流方法前,我先基于 DeepSeek R1 的技术报告,简要梳理它的训练流水线。这份报告既是一个精彩的案例,也可以作为开发推理型大语言模型的参考蓝图。

需要注意的是,DeepSeek 并非只发布了一款 R1 推理模型,而是推出了三个不同版本:DeepSeek-R1-Zero、DeepSeek-R1 与 DeepSeek-R1-Distill。

结合技术报告的描述,我将这三款模型的开发流程整理成了下图:

figure05

图 5:DeepSeek R1 技术报告中三款推理模型的开发流程

接下来我们先简要梳理图中的流程,更详细的技术细节会在下一节四种构建方法中展开。

  1. DeepSeek-R1-Zero:该模型基于 2024 年 12 月发布的 6710 亿参数预训练基座 DeepSeek-V3 开发。团队采用双奖励机制的强化学习(RL)进行训练,由于跳过了基于人类反馈的强化学习(RLHF)中常规的监督微调(SFT)环节,这种方式也被称为 “冷启动” 训练。

  2. DeepSeek-R1:这是 DeepSeek 的旗舰推理模型,在 DeepSeek-R1-Zero 的基础上迭代而来。团队通过额外的监督微调阶段与多轮强化学习训练,进一步优化了这款 “冷启动” 的 R1-Zero 模型。

  3. DeepSeek-R1-Distill:DeepSeek 团队利用前序步骤生成的监督微调数据,对 Qwen、Llama 等开源模型进行微调,提升其推理能力。这并非传统意义上的知识蒸馏,而是用大模型(6710 亿参数的 DeepSeek-R1)的输出作为训练数据,让更小的模型(Llama 8B/70B、Qwen 1.5B–30B)进行监督微调。

构建与优化推理模型的四种核心方法

本节将梳理当前提升大语言模型推理能力、打造专用推理模型(如 DeepSeek-R1、OpenAI o1/o3 等)的主流技术方案。

注:o1 与 o3 的具体技术细节仅 OpenAI 内部知晓,业内普遍推测它同时结合了推理侧优化与训练侧优化两类技术。

1. 推理时算力扩展

提升大语言模型推理能力(或任何通用能力)的第一种思路,是推理时算力扩展。这个术语有多重含义,在本文语境下,它指的是通过提升推理阶段的计算资源投入,来优化输出质量。

可以用一个通俗的类比:人类面对复杂问题时,思考时间越充分,往往能给出更完善的答案。同理,我们也可以通过技术手段,让大语言模型在生成答案时 “多思考一会儿”。(至于大语言模型算不算真正的 “思考”,则是另一个议题。)

推理时算力扩展最基础的实现方式是精巧的提示工程。经典代表就是思维链(CoT)提示:在输入提示中加入 “一步步思考” 这类指令,引导模型生成中间推理步骤,而非直接跳到最终答案。对于复杂问题,这种方法通常(但并非绝对)能提升答案的准确率。
(注:对于 “法国首都是哪里” 这类简单知识类问题,用思维链提示毫无意义 —— 这也可以作为一个判断标准:如果一个问题用思维链提示才有收益,那它才值得用推理模型来处理。)

figure06

图 6:经典思维链提示示例,出自 2022 年论文《Large Language Models are Zero-Shot Reasoners》(https://arxiv.org/abs/2205.11916

上述思维链方法之所以属于推理时算力扩展,是因为它生成了更多输出 token,推高了推理的计算成本。

推理时算力扩展的另一类实现方式是投票与搜索策略。最简单的是多数投票法:让大语言模型生成多个答案,再通过投票选出出现次数最多的结果。同理,也可以用束搜索、其他搜索算法来生成更优的回复。

关于这类策略的更多细节,我非常推荐阅读《Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters》这篇论文,我在之前的《2024 年值得关注的 AI 论文(下)》(https://magazine.sebastianraschka.com/p/ai-research-papers-2024-part-2)一文中也做过解读。

figure07

图 7:不同搜索类方法均基于过程奖励模型筛选最优答案。图源标注改自论文《Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters》,https://arxiv.org/abs/2408.03314

DeepSeek R1 的技术报告将过程奖励模型、蒙特卡洛树搜索这类常见的推理时扩展方法归为 “未达预期的尝试”。这意味着除了 R1 模型本身天然会生成更长回复(相比 V3 基座模型,这本身就是一种隐式的推理时算力扩展),DeepSeek 并没有在模型内部显式集成这类技术。

不过,显式的推理时算力扩展通常在应用层实现,而非内置在模型本身,因此 DeepSeek 的产品端也可能仍在使用这类方案。

我推测 OpenAI 的 o1 与 o3 模型都采用了推理时算力扩展,这也能解释为什么它们比 GPT-4o 这类模型贵得多。除了推理侧优化,o1 与 o3 大概率也采用了和 DeepSeek R1 类似的强化学习训练流水线。下两节会详细介绍强化学习相关内容。

2. 纯强化学习(RL)

DeepSeek R1 论文中我个人认为最亮眼的发现,就是:推理行为可以通过纯强化学习自发涌现。我们来详细拆解这一点。

前文提到,DeepSeek 开发了三款 R1 系列模型。第一款 DeepSeek-R1-Zero 基于 2024 年 12 月发布的通用预训练大模型 DeepSeek-V3 基座开发。
和常规的强化学习流水线(先做监督微调,再做强化学习)不同,DeepSeek-R1-Zero 完全跳过了初始的监督微调阶段,仅通过强化学习完成训练,如下图所示。

figure08

图 8:DeepSeek-R1-Zero 模型开发流程

这套强化学习流程和常用的 RLHF(基于人类反馈的强化学习)逻辑相似 ——RLHF 通常用于大模型的偏好对齐。(我在《大语言模型训练:RLHF 及其替代方案》一文中详细讲解过 RLHF。)
但核心区别在于:DeepSeek-R1-Zero 跳过了用于指令对齐的监督微调环节,这也是它被称为 “纯” 强化学习的原因。(当然,大语言模型语境下的强化学习,和传统强化学习差异很大,这是另一个话题了。)

在奖励设计上,它没有采用基于人类偏好训练的奖励模型,而是设置了两类奖励:准确性奖励格式奖励

  • 准确性奖励:针对编程题用 LeetCode 编译器验证答案正确性,针对数学题用确定性规则校验结果。

  • 格式奖励:通过大语言模型裁判,确保回复符合指定格式,比如将推理步骤放在 \\ 标签内。

令人意外的是,仅靠这套机制,大语言模型就演化出了基础推理能力。研究团队观察到了一个 “顿悟时刻”:模型开始自发在回复中生成推理轨迹,而并没有人明确教它这么做,如下图所示。

figure09

图 9:DeepSeek R1 技术报告(https://arxiv.org/abs/2501.12948)中展示的 “顿悟时刻” 涌现现象

尽管 R1-Zero 算不上顶级性能的推理模型,但它确实能生成中间 “思考” 步骤、具备推理能力。这证明了纯强化学习就可以孵化出推理模型,而 DeepSeek 团队是首个(至少是首个公开发表成果的团队)验证这一结论的团队。


本专栏是读者支持的独立创作。如果你想收到新文章、支持我的创作,欢迎免费订阅或付费订阅。

输入你的邮箱…
订阅


3. 监督微调 + 强化学习(SFT + RL)

接下来我们看 DeepSeek 的旗舰推理模型 DeepSeek-R1,它是构建推理模型的典型范本。这款模型在 DeepSeek-R1-Zero 的基础上,叠加了额外的监督微调(SFT)与强化学习(RL),进一步提升了推理性能。

实际上,强化学习之前先做监督微调是行业常规操作,标准 RLHF 流水线就是如此。OpenAI 的 o1 大概率也采用了类似的开发路径。

figure10

图 10:DeepSeek-R1 模型开发流程

如上图所示,DeepSeek 团队先用 DeepSeek-R1-Zero 生成了所谓的 “冷启动” 监督微调数据 —— 之所以叫 “冷启动”,是因为生成这些数据的 R1-Zero 本身从未经过任何监督微调训练。

基于这批冷启动监督微调数据,DeepSeek 先对模型做了指令微调,再进入下一轮强化学习训练。这轮强化学习保留了 R1-Zero 阶段的准确性奖励与格式奖励,同时新增了一致性奖励,避免模型在回复中混用多种语言。

强化学习阶段结束后,团队又进行了一轮监督微调数据采集:用最新的模型检查点生成 60 万条思维链监督微调样本,再用 DeepSeek-V3 基座模型补充 20 万条知识类监督微调样本。

随后,团队用这总计 80 万条样本对 DeepSeek-V3 基座做指令微调,再进行最终一轮强化学习。这一轮中,数学与编程题依然用规则化方法计算准确性奖励,其他类型问题则引入人类偏好标注。
整体来看,这套流程和常规 RLHF 非常接近,区别仅在于:监督微调数据包含了更多思维链样本,强化学习除了人类偏好奖励,还加入了可验证的规则化奖励。

最终的 DeepSeek-R1 模型,相比 R1-Zero 性能有显著提升,对比如下表:

figure11

图 11:OpenAI o1 与 DeepSeek R1 系列模型的基准测试对比。图源标注改自 DeepSeek-R1 技术报告,https://arxiv.org/abs/2501.12948

4. 纯监督微调(SFT)与模型蒸馏

到目前为止,我们已经介绍了三种构建推理模型的核心路径:

  1. 推理时算力扩展:无需训练、不改模型本身,仅通过推理侧优化提升推理能力。

  2. 纯强化学习:代表是 DeepSeek-R1-Zero,证明了无需监督微调,推理能力也能通过强化学习自发涌现。

  3. 监督微调 + 强化学习:打造了 DeepSeek-R1 这款旗舰推理模型。

剩下的第四种路径,就是模型蒸馏

有意思的是,DeepSeek 也发布了通过 “蒸馏” 训练的小模型。但在大语言模型领域,蒸馏并不完全等同于深度学习里经典的知识蒸馏。
传统知识蒸馏(我在《机器学习问答》一书第 6 章简要介绍过)是让小型学生模型,同时学习大型教师模型的输出概率分布与目标数据集的标注。

而这里的 “蒸馏”,指的是用大模型生成的监督微调数据集,对小型大语言模型(比如 Llama 8B/70B、Qwen 2.5 全系列 0.5B 到 32B)做指令微调。
具体来说,这些 “教师” 大模型指的是 DeepSeek-V3 和 DeepSeek-R1 的中间检查点;蒸馏所用的监督微调数据,和上一节训练 DeepSeek-R1 的是同一批。

为了更清晰地展示这个流程,我在下图中标出了蒸馏对应的环节:

figure12

图 12:DeepSeek-R1-Distill 系列模型开发流程

为什么要开发这些蒸馏模型?在我看来主要有两个原因:

  1. 小模型效率更高:运行成本更低,还能在更低配置的硬件上跑起来,对广大研究者和技术爱好者非常友好。

  2. 纯监督微调的效果参照:这些蒸馏模型是很好的基准,可以验证不借助强化学习、仅靠监督微调,模型的推理能力能达到什么水平。

下表对比了蒸馏模型、其他主流模型,以及 DeepSeek-R1-Zero、DeepSeek-R1 的性能:

figure13

图 13:蒸馏模型与非蒸馏模型的基准测试对比。图源标注改自 DeepSeek-R1 技术报告,https://arxiv.org/abs/2501.12948

可以看到,蒸馏模型的性能明显弱于完整的 DeepSeek-R1,但相比体量小几个数量级的 DeepSeek-R1-Zero,表现却出人意料地好。另外值得注意的是,它们的表现和 o1-mini 相当接近 —— 我猜测 o1-mini 本身可能也是 o1 的类似蒸馏版本。

在结束这一小节前,还有一组很有意思的对比:DeepSeek 团队验证了一个问题:DeepSeek-R1-Zero 上观察到的推理涌现现象,在小模型上是否也能复现?
他们把 R1-Zero 的纯强化学习方案,直接用在了 Qwen-32B 模型上,实验结果如下表所示。表中的 QwQ-32B-Preview 是 Qwen 团队基于 Qwen 2.5 32B 开发的推理参照模型(其训练细节并未公开)。这组实验能帮我们进一步判断:纯强化学习能否在远小于 DeepSeek-R1-Zero 的模型上催生出推理能力。

figure14

图 14:32B 参数量级别下,蒸馏与纯强化学习的基准测试对比。图源标注改自 DeepSeek-R1 技术报告,https://arxiv.org/abs/2501.12948

实验结果很有意思:对于小模型,蒸馏的效果远好于纯强化学习。这也印证了一个观点:仅靠强化学习,不足以在这个体量的模型上催生出强推理能力;而对小模型来说,用高质量推理数据做监督微调,是更高效的策略。

严谨起见,我认为表格里还应该补充两组对照:

  1. 按 DeepSeek-R1 的模式,用 SFT+RL 训练 Qwen-32B,对比纯 RL、纯 SFT 的收益,看强化学习与监督微调结合能带来多大提升。

  2. 按蒸馏模型的模式,用纯 SFT 训练 DeepSeek-V3 基座,直接对比 RL+SFT 和纯 SFT 的效果差异。


本专栏是读者支持的独立创作。如果你想收到新文章、支持我的创作,欢迎免费订阅或付费订阅。

输入你的邮箱…
订阅


方法总结

本节我们梳理了构建与优化推理模型的四种策略,总结如下:

  1. 推理时算力扩展:无需额外训练,但会推高推理成本。当用户量或查询规模增长时,大规模部署的开销会显著上升。但对于本身性能已经很强的模型,它是提升表现的零门槛方案。我高度怀疑 o1 采用了推理时算力扩展,这也是它单 token 成本远高于 DeepSeek-R1 的原因之一。

  2. 纯强化学习:研究价值很高,能帮我们理解 “推理作为涌现行为” 的本质。但在实际模型开发中,RL+SFT 的组合是更优选择,能打造出性能更强的推理模型。我推测 o1 同样采用了 RL+SFT 的训练方式。更具体地说,我认为 o1 的基座模型体量弱于 DeepSeek-R1,但通过 RL+SFT 与推理时算力扩展弥补了差距。

  3. RL+SFT 组合:是打造高性能推理模型的核心路径,DeepSeek-R1 就是这套方案的优秀范本。

  4. 模型蒸馏:非常适合打造体积小、效率高的推理模型。但它的局限在于无法推动技术创新、无法孵化下一代推理模型 —— 因为蒸馏永远依赖已有的、更强的模型来生成监督微调数据。

我认为接下来的一个重要发展方向,是把 RL+SFT(方案 3)和推理时算力扩展(方案 1)结合起来。OpenAI 的 o1 大概率就是这么做的,只不过它的基座模型弱于 DeepSeek-R1—— 这也解释了为什么 DeepSeek-R1 表现出色,同时推理成本还更低。

关于 DeepSeek R1 的几点思考

最近很多人问我怎么看 DeepSeek-R1 系列模型。简而言之:我认为这是一项非常出色的成果。作为一名研究工程师,我尤其欣赏它详实的技术报告,里面的方法论细节很有学习价值。

其中最有启发性的结论,就是推理能力可以通过纯强化学习自发涌现。另外,DeepSeek 以宽松的 MIT 开源协议开放了模型权重,限制比 Meta 的 Llama 系列还少,这点也非常难得。

和 o1 相比如何?

DeepSeek-R1 比 o1 更强吗?我认为两者整体处于同一水平梯队。但 DeepSeek-R1 的推理效率明显更高,这说明 DeepSeek 可能把更多成本投入在了训练环节,而 OpenAI 的 o1 则更依赖推理时算力扩展。

当然,直接对比 o1 和 DeepSeek-R1 并不容易,因为 OpenAI 几乎没有公开 o1 的技术细节。比如我们完全不清楚:

  • o1 是不是混合专家(MoE)架构?

  • o1 的参数量到底有多大?

  • o1 会不会只是 GPT-4o 的小幅优化版,只做了少量 RL+SFT,主要靠大规模推理时算力扩展提分?

在这些信息缺失的前提下,直接对比本质上是 “苹果和橘子” 的不公平比较。

DeepSeek-R1 的训练成本

另一个热议话题是 DeepSeek-R1 的开发成本。有人说训练成本约 600 万美元,但这个数字其实混淆了 DeepSeek-V3(去年 12 月发布的基座模型)和 DeepSeek-R1。

600 万美元的估算,来自 2024 年 12 月对 DeepSeek-V3 最终训练轮次的 GPU 时耗测算,按每 GPU 小时 2 美元的租金计算得出。

而 DeepSeek 团队从未公开过 R1 的具体训练时耗或开发成本,所有相关估算都只是推测。

无论如何,DeepSeek-R1 都是开源推理模型的重要里程碑,它的推理效率优势,也让它成为 OpenAI o1 之外极具竞争力的选择。

低成本开发推理模型

即便从开源基座模型(比如 DeepSeek-V3)起步,打造 DeepSeek-R1 级别的推理模型,往往也需要数十万到数百万美元的投入。这对预算有限的研究者或工程师来说,难免望而却步。

好消息:蒸馏方案性价比很高

幸运的是,模型蒸馏提供了性价比高得多的替代方案。DeepSeek 团队的 R1 蒸馏系列模型已经验证了这一点:这些模型体量远小于完整的 DeepSeek-R1,却拥有出人意料的强劲推理表现。
不过即便如此,蒸馏也不算完全低成本 —— 他们的蒸馏流程用了 80 万条监督微调样本,依然需要不少算力。

有意思的是,就在 DeepSeek-R1 发布前几天,我看到了 Sky-T1 项目:一个小团队只用 1.7 万条监督微调样本,就训练出了一款 320 亿参数的开源推理模型,总成本仅 450 美元,比大多数 AI 会议的注册费还便宜。

这个案例说明:大规模训练成本高昂,但小规模、针对性的微调,也能以极低的成本取得亮眼的效果。

figure15

图 15:图源《Sky-T1:450 美元内训练属于你的 o1-preview 级别模型》,https://novasky-ai.github.io/posts/sky-t1/

从基准测试来看,Sky-T1 的表现和 o1 大致相当,考虑到它极低的训练成本,这个成果非常惊人。

低成本纯强化学习:TinyZero

Sky-T1 走的是模型蒸馏路线,而在纯强化学习领域,也有很有意思的低成本实践。其中代表就是 TinyZero:一款 30 亿参数的模型,复现了 DeepSeek-R1-Zero 的思路(补充一句:训练成本不到 30 美元)。

令人意外的是,即便只有 30 亿参数,TinyZero 也展现出了一定的自验证涌现能力。这也佐证了:即便在小模型上,纯强化学习也能催生出推理能力。

TinyZero 的代码仓库提到相关研究报告还在撰写中,我会持续关注后续进展。

figure16

图 16:图源 TinyZero 代码仓库(https://github.com/Jiayi-Pan/TinyZero),展示了模型具备自验证能力。(如果能加上基座模型的回复作为对照会更有参考价值。)
注:该 GitHub 页面解析失败,相关信息仅基于仓库名称与原文引用内容整理。

以上两个项目证明:即便预算有限,也能开展推理模型的相关研究与实践。它们分别复现了 DeepSeek-R1 的两条技术路线 ——TinyZero 主打纯强化学习,Sky-T1 主打纯监督微调。如果能把这些思路进一步延伸拓展,相信会有更多有趣的成果。

超越传统监督微调:旅程学习

去年我接触到一个很有意思的方向,出自论文《o1 复现之旅:战略进展报告(第一部分)》。别看标题叫 “复现 o1”,实际上论文并没有真正复现 o1,而是提出了一种优化蒸馏(纯监督微调)过程的新思路。

论文的核心概念是旅程学习,和传统的捷径学习相对应:

  • 捷径学习:就是传统的指令微调方式,只用正确的解题路径来训练模型。

  • 旅程学习:训练数据中同时包含错误的解题路径,让模型从错误中学习。

这个思路和 TinyZero 纯强化学习中观察到的自验证能力有相通之处,但它完全通过监督微调实现。让模型接触错误的推理路径与修正过程,也能强化模型的自我纠错能力,从而提升推理模型的可靠性。

figure17

图 17:与传统捷径学习不同,旅程学习在监督微调数据中加入了错误解题路径。图源标注改自论文《o1 复现之旅:战略进展报告(第一部分)》,https://arxiv.org/abs/2410.18982

这是一个很有前景的未来方向,尤其适合预算有限、难以承担强化学习算力成本的推理模型开发场景。

总而言之,当前推理模型领域正涌现出大量精彩的研究与实践,相信未来几个月还会有更多令人兴奋的成果出现。

【转载】大语言模型研究论文:2025年下半年精选(7-12月)

原文地址:LLM Research Papers: The 2025 List (July to December),by Sebastian Raschka, on 2025-12-30

大语言模型研究论文:2025年下半年精选(7-12月)

今年 6 月,我曾向付费订阅用户分享过一篇附赠文章,整理了我收藏标记的研究论文清单 —— 正是这些订阅者支撑着这个 Substack 专栏的运营。

本着同样的心意,为了感谢所有热心支持者,我整理了 2025 年 7 月至 12 月期间我标记归档的优质研究论文,清单如下。

这些论文我都通读了摘要,但真正全文精读的只有极少一部分。不过我依然坚持整理这类分类清单,因为在开展具体项目时,我常常会回头查阅这些资料。

顺便一提,我同时也在撰写年度大语言模型综述文章《2025 年大语言模型发展现状:进展、问题与展望》,今天也同步发布了。大家可以通过以下链接查看:

《2025 年大语言模型发展现状:进展、问题与展望》

原本我打算把这份论文清单放进上面这篇综述里,但文章篇幅已经过长,因此决定单独成篇分享。希望大家不介意今天收到两封推送邮件。我的考虑是,拆分后两篇文章都更便于阅读、快速浏览和日后回顾,不用在超长的页面里费力查找。

本次论文清单分为以下类别(大家可以在网页版文章的目录中直接跳转对应章节):

  • 推理模型

    • 1a. 推理模型训练

    • 1b. 推理阶段推理策略

    • 1c. 大语言模型评估与推理解析

  • 大语言模型的其他强化学习方法

  • 其他推理阶段扩展方法

  • 模型发布 / 技术报告

  • 模型架构

  • 高效训练

  • 基于扩散的语言模型

  • 多模态与视觉 – 语言模型

  • 数据与预训练数据集


Continue reading 【转载】大语言模型研究论文:2025年下半年精选(7-12月)

【转载】从零理解并实现Qwen3

原文地址:Understanding and Implementing Qwen3 From Scratch,by Sebastian Raschka, on 2025-09-06

从零理解并实现Qwen3

深度解析主流开源大语言模型之一

此前,我在《大语言模型架构大比拼》一文中对比了2025年最具代表性的开源权重架构;随后又在《从GPT-2到gpt-oss:架构演进概念分析》中,从概念层面深入拆解了各类架构组件。

好事成三。在介绍今年夏天值得关注的研究亮点之前,我打算从代码层面动手实践,深入拆解这些架构。跟着本文一步步操作,你就能理解模型的底层运行原理,还能获得可复用的基础模块,适配到自己的实验或项目中。

为此我选择了Qwen3(5月首次发布,7月完成更新)——截至撰文时,它是最受青睐、应用最广的开源权重模型系列之一。

在我看来,Qwen3系列模型广受欢迎的原因如下:

  • 采用对开发者与商业应用友好的开源协议(Apache 2.0许可证),除开源许可证本身条款外无任何附加限制(其他部分开源大模型会额外设置使用约束)。

  • 性能表现优异:截至撰文时,开源权重的235B-Instruct版本在LMArena排行榜上位列第8,与闭源模型Claude Opus 4持平。排名更高的开源大模型仅有两款——参数量是其3倍的DeepSeek 3.1,以及参数量是其4倍的Kimi K2。9月5日,Qwen3在其平台发布了1万亿参数的“max”版本,在所有主流基准测试中均超越Kimi K2、DeepSeek 3.1与Claude Opus 4;不过该模型目前为闭源状态。

  • 覆盖多种模型尺寸,适配不同算力预算与应用场景,从0.6B稠密模型到480B参数的混合专家(MoE)模型一应俱全。

本文篇幅较长,因为包含纯PyTorch从零实现的完整代码。尽管代码部分看起来篇幅较多,但我相信相比单纯的概念示意图,代码能更好地帮你理解各个基础模块的原理。

提示1:如果你是在邮件收件箱中阅读本文,较窄的行宽可能导致代码片段换行错乱。为获得更好的阅读体验,建议在网页浏览器中打开本文。
提示2:你可以使用网站左侧的目录,在各章节间更便捷地跳转。

figure01

图1:本文将用纯PyTorch讲解并复现的Qwen3稠密架构与混合专家(MoE)架构示意图

Continue reading 【转载】从零理解并实现Qwen3

【转载】大语言模型研究论文:2025年上半年精选(1-6月)

原文地址:LLM Research Papers: The 2025 List (January to June),by Sebastian Raschka, on 2025-07-01

大语言模型研究论文:2025年上半年精选(1-6月)

按主题分类的 200 余篇 2025 年大语言模型研究论文合集

熟悉我的读者可能知道,我一直有整理待读、待参考研究论文清单的习惯。

大约半年前,我分享了 2024 年的论文清单,很多读者都觉得很实用。因此我打算继续更新这个系列,并且采纳了大家反复提到的建议:「能不能按主题而非日期来整理论文?」

我划分的分类如下:

  • 推理模型

    • 1a. 推理模型训练

    • 1b. 推理阶段推理策略

    • 1c. 大语言模型评估与推理解析

  • 大语言模型的其他强化学习方法

  • 其他推理阶段扩展方法

  • 高效训练与模型架构

  • 基于扩散的语言模型

  • 多模态与视觉 – 语言模型

  • 数据与预训练数据集

同时,大语言模型领域的研究更新速度极快,因此我决定将清单更新频率调整为半年一次。这样既能保证内容的时效性,也更易于阅读,希望能为大家的暑期研读提供一份扎实的参考资料。

请注意,目前这份内容仅为精选清单。在后续的文章中,我会针对其中更具价值、更有影响力的论文,按主题撰写更深入的解读与讨论,敬请期待。

Continue reading 【转载】大语言模型研究论文:2025年上半年精选(1-6月)

【转载】从零编写大语言模型:完整课程

原文地址:Coding LLMs from the Ground Up: A Complete Course,by Sebastian Raschka, on 2025-05-10

从零编写大语言模型:完整课程

近几个月我写了很多关于推理模型的内容(一连更了 4 篇)。除了 “智能体” 相关方向之外,推理能力是 2025 年大语言模型领域最核心的议题之一。

但这个月,我想分享一些更底层、更 “基础” 的内容 —— 如何从零编写大语言模型。这是理解 LLM 工作原理的最佳方式之一。

为什么要做这套内容?因为去年我分享的精简版 LLM 实战 workshop 反响非常好,很多人都从中受益:

《从零构建大语言模型:3 小时编码实战课》

所以我想,这套时长约为原版 5 倍、内容更详尽的课程(总时长约 15 小时),实用价值会更高。

另外很遗憾的是,我最近颈部受了重伤,过去三周基本没法对着电脑工作。目前我先尝试保守治疗,再考虑医生建议的手术方案。这个时机实在糟糕 —— 我刚找回工作节奏,生活就又抛来一记曲线球。

所以在康复期间,我把前几个月录好的这些视频整理出来,作为过渡内容分享给大家。

希望这份内容对你有帮助,也感谢大家的支持!

附:这些视频原本是我《从零构建大语言模型》一书的配套补充内容,但实际体验下来,它们作为独立课程也完全成立。

Continue reading 【转载】从零编写大语言模型:完整课程

【转载】从零初探推理:第1章

原文地址:First Look at Reasoning From Scratch: Chapter 1,by Sebastian Raschka, on 2025-04-29

从零初探推理:第1章

当代大语言模型的推理入门

大家好:

如各位所知,我近期撰写了大量关于大语言模型推理前沿研究的内容。在下一篇聚焦研究的博客文章发布前,我想为付费订阅者准备一份特别内容,感谢大家一直以来的支持。

目前我正在撰写一本关于大语言模型推理原理的新书,今天先和大家分享全书的第 1 章。这一章约 15 页,是大语言模型领域的推理入门内容,概述了推理时算力扩展、强化学习等核心方法。

感谢各位的支持!希望大家喜欢这一章节,也敬请期待我下一篇关于推理研究的博客文章。

祝阅读愉快
塞巴斯蒂安


第 1 章 引言

欢迎来到大语言模型(LLM)发展的下一阶段:推理。大语言模型已经彻底改变了我们处理与生成文本的方式,但此前其能力的核心驱动力主要是统计模式识别。如今,推理方法的新进展让大语言模型能够应对更复杂的任务,比如解答逻辑谜题、完成多步算术运算。理解这些方法,正是本书的核心主题。

在这一入门章节中,你将学习:

  • “推理” 在大语言模型语境下的具体定义

  • 推理与模式匹配的本质区别

  • 大语言模型常规的预训练与后训练阶段

  • 提升大语言模型推理能力的核心方法

  • 为什么从零搭建推理模型,能帮助我们更深入地理解其优势、局限与实际权衡

在本章搭建完基础概念之后,后续章节将转向实操代码案例,带你直接实现大语言模型的推理技术。

1.1 对大语言模型而言,“推理” 意味着什么?

Continue reading 【转载】从零初探推理:第1章

【转载】大语言模型研究论文:2024年度合集

原文地址:LLM Research Papers: The 2024 List,by Sebastian Raschka, on 2024-12-08

大语言模型研究论文:2024年度合集

今年的AI研究领域精彩纷呈、热点不断,如果你关注大语言模型方向,更是能感受到领域的飞速发展。

我原本为12月的这期内容做了详尽规划,打算发布一篇专题文章,盘点2024年我心目中的所有研究亮点。这个计划依然会推进,但由于意外受了重伤,我目前无法坐在电脑前完成草稿。希望接下来几周能顺利康复,尽快回归工作。

在此期间,我想分享自己2024年以来持续收藏的优质论文清单(以大语言模型相关内容为主)。这只是一份简单的列表,但或许能帮大家在假期里挖到一些值得深入研读的宝藏论文。

如果你偏好代码向的深度阅读与动手实践,我的《从零构建大语言模型》一书已于上个月在亚马逊上线。
此外,我还在GitHub仓库中补充了大量配套学习资料。

figure01

Continue reading 【转载】大语言模型研究论文:2024年度合集

【转载】从零构建GPT风格大语言模型分类器

原文地址:Building A GPT-Style LLM Classifier From Scratch,by Sebastian Raschka, on 2024-09-21

从零构建 GPT 风格大语言模型分类器

面向垃圾邮件分类的 GPT 模型微调

在本文中,我将向大家演示如何将预训练大语言模型(LLM)改造为高性能文本分类器。

为什么要聚焦分类任务?首先,针对分类任务微调预训练模型,是入门模型微调技术的优质路径 —— 难度平缓但实用性强。其次,大量现实场景与业务问题本质上都属于文本分类:垃圾邮件检测、情感分析、客户反馈归类、主题标注等等。

figure00

将 GPT 模型改造为文本分类器

Continue reading 【转载】从零构建GPT风格大语言模型分类器

【翻译】遗漏的细节:Llama 2权重已发生变更

原文地址:The Missing Bits: Llama 2 Weights Have Changed,by Sebastian Raschka, on 2023-08-27

遗漏的细节:Llama 2权重已发生变更

由于《AI 前沿》第 11 期《新基础模型》的正文篇幅过长,我将几则与 Llama 2 权重相关的趣味技术细节从主通讯中剥离了出来。把这些内容作为小福利分享给《AI 前沿》的支持者们也很不错,再次感谢大家的热心支持!

在这篇精简文章中,我们将简要分析 Llama 2 的权重特性,以及以不同浮点精度格式托管权重带来的实际影响。

=== 以下为付费内容 ===