
一、什么是 Polymarket?
Polymarket是一个基于区块链的去中心化预测市场平台,由Shayne Coplan于2020年创立,构建于 Polygon 网络之上。它打破了传统预测市场的中心化局限,允许用户使用加密货币(主要是 USDC 稳定币)对真实世界各类事件的结果进行投注和交易——覆盖范围极为广泛,从全球政治选举、体育赛事胜负,到加密货币价格走势、宏观经济政策变动,甚至是流行文化热点、科技突破进展等,几乎涵盖了所有具有不确定性的现实场景。
Learn and share.

一、什么是 Polymarket?
Polymarket是一个基于区块链的去中心化预测市场平台,由Shayne Coplan于2020年创立,构建于 Polygon 网络之上。它打破了传统预测市场的中心化局限,允许用户使用加密货币(主要是 USDC 稳定币)对真实世界各类事件的结果进行投注和交易——覆盖范围极为广泛,从全球政治选举、体育赛事胜负,到加密货币价格走势、宏观经济政策变动,甚至是流行文化热点、科技突破进展等,几乎涵盖了所有具有不确定性的现实场景。
————当算力需求冲破地球边界,太空数据中心的梦想正面临一场严酷的商业与科技挑战。
近年来,AI算力需求呈指数级增长,地面数据中心面临着电力、冷却、土地的多重约束,“把算力送上天”的太空AI数据中心概念开始被热议。人们憧憬着低地球轨道(LEO)上无尽的太阳能、无限制的物理空间,认为这是算力未来的终极形态。
“将夜空转变为一个巨大的、由太阳能驱动的人工智能大脑”—— 这是马斯克描绘的宏大愿景。随着 SpaceX 向 FCC 提交百万级卫星星座的申请,以及谷歌、亚马逊等巨头纷纷布局,太空 AI 数据中心正从科幻走向现实。

企业数字化转型:从战略认知到落地实践的全景指南。数字化转型不是选择题,而是生存题。但比”要不要转”更重要的是”如何转对”。在数字经济时代,数字化转型已从“可选”变为“必选”。2026年的商业环境中,成功实现数字化的企业展现出更强的韧性、创新力和市场竞争力。然而,许多企业在转型的浪潮中迷失了方向,陷入“为了数字化而数字化”的误区。数字化转型的本质不是技术的简单堆砌,而是一场涉及业务重构、组织变革与生态协同的系统性革命。本文将从目的意义、理念方法、核心能力、实施步骤及难点突破,为企业提供数字化转型的全面指引,帮你理清转型思路,避开常见误区。

当下业界对通用人形具身机器人的热度明显过高。回归工程与产业现实,一个很朴素但常被忽略的结论是:通用人形具身机器人很难在单一任务上超越专业机器人,效率追不上,成本更打不过。真正会率先爆发、兑现价值的,是大模型升级后的专业机器人;而通用人形具身机器人的核心价值,不在生产效率,而在情感陪伴。

在出海过程中,如何平衡全球体系化与各国本地化是决定成败的关键。多数出海产品初期仅完成语言翻译、支付适配等“表层本地化”,便能实现初步落地;但当产品进入规模化扩张阶段,各国对核心业务规则与算法的分歧逐渐凸显,这通常意味着产品进入了深水区,需要从“表层本地化”转向“底层架构重构”,既要守住全球体系的效率与一致性,又要适配本地市场的合规要求、用户偏好和商业环境。
主流电商分类对比解析:

常见软件服务收费模式:

推理缩放已经成为提升已部署大语言模型回答质量与准确率的最有效手段之一。
它的原理非常直白:如果我们愿意在推理阶段(即使用模型生成文本时)投入更多算力、花费更多时间,就能让模型输出更优质的答案。
如今,每一家主流大语言模型服务商都在采用某种形式的推理时算力缩放,学术界围绕这类方法的研究也在快速增长。
今年3月,我曾写过一篇推理缩放领域概览,总结了早期的部分技术。
《大语言模型推理模型的推理现状》
在本文中,我会在之前讨论的基础上做进一步延伸,将不同方法划分成更清晰的类别,同时重点介绍过去几个月涌现的最新研究成果。
在为《从零构建推理模型》一书撰写推理缩放完整章节的过程中,我亲自实验了这类方法的众多基础变体。为了调优超参数,我累计跑了数千次实验,花了大量精力斟酌哪些方法值得在章节中展开讲解。(这个章节最后篇幅过长,我最终拆成了两章,目前都已在抢先阅读计划中上线。)
附言:我对这两章的最终呈现非常满意。它们能把基础模型的准确率从约15%提升到52%左右,是目前整本书里成就感最强的内容之一。
本文整理了一些没有放进最终章节叙事、但仍然值得分享的思路、笔记与论文。
我也计划后续在GitHub的补充材料里加入更多代码实现。
推理时算力缩放概述
思维链提示
自一致性
N选优排序
带验证器的拒绝采样
自我精炼
解路径搜索
结论、分类与组合方式
番外:闭源大语言模型都用了哪些技术?
你可以在网页版阅读时使用左侧导航栏,直接跳转到任意章节。
推理时算力缩放(也叫推理算力缩放、测试时缩放,或简称推理缩放)是一个统称,指代所有在推理阶段投入更多算力与时间来提升模型表现的方法。
这个概念由来已久,经典机器学习中的集成方法就可以看作推理时缩放的早期例子——使用多个模型会消耗更多算力,但能得到更好的结果。
即便在大语言模型领域,这个思路也早已存在。不过我印象中,它是去年OpenAI在o1的官宣博文《用大语言模型学习推理》里放出一张推理缩放与训练缩放的对比图后,才又一次彻底火了起来。

图1:在推理阶段(左)和训练阶段(右)投入更多资源,通常都能提升模型准确率。
我认为这张改自OpenAI博客的图,很好地概括了我们优化大模型的两个核心抓手:我们既可以在训练阶段投入更多资源(更多数据、更大模型、更多或更长的训练阶段),也可以在推理阶段做优化。
实际上,最优做法是双管齐下:先训练出更强的模型,再通过额外的推理缩放让它的表现更上一层楼。
本文只聚焦图的左半部分,也就是推理时缩放技术——即所有无需训练、不修改模型权重的方法。
原文地址:Understanding Reasoning LLMs,by Sebastian Raschka, on 2025-02-05
本文将介绍构建推理模型的四种核心路径,阐释如何为大语言模型(LLM)赋予并强化推理能力。希望本文能提供有价值的洞见,帮你在该领域快速迭代的学术研究与行业热潮中理清脉络。
2024 年,大语言模型领域的专业化趋势愈发明显。除了预训练与微调技术的持续演进,检索增强生成(RAG)、代码助手等垂直场景应用也快速崛起。我预计这一趋势将在 2025 年进一步加速,行业会更聚焦于领域与场景专属的优化(即 “专业化”)。

图 1:第 1-3 阶段是大语言模型的通用开发流程,第 4 阶段则是针对具体场景对模型进行专业化定制
推理模型的开发正是这类专业化方向之一。我们通过优化模型,使其擅长解决需要中间推导步骤的复杂任务,比如逻辑谜题、高等数学与编程挑战。但这种专业化并不会替代其他大语言模型的应用场景;将通用大模型改造为推理模型也会带来一些短板,后文会详细展开。
先简要预告本文的核心内容:
阐释 “推理模型” 的定义
分析推理模型的优势与局限
拆解 DeepSeek R1 的技术实现路径
介绍构建与优化推理模型的四种主流方案
分享 DeepSeek V3 与 R1 发布后,大语言模型行业格局的观察
给出低成本开发推理模型的实践建议
希望在 AI 高速发展的 2025 年,本文能为你带来切实的帮助。
如果你从事 AI(或广义的机器学习)相关工作,一定对各种模糊且充满争议的术语定义不陌生,“推理模型” 也不例外。总会有论文先给出一个正式定义,后续的研究又会重新改写定义,循环往复。
在本文中,我将 “推理” 定义为:回答问题时需要经过多步复杂生成、产出中间推导过程的能力。
举个例子,“法国的首都是哪里?” 这类事实性问答不涉及推理;而 “一列火车以 60 英里 / 小时的速度行驶 3 小时,总行驶距离是多少?” 就需要基础的推理 —— 模型需要先识别出距离、速度、时间三者的关系,再推导得出答案。

图 2:普通大语言模型可能只输出简短答案(左),而推理模型通常会给出中间步骤,展现部分思考过程。(注:很多未专门针对推理优化的大语言模型,同样能在回答中输出中间推理步骤。)
如今绝大多数大语言模型都具备基础推理能力,可以解答上述的火车行程类问题。因此当下我们所说的 “推理模型”,通常特指擅长解决更复杂推理任务的模型,比如逻辑解谜、智力问答、数学证明等。
此外,当前市面上标注为 “推理模型” 的产品,大多会在回复中包含 “思考” 过程。至于大语言模型是否真的在 “思考”,则是另一个独立的讨论议题。
推理模型的中间步骤有两种呈现形式:
第一种是显式输出,即像上图一样把推导过程直接展示在回复中;
第二种是隐式执行,比如 OpenAI 的 o1 模型,会在内部运行多轮带中间步骤的迭代,但过程不对用户可见。

图 3:“推理” 体现在两个层面:1)模型内部通过多步中间过程处理输入、生成结果;2)模型在面向用户的回复中呈现一定的推理逻辑。
明确了推理模型的定义后,我们可以进入更核心的话题:如何构建与优化面向推理任务的大语言模型。但在深入技术细节之前,有必要先厘清:推理模型的真实适用场景是什么。
推理模型专为复杂任务设计,比如解逻辑谜题、攻克高等数学问题、处理高难度编程任务。但对于摘要生成、翻译、知识类问答等简单任务,推理模型并非必需。
事实上,所有场景都强行使用推理模型反而会低效且昂贵:推理模型通常调用成本更高、输出更冗长,有时还会因为 “过度思考” 而更容易出错。这里也适用一个简单原则:根据任务选择合适的工具(或大语言模型类型)。
推理模型的核心优势与局限总结如下图:

图 4:推理模型的核心优劣势
在正式介绍四种构建推理模型的主流方法前,我先基于 DeepSeek R1 的技术报告,简要梳理它的训练流水线。这份报告既是一个精彩的案例,也可以作为开发推理型大语言模型的参考蓝图。
需要注意的是,DeepSeek 并非只发布了一款 R1 推理模型,而是推出了三个不同版本:DeepSeek-R1-Zero、DeepSeek-R1 与 DeepSeek-R1-Distill。
结合技术报告的描述,我将这三款模型的开发流程整理成了下图:

图 5:DeepSeek R1 技术报告中三款推理模型的开发流程
接下来我们先简要梳理图中的流程,更详细的技术细节会在下一节四种构建方法中展开。
DeepSeek-R1-Zero:该模型基于 2024 年 12 月发布的 6710 亿参数预训练基座 DeepSeek-V3 开发。团队采用双奖励机制的强化学习(RL)进行训练,由于跳过了基于人类反馈的强化学习(RLHF)中常规的监督微调(SFT)环节,这种方式也被称为 “冷启动” 训练。
DeepSeek-R1:这是 DeepSeek 的旗舰推理模型,在 DeepSeek-R1-Zero 的基础上迭代而来。团队通过额外的监督微调阶段与多轮强化学习训练,进一步优化了这款 “冷启动” 的 R1-Zero 模型。
DeepSeek-R1-Distill:DeepSeek 团队利用前序步骤生成的监督微调数据,对 Qwen、Llama 等开源模型进行微调,提升其推理能力。这并非传统意义上的知识蒸馏,而是用大模型(6710 亿参数的 DeepSeek-R1)的输出作为训练数据,让更小的模型(Llama 8B/70B、Qwen 1.5B–30B)进行监督微调。
本节将梳理当前提升大语言模型推理能力、打造专用推理模型(如 DeepSeek-R1、OpenAI o1/o3 等)的主流技术方案。
注:o1 与 o3 的具体技术细节仅 OpenAI 内部知晓,业内普遍推测它同时结合了推理侧优化与训练侧优化两类技术。
提升大语言模型推理能力(或任何通用能力)的第一种思路,是推理时算力扩展。这个术语有多重含义,在本文语境下,它指的是通过提升推理阶段的计算资源投入,来优化输出质量。
可以用一个通俗的类比:人类面对复杂问题时,思考时间越充分,往往能给出更完善的答案。同理,我们也可以通过技术手段,让大语言模型在生成答案时 “多思考一会儿”。(至于大语言模型算不算真正的 “思考”,则是另一个议题。)
推理时算力扩展最基础的实现方式是精巧的提示工程。经典代表就是思维链(CoT)提示:在输入提示中加入 “一步步思考” 这类指令,引导模型生成中间推理步骤,而非直接跳到最终答案。对于复杂问题,这种方法通常(但并非绝对)能提升答案的准确率。
(注:对于 “法国首都是哪里” 这类简单知识类问题,用思维链提示毫无意义 —— 这也可以作为一个判断标准:如果一个问题用思维链提示才有收益,那它才值得用推理模型来处理。)

图 6:经典思维链提示示例,出自 2022 年论文《Large Language Models are Zero-Shot Reasoners》(https://arxiv.org/abs/2205.11916)
上述思维链方法之所以属于推理时算力扩展,是因为它生成了更多输出 token,推高了推理的计算成本。
推理时算力扩展的另一类实现方式是投票与搜索策略。最简单的是多数投票法:让大语言模型生成多个答案,再通过投票选出出现次数最多的结果。同理,也可以用束搜索、其他搜索算法来生成更优的回复。
关于这类策略的更多细节,我非常推荐阅读《Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters》这篇论文,我在之前的《2024 年值得关注的 AI 论文(下)》(https://magazine.sebastianraschka.com/p/ai-research-papers-2024-part-2)一文中也做过解读。

图 7:不同搜索类方法均基于过程奖励模型筛选最优答案。图源标注改自论文《Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters》,https://arxiv.org/abs/2408.03314
DeepSeek R1 的技术报告将过程奖励模型、蒙特卡洛树搜索这类常见的推理时扩展方法归为 “未达预期的尝试”。这意味着除了 R1 模型本身天然会生成更长回复(相比 V3 基座模型,这本身就是一种隐式的推理时算力扩展),DeepSeek 并没有在模型内部显式集成这类技术。
不过,显式的推理时算力扩展通常在应用层实现,而非内置在模型本身,因此 DeepSeek 的产品端也可能仍在使用这类方案。
我推测 OpenAI 的 o1 与 o3 模型都采用了推理时算力扩展,这也能解释为什么它们比 GPT-4o 这类模型贵得多。除了推理侧优化,o1 与 o3 大概率也采用了和 DeepSeek R1 类似的强化学习训练流水线。下两节会详细介绍强化学习相关内容。
DeepSeek R1 论文中我个人认为最亮眼的发现,就是:推理行为可以通过纯强化学习自发涌现。我们来详细拆解这一点。
前文提到,DeepSeek 开发了三款 R1 系列模型。第一款 DeepSeek-R1-Zero 基于 2024 年 12 月发布的通用预训练大模型 DeepSeek-V3 基座开发。
和常规的强化学习流水线(先做监督微调,再做强化学习)不同,DeepSeek-R1-Zero 完全跳过了初始的监督微调阶段,仅通过强化学习完成训练,如下图所示。

图 8:DeepSeek-R1-Zero 模型开发流程
这套强化学习流程和常用的 RLHF(基于人类反馈的强化学习)逻辑相似 ——RLHF 通常用于大模型的偏好对齐。(我在《大语言模型训练:RLHF 及其替代方案》一文中详细讲解过 RLHF。)
但核心区别在于:DeepSeek-R1-Zero 跳过了用于指令对齐的监督微调环节,这也是它被称为 “纯” 强化学习的原因。(当然,大语言模型语境下的强化学习,和传统强化学习差异很大,这是另一个话题了。)
在奖励设计上,它没有采用基于人类偏好训练的奖励模型,而是设置了两类奖励:准确性奖励与格式奖励。
准确性奖励:针对编程题用 LeetCode 编译器验证答案正确性,针对数学题用确定性规则校验结果。
格式奖励:通过大语言模型裁判,确保回复符合指定格式,比如将推理步骤放在 \\ 标签内。
令人意外的是,仅靠这套机制,大语言模型就演化出了基础推理能力。研究团队观察到了一个 “顿悟时刻”:模型开始自发在回复中生成推理轨迹,而并没有人明确教它这么做,如下图所示。

图 9:DeepSeek R1 技术报告(https://arxiv.org/abs/2501.12948)中展示的 “顿悟时刻” 涌现现象
尽管 R1-Zero 算不上顶级性能的推理模型,但它确实能生成中间 “思考” 步骤、具备推理能力。这证明了纯强化学习就可以孵化出推理模型,而 DeepSeek 团队是首个(至少是首个公开发表成果的团队)验证这一结论的团队。
本专栏是读者支持的独立创作。如果你想收到新文章、支持我的创作,欢迎免费订阅或付费订阅。
输入你的邮箱…
订阅
接下来我们看 DeepSeek 的旗舰推理模型 DeepSeek-R1,它是构建推理模型的典型范本。这款模型在 DeepSeek-R1-Zero 的基础上,叠加了额外的监督微调(SFT)与强化学习(RL),进一步提升了推理性能。
实际上,强化学习之前先做监督微调是行业常规操作,标准 RLHF 流水线就是如此。OpenAI 的 o1 大概率也采用了类似的开发路径。

图 10:DeepSeek-R1 模型开发流程
如上图所示,DeepSeek 团队先用 DeepSeek-R1-Zero 生成了所谓的 “冷启动” 监督微调数据 —— 之所以叫 “冷启动”,是因为生成这些数据的 R1-Zero 本身从未经过任何监督微调训练。
基于这批冷启动监督微调数据,DeepSeek 先对模型做了指令微调,再进入下一轮强化学习训练。这轮强化学习保留了 R1-Zero 阶段的准确性奖励与格式奖励,同时新增了一致性奖励,避免模型在回复中混用多种语言。
强化学习阶段结束后,团队又进行了一轮监督微调数据采集:用最新的模型检查点生成 60 万条思维链监督微调样本,再用 DeepSeek-V3 基座模型补充 20 万条知识类监督微调样本。
随后,团队用这总计 80 万条样本对 DeepSeek-V3 基座做指令微调,再进行最终一轮强化学习。这一轮中,数学与编程题依然用规则化方法计算准确性奖励,其他类型问题则引入人类偏好标注。
整体来看,这套流程和常规 RLHF 非常接近,区别仅在于:监督微调数据包含了更多思维链样本,强化学习除了人类偏好奖励,还加入了可验证的规则化奖励。
最终的 DeepSeek-R1 模型,相比 R1-Zero 性能有显著提升,对比如下表:

图 11:OpenAI o1 与 DeepSeek R1 系列模型的基准测试对比。图源标注改自 DeepSeek-R1 技术报告,https://arxiv.org/abs/2501.12948
到目前为止,我们已经介绍了三种构建推理模型的核心路径:
推理时算力扩展:无需训练、不改模型本身,仅通过推理侧优化提升推理能力。
纯强化学习:代表是 DeepSeek-R1-Zero,证明了无需监督微调,推理能力也能通过强化学习自发涌现。
监督微调 + 强化学习:打造了 DeepSeek-R1 这款旗舰推理模型。
剩下的第四种路径,就是模型蒸馏。
有意思的是,DeepSeek 也发布了通过 “蒸馏” 训练的小模型。但在大语言模型领域,蒸馏并不完全等同于深度学习里经典的知识蒸馏。
传统知识蒸馏(我在《机器学习问答》一书第 6 章简要介绍过)是让小型学生模型,同时学习大型教师模型的输出概率分布与目标数据集的标注。
而这里的 “蒸馏”,指的是用大模型生成的监督微调数据集,对小型大语言模型(比如 Llama 8B/70B、Qwen 2.5 全系列 0.5B 到 32B)做指令微调。
具体来说,这些 “教师” 大模型指的是 DeepSeek-V3 和 DeepSeek-R1 的中间检查点;蒸馏所用的监督微调数据,和上一节训练 DeepSeek-R1 的是同一批。
为了更清晰地展示这个流程,我在下图中标出了蒸馏对应的环节:

图 12:DeepSeek-R1-Distill 系列模型开发流程
为什么要开发这些蒸馏模型?在我看来主要有两个原因:
小模型效率更高:运行成本更低,还能在更低配置的硬件上跑起来,对广大研究者和技术爱好者非常友好。
纯监督微调的效果参照:这些蒸馏模型是很好的基准,可以验证不借助强化学习、仅靠监督微调,模型的推理能力能达到什么水平。
下表对比了蒸馏模型、其他主流模型,以及 DeepSeek-R1-Zero、DeepSeek-R1 的性能:

图 13:蒸馏模型与非蒸馏模型的基准测试对比。图源标注改自 DeepSeek-R1 技术报告,https://arxiv.org/abs/2501.12948
可以看到,蒸馏模型的性能明显弱于完整的 DeepSeek-R1,但相比体量小几个数量级的 DeepSeek-R1-Zero,表现却出人意料地好。另外值得注意的是,它们的表现和 o1-mini 相当接近 —— 我猜测 o1-mini 本身可能也是 o1 的类似蒸馏版本。
在结束这一小节前,还有一组很有意思的对比:DeepSeek 团队验证了一个问题:DeepSeek-R1-Zero 上观察到的推理涌现现象,在小模型上是否也能复现?
他们把 R1-Zero 的纯强化学习方案,直接用在了 Qwen-32B 模型上,实验结果如下表所示。表中的 QwQ-32B-Preview 是 Qwen 团队基于 Qwen 2.5 32B 开发的推理参照模型(其训练细节并未公开)。这组实验能帮我们进一步判断:纯强化学习能否在远小于 DeepSeek-R1-Zero 的模型上催生出推理能力。

图 14:32B 参数量级别下,蒸馏与纯强化学习的基准测试对比。图源标注改自 DeepSeek-R1 技术报告,https://arxiv.org/abs/2501.12948
实验结果很有意思:对于小模型,蒸馏的效果远好于纯强化学习。这也印证了一个观点:仅靠强化学习,不足以在这个体量的模型上催生出强推理能力;而对小模型来说,用高质量推理数据做监督微调,是更高效的策略。
严谨起见,我认为表格里还应该补充两组对照:
按 DeepSeek-R1 的模式,用 SFT+RL 训练 Qwen-32B,对比纯 RL、纯 SFT 的收益,看强化学习与监督微调结合能带来多大提升。
按蒸馏模型的模式,用纯 SFT 训练 DeepSeek-V3 基座,直接对比 RL+SFT 和纯 SFT 的效果差异。
本专栏是读者支持的独立创作。如果你想收到新文章、支持我的创作,欢迎免费订阅或付费订阅。
输入你的邮箱…
订阅
本节我们梳理了构建与优化推理模型的四种策略,总结如下:
推理时算力扩展:无需额外训练,但会推高推理成本。当用户量或查询规模增长时,大规模部署的开销会显著上升。但对于本身性能已经很强的模型,它是提升表现的零门槛方案。我高度怀疑 o1 采用了推理时算力扩展,这也是它单 token 成本远高于 DeepSeek-R1 的原因之一。
纯强化学习:研究价值很高,能帮我们理解 “推理作为涌现行为” 的本质。但在实际模型开发中,RL+SFT 的组合是更优选择,能打造出性能更强的推理模型。我推测 o1 同样采用了 RL+SFT 的训练方式。更具体地说,我认为 o1 的基座模型体量弱于 DeepSeek-R1,但通过 RL+SFT 与推理时算力扩展弥补了差距。
RL+SFT 组合:是打造高性能推理模型的核心路径,DeepSeek-R1 就是这套方案的优秀范本。
模型蒸馏:非常适合打造体积小、效率高的推理模型。但它的局限在于无法推动技术创新、无法孵化下一代推理模型 —— 因为蒸馏永远依赖已有的、更强的模型来生成监督微调数据。
我认为接下来的一个重要发展方向,是把 RL+SFT(方案 3)和推理时算力扩展(方案 1)结合起来。OpenAI 的 o1 大概率就是这么做的,只不过它的基座模型弱于 DeepSeek-R1—— 这也解释了为什么 DeepSeek-R1 表现出色,同时推理成本还更低。
最近很多人问我怎么看 DeepSeek-R1 系列模型。简而言之:我认为这是一项非常出色的成果。作为一名研究工程师,我尤其欣赏它详实的技术报告,里面的方法论细节很有学习价值。
其中最有启发性的结论,就是推理能力可以通过纯强化学习自发涌现。另外,DeepSeek 以宽松的 MIT 开源协议开放了模型权重,限制比 Meta 的 Llama 系列还少,这点也非常难得。
DeepSeek-R1 比 o1 更强吗?我认为两者整体处于同一水平梯队。但 DeepSeek-R1 的推理效率明显更高,这说明 DeepSeek 可能把更多成本投入在了训练环节,而 OpenAI 的 o1 则更依赖推理时算力扩展。
当然,直接对比 o1 和 DeepSeek-R1 并不容易,因为 OpenAI 几乎没有公开 o1 的技术细节。比如我们完全不清楚:
o1 是不是混合专家(MoE)架构?
o1 的参数量到底有多大?
o1 会不会只是 GPT-4o 的小幅优化版,只做了少量 RL+SFT,主要靠大规模推理时算力扩展提分?
在这些信息缺失的前提下,直接对比本质上是 “苹果和橘子” 的不公平比较。
另一个热议话题是 DeepSeek-R1 的开发成本。有人说训练成本约 600 万美元,但这个数字其实混淆了 DeepSeek-V3(去年 12 月发布的基座模型)和 DeepSeek-R1。
600 万美元的估算,来自 2024 年 12 月对 DeepSeek-V3 最终训练轮次的 GPU 时耗测算,按每 GPU 小时 2 美元的租金计算得出。
而 DeepSeek 团队从未公开过 R1 的具体训练时耗或开发成本,所有相关估算都只是推测。
无论如何,DeepSeek-R1 都是开源推理模型的重要里程碑,它的推理效率优势,也让它成为 OpenAI o1 之外极具竞争力的选择。
即便从开源基座模型(比如 DeepSeek-V3)起步,打造 DeepSeek-R1 级别的推理模型,往往也需要数十万到数百万美元的投入。这对预算有限的研究者或工程师来说,难免望而却步。
幸运的是,模型蒸馏提供了性价比高得多的替代方案。DeepSeek 团队的 R1 蒸馏系列模型已经验证了这一点:这些模型体量远小于完整的 DeepSeek-R1,却拥有出人意料的强劲推理表现。
不过即便如此,蒸馏也不算完全低成本 —— 他们的蒸馏流程用了 80 万条监督微调样本,依然需要不少算力。
有意思的是,就在 DeepSeek-R1 发布前几天,我看到了 Sky-T1 项目:一个小团队只用 1.7 万条监督微调样本,就训练出了一款 320 亿参数的开源推理模型,总成本仅 450 美元,比大多数 AI 会议的注册费还便宜。
这个案例说明:大规模训练成本高昂,但小规模、针对性的微调,也能以极低的成本取得亮眼的效果。

图 15:图源《Sky-T1:450 美元内训练属于你的 o1-preview 级别模型》,https://novasky-ai.github.io/posts/sky-t1/
从基准测试来看,Sky-T1 的表现和 o1 大致相当,考虑到它极低的训练成本,这个成果非常惊人。
Sky-T1 走的是模型蒸馏路线,而在纯强化学习领域,也有很有意思的低成本实践。其中代表就是 TinyZero:一款 30 亿参数的模型,复现了 DeepSeek-R1-Zero 的思路(补充一句:训练成本不到 30 美元)。
令人意外的是,即便只有 30 亿参数,TinyZero 也展现出了一定的自验证涌现能力。这也佐证了:即便在小模型上,纯强化学习也能催生出推理能力。
TinyZero 的代码仓库提到相关研究报告还在撰写中,我会持续关注后续进展。

图 16:图源 TinyZero 代码仓库(https://github.com/Jiayi-Pan/TinyZero),展示了模型具备自验证能力。(如果能加上基座模型的回复作为对照会更有参考价值。)
注:该 GitHub 页面解析失败,相关信息仅基于仓库名称与原文引用内容整理。
以上两个项目证明:即便预算有限,也能开展推理模型的相关研究与实践。它们分别复现了 DeepSeek-R1 的两条技术路线 ——TinyZero 主打纯强化学习,Sky-T1 主打纯监督微调。如果能把这些思路进一步延伸拓展,相信会有更多有趣的成果。
去年我接触到一个很有意思的方向,出自论文《o1 复现之旅:战略进展报告(第一部分)》。别看标题叫 “复现 o1”,实际上论文并没有真正复现 o1,而是提出了一种优化蒸馏(纯监督微调)过程的新思路。
论文的核心概念是旅程学习,和传统的捷径学习相对应:
捷径学习:就是传统的指令微调方式,只用正确的解题路径来训练模型。
旅程学习:训练数据中同时包含错误的解题路径,让模型从错误中学习。
这个思路和 TinyZero 纯强化学习中观察到的自验证能力有相通之处,但它完全通过监督微调实现。让模型接触错误的推理路径与修正过程,也能强化模型的自我纠错能力,从而提升推理模型的可靠性。

图 17:与传统捷径学习不同,旅程学习在监督微调数据中加入了错误解题路径。图源标注改自论文《o1 复现之旅:战略进展报告(第一部分)》,https://arxiv.org/abs/2410.18982
这是一个很有前景的未来方向,尤其适合预算有限、难以承担强化学习算力成本的推理模型开发场景。
总而言之,当前推理模型领域正涌现出大量精彩的研究与实践,相信未来几个月还会有更多令人兴奋的成果出现。