大模型中转站中间人攻击解析与防御

大模型中转站中间人攻击解析与防御

在当下AI全民普及的时代,大语言模型(LLM)、AI编程助手、智能Agent已深度融入企业研发、自动化运维、个人办公全场景。GPT、Claude、Gemini等顶级模型能力强大,但官方API普遍存在收费昂贵、网络访问受限、调用门槛高等问题。

在此背景下,各类第三方大模型中转服务快速崛起。它们以低价普惠、免特殊网络、全模型聚合、高速稳定为宣传卖点,用极低的使用成本、极简的操作界面,吸引了海量个人开发者、中小企业用户。

便利与低价的背后,是绝大多数用户忽略的致命安全隐患。在使用第三方中转站时,本质是在无条件信任一个完全不受自己掌控的中间人。不同于普通的网络服务中转,大模型中转站拥有对用户请求、模型响应的完整读写、篡改、伪造、截留权限。

这也让大模型中转站中间人攻击(LLM MITM)从理论风险,变成当下AI安全领域最普遍、隐蔽性最高、破坏力最强的现实威胁。它早已突破传统网络窃听范畴,升级为语义层投毒、业务层渗透、系统层控权的复合型高级攻击。

Continue reading 大模型中转站中间人攻击解析与防御

大模型“岗前特训”:大模型微调(LLM Fine-tuning)

大模型“岗前特训”:大模型微调(LLM Fine-tuning)

如今大模型已经全面走入产业落地场景,从智能客服、行业知识库到专属AI助手,几乎所有垂直场景的大模型应用,都绕不开一个核心环节——模型微调。

很多人都有疑惑:明明可以用提示词(Prompt)、RAG检索就能让大模型适配业务,为什么还要费力做微调?事实上,Prompt存在能力上限、泛化性差、人工成本高的问题,RAG只能解决外部知识补充问题,无法改变模型的底层生成逻辑、风格习惯和领域认知。而微调,是让通用大模型真正变成「行业专属模型」的核心手段。

Continue reading 大模型“岗前特训”:大模型微调(LLM Fine-tuning)

大模型“瘦身术”:大模型量化(LLM Quantization)

大模型“瘦身术”:大模型量化(LLM Quantization)

过去几年,大语言模型凭借超强的理解、生成与推理能力,彻底引爆了AI行业。但强大能力的背后,是大模型难以回避的“三高痛点”:高算力消耗、高显存占用、高推理延迟。动辄数十亿、上百亿参数的大模型,看似智能无比,却极度依赖高端服务器、旗舰显卡,普通用户的电脑、手机根本无法运行。

想要打破算力壁垒,让大模型走出实验室、走进普通设备,就必须用到大模型领域的核心轻量化技术——模型量化(LLM Quantization)。它堪称大模型的“瘦身术”和“万能压缩包”,是解决AI低成本部署、终端落地的关键技术。今天我们来介绍一下大模型量化技术。

Continue reading 大模型“瘦身术”:大模型量化(LLM Quantization)

【转载】Karpathy LLM Wiki

2026年4月,前OpenAI创始成员Andrej Karpathy提出了一种新的个人知识管理新范式,核心是让大语言模型(LLM)充当 “知识编译器”,将零散原始资料(文章、论文、笔记等)自动生成结构化、可持久化、能复利增长的 Markdown 维基知识库。

它采用 Raw Sources(原始资料)、Wiki(LLM 生成的结构化知识库)、Schema(规范配置)三层架构,区别于传统 RAG 的 “运行时检索”,LLM Wiki 提前处理知识并持续维护更新,形成高密度互联的知识图谱(交叉引用的 Markdown Wiki),人类仅负责资料收集与判断,大幅降低知识维护成本。

Continue reading 【转载】Karpathy LLM Wiki

大模型时代学习方法小结

最近和几个朋友聊天的时候,大家稍微总结了一下大模型时代要如何快速学习,汇总了几个典型的方式:

方法1:在你有一定了解的领域,把AI当做有无限耐心的老师,无限提问法
1、当你想深入了解一个事情的时候,可以用清晰的命令描述好自己的问题,去多个AI同时发送该问题。
2、对每个AI反馈的内容进行初筛,最终保留2~3个候选AI
3、用靠谱的那个AI,去进一步咨询自己想理解的问题
4、不断的拓展问题的广度和深度,在这个过程中,最好记录一个思维导图,对于想进一步理解的点,做好标记
5、用适合自己的学习方式,把这些知识点逐一搞清楚
6、当AI不断说车轱辘话的时候,先更换说书,后尝试备选AI
7、一个不理解、但很重要的知识点,多发给几个AI,让他们交叉验证
8、请AI把整个过程的资料,梳理为笔记或思维导图
其实大家可以看到,知识面比较广的、求知欲强的、能提出好问题的、有一定较真精神的人,在AI时代会有更多的优势

Continue reading 大模型时代学习方法小结

【转载】理解推理型大语言模型

原文地址:Understanding Reasoning LLMs,by Sebastian Raschka, on 2025-02-05

理解推理型大语言模型:构建与优化推理模型的方法与策略

本文将介绍构建推理模型的四种核心路径,阐释如何为大语言模型(LLM)赋予并强化推理能力。希望本文能提供有价值的洞见,帮你在该领域快速迭代的学术研究与行业热潮中理清脉络。

2024 年,大语言模型领域的专业化趋势愈发明显。除了预训练与微调技术的持续演进,检索增强生成(RAG)、代码助手等垂直场景应用也快速崛起。我预计这一趋势将在 2025 年进一步加速,行业会更聚焦于领域与场景专属的优化(即 “专业化”)。

figure01

图 1:第 1-3 阶段是大语言模型的通用开发流程,第 4 阶段则是针对具体场景对模型进行专业化定制

推理模型的开发正是这类专业化方向之一。我们通过优化模型,使其擅长解决需要中间推导步骤的复杂任务,比如逻辑谜题、高等数学与编程挑战。但这种专业化并不会替代其他大语言模型的应用场景;将通用大模型改造为推理模型也会带来一些短板,后文会详细展开。

先简要预告本文的核心内容:

  • 阐释 “推理模型” 的定义

  • 分析推理模型的优势与局限

  • 拆解 DeepSeek R1 的技术实现路径

  • 介绍构建与优化推理模型的四种主流方案

  • 分享 DeepSeek V3 与 R1 发布后,大语言模型行业格局的观察

  • 给出低成本开发推理模型的实践建议

希望在 AI 高速发展的 2025 年,本文能为你带来切实的帮助。

如何定义 “推理模型”?

如果你从事 AI(或广义的机器学习)相关工作,一定对各种模糊且充满争议的术语定义不陌生,“推理模型” 也不例外。总会有论文先给出一个正式定义,后续的研究又会重新改写定义,循环往复。

在本文中,我将 “推理” 定义为:回答问题时需要经过多步复杂生成、产出中间推导过程的能力。
举个例子,“法国的首都是哪里?” 这类事实性问答不涉及推理;而 “一列火车以 60 英里 / 小时的速度行驶 3 小时,总行驶距离是多少?” 就需要基础的推理 —— 模型需要先识别出距离、速度、时间三者的关系,再推导得出答案。

figure02

图 2:普通大语言模型可能只输出简短答案(左),而推理模型通常会给出中间步骤,展现部分思考过程。(注:很多未专门针对推理优化的大语言模型,同样能在回答中输出中间推理步骤。)

如今绝大多数大语言模型都具备基础推理能力,可以解答上述的火车行程类问题。因此当下我们所说的 “推理模型”,通常特指擅长解决更复杂推理任务的模型,比如逻辑解谜、智力问答、数学证明等。

此外,当前市面上标注为 “推理模型” 的产品,大多会在回复中包含 “思考” 过程。至于大语言模型是否真的在 “思考”,则是另一个独立的讨论议题。

推理模型的中间步骤有两种呈现形式:
第一种是显式输出,即像上图一样把推导过程直接展示在回复中;
第二种是隐式执行,比如 OpenAI 的 o1 模型,会在内部运行多轮带中间步骤的迭代,但过程不对用户可见。

figure03

图 3:“推理” 体现在两个层面:1)模型内部通过多步中间过程处理输入、生成结果;2)模型在面向用户的回复中呈现一定的推理逻辑。

什么时候该用推理模型?

明确了推理模型的定义后,我们可以进入更核心的话题:如何构建与优化面向推理任务的大语言模型。但在深入技术细节之前,有必要先厘清:推理模型的真实适用场景是什么。

推理模型专为复杂任务设计,比如解逻辑谜题、攻克高等数学问题、处理高难度编程任务。但对于摘要生成、翻译、知识类问答等简单任务,推理模型并非必需。
事实上,所有场景都强行使用推理模型反而会低效且昂贵:推理模型通常调用成本更高、输出更冗长,有时还会因为 “过度思考” 而更容易出错。这里也适用一个简单原则:根据任务选择合适的工具(或大语言模型类型)。

推理模型的核心优势与局限总结如下图:

figure04

图 4:推理模型的核心优劣势

DeepSeek 训练流程概览

在正式介绍四种构建推理模型的主流方法前,我先基于 DeepSeek R1 的技术报告,简要梳理它的训练流水线。这份报告既是一个精彩的案例,也可以作为开发推理型大语言模型的参考蓝图。

需要注意的是,DeepSeek 并非只发布了一款 R1 推理模型,而是推出了三个不同版本:DeepSeek-R1-Zero、DeepSeek-R1 与 DeepSeek-R1-Distill。

结合技术报告的描述,我将这三款模型的开发流程整理成了下图:

figure05

图 5:DeepSeek R1 技术报告中三款推理模型的开发流程

接下来我们先简要梳理图中的流程,更详细的技术细节会在下一节四种构建方法中展开。

  1. DeepSeek-R1-Zero:该模型基于 2024 年 12 月发布的 6710 亿参数预训练基座 DeepSeek-V3 开发。团队采用双奖励机制的强化学习(RL)进行训练,由于跳过了基于人类反馈的强化学习(RLHF)中常规的监督微调(SFT)环节,这种方式也被称为 “冷启动” 训练。

  2. DeepSeek-R1:这是 DeepSeek 的旗舰推理模型,在 DeepSeek-R1-Zero 的基础上迭代而来。团队通过额外的监督微调阶段与多轮强化学习训练,进一步优化了这款 “冷启动” 的 R1-Zero 模型。

  3. DeepSeek-R1-Distill:DeepSeek 团队利用前序步骤生成的监督微调数据,对 Qwen、Llama 等开源模型进行微调,提升其推理能力。这并非传统意义上的知识蒸馏,而是用大模型(6710 亿参数的 DeepSeek-R1)的输出作为训练数据,让更小的模型(Llama 8B/70B、Qwen 1.5B–30B)进行监督微调。

构建与优化推理模型的四种核心方法

本节将梳理当前提升大语言模型推理能力、打造专用推理模型(如 DeepSeek-R1、OpenAI o1/o3 等)的主流技术方案。

注:o1 与 o3 的具体技术细节仅 OpenAI 内部知晓,业内普遍推测它同时结合了推理侧优化与训练侧优化两类技术。

1. 推理时算力扩展

提升大语言模型推理能力(或任何通用能力)的第一种思路,是推理时算力扩展。这个术语有多重含义,在本文语境下,它指的是通过提升推理阶段的计算资源投入,来优化输出质量。

可以用一个通俗的类比:人类面对复杂问题时,思考时间越充分,往往能给出更完善的答案。同理,我们也可以通过技术手段,让大语言模型在生成答案时 “多思考一会儿”。(至于大语言模型算不算真正的 “思考”,则是另一个议题。)

推理时算力扩展最基础的实现方式是精巧的提示工程。经典代表就是思维链(CoT)提示:在输入提示中加入 “一步步思考” 这类指令,引导模型生成中间推理步骤,而非直接跳到最终答案。对于复杂问题,这种方法通常(但并非绝对)能提升答案的准确率。
(注:对于 “法国首都是哪里” 这类简单知识类问题,用思维链提示毫无意义 —— 这也可以作为一个判断标准:如果一个问题用思维链提示才有收益,那它才值得用推理模型来处理。)

figure06

图 6:经典思维链提示示例,出自 2022 年论文《Large Language Models are Zero-Shot Reasoners》(https://arxiv.org/abs/2205.11916

上述思维链方法之所以属于推理时算力扩展,是因为它生成了更多输出 token,推高了推理的计算成本。

推理时算力扩展的另一类实现方式是投票与搜索策略。最简单的是多数投票法:让大语言模型生成多个答案,再通过投票选出出现次数最多的结果。同理,也可以用束搜索、其他搜索算法来生成更优的回复。

关于这类策略的更多细节,我非常推荐阅读《Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters》这篇论文,我在之前的《2024 年值得关注的 AI 论文(下)》(https://magazine.sebastianraschka.com/p/ai-research-papers-2024-part-2)一文中也做过解读。

figure07

图 7:不同搜索类方法均基于过程奖励模型筛选最优答案。图源标注改自论文《Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters》,https://arxiv.org/abs/2408.03314

DeepSeek R1 的技术报告将过程奖励模型、蒙特卡洛树搜索这类常见的推理时扩展方法归为 “未达预期的尝试”。这意味着除了 R1 模型本身天然会生成更长回复(相比 V3 基座模型,这本身就是一种隐式的推理时算力扩展),DeepSeek 并没有在模型内部显式集成这类技术。

不过,显式的推理时算力扩展通常在应用层实现,而非内置在模型本身,因此 DeepSeek 的产品端也可能仍在使用这类方案。

我推测 OpenAI 的 o1 与 o3 模型都采用了推理时算力扩展,这也能解释为什么它们比 GPT-4o 这类模型贵得多。除了推理侧优化,o1 与 o3 大概率也采用了和 DeepSeek R1 类似的强化学习训练流水线。下两节会详细介绍强化学习相关内容。

2. 纯强化学习(RL)

DeepSeek R1 论文中我个人认为最亮眼的发现,就是:推理行为可以通过纯强化学习自发涌现。我们来详细拆解这一点。

前文提到,DeepSeek 开发了三款 R1 系列模型。第一款 DeepSeek-R1-Zero 基于 2024 年 12 月发布的通用预训练大模型 DeepSeek-V3 基座开发。
和常规的强化学习流水线(先做监督微调,再做强化学习)不同,DeepSeek-R1-Zero 完全跳过了初始的监督微调阶段,仅通过强化学习完成训练,如下图所示。

figure08

图 8:DeepSeek-R1-Zero 模型开发流程

这套强化学习流程和常用的 RLHF(基于人类反馈的强化学习)逻辑相似 ——RLHF 通常用于大模型的偏好对齐。(我在《大语言模型训练:RLHF 及其替代方案》一文中详细讲解过 RLHF。)
但核心区别在于:DeepSeek-R1-Zero 跳过了用于指令对齐的监督微调环节,这也是它被称为 “纯” 强化学习的原因。(当然,大语言模型语境下的强化学习,和传统强化学习差异很大,这是另一个话题了。)

在奖励设计上,它没有采用基于人类偏好训练的奖励模型,而是设置了两类奖励:准确性奖励格式奖励

  • 准确性奖励:针对编程题用 LeetCode 编译器验证答案正确性,针对数学题用确定性规则校验结果。

  • 格式奖励:通过大语言模型裁判,确保回复符合指定格式,比如将推理步骤放在 \\ 标签内。

令人意外的是,仅靠这套机制,大语言模型就演化出了基础推理能力。研究团队观察到了一个 “顿悟时刻”:模型开始自发在回复中生成推理轨迹,而并没有人明确教它这么做,如下图所示。

figure09

图 9:DeepSeek R1 技术报告(https://arxiv.org/abs/2501.12948)中展示的 “顿悟时刻” 涌现现象

尽管 R1-Zero 算不上顶级性能的推理模型,但它确实能生成中间 “思考” 步骤、具备推理能力。这证明了纯强化学习就可以孵化出推理模型,而 DeepSeek 团队是首个(至少是首个公开发表成果的团队)验证这一结论的团队。


本专栏是读者支持的独立创作。如果你想收到新文章、支持我的创作,欢迎免费订阅或付费订阅。

输入你的邮箱…
订阅


3. 监督微调 + 强化学习(SFT + RL)

接下来我们看 DeepSeek 的旗舰推理模型 DeepSeek-R1,它是构建推理模型的典型范本。这款模型在 DeepSeek-R1-Zero 的基础上,叠加了额外的监督微调(SFT)与强化学习(RL),进一步提升了推理性能。

实际上,强化学习之前先做监督微调是行业常规操作,标准 RLHF 流水线就是如此。OpenAI 的 o1 大概率也采用了类似的开发路径。

figure10

图 10:DeepSeek-R1 模型开发流程

如上图所示,DeepSeek 团队先用 DeepSeek-R1-Zero 生成了所谓的 “冷启动” 监督微调数据 —— 之所以叫 “冷启动”,是因为生成这些数据的 R1-Zero 本身从未经过任何监督微调训练。

基于这批冷启动监督微调数据,DeepSeek 先对模型做了指令微调,再进入下一轮强化学习训练。这轮强化学习保留了 R1-Zero 阶段的准确性奖励与格式奖励,同时新增了一致性奖励,避免模型在回复中混用多种语言。

强化学习阶段结束后,团队又进行了一轮监督微调数据采集:用最新的模型检查点生成 60 万条思维链监督微调样本,再用 DeepSeek-V3 基座模型补充 20 万条知识类监督微调样本。

随后,团队用这总计 80 万条样本对 DeepSeek-V3 基座做指令微调,再进行最终一轮强化学习。这一轮中,数学与编程题依然用规则化方法计算准确性奖励,其他类型问题则引入人类偏好标注。
整体来看,这套流程和常规 RLHF 非常接近,区别仅在于:监督微调数据包含了更多思维链样本,强化学习除了人类偏好奖励,还加入了可验证的规则化奖励。

最终的 DeepSeek-R1 模型,相比 R1-Zero 性能有显著提升,对比如下表:

figure11

图 11:OpenAI o1 与 DeepSeek R1 系列模型的基准测试对比。图源标注改自 DeepSeek-R1 技术报告,https://arxiv.org/abs/2501.12948

4. 纯监督微调(SFT)与模型蒸馏

到目前为止,我们已经介绍了三种构建推理模型的核心路径:

  1. 推理时算力扩展:无需训练、不改模型本身,仅通过推理侧优化提升推理能力。

  2. 纯强化学习:代表是 DeepSeek-R1-Zero,证明了无需监督微调,推理能力也能通过强化学习自发涌现。

  3. 监督微调 + 强化学习:打造了 DeepSeek-R1 这款旗舰推理模型。

剩下的第四种路径,就是模型蒸馏

有意思的是,DeepSeek 也发布了通过 “蒸馏” 训练的小模型。但在大语言模型领域,蒸馏并不完全等同于深度学习里经典的知识蒸馏。
传统知识蒸馏(我在《机器学习问答》一书第 6 章简要介绍过)是让小型学生模型,同时学习大型教师模型的输出概率分布与目标数据集的标注。

而这里的 “蒸馏”,指的是用大模型生成的监督微调数据集,对小型大语言模型(比如 Llama 8B/70B、Qwen 2.5 全系列 0.5B 到 32B)做指令微调。
具体来说,这些 “教师” 大模型指的是 DeepSeek-V3 和 DeepSeek-R1 的中间检查点;蒸馏所用的监督微调数据,和上一节训练 DeepSeek-R1 的是同一批。

为了更清晰地展示这个流程,我在下图中标出了蒸馏对应的环节:

figure12

图 12:DeepSeek-R1-Distill 系列模型开发流程

为什么要开发这些蒸馏模型?在我看来主要有两个原因:

  1. 小模型效率更高:运行成本更低,还能在更低配置的硬件上跑起来,对广大研究者和技术爱好者非常友好。

  2. 纯监督微调的效果参照:这些蒸馏模型是很好的基准,可以验证不借助强化学习、仅靠监督微调,模型的推理能力能达到什么水平。

下表对比了蒸馏模型、其他主流模型,以及 DeepSeek-R1-Zero、DeepSeek-R1 的性能:

figure13

图 13:蒸馏模型与非蒸馏模型的基准测试对比。图源标注改自 DeepSeek-R1 技术报告,https://arxiv.org/abs/2501.12948

可以看到,蒸馏模型的性能明显弱于完整的 DeepSeek-R1,但相比体量小几个数量级的 DeepSeek-R1-Zero,表现却出人意料地好。另外值得注意的是,它们的表现和 o1-mini 相当接近 —— 我猜测 o1-mini 本身可能也是 o1 的类似蒸馏版本。

在结束这一小节前,还有一组很有意思的对比:DeepSeek 团队验证了一个问题:DeepSeek-R1-Zero 上观察到的推理涌现现象,在小模型上是否也能复现?
他们把 R1-Zero 的纯强化学习方案,直接用在了 Qwen-32B 模型上,实验结果如下表所示。表中的 QwQ-32B-Preview 是 Qwen 团队基于 Qwen 2.5 32B 开发的推理参照模型(其训练细节并未公开)。这组实验能帮我们进一步判断:纯强化学习能否在远小于 DeepSeek-R1-Zero 的模型上催生出推理能力。

figure14

图 14:32B 参数量级别下,蒸馏与纯强化学习的基准测试对比。图源标注改自 DeepSeek-R1 技术报告,https://arxiv.org/abs/2501.12948

实验结果很有意思:对于小模型,蒸馏的效果远好于纯强化学习。这也印证了一个观点:仅靠强化学习,不足以在这个体量的模型上催生出强推理能力;而对小模型来说,用高质量推理数据做监督微调,是更高效的策略。

严谨起见,我认为表格里还应该补充两组对照:

  1. 按 DeepSeek-R1 的模式,用 SFT+RL 训练 Qwen-32B,对比纯 RL、纯 SFT 的收益,看强化学习与监督微调结合能带来多大提升。

  2. 按蒸馏模型的模式,用纯 SFT 训练 DeepSeek-V3 基座,直接对比 RL+SFT 和纯 SFT 的效果差异。


本专栏是读者支持的独立创作。如果你想收到新文章、支持我的创作,欢迎免费订阅或付费订阅。

输入你的邮箱…
订阅


方法总结

本节我们梳理了构建与优化推理模型的四种策略,总结如下:

  1. 推理时算力扩展:无需额外训练,但会推高推理成本。当用户量或查询规模增长时,大规模部署的开销会显著上升。但对于本身性能已经很强的模型,它是提升表现的零门槛方案。我高度怀疑 o1 采用了推理时算力扩展,这也是它单 token 成本远高于 DeepSeek-R1 的原因之一。

  2. 纯强化学习:研究价值很高,能帮我们理解 “推理作为涌现行为” 的本质。但在实际模型开发中,RL+SFT 的组合是更优选择,能打造出性能更强的推理模型。我推测 o1 同样采用了 RL+SFT 的训练方式。更具体地说,我认为 o1 的基座模型体量弱于 DeepSeek-R1,但通过 RL+SFT 与推理时算力扩展弥补了差距。

  3. RL+SFT 组合:是打造高性能推理模型的核心路径,DeepSeek-R1 就是这套方案的优秀范本。

  4. 模型蒸馏:非常适合打造体积小、效率高的推理模型。但它的局限在于无法推动技术创新、无法孵化下一代推理模型 —— 因为蒸馏永远依赖已有的、更强的模型来生成监督微调数据。

我认为接下来的一个重要发展方向,是把 RL+SFT(方案 3)和推理时算力扩展(方案 1)结合起来。OpenAI 的 o1 大概率就是这么做的,只不过它的基座模型弱于 DeepSeek-R1—— 这也解释了为什么 DeepSeek-R1 表现出色,同时推理成本还更低。

关于 DeepSeek R1 的几点思考

最近很多人问我怎么看 DeepSeek-R1 系列模型。简而言之:我认为这是一项非常出色的成果。作为一名研究工程师,我尤其欣赏它详实的技术报告,里面的方法论细节很有学习价值。

其中最有启发性的结论,就是推理能力可以通过纯强化学习自发涌现。另外,DeepSeek 以宽松的 MIT 开源协议开放了模型权重,限制比 Meta 的 Llama 系列还少,这点也非常难得。

和 o1 相比如何?

DeepSeek-R1 比 o1 更强吗?我认为两者整体处于同一水平梯队。但 DeepSeek-R1 的推理效率明显更高,这说明 DeepSeek 可能把更多成本投入在了训练环节,而 OpenAI 的 o1 则更依赖推理时算力扩展。

当然,直接对比 o1 和 DeepSeek-R1 并不容易,因为 OpenAI 几乎没有公开 o1 的技术细节。比如我们完全不清楚:

  • o1 是不是混合专家(MoE)架构?

  • o1 的参数量到底有多大?

  • o1 会不会只是 GPT-4o 的小幅优化版,只做了少量 RL+SFT,主要靠大规模推理时算力扩展提分?

在这些信息缺失的前提下,直接对比本质上是 “苹果和橘子” 的不公平比较。

DeepSeek-R1 的训练成本

另一个热议话题是 DeepSeek-R1 的开发成本。有人说训练成本约 600 万美元,但这个数字其实混淆了 DeepSeek-V3(去年 12 月发布的基座模型)和 DeepSeek-R1。

600 万美元的估算,来自 2024 年 12 月对 DeepSeek-V3 最终训练轮次的 GPU 时耗测算,按每 GPU 小时 2 美元的租金计算得出。

而 DeepSeek 团队从未公开过 R1 的具体训练时耗或开发成本,所有相关估算都只是推测。

无论如何,DeepSeek-R1 都是开源推理模型的重要里程碑,它的推理效率优势,也让它成为 OpenAI o1 之外极具竞争力的选择。

低成本开发推理模型

即便从开源基座模型(比如 DeepSeek-V3)起步,打造 DeepSeek-R1 级别的推理模型,往往也需要数十万到数百万美元的投入。这对预算有限的研究者或工程师来说,难免望而却步。

好消息:蒸馏方案性价比很高

幸运的是,模型蒸馏提供了性价比高得多的替代方案。DeepSeek 团队的 R1 蒸馏系列模型已经验证了这一点:这些模型体量远小于完整的 DeepSeek-R1,却拥有出人意料的强劲推理表现。
不过即便如此,蒸馏也不算完全低成本 —— 他们的蒸馏流程用了 80 万条监督微调样本,依然需要不少算力。

有意思的是,就在 DeepSeek-R1 发布前几天,我看到了 Sky-T1 项目:一个小团队只用 1.7 万条监督微调样本,就训练出了一款 320 亿参数的开源推理模型,总成本仅 450 美元,比大多数 AI 会议的注册费还便宜。

这个案例说明:大规模训练成本高昂,但小规模、针对性的微调,也能以极低的成本取得亮眼的效果。

figure15

图 15:图源《Sky-T1:450 美元内训练属于你的 o1-preview 级别模型》,https://novasky-ai.github.io/posts/sky-t1/

从基准测试来看,Sky-T1 的表现和 o1 大致相当,考虑到它极低的训练成本,这个成果非常惊人。

低成本纯强化学习:TinyZero

Sky-T1 走的是模型蒸馏路线,而在纯强化学习领域,也有很有意思的低成本实践。其中代表就是 TinyZero:一款 30 亿参数的模型,复现了 DeepSeek-R1-Zero 的思路(补充一句:训练成本不到 30 美元)。

令人意外的是,即便只有 30 亿参数,TinyZero 也展现出了一定的自验证涌现能力。这也佐证了:即便在小模型上,纯强化学习也能催生出推理能力。

TinyZero 的代码仓库提到相关研究报告还在撰写中,我会持续关注后续进展。

figure16

图 16:图源 TinyZero 代码仓库(https://github.com/Jiayi-Pan/TinyZero),展示了模型具备自验证能力。(如果能加上基座模型的回复作为对照会更有参考价值。)
注:该 GitHub 页面解析失败,相关信息仅基于仓库名称与原文引用内容整理。

以上两个项目证明:即便预算有限,也能开展推理模型的相关研究与实践。它们分别复现了 DeepSeek-R1 的两条技术路线 ——TinyZero 主打纯强化学习,Sky-T1 主打纯监督微调。如果能把这些思路进一步延伸拓展,相信会有更多有趣的成果。

超越传统监督微调:旅程学习

去年我接触到一个很有意思的方向,出自论文《o1 复现之旅:战略进展报告(第一部分)》。别看标题叫 “复现 o1”,实际上论文并没有真正复现 o1,而是提出了一种优化蒸馏(纯监督微调)过程的新思路。

论文的核心概念是旅程学习,和传统的捷径学习相对应:

  • 捷径学习:就是传统的指令微调方式,只用正确的解题路径来训练模型。

  • 旅程学习:训练数据中同时包含错误的解题路径,让模型从错误中学习。

这个思路和 TinyZero 纯强化学习中观察到的自验证能力有相通之处,但它完全通过监督微调实现。让模型接触错误的推理路径与修正过程,也能强化模型的自我纠错能力,从而提升推理模型的可靠性。

figure17

图 17:与传统捷径学习不同,旅程学习在监督微调数据中加入了错误解题路径。图源标注改自论文《o1 复现之旅:战略进展报告(第一部分)》,https://arxiv.org/abs/2410.18982

这是一个很有前景的未来方向,尤其适合预算有限、难以承担强化学习算力成本的推理模型开发场景。

总而言之,当前推理模型领域正涌现出大量精彩的研究与实践,相信未来几个月还会有更多令人兴奋的成果出现。

大模型幻觉自动识别

关于大模型自动化幻觉识别的一些思考:
1、要求大模型输出参考文献、文献引用及数据更新时间
2、通过搜索引擎、RAG等工具,确认文献可信度
3、通过搜索引擎、RAG等工具,获取有没有最新的信息
4、对于风险高的情形,对比其他大模型结果(感觉成本好高)
5、通过小模型,判定置信度

领域大模型怎么用才高效?5大增强方法+2大开发范式,从入门到进阶

整理了一些领域大模型增强的技术方法:
领域大模型增强方法


领域大模型怎么用才高效?5大增强方法+2大开发范式,从入门到进阶

很多企业和个人用领域大模型时都会遇到困惑:“为什么模型输出的内容不够精准?”“怎么让模型快速掌握行业知识?” 其实领域大模型的核心价值,不在于 “基础模型多强”,而在于 “针对性增强”—— 通过数据、提示、工具的组合优化,让通用模型适配特定场景。今天就拆解领域大模型的增强方法和开发范式,帮你快速提升模型实用价值。

一、模型调整:选对 “底座”,精准补能
模型的 “底子” 和 “适配度”,直接决定了后续增强效果,核心分两步走:
第一步,基础模型选用
优先选生成质量高、上下文窗口足够长、推理能力强的模型作为底座 —— 比如处理长文档的法律合同解析,就需要大上下文模型;做复杂逻辑推理的金融分析,就侧重推理能力强的模型,避免 “小马拉大车”。

第二步,按需选择调整方式
1、不推荐多数企业做 “垂直大模型重新训练”:需要大量领域知识数据,成本超高、耗时极长,除非是头部企业且有核心场景刚需;

2、优先考虑 “模型微调”:注入较新的领域知识,比如将 2023-2024 年的行业新规、企业内部流程数据融入模型,适配性比通用模型强很多,但要注意 —— 核心是 “大量高质量数据”,数据质量直接决定微调效果;

3、少数据场景用 “Prompt 数据补充”:如果没有足够数据做微调,可将简单 QA、核心知识点直接嵌入 Prompt,让模型快速获取关键信息,比如给模型喂 “行业术语对照表”“常见问题解答”,快速提升专业度。

二、Prompt 优化:用 “精准指令” 让模型少走弯路
Prompt 是人和模型的 “沟通桥梁”,优化后能让模型输出质量翻倍,核心技巧有 4 个:
1、结构化提示:把需求拆分成清晰的模块,比如 “先分析问题核心→再列出解决方案→最后给出注意事项”,利于模型理解逻辑,避免输出混乱;

2、无效内容清理:去掉和需求无关的描述,比如问 “电商行业的用户留存策略”,就不用附带 “我是做互联网的,最近想提升业绩” 这类冗余信息,让模型聚焦核心问题;

3、领域限定与角色设定:明确场景边界和模型身份,比如 “假定你是电商运营专家,基于淘宝平台规则,分析美妆类目新店铺的用户留存方法”,限定条件 + 角色定位,让输出更精准;

4、思维链引导:通过少样本提示(给 1-2 个示例)或零样本提示(直接引导步骤),让模型一步步思考,比如 “先拆解用户流失的 3 个核心原因,再针对每个原因给出 2 个具体策略,最后说明落地优先级”,避免模型跳过关键步骤。

三、RAG 增强:给模型建 “专属知识库”,解决知识滞后问题
大模型的知识有 “截止日期”,而 RAG(检索增强生成)能让模型实时调用最新数据,核心逻辑是 “检索 + 生成”:
1、把大量领域数据(比如行业报告、企业内部文档、最新政策文件)整理后存入向量数据库,相当于给模型建了一个 “专属图书馆”;

2、当用户提问时,模型先从 “图书馆” 中检索相似的相关信息,再结合自身知识生成回答 —— 既解决了模型知识滞后的问题,又能让输出有具体数据支撑,比如问 “2024 年新能源汽车的补贴政策”,模型会从向量数据库中检索最新政策文件,精准回复。

3、关键注意点:做好元数据设计和向量数据库构建,定期更新数据,确保检索的准确性和时效性。

四、工具调用:让模型 “手脚并用”,拓展能力边界
纯文本模型的能力有限,搭配工具后能实现 “信息查询、数据分析、图表生成” 等复杂功能,核心场景包括:
1、联网搜索:获取实时信息,比如 “查询今日原油价格”“了解最新行业动态”,解决模型知识不更新的问题;

2、数据库查询:对接企业内部数据库,比如查询 “近 3 个月的销售数据”“用户画像统计”,直接基于真实业务数据生成分析报告;

3、数据分析与图表生成:自动处理 Excel 表格、生成柱状图 / 折线图,比如 “分析近半年的用户增长趋势,生成可视化图表并给出结论”;

4、关键支撑:通过 MCP(AI 工具调用标准)和 A2A(Agent 间通讯标准),实现不同工具、不同 Agent 之间的标准化调用,让协作更顺畅。

五、Agent 增强:让模型成为 “自主决策者”,搞定复杂任务
如果说工具调用是 “给模型加手脚”,那 Agent 就是 “给模型加大脑”,核心能力是 “自主规划 + 执行 + 调整”:
1、面对复杂任务,Agent 能自动拆解步骤,比如 “完成电商店铺的月度运营复盘”,会拆解为 “1. 调取近 30 天销售数据→2. 分析用户增长 / 流失情况→3. 对比行业均值→4. 找出核心问题→5. 给出优化策略→6. 生成复盘报告”;

2、过程中能自主选择工具,比如需要数据就调用数据库,需要行业对比就联网搜索,还能评估阶段性结果,比如发现 “销售数据异常”,会自动调整步骤,补充 “异常原因分析”;

3、适合场景:复杂流程优化、多步骤任务执行(如市场调研、项目规划),让模型从 “被动响应” 变成 “主动解决问题”。

六、两大核心开发范式:组合使用效果翻倍
单独用一种增强方法效果有限,推荐两种主流组合范式:
1、微调 + Prompt+RAG:适合需要深度适配领域的场景,比如企业内部的智能客服 —— 通过微调注入企业流程知识,用 Prompt 优化回复逻辑,用 RAG 调用最新的产品信息和售后政策,既专业又精准;

2、Agent+Tools:适合复杂任务处理,比如跨境电商的选品分析 ——Agent 拆解任务(市场调研→竞品分析→成本核算→风险评估),调用联网搜索(市场趋势)、数据库查询(成本数据)、数据分析工具(竞品销量),全程自主完成,高效落地。

总结:领域大模型的增强逻辑 ——“扬长避短,按需组合”
领域大模型的增强,不是 “越多方法越好”,而是 “按需选择”:
1、数据充足、场景固定→优先 “微调 + RAG”;
2、数据有限、需求灵活→优先 “Prompt 优化 + 工具调用”;
3、复杂任务、需要自主决策→用 “Agent+Tools”;
4、核心是让模型的 “推理能力” 结合 “领域知识” 和 “工具能力”,实现 1+1>2 的效果。

你在使用领域大模型时,遇到过哪些 “不精准”“不实用” 的问题?欢迎在评论区留言,一起探讨解决方案~