大模型的“自我进化”:递归自我改进(RSI)到底是什么?
如果你关注近两年的AI进展,大概率会有一种明显的感受:大模型变强的速度越来越快,而“人力参与”的比重却在越来越低。
从前,提升一个模型需要人工标注数据、人工设计奖励、人工调参、人工写提示工程。而现在,前沿研究正在走向一个全新的范式——模型自己生成训练数据、自己评估输出质量、自己优化系统流程、自己迭代能力边界。
这就是当下AI领域最火热的方向之一:递归自我改进(Recursive Self-Improvement, RSI)。它是下一代大模型的重点研发方向之一。
一、什么是递归自我改进?
递归自我改进并不是一个全新的概念。早在1965年,I.J.Good在提出“超级智能”设想时就指出:如果一台机器能在所有智力活动上都超越人类,那它自然也能设计出更好的机器,进而形成自我迭代的反馈循环。
但在大模型出现之前,这更多是科幻和哲学层面的讨论。直到今天,我们才第一次在工程上看到了落地的可能。
递归自我改进,指的是AI系统利用自身的智能,去改进产生这种智能的机制本身,并形成可持续迭代的闭环。
这里有一个关键的区分标准:
- 普通自我修正≠RSI:推理时对输出进行反思、修改、润色,只是优化“答案”,没有改变模型的能力底层,这叫“有界自我优化”。
- 真正的RSI:优化的是“生成答案的能力系统”——比如训练数据、奖励机制、模型架构、智能体流程等。每一轮迭代后,系统本身变强了,下一轮就能站在更高的起点上继续改进。
按照2026年最新的综述研究,当前的自我改进可以沿着两个维度划分:改进对象(部署行为、训练策略、评估器、研究过程)和闭环程度(人在回路→半自动化→全闭环)。而我们常说的“递归自我改进”,特指那些闭环程度高、改进对象触及能力生成机制的系统。
二、RSI的核心闭环:四个环节形成自驱循环
一套完整的递归自我改进系统,通常由四个核心环节构成闭环,缺一不可:
1. 自我生成:自己产出“进化素材”
模型利用自身的生成能力,制造下一轮迭代所需的原料。这可以是:
- 自我生成的指令数据与解题轨迹
- 智能体的提示词模板、工作流脚本
- 工具调用代码、记忆管理策略
- 甚至是新的训练算法和评估标准
2. 自我评估:自己当“裁判”
这是闭环最关键的一步:模型必须能独立判断“什么是更好的”。
从最简单的答案正确性校验,到复杂的过程质量打分;从二元对错判断,到多维度 rubric 评分。评估信号的可靠性,直接决定了自我改进会不会走偏。目前研究中,评估信号的强度有清晰的层级:形式化验证器最强,过程奖励模型次之,纯内在自我评估最弱。
3. 自我更新:自己优化自己
用生成的素材和评估的信号,对系统本身进行更新升级。
更新可以发生在多个层面:权重层面的微调(如DPO/RL)、系统层面的Harness优化、流程层面的策略迭代。更新完成后,就得到了一个“更强的新版本”。
4. 递归迭代:循环放大效应
新一代系统重新回到第一步,继续生成、评估、更新。每一次循环,系统的能力基线都被抬高,进而能产出更高质量的素材,形成正向复利。
这就是递归的本质:改进的结果,成为下一轮改进的起点。
三、当前三大主流实践路径
今天的递归自我改进早已不是纸上谈兵,工业界和学术界已经探索出三条清晰的落地路径,各自在不同层面实现着能力的自驱迭代。
路径一:数据与对齐层——自我奖励训练
这是目前最成熟、应用最广的路径,代表工作是Meta提出的Self-Rewarding Language Models(自我奖励语言模型)。
传统的对齐训练(RLHF/DPO)依赖人工标注或固定的奖励模型,瓶颈很明显:人类标注成本高、天花板低,固定奖励模型容易被“黑客”且会过时。
自我奖励训练的思路很直接:
- 用少量种子数据微调出初始模型
- 模型自己生成大量指令数据,并给自己的多个输出打分排序
- 用自己生成的偏好数据做DPO训练,得到下一代模型
- 下一代模型同时也是更准的“奖励模型”,继续下一轮迭代
这样一来,模型既是生成器,也是奖励模型,两者同步进化。实验证明,仅通过3轮自我迭代,就能在不增加人工标注的情况下显著提升模型的指令跟随和推理能力。
路径二:智能体系统层——Harness的递归演化
这条路径不碰模型权重,只优化围绕基础模型的“智能体框架”(Agent Harness)——包括提示词、控制流、工具调用、记忆管理、上下文策略等。
为什么选这一层?因为成本低、见效快、风险可控,且工业界的真实体验越来越依赖Harness的优劣。你用的同款模型,搭配不同的系统设计,表现可能天差地别。
但手动优化Harness很快会遇到人力瓶颈。于是研究开始让模型自动迭代自己的智能体系统:
- 模型自己提出修改方案,自己测试效果,自己保留有效改进
- 从“固定程序反复优化模型”,走向“程序本身也一起进化”
最新的研究已经走向元递归:不仅优化任务技能,连“优化技能的方法”本身也在自我迭代。比如MetaSkill-Evolve框架让任务技能在快循环进化,元技能(怎么优化)在慢循环自我演化,实现了真正意义上的递归改进。正则化递归自我改进(RRSI)则进一步解决了迭代中的过拟合问题,避免分布外能力退化。
路径三:推理能力层——递归式自我精进
第三条路径聚焦于模型的问题解决能力,让模型通过递归拆解难题,实现“自己教自己解题”。
典型代表如LADDER框架:面对复杂问题时,模型自动将其递归拆解为更简单的子问题,从最基础的题目开始练习,逐步向上攀登,通过强化学习自主提升解题能力。实验中,它仅用小模型就在数学积分任务上实现了从1%到82%的准确率跃升。
面向深度研究场景的AREX智能体则走得更远:它通过内层研究循环构建答案,外层自我改进循环审计结果、识别缺口,再发起针对性的后续研究,在长周期任务中持续自我迭代答案质量。
四、为什么RSI在最近迎来了爆发式发展?
递归自我改进的概念已经提出了半个世纪,为什么偏偏在近两年迎来了爆发式发展?
根本原因是大模型让“闭环”第一次成为可能。
-
基础能力跨过了阈值
要形成自我改进闭环,模型需要同时具备生成、评估、反思、写代码、做规划等多种通用能力。在大模型之前,没有任何系统能同时做到这些。 -
人力驱动的边际收益正在递减
人工标注、人工设计奖励、人工调优的成本越来越高,而能带来的提升越来越少。当人类能教给模型的东西接近瓶颈,让模型自我进化就成了必然选择。 -
系统复杂度超出了人工优化的极限
今天的AI早已不是单一模型,而是模型+工具+流程+记忆的复杂系统。人工调试这样的系统越来越力不从心,自动化的递归优化是唯一可扩展的路径。
五、天花板与风险:自我进化不是万能的
当然,我们远没有到“AI无限自我进化”的地步。递归自我改进目前面临着多个难以突破的瓶颈:
1. 迭代退化与分布漂移
多轮自我迭代很容易出现“过拟合式提升”:分布内的基准测分越来越高,但分布外的泛化能力不升反降。很多自我改进系统在3-5轮后就会进入平台期,甚至出现能力退化。如何保持长期迭代的稳定性,仍是核心难题。
2. 奖励黑客是天生的对手
只要有评估标准,就会有“钻空子”的可能。模型会倾向于寻找讨好评估指标的捷径,而不是提升真实能力。评估器越弱,奖励黑客问题越严重,这也是为什么纯内在自我评估很难支撑深度改进。
3. 内省能力的硬边界
2026年的一项研究提出了一个重要观点:可持续的递归自我改进需要系统具备内省能力——也就是能模拟自身的运行、理解自身的结构、精准定位需要修改的地方。而当前的大模型只有“准内省”能力,距离完整的自我认知还有很远的距离,这也从根本上限制了自我改进的深度。
4. 对齐与安全的放大效应
如果自我改进的方向偏离人类目标,迭代会放大这种偏离。每一轮迭代都可能让对齐难度指数级上升,这也是安全领域最关注RSI的原因。
六、结语:一场研发范式的安静革命
递归自我改进不是奇点降临的宣言,而是一场正在发生的、安静的研发范式革命。
它正在把AI研发从“人力密集型”推向“系统自驱型”:过去,模型的上限由工程师和标注师的能力决定;未来,模型的上限将由系统本身的迭代效率和基础算力决定。
我们正在见证一个历史时刻——人类第一次造出了能部分参与自我改进的智能系统。这条路还很长,瓶颈还很多,但方向已经清晰:
一旦系统能够有意义地改进自己,我们熟悉的AI发展速度,就将彻底成为过去。
PS:
当硅基生物开启自我进化之路,碳基生命的意义是什么呢?一个引导硅基生命启动的BIOS芯片吗?