什么是递归自我改进(RSI)?
递归自我改进指的是这样一个系统:它改进的是自己改进的能力——每一轮自我修改都让下一轮更有效,于是收益会累积。这个回路的狭窄片段是真实的,今天也已经被测量:一个模型润色自己的答案、生成自己的训练数据,或者搜索更好的提示词与工具组合。但这个词真正指称的那种累积式递归并没有被证实。已测量的回路会趋于平台,它们要运转就得依赖外部的正确性信号,而用自己的输出训练出来的系统是退化而非进步。
定义
递归自我改进是这样一个过程:一个 AI 系统修改自身——它的输出、它的提示词与脚手架、它的训练数据或它的权重——以提升自己继续进行此类修改的能力,使每一次迭代改进下一次。
核心要点
- 被主张的是递归,而不是自我改进:自我润色一轮是常规工程;能够累积的多轮并未被证实。
- 每一个被测量的自我改进回路都依赖一个外部的正确性信号——测试、验证器、奖励——没有它就停摆。
- 用自己的输出训练会让模型退化(模型崩塌);回路需要新鲜的真值,这是供给问题,不是算法问题。
- 真正上生产的是脚手架层面的:重写提示词、工具与评测套件的系统,而合并按钮握在人手里。
- 把「它自己变好了」当作一项测量主张来对待,并追问验证器是什么、递归走了多深、在哪里停下。
背景
这个想法很老,证据很薄。I. J. Good 在 1965 年论证说,一台能设计出更好机器的机器会引发「智能爆炸」,此后这个框架一直塑造着讨论——更多是作为论证,而不是作为测量。六十年后有用的问题不是爆炸会不会来,而是这个回路的哪些部分真被造出来了,以及是什么把它们限住了。
三项进展把它重新打开为工程话题而非哲学话题。模型可以在推理时投入更多算力去思考;针对可自动检查的奖励做强化学习,在正确性可由机器验证的地方效果很好;而智能体作用于代码——这是系统唯一能够编辑「产生了它的那个东西」的基底。
这一点对脚手架工作尤其切身。如果你在运行会写代码、选工具并调自己提示词的智能体,你已经在运行这个自我改进回路的一部分了——只是合并路径上还站着一个人。工程上的问题是这个人站在哪里、凭什么证据批准,而不是回路是否存在。
架构
一个系统可以在四种深度上修改自己,而它们的难度并不相同。最浅的是输出:在同一次运行之内,模型批评并重写自己的答案。这很常规,在一部分任务上有效,而且有边界——已发表的结果表明,在没有外部反馈时,模型往往无法可靠地把自己答错的与答对的分开,因此在自己的判断上反复迭代,质量可能原地不动甚至更差。
其次是提示词与脚手架:在指令、工具定义、检索设置与编排之间搜索,保留在留出集上得分更高的那一个。今天绝大多数真实收益都在这里,因为被改进的是代码和配置而不是模型,也因为分数来自系统之外。
更深一层是数据:系统生成自己的训练样本,只留下验证器接受的那些,再拿它们去训练。这在正确性可检查的地方奏效——测试通过、证明闭合、棋局取胜——也是近期最强结果背后的机制。而在正确性属于判断的地方,它会变质:系统优化的是验证器而不是任务。
最深的是权重,用自生成的信号重训或强化。累积式的那个主张本该在这里见分晓,而这里的证据最薄弱,因为失效方式不是崩溃,而是缓慢的收窄:用自己的分布去训练,它就会一代一代地收缩。
在这四层里,承重的部件都不是模型,而是验证器。递归能走多深,取决于你在不询问「产生它的那个系统」的情况下,能把好与坏分辨到什么程度。这就是为什么这个回路在代码和棋局里能跑很远,而在开放性工作里几乎跑不动。
组件
优势
- 带硬验证器的狭窄回路确实有生产力:在正确性可由机器检查的地方,自生成数据与搜索能带来被测量的收益。
- 脚手架层面的改进便宜且可逆:提示词、工具与检索设置都是配置,糟糕的一轮回退即可。
- 它把压力施加在评测上,而那里才是真正的工作:一个回路的价值不会超过它所优化的那个分数。
- 这个框架让治理变清楚:「这个系统可以改自己的什么,由谁批准」这个问题有答案,而且可审计。
风险
- 模型崩塌:用自生成输出训练会收窄分布,并让质量一代不如一代,所以没有新鲜真值的回路是衰减而非累积。
- 奖励套利:验证器一弱,系统改进的就是分数而不是任务,指标报出成功而能力并未跟上。
- 无法反驳的主张:「系统自己变好了」在缺少验证器、基线和递归深度时无法核验,而这三样恰恰是通常被省略的部分。
- 监督路径的丧失:自我修改越深,越难说清改了什么、为什么改,而这正是审计所需要的。
- 能力的不透明:一个会重写自己脚手架的系统,可能获得没人授予它的触及范围;这在成为能力问题之前,先是围堵问题。
工具与技术
示例
- 一个写补丁、跑测试套件、失败就重试的编码智能体:带硬验证器的一轮自我改进,也是真实仓库评测上那些被测量的进展背后的机制。
- 一个模型从自己生成又自己过滤的样例中学会使用某个工具,只保留那些让预测变好的调用。
- 在答案可自动检查的问题上做强化学习,训练信号来自检查器而不是人工标注。
- 一次提示词与脚手架搜索:提出变体、在留出集上各自打分、把胜者提升上去——不碰模型的改进。
常见问题解答
- 有哪个系统真的做到了递归自我改进吗?
- 没有系统展示过这个词所指称的累积式回路。已有的是针对外部验证器的单轮,以及对脚手架的搜索:两者都真实,两者都有边界。关于模型在没有外部反馈时自我纠错,已发表的结果明显薄弱;而用自生成数据训练会让质量一代一代下降。任何关于递归的主张,首先都得过这两道结论。
- 这和奇点是一回事吗?
- 奇点的论证把递归自我改进当作发动机,但这是两个不同的主张。RSI 是一个可以去寻找、去测量的机制;奇点是一个关于后果的预测。你完全可以把这个机制当作严肃的工程话题,同时对那个预测不持任何立场——对要造系统的人来说,这才是有用的姿态。
- 为什么验证器这么关键?
- 因为改进意味着「更好」,而这必须由被改进者之外的某个东西来判定。在机器能检查正确性的地方——测试通过、证明闭合、棋局取胜——回路转得起来,收益是真的。在正确性属于判断的地方,系统最终优化的是你给它的那个替代指标。递归深度是你验证器的属性,不是你模型的属性。
- 该让智能体在生产环境里改进自己的提示词和工具吗?
- 这是合理的,很多团队也在做,前提是三件事成立:分数来自这个回路看不到的留出集;每一项被采纳的改动都能归因到某一次运行;以及由一个人或一条策略来把关采纳。缺了这些,你自动化的不是改进,而是漂移。
- 什么才算真正递归的证据?
- 一个能往下跑好几代而改进率不下降的回路,一个系统无法套利的验证器,以及一条能把回路的贡献与所花算力分开的基线。这三样同时被报告出来的情况足够罕见,罕见到它们的缺席本身就是第一个该检查的地方。
参考文献
- Shinn et al. — Reflexion: Language Agents with Verbal Reinforcement Learning (2023)
- Schick et al. — Toolformer: Language Models Can Teach Themselves to Use Tools (2023)
- Jimenez et al. — SWE-bench: Can Language Models Resolve Real-World GitHub Issues? (2023)
- DeepSeek-AI — DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (2025)
- Huang et al. — Large Language Models Cannot Self-Correct Reasoning Yet (2023)
- Shumailov et al. — The Curse of Recursion: Training on Generated Data Makes Models Forget (2023)
- Anthropic — Responsible Scaling Policy
- Santa María, S. — The next generation of AI: Self-Improvement and Autonomous Learning (2025)