概念更新于 2026-09-30 · 版本 1.0

什么是递归自我改进(RSI)?

递归自我改进指的是这样一个系统:它改进的是自己改进的能力——每一轮自我修改都让下一轮更有效,于是收益会累积。这个回路的狭窄片段是真实的,今天也已经被测量:一个模型润色自己的答案、生成自己的训练数据,或者搜索更好的提示词与工具组合。但这个词真正指称的那种累积式递归并没有被证实。已测量的回路会趋于平台,它们要运转就得依赖外部的正确性信号,而用自己的输出训练出来的系统是退化而非进步。

证据: 理论研究置信度: 中来源: 论文来源: 基准测试

定义

递归自我改进是这样一个过程:一个 AI 系统修改自身——它的输出、它的提示词与脚手架、它的训练数据或它的权重——以提升自己继续进行此类修改的能力,使每一次迭代改进下一次。

核心要点

  • 被主张的是递归,而不是自我改进:自我润色一轮是常规工程;能够累积的多轮并未被证实。
  • 每一个被测量的自我改进回路都依赖一个外部的正确性信号——测试、验证器、奖励——没有它就停摆。
  • 用自己的输出训练会让模型退化(模型崩塌);回路需要新鲜的真值,这是供给问题,不是算法问题。
  • 真正上生产的是脚手架层面的:重写提示词、工具与评测套件的系统,而合并按钮握在人手里。
  • 把「它自己变好了」当作一项测量主张来对待,并追问验证器是什么、递归走了多深、在哪里停下。

背景

这个想法很老,证据很薄。I. J. Good 在 1965 年论证说,一台能设计出更好机器的机器会引发「智能爆炸」,此后这个框架一直塑造着讨论——更多是作为论证,而不是作为测量。六十年后有用的问题不是爆炸会不会来,而是这个回路的哪些部分真被造出来了,以及是什么把它们限住了。

三项进展把它重新打开为工程话题而非哲学话题。模型可以在推理时投入更多算力去思考;针对可自动检查的奖励做强化学习,在正确性可由机器验证的地方效果很好;而智能体作用于代码——这是系统唯一能够编辑「产生了它的那个东西」的基底。

这一点对脚手架工作尤其切身。如果你在运行会写代码、选工具并调自己提示词的智能体,你已经在运行这个自我改进回路的一部分了——只是合并路径上还站着一个人。工程上的问题是这个人站在哪里、凭什么证据批准,而不是回路是否存在。

架构

一个系统可以在四种深度上修改自己,而它们的难度并不相同。最浅的是输出:在同一次运行之内,模型批评并重写自己的答案。这很常规,在一部分任务上有效,而且有边界——已发表的结果表明,在没有外部反馈时,模型往往无法可靠地把自己答错的与答对的分开,因此在自己的判断上反复迭代,质量可能原地不动甚至更差。

其次是提示词与脚手架:在指令、工具定义、检索设置与编排之间搜索,保留在留出集上得分更高的那一个。今天绝大多数真实收益都在这里,因为被改进的是代码和配置而不是模型,也因为分数来自系统之外。

更深一层是数据:系统生成自己的训练样本,只留下验证器接受的那些,再拿它们去训练。这在正确性可检查的地方奏效——测试通过、证明闭合、棋局取胜——也是近期最强结果背后的机制。而在正确性属于判断的地方,它会变质:系统优化的是验证器而不是任务。

最深的是权重,用自生成的信号重训或强化。累积式的那个主张本该在这里见分晓,而这里的证据最薄弱,因为失效方式不是崩溃,而是缓慢的收窄:用自己的分布去训练,它就会一代一代地收缩。

在这四层里,承重的部件都不是模型,而是验证器。递归能走多深,取决于你在不询问「产生它的那个系统」的情况下,能把好与坏分辨到什么程度。这就是为什么这个回路在代码和棋局里能跑很远,而在开放性工作里几乎跑不动。

组件

提议方:生成候选改进的模型或智能体验证器:判定是否更好的外部信号(测试、留出集、奖励、人)尝试记忆:已经试过什么,以免搜索原地打转预算:这个回路可以花掉的算力与时间闸门:决定采纳什么的人或策略

优势

  • 带硬验证器的狭窄回路确实有生产力:在正确性可由机器检查的地方,自生成数据与搜索能带来被测量的收益。
  • 脚手架层面的改进便宜且可逆:提示词、工具与检索设置都是配置,糟糕的一轮回退即可。
  • 它把压力施加在评测上,而那里才是真正的工作:一个回路的价值不会超过它所优化的那个分数。
  • 这个框架让治理变清楚:「这个系统可以改自己的什么,由谁批准」这个问题有答案,而且可审计。

风险

  • 模型崩塌:用自生成输出训练会收窄分布,并让质量一代不如一代,所以没有新鲜真值的回路是衰减而非累积。
  • 奖励套利:验证器一弱,系统改进的就是分数而不是任务,指标报出成功而能力并未跟上。
  • 无法反驳的主张:「系统自己变好了」在缺少验证器、基线和递归深度时无法核验,而这三样恰恰是通常被省略的部分。
  • 监督路径的丧失:自我修改越深,越难说清改了什么、为什么改,而这正是审计所需要的。
  • 能力的不透明:一个会重写自己脚手架的系统,可能获得没人授予它的触及范围;这在成为能力问题之前,先是围堵问题。

工具与技术

自动验证器:测试套件、类型检查器、证明助手、模拟器留出评测集与回归套件针对带分目标的提示词与脚手架搜索拒绝采样与经验证器过滤的数据生成追踪与来源工具,使被采纳的改动可以归因

示例

  • 一个写补丁、跑测试套件、失败就重试的编码智能体:带硬验证器的一轮自我改进,也是真实仓库评测上那些被测量的进展背后的机制。
  • 一个模型从自己生成又自己过滤的样例中学会使用某个工具,只保留那些让预测变好的调用。
  • 在答案可自动检查的问题上做强化学习,训练信号来自检查器而不是人工标注。
  • 一次提示词与脚手架搜索:提出变体、在留出集上各自打分、把胜者提升上去——不碰模型的改进。

常见问题解答

有哪个系统真的做到了递归自我改进吗?
没有系统展示过这个词所指称的累积式回路。已有的是针对外部验证器的单轮,以及对脚手架的搜索:两者都真实,两者都有边界。关于模型在没有外部反馈时自我纠错,已发表的结果明显薄弱;而用自生成数据训练会让质量一代一代下降。任何关于递归的主张,首先都得过这两道结论。
这和奇点是一回事吗?
奇点的论证把递归自我改进当作发动机,但这是两个不同的主张。RSI 是一个可以去寻找、去测量的机制;奇点是一个关于后果的预测。你完全可以把这个机制当作严肃的工程话题,同时对那个预测不持任何立场——对要造系统的人来说,这才是有用的姿态。
为什么验证器这么关键?
因为改进意味着「更好」,而这必须由被改进者之外的某个东西来判定。在机器能检查正确性的地方——测试通过、证明闭合、棋局取胜——回路转得起来,收益是真的。在正确性属于判断的地方,系统最终优化的是你给它的那个替代指标。递归深度是你验证器的属性,不是你模型的属性。
该让智能体在生产环境里改进自己的提示词和工具吗?
这是合理的,很多团队也在做,前提是三件事成立:分数来自这个回路看不到的留出集;每一项被采纳的改动都能归因到某一次运行;以及由一个人或一条策略来把关采纳。缺了这些,你自动化的不是改进,而是漂移。
什么才算真正递归的证据?
一个能往下跑好几代而改进率不下降的回路,一个系统无法套利的验证器,以及一条能把回路的贡献与所花算力分开的基线。这三样同时被报告出来的情况足够罕见,罕见到它们的缺席本身就是第一个该检查的地方。

参考文献