递归自我改进(RSI):这个方向现在到哪一步了


资料截至 2026-10-09,全部来自 arXiv ,这个方向的论文量在这几个月是爆发的,所以”最新”这件事本身有保质期。

一、RSI 是什么,它和”自动化”差在哪

递归自我改进(Recursive Self-Improvement,RSI):系统改进自己,改进后的系统再来改进自己。关键不在”自动”,而在改进的对象是系统自身。

按”改什么”分,目前能看到四种层次:

改进对象 具体形态
提示与工作流(harness) agent 重写自己的控制器指令、记忆协议、工具与技能定义
记忆 把经验沉淀成可复用的外部记忆,供后续任务读取
自己的源代码 编程 agent 直接编辑自己的代码库
权重与数据 自生成轨迹再训练自己

它的思想源头是 Gödel Machine 的理想:一台能证明自己每次改动都”净收益为正”的自我改进机器。而 Darwin Gödel Machine 的摘要把现实说得很清楚——证明大多数改动有益在实践中做不到,所以这条路转向了”经验验证 + 开放演化”(arXiv:2505.22954)。

二、三条技术路线

1. 改代码:编程 agent 改写自己

这条线的进展最直观,因为它有跑分。

  • A Self-Improving Coding Agent(2025-04,arXiv:2504.15228)。一个带基础编程工具的 agent 系统能自主编辑自己,在 SWE-Bench Verified 的随机子集上把成绩从 17% 提到 53%,在 LiveCodeBench 与合成的 agent 基准上也有提升。这篇通常被当作这条线的起点。
  • Darwin Gödel Machine(2025-05,arXiv:2505.22954)。放弃”可证明有益”,改成经验验证加存档式开放演化,让自我修改在谱系上累积下来。
  • Huxley-Gödel Machine(2025-10,arXiv:2510.21614)。这篇提出一个很值得记住的概念:元生产力-性能错配(Metaproductivity-Performance Mismatch)——当前跑分高,不代表这个 agent 后续自我改进的潜力大。作者改用”后代的表现”(CMP 指标)来衡量自我改进潜力,而不是它自己的分数。
  • Mendel Gödel Machine(2026-08,arXiv:2608.07645)。指出多数做法一次只看一条失败轨迹,浪费了历史尝试里的对比信息;于是引入基于多任务轨迹的”反应规范变异”等自我修改方式。

2. 改数据与奖励:自我监督的瓶颈

  • Multi-Agent Self-Supervision(MASS)(2026-10,arXiv:2610.12176)把这条路的难点讲得很直白:在不可验证任务(例如开放式研究)上会出现监督瓶颈——输出已经超出人类专家能可靠评估的范围,于是模型自己既是”被优化者”又是”优化者和评估者”。但单个模型实例在同质回路里很难批评并改进自己的复杂推理,所以它用多智能体结构来解决:演化式工作流优化与自生成轨迹上的监督微调交替进行。
  • 更早的自我奖励线(如 arXiv:2503.03746、arXiv:2508.06026)都在做同一件事:让模型给自己打分,再用自产数据迭代。

3. 改科研流程与环境

  • The AI Scientist(2024-08,arXiv:2408.06292)。全自动开放式科研的第一个完整框架。
  • Jr. AI Scientist 及其风险报告(2025-11,arXiv:2511.04583)。模拟新手研究者的流程:分析基线论文的局限 → 提假设 → 迭代实验 → 写论文,并附一份风险报告。
  • AlphaEvolve(2025-06,arXiv:2506.13131)。演化式编码 agent,持续接收评估器反馈来改进算法本身,报告了在开放科学问题与关键计算基础设施上的改进。
  • RSI-Forge(2026-10,arXiv:2610.09426)。多智能体流水线把已发表的论文变成可执行的自改进环境:产出 210 个环境、覆盖 18 个领域,其中 90 个经过独立复核,每篇论文的方法都被独立重实现以保证基线可信。它针对的瓶颈是——环境(任务 + 可靠评估)才是 RSI 的地基,但造环境一直得靠领域专家。
  • RSIGym(2026-10,arXiv:2610.10310)。agent 原生的自改进环境(构建在 Everything as a Service 之上),把训练、推理、rollout、评估、沙箱都做成可复用服务,支持 Data / Harness / Joint 三条改进轨,并带共享预算与权限控制。

三、近期转向:从”能不能”到”怎么量、怎么防跑偏”

最近的重心明显变了。不太有人还在问”能不能自我改进”,问题变成了三个:怎么度量它、怎么给环境、怎么防止它跑偏。

  • Verification and Self-Improvement in Agentic AI: Foundations and Limits(2026-10,arXiv:2610.10611)给了一个理论视角:跑分提升本身无法区分三种机制——是”搜得更久”、是”拿到了更多外部支持”、还是真的改变了”如何提出与验证候选方案”。也就是说,成绩涨了不等于自我改进能力涨了。
  • SEABench(2026-09,arXiv:2609.35596)测的是内生失准(endogenous misalignment):自我进化出的更新在局部有用,却会留存到后续任务里产生不安全行为——不需要任何外部对抗输入。它用 48 条纵向任务序列覆盖多种进化面、任务域与危害类型。
  • Safety in Self-Evolving Agents: A Survey(2026-09,arXiv:2610.00093)把安全问题的性质变化说得很清楚:一旦经验变成可复用的状态,过去的事件就成为未来的原因——某个上下文里无害的信息,可能以更强的持续性和权威性影响之后的决策。
  • ReSI(2026-10,arXiv:2610.12233)反过来把递归用在安全上:模型每次更新后安全对齐都要重新适配,目标是”对已知威胁的抵抗”加上”对未预见风险的韧性”。
  • Authorization for Self-Modifying AI Agent Populations(2026-10,arXiv:2610.00347)指出自我修改的 agent 会替换、分叉、回滚自己的”带身份的软件”,而逐个后继授权管不住整个种群(兄弟节点可能重复配额、合并权限、越过祖先裁剪),于是提出”授权继承”来在代际之间守恒权限。

四、实验室与学界的表态

这一层比论文更能说明现在到了哪一步。

一篇 22 人的论文(2609.36054,2026-09-28):《What if automating AI R&D triggers an intelligence explosion?》,作者里有 Hinton、Bengio、Barto(RL 先驱)和 OpenAI 首席科学家 Pachocki。摘要第一句就很直白:

In contrast to even a year ago, AI systems now write most of the code inside the companies that build them.

大意是:和一年前不同,现在 AI 系统写出了”造它们的公司”里的大部分代码。论文的判断是初步证据支持”加速可能发生”,但也明确写了不确定性——算力、数据、实验时间都是约束——并给政策制定者提了三条:提高对 AI 研发自动化的可见度、设法约束和引导这个过程、让社会准备好适应冲击。

一份 25 人访谈(2603.03338,2026-02):2025 年 8–9 月访谈了前沿实验室与高校的 25 位研究者(DeepMind、OpenAI、Anthropic、Meta、伯克利、普林斯顿、斯坦福),其中 20 位把”自动化 AI 研究”列为最严重、最紧迫的风险之一;论文同时写明”AI 系统目前还不能递归自我改进”。

一场正在发生的抵制:据量子位 2026-10-09 报道,陶哲轩牵头成立”人类数学家协会”,25 位菲尔兹奖得主联名要求商业 AI 公司放慢;随后 OpenAI 放出 700 多份机器生成的证明文档——其内部模型在约 8000 个开放数学问题上成功率约 5%(每题平均约 3 小时 GPT-Pro 级算力)。反对理由是:未经同行评审、缺乏人类可读的逻辑、无视既有工作。这其实是”跑分涨了但无法验证”的现实版。

五、为什么”递归”这么难

把上面的论文串起来,瓶颈其实就四个:

  1. 评估瓶颈(裁判问题):谁来判定”这次改动真的更好”?任务可验证时还好,一到开放式任务就只能让模型自己当裁判(MASS 的出发点)。
  2. 跑分不等于能力:既有”元生产力-性能错配”(Huxley-Gödel),也有”三种机制混在一个分数里”(2610.10611)。优化分数和优化能力是两件事。
  3. 内生失准与环境反馈:局部有用的更新会沉淀成后续的不安全行为(SEABench),而且这种风险不来自外部攻击。
  4. 同质回路的极限与误差累积:同一个模型自我批评、自我评估,收益会很快饱和;同时每一步的验证成本与错误都会沿着谱系累积。

六、跟进综述

  • A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve(arXiv:2507.21046)——按”改什么、何时改、怎么改、在哪改”组织,适合建立整体框架。
  • Safety in Self-Evolving Agents: A Survey(arXiv:2610.00093)——安全侧的对应框架。

今天的 RSI 更像”agent 工程的自举”,而不是”智能爆炸”。但它值得跟的原因也在这里——它正在真实地推进评测、环境、权限这些基础设施,而这些恰好是大模型落地最缺的东西。

参考

  • A Self-Improving Coding Agent — 2504.15228(2025-04)
  • Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents — 2505.22954(2025-05)
  • Huxley-Gödel Machine: Human-Level Coding Agent Development — 2510.21614(2025-10)
  • Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution — 2608.07645(2026-08)
  • Recursive Self-Improvement through Multi-Agent Self-Supervision — 2610.12176(2026-10)
  • Process-based Self-Rewarding Language Models — 2503.03746(2025-03)
  • Temporal Self-Rewarding Language Models — 2508.06026(2025-08)
  • The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery — 2408.06292(2024-08)
  • Jr. AI Scientist and Its Risk Report — 2511.04583(2025-11)
  • AlphaEvolve: A coding agent for scientific and algorithmic discovery — 2506.13131(2025-06)
  • RSI-Forge: From Research Papers to Environments for Recursive Self-Improvement — 2610.09426(2026-10)
  • RSIGym: A Flexible Environment for Recursive Self-Improvement — 2610.10310(2026-10)
  • Verification and Self-Improvement in Agentic AI: Foundations and Limits — 2610.10611(2026-10)
  • SEABench: Benchmarking Endogenous Misalignment in Self-Evolving Agents — 2609.35596(2026-09)
  • Safety in Self-Evolving Agents: A Survey — 2610.00093(2026-09)
  • ReSI: Recursive Safety Improvement toward Resistant and Resilient AI — 2610.12233(2026-10)
  • Authorization for Self-Modifying AI Agent Populations — 2610.00347(2026-10)
  • A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve — 2507.21046(2025-07)
  • What if automating AI R&D triggers an intelligence explosion? — 2609.36054(2026-09)
  • AI Researchers’ Views on Automating AI R&D and Intelligence Explosions — 2603.03338(2026-02)
  • AgentGarten: Code Worlds for Evolving Agents — 2610.12374(2026-10)

文章作者: Halensea
版权声明: 本博客所有文章除特別声明外,均采用 CC BY 4.0 许可协议。转载请注明来源 Halensea !
 上一篇
世界模型(World Models):它是什么、用来干什么、现在到哪一步 世界模型(World Models):它是什么、用来干什么、现在到哪一步
世界模型想让模型学会"如果我这么做,世界接下来会变成什么样"。它是机器人与自动驾驶里最被看重的一块,这篇按四条技术路线梳理它是什么、用在哪,以及现在的真实瓶颈。
2026-10-09
下一篇 
大模型推理部署:vLLM、SGLang 与 Ollama 对比 大模型推理部署:vLLM、SGLang 与 Ollama 对比
三个工具都能在本地跑大模型,但定位完全不同——Ollama 求"最快跑起来",vLLM 求单机吞吐,SGLang 求高并发下的前缀复用。这篇整理三者的差异、上手命令和选型依据。
2026-10-09
  目录