AI开始改进“改进自己的方法”,RSI进入平方时代丨MetaRSI

递归自我改进(Recursive Self-Improvement,RSI)被认为是通向通用人工智能的核心路径之一,但此前的RSI系统普遍采用固定不变的改进程序反复作用于模型,且大多仅从Harness(改进程序载体)、Data(数据迭代)、Model(模型自身优化)的单一视角切入,难以突破自我改进的速率天花板。

AI开始改进“改进自己的方法”,RSI进入平方时代丨MetaRSI

十余家顶尖机构联合攻关,破解RSI单视角改进瓶颈

为打破这一发展瓶颈,AI研究机构CosmosMind联合斯坦福大学、加州大学伯克利分校、麻省理工学院、清华大学、北京大学等全球十余家海内外顶尖高校,正式发布MetaRSI-v1。这是全球首个统一Model-RSI、Data-RSI、Harness-RSI三类RSI路线的元递归架构,核心能力是直接迭代优化“自我改进的方法”,而非仅提升单次改进的效果,被业界视为RSI领域从“线性迭代”迈向“平方级进化”的标志性突破。

三层RSI联动运转,实现能力边界的动态标定与累积

MetaRSI-v1首次重新定义了Data-RSI的定位,将其作为模型的能力边界探测与放大器:系统会对AI的执行轨迹与外界反馈产生的学习信号(learning-signal)进行联合分析,提炼出经过验证的可复用经验,并标定这些经验能够支撑的能力范围,明确框定模型能力的正负边界。
Data-RSI产出的验证经验会同时供给Harness-RSI与Model-RSI消费,两条改进路线的改动结果又会流回Data-RSI,重新标定能力边界、驱动下一轮迭代,让AI的能力逐轮披露、持续累积。
此外,Harness-RSI系统还能实现“做加法也做减法”:当Data-RSI放大暴露的问题被Model-RSI内化后,原本吸纳在Harness中的冗余知识会被自动识别并删除,核心能力得以保留,改进成本则随之降低。

提炼五条RSI运行定律,为自我改进划定核心规则

基于架构设计与实验验证,MetaRSI团队还提炼出了五条RSI运行的核心定律,为后续相关研究提供了可参考的规则框架:

  1. 验证决定自我改进的前沿。一个领域能否形成自改进闭环,取决于该领域任务能否被有效检验,是否存在合适的验证器(verifier)。
  2. 自我认知会过期,重新发现能力边界是速率瓶颈。RSI会改变agent的能力边界,其原本旧的系统描述随即失效,只有持续重新标定边界才能维持改进速率。
  3. 能力与载体无关,但成本与载体有关。改进产出的能力可跨载体复用,但不同载体的改进成本存在显著差异。

双路线验证效果显著,小模型增益翻倍前沿模型同样适用

MetaRSI团队通过两类路线验证了架构的有效性:

  • 小模型自我改进路线:测试目标为总参数35B、激活参数仅3B的Qwen3.5-35B-A3B模型,在Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond高难度子集、AIME四项高难度基准上进行评测。结果显示,MetaRSI-v1让该模型平均提升10.9分,SWE-bench Pro的问题解决率接近翻倍,Meta层为RSI带来了更高的性能天花板,连续自进化的累计增益提升显著。
  • 前沿模型自我改进路线:六款主流前沿模型在Terminal-Bench 2.1基准上平均提升7.3分,证明MetaRSI范式对旗舰模型同样成立,当前顶尖模型仍存在可观的自我改进空间。