号称人类造的最后一个 AI 要来了,刷屏全网的 RSI 是什么

前阵子OpenAI总裁格雷格·布罗克曼刚放出GPT-6 Astra摸到AGI门槛的消息,AGI的讨论热潮尚未退去,AI圈的新热词RSI(Recursive Self Improvement,递归自我改进)就已经接棒成为全球科技圈关注的焦点。

号称人类造的最后一个 AI 要来了,刷屏全网的 RSI 是什么

AGI余温未消 RSI接棒成AI新热词

简单来说,RSI的核心逻辑是让AI自主完成写代码、跑实验、改训练流程的全流程,改完的成果再传递给下一代能力更强的模型,经过多轮“套娃式”迭代,AI的研发速度可能呈指数级上升,最终超过人类的理解与控制速度。
和所有颠覆性技术登场时一样,RSI的走红也伴随着两极分化的争议:OpenAI首席科学家Jakub Pachocki将强AI描述为人类尚未充分理解的「异星心智」,Anthropic CEO达里奥·阿莫代伊更是警告更强的智能体可能带来大规模网络攻击、失控等文明级风险;而英伟达CEO黄仁勋近期在公开活动中反驳了非黑即白的二元论调,认为安全与创新并非只能二选一。

北大校友领衔 OpenAI押注Harness工程打开RSI落地口

据外媒The Information报道,北大校友翁荔重返OpenAI后,将牵头组建团队研究递归自我改进,她此前在技术博客中提出的Harness Engineering(harness工程)正是理解RSI落地的核心入口。
Harness可以理解为AI的运行系统,负责工具调用、上下文管理、记忆保存、任务分配、权限控制和结果检查等基础功能。AI可以通过自主优化这部分非模型权重的系统能力实现提升:比如发现自己总是遗忘实验条件就改进记录方式,发现某类工具反复出错就修正接口,发现研究流程效率低下就重写任务调度代码。这类改动未必直接修改模型权重,却可能明显提升整个系统的工作效率,同时为下一代模型的研发提供更优的基础环境。

五级自主性划分落地 RSI已在多产业跑通验证

日前由上海交通大学、清华大学、字节跳动、上海人工智能实验室等机构研究者合作完成的预印本《The Last AI Built by Humans》,首次将RSI的自主性划分为L1至L5五个层级,明确了技术的演进路径:

  1. L1级:仅能执行人类给出的改进方案;
  2. L2级:可自主寻找可行的改进策略;
  3. L3级:能够自主决定需要获取哪些经验数据;
  4. L4级:可以把部署环境中的反馈转化为可持续保留的系统改动;
  5. L5级:改进机制本身也成为改进对象,AI不仅能完成研究任务,还能修改决定后续方案搜索、结果评估、研究组织的机制,并让后继系统沿用修改后的逻辑。
    在最激进的终局设想中,L5级以上的AI还将进一步获得自主提出目标、修改评估方法、重写底层改进逻辑的能力,届时人类制造的将不再是一个单独的AI模型,而是一套能够持续自主制造新模型的系统。
    目前RSI已不是停留在纸面上的理论,多家企业已经跑通落地案例:
    • 面壁智能让Agent自主完成工程设计与优化,ForgeStencil实现1.15-1.9倍的效率提升;
    • 腾讯混元将代码、日志和评估反馈沉淀为经验驱动下一轮实验,nanochat验证误差率从0.9109降至0.9015;
    • 小红书生成式推荐通过真实反馈校正用户记忆,形成「记忆更新+模型迭代」的双层闭环,精排分score_mean@16从2.211提升至2.366,涨幅约7%。
      研究同时指出不同领域的RSI落地进度差异显著:软件工程领域进展最快,而科学发现、机器人技术、医疗保健领域因反馈验证难度更高、风险更大,落地速度相对更慢。在覆盖30个生产力任务、547项评分细则的测试中,最新基模与harness配置的组合均实现了明显的性能跃迁。

头部玩家路线分化 ASI落地时间预测差距达5年

对于完全体RSI落地、进而诞生在所有计算机认知工作中全面超越顶尖人类专家的超级人工智能(ASI)的时间,业界预测存在明显分歧:OpenAI旗下Thinking Machines首席科学家John Schulman预测为3至4年,未来主义者Millidge倾向于约5年,而分析师O'Neill则认为仍需5至10年。
这种分歧背后是技术路线的明显分化:OpenAI、Anthropic等企业更多从模型权重和训练规则切入,也有玩家选择从Harness系统、记忆库、技能库入手,还有企业将赌注押在评估器与奖励机制的持续演化上。日前清华系青年团队Theseus Labs发布的RSI完整路线图,也