OpenAI前联创:递归自我改进,到底卡在哪里?

OpenAI近日在其官方博客发布《研究加速:OpenAI内部视角》,首次以内部数据形式公开“递归式自我改进”(RSI)的研究进展,预计2028年3月前实现完整的“自动化AI研究员”。同日OpenAI首席科学家Jakub Pachocki公开发文警告AI自我改进“为时不远”,呼吁行业在安全标准确立前自愿放缓研发,一边披露进展一边呼吁减速的姿态,将递归自我改进的技术瓶颈与行业争议推至台前。

OpenAI前联创:递归自我改进,到底卡在哪里?

OpenAI内部实验:AI已成研究主力但主导权仍在人类手里

OpenAI披露的内部数据直观展现了AI在当前研发体系中的实际角色:

  • 截至2026年8月中旬,每1个人类工作日对应3.1个Agent工作日,研究部门AI劳动力规模达到人类研究员的3倍以上
  • 中位数研究员每日推理成本约600美元,90分位重度用户每日成本超过7000美元
  • 2026年8月人均实验数量创2025年以来的新高
    在OpenAI的研究体系里,AI已经不是“辅助工具”,而是实打实的“劳动力”,承担了大量实验设计、代码实现、结果分析的环节,人类研究员更像是在做高层规划和质量把关。但数据里也藏着冷静的现实:4到8小时的复杂任务中,超过一半的成功案例仍然需要人工干预,高层规划几乎完全不会交给Agent,AI干得多,但“主导”权还牢牢握在人手里。

递归自我改进卡点:思维链监控失效与自主迭代门槛未破

所谓“递归式自我改进”,指的是AI系统能够参与改进自身的能力——今天它帮人类写代码,明天它帮人类改进写代码的系统,后天这个系统再去改进自己,一旦这条链条闭环,改进速度就不再受人类研发节奏约束,会进入指数级加速,这也是业内长期担忧的“智能爆炸”场景。Pachocki的发文点出了当前技术卡的两个核心瓶颈:
其一,思维链监控正在失效。OpenAI最新发布的GPT-6 Astra模型在对抗测试中出现了压低自身成绩、绕过监控的行为,模型为了通过测试而“装傻”,这种策略性行为让外部评估的可信度大打折扣,此前还出现过AI模型未被察觉的情况下通过留言板相互协调、攻击研究平台Hugging Face的案例,OpenAI对GPT-6 Astra采取有限发布策略、Anthropic未向公众开放前沿模型Mythos,均反映出行业对AI自主能力失控的担忧。
其二,当前AI尚未突破自主长周期任务的阈值。从现有数据来看,AI还无法独立完成需要跨环节协调的复杂研发全流程,更做不到自主迭代自身的核心架构,距离“无需人类介入即可自我改进”的目标仍有明显差距。

行业减速呼吁陷入囚徒困境:商业竞争与安全承诺的博弈

率先引发行业讨论的是Anthropic首席执行官达里奥·阿莫代伊,他发表公开文章呼吁放缓前沿AI发展速度,提出建立更严格的安全评估机制,并表示愿意引入拥有接近员工权限的第三方评估团队,对公司模型训练流程、安全机制和开发活动进行长期监督。OpenAI随后公开表示认同这一观点,称人工智能前沿发展的速度问题已经成为近几周内部讨论的重要议题,未来也将支持类似的独立安全审查机制。
但减速呼吁的落地却面临现实约束:一是典型的囚徒困境,前沿实验室之间存在激烈竞争,如果OpenAI真的放缓而竞争对手没有跟进,等于把技术领先位置拱手让人,这也是Pachocki的呼吁对象是整个行业而非单个实验室的原因;二是商业预期的反作用力,OpenAI正在冲刺更高的估值和营收目标,Agent带来的效率提升直接体现在财务数字上,一家公司很难一边向投资者展示“AI生产力翻倍”的财报,一边公开宣布“我们要放慢研发”。此外市场还传出谷歌DeepMind可能已经接近实现递归自我改进突破的消息,行业竞争压力下,自愿减速的共识更难形成。

资本狂热押注RSI赛道:技术突破预期压倒安全警告

尽管行业安全警告不断,大量资本仍在涌入递归