AI开始研究AI,OpenAI「研究实习生」上岗,奥特曼画的饼已兑现一半
9月6日,OpenAI研究员Boris Power转发官方博客确认,OpenAI已达成「自动化AI研究实习生」的部署目标,这也是AI行业首张被公开兑现的能力落地时间表。这一成果落地于奥特曼一年前立下的Flag:2026年9月完成自动化研究实习生部署,2028年3月完成自动化研究员部署。

奥特曼直播立Flag 一年期满准时交卷
去年10月28日OpenAI完成营利实体重组当天,奥特曼和首席科学家Jakub Pachocki曾发起公开直播。奥特曼在直播中明确表示,与其持续争论AGI的抽象定义,不如设定两个可以真实兑现的时间节点。随后Pachocki当场公布了两项核心里程碑:2026年9月落地「自动化AI研究实习生」,2028年3月落地「自动化AI研究员」。十个多月过去,首个时间节点如期达成,相当于奥特曼此前公开描绘的AI能力发展路径已经兑现了一半。
内部数据首公开 AI已接管绝大多数研发执行层工作
OpenAI同步发布的长文《研究加速,OpenAI内部视角》首次公开了内部AI辅助研发的核心运行数据:截至2026年8月中旬,按标准8小时工作日折算,每投入1个人类工作日,OpenAI研究组织的AI Agent就能提供约3.1个工作日的运行时长,意味着1名研究员的工作产出已等价于3.1名AI实习生的工时。
不同层级研究员的Agent使用成本也对外披露:中位数研究员每日Agent推理费用折合约600美元(约4000元人民币),排名前10%的顶尖研究员单日消耗更是超过7000美元(约46000元人民币)。OpenAI按科研流程将Agent的工作分为决策、设计、构建、运行、分析、沟通六大类,其中增量最为明显的是执行层工作,具体包括:
- 研究与基础设施代码编写、审查
- 实验启动、监控与故障排查
- 技术支持类问题解答
数据还显示,执行层工作的日token增量是决策层的近千倍:其中代码相关类工作单日token增量达19.82万,而「决定项目是否继续或叫停」的决策类工作单日token增量仅200,高层规划在Agent输出中占比极小。这一变化也直接冲击了内部人工支持体系:原本活跃的内部求助频道日均新帖数从2025年的20条左右断崖式跌至2026年8月的个位数,此前每周固定开设、帮研究员排查实验环境问题的答疑会,因到岗求助的研究员越来越少,有团队直接停办该环节,将人手全部抽调去做底层系统改进。
碎片任务零干预成功率破90% 长线复杂任务仍需人类介入
OpenAI对2026年1-7月Agent任务的追踪显示,AI已经能高效处理短时长、低复杂度的研发任务:15分钟以内的碎片化任务,零干预成功率从1月的60%提升至90%;4至8小时的中等复杂度任务,零干预成功率从20%提升至50%左右。但面对长线复杂任务时,AI仍离不开人类辅助:32小时以上的长线任务零干预成功率仅在20%左右徘徊,过去6个月内,4-8小时量级成功完成的任务中,超过一半至少需要人类干预1次。
2028年自动化研究员目标待突破 安全争议同步升温
OpenAI的下一阶段目标是在2028年3月前落地「自动化AI研究员」,但官方已公开承认目前尚未找到安全完成该目标的方法。OpenAI指出当前系统的迭代存在“刹车失效”风险:即使人为踩下研发刹车,算力消耗也不会停止,会直接转向训练下一代模型,加速能力迭代。
几乎同一时间,OpenAI首席科学家Jakub Pachocki发布长文《一个异星心智》,承认当前机器智力已经超过人类,研发的「异星心智」已超出人类理解范围,呼吁全人类紧急踩下研发刹车。而英伟达CEO黄仁勋同日官宣AGI已来,并将在后续为OpenAI提供40万块GPU支持,完全加速的研发节奏与刹车警报形成强烈对撞。随着自动化研究实习生的落地,关于AI研发自主权边界、安全可控的讨论也已同步升温。