Anthropic 首次量化公开 AI 研发自动化进度:Claude 主导 26% 研发,压力甩给 OpenAI 等竞品

1 天前
7 阅读

当地时间9月17日,Anthropic正式发布内部AI研发自动化量化数据,首次采用独立AI研究机构Epoch AI提出的六级自动化框架,对自身研发工作的AI参与程度进行标准化度量,相关数据被视为递归自我改进(RSI)从概念走向工程现实的关键信号。

Anthropic首度公开AI研发自动化量化指数

Anthropic此次公布的评估框架将AI参与研发的程度划分为AL0至AL5六个等级,各等级定义如下:

  • AL0:完全无AI参与
  • AL3:AI协作,可在人类密切指导下完成大块研发工作
  • AL4:AI主导,人类仅需给出高层目标,AI即可完成端到端大部分工作,人类负责监督、检查与最终决策
  • AL5:完全自主,AI无需人类介入即可自主发现故障、定位问题、修复、测试并部署上线

本次披露的核心指标为Anthropic R&D Automation Index(研发自动化指数):截至2026年8月,26%的AI研发工作达到AL4级,超90%的研发工作至少达到AL3级。对比2026年2月,Claude能主导的研发工作占比尚不足1%,短短6个月提升超25个百分点。
该指数的计算逻辑为:每周随机抽取20%的内部员工,由Claude研究Agent阅读其Slack沟通记录与内部文档,梳理当周研发任务,累计形成约1.5万个细粒度任务,归纳为包含542个节点(其中378个为叶子节点)的任务树,再按员工投入的人时加权汇总——26%指被评为AL4及以上等级的工作占全部人时权重的比例,并非任务数量的占比。后续所有测量均对照同一份任务树开展,保证数据可比性。Anthropic表示未来将定期公布相关数据,方便外界持续追踪AI自动化程度的变化趋势。

Anthropic 首次量化公开 AI 研发自动化进度:Claude 主导 26% 研发,压力甩给 OpenAI 等竞品

夜间管道故障场景验证AL4级落地能力

Anthropic在披露中给出了AL4级能力的实际落地案例:若夜间数据管道出现故障,处于AL3阶段时,工程师需要先查看日志、给出初步判断,并在Claude遇到新问题时持续提供指导;进入AL4阶段后,工程师仅需将故障报告交由Claude并告知“把它修好”,后者即可自主完成查看日志、定位故障原因、编写修复代码、测试验证、处理过程中出现的突发问题、重跑管道对比结果、撰写修复说明全流程,人类仅需完成最终确认环节。
与此同时,Anthropic还披露了内部AI Agent的规模:截至8月,公司最常用的内部平台上,任意时刻约有3万个AI Agent从事研究与工程工作。这些Agent拥有独立于底层模型升级的独立身份标识,可通过共享消息系统互相委派任务、交叉纠错,并非仅执行简单问答类任务,可半自主完成长期研发工作。

双层监控体系拦截危险决策 一成二研发算力投向安全领域

针对AI Agent的自主运行风险,Anthropic搭建了在线+离线双层监控机制:所有Agent动作执行前均需经过在线监控实时检查,8月超10亿次决策中约0.002%被拦截,相当于每4.7万次决策触发1次阻止机制;离线监控会在动作完成后读取Agent活动记录,用于发现发展较慢、可逆转的异常行为,每周约标记10万条对话记录,经分类器过滤误报和初步审查后,每周约50条最高优先级案例升级至人工审查。
算力分配层面,7月样本周内约6%的AI研发算力投入安全研究;若仅统计AI驱动的研发工作,安全研究算力占比升至约12%。

主动透明化甩出行业竞争压力 OpenAI