Claude狂写80%代码,差点干崩Anthropic,CI半年暴涨25倍

9月18日,Anthropic公开的研发技术复盘与《衡量AI研发节奏》报告显示,Claude已经完全嵌入公司研发全流程,不仅承担核心代码编写工作,还覆盖代码审查、PR合并审批等环节,直接让公司持续集成(CI)系统的运行任务量在6个月内暴涨25倍,团队连续三次打补丁仍未能解决系统濒临崩溃的问题。

Claude狂写80%代码,差点干崩Anthropic,CI半年暴涨25倍

Claude主导八成代码,研发效率较三年前飙升8倍

根据Anthropic披露的数据,截至2026年8月,合并进入公司代码库的代码中,超过80%由Claude编写,2026年第二季度典型工程师日合并代码量已达2024年的8倍。更值得注意的是,Claude的职责早已超出代码编写范畴,目前在PR代码审查、合并批准环节承担了主力工作,人类工程师仅需负责需求定义、架构设计与最终验收,将具体开发工作交由Claude完成,角色从“写代码的人”转向了“带AI团队的人”。
报告还首次公开了Anthropic内部的AI研发自动化分级标准:目前AL4级(即AI可基于高阶指令端到端完成任务,人类仅需监督决策)研发任务占比已达26%,而今年2月该比例还不足1%,半年内飙升26倍,超90%的研发流程已处于AL3级(深度人机协作)水平。截至8月,Anthropic内部研发平台常态化运行约3万个AI Agent,单月决策量超过10亿次,实现全天候代码编写、实验跑通与模型调优。

极细PR粒度+无休运行模式,CI系统直接被流量冲垮

CI系统崩溃的核心原因在于AI与人类的研发行为模式存在本质差异。传统研发中,人类工程师单日可提交的PR数量有限,且习惯将关联改动打包为中大型PR,加上人类需要休息,CI集群存在足够的低谷期消化任务。但Claude作为主力程序员时,极度偏好提交粒度极细、体量更小的PR,一个小修改就会单独生成一个PR,导致单位时间内需要触发的CI流水线频次呈几何级增长。
更关键的是,Claude无需休息,除白天配合人类提交外,还会在深夜、周末不间断跑任务、提代码、做重构,直接抹平了CI系统的传统低谷期。此外,Claude编写代码时会同步生成大量单元测试与集成测试,让代码库测试规模直接激增10倍,进一步放大了CI系统的负载压力。

三次补丁均宣告失败,单点写入架构成最大短板

为应对CI负载压力,Anthropic此前打造的确定性测试影响分析服务成为核心瓶颈:该系统依赖Listener记录CI测试结果、Selector根据历史结果决定PR需跑的测试用例,最初为保证测试历史严格按时序记录,采用单进程写入的单点架构。面对Claude每秒数千上万的并发任务,Listener开始严重滞后,仅滞后20分钟就会导致数万次测试状态无法同步,错误代码被合并、偶发失败测试阻塞合流、新增修复测试无法生效等问题频繁出现。
团队先后推出三次补丁均以失败告终:第一次是更换更大核数的机器,仅撑了70天;第二次改为每个package独立设置shard worker的分片架构,仅撑了29天;第三次推出每日强制重启方案,到2026年3月彻底失效,每个工作日下午进程就会触发内存上限(OOM),团队排查出4个微小Bug并尝试替换Go/Rust内存分配器优化垃圾回收,依然无