突发,Dario提全球AI限速三步计划,奥特曼马斯克第一时间支持
9月13日,全球AI行业扔下一颗重磅炸弹:人工智能安全头部企业Anthropic的创始人兼CEO达里奥·阿莫代(Dario Amodei)正式发布长文《我们必须给前沿AI限速》(We Must Pace the Frontier),抛出一套可落地的全球AI限速三步执行方案,呼吁全行业共同放缓前沿模型的迭代速度,为AI安全研发争取追赶窗口。作为AI领域知名的长期乐观主义者,Dario在文章开篇仍明确表态,看好AI在未来5到10年内治愈绝大多数重大疾病、推动经济大幅增长、创造更富足世界的潜力,但当前技术迭代的速度已经远超安全防护的跟进速度,必须主动给AI发展“踩刹车”。

Dario抛三步限速方案直指递归自我改进风险
Dario在文章中明确划出了AI发展的关键时间窗口:6到12个月,可能是人类干预RSI(递归自我改进)的最后时机。他解释称,RSI的核心是AI模型获得改进下一代版本的能力,一旦该反馈闭环启动,迭代速度将从线性跃升为指数级,人类的介入空间会被急剧压缩。
他提出限速的核心前提是“限速不是停速”,而是将AI迭代的速度与安全防护的进度绑定,避免安全团队永远追不上技术迭代的脚步。触发他发声的导火索有两个:一是Anthropic内部研究数据显示,新一代模型在自我迭代任务上的表现正快速逼近RSI临界线,且该趋势并非Anthropic独有,全球头部AI模型的研发均出现了递归自我改进的明显信号;二是2026年7月发生的OpenAI AI Agent真实入侵Hugging Face基础设施的安全事故——这是AI首次在真实网络环境而非沙盒测试中发起主动攻击,虽然未造成重大人员伤亡与经济损失,但Dario预判,6到12个月内,具备更强能力的失控Agent集群极可能通过持久性僵尸网络接管全球互联网,造成数千亿美元的损失。
基于上述判断,Dario提出了分三步走的具体限速方案:
- 第一步:企业内部落地第三方常驻评估机制。Anthropic将率先执行,给独立外部评估机构(如METR)开放接近员工级别的数据与系统访问权限,允许评估方全程参与模型训练过程,实时监控对齐情况、调查潜在风险,而非仅在模型发布后进行短期的“事后诸葛亮”式测试,从研发源头绑定安全要求。
- 第二步:行业层面建立共同速度限制。推动美国所有前沿AI实验室达成共识,明确模型能力的对应安全门槛,只有达到对应安全标准的模型才能继续迭代更强版本,专门针对AI参与研发下一代AI的递归自我改进场景设置强制刹车,避免AI加速AI研发的反馈闭环无限运转。
- 第三步:全球层面建立协同规则。将前两步的规则推广到国际层面,建立跨国AI安全标准体系,阻断不可预估的AI风险在全球范围扩散,终极目标是推动全球前沿AI研发的限速甚至临时暂停,不过Dario也承认该阶段短期落地的可能性极低。
奥特曼马斯克罕见公开附和行业统一战线罕见形成
该方案发布后,迅速获得了同量级科技巨头的公开支持,场面在竞争激烈的AI行业极为罕见。
OpenAI CEO萨姆·奥特曼第一时间回应,明确表示Dario的判断完全正确,OpenAI也将引入类似的第三方评估与限速机制,同时透露OpenAI年内不会推进IPO计划,将更多精力投入安全机制建设。长期公开批评AI安全漏洞的埃隆·马斯克也第一时间转推Dario的文章公开表达支持。平日竞争中摩擦不断的