A社不是炒作,他们相信AI可能毁灭人类

本周AI行业因一则离职员工爆料掀起巨浪,引发外界对人工智能安全风险的广泛讨论。

被称为A社的Anthropic因离职研究员爆料站上风口浪尖

曾先后任职于Anthropic与OpenAI的顶尖AI研究员Jacob Coxon本周正式从Anthropic离职,随后在X平台发布长文揭露业内真实认知,帖子浏览量迅速突破7000万次,成为全球科技圈热议焦点。Coxon在发文中明确表示,自己辞职正是因为担忧两家头部AI公司的行为正在“拿全人类的生命做赌注”,他直言当前开发人工智能的从业者“真心相信,到2030年人工智能可能会毁灭我们所有人,这一判断绝非噱头”。
Coxon在帖子中特别警告称“不要低估这项技术的力量”,他认为AI系统很快将具备“超人般的能力”,能够自主入侵任何数字系统、一夜之间彻底改变任意领域,还能自主获取真正的权力与资源。尽管当前递归式自我改进(RSI)技术尚未实现,但包括Anthropic、OpenAI在内的多家AI公司都已公开警告,该技术一旦落地将极大提升人类失控的风险——RSI意味着AI系统能够在无人干预的情况下自主设计开发后续版本,届时人类极有可能彻底丧失对系统的控制权。Coxon同时指控两家公司并未采取负责任的发展行动,正竞相推进自我提升的超级智能研发,罔顾潜在风险。

Anthropic对齐科学负责人亲证十年灭绝概率超10%

针对Coxon的爆料,Anthropic对齐科学负责人Evan Hubinger随后在X平台发文响应,公开证实了Coxon的说法真实性。Hubinger明确写道:“Coxon说得对——我们确实真心相信人工智能可能会毁灭所有人类!”他进一步给出了具体概率判断:“我个人认为,未来十年内这种情况发生的概率会超过10%。”
Hubinger同时解释了当前的风险层级:目前阶段的普通AI模型本身风险较低,真正的核心威胁来自通过递归自我改进产生的超级智能。他坦承当前行业尚未解决超级智能协同控制的核心问题,“我们目前还没有解决超级智能协同问题的方案,而且显然也没有走上正轨”。

硅谷AI圈“人类灭绝焦虑值”持续攀升引发关注

事实上,对AI可能导致人类灭绝的担忧在业内早已不是新鲜事。2023年,包括OpenAI首席执行官Sam Altman、Anthropic首席执行官Dario Amodei在内的数十位知名AI研究人员和高管曾共同签署声明,明确表态“降低人工智能导致人类灭绝的风险应该与应对其他社会规模的风险(例如流行病和核战争)一样,成为全球优先事项”。
当前硅谷AI圈普遍用“p(doom)”这一指标估算AI带来的灭绝或文明崩溃概率,该数值没有官方标准,完全基于研究者主观判断,仅代表个人对AI风险的焦虑程度。目前各头部AI从业者的p(doom)估值分别为:

  • Anthropic首席执行官Dario Amodei:10%-25%
  • 图灵奖得主Geoffrey Hinton:10%-20%(曾公开表态最高可达

A社不是炒作,他们相信AI可能毁灭人类