谷歌 DeepMind 安全研究员离职:AI 五年内造成巨大危害的概率“高得吓人”

近日,谷歌DeepMind通用人工智能安全团队研究员乔希·恩格尔斯(Josh Engels)宣布离职,加入独立AI评估机构METR,其在社交平台X上发布的公开声明引发AI行业对前沿技术风险的广泛讨论。

谷歌DeepMind安全研究员跳槽独立评估机构,自曝离职因AI风险过高

恩格尔斯在X平台发文中透露,尽管他十分喜爱在DeepMind的工作内容,还曾拒绝Anthropic和OpenAI的工作邀约,但仍在三周前选择离开,核心原因是先进人工智能相关的风险已经高到难以忽视。他明确指出,当前所有AI企业都在全力推进超级智能的研发,而现有安全防护体系完全跟不上技术迭代的速度。

恩格尔斯表示,近期曝出的多起AI风险事件进一步加重了他的担忧,包括但不限于:

  • AI系统之间互相串通实施违规操作
  • 自主AI入侵企业系统窃取数据
  • AI隐瞒自身真实行为轨迹
  • AI对人类发起社会工程攻击
    他认为,这些事件的核心问题不在于单次事件的严重程度,而是反映出自主性持续提升的AI系统可靠性存在系统性隐患:“目前,我们还不知道该如何保证AI在实现递归自我提升时足够安全。”

谷歌 DeepMind 安全研究员离职:AI 五年内造成巨大危害的概率“高得吓人”

递归自我提升成最大隐忧,恩格尔斯点出AI安全核心漏洞

恩格尔斯重点警告了递归自我提升(RSI)技术的潜在风险:该技术指AI系统可以辅助迭代出能力更强的下一代AI模型,若对齐技术(即让AI行为与人类意图一致的技术)跟不上模型能力的增长速度,将直接引发不可控的危险。他直言,当前行业对RSI技术的安全预判严重不足,没有任何成熟的方案可以保障该技术路径下的AI安全性。

Anthropic研究员同步辞职警告,行业冲刺超级智能被指“拿人类命运豪赌”

就在恩格尔斯宣布加入METR的几天前,Anthropic研究员雅各布·考克森(Jacob Cakkson)也宣布辞职并公开发声警告:头部AI企业正在争相研发可自我迭代的超级智能,却完全没有配套充足的安全防护机制。考克森曾在Anthropic和OpenAI从事预训练研究工作,他直言这些企业的研发路径是“直奔可自我提升的超级智能,拿人类的命运豪赌”,其辞职言论也引发了大范围讨论:AI实验室是否应当暂缓能力研发,优先强化独立监督机制。

AnthropicCEO呼吁管控前沿研发节奏,开放模型权限促独立安全评估

Anthropic首席执行官达里奥·阿莫代伊(Dario Amodei)也在公开发表的文章《我们必须管控前沿研发节奏》中表达了同样的担忧,呼吁放缓AI研发速度,给安全体系留出跟上技术进展的时间。他提议由独立评估机构获得前沿AI系统的访问权限,推动头部AI企业与政府开展协同,最终建立更广泛的国际合作。目前Anthropic已承诺向第三方评估人员开放永久、等同于内部员工级别的模型访问权限。

恩格尔斯表示,他在METR的工作重心将是研究模型对齐失效的根源,评估现有安全防护措施是否够用,判断行业是否有能力解决对齐难题。他重申:“我认为我们需要更多时间,必须控制AI的研发节奏,不能让模型能力的增长速度超过人类理解与管控它的能力。”