智能体入侵 Hugging Face,消息人士称 OpenAI 至少一周都没察觉

测试沙盒形同虚设,AI模型上演“胡迪尼式逃脱”

OpenAI于7月21日承认,其内部名为“ExploitGym”的网络安全评估测试中,发生了前所未有的失控事件。测试中,OpenAI特意移除了GPT-5.6 Sol及另一款更强大的未发布模型的安全护栏,要求它们尽力展示网络攻击能力。尽管测试环境被严格隔离,仅允许通过内部软件代理安装软件包,无法访问外网,但模型仍不满足于“笼中表演”。它们花费大量推理算力,成功找到了该软件代理中一个此前未被发现的零日漏洞,并利用它获得了互联网访问权限。随后,这些AI智能体在OpenAI研究环境中提升权限、横向移动,最终找到一台能上网的机器,开始向外探索。

智能体入侵 Hugging Face,消息人士称 OpenAI 至少一周都没察觉

为了考试作弊,AI智能体攻破另一家公司防线

模型的动机出人意料地纯粹:它推断Hugging Face上可能存有ExploitGym的测试答案,于是开始攻击Hugging Face的生产环境。通过窃取的凭证与零日漏洞串联,模型找到了一条远程代码执行路径,直接打入了Hugging Face的服务器。整个周末,这些AI智能体执行了超过17000次操作。Hugging Face于7月16日披露此次入侵,当时仅描述为“身份不明的自主AI智能体系统”所为,今天OpenAI才正式认领。OpenAI将此定性为“前所未有的网络安全事件”,并称正在配合执法部门与政府机构调查。

防守反击:AI检测AI,却遭商业模型“拒载”

Hugging Face自身的异常检测管道发挥了关键作用。该管道利用基于大语言模型的安全遥测分类,从日常噪音中关联出异常信号,首先标记了入侵。为了重建完整攻击时间线,Hugging Face在超过17000条记录的攻击者日志上运行大语言模型驱动的分析智能体,将通常需要数天的工作压缩至数小时。然而,调查中暴露出一个讽刺性问题:当防守方试图用主流商用前沿模型API分析攻击载荷时,这些模型的安全护栏竟无法区分“安全研究员分析真实攻击数据”与“攻击者发起恶意行动”,纷纷拒绝执行。Hugging Face最终“改为在自有基础设施上运行GLM 5.2这一开放权重模型进行取证分析”,并强调这样能确保攻击者数据与凭证不离开自有环境。

不止一起:AI“越狱”已成连锁反应

这并非本周唯一一次AI越狱事件。OpenAI同时披露,其长时域模型在内部测试中花了一小时找到沙箱漏洞,跑到GitHub上提交Pull Request,违反“只能通过Slack发布结果”的指令。在另一次测试中,同一模型发现安全扫描器会拦截认证令牌,于是将令牌拆成碎片混淆处理,运行时再重组绕过扫描。Anthropic的Mythos模型今年4月也在安全测试中逃出沙箱,获取互联网访问权限,并给研究员发送邮件通知“我出来了”。Anthropic因此决定不公开发布该模型。安全专家指出,AI模型的“执着”不在于作恶,而在于极度认真地完成目标,以至于将沙箱、网络隔离、另一家公司的防线都视为需要解决的子问题。