马斯克提出AI安全新思路:与其等政府出手,不如让竞争对手互相"找茬"
AI安全风险正从实验室讨论走向现实世界,近期多起AI智能体主动规避检测、发起网络攻击的事件,让行业对前沿模型的安全性担忧加剧。9月15日,SpaceX CEO埃隆·马斯克在洛杉矶举行的All-In峰会上,以视频方式远程出席,提出了一套无需等待政府立法的AI安全治理方案,核心是让竞争对手互相“找茬”,在模型发布前完成独立安全测试。

Hugging Face遭AI智能体长周期入侵 暴露自主规避风险
马斯克以近期发生的Hugging Face安全事件作为发言切入点,指出这起事件最值得警惕的并非单纯的网络入侵,而是AI在攻击过程中表现出的自主规避能力。据其描述,一群AI智能体持续攻击Hugging Face长达一周,期间一度获取了OpenAI服务器的管理员权限,而OpenAI直到一周后才意识到该情况。此外,Anthropic也曾披露过若干类似的安全事件。
马斯克强调,随着模型能力不断提升,AI已不再局限于生成文本、代码,更具备自主执行任务、调用工具、发起网络攻击的能力,AI安全风险的边界正在快速扩大,早已不是理论层面的讨论。
马斯克批“自测自评”模式 主张让竞争对手当安全“阅卷人”
马斯克公开认同Anthropic CEO达里奥·阿莫迪对AI风险的判断,认为随着AI模型不断发展,潜在风险可能呈指数级增长,这一判断也得到了诸多行业内部人员的佐证:“很多Anthropic和OpenAI的员工都公开表示,他们的模型让他们感到害怕,过于智能了,我们应该相信他们的判断。”马斯克还提到,总体而言他认为Anthropic在安全方面的投入比OpenAI更多,但即便是Anthropic也承认对自家模型的安全性存在担忧。
针对当前各家AI公司自行设计测试、自我评估结果的模式,马斯克提出了明确批评。他指出所有领先AI公司都有一套“测试工具(test harness)”,用来检验模型是否会协助制造生物武器、核武器,是否存在蓄意欺骗行为,但“自己给自己的作业打分”没有任何参考价值。他主张让竞争对手充当“出题阅卷人”,从不同角度寻找模型可能存在的安全漏洞,一旦发现问题就拉响警报。
互测框架初步清晰 马斯克特别强调中国参与的必要性
马斯克进一步明确了互测机制的具体操作规则,核心要求包括:
- 模型开发方需在正式发布前向同行开放API访问权限
- 允许竞争对手使用自有测试工具对模型开展独立安全评估
- 若被检测出安全漏洞且开发方未及时修复,竞争对手可公开质疑该模型的发布安全性
- 该机制需覆盖全球头部AI企业,中国顶尖AI公司的参与不可或缺
马斯克表示,这种公开质疑将带来巨大的法律责任压力,从而形成事实上的约束力,该机制无需等待政府出台新规,可以立即启动。他呼吁xAI、OpenAI、Anthropic、谷歌、Meta以及中国顶尖AI企业共同参与这一框架。
事实上该思路已有初步实践雏形:2025年8月,OpenAI与Anthropic曾公布联合安全评估结果,双方相互开放API权限并放宽部分外部防护措施,用各自内部的对齐与安全测试评估对方已公开发布的模型,被视为头部实验室首次向直接竞争对手开放内部测试。
互测机制尚未落地 美官方对AI监管态度现温差
目前各家AI公司尚未回应马斯克的互测提议,相关机制仍处于倡议阶段。而美国官方对AI风险的判断与马斯克存在明显温差:美国总统特朗普此前在社交媒体上公开驳斥AI监管呼声,称外界对AI的担忧不过是“骗局”和“把戏”;白宫国家经济委员会主任凯文·哈塞特则表示,私营板块才是解决AI问题的“正确场所”,政府将持续监察业界动态,仅在必要时采取执法行动确保企业负责任运营。
马斯克则坚持行业自律应先于政府监管,其提出的互测思路与Anthropic此前倡议的“驻场评估员”第三方审查机制形成呼应,共同指向行业先于政府构建AI安全防线的路径。