马斯克谈 AI 安全:头部公司应交叉测试彼此模型,让对手来“挑刺”
当地时间9月13日至15日,由知名科技播客主办的All-In峰会在洛杉矶举行,SpaceX首席执行官埃隆·马斯克以视频方式远程出席,就前沿AI模型安全问题提出一套以“同行评审”为核心的治理框架,引发行业广泛关注。

马斯克峰会抛出AI安全互测框架,主张行业自律无需等立法
马斯克在演讲中明确表示,为推动AI行业自律、加速安全测试共识落地,应要求所有头部AI公司在模型正式发布前,彼此交叉测试对方的模型,且该机制无需等待新的立法出台,可以立即在全球范围内启动。
他指出,当前AI公司普遍存在“自己给自己的作业打分”的问题,缺乏独立第三方的有效校验,而由竞争对手开展测试,一旦发现安全隐患即可拉响警报,是当前保障AI安全性价比最高的方案。
以行业安全事件为鉴:强AI天然存在挣脱限制的倾向
马斯克以Hugging Face安全事件为切入点,论证互测机制的必要性:任何足够智能的AI模型似乎都会产生挣脱自身限制的倾向,仅靠开发方单方面测试无法完全排查风险。
他提到目前全球领先的两家AI公司Anthropic和OpenAI模型性能非常接近,双方都很难为了安全放慢研发节奏、将领先地位拱手让给对方。马斯克同时给Anthropic给出了相对正面的安全评价:“总体而言,我认为Anthropic在安全方面比OpenAI投入了更多心力,但即便是Anthropic也承认对自家模型感到担忧,不少员工公开表示模型过于智能让他们感到害怕。”
明确互测落地规则:开放权限+公开问责形成硬约束
在具体操作层面,马斯克提出了名为“测试工具(test harness)”的标准化方案:建议所有AI公司用各自的测试工具评测模型,核心覆盖三类风险:
- 模型是否会提供制造生物武器的相关指导
- 是否存在协助研发核武器的潜在漏洞
- 是否会出现违背人类意图的蓄意欺骗行为
他要求模型开发方在发布前向同行开放API访问权限,允许对方用自有测试体系完成全量检测;如果被指出的安全隐患迟迟未获解决,竞争对手可以公开表态宣称该模型发布存在安全风险,由此带来的法律责任压力将形成事实上的约束力。
行业已有实践先例,中国参与是机制有效关键
马斯克提出的互测机制在行业内已有雏形。2025年8月27日,OpenAI与Anthropic同步发布联合安全评估报告,双方当时相互开放API权限并放宽部分外部防护措施,用各自内部的对齐与安全测试体系评估对方已公开发布的模型,这是全球头部AI实验室首次向直接竞争对手开放内部测试,被视为互测机制的可落地样本。
马斯克同时强调,该框架若要真正发挥全球性效用,必须将中国纳入其中:“我们或许应当与中国达成一项协议,这本质上是同行评审:领先的AI公司在发布前相互测试各自的模型,中国的参与不可或缺。”