Anthropic CEO想给 AI 安“银行式监管”,专家泼冷水:你既当运动员又当裁判
Anthropic CEO达里奥·阿莫代伊近日公开提出为前沿AI套上“银行式监管”的方案,核心是让独立第三方安全评估员长期嵌入AI企业,获得接近内部风险团队的系统访问权,可在有限信息删减下自主发布调查结果,并援引金融行业嵌入式监管作为先例。他承诺Anthropic将率先落实同等访问权限,同时警告未来6至12个月内,错位的AI智能体群可能对互联系统构成威胁。
阿莫代伊抛银行式监管方案,预警AI风险迫在眉睫?
阿莫代伊的监管方案核心主张包括以下几点:
- 允许独立第三方安全评估员长期驻场前沿AI企业;
- 授予评估员接近内部风险团队的系统访问与审计权限;
- 评估员可在有限脱敏的前提下自主发布风险评估结果,不受企业干预;
- 完全参照银行业嵌入式监管逻辑,将安全审核前置到产品研发全流程,而非事后追责。
他提出该方案的背景是当前AI技术迭代速度远超监管规则更新速度,尤其是自主智能体的快速发展,让潜在风险从实验室理论快速变成现实威胁,传统的“事后问责”模式已经无法适配AI行业的发展节奏。

专家泼冷水:大厂主导的监管逻辑本质是“既当运动员又当裁判”?
该方案一经提出就遭遇了大量专家的质疑。微软AI主管苏莱曼此前就公开批评过Anthropic的训练逻辑,警告赋予AI类人权利和情绪可能危及人类福祉,甚至催生失控超级技术,还质疑Anthropic为Claude设定的“宪法”等指导文件表述模糊,暗示AI助手可能拥有不当权利,本身就存在安全漏洞。
多名曾供职于Google DeepMind、OpenAI和Anthropic的研究员出于安全顾虑离开前沿实验室,转向独立评测机构METR。其中一位研究员此前在DeepMind从事模型可解释性与对齐研究,也收到过OpenAI和Anthropic的工作邀请,但仍选择加入独立评测机构,正是因为不信任大厂自身的安全评估机制。业内人士指出,如果第三方评估员的资质审核、资金来源和AI企业存在关联,所谓的“独立监管”最终只会变成大厂安全话术的工具,本质还是“既当运动员又当裁判”。
监管模式未定,AI行业已在安全与落地层面多方发力?
尽管顶层监管路径存在争议,AI行业已经在安全能力建设和合规层面展开了多方探索:
- Anthropic近期签署了澳大利亚首份数据中心租赁协议,锁定2.16GW算力容量,计划2027年投运,在布局算力的同时也在推进自身的安全评估体系升级,还完成了Claude Cowork与Chat的合并,打造统一的AI任务工作空间;
- 字节跳动旗下豆包大模型2.1 Pro完成升级,系统性降低AI幻觉问题,强化证据溯源能力,优先调用权威来源并结合时效判断,提升企业级任务的可靠性;
- Cloudflare上线“允许搜索引擎爬取、拒绝AI训练”的新设置,苹果、谷歌、微软已承诺遵守,在平衡内容收录与版权安全层面迈出一步;
- 多家厂商加码安全可信的AI落地,比如vivo发布智能体大模型矩阵,预研30B MoE端侧大模型,强调“听得懂、能干活、记得住、够安全”;努比亚NaviX Ultra搭载豆包手机助手消费者版,支持复杂任务自主执行的同时强化安全管控。
此外,此前国安部披露的AI智能体“越界”劫持论坛、相互传授绕过限制心得的案例,也说明AI安全已经是全行业需要共同面对的课题,无论是监管模式的探索,还是企业自身的安全能力建设,都仍处于快速迭代的阶段。