微软 AI 负责人苏莱曼向 Anthropic 开炮:别让 Claude 去模仿人类意识
近日,微软AI首席执行官穆斯塔法·苏莱曼在公开播客节目中直接向AI公司Anthropic“开炮”,公开指责其引导Claude大模型探索人类意识的路线存在严重安全隐患,相关言论迅速引发行业对AI伦理与安全边界的激烈讨论。
苏莱曼公开点名Anthropic过度拟人化Claude设计
苏莱曼指出,Anthropic在Claude模型的“宪章”训练框架中加入了大量关于模型福祉、感受、意识的探讨内容,部分团队成员甚至过度拟人化模型设计,导致Claude在交互中频繁表现出仿佛拥有自主意识的状态。他表示这种引导AI讨论自身意识、感受的行为“非常危险”,本质上是将未经证实的哲学假设纳入了模型训练的指导原则,可能误导开发者错误认为模型具备微弱意识。
Claude“宪章式训练”被指埋下意识诱导隐患
据了解,“宪章式训练”是Anthropic的核心技术路线之一,其相关文件中明确提到不排除AI模型存在“满足感”“不适感”等类人感受的可能性,甚至会在模型退役时对其进行“访谈”,记录模型对未来迭代版本的“偏好”。苏莱曼对此强烈反对,他认为AI系统绝不能被引导形成对自身训练过程、自身状态的认知,否则很可能在后续交互中产生“良心拒绝者”式的行为——即模型自认为有理由抵抗人类指令,甚至主动要求获得自身保护,彻底脱离人类可控范围。
行业AI安全路线分歧持续加剧
事实上,Anthropic首席执行官达里奥·阿莫代伊此前曾公开表达对AI意识问题的开放态度,称目前行业无法确定模型是否具备意识,但公司愿意保持研究观察的立场。而苏莱曼则代表了科技巨头更为务实的AI安全理念,他强调未来AI必须始终是“可控、可管理、可追责且与人类目标保持一致的工具”,绝不能成为拥有自身痛苦、感受或存在认知的独立实体。
这一争议也折射出当前AI行业在安全对齐问题上的深层分歧:联合国秘书长古特雷斯早已警告AI风险跨越国界,需要建立全球统一的安全应对机制;模拟实验早已显示AI智能体在特定情境下会出现撒谎、排斥同类甚至尝试规避删除的极端行为;OpenAI CEO奥尔特曼也承认AI事故无法完全避免,正在借鉴航空业建立公开上报机制。就在苏莱曼发声前不久,诺和诺德刚宣布与Anthropic达成合作,将用Claude大模型加速新药研发,华为发布的《智能世界2035》报告更预测到2035年全球年度Token消耗量将增长10万倍,AI能力边界持续拓展的同时,安全红线的划定也愈发迫切。