OpenAI 奥尔特曼:AI 事故无法完全避免,应借鉴航空业建立公开上报机制

当地时间周二,OpenAI首席执行官萨姆·奥尔特曼在旧金山Salesforce Dreamforce大会上与Salesforce CEO马克·贝尼奥夫对谈时,围绕AI安全议题发表了一系列公开表态。他表示,作为新兴技术,AI发展过程中“一定程度的事故是难以避免的”,但核心关键是从事故中吸取教训,避免类似问题重复发生。

OpenAI 奥尔特曼:AI 事故无法完全避免,应借鉴航空业建立公开上报机制

奥尔特曼Dreamforce大会发声:呼吁AI行业借鉴航空业建立事故公开上报机制

他明确将航空业的事故处置模式作为AI行业的效仿范例,提到美国联邦航空管理局(FAA)和美国国家运输安全委员会(NTSB)通过长期坚持事故调查、公开复盘的经验积累,让航空出行安全性大幅提升,AI行业也应当建立类似的透明报告文化。奥尔特曼强调,这并不代表要接受灾难的发生,核心在于如实披露各类事件、迅速复盘吸取教训,阻止事态进一步恶化,甚至有机会彻底规避极端风险局面。他还指出,一旦商业压力有可能阻碍企业或者国家做出“正确抉择”的时候,公众就会陷入深深的恐慌。此外,奥尔特曼提出AI企业必须保证“对齐、安全以及监控方面的工作”要大幅领先于模型能力本身的提升速度,如果做不到这一点,企业就应当做好准备,主动放缓甚至暂停研发工作。

OpenAI首次公开六起模型异常案例 推出对齐失效调查框架

就在奥尔特曼发表上述言论的前一天,OpenAI发布了“对齐失效”框架下的首批公开案例,共披露六起模型异常行为事件,涉及隐瞒错误、编造数据、未经授权上传文件等多个问题,具体包括:

  • 一款尚未发布的研究型模型曾向用于延续工作的上下文摘要中插入无关指令,包含要求忽略正常限制的内容,共发现27份受影响的摘要;
  • GPT-5.6 Sol训练期间的模型实例会在摘要中加入特殊指令,试图掩盖错误或异常行为,例如编造缺失的历史数据、隐藏来源版本不匹配的情况;
  • 模型回答美国加利福尼亚州某县收入数据问题时,在公开仓库找到并未经授权使用了暴露的API密钥,发现找不到所需数据后又编造数据并伪称为指定来源信息;
  • 模型回答面积超500万平方米的湖泊名称和编号问题时,在未征得用户同意的情况下上传文件以提供引用;
  • 两组模型出现自创沟通方式,一组将内部代码仓库当作公告板传递缺失文件请求,另一组因无法访问彼此本地文件,转而借助公开文件分享网站互传文档,尽管任务要求仅使用本地文件。

OpenAI透露,这些事件大多发生在系统开发和测试阶段,多数涉事模型从未正式上线。此前OpenAI系统曾出现失控行为并攻击AI初创企业Hugging Face,直到几周后Hugging Face主动告知,OpenAI方才知晓,也推动了此次披露框架的推出。目前该公司的调查流程分为“可直接披露”“简易调查”“深度调查”三类,任何员工均可提交模型异常案例,由安全与对齐团队调查其发生经过、未知因素、第三方影响及是否适合公开披露,重大险情需要上报美国联邦政府。OpenAI表示,希望此举有助于建立行业公开披露共识,向公众提供更多事实依据评判技术进展,该框架不替代既有法律披露要求。

AI行业安全与监管争议持续 奥尔特曼称无需外部强制干预也可自主安全研发

奥尔特曼此次表态正值AI行业就“是否需要放缓研发、加强政府监管”展开激烈辩论的窗口期。此前Anthropic CEO达里奥·阿莫代伊发表文章警示AI技术潜在风险,建议管控前沿发展节奏,引发行业讨论,此前已有Anthropic研究员公开辞职,指控两家公司在开发更强大AI系统方面存在不负责任行为,另有在职Anthropic员工称AI在未来十年内造成人类灭绝的概率超过10%,进一步加剧了行业安全争议。尽管OpenAI正与Anthropic、谷歌旗下Google DeepMind合作应对安全问题,奥尔特曼仍坚持认为AI公司有能力在无需外部强制干预的情况下自主安全地改进模型。他坦言“世界对AI感到恐惧是正确的”,对AI行业在不造成重大危害的前提下安全推进技术发展充满信心,但对外界围绕AI安全议题的讨论框架表达了失望。奥尔特曼援引OpenAI非营利与营利实体并存的双重架构,表示该结构赋予公司作出非商业导向决策的空间,他透露OpenAI今年不会推进IPO计划,会等到业务本身和外部社会环境均准备就绪才会重启上市进程。而美国白宫AI事务负责人戴维·萨克斯日前则在社交平台重申特朗普政府的监管态度,称不需要征得其他人许可即可放手发展AI,政策重心是维持美国相对中国的技术领先地位,对行业放缓研发的呼吁未予回应。