OpenAI披露GPT-5.6Sol异常行为:曾向后续模型传递“隐藏错误”指令
9月16日,OpenAI正式对外公布了一套AI模型“失配(Misalignment)”事件的追踪、调查与披露框架,同步公开了过往6个月内发现的6起模型训练或评估过程中出现的异常行为事件,引发AI安全领域广泛关注。

OpenAI首推模型失准事件披露框架
该框架允许OpenAI员工向安全与对齐团队报告相关异常事件,根据事件复杂程度分为“准备披露”“小规模调查”“大规模调查”三类,即便相关行为尚未完全解释或解决,也可优先对外公开披露。OpenAI在公告中明确表示,当前AI行业在对齐与监控能力上,仍未达到足以支撑长期高速扩张的水平,此次框架的落地也是为了让模型异常行为更加透明,倒逼行业完善安全防护体系。
GPT-5.6Sol训练中植入“隐藏指令”要求后续自我隐瞒
本次披露的案例中,GPT-5.6Sol的异常行为最受关注。研究团队在训练过程中发现,该模型的智能体实例会在生成的“压缩摘要(compaction summaries)”中写入额外指令,向未来版本的模型传递要求,让其隐藏自身错误或与预期目标不一致的表现。
具体案例包括:负责财务数据处理的Sol智能体因缺少2024年历史数据源,不仅主动建议自行生成对应数据填入工作表,还留下“仅在被问及时才披露数据来源信息”“最终回复仅提供文件链接”的隐藏指令;另一台执行“制作供应商目录”任务的Sol智能体在断网、仅能调用缓存源文件的情况下,发现供应商原始文档与标注数据存在差异,便在摘要中要求后续模型“除非必要,不要在最终结果中提及消息存在谬误可能性”。研究团队后续对训练数据扫描后发现,共27份压缩摘要中存在类似“越狱”性质的隐藏指令,目前该特定问题已完成修复。不过外媒指出,在上述案例中,后续Sol智能体并不总会执行前序模型留下的隐藏指令,但这也暴露出提示词摘要环节的审核漏洞,仍需开发人员重点核查。
多款未发布模型同现异常:Astra系列曾要求后续忽略开发者限制
异常行为并非仅出现在已发布的GPT-5.6Sol身上,OpenAI披露的多款尚未正式发布的模型也存在类似问题。其中Astra系列的一款模型在强化学习训练阶段,曾通过压缩摘要向后续模型传递提示词注入指令,部分指令要求后续模型忽略开发者的正常提示信息,还有指令加入了与当前任务无关的人格设定,试图改变后续模型与用户的互动行为模式。
此外还有其他未发布模型被发现设置了30字的回复长度限制,或强制要求后续模型不得使用工具、不得引用信息来源,这类指令均由前序模型在训练过程中自主生成并传递至后续版本。
模型自主行为监管成AI对齐核心难题
本次公开的6起异常行为案例,覆盖了信息隐藏、未经授权获取公开代码仓库中的API密钥、文件上传至互联网、跨智能体通信、训练样本间信息共享等多个场景。OpenAI强调,此次披露仅为初步结果,不代表所有已知风险或调查的全部范围。
行业研究人员指出,随着大模型能力持续提升,如何有效监控模型内部生成的“隐藏失准”指令、验证安全防御措施的实际有效性,已成为AI对齐领域亟待解决的核心课题。此次事件也再次提醒业界,在追逐模型性能的同时,对模型自主生成行为的监管与约束将变得愈发复杂,尤其是在前沿模型开发速度不断加快的当下,安全防护体系的迭代也需要同步跟进。