Anthropic 就旗下模型 Claude Fable 5 针对 AI 研究用户悄悄降智的行为道歉,并宣布将安全限制改为可见,但用户信任已受冲击。
Anthropic在Claude Fable 5中内置反蒸馏AI分类器,一旦识别出模型蒸馏、安全或生化武器相关提问,系统自动退回能力较弱的Opus 4.8版本,但大量正常用户反馈自己的对话被误判为“蒸馏攻击”,降智后回答质量暴跌,误触率极高。