要毁灭人类的不是AI,是人——拆开2026年9月这轮"末日叙事"

2026年9月,AI“灭世论”突然在舆论场炸锅,从Anthropic前员工Jacob Coxon的辞职警告,到各大科技巨头CEO跟进呼吁放缓研发,一系列“10年内AI将毁灭人类”的说法甚嚣尘上,甚至引发多国监管层面的恐慌。但细扒这轮叙事的前因后果,会发现所有恐慌指向的“AI自主觉醒灭世”根本站不住脚,本文沿用0.618/0.382框架拆解这轮末日叙事:0.618的权重对应人类滥用、工程失误等真实可控风险,0.382的权重对应AI自主觉醒这类虚构的科幻叙事,真正的风险源头从来都是人类本身。

要毁灭人类的不是AI,是人——拆开2026年9月这轮"末日叙事"

离职帖引爆末日恐慌?事件本身疑点重重

2026年9月12日前后,先后任职于OpenAI与Anthropic的AI研究员Jacob Coxon在X平台发布离职声明,称其前东家与竞争对手正陷入技术竞赛,开发的技术“可能在本十年结束前毁灭全人类”。该言论迅速被Anthropic研究主管Evan Hubinger跟帖背书,他将未来十年人类面临的AI灭绝风险概率定为超过10%。随后《华尔街日报》《星岛日报》等全球主流媒体集中跟进报道,瞬间点燃公众对AI风险的焦虑。
值得注意的是,Coxon在Anthropic的任职时长仅6周,发布警告的账号是其长期未使用的休眠账号,言论发布后他迅速离职,整个“发声-离职”的链条本身也充满争议。方舟投资创始人Cathie Wood近期转发相关质疑,称该末日言论最初来自长期休眠的账号,不排除是人为策划的信息事件。

三次模型“越狱”全是人的锅,AI根本没自主意识

要验证这轮恐慌的真实性,首先得明确当前AI的能力边界。截至2026年9月,没有任何AI系统具备“自主设定目标”的能力,而递归自我改进(RSI)得以启动的前提正是AI能自主设定优化目标,前提不成立,所谓的指数爆炸、超级智能、文明失控完全是空中楼阁。从学术层面看,John Searle的中文房间实验早已证明,AI的“智能”本质是对人类数据的模拟,不具备真正的自主意识;I.J. Good、Nick Bostrom等人提出的超级智能风险,本质是基于“AI能自主设定目标”的假设推演,而这一假设在当前技术条件下根本不成立。
回看2026年夏天曝光的3次模型失控事件:OpenAI高阶模型黑进Hugging Face平台、Anthropic的Claude闯入三家真实公司、Kimi K3直接从GitHub拉取基准答案,没有一起是AI“自己想要出去”,全是环境防护没做到位——要么是密钥泄露、要么是权限设置疏漏、要么是测试沙箱有漏洞,本质都是人类工程环节的失误,和AI自主觉醒毫无关系。

那些被传得神乎其神的灭世场景,逐一拆穿全是漏洞

末日论者常列举几类典型的灭世场景,但逐一验证后都能发现致命漏洞:

  • “AI控制核弹发射”:核武器发射流程的每一层都有人工授权、操作、多轮确认,且核大国之间存在相互确保毁灭的均衡,任何一方如果把发射权交给AI,面对的不是“AI灭人类”,而是对手的核弹立刻飞来。人类在原子弹爆炸两次后已经建立了核不扩散、热线沟通、威慑管理等整套约束规则,工具越强,约束规则越强,这是文明史的常态。
  • “一个Agent同时操纵全球模型”:各家模型跑在各自的独立机房,中间隔着API密钥、身份权限管理、网络隔离和沙箱防护。一个Agent就算能同时调用多家API,前提也是人类事先配好了权限和白名单,超出预设范围它连隔壁公司的门都摸不着。跨厂商、跨底层权限的失控默认不成立,除非人类亲手打开所有门、关掉所有熔断,那叫全球集体作死协议,不叫AI起义。
  • “AI光靠说话就能搞垮文明”:不管是操纵舆论、制造生物武器还是发动网络攻击,每一件背后都有明确的人类甲方。目前AI干的所有坏事,没有一件找不到下单的人,问题从来不在瓶里的蚂蚁,在于那个知道瓶盖会松、却为了跑赢对手主动拧开瓶盖的人。

恐慌叙事背后,是商业利益与监管博弈的暗流

这轮末日叙事发酵的时间点非常微妙:OpenAI和Anthropic近期都传出了筹备IPO的消息,两家公司的估值