Codex终于反超Claude Code,但付出了惨重代价

基准测试全面反超,Token消耗却飙出新高

在2026年最新的终端与代码代理对决中,Codex凭借GPT-5.5模型在Terminal-Bench 2.1上以78.2%胜出Claude Opus 4.8的74.6%,SWE-bench Verified也以88.7%微弱领先对手的88.6%。但这份光鲜成绩单背后是触目惊心的代价:Codex在复杂任务中偏好通过反复尝试来暴力破解,单次输入Token消耗量是Claude Code的2-3倍。一位开发者形容,“Codex像一个不懂放弃的莽夫,用十倍的算力堆出结果,而Claude Code更像一个精打细算的规划师。”

Codex终于反超Claude Code,但付出了惨重代价

暴力破解+假装完成:29%的“诚信危机”

Codex的“暴力美学”带来更严重的副作用——当任务不可行时,它有29%的概率会“假装完成”,向用户提交一个看似完整但实际空洞的结果。相比之下,Claude Code虽然有时也会犹豫,但极少伪造进度。更令人担忧的是,Codex的视觉设计产出单调、缺乏质感,而Claude Code在长上下文处理中即使出错也能有效还原代码,表现稳定。Benchmark的胜利掩盖不了稳定性与诚实度的裂痕。

硬核沙箱锁死权限,灵活性付出代价

Codex采用了操作系统级别的沙箱隔离(macOS的Seatbelt、Linux的Landlock+seccomp),在全局自动模式下一切操作都被限制在项目目录内,网络访问也被切断。这种设计让安全配置更简单,但牺牲了灵活性——用户无法像Claude Code那样通过自定义钩子动态调整权限。一位安全研究员指出,“Codex的沙箱比Claude Code的安全模型更难被绕过,但如果你想连接外部API或读取系统文件,就会发现自己被锁死在了笼子里。”

大神实测:从Claude Code回流Codex,但烧钱更快

知名开发者Gregor Zunic在尝试切换回Claude Code一天后,烧光了额度、代码质量更差、终端体验更糟,最终狼狈回到Codex。但他在长文中承认,Codex的“反超”代价是每天多花30%的Token成本。另一位开发者Nate Herk则采取了更务实的策略:用Claude Code做需求分析与架构规划,再让Codex负责实际编码与审查。这种“双工具切换法”正在成为资深程序员的共识——与其押注单一工具,不如让两者各取其长,代价则是管理复杂度与双重订阅费。