当 Codex 开始写测试:AI 正在重新定义软件质量工程
近期 OpenAI Codex 产品与工程负责人 Andrew Ambrosino 在 Lenny 播客中的分享,揭开了 AI 编程工具从“结对辅助”到“任务委托”的质变细节,而测试环节作为软件质量的核心抓手,正是这次变革中被重新定义最彻底的领域。
从结对编程到任务委托:Codex 把测试全流程打包交给 AI
过去半年 OpenAI 内部的工作流发生了本质变化:在 GPT-5.2 Codex 发布前,AI 仅能扮演自动补全、结对编程的辅助角色,工程师仍需坐在编辑器前手动驱动整个开发流程,测试环节也需要人工编写用例、执行、排查问题。但从 GPT-5.2 Codex 开始,工作模式切换为“工程师制定计划、确认规格,剩余工作全权委托给 AI”。

这种转变直接覆盖了测试全流程:Codex 现在可以自主运行 QA 测试、独立训练优化模型、生成包含缺陷定位与修复建议的 PDF 报告,甚至能在夜间无人值守时段完成全量回归测试。OpenAI 内部没有给出精确的代码 AI 生成占比,但明确表示绝大多数代码现在都由 AI 完成,很多工程师甚至不再打开传统 IDE,仅需设计模块接口、规划方案,代码实现与测试验证全由 Codex 承担。Codex 负责人 VJ 曾分享过一个细节:他在飞机上使用 Codex 跑测试任务,空乘要求关闭电子设备时,他特意把笔记本半合放置,只为不中断 Agent 的自主测试进程——如今 OpenAI 内部几乎人人都会半合笔记本带着 Codex 到处走,生怕错过后台的测试运行。
并行探索与角色重构:设计师都能写代码,测试岗边界正在模糊
Codex 带来的不仅是效率提升,还有整个研发团队的角色边界重构。过去遇到复杂技术选型时,团队需要撰写设计文档、召开多轮会议讨论排除备选方案,决策周期往往长达数天;如今工程师会同时让 Codex 实现多个备选方案,直接跑测试对比实际效果,决策逻辑从“讨论后择一”彻底变为“实现后比较”。
更明显的变化是跨岗位的能力溢出:
- 过去只有工程师能完成的代码编写工作,如今设计师产出的代码量已经比半年前的工程师产出还多,Codex 生成的代码质量已达到可直接合并的标准,设计师无需依赖工程师就能完成简单的功能迭代,自然也需要承担对应的测试验证工作;
- 传统的前端、后端、测试、基础设施分工正在迅速模糊,每个人都必须具备更强的全栈能力,甚至需要参与产品判断。Codex 团队甚至半开玩笑地表示,在某些场景下,产品经理这个角色是否仍然必要,都值得重新讨论——毕竟当 AI 能自主完成开发、测试全流程