OpenAI总裁:AGI时代来了,GPT-6已能自主干活24小时

9月4日凌晨,OpenAI正式发布新一代旗舰模型GPT-6 Astra,在发布会尾声,OpenAI总裁格雷格·布罗克曼公开表示“我个人认为,我们可能已经到达AGI了,我觉得就是这个模型”,并以“欢迎来到AGI时代”收尾,直接将行业讨论推向高潮。这场发布早有预热:2026年4月初,X平台科技博主@iruletheworldmo率先爆料OpenAI内部代号“Spud”的下一代模型GPT-6已完成预训练,预计4月14日发布;3月中旬OpenAI CEO萨姆·奥尔特曼在贝莱德峰会上公开称正在得克萨斯州阿比林训练“世界上最好的模型”,多方信源交叉印证了发布时间的可靠性。

OpenAI总裁:AGI时代来了,GPT-6已能自主干活24小时

布罗克曼发布会放话:我们已进入AGI时代

Astra在拉丁语中意为“星辰”,ChatGPT官方发布前曾预告“The stars are almost aligned(星星几乎排列好了)”,OpenAI将这颗星辰定义为“新一代智能”,称其是“当今世界智能水平最高、对齐表现最好的模型”。布罗克曼在媒体电话会议中进一步放话:“未来人们回过头看,可能会认为AGI大概就是在这个时候出现的,我认为可能就是从这个模型开始的。”他同时解释,AGI更像一个“使命概念”而非可以被简单定义的技术指标,此番宣告是方向而非终点。
这一表态与OpenAI高层的口径转变高度吻合:奥尔特曼今年早些时候还曾公开表示AGI是“没什么用的词”,7月便改口称“我们现在已经身处技术奇点”。OpenAI将AGI定义为在大多数具有经济价值的工作中,表现超过人类的高度自主系统,在Astra的电脑操作、软件工程、网络安全、科学研究等领域的突破性表现支撑下,高层选择在此时抛出AGI到来的结论。

GPT-6 Astra核心突破:从回答问题到自主完成全流程工作

Astra最核心的变化,是AI从“提供答案”转向了“直接完成任务”:用户无需拆解步骤,只需给出明确目标,模型即可自主拆解任务、调用不同工具、持续执行,最终交付完整结果。无论是“整理一份财务分析并做成演示文稿”还是“开发一个游戏原型并测试运行”,Astra均可独立完成。
在实际工作场景中,Astra可自主填写网络表单、更新CRM客户记录、整理日历、进行网络搜索、在邮件或文档中撰写总结,还可分析科学数据、生成图表、创建网站并运行前端质量测试;针对软件开发任务,Astra能够自主安装和测试软件,根据屏幕显示的问题自主排查故障。
测试数据印证了其能力跃升:在OSWorld 2.0测试中,Astra得分72.6%,较上一代GPT-5.6 Sol的65.7%有明显提升;在延迟模拟环境下,Astra完成一项任务平均耗时40分钟,上一代需75分钟,效率提升47%;结合更新后的Codex harness,Astra在Mind2Web测试中的任务完成速度达到上一代的1.9倍。此外,Astra的对齐表现也有显著优化,上一代模型有48%的时间会超出授权目标,而Astra的该比例为0%。

底层架构革新:Symphony架构与双系统推理重塑AI能力边界

从技术参数来看,GPT-6同样实现了量级跃升:

  • 参数规模达5至6万亿,采用混合专家架构,实际激活参数仅占10%左右;
  • 上下文窗口扩展至200万个Token,主流基准测试表现较GPT-5.4提升约40%;
  • 训练投入超过20亿美元,动用了约10万张H100 GPU。
    更深层的变革来自底层架构的重构。OpenAI将GPT-6的底层架构命名为“Symphony(交响乐)”,从设计之初就将文本、图像、音频、视频等不同模态纳入同一向量空间,实现底层编码的统一,打破了此前多模态能力“在文本模型上嫁接其他模块”的叠加逻辑。同时,模型引入了双系统推理框架:System-1负责快速响应与内容生成,System-2负责逻辑校验和多步推导,呼应认知科学中“快思考”与“慢思考”的经典理论,推动AI能力从“生成更多”转向“生成更准确”。

争议与落地并行: