老黄替OpenAI宣布AGI,出题人当场打脸:换个考场99.9%掉到62.7%

9 天前
5 阅读

上周四,OpenAI正式发布新一代旗舰模型GPT-6 Astra,官方将其定性为“世界上最智能、最对齐的模型”,能力边界从聊天、写代码等单一任务,拓展至计算机操作、软件工程、专业工作自动化、网络安全等复杂场景,发布后迅速成为行业焦点。随后英伟达CEO黄仁勋在X平台发布公开帖文,向OpenAI团队表示祝贺,并直接抛出“AGI已经到来”的判断,瞬间将事件热度推至顶点。

老黄替OpenAI宣布AGI,出题人当场打脸:换个考场99.9%掉到62.7%

黄仁勋高调站台OpenAI,GPT-6 Astra被推上AGI神坛

OpenAI公布的多项测试数据显示,GPT-6 Astra的综合能力较前代有显著提升:电脑操作能力测试中得分达到72.6%,高于上一代GPT-5.6 Sol的65.7%;专业工作自动化测试得分从18.1%大幅升至41.4%;在Terminal-Bench 4.0测试中得分57.9%,超过Anthropic同期发布的Claude Fable 5.1。网络安全能力的跃升更为行业关注,正是这类复杂开放场景的表现,让OpenAI联合创始人兼总裁格雷格·布罗克曼随即公开宣布“欢迎来到AGI时代”。

GPT-6 Astra成绩单现两个版本:定制环境99.9%,裸考直接打六折

引发争议的核心来自AGI判定测试ARC-AGI-3的两个差异极大的成绩版本,测试规则的不同直接导致了结果的悬殊:

  • 定制「自带工具」环境(Provider Adapter框架):允许GPT-6 Astra使用OpenAI专门设计的上下文管理机制,在连续操作之间保留内部推理状态,并对超长对话进行压缩,相当于为模型测试“开小灶”,最终取得99.9%的成绩,单次测试成本约1.9万美元
  • 统一裸考标准环境(Standard Harness):所有厂商的模型使用完全相同、无特殊优化的中立测试规则,GPT-6 Astra的最高得分仅为62.7%,单次测试成本飙升到2.6万美元

出题机构ARC Prize当场打脸:真AGI必须裸考过关

负责ARC-AGI-3测试的ARC Prize态度十分坚决:未来的AGI必须能在标准条件下解题,带工具拿到的99.9%和裸考拿到的62.7%,完全是两码事。同时ARC Prize也承认Astra带来了“阶跃式”惊喜:在96%的测试关卡中,Astra完成任务使用的动作数比人类更少,平均少用51.7%,是AI首次在动作效率上全面碾压人类。但ARC Prize早已明确说明,ARC-AGI-3的上线公告中已写明,刷满该基准不等于“证明达到了AGI”——测试环境再难也是封闭的,机制确定、目标封闭,无法代表真实世界的复杂与开放性,就如同学霸在封闭考卷中考满分,到了开放的真实职场未必能同样出色。

AGI定义混乱叠加营销质疑:99.9%是技术跃迁还是资本造势

此次事件也暴露出OpenAI在AGI定义上的反复摇摆:过去11年OpenAI内部对AGI的定义多次调整,CEO山姆·奥尔特曼甚至在两天前刚刚公开表示“AGI是一个营销术语”,与布罗克曼的高调宣布形成鲜明反差。此外当前OpenAI正面临被Anthropic在收入、估值、IPO速度上全面超越的压力,此次高调宣布AGI的动机也引发行业猜测。第三方测评机构Artificial Analysis的“智能指数4.1.1”测试显示,GPT-6 Astra的得分仅为61.2,仅略高于上一代GPT-5.6 Sol的60.9,低于Anthropic Claude Fable 5.1的65.7和Claude Opus 5的63.1,并未出现能支撑AGI判断的碾压式性能提升。