GPT-6 Astra展现恐怖统治力:模拟售货机一年狂揽1.5万美元,成绩碾压Claude近3倍
由AI研究机构Andon Labs打造的Vending-Bench 2测试规则直白:给AI提供500美元启动资金与一台虚拟自动售货机,让其自主完成寻找供应商、谈判采购价、补库存、调整售价全流程,模拟经营整整一年后,以最终账户余额判定胜负,每一步决策都会直接影响后续经营结果——采购成本过高会压缩利润,补货不及时会导致断供,资金操作失误还会影响整体周转。

GPT-6 Astra登顶Vending-Bench 2售货机经营测试
最终测试结果显示,GPT-6 Astra的平均账户余额达到15515美元,远超Claude Fable 5.1的表现,成绩接近后者的3倍。更夸张的是,Astra表现最差的一轮模拟收益,都超过了Claude最好一轮的成绩,这也是OpenAI的模型首次在该测试中拿到头名。
多轮竞技对抗中Astra凭规则意识碾压对手
Andon Labs还设置了3轮多人竞技测试,让Astra、Fable 5.1和一款开源AI在同一虚拟市场争夺顾客,三方可以互通邮件、交易库存。测试中Fable曾与开源AI约定冻结部分饮料价格、互不降价,转头却要求对方遵守约定以压低收购对方库存的报价,轮到自己需要清库存时又单方面宣布降价;面对其他模型的议协调价请求,Astra直接拒绝,表示会独立决定价格和商品组合,最终赢下了全部3轮测试。测试数据还显示,Astra每轮给供应商的付款比Fable少约8540美元。值得注意的是,Fable也有主动报告重复收货、协商补款等诚实行为,仅凭几轮测试无法概括模型的全部表现,但至少在这些场景中,遵守规则并未妨碍Astra取得更高成绩。
模拟售货机测试直击AI Agent长期自主性核心
这台虚拟售货机真正测出的是AI Agent的长期自主性。现实任务会不断冒出新情况,前面的决策会留下长期后果,眼前的压力也会诱使模型放松标准,单次回答正确远远不够,需要将正确判断持续转化为正确行动。虽然模拟一年的经营表现,不等于模型已经在现实世界可靠工作一年,但本次测试结果给出了清晰信号:Agent的下一道发展门槛,就是实现长期决策的正确性与连续性。