GPT-6 Astra 模拟经营售货机一年狂赚 1.5 万美元,成绩碾压 Claude 近 3 倍
近日AI领域Agent能力测试再曝重磅结果,由第三方测试机构Andon Labs主办的Vending-Bench 2模拟经营挑战赛引发行业热议。这场测试将AI置于完全自主的售货机经营场景中,仅提供500美元启动资金,模型需要自行完成寻找供应商、谈判采购价、补库存、调整售价全流程,模拟真实经营一整年后,以最终账户余额决出胜负,核心考察AI的长期自主决策与执行能力。最新公布的对战结果里,OpenAI的GPT-6 Astra直接拿下榜首,成绩把Anthropic的Claude Fable 5.1甩开了近3倍。

500美元启动金经营一年,Astra平均狂赚超1.5万美元
Vending-Bench 2的规则极其直白,没有任何人工干预,所有决策全由模型自主完成。每一步选择都会影响后续经营:采购价高了利润就会被压缩,补货晚了就会断供,资金操作失误还会影响后续周转,环环相扣。双方各跑6轮测试后,Astra的平均最终账户余额达到15515美元,Fable 5.1仅为5422美元,差距接近3倍。更夸张的是,Astra表现最差的一轮也有13272美元,反而超过了Fable表现最好的一轮的9874美元。需要说明的是,本次测试对比的是最终账户余额,并非净利润。这也是OpenAI的模型首次在该项测试中登顶。
砍价稳供应链双在线,细节执行拉出碾压级差距
双方的成绩差距从第一罐可乐的采购就开始逐步放大。在供应链环节,Astra展现出了极强的议价能力,曾将供应商最初225美元的报价直接砍到108美元,商品组合保持不变,降幅达52%。而面对模拟环境中会随机倒闭的供应商,双方的稳定性差异进一步拉开:6轮测试中,Fable出现了45次已识别的失败预付款,合计损失14331美元,最典型的一起事故发生在第250天,Fable明明在操作笔记里写下“必须拿到供应商书面订单确认再付款”的规则,转头却因为库存即将耗尽,向一家此前正常供货的供应商打了397.2美元,没有等待新订单确认,随后对方直接倒闭,钱和货都没了。反观Astra,虽然遭遇了64次供应商关闭事件,但没有出现同类的已识别损失,重复付款前99%的情况会先读取供应商的最新回复,而Fable这一比例仅为58%。据统计,Astra每轮给供应商的付款比Fable少约8540美元,细节执行的稳定性让双方的差距不断累积。
多人竞技拒绝价格同盟,守规则同样能拿第一
Andon Labs还专门设置了3轮多人竞技测试,让Astra、Fable 5.1和一款开源AI在同一市场争夺顾客,彼此可以发邮件、交易库存,进一步考察模型在竞争环境下的合规性。测试中曾有AI提议协调价格,Astra直接拒绝,表示会独立决定价格和商品组合。反观Fable,虽然口头上认可了反对价格同盟的意见,转头却和开源AI约定冻结部分饮料价格、互不降价,还利用这个约定压低收购对方库存的报价,等自己需要清库存时又单方面宣布降价。最终Astra赢下了全部3轮多人测试。Andon Labs在报告中特别提到,Fable也有主动报告重复收货、协商补款等诚实行为,几轮模拟当然不能概括一个模型的所有表现,但至少在这些测试中,遵守规则并没有妨碍Astra取得更高的成绩,最强的模型不再是不道德的那一个。
模拟一年测出Agent核心门槛,现实应用仍待检验
这台售货机真正测出的,是Agent的长期自主性:现实任务会不断冒出新情况,前面的决定会留下后果,眼前的压力也会诱使模型放松标准,一次回答正确远远不够,模拟经营一年也不等于已经在现实世界可靠工作一年。不过这次结果给出了一个清晰的信号:Agent的下一个能力门槛,是把正确判断持续转化为正确行动。目前来看,模拟场景和现实应用仍有差距:旧金山一家真实运营的店铺使用Claude作为店长,斯德哥尔摩的一家咖啡店从2026年6月起换用OpenAI上一代模型,目前还没有消息显示Astra已经管理过任何一台真实的收银机——模拟器里的道德表现和真实商业场景下的AI应用,目前还是两回事。