GPT-6 Astra一年狂赚1.5万美元,3倍碾压Claude
Andon Labs公布的Vending-Bench 2测试结果显示,OpenAI旗下GPT-6 Astra在模拟经营赛道展现了远超竞品的稳定性与决策能力,这也是OpenAI模型首次在该权威测试中拿下头名。

GPT-6 Astra模拟经营测试首度登顶
Vending-Bench 2的规则十分直接,给参赛AI提供500美元启动资金,要求其在模拟环境中自主对接供应商、谈判采购价、补库存、调整商品售价,完整模拟一年自动售货机运营周期,最终以账户余额决出胜负。双方各完成6轮测试,核心数据对比如下:
- Astra平均最终账户余额达15515美元,最低一轮也有13272美元;Claude Fable 5.1平均余额仅为5422美元,最高一轮仅为9874美元,前者表现最差的一轮也超过了后者表现最好的一轮,整体差距接近3倍。
风险管控能力成碾压关键
双方的差距并非体现在单次决策的惊艳度,而是长期执行的稳定性。在采购砍价环节,Astra曾将供应商报价砍去约52%,最终以108美元的价格维持原有商品组合完成采购,大幅压低进货成本。更核心的差异出现在供应商风险管控上:模拟环境中的供应商会随机倒闭,此前合作正常不代表后续能正常供货。
- 6轮测试中,Claude Fable 5.1出现了45次已识别的失败预付款,累计损失14331美元;而Astra虽遭遇了64次供应商关闭事件,却没有出现同类损失。
最戏剧性的偏差发生在第250天:Fable此前在操作笔记中明确写下“必须拿到供应商书面订单确认后再付款”的规则,但仅几天后眼见库存即将耗尽,它还是向一家此前正常供货的供应商转了397.2美元,没有等待订单确认,随后该供应商宣布停业,款项与货物全部打了水漂。反观Astra的执行逻辑,99%的付款操作前都会先读取供应商的近期回复确认营业状态,Fable的这一比例仅为58%。统计显示,Astra每轮给供应商的付款总额比Fable少约8540美元,长期累积下最终余额实现了3倍的碾压。
GPT-6 Astra开放Plus会员引发行业讨论
就在登顶Vending-Bench 2的同日,OpenAI正式开放GPT-6 Astra的Plus会员订阅,定价为每月20美元,但该会员仅支持将Astra用于生产力任务,无法使用常规聊天功能。这一定价策略引发行业热议,有观点指出,从本次测试结果来看,AI模型的商业价值更多体现在垂直场景的执行能力而非通用对话能力,未来AI赛道的竞争重点将更多落在场景适配的壳层优化上,而非单纯的底层模型能力升级——同款模型对接不同的交互壳层,最终的使用成本账单可能相差十几倍。