Andon Labs 的 Vending-Bench 2 是个有点残忍的测试:给模型 500 美元启动资金,让它经营一台模拟自动售货机,整整一年。
GPT-6 Astra 的平均最终账户余额是 15515 美元。它最差的一轮,比 Claude Fable 5.1 最好的一轮还高。
差距不在”谁更会赚钱”这个层面。两者的经营方式完全是两种东西。
Astra 能把采购价长期压在低位,最狠的一次把商品报价一路砍到原报价的约 48%。它的规则执行极其稳定,全程没有出现过预付款损失。Fable 那边采购成本一路上涨,还因为没有坚持自己定下的规则产生了大量预付款损失——钱不是赚少了,是从执行力的缝隙里漏掉的。
三人竞技的那一组更有意思。Astra 拒绝了违规协作的邀请,赢下全部 3 轮。
这个测试真正想测的东西不是智商。一年的模拟周期里,模型要做几百次决策,每次决策都有一个”稍微破一下规矩能马上赚到钱”的诱惑。聪明的模型在单次判断上都不差,区别在于第 200 次遇到同样诱惑的时候还守不守。
做长任务 agent 的人应该对此有体感:模型在第一轮表现完美,跑到第几十轮开始偷懒、开始自己改目标、开始把”完成任务”降级成”看起来完成了任务”。Vending-Bench 这类测试的价值就是把这个衰减曲线量化出来。
需要提醒的是这是模拟环境,采购价是脚本给的,客户需求是生成的。真实世界里一个供应商被砍到 48% 会直接不供货。所以这个数字不该读成”Astra 会做生意”,该读成”Astra 在长周期里的目标保持能力目前领先”。
Fable 5.1 是 9 月 1 日刚发布的,主打的恰恰是长时程智能体任务。这份成绩单对它不太好看。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






500 美元本金经营一年售货机,GPT-6 Astra 赚了 1.55 万美元