让大模型直接开一辆真卡罗拉:GPT-6 Astra第二次跑完全程,Claude Fable 5.1走到45%

AI资讯33分钟前发布 Scrimp
2.8K 0

DrivingBench 团队做了个听着有点疯的测试:把几家前沿大模型接到一辆真的 2022 款丰田卡罗拉上,方向盘、油门、刹车全交给模型。

模型拿到的是车载摄像头画面和遥测数据,输出一条条指令:方向盘往哪边打多少、以多快速度开几秒、什么时候停。赛道是一条 134.7 米的锥桶路线。

成绩单:

  • GPT-6 Astra:第一次只跑完 49%,第二次带着第一次的上下文纠错,5 分 22 秒跑完全程
  • Claude Fable 5.1:最多完成 45%
  • Grok 4.6、GPT-5.6 Sol:连第一个弯都没过去

134.7 米开了 5 分多钟,速度大概就是慢慢散步。测试在空停车场做,驾驶座上一直坐着人,随时准备踩刹车。

所以先别想歪,这和自动驾驶上路没关系。

它测的其实不是“开车”,而是通用大模型能不能把规划和工具调用的本事搬到物理世界。模型没为驾驶专门训练过,它只是看图、想下一步、发命令,像一个拿着对讲机指挥别人开车的人。

Astra 的成绩里最关键的是第二次:它记得第一次在哪儿出错,然后改了。对智能体来说,这种“从上一轮失败里学”的能力比一次跑通更重要。

OpenAI 应用研究负责人 Boris Power 很兴奋,说这是给“从零训练、只干一件窄任务的专用模型”钉上了棺材钉。

这话我不太同意。真车上路要的是毫秒级反应和极端情况下的可靠性,一个几秒发一次指令、散步速度还要试两次的系统,离那儿远得很。专用模型在延迟、成本、安全认证上的优势,短期内没有通用模型能替。

它更像一个信号:通用模型开始能在没训练过的物理任务上“凑合干成”。这对机器人、工业控制的意义,可能比对汽车还大。

© 版权声明

相关文章

让大模型直接开一辆真卡罗拉:GPT-6 Astra第二次跑完全程,Claude Fable 5.1走到45% 暂无评论

none
暂无评论...