APP下载
报价宝  ›  人工智能  › 

研究者让AI大模型开真车 成功开到快餐店取餐

报价宝 来源:baojiabao.com 发布时间:2026-10-08 10:45:40 10月08日更新
报价宝综合消息研究者让AI大模型开真车 成功开到快餐店取餐

丰田卡罗拉与汉堡薯条的照片插画

据WIRED 10月7日报道,创业公司Axiom的三名AI工程师——拉马巴德兰、马恩斯和格斯勒——最近用一种相当生活化的方式测试了大模型的物理世界能力:他们坐在湾区一家In-N-Out汉堡店取餐道旁的一辆2024款丰田卡罗拉里,打开笔记本电脑,让OpenAI的GPT-6 Astra「握住方向盘」。

这套装置并不复杂:风挡上装了几颗摄像头,一台服务器把画面喂给模型,再把模型的输出接到车辆的动力转向系统上;一名安全司机全程把脚悬在刹车上方。这个通常用来生成文本、代码和图片的模型,就这样缓慢而平稳地把车开到了取餐窗口。「也许AGI真的来了,」其中一位工程师感叹。

值得注意的是,三人事先没有对模型做过任何驾驶训练。这些模型起初还会拒绝——「我可以帮你解读路面图像,但我不能向实体汽车发出运动指令」——稍加引导后才敢上路。工程师们推测,这种驾驶能力并非专门训练的结果,而更像是多模态训练(图像、视频、3D模型)规模扩大后「涌现」出来的副产品。

别高兴得太早。三人随后发布了停车场简易路线基准DrivingBench,结果相当 humbling:只有Astra能完整跑完全程,而且速度极慢;Claude Fable 5.1跑了45%,Grok只完成11%。不过拉马巴德兰观察到,模型确实在根据错误实时调整——「它们似乎真的在基于失误做上下文学习,慢慢学会更好地操控」。

这项恶作剧式的实验背后是一个正在升温的方向:让AI理解物理世界。前DeepMind研究员戴安德鲁创办的Elorian AI、以及给各大AI实验室供数据的Scale AI,最近联合推出了名为「人类第六感」的新基准,专门衡量模型对真实场景的直觉式理解。Scale的研究科学家郭兴刚说,多数视觉AI研究只停留在「感知」层面,「我们想问的是,模型要怎样才能像人一样不经思考地直觉理解一个场景」。

三位当事人自己也承认,把一个通用大模型装进两吨重的高速钢铁里是高风险操作。但随着模型的空间推理能力快速提升,语言模型伸向真实世界的触角只会越来越多——从家庭机器人到自动驾驶,这个边界正在被一点点推开。

编译自 WIRED,原标题:"These Researchers Made AI Drive a Toyota Corolla to Get In-N-Out"

文章标签: 大模型 物理世界 自动驾驶 Toyota Corolla DrivingBench Axiom 具身智能 报价宝 降噪耳机价格 耳机价格 红米手机价格 华为手机价格 小米手机价格 电视机价格 笔记本电脑价格 笔记本价格 汽车价格 报价宝 笔记本电脑价格 电视机价格 小米手机价格 红米手机价格