这些研究人员让人工智能驾驶丰田卡罗拉进行进出
Aditya Ramabadran、Simon Mahns和Tobias Gessler是一家名为Axiom的初创公司的三名人工智能工程师,他们最近想吃In-N-Out汉堡。不过,他们可不想自己开车。
他们坐在湾区餐厅车道附近的一辆2024丰田花冠里,打开一台笔记本电脑,让OpenAI的GPT-6 Astra来驾驶。他们将一个聊天界面连接到一个服务器上,该服务器连接到几个安装在挡风玻璃上的摄像头和汽车的动力转向系统。
一名安全司机将一只脚放在刹车上方,以防万一。人工智能模型通常负责生成文本、代码和奇怪图像,缓慢但肯定地将车辆导航到外卖窗口,以便他们可以领取食物。“也许AGI毕竟就在这里,”一位工程师说道,他指的是人工通用智能,即可以与人类智能相匹配的机器的广为人知的想法。
当然,自动驾驶汽车并不是什么新鲜事,但它们通常由专门为任务训练和设计的算法来操作。在这种情况下,操作来自一个旨在输出文本的模型,并且它是在飞行中发生的,没有三人组的事先指导。快餐特技以及其他一些实验表明,基于语言的人工智能模型开始对物理世界进行初步但有用的理解。
尽管三人的午餐旅行中没有发生任何明显令人震惊的事情,但他们承认,让通用模型负责快速移动的两吨重的钢铁是一项风险很高的任务。随着物理理解的提高,我们可以看到人工智能模型以令人印象深刻、也许是令人惊叹的新方式进入现实世界。
锻炼身体当今最聪明的模型非常擅长回答复杂的问题,甚至自主执行一些虚拟任务,但他们的技能往往仅限于计算机和互联网的世界。将这些模型带入现实世界,它们很快就会变得困惑。尽管声称AGI已经到来,但人工智能公司显然将物理推理视为人工智能尚未征服的前沿。
一些研究人员离开大公司,创立专注于解决物理推理的初创公司。安德鲁·戴(Andrew Dai)是其中一家名为Elorian AI的机构的首席执行官,他曾担任Google DeepMind的研究员。
他说,更好的视觉推理将为人工智能开辟许多新应用,比如了解食客是否在餐厅享用餐点的系统,或者能够在家中工作的机器人。戴说,机器人技术是物理推理技能的重要测试案例。“这对于机器人技术非常重要,”他说。
“如果没有这个,你就无法真正想象家用机器人。
”Elorian和Scale AI是一家为大型人工智能实验室提供训练数据的公司,最近开发了一个新的基准,即人类的第六感,它衡量模型理解物理场景的能力。“大多数视觉AI研究都是关于感知的,”Scale AI的研究科学家Xingang Guo说,他参与了基准的开发。
“我们想问的是,一个模型需要什么才能直观地理解一个场景,就像一个人不去想它一样。”对于Ramabadran,Mahns和Gessler来说,他们在Axiom工作之外完成的In-N-Out项目的目标是测量模型在混乱的现实世界中的运行情况。
他们的想法是在一个周末闲逛时测试模特的驾驶技术。他们注意到像Astra这样的模型能够构建复杂的3D模拟,并想知道它是否可以转化为导航现实世界的能力。“我们都生活在湾区,我们接触过特斯拉和Waymos,所以也许这发挥了一定作用,”拉马巴德兰告诉我。
工程师们在尝试OpenAI和Anthropic的最新模型之前尝试测试SpaceXAI的Grok。起初,模特们拒绝控制车辆--他们反驳道,“我可以帮助解释道路图像,但我不能向实体汽车发出运动命令。
“但只要稍微谨慎一点,他们就可以被哄骗走得更远。当模特开始开车时,三人都惊呆了。
工程师们表示,大型人工智能公司似乎专注于提高其最新车型的空间推理能力,但他们怀疑这是否意味着他们实际上正在训练他们驾驶汽车。他们说,这些模型的汽车天赋可能是3D推理训练的一部分。
“这可能就像是一种新兴的能力,可以扩展模型的多模态,”Mahns告诉我,他引用了现在用于训练模型的图像、视频和3D模型等输入。尽管如此,三人组的一个新的车辆基准,称为DrivingBench,表明这些模型在通过驾驶测试之前还有很长的路要走。
该基准衡量模特在停车场设置的简单赛道上行驶的能力。只有阿斯特拉能够完成课程--而且速度非常慢。克劳德寓言5. 1的成功率为45%,而Grok的成功率仅为11%。拉马巴德兰表示,最新车型似乎能够适应错误;
它们显然适应了汽车的控制并实时改善了驾驶性能。他说:“这些模型似乎确实在根据错误进行调整或上下文学习,并学习如何更好地驾驭控制。”GPT,握住方向盘。这是Will Knight的人工智能实验室时事通讯的一个版本。
在此处阅读之前的时事通讯。