Google DeepMind 发布 Gemini Robotics 2,实现人形机器人全身控制
Google DeepMind 推出 Gemini Robotics 2 模型,支持人形机器人从脚到指尖的全身运动,并提升灵巧操作能力,是迈向复杂现实任务的重要一步。
Google DeepMind 表示,其最新版本的 Gemini Robotics AI 模型可以“控制整个人形机器人”。根据周四的公告,之前的模型专注于控制人形机器人的上半身,而 Gemini Robotics 2 现在支持从脚到指尖的“全身运动”。
新模型将使人形机器人能够执行更广泛的动作,包括行走、蹲下、伸展和操纵物体。Google 分享的视频展示了 Apptronik 的 Apollo 2 机器人如何弯腰捡起喷壶,以及寻找并从货架上取下特定物品。
尽管 Google DeepMind 指出其机器人“在运动速度方面还有待提升”,但它补充说,这次更新“是迈向完成更复杂、需要全身协调的现实世界任务所需技能的重要一步”。此外,Gemini Robotics 2 支持更好的灵巧性,因为它现在可以控制更复杂的五指手。
这使得机器人能够执行诸如密封 Ziploc 袋、系垃圾袋或拧开灯泡等任务。Google DeepMind 还在更新 Gemini Robotics ER(具身推理),这是一个视觉语言模型,帮助机器人分析周围环境、处理指令并执行多步骤任务。
Gemini Robotics ER 2 在较长时间内完成任务的能力更强,并且“现在能理解任务何时开始和结束”。
Google DeepMind 表示,这次更新还允许多个不同类型的机器人协同工作并完成任务,其中一段视频展示了 Apollo 2 如何指示 Google 的双臂机器人在清洁车库时将工具放入垃圾箱。
该公司指出,Gemini Robotics ER 2 是其“迄今为止最安全的机器人模型”,因为它可以“更好地检测人类何时在附近,触发安全工具调用,并在有人过于靠近时使机器人安全停止”。
与此同时,Google DeepMind 对其 Gemini Robotics On-Device Model 进行了改进,该模型可以在机器人上本地运行,无需互联网连接。该模型现在可以更快地适应新的形态,包括那些“形状、传感器和自由度截然不同”的形态。