谷歌DeepMind的新人工智能模型可以控制机器人的整个身体
真正值得关注的不是这条新闻本身,而是它可能把「大模型」的竞争焦点推向能力、成本与开放生态的再平衡。
谷歌 DeepMind 表示,其 Gemini Robotics 人工智能模型的最新版本可以“控制整个人形机器人”。根据周四的公告,虽然之前的模型专注于控制人形机器人的上半身,但 Gemini Robotics 2 现在支持从脚到指尖的“全身运动”。新模型将允许人形机器人执行更广泛的动作,因为它允许它们行走、蹲伏、伸展和操纵物体。谷歌分享的视频展示了 Apptronik 的 Apollo 2 机器人如何弯腰拿起喷壶,以及如何找到并从架子上拿走特定物品。
[媒体:https://youtu.be/9MNLEAzA59o?si=02zFLpyUWiebY9dL] 尽管 Google DeepMind 指出其机器人“在移动速度方面还有更多进步”,但它补充说,这次更新“是朝着完成更复杂、需要全身协调的现实世界任务所需的技能迈出的重要一步。”此外,Gemini Robotics 2 支持更好的灵活性,因为它现在可以控制更复杂的五指手。这使得机器人能够执行诸如密封密封袋、系垃圾袋或拧开灯泡等任务。
[媒体:https://youtu.be/O9-650iHAls?si=E24B2zu3yzrqg2U2] Google DeepMind 也在更新 Gemini Robotics ER(体现推理),这是一种视觉语言模型,可以帮助机器人分析周围环境、处理指令并执行多步骤任务。
Gemini Robotics ER 2 能够更好地在较长时间内完成任务,并且“现在可以了解任务何时开始和结束”。谷歌 DeepMind 表示,此次更新还允许多个不同类型的机器人协同工作并完成任务,其中一个视频展示了阿波罗 2 号如何指示谷歌的双臂机器人在清洁车库时将工具放入垃圾箱内。
[媒体:https://youtu.be/CiTPDm7PKW0?si=02Sj7JcvZbvoWvXq] 该公司指出 Gemini Robotics ER 2 是其“迄今为止最安全的机器人模型”,因为它可以“更好地检测人类何时在附近,触发安全工具调用,并在有人靠近时让机器人安全停止。”与此同时,谷歌 DeepMind 对其 Gemini Robotics On-Device Model 进行了改进,该模型可以在没有互联网连接的情况下在机器人上本地运行。该模型现在可以更快地适应新的实施例,包括那些具有“截然不同的形状、传感器和自由度”的实施例。