Gemini Robotics 2:谷歌DeepMind为自适应机器人打造的新型大脑

  • Google DeepMind 发布了 Gemini Robotics 2,这是一个用于控制全人形机器人的视觉、语言和动作模型。
  • 它包括三个模型:VLA 用于执行,ER 2 用于推理,On-Device 2 用于本地操作。
  • 它可以执行诸如打结或拧灯泡之类的精确任务,成功率超过 90%。
  • 这些机器人可以相互协作,如果有人靠近,系统会自动停止。

谷歌DeepMind公司的Gemini Robotics 2

谷歌DeepMind公司发布了其最先进的视觉、语言和动作模型——Gemini Robotics 2,标志着机器人技术向前迈出了巨大一步。这一全新的智能层有望将机器人转变为真正适应性强的机器,使其能够理解每一个动作并在真实环境中执行复杂任务。该公司将其定位为一个通用大脑,可以安装在任何类型的机器人硬件上,从工业机械臂到完整的人形机器人。

该系统由三个协同工作的专用模型构成。首先,VLA(视觉、语言和动作)模型将指令转化为物理动作。ER 2 模型作为高级大脑,负责规划任务并与人类沟通。而 On-Device 2 模型则经过优化,可在机器人本地运行,无需依赖互联网连接。这种架构使机器人能够同时思考和行动,从而消除了类似系统中常见的停顿现象。

Google Home 上的 Gemini
相关文章:
Google Home 上的 Gemini:你需要了解的有关其推出和新功能的一切

三种完整的机器人智能模型

Gemini Robotics 2 款模型

视觉、语言和动作(VLA)模型负责直接控制机器人的身体。它首次实现了对从脚趾到手的完整人形机器人的控制,使其能够行走、蹲伏、伸展并灵巧地操作物体。测试表明,该模型在使用机械臂进行插入任务时准确率达到90%,使用五指机械手(22个自由度)拧灯泡时准确率达到92%。

另一方面,Gemini Robotics 的 ER 2 模型则侧重于集成推理。它作为一个智能体,能够观察周围环境,规划多步骤序列,并与 VLA 协同执行这些序列。当需要额外信息时,它可以使用诸如 Google 搜索之类的外部工具,并且能够分析实时视频来监控任务进度。据 Google 称,该模型在估计进度方面达到了 57,4% 的准确率,在识别关键事件方面达到了 91,3% 的准确率,误差小于一秒。

第三款产品 Gemini Robotics On-Device 2 专为离线运行而设计。它只需几个小时即可适应全新的机器人,训练样本不足 200 个。这使其成为对延迟或隐私要求极高的环境(例如工厂或私人住宅中的联网设备)的理想之选。

完全的身体控制能力和前所未有的灵巧性

Gemini Robotics 2 型人形机器人

最引人注目的新功能之一是全身控制。之前的型号只能控制机器人的上半身完成桌面上的任务,而 Gemini Robotics 2 将物理人工智能扩展到了全身运动。现在,机器人可以行走、蹲伏、伸展和操作物体,同时还能规划复杂的动作。在演示中,配备 SharpaWave 机械手的 Apptronik Apollo 2 机器人能够精准地整理货架和打结。

精细动作技能也得到了显著提升。该模型能够控制双指平行抓握完成需要力量的任务,也能控制五指操作完成精细动作。已展示的技能包括封口、打结、拧灯泡和组装小零件。谷歌公布的数据也证实了这些能力:精准插入任务的成功率达到 90%,拧灯泡任务的成功率达到 92%。

芒果和牛油果,Meta 的新型 AI 模型
相关文章:
芒果和牛油果:这是 Meta 的新型 AI 模型

机器人协作与实时推理

多机器人协作

另一项重大创新是能够协调同一工作空间内的多个机器人。Gemini Robotics ER 2 系统使不同类型的机器能够共享对环境的共同理解并分配任务。在一次测试中,Franka F3 Duo 机器人将物体放入盒子,而 Apollo 2 人形机器人则将物体放在架子上。据谷歌称,它们各自都无法单独完成这项任务,但通过协同工作,它们成功完成了任务。

该系统还集成了实时进度跟踪功能。通过持续分析机器人拍摄的视频,模型会将每一帧画面按照五级等级进行分类,从活动开始到结束。如果出现意外问题,机器人可以精确定位故障位置,并在纠正故障后继续执行,而无需重新启动整个工作流程。这相比之前的版本有了显著改进,之前的版本中任何错误都需要从头开始。

开发人员的安全性和可用性

Gemini Robotics 2 的安全

谷歌特别重视新一代机器人的安全性。该模型采用多层防护机制,配备强大的保护框架和名为 ASIMOV-Agentic 的全新评估工具。该工具能够检测机器人是否拒绝危险指令、是否能够识别不确定情况以及是否能在人员靠近时停止运行。演示中,该系统能够在检测到工作区域内有人时自动停止人形机器人的移动,并在区域内人员安全后恢复运行。

Gemini Robotics ER 2 现已通过 Gemini API、Google AI Studio 以及 Gemini 企业代理平台的私有预览版向开发者开放。然而,VLA 和 On-Device 2 型号目前仅供拥有早期访问权限的合作伙伴使用。谷歌预计这项技术将加速机器人在物流、制造和智能家居等领域的应用,在这些领域,多功能性和安全性至关重要。

Gemini Robotics 2 融合了持续推理、环境感知、多步骤规划、机器人协作以及与外部工具的集成等功能,是 DeepMind 迄今为止最先进的研发成果之一。此次发布也标志着谷歌进一步巩固了其在物理人工智能领域的投入,旨在使机器人能够执行人类的任何任务,从装洗碗机到工厂生产,并具备与人类和谐共处所需的流畅性和安全性。

ChatGPT
相关文章:
GPT-5 重组 ChatGPT:关键变化、限制和争论

在 Google 中将其添加为首选来源