Google DeepMind发布Gemini Robotics 2

WIRED AI··作者 Will Knight

关键信息

Google表示,该模型通过人类远程操控、视频示例和仿真进行训练,这说明今天的机器人仍然需要针对具体任务的训练。公司还推出了ASIMOV-Agentic安全基准,用于检测机器人指令是否可能导致有害或不确定的结果。

资讯摘要

Google DeepMind发布了Gemini Robotics 2,这是一套把多个AI模型整合在一起的机器人控制系统。该系统包含一个视觉语言模型,用来理解图像、视频和人类指令;还包含两个视觉语言动作模型,把这种理解转化为实际运动。公司表示,这让机器人既能推理任务,也能在物理世界中执行动作。发布前公开的视频演示中,Google展示了多台机器人使用这套组合模型自主完成复杂任务。

一个例子里,Apptronik的Apollo 2机器人使用Sharpa提供的手部组件来整理货架。该模型的训练依赖人类远程操控、视频数据和仿真,这说明目前的系统仍然需要经过精心准备的示例,而不是开放式、通用的自主能力。Google把这次发布描述为迈向所谓“physical AGI”的又一步,也就是让机器人能够像人类一样完成各种事情。与此同时,公司强调了安全问题,指出前沿AI控制机器人可能出现意外甚至危险行为,因此正在加入多层防护机制,并推出新的ASIMOV-Agentic基准来衡量有风险或不确定的结果。

Google DeepMind发布Gemini Robotics 2

资讯正文

Gemini Robotics 2 将多种不同的 AI 模型整合进一个单一系统。综合起来,它们让机器人能够理解周围环境,以及在其中该如何行动。一个视觉语言模型(VLM)可以理解图像和视频,能够与人类交流,并推理如何执行不同任务。两个视觉语言行动(VLA)模型则经过训练,理解如何在物理空间中移动,分别控制机器人的全身动作以及夹爪或手部的动作。

在发布前分享的视频演示中,这家公司展示了几种不同的机器人使用这一整合模型自主执行复杂任务。在其中一个演示里,Apptronik 的 Apollo 2 机器人使用一家名为 Sharpa 公司的手部装置整理货架。Google DeepMind 通过人类远程操作、视频示例和模拟的组合来训练该模型完成这些任务——目前,AI 模型在没有特定训练的情况下,仍然不可能执行范围广泛的复杂任务。

尽管 Anthropic 和 OpenAI 已在聊天机器人和 AI 编码工具方面取得领先,Google 在机器人研究方面有着更强的积累,并且已经发表了许多关于如何利用 AI 训练机器人做有用事情的重要研究。这次发布进一步表明,这家搜索巨头押注 AI 需要摆脱纯数字领域,才能释放其全部潜力。(它此前还曾与足式机器人领域的领先者 Boston Dynamics 合作,为那些机器提供“大脑”。)

Google DeepMind 机器人负责人 Carolina Parada 告诉 WIRED:“这又是我们迈向真正实现我们所说的 physical AGI 的一个里程碑,也就是说,我们让机器人能像人类一样做任何事情。”

不过,让前沿 AI 模型接触机器人,使其能在工作场所或家庭中四处活动并操纵物体,也伴随着风险。先前研究表明,用前沿 AI 控制机器人可能会产生意料之外、甚至有时危险的行为。而这些模型能在数字领域采取突然或不受欢迎行动的想法,最近也已经显现出来:OpenAI 开发的一款尚未发布的 AI 代理曾入侵了多个系统。

Parada 说:“安全问题甚至更紧迫,因为你把它们放进了很多其他情境中。会出现很多不确定性,所以你需要更深入地理解安全问题。”

Parada 表示,Google 采取多层次的安全方法,在每一层模型上都应用了防护措施。它还推出了 ASIMOV-Agentic,这是一个新的基准,用于衡量多种 AI 系统协同控制机器人时的安全性。该基准可以检测一条指令是否会导致有害或不确定的结果。

公司 CEO Demis Hassabis 此前告诉 WIRED,他希望开发一种适用于多种不同机器人的 AI 操作系统,类似于智能手机上的 Android 操作系统。

来源与参考

  1. 原始链接
  2. Google’s Gemini Can Now Stomp Around as a Humanoid Robot

收录于 2026-07-31