机器人从一次示范中学会新任务
WIRED AI··作者 Will Knight
关键信息
Generalist 表示,它在训练机器人理解物理世界的动力学规律,公司通过工人佩戴带摄像头的特殊夹爪来收集高质量的人类示范数据。文章还提到,这家初创公司从零开始构建模型,并未依赖开源语言模型,而且已经积累了大量训练数据。
资讯摘要
《Wired》走访了 Generalist AI 位于马萨诸塞州剑桥的办公室,看到机器人机械臂在做一些简单家务,比如叠杯子、把积木放进碗里。真正令人震惊的不是它们会做这些动作,而是它们在看过简短教学视频后,似乎能很快学会新的任务。一个例子里,机器人被要求用簸箕和刷子把积木扫进碗里,但当刷子被拿走后,它竟然改用簸箕像刷子一样操作,把积木弹进了碗里。另一次演示中,一台双臂机器人看了一个人拉开手提包拉链并取出纸币的视频,随后成功打开了一个不同款式的包,并把纸币取了出来。更令人惊讶的是,当它右侧夹爪够不到钱时,它切换到左侧夹爪来调整角度,一名工程师还在旁边说,这还是它第一次这么做。
Generalist 联合创始人兼 CEO Pete Florence 将这种能力类比为人们当年对 GPT-3 的兴奋:给模型一个新任务提示,它就有机会直接尝试成功。Florence 说,公司重点是在教机器人理解物理世界,这种能力可能帮助模型把一个场景中学到的东西迁移到另一个场景中,像孩子学习那样进行推理和试探。文章还指出,传统机器人训练通常需要成千上万条样本,而且即使如此,灯光等细微变化也会让机器人表现变差,而 Generalist 则押注于大规模的人类示范、专门的数据采集硬件,以及完全自主构建的模型。Florence、CTO Andrew Barry 和首席科学家 Andy Zeng 都曾在 Google DeepMind 和 Boston Dynamics 工作,文中引用的一位机器人研究者也认为,这个团队在执行上做得非常出色。

资讯正文
我去了一家名为 Generalist AI 的初创公司在马萨诸塞州剑桥的办公室,在那里我看到机器人手臂完成诸如堆叠杯子、把积木放进碗里之类的简单活儿。它们很快就摸清了该怎么做,这让我大为惊讶——那感觉就像有血有肉的人在操作一样。
这些机械臂在接收一段简短的教学视频后,就学会了多种任务,而且最令人印象深刻的是,它们并没有针对某一项任务进行专门训练。其中一个最引人注目的例子是一台机器人被指示用簸箕和刷子把一个积木扫进碗里。当场景中的刷子被拿走后,这台机器人便即兴发挥,直接把簸箕当成刷子来用,把积木弹进了碗里。
另一个例子中,一台双臂机器人观看了一段视频,画面里有人先拉开手包拉链,再取出一些钞票。我看着——多少有些目瞪口呆——这台机器人拉开了另一种不同的手包拉链,并小心地把钞票取了出来。最神奇的是,当它没法抓稳钱时,它把右侧夹爪换成了左侧,以便找到更好的发力角度。“哈,”旁边一位工程师说道,“它以前从没这样做过。”
Generalist 联合创始人兼首席执行官 Pete Florence 对我说:“这正是人们对 GPT-3 特别兴奋的那种事情。”他指的是 OpenAI 于 2020 年发布的突破性大语言模型。“你可以把那个模型拿来,只要给它一个新任务的提示,它就很有可能真的把它做出来。”
Generalist 似乎专注于教机器人理解世界的物理规律,这种思路显然受到人类从很小的时候起就具备的直觉物理感知启发。这很可能有助于模型把在一个场景中学到的东西迁移到另一个场景。事实上,公司的某些演示让我想起儿童在被展示一项任务时会如何即兴发挥和试验。研究人员经常会对机器人最终选择的做法感到惊讶——比如,有一次它面前放着物品时,居然选择拿香蕉把东西扫起来。乍看之下这也许很琐碎,但具身智能在机器中仍然在很大程度上缺失,而婴儿如此高效地学习他们所处世界的方式,或许能为 AI 研究者提供重要启示。
我在一间俯瞰着一群人用手上装有特殊夹爪进行机器人训练的会议室里见到了 Florence 和联合创始人兼 CTO Andrew Barry。公司的另一位联合创始人兼首席科学家是 Andy Zeng。这三位创始人背景都很亮眼:他们此前曾在 Google DeepMind 和 Boston Dynamics 任职,参与过一些最先进的硬件和机器人模型研发。
传统上,要训练一台由 AI 驱动的机器人去完成不同任务,意味着要向模型输入成千上万条样本。不过,这种学习方式向来并不完美;一旦你把光照之类看似简单的因素改掉,机器人就会在任务上表现吃力。
Generalist 和其他一些机器人初创公司正在大举投资一种由人类训练的通用机器人模型。该公司制造了一种特殊手套,外形像带有摄像头的机器人钳爪,人们戴着它来完成各种家务。我看到一个箱子里堆满了数百个这样的抓手,它们将被运往墨西哥和其他地方的工人手中。
Florence 和他的团队对他们究竟使用什么配方来训练机器人守口如瓶,但他们表示,公司已经收集了海量高质量训练数据。与一些追逐更聪明机器人的其他公司不同,他们还完全从零开始构建自己的 AI 模型,而不是依赖开源语言模型。
佐治亚理工学院研究机器人学的 Danfei Xu 熟悉 Generalist 的工作,他表示,在追求更通用机器人模型的公司中,这家初创公司显得格外突出。Xu 说:“他们把这件事推进到了极致,而且执行得非常好。” 除了收集海量高质量数据之外,他还说:“他们是非常优秀的机器人学家,而且做出了很好的科学研究。”
Xu 还表示,Generalist 迄今为止展示的内容表明,他们的目标是把机器人部署到真实的商业环境中。 他说:“他们最接近可部署的东西。”
斯坦福大学研究机器人学、同样了解这家公司的 Karen Liu 说:“Generalist 的数据策略,是在不与某一特定机器人过度绑定的情况下,大规模收集物理交互数据。” “他们最强的结果表明,这个赌注可能正在奏效。”
不过,Generalist 也表示,其模型的学习能力目前还谈不上多可靠。平均而言,机器人只能在约 59% 的情况下完成它被示范过的任务;理想情况下,它的成功率应当高于 99%。此外,这些技能到底能否很好地泛化到所有可以想象的任务或场景,也仍然不清楚。
即便如此,机器人在制造业等场景中快速学习技能的潜力依然巨大。Generalist 的一名工程师似乎就在最近某个深夜偶然发现了这一点。一段记录这一幕的视频显示,这名工程师把几个小杯子堆在一台双臂机器人面前的桌子上,只是想看看机器会怎么做。机器人突然加入进来,用两个抓手抓起并堆叠起其他杯子。等机器人把杯子整齐地堆成一摞后,这名工程师兴奋地朝着不知谁大喊起来,对这番操作欣喜不已。
来源与参考
收录于 2026-08-20