World Labs 打造现实到仿真机器人训练引擎
The Decoder··作者 Jonathan Kemper
关键信息
World Labs 表示,该引擎会把机器人、传感器、环境和任务示范重建为可交互的虚拟世界,并改变光照、物体位置、物体数量、摩擦力和摄像机角度。该公司还称,这套仿真可用于把模型排序结果与真实硬件进行对比,测试对象包括 ALOHA,以及 GR00T N1.6 和 π₀.₅ 等多个模型家族。
资讯摘要
由李飞飞创办的 World Labs 发布了一套新的仿真引擎,目标是在完全虚拟的环境中训练机器人控制系统,再把模型迁移到真实机器人上。公司把这套方法称为现实到仿真到现实(R2S2R),并表示相关技术来自其在 7 月收购的 SceniX。World Labs 认为,机器人部署的主要瓶颈不是模型结构,而是机器人要获得足够多的经验才能稳定工作。真实世界的机器人数据成本高、难以控制,而且覆盖不了所有物体、物理条件和失败状态;而网络视频也无法系统性覆盖这些情况。该系统会记录真实任务中的机器人、传感器、环境和任务示范,然后把它们重建成一个既像原场景、又能在物理上保持一致的交互式虚拟世界。World Labs 表示,系统可以从一个真实任务生成成千上万种受控变化,例如改变光照、物体位置和数量、周围环境、摩擦系数以及摄像机角度。为了验证精度,公司会让同一动作序列在仿真和现实中并排执行,再比较观测结果、物体运动和最终结果。
展示的例子包括刚体、可移动物体和柔性物体任务,例如电缆布线、把弹性线缆末端插入孔中,以及双手装箱。World Labs 还称,训练好的控制模型只在仿真中训练,但可以成功迁移到真实机器人,包括斯坦福开源的双臂平台 ALOHA。公司表示,这些模型在另外四个机器人平台上都能连续运行一小时且无需人工干预,任务包括用双手把电源线缠绕在冰箱上、精确调整试管位置,以及从一堆杂乱物体中分离出记号笔或铅笔等细长物体。World Labs 进一步指出,仿真不仅能用于训练,也能用于策略评估,因为开发者真正关心的是模型在哪里失败、哪个版本更好,以及改进是否能转移到真实机器人上。公司举例称,在 ALOHA 的双手传递立方体测试中,仿真不仅复现了勉强抓住立方体边缘的边界案例,也复现了失败尝试;而在 GR00T N1.6、π₀.₅ 等不同模型和不同训练阶段上,仿真与现实中的模型排序大体一致。World Labs 认为,这种可复用的重建世界可以帮助团队先在仿真中筛掉较弱版本,把昂贵的硬件测试留给最有希望的候选模型。

资讯正文
World Labs 将一个真实世界的机器人任务转化为数千种模拟变体用于训练
由 AI 先驱李飞飞创立的初创公司 World Labs 发布了一款仿真引擎,能够在完全虚拟的环境中训练机器人控制系统。随后,这些模型可以在真实硬件上稳定运行数小时。
该公司的“Real-to-Sim-to-Real”(R2S2R)引擎会把真实世界中的机器人任务转化为用于训练和评估控制模型的模拟场景,从而省去在实际硬件上进行昂贵测试的环节。这项技术来自 SceniX——World Labs 在 7 月收购的一家初创公司。
World Labs 表示,机器人部署的主要瓶颈并不是模型架构,而是机器人为了可靠运行所需的庞大经验量。真实世界数据成本高且难以控制,即便是在线视频,也无法系统性覆盖各种物体、物理条件以及故障状态的全部范围。
一个真实世界任务变成数千种受控变体
该引擎会捕捉机器人、传感器、环境以及任务演示,然后把它们重建为一个交互式虚拟世界;这个世界不仅外观与原始场景相似,在物理行为上也与之相同。World Labs 通过将生成式世界模型与面向任务的机器人仿真相结合,实现了这一点。
从单个真实世界任务出发,系统通过改变光照、物体位置和数量、周围环境、摩擦力等物理属性以及相机角度,生成数千种变体。为了检验准确性,World Labs 会将同一动作序列在仿真和现实中并排运行,并比较观测结果、物体运动和最终结果。
展示的示例包括刚性物体、可移动物体和可变形物体,例如线缆布线、将弹性线缆末端插入孔中,以及用双手打包一个盒子。
从未在真实硬件上训练过的控制模型
控制模型先在仿真中训练,然后迁移到真实机器人上。其中一个测试平台是 ALOHA,这是一种由斯坦福大学推出的开源双臂设计,通过两只更小的控制臂进行遥操作。该系统的成本只是商用系统的一小部分,而且所有蓝图都公开,因此 ALOHA 已成为机器人研究中的首选参考平台。
据 World Labs 介绍,这些模型分别在另外四个机器人平台上连续运行了一小时,期间没有任何人工干预。任务范围从用双手把电源线缠绕在冰箱上,到精确重新摆放试管,再到从一堆密集杂乱的物体中分离出记号笔或铅笔等细长物体。
公司表示,该系统并不绑定某一种特定的控制模型或机器人类型,因此,一旦某个世界被重建一次,之后就可以被重复用于新的模型和不同的机器人。
仿真可以在策略评估中替代硬件
World Labs 认为,机器人开发之所以远远落后于语言模型,是因为评估控制模型过去主要依赖真实硬件测试。一个足够好的仿真并不需要达到与现实完全相同的成功率。关键在于它是否能回答同样的问题:模型在哪里失败、哪个版本更好,以及这些改进能否迁移到物理机器人上。
团队在 ALOHA 机器人的双臂之间进行了一次双手传递立方体的实验来测试这一点。据 World Labs 介绍,仿真复现了机器人勉强用边缘抓住立方体的临界情况,以及相应的失败尝试。在不同模型类型中,包括 GR00T N1.6 和 π₀.₅,以及不同训练阶段,模型在仿真和现实中的排名基本保持一致。对于已知的立方体位置和此前未见过的位置,这一点都成立。每个检查点都通过 2,000 次仿真运行和 100 次真实运行进行了评估。
开发团队可以在仿真中筛掉较弱的模型版本,把昂贵的硬件测试留给最有希望的候选者。
仿真器处于 World Labs 更广泛战略的核心
World Labs 将这些结果与其世界模型分类体系联系起来。在这一框架下,仿真器是核心部分,因为它把世界变成了软件代理可以行动、学习和接受测试的场所。公司还将其与自动驾驶相类比,某些成功的 L3 和 L4 系统会在真实数据和仿真数据的混合上进行训练。
World Labs 对其长期目标的表述是:要提升机器人的智能,就必须扩展它们学习的世界。与此同时,这些结果能在多大程度上迁移到更复杂的环境、其他类型的机器人,以及不那么受控的日常场景,仍然是一个悬而未决的问题。
World Labs 由 AI 研究员李飞飞于 2024 年创立,旨在构建具有空间智能、能够理解三维物理世界的模型。早期系统可以根据单张照片生成可行走的 3D 环境。最近,该公司筹集了 10 亿美元风险投资,以将其世界模型扩展到机器人和科学领域。R2S2R 引擎是这一愿景在机器人领域的第一个具体应用。
这项研究也进一步推动了关于世界模型在机器人学中应扮演何种角色的更广泛讨论。一个国际研究团队最近试图厘清世界模型究竟是什么,给出统一定义,并在世界模型与纯视频生成器之间划出明确界线。
相关领域还有 World Action Models,它把对近未来的预测直接与控制指令联系起来。这与 World Labs 的方法不同,后者将仿真和策略保持分离。另一种名为 Orca 的方法来自中国,它让机器人仅通过观看视频来学习任务,在训练期间不需要任何真实运动数据。
AI News Without the Hype – 由人类精选
订阅 THE DECODER,可获得无广告阅读、每周 AI 新闻简报、我们每年 6 次发布的独家“AI Radar”前沿报告、完整档案访问权限以及评论区访问权限。
来源与参考