Xiaomi-Robotics-1 证明数据比模型更重要
The Decoder··作者 Jonathan Kemper
关键信息
为了避免昂贵的实体机器人遥操作,小米改用带摄像头的手持夹爪,让人直接手持记录操作动作,覆盖厨房、办公室、商店、工厂车间和户外等多种环境。公司称,借助另一款 AI 模型在约两周内完成了全量数据标注;随着训练数据增加,模型在陌生环境中的成功率从约 25% 提升到 75%。
资讯摘要
Xiaomi-Robotics-1 被描述为一款机器人 AI 模型,其扩展规律与大型语言模型相似:训练数据越多,性能越好。它要解决的核心问题是,机器人学习没有像 LLM 那样可直接利用的海量公开文本语料,因为可用于操作任务的动作数据采集既昂贵又缓慢。传统机器人数据采集通常依赖遥操作,也就是由人远程控制实体机器人反复完成任务,这样得到的示范数据往往有限,而且场景重复。小米在采集数据时大多没有使用真正的机器人,而是采用带摄像头的手持夹爪,让人直接手持记录操作行为。这个方法使团队能够在厨房、办公室、商店、工厂车间和户外等多种环境中收集超过 10 万小时的运动数据。
由于如此大规模的数据无法人工逐段标注,小米称其使用另一款 AI 模型为每个动作片段生成文字描述,并在大约两周内完成了全量标注。随后,这些训练结果被迁移到实体机器人上,包括轮式机器人和双臂系统,而这些机器人还必须弥合手持示范设备与真实机械臂之间的差异。小米表示,更大的模型确实有帮助,但更多数据带来的提升更显著,而且当数据集不断扩大时,模型在陌生环境中的成功率从约 25% 提升到了 75%。公司还声称,Xiaomi-Robotics-1 在标准机器人 AI 基准测试中取得了目前最好的结果,并演示了无需人工帮助打包行李箱等任务。

资讯正文
Xiaomi-Robotics-1 表明,在训练机器人运动时,更多数据比更大的模型更有效
小米发布了一款面向机器人的 AI 模型,其遵循与大语言模型相同的扩展规律:随着训练数据增多,性能也会提升。为了构建这套数据集,小米在很大程度上避免使用实体机器人。
机器人 AI 面临着语言模型没有的数据问题:LLM 可以在公共互联网的大量内容上训练,而有关机器人运动的有用数据却很稀缺。机器人通常必须从零开始学习如何抓取、举起以及收纳物体。标准做法是让人远程操控实体机器人完成每一个动作。这个过程既缓慢又昂贵,而且往往会在相同任务、相同环境中产生重复性数据。
小米-Robotics-1 试图弥补的正是这一缺口。该模型旨在在陌生环境中无需预先接触,就能根据口头或书面指令执行操作,并以较少额外训练适应新任务。
手持夹爪取代昂贵机器人
为绕开数据瓶颈,小米在数据采集阶段大多放弃了真实机器人。取而代之的是,团队使用带摄像头的便携式手持夹爪,由人直接拿起并手动操作。这样一来,即使没有机器人在场,也能记录厨房、办公室、商店、工厂车间和户外空间中的操作任务。最终得到了超过 10 万小时的运动录像。
如此庞大的数据集又带来另一个问题,因为每段录制内容都需要配有模型可以学习的描述。逐一人工标注并不现实,因此小米使用了另一款 AI 模型,用文本描述每个动作片段。团队表示,他们大约用两周时间就完成了整个数据集的标注。
随后,小米将这些训练成果迁移到实体机器人上,包括轮式机器人和双臂系统。模型仍然必须处理手持夹爪与机器人机械臂之间的差异。
更多训练数据比模型规模更重要
测试显示,更大的模型确实能提升性能,但更多训练数据带来的增益要远大于增加算力。研究人员表示,机器人 AI 的进展主要将取决于收集更大、更多样化的数据集。
这一发现与研究人员在 3 月初针对视觉数据得出的结论一致。对于语言模型而言,长期以来的规则是:模型规模和数据量应大致同步增长,才能让固定的算力预算得到最佳利用。当模型需要处理图像而不仅仅是文本时,这种平衡会发生变化。在这种情况下,增加数据的帮助远大于扩大模型规模。
同样的模式也出现在实体机器人的测试中。随着小米增加训练数据量,模型在陌生环境中的成功率从约 25% 提高到 75%。研究人员表示,他们还没有达到一个“再增加数据也不会继续提升性能”的拐点。
小米称,Xiaomi-Robotics-1 在标准机器人 AI 基准测试中创下了迄今最佳成绩。在其中一个演示中,一台机器人据称在没有人工帮助的情况下整理好了一个行李箱。这项任务耗时超过十分钟,并且要求机器人在整个房间内移动。
该模型只需少量训练数据就能适应新任务
当一个基础模型能够快速适应新任务时,它才最有用。小米在四项任务上测试了 Xiaomi-Robotics-1,包括为手机装盒、把衣物放进洗衣机、将纸张送入打印机,以及把物品装进箱子。
在每项任务训练数据都不足十小时的情况下,该模型的平均成功率达到了 75%。来自 Physical Intelligence 的一个竞争模型在同样的测试中只取得了 40% 的成绩。小米表示,其模型在处理纸张等柔软、可变形材料,以及需要在房间内四处移动的任务上表现尤其出色。
机器人数据仍然是机器人研究的一大重点,各团队正在探索截然不同的解决方案。World Action Models 在 5 月发布的一项综述回顾了大约 100 项研究,发现遥操作数据虽然精确,但成本高昂,而且只局限于少数场景。小米的手持式夹爪旨在弥补这些局限。
Nvidia、卡内基梅隆大学和 UC Berkeley 借助 ENPIRE 项目,让 AI 编程代理自主教会一支由 8 台机器人组成的队伍如何抓取物体。Nvidia 还希望把机器人领域的数据问题转化为算力问题,通过生成合成训练数据来解决。
中国的 BAAI 研究机构则走的是相反路线。其 Orca 世界模型在没有任何动作标签的情况下,从 125,000 小时视频中学习,并且在五项操作任务上的表现仍能与专门模型 pi0.5 持平。小米是自动化标注并将其规模化应用,而 Orca 则试图彻底消除标签。
Physical Intelligence 在这两种情况下都充当参照点。该公司在 4 月份因 pi0.7 遭到批评,因为它声称模型具备泛化能力,但实际上可能是在回忆相似的训练数据。小米发现,更多数据比更多算力更重要,这使得这个问题更难厘清。
这项工作也契合小米更广泛的计划。该公司在 3 月推出 MiMo-V2 模型时表示,这些智能体最终或可控制机器人。
小米计划在 GitHub 和 Hugging Face 上发布该模型和代码。该团队最近还发布了开源的 Xiaomi-Robotics-0,重点是快速、实时运行。
来源与参考