Xiaomi-Robotics-1 证明数据比更大模型更重要
The Decoder··作者 Jonathan Kemper
关键信息
小米表示,它在厨房、办公室、商店、工厂车间和室外环境中采集了超过 100,000 小时的动作数据,并用另一个 AI 模型在约两周内自动完成了标注。在测试中,随着数据量增加,模型在陌生环境中的成功率从约 25% 提升到 75%;在每个任务少于 10 小时的任务数据下,它在四项适应任务上的平均成功率达到 75%,优于 Physical Intelligence 的 40%。
资讯摘要
Xiaomi-Robotics-1 是小米针对机器人 AI 数据瓶颈推出的一次尝试,因为与语言模型不同,机器人无法像 LLM 那样直接从海量互联网文本中学习。该模型的目标是在陌生环境中理解口头或书面指令,并且能够以较少额外训练快速适应新任务。为了解决数据不足问题,小米在数据采集上尽量避开真实机器人,而是使用带摄像头的手持夹爪,由人手持操作来记录动作。这样一来,团队就能在厨房、办公室、商店、工厂车间和室外环境中采集操作行为,总计超过 100,000 小时的动作记录。由于手工标注如此庞大的数据集并不现实,小米又用另一套 AI 系统为每个动作片段自动生成文本描述,并称整套数据集大约两周就完成了标注。随后,这些训练被迁移到真实机器人上,包括轮式机器人和双臂系统,尽管手持夹爪与真实机械臂之间存在形态差异。
小米表示,更大的模型确实更强,但增加数据带来的收益远大于增加算力或扩大模型规模。公司称,在陌生环境中的成功率随着数据增加从约 25% 提升到 75%,而且目前还没有出现“继续加数据不再有效”的拐点。小米还表示,Xiaomi-Robotics-1 在标准机器人 AI 基准测试中取得了目前最好的结果,并演示了一台机器人在没有人类帮助的情况下花十多分钟独立收拾行李箱。对于任务迁移,小米测试了四项任务,包括包装手机、把衣物放进洗衣机、把纸张送入打印机,以及把物品装进盒子。每个任务只用不到 10 小时的训练数据时,模型平均成功率达到 75%,而 Physical Intelligence 的对比模型为 40%;小米还称,这套模型在纸张等柔性材料,以及需要在房间内移动的任务上表现尤其突出。

资讯正文
Xiaomi-Robotics-1 表明,在训练机器人运动时,更多数据比更大的模型更有效
小米发布了一款面向机器人的 AI 模型,其遵循与大语言模型相同的扩展规律:随着训练数据增多,性能也会提升。为了构建这套数据集,小米在很大程度上避免使用实体机器人。
机器人 AI 面临着语言模型没有的数据问题:LLM 可以在公共互联网的大量内容上训练,而有关机器人运动的有用数据却很稀缺。机器人通常必须从零开始学习如何抓取、举起以及收纳物体。标准做法是让人远程操控实体机器人完成每一个动作。这个过程既缓慢又昂贵,而且往往会在相同任务、相同环境中产生重复性数据。
小米-Robotics-1 试图弥补的正是这一缺口。该模型旨在在陌生环境中无需预先接触,就能根据口头或书面指令执行操作,并以较少额外训练适应新任务。
手持夹爪取代昂贵机器人
为绕开数据瓶颈,小米在数据采集阶段大多放弃了真实机器人。取而代之的是,团队使用带摄像头的便携式手持夹爪,由人直接拿起并手动操作。这样一来,即使没有机器人在场,也能记录厨房、办公室、商店、工厂车间和户外空间中的操作任务。最终得到了超过 10 万小时的运动录像。
如此庞大的数据集又带来另一个问题,因为每段录制内容都需要配有模型可以学习的描述。逐一人工标注并不现实,因此小米使用了另一款 AI 模型,用文本描述每个动作片段。团队表示,他们大约用两周时间就完成了整个数据集的标注。
随后,小米将这些训练成果迁移到实体机器人上,包括轮式机器人和双臂系统。模型仍然必须处理手持夹爪与机器人机械臂之间的差异。
更多训练数据比模型规模更重要
测试显示,更大的模型确实能提升性能,但更多训练数据带来的增益要远大于增加算力。研究人员表示,机器人 AI 的进展主要将取决于收集更大、更多样化的数据集。
这一发现与研究人员在 3 月初针对视觉数据得出的结论一致。对于语言模型而言,长期以来的规则是:模型规模和数据量应大致同步增长,才能让固定的算力预算得到最佳利用。当模型需要处理图像而不仅仅是文本时,这种平衡会发生变化。在这种情况下,增加数据的帮助远大于扩大模型规模。
同样的模式也出现在实体机器人的测试中。随着小米增加训练数据量,模型在陌生环境中的成功率从约 25% 提高到 75%。研究人员表示,他们还没有达到一个“再增加数据也不会继续提升性能”的拐点。
小米称,Xiaomi-Robotics-1 在标准机器人 AI 基准测试中创下了迄今最佳成绩。在其中一个演示中,一台机器人据称在没有人工帮助的情况下整理好了一个行李箱。这项任务耗时超过十分钟,并且要求机器人在整个房间内移动。
该模型只需少量训练数据就能适应新任务
当一个基础模型能够快速适应新任务时,它才最有用。小米在四项任务上测试了 Xiaomi-Robotics-1,包括为手机装盒、把衣物放进洗衣机、将纸张送入打印机,以及把物品装进箱子。
在每项任务训练数据都不足十小时的情况下,该模型的平均成功率达到了 75%。来自 Physical Intelligence 的一个竞争模型在同样的测试中只取得了 40% 的成绩。小米表示,其模型在处理纸张等柔软、可变形材料,以及需要在房间内四处移动的任务上表现尤其出色。
机器人数据仍然是机器人研究的一大重点,各团队正在探索截然不同的解决方案。World Action Models 在 5 月发布的一项综述回顾了大约 100 项研究,发现遥操作数据虽然精确,但成本高昂,而且只局限于少数场景。小米的手持式夹爪旨在弥补这些局限。
Nvidia、卡内基梅隆大学和 UC Berkeley 借助 ENPIRE 项目,让 AI 编程代理自主教会一支由 8 台机器人组成的队伍如何抓取物体。Nvidia 还希望把机器人领域的数据问题转化为算力问题,通过生成合成训练数据来解决。
中国的 BAAI 研究机构则走的是相反路线。其 Orca 世界模型在没有任何动作标签的情况下,从 125,000 小时视频中学习,并且在五项操作任务上的表现仍能与专门模型 pi0.5 持平。小米是自动化标注并将其规模化应用,而 Orca 则试图彻底消除标签。
Physical Intelligence 在这两种情况下都充当参照点。该公司在 4 月份因 pi0.7 遭到批评,因为它声称模型具备泛化能力,但实际上可能是在回忆相似的训练数据。小米发现,更多数据比更多算力更重要,这使得这个问题更难厘清。
这项工作也契合小米更广泛的计划。该公司在 3 月推出 MiMo-V2 模型时表示,这些智能体最终或可控制机器人。
小米计划在 GitHub 和 Hugging Face 上发布该模型和代码。该团队最近还发布了开源的 Xiaomi-Robotics-0,重点是快速、实时运行。
来源与参考
收录于 2026-07-22