让机器人去陌生房间取一件东西,难点不只是“看见”物体。它还要听懂指令,避开障碍,并在摩擦、遮挡和控制误差中把动作做完。过去常见的做法,是为具体任务单独训练控制器。小米新发布的机器人基础模型 Xiaomi-Robotics-1(XR-1),则想先从大量真实操作记录里学会通用本领,再适配新任务。
不过,目前公开给编辑部的直接材料只有一篇 Reddit 帖文。以下训练规模、模型设计和效果判断均来自该帖对小米论文及项目页面的转述,尚不能视为独立验证。
十万小时,机器人学的是“实践示范”
据该帖介绍,XR-1 使用超过 100K hours 的真实世界操作轨迹训练。操作轨迹,是机器人完成任务时连续记录下来的画面、指令和动作,类似一份带答案的实践示范。真实轨迹的价值在于,它会包含摩擦、遮挡和控制误差等现实条件,而不只是理想环境里的动作。
XR-1 属于 VLA(Vision-Language-Action,视觉—语言—动作)模型:它把“看见环境、理解文字指令、决定机器人怎么动”放进同一个学习框架。项目面向两个目标:让机器人在未知环境中直接执行移动操作,以及用较少适配工作学习新任务。
把大模型的训练节奏搬到机器人上
XR-1 采用两阶段训练。预训练先从大规模数据中获得广泛能力,后训练再用更有针对性的示范或反馈校准行为。这套“先学得广,再调得准”的路径来自大语言模型,如今被用于机器人策略。
模型内部以 Qwen3-VL 作为预训练视觉语言模型,也就是负责理解图像和文字的部分;再接入 Diffusion-Transformer(DiT),用于生成动作。两者通过 Mixture-of-Transformers(MoT)结合。帖文称,DiT 与视觉语言模型拥有相同层数,但采用更小的 hidden size——每层内部处理信息的宽度——以加快推理。
真正值得看的,是规模能否换来部署能力
机器人基础模型的赌注很直接:如果跨任务数据足够多,模型或许不必为每项工作从头训练。帖文进一步转述称,XR-1 在预训练阶段呈现的 scaling behavior——随着训练规模扩大而改善的趋势——能在后训练后稳定转化为真实机器人性能,并且尚未出现饱和迹象。
如果这一判断经得起完整实验和外部复现,意义不只在“十万小时”这个数字,而在于通用训练是否真的能变成陌生环境里的可靠动作。那会是机器人基础模型从展示能力走向实际部署的重要信号。
局限与未知
- “超过十万小时”没有披露机器人数量、任务构成、采集周期、去重方式和轨迹质量,不能直接等同于十万小时高质量或完全独有的数据。
- 材料没有提供基准成绩、对照模型、统计误差、推理速度或真实部署成功率。“开箱即用”“高效适配”和“尚未饱和”仍是项目方的结论性表述。
- 帖文提供了 Hugging Face、GitHub 和论文链接,但现有材料不足以确认已发布的是论文、权重、代码,还是完整可复现的训练方案。