Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.028 — 2026-08-01
PAPER HF 141 约 7 分钟

HiFi-UMI:不用真机数据也能部署

HiFi-UMI用便携设备采集高保真示范,后训练不碰真机,也能把操作策略直接部署到机器人。

你想教机器人把零件插进一个很小的孔里。常见办法是让人实时驾驶真机器人,一遍遍示范。数据很准,但机器人、场地和操作员全被占着,规模一大,成本就迅速上升。

HiFi-UMI想换一条路:先让人拿着便携装置完成动作,不必现场控制完整机器人;再用这些示范训练操作策略——也就是把视觉和传感信息转换成下一步动作的“驾驶方法”。论文声称,只要这类数据足够精确,后训练阶段可以完全不加入真机遥操作数据,策略仍能直接部署到真实机器人。

这里需要先把标题说准。“不用真机数据也能部署”指的是 zero-robot post-training,即后训练只用HiFi-UMI示范。论文没有说明三个基础模型此前的预训练是否接触过真机数据,因此不能理解为整套模型从头到尾都没用过任何真机数据。本文的效果数字也都来自论文作者自己的实验,尚无独立信源交叉验证。

问题不只是数据少,而是数据不够可信

UMI(Universal Manipulation Interface)是一类手持式采集装置。人拿着它抓取、摆放物体,装置同时记录相机画面和夹爪运动。它不占用机器人,适合在不同场景大量收集示范。

但便携不等于可直接使用。手移动时,系统要准确知道夹爪在哪里;双手协作时,还要知道两只夹爪彼此的距离和方向;相机、惯性传感器与夹爪状态也必须在同一时刻对齐。任何一环有偏差,记录下来的“正确动作”都可能变成机器人无法照做的指令。

因此,现有做法通常把UMI数据用于预训练,让模型先广泛学习操作经验;到训练后期,再加入少量“真机锚定数据”,校准便携装置记录的动作与机器人真正能执行的动作之间的差距。HiFi-UMI的核心问题是:与其不断压缩这部分真机数据,能不能把无机器人数据本身做得足够好,直接移除这块锚?

它把采集装置做成了一套数据生产线

HiFi-UMI不是单独更换某个模型,而是同时改造采集硬件和数据处理流程。

它使用头戴式、离线运行的stereo-inertial SLAM。SLAM可以理解为让设备一边观察环境,一边估算自己走过的轨迹;“stereo-inertial”表示它结合双目相机和惯性信息。离线处理则允许系统在录制结束后同时参考前后画面,不必只凭当下有限的信息立刻下判断。

两只手上的标记都由头部相机观察,因此双夹爪的相对位姿——两者之间的位置和朝向关系——可以直接测量,不必事后从两路相机画面里拼出来。这对双手配合尤其重要,例如一只手固定物体,另一只手完成插入。

时间对齐方面,所有传感器共享一个GPIO硬件触发信号,将同步做到微秒级。它相当于让相机、惯性传感器和夹爪编码器听同一声发令枪,减少“画面已经发生、动作标签还停在上一刻”的错位。

每只手还装有两台非平行的广角相机,合计提供约200°视野,以减少夹爪或物体遮挡造成的盲区。系统不依赖外部定位基础设施;论文报告称,它在工作空间局部可达到3毫米的末端执行器精度。末端执行器就是机器人真正接触物体的手或夹爪。

采集之后,每条轨迹还要经过重建、自动清理、仿真重定向和回放验证。所谓重定向,就是把人的手持轨迹转换成目标机器人能够执行的动作。系统也会生成任务描述和动作分段,再由人工重点复核低置信度或被自动检查标记的样本。思路很直接:不把所有压力留给模型,而是先确保送进训练的数据在位置、时间和可执行性上都站得住。

真能替代后训练里的真机示范吗?

论文把任务特定的HiFi-UMI示范与评测机器人上的真机遥操作示范作比较,并保持模型骨干、训练方案和部署系统不变。遥操作指人通过控制器实时驾驶机器人,它的数据与真机高度一致,但每小时都占用机器人和人员。

作者在三种不同的模型骨干上进行测试。它们包括VLA和WAM两类:VLA(vision-language-action)根据当前视觉、语言指令直接产生动作;WAM(world-action model)还会预测未来状态,再据此生成动作。

相对域内真机遥操作基线,只用HiFi-UMI示范后训练的成功率差分别为:StarVLA-QwenPI低2.5个百分点,OpenPI-pi_0.5高3.1个百分点,LingBot-VA低0.6个百分点。结果有正有负。作者将其概括为“匹配”真机遥操作,并称差距处于实验协议的采样噪声内;不过材料没有给出完整的方差、置信区间或显著性检验,因此更稳妥的表述是:三组结果处在接近的水平,尚不能判断小幅差异是否具有统计意义。

这项比较还有一个对真机基线有利的设置:遥操作数据直接采自评测场景,而HiFi-UMI轨迹没有一条来自该场景。即便如此,表现最强的策略在精密插入任务上达到85%成功率。这个数字说明路线值得继续验证,但论文摘要未提供测量协议和重复次数,不能把85%理解成跨场景的稳定保证。

规模带来的不只是“见得多”

同一语料库也被用于预训练。作者报告,使用4,000小时HiFi-UMI数据后,模型在十个未见任务上的动作误差降低41%。在StarVLA-QwenPI上,这一步还让真实机器人成功率进一步提高18.1个百分点。

论文观察到,迁移效果更取决于预训练数据是否覆盖相似的物理交互,而不只是是否见过同一种物体。换句话说,模型学到“如何插入、如何接触、如何双手配合”,可能比单纯认识某件物品更有用。作者还称,预训练后的模型用四分之一任务数据,就能追平从头初始化的基线。

团队同时宣布开源HiFi-UMI-2K:2,000小时经过微秒级同步、具备超宽视野的示范,每条示范都通过仿真回放自动重建和验证。需要注意,实验使用的预训练语料为4,000小时,宣布开源的是其中2,000小时,二者不能混为一谈;“宣布开源”也不等于本文已经独立核实所有数据和代码均可下载。

为什么值得关注

这项工作的看点不是再次证明“更多数据有用”,而是把机器人学习的数据瓶颈重新定义为精度问题。过去的默认前提是:便携装置负责便宜地收集广泛经验,真机数据负责最后校准。HiFi-UMI提出,若轨迹、双手关系、时间同步和视野都足够可靠,这种分工本身或许可以改变。

如果后续研究能够复现结果,机器人不必为了每项新技能都先接受一轮昂贵遥操作。采集者可以先在普通环境中生产示范,再把策略部署到目标机器人上。这不会消除真机评测,但可能减少训练阶段对机器人本体、专用场地和操作人员的占用。

局限与未知

  • 论文没有对数据精度做受控降级实验,因此尚不能分清表现来自更高保真、更多样本、更广场景覆盖,还是几者共同作用。
  • 3毫米精度、85%成功率、41%误差下降和18.1个百分点提升均缺少材料层面的完整测量协议、重复次数与统计细节,且目前只有作者单一信源。
  • “zero-robot”仅适用于后训练。三个基础模型此前是否使用过真机数据,现有材料没有交代。

供稿材料 SOURCES — 1

← 返回 2026-08-01 · 学术板块