Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.027 — 2026-07-31
PAPER HF 32 约 1 分钟

具身数据也需要一座金字塔

把真实操作、仿真与人类视频分层看,机器人数据扩量的取舍更清楚了。

教机器人学会拿杯子,不能只给它看杯子的照片。它还得知道手臂在哪里、做了什么动作,以及杯子随后怎样移动。问题在于,这种真实机器人记录最贴近实际,却也最费设备、人力和环境复位。论文提出 Data Pyramid,用一座五层“数据金字塔”梳理具身基础模型——先用大量、多样数据训练,再适配不同机器人和任务的通用模型——该从哪里获得训练材料。

金字塔顶端是真实机器人数据:动作能直接对应执行平台,但难以扩量。往下依次是 UMI-style 数据(Universal Manipulation Interface,即不用机器人参与采集、仍记录末端工具运动的示范)、人类第一与第三人称操作视频、仿真数据,以及通用图文数据。越靠下,通常越容易大量获取;越靠上,则越贴近机器人真实执行。这个次序并非简单的优劣榜,作者还用质量、多样性、可复用性和物理真实性四个维度补充比较。

这项工作的价值,不是宣称某一层能取代其他层,而是把“数据够不够多”与“数据能不能教会机器人行动”放进同一框架。论文也指出,目前仍缺少触觉、失败与恢复过程等记录,怎样搭配各层数据,仍是尚未解决的问题。


供稿材料 SOURCES — 1
01
Data Pyramid for Embodied Manipulation arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-07-31 · 学术板块