Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.035 — 2026-08-08
PAPER HF 14 约 1 分钟

手腕相机不该只是第二个主视角

World-to-Wrist让机器人提前感知夹爪附近的变化,而非把腕部画面当作第二个主视角。

把插头送进插孔时,远处的相机能看清目标在哪,却未必看得清夹爪旁那一点微小的对齐偏差。World-to-Wrist抓住的正是这处短板:VLA——把视觉、语言指令直接转换成机器人动作的模型——不该把主相机和腕部相机当成两路同等用途的画面。前者负责全局任务,后者更贴近夹爪与接触点。

它没有费力生成未来视频,而是预测未来腕部画面的潜在表示——压缩后的内部数字特征。模型结合当前多视角画面、指令与腕部历史,先判断任务进度、物理变化线索和腕部证据,再推测接触区域接下来会怎样变化,并据此生成动作。训练时使用的结构化推理标注,运行时无需逐句生成;作者称动作生成速度超过 80 Hz。

论文在 LIBERO、RoboTwin 2.0 和三项真实机器人任务上报告了提升,但现有原文片段未完整给出成功率数字。更值得记住的是它对多视角的重新分工:腕部相机不是第二个主视角,而是一条专门观察接触过程的近景通道。


供稿材料 SOURCES — 1

← 返回 2026-08-08 · 学术板块