Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.054 — 2026-08-27
PAPER 约 1 分钟

传送带抓取开始预判接触时刻

ForeTime-VLA让机器人只看过去八帧,也能提前为传送带上的接触时刻做准备。

抓传送带上的物体,难点不只是“看见它”,还要赶在它移动前预判何时接触、夹爪该以什么姿态落下。等画面变化后再反应,往往已经晚了。ForeTime-VLA瞄准的正是这段时间差:让机器人从当下和过去的画面里,推测接下来与抓取有关的变化。

它先让世界动作模型——能预演动作如何改变环境的模型——读取当前及未来画面,并把未来线索压缩成64维代码;再通过知识蒸馏,把这套“预判经验”教给控制策略。实际运行时,策略只看此前八帧,不读取真实未来,也不用生成整段未来视频,因此仍符合因果性。模型还预测抓取所处阶段,以及距离下一次夹爪状态变化还有多久,相当于同时判断“现在做到哪一步”和“还剩多少时间”。

作者报告,在三档传送带速度下,ForeTime-VLA完成44次抓取(共90次),对照模型为23次;最快档分别为11/30和2/30。代价是推理延迟增加2.46%至2.93%。这些结果来自论文自己的数据与真机实验,核心看点不是让机器人“看见未来”,而是把训练时获得的未来知识压进一个部署时可用的轻量预判器。


供稿材料 SOURCES — 1

← 返回 2026-08-27 · 学术板块