Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.016 — 2026-07-20
PAPER 约 1 分钟

接触发生后,VLA开始听力觉

LIFT给视觉主导的VLA补上力觉,让机器人接触物体后还能及时纠偏。

把书插进书架时,光看画面不一定知道它是卡住了,还是已经对准。机器人也一样:视觉可能被遮挡,细小的受力变化更难看出来。LIFT给已有的视觉-语言-动作模型(VLA——把画面和文字指令直接变成动作的模型)补上一条力觉反馈通道,让它在接触发生后及时修正动作,而不是把原定动作一路执行到底。

关键设计是把“慢看”和“快调”分开。系统先缓存较慢的视觉和语言信息,再反复读取机械臂末端最近的六维力与力矩,逐个刷新动作。新加入的反应式动作模块复制原模型参数,力觉通道则从零输出开始训练,尽量避免一上来破坏原有能力。训练时,LIFT还让机器人实际执行,并用人工纠正它偏离示范后遇到的状态。

作者在毛巾折叠、书本插入和汉诺塔圆环放置三项真实任务中报告,LIFT比只用视觉的后训练学得更快、最终表现更高;在线纠正也在三项任务中都优于纯离线适配。


供稿材料 SOURCES — 1

← 返回 2026-07-20 · 学术板块