Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.061 — 2026-09-03
PAPER H 32 约 1 分钟

手势也能成为VLA指令

DeicticVLA把语言和指点统一成机器人指令,“拿这个、放那里”也能听懂。

桌上摆着几个相似的杯子时,与其费劲描述“左边第二个”,人通常会直接一指:“拿这个。”DeicticVLA想把这种交流方式交给机器人:同一个VLA(把视觉、语言和动作连起来的模型)既能接收纯语言,也能理解“语言加指点”,还可以只看指点完成任务。

具体来说,论文用点击机器人视野中的位置来模拟指示手势,再由SAM 2把点击扩展成掩码——一张标出目标物体或落点像素的选区图。系统把三种输入统一整理成文字提示和掩码,交给同一套VLA处理。这样,“这个”“那里”不必完全依靠模型猜测语言所指,而能落实到画面中的具体区域。

最醒目的结果来自真实环境中的未见类别测试:作者报告,语言加指点和纯指点的成功率均为100%,联合训练的纯语言模式只有16.7%。这说明在陌生物体面前,直接指出目标可能比精确描述更稳。不过,论文采用的是屏幕点击,并非直接识别人手指向;100%也只对应作者设置的三项真实机器人任务,不能据此推断它已适用于开放环境。


供稿材料 SOURCES — 1

← 返回 2026-09-03 · 学术板块