Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.057 — 2026-08-30
PAPER H 3 约 1 分钟

VLA找回动作生成中丢失的视觉

V-Link为动作模块补回语义与空间线索,让机器人边行动边“看清”环境。

机器人伸手插电源时,光知道“插进去”还不够,还得持续看清插孔的位置和距离。问题在于,视觉—语言—动作模型(VLA——把画面、指令直接变成机器人动作)把视觉信息交给 Action DiT——逐步生成连续动作的模块——之后,一些关键线索会变得难以读取。

作者冻结模型内部特征,再用同样的轻量测试头读取深度与物体分区信息。结果显示,从视觉语言模型特征转到 Action DiT 特征后,深度误差由 0.015 升至 0.071,分区 mIoU 由 0.665 降至 0.290;尤其是三维结构几乎难以恢复。

V-Link 的做法,是分别提取空间和语义线索,再通过不同通路注入 Action DiT。作者报告,它在三个模拟基准上较 GR00T N1.6 平均成功率提升 1.9% 至 31.2%,两个真实人形机器人任务提升 20% 和 24%,额外推理延迟为 1.58 毫秒。这些效果目前来自论文作者自述。


供稿材料 SOURCES — 1

← 返回 2026-08-30 · 学术板块