机器人伸手插电源时,光知道“插进去”还不够,还得持续看清插孔的位置和距离。问题在于,视觉—语言—动作模型(VLA——把画面、指令直接变成机器人动作)把视觉信息交给 Action DiT——逐步生成连续动作的模块——之后,一些关键线索会变得难以读取。
作者冻结模型内部特征,再用同样的轻量测试头读取深度与物体分区信息。结果显示,从视觉语言模型特征转到 Action DiT 特征后,深度误差由 0.015 升至 0.071,分区 mIoU 由 0.665 降至 0.290;尤其是三维结构几乎难以恢复。
V-Link 的做法,是分别提取空间和语义线索,再通过不同通路注入 Action DiT。作者报告,它在三个模拟基准上较 GR00T N1.6 平均成功率提升 1.9% 至 31.2%,两个真实人形机器人任务提升 20% 和 24%,额外推理延迟为 1.58 毫秒。这些效果目前来自论文作者自述。