机器人把手伸向杯子时,可以一口气规划多走几步;真正对准、抓取和放下时,却得步步小心。现有 VLA(把画面和语言指令直接变成机器人动作的模型)单次推理延迟可超过 600 毫秒,而一次预测的动作又常少于 4 个,既慢,也要频繁重算。SpecVLA 想用“先猜一段、关键处再检查”的办法同时缓解这两个问题。
它先判断机器人处于哪种状态:在只是移向目标的“非活动状态”,完整 VLA 会投机预测较长的动作序列,论文示例为一次 5 个动作;进入对准、抓取或放置等“活动状态”后,一个更小、更快的 sVLA 会在每个动作执行前核验。若核验不通过,系统立即回退,让完整 VLA 重新生成。完整模型与验证模型还分别运行在 GPU 和机器人专用硬件上,并行工作以隐藏等待时间。作者称该设计在 OpenVLA、RDT 及两套基准上降低了端到端延迟,同时保持相近的任务成功率;现有材料未给出完整的加速倍数。