让机器人一边看画面、一边听指令再动手,模型每一步都要处理很长的信息队列。VLA(视觉—语言—动作模型)会把图像、文字和机器人状态切成Token——模型可处理的小单位;直接删掉Token虽能省算力,却可能连同定位或控制线索一起丢掉,在连续操作中让误差越滚越大。
RoleSub换了更细的做法:先减少视觉Token,再把保留下来的Token内部表示分组,由轻量路由器结合Token内容、语言上下文和模型学出的“潜在角色”,决定保留哪些组。这里的角色不是人工规定的“语义”或“几何”,而是随控制任务共同学出。好比参会者仍在场,但每人只携带当前最相关的材料。
在OpenVLA-OFT-7B与四组LIBERO测试中,作者称,RoleSub在相同视觉KV预算——模型推理时保存的中间信息额度——下,36种设置中有33种优于同样训练过的纯Token删减方案。更值得注意的是:删除语言Token会迅速损害控制,但保留全部语言Token、只把其内部表示压到16组中的1组,单独使用时未测得性能损失。视觉与语言压缩合用后,总KV降至原来的9.2%至11.3%;不过长程任务对激进压缩仍更敏感。