机器人伸手抓球时,快还不够,还得在靠近球的最后几厘米足够准。VQVLA瞄准的正是这种取舍:VLA(Vision-Language-Action,把画面、语言指令和机器人动作串起来的模型)若输出动作太慢,依据的现场状态可能已经过时。
它先看相邻动作的运动幅度:移动距离较大时采用低精度量化;抓取、放置等细小调整阶段则切回高精度。这里的向量量化,是把许多相近权重换成少量代表向量,像用有限色卡近似大量颜色。更巧的一步是复用反复出现的“码字”——量化后的代表向量:先合并部分输入再做乘法,并跨列复用中间结果,以减少重复计算。
作者还为这套方法设计了专用加速器,并称其相对 A100 GPU 获得 6.5 倍加速,准确率下降可忽略。这是一条不同于直接剪小模型的路线,不过上述效果来自论文自述,且依赖定制硬件,并非现有 GPU 上即插即用的软件优化。