摄像头每16.7毫秒送来一帧,机器人却要在33毫秒内完成一次判断。新画面还在不断排队,如果模型什么请求都接,结果可能不是“慢一点”,而是错过控制时机。vla-edge-backend的思路很直接:先估算这次推理要花多久,来不及就拒绝启动,让系统转用备用动作,而不是赌它能赶上截止时间。
它还会主动整理KV cache——模型保存既有画面信息、避免重复计算的“草稿纸”。缓存快满时,系统用余弦相似度衡量画面内容是否接近,优先丢掉最重复的一帧,而非机械删除最旧画面;双缓冲则让感知端始终读取较新的帧,不被积压任务堵住。值得注意的是,据作者说明,这仍是架构展示而非机器人实机基准:系统只在单张云端NVIDIA Hopper GPU上构建和测试,8GB显存上限也是代码中的设计预算,并非边缘设备实测结果。