接飞来的球时,手不能伸向球刚才的位置,而要提前等在它将要出现的地方。机器人也一样:摄像头看到变化后,模型计算动作需要时间;面对传送带上的物体或旋转中的插孔,判断即使正确,慢半拍也可能落空。Reflex关注的正是这种“关键一瞬”。
作者提出 ReflexBench,用六项动态任务检验 Vision-Language-Action(VLA,直接把画面和语言指令转换成机器人动作)模型,包括接球、移动物体抓取和旋转插销等。它最值得注意的设计,是不在模型思考时暂停模拟环境:物体仍会继续运动,从而把控制延迟真实地算进结果;同时支持同步和异步推理,后者让机器人执行上一批动作时并行计算下一批动作。
配套模型 ReflexVLA 会融合多帧历史画面,并预测未来视觉状态,再用批量视觉编码和 CUDA Graph replay 缩短部署延迟。作者称,它在动态任务上持续改善表现,同时保持静态操作的竞争力;但现有材料未给出具体提升数字。