机器人执行长任务时,也会遇到“转身就忘”:物体一旦被遮住,当前画面便不再告诉它东西放在哪。StateMem想解决的正是这个问题。它面向视觉—语言—动作模型(Vision-Language-Action, VLA)——把摄像头画面和文字指令直接变成机器人动作的模型——但不把历史画面越堆越多,也不另建需要搜索的记忆库。
它只维护一个固定大小的“残差状态”,像一张不断改写的便签。模型先根据旧状态预测眼前所见,再把预测与实际画面的差异压缩后写回;这样保存的是新信息带来的变化,而非完整录像。同一份预测误差还用于判断是否沿用此前缓存的视觉语言特征,画面变化明显时才重新计算,并用轻量校正弥补缓存变旧的问题。
据作者报告,StateMem在机器人操作基准 LIBERO 上平均成功率为 97.6%,同时把视觉语言模型前缀的平均刷新率较每次都刷新降低 20.25%。它的价值在于让“记住过去”不必带来持续膨胀的上下文;代价也很直观:单一摘要经过反复压缩,仍可能漏掉历史细节。