Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.090 — 2026-10-02
PAPER H 9 约 1 分钟

长任务VLA有了快慢两套记忆

D²-VLA把长期线索与眼前变化分开记,让机器人既不忘事,也能及时应变。

让机器人先看一眼物品原来的位置,再追着移动物体操作,难点不只是“看准”,还要它别把早先线索忘掉。D²-VLA面向这种长时程操作:它把视觉、文字指令和动作相连的 VLA 模型,改造成一套“慢记长期、快盯眼前”的系统。

作者发现,大型视觉语言模块需要较广的历史来判断任务含义,负责具体动作的模块却更关注近期、包含运动变化的信息。于是,D²-VLA为两者分别挑选历史记录,并以不同频率更新。历史保存在 KV cache——模型处理信息时留下的中间“速记”——里;完整理解模块周期性刷新,两次刷新之间则用轻量组件加入最新画面,让动作模块快速重做计划,不必每次都重新运行整套大模型。

作者还设计了十项任务的 DOMINO-Long,要求机器人记住早先的空间、顺序或颜色线索,同时处理持续移动的物体。论文报告,D²-VLA完整任务成功率为60.0%,高于对比方法的35.4%和20.6%。这些结果仍是作者自述,但它的关键价值很清楚:机器人需要的并非一块越大越好的记忆,而是按用途分工、按变化速度更新的记忆。


供稿材料 SOURCES — 1

← 返回 2026-10-02 · 学术板块