Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.040 — 2026-08-13
PAPER H 10 · HF 22 约 1 分钟

自动驾驶世界模型不必生成未来

SimWAM把未来视频留在训练场,让自动驾驶部署时直接规划轨迹。

学开车时,提前推演“下一秒画面会怎样”很有用;但真上路后,每次转向前都生成一段未来视频,既慢又贵。SimWAM解决的正是这个矛盾:让自动驾驶模型在训练时借视频预测理解车辆与场景如何变化,部署时却直接输出行驶轨迹,不再生成未来画面。

它属于世界—动作模型(WAM)——把“世界接下来怎样变化”和“车该怎样行动”放进同一套学习框架。SimWAM同时训练一个预训练视频专家和一个轻量动作专家,并用联合Flow Matching(一种学习数据变化过程的生成模型训练方法)传递驾驶场景的动态先验。关键是一张隔离注意力掩码:它禁止动作专家读取未来帧,迫使规划器只凭当前信息学习决策。因此,未来视频只是训练时的老师,推理时可以整个省掉。

作者还把视频与动作模块做成参数互不共享的两部分,只通过统一的注意力接口交互,因而可以单独更换视频模型或扩展动作模型。论文称,SimWAM在NAVSIM基准上取得PDMS成绩,并以明显更低的延迟超过其他基于世界模型的规划器,还能零样本迁移到nuScenes;不过供稿原文未披露这里对应的具体分数和延迟数值。


供稿材料 SOURCES — 1

← 返回 2026-08-13 · 学术板块