自动驾驶模型可能“想象”出一段看着合理的未来视频,规划的路线却建立在错误的空间关系上。比如前车在画面中似乎正常移动,模型却没保持它连续的深度和遮挡关系。4D-WAM要补的正是这副空间骨架:4D指三维空间加时间,让车辆、道路和障碍物在连续时刻保持一致。
训练时,研究者把模型预测的画面和真实画面分别交给冻结的几何基础模型——一种能从平面视频推断深度与场景结构的模型。它充当“几何老师”,用全局布局、跨帧一致性和深度差异来约束4D-WAM;正式运行时不需要这位老师,因此作者称不会增加推理成本。
论文还发现,模型通常在最初一两个高噪声去噪步骤里就形成驾驶决定,后续步骤主要润色画面和轨迹。于是团队把更多训练监督放到这个早期决策阶段。作者报告其在NAVSIM-v1和NAVSIM-v2测试上达到当前最佳规划表现,但供稿未提供具体提升数字。