开车接近路口时,只看见“前方有车”还不够。司机还要判断:如果我转弯、减速或继续前进,接下来会发生什么。自动驾驶模型也面临同样的问题。它需要理解画面,更需要把自己的行动与行动造成的未来联系起来。
WA-JEPA追问的正是这一点:驾驶模型究竟应该预测未来画面,还是预测“采取某种行动后,世界会怎样变化”?研究团队的答案是,把两者放进同一套预测过程。模型一边推演未来场景,一边生成本车轨迹,让动作信号反过来塑造它对世界的理解。
本文的技术细节和成绩均来自研究团队发布的论文,尚无跨机构复现。文中的比较数字应视为作者自报结果。
从“补画面”改成“猜未来”
WA-JEPA建立在V-JEPA之上。JEPA,即Joint Embedding Predictive Architecture,不要求模型画出未来图像的每个像素,而是预测图像压缩后的特征表示。可以把它理解为:不必完整画出下一秒的街景,只要概括出“前车变近、路口出现横向车辆、本车需要调整轨迹”这类更高层的状态。
这种训练通常采用自监督学习——模型从视频本身制造练习题,不依赖人工逐帧标注。原版V-JEPA会随机遮住视频中的一些区域或片段,再让模型补出相应特征。它擅长学习视频里有什么,但论文作者认为,这种“哪里缺了补哪里”的练习,与驾驶规划仍有距离。规划面对的是严格的时间箭头:模型只能看过去,不能偷看未来。
WA-JEPA因此把预训练改为“混合未来遮挡”。其中一条训练分支遮住全部未来内容,迫使模型只凭历史画面向前预测;另一条分支保留部分未来图块,让模型继续练习较容易的局部补全。前者强调因果方向,后者帮助稳定地学习视觉表征。
消融实验——逐项拿掉设计、观察成绩变化的测试——支持了这种组合。在NAVSIM-v2上,不做这轮nuPlan视频预训练时,模型得到89.5 EPDMS;只用部分遮挡为91.0,只用全部未来遮挡为91.3,两者结合达到91.7。按论文结果,两种练习提供了互补信号。
未来不该只有一个模糊答案
只改变遮挡方式还不够。原版V-JEPA主要用回归来预测缺失特征。回归倾向于给出一个折中的确定答案;但道路未来可能有多种合理走向。比如前车既可能继续行驶,也可能减速。把多种可能压成平均值,容易得到过于平滑、缺少变化的未来表示。
WA-JEPA改用conditional flow matching,即“条件流匹配”。直观地说,模型先从随机噪声出发,再依据历史场景,逐步把噪声推向一个合理的未来特征。它生成的不是像素视频,而是潜空间中的future latents——未来画面经过压缩后的特征。论文报告,在第二阶段直接回归未来特征时,EPDMS为90.7;换成基于flow matching的未来预测后,成绩升至91.7。
这项对比也提醒我们,关键不只是“有没有预测未来”,还包括用什么方式表达未来。作者对内部表示的分析称,flow matching比直接回归更能保留时间变化和空间结构;不过原文抓取材料缺失了两项分析指标的具体数值,因此这里不作数字展开。
让动作进入世界模型
WA-JEPA的第二个关键变化,是把未来场景与本车动作放进同一个预测器。所谓世界动作模型,就是同时建模环境如何变化,以及转向、加速等自身行动怎样参与这种变化。
训练分两阶段。第一阶段使用nuPlan的多视角行车视频,不加入动作监督,先学习从历史画面预测未来特征。第二阶段在NAVSIM的navtrain数据上训练规划能力。此时模型只看历史画面、历史动作和车辆自身状态;未来图像只负责提供训练目标,不会作为输入泄露给预测器。
场景特征与轨迹在统一的时空潜空间里共同去噪。这里的“去噪”,就是从加入随机噪声的候选未来中,逐步恢复出合理的场景状态和车辆动作。推理时,两者都从高斯噪声开始,经过12步采样,最后输出未来轨迹。论文的实验设置使用左、前、右、后四个摄像头的4帧历史画面,预测8个动作点,频率为2 Hz。
联合建模本身也带来差异。只通过历史特征规划的基线得到89.9 EPDMS;另设一个未来预测器,再把预测结果交给规划模块,得到90.8;把场景与动作统一建模、但不明确监督未来场景,得到91.1;联合建模再配合flow matching,最终为91.7。换句话说,未来预测和动作规划并非简单前后串联,两者在同一过程中相互约束,效果更好。
为什么值得关注
在NAVSIM-v2的navtest测试集上,WA-JEPA取得91.7 EPDMS。论文表格中,最强端到端基线SparseDriveV2为90.1,最强世界动作基线Discrete-WAM为90.4,差距分别是1.6和1.3分。NAVSIM-v1上,WA-JEPA的PDMS为91.8。
更值得留意的是闭环测试。开环评测主要检查模型给出的规划;闭环评测则让车辆执行动作,后续场景会随之变化,更接近“行动影响未来”的问题。WA-JEPA没有使用HUGSIM生成的画面或其四个来源数据集训练,在436个HUGSIM场景上取得0.4462 HD-Score。论文称,在共享场景、控制器、指令、汇总方式和指标实现、但各模型保留原生传感器配置的协议下,这是参评方法中的最高值;优势主要出现在中等和困难场景。
这项工作的意义,不只是又提高了一项驾驶分数。它给JEPA式视频学习换了一道题:不再满足于理解被遮住的画面,而是要求模型沿时间向前推演,并把“我将做什么”纳入“世界将怎样变化”。对于自动驾驶规划,这比单纯学会描述场景更接近真正的问题。
局限与未知
- 所有结果来自同一研究团队。论文没有提供误差范围或重复实验统计;WA-JEPA的随机预测采用固定10个种子取均值,而确定性基线只评估一次。
- HUGSIM比较虽采用论文所称的共同协议,但各方法保留自己的传感器配置。因此,0.4462可以说明这组实验中的表现,不能直接外推为所有闭环设置下都领先。
- 训练规模不小:第一、第二阶段分别使用64张和32张NVIDIA A800 GPU。论文摘要宣称代码发布于GitHub,但现有材料未独立确认仓库的完整性与可复现性。