Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.090 — 2026-10-02
PAPER H 11 约 7 分钟

CoDrive:多辆车共享同一个世界

CoDrive让两辆车在同一虚拟道路里“做梦”,画面彼此对得上,行驶轨迹也能精确控制。

想象两辆车同时驶进一个路口。前车看见一名行人从货车后走出,后车的视线仍被挡住。如果用两个彼此独立的视频模型模拟这一幕,麻烦就来了:行人可能只存在于一辆车的画面里,也可能在两边处于不同位置,甚至朝不同方向移动。每段视频单看都像真的,拼起来却不是同一个世界。

CoDrive要补的正是这个缺口。它是一套面向协同驾驶的视频生成框架:同时生成两辆车、每辆车三个摄像头看到的画面,并按照给定的相机轨迹控制车辆如何运动。所谓驾驶世界模型,就是一座可反复预演的虚拟道路;所谓协同驾驶,则是多辆车共享感知或意图,一起判断该怎么走。要让后者在模拟中成立,多辆车必须看到同一个、彼此不矛盾的世界。

这项工作的关键,不只是“多生成几路视频”,而是把多车视角的一致性和轨迹控制放进同一套生成过程。以下结果均来自论文作者在自建 CoDrive-Bench 上的报告,尚无第三方复现或独立评测。

两辆车不能各做各的梦

CoDrive建立在预训练视频生成模型 HunyuanVideo-1.5 上。视频先被压缩成更紧凑的内部表示,再由扩散 Transformer——一种逐步把噪声还原成视频的生成模型——完成画面生成。作者没有让两辆车分别生成完再拼接,而是让它们在生成过程中持续交换信息。

具体来说,模型交替使用两种自注意力。自注意力可以理解为:模型让不同位置、不同时间的画面彼此“查阅”,判断哪些内容需要保持关联。

第一种是 local self-attention,也就是局部自注意力。它只处理同一辆车的多个摄像头,让这辆车的前方视角和其他视角在时间与空间上保持连贯。第二种是 global self-attention,即全局自注意力。它跨越车辆交换信息,让一辆车画面中的道路、建筑和车辆,能与另一辆车看到的内容互相校对。

这个安排像两级核对:先保证每辆车自己的三路录像说得通,再让两辆车对照笔记。论文的消融实验——也就是拿掉某个组件,看性能如何变化——显示,移除这种局部与全局交替的设计后,轨迹平均位移误差 ADE 从 3.05 升到 6.71;跨车车辆的 Soft Hit Rate 从 0.482 降到 0.409。后者衡量目标车辆是否持续出现在几何关系预测的位置附近,越高越好。

交换信息还不够,还得知道彼此站在哪

仅让两辆车“聊天”仍然不够。模型还需要知道,它们在道路上的相对位置、朝向和摄像头参数。否则,两幅画面看起来可能相似,却无法在几何上严丝合缝。

CoDrive把所有相机轨迹放进同一个世界坐标系,再用 projective relative positional encoding(投影式相对位置编码,简称 PRoPE)把相机之间的几何关系注入注意力层。简单说,它给每路画面附上一张共同标尺:模型不只看到“这里像是同一辆车”,还知道另一台摄像机应该从哪个方向、以什么尺度看到它。

这一设计被称为 Global Camera Geometry Injection,即全局相机几何注入。拿掉它以后,ADE 从 3.05升至13.40,衡量轨迹形状相似度的 DTW 从116升至688,Soft Hit Rate 也从0.482降到0.342。按照作者的实验,这说明显式几何信息不只是帮助场景对齐,也是精确轨迹控制的重要部分。

真实道路不够,就让模拟器补课

多车生成还有一个现实问题:同步拍摄、带完整相机位姿的真实多车数据既少又贵。CoDrive采用五阶段渐进训练。模型先学习单视角真实驾驶视频,再学习相机运动控制,随后扩展到单车多视角,最后进入多车、多视角训练。训练共使用约90万段视频。

作者还在 CARLA驾驶模拟器中制作了1.5万段双车交互片段。每辆车装有三个朝前的 RGB 摄像头,两辆车合计六路同步视频。数据覆盖8张地图、11种天气和6类交互,包括路口交会、同向跟车、迎面相遇、转弯、并线或加塞,以及平行车道行驶。

最后的 mixed-task fine-tuning——混合任务微调——同时喂给模型两类材料:合成的双车视频负责教它跨车一致性,真实的单车视频负责保留现实道路的外观和运动分布。在真实场景测试子集上,加入这一步后,FVD从282.9降至104.3,ADE从6.86降至1.53,Soft Hit Rate从0.560升至0.646。FVD用于衡量生成视频与真实视频在整体分布上的差距,通常越低越好。结果支持作者的设计判断:模拟数据可以教多车关系,真实数据则帮助模型别把道路生成得太像模拟器。

怎么判断两辆车看到的是同一个世界?

为此,论文还提出 CoDrive-Bench。它包含200个双车交互场景,其中100个来自真实世界,100个来自合成环境;合计提供1200段 RGB 视频和400条轨迹。每辆车都有三个摄像头视角。

评测分三层。第一层看车辆是否按指定轨迹运动。第二层重建两辆车看到的静态场景,比较道路和建筑的三维几何是否吻合。第三层检查参与交互的另一辆车,是否出现在几何关系推算出的正确位置。这样可以区分三种不同的“看起来没问题”:视频本身顺滑、车确实按路线走、两辆车也确实生活在同一个世界。

在论文列出的五个对照模型中,CoDrive的 ADE 为3.05、DTW为116,均为最低;场景几何指标 CD为1.64、RE为0.52,也均为最低。实例层面,它取得最高的 Soft Hit Rate 0.482,以及最低的三维定位误差 LE 5.81米。其 FVD为108.8,接近对照中的最好结果103.2。换句话说,作者报告的一致性提升没有伴随明显的视频质量损失,但这不能写成画质领先。

为什么值得关注

此前的驾驶世界模型主要让一辆车独自“做梦”。CoDrive推进了一步:它要求多个观察者共同维护一个动态世界,而且每个观察者仍能沿指定轨迹移动。这更接近协同驾驶真正需要的模拟条件。若同一辆车在不同视角中位置不一,或一个视角里有行人、另一个视角里没有,那么后续的协同感知与多车规划就缺少可信基础。

同样重要的是,CoDrive-Bench没有只看画面是否逼真,而是把轨迹、静态场景和具体车辆分开检查。对于多车世界模型,这套问题比一句“生成得像不像”更接近实际用途。

局限与未知

  • 当前实现只覆盖两辆车,每辆车三个视角。论文也把扩展到更多交互车辆列为后续方向,因此标题里的“多车”暂时仍是双车规模。
  • 双车训练的关键监督主要来自 CARLA 合成数据。混合微调在真实测试子集上有所改善,但复杂遮挡、长时间生成和高密度交通中的一致性,材料没有给出充分验证。
  • 全部结果来自作者自建基准与论文报告。材料未提供第三方复现,代码和模型是否公开也无法据此确认。

供稿材料 SOURCES — 1

← 返回 2026-10-02 · 学术板块