想象自动驾驶系统驶近一个路口。真实行车记录只告诉它:“当时直行,后来发生了什么。”但开发者还想追问:如果提前减速呢?如果改道呢?如果路边多出一辆车呢?这些没有真实发生过的分支,日志里找不到,只能重新采集,或由模型生成。
HelloWorld 想做的,就是一台可以改动条件、继续推演的驾驶环境模拟器。它不是只生成一段看起来像行车记录的视频,而是把反事实数据生成、连续仿真、多摄像头画面、LiDAR(激光雷达)观测和推理加速放进同一套系统。论文把它称为一个参数规模为 2B、即约 20 亿参数的生成式驾驶世界模型。
不过先说清证据边界:下文关于系统能力和实验设置的事实均来自论文自身,尚无独立信源交叉验证。论文材料没有给出足以支持“效果领先”“实时运行”或“已经实车应用”的结果数字。
先学会看世界,再学会听指挥
驾驶世界模型会根据道路场景和车辆运动,预测接下来应该看到什么。难点不只是把画面做得逼真。模型还得理解车辆怎么移动、道路和其他车辆在哪里,并在开发者修改条件后给出相应变化。
HelloWorld 采用渐进式训练。可以把它理解为先上通识课,再学驾驶专业课。
第一阶段使用普通视频和车队视频,让模型学习广泛的外观、运动规律与相机运动。论文列出的标准训练单元为 29 帧;这一阶段共有约 366 万个训练窗口,其中车队数据占 35.1%,其余来自 SpatialVID、Sekai、DL3DV、ScanNet 等通用视频集。通用视频覆盖面较广,却通常没有精确的驾驶标注,而且相机移动的距离缺少统一尺度。团队因此对位移做归一化,并额外告诉模型一段轨迹是否具有真实的米制尺度。
第二阶段再用经过标定的同步车载数据,教模型同时生成七个摄像头的 RGB 彩色画面。所谓“标定”,就是明确各摄像头装在哪里、朝哪个方向看。七路画面不能各编各的:同一辆车从前方视野驶向侧方视野时,位置与外观应当衔接。HelloWorld 为相邻视角加入信息交换机制,希望各摄像头围绕同一个场景状态生成观察。
第三阶段加入更明确的控制条件:ego pose、HD maps 和 3D boxes。ego pose 是本车在三维空间中的位置与朝向;HD maps 是带有车道线、路缘、交通标志等信息的高精地图;3D boxes 则用三维框表示车辆等物体的位置。三类条件分别回答“车怎么走”“道路怎样布置”“场景里有什么”。论文还专门混合训练同时给出全部条件、只给轨迹以及只给场景控制的样本,因此在推理时关闭某一类输入,是训练过的工作模式。
真正的门槛,是让下一秒接得住上一秒
一次生成完整短片,与连续驾驶仿真并不是一回事。交互式仿真要求模型根据已经生成的历史和当前条件,一段接一段地产生未来;它不能偷看尚未发生的画面。
HelloWorld 使用 block-causal generation,也就是“分块因果生成”。模型会联合生成当前一小段画面,然后把这段结果固定下来,作为生成下一段时的历史。这里的“因果”指视觉观察的时间顺序:生成当前片段时,看不到未来观察。
问题在于,训练时模型常常接着真实画面往下生成,实际运行时接到的却是自己先前生成的画面。小错误会进入下一轮,像复印件反复复印,逐步积累。论文用两种办法缩小差距:一是故意扰动历史上下文,让模型习惯不完美的输入;二是 self rollout,让模型在训练中直接面对自己生成的历史。KV cache——模型保存先前计算结果、避免每次从头重算的“草稿纸”——则服务于分块连续执行。
这套接口很关键,因为它把世界模型从“生成一条演示视频”推向“能够反复调用的环境”。但论文也主动划了一条界线:HelloWorld生成的是给定轨迹和场景条件下的传感器观察,并不从油门、刹车或方向盘指令推导车辆动力学,也没有证明周围交通会对驾驶策略作出真实反应。因此,它还不能直接等同于经过验证的自动驾驶闭环仿真器。
不只要画面,还要几何观察
自动驾驶系统通常不只看摄像头。HelloWorld 还提供以 RGB 视频为条件的 LiDAR 合成:根据同步画面生成激光雷达式的距离观测。
这不是简单把深度值涂成一张图片。激光雷达数据既要表示测得的距离,也要区分某条射线究竟有回波,还是没有探测到物体。论文因此单独建模回波有效性,并加入面向几何结构的表示和约束。其 LiDAR tokenizer——把原始扫描转换成模型可处理表示的编码器——使用了 5 万段、共 145 万帧数据。论文同时强调,这一分支是“由 RGB 条件生成 LiDAR”,并未据此证明两种模态在所有场景中都达到可靠的一致性。
为什么值得关注
HelloWorld 最有意思的地方,不是单独发明了某一种生成技巧,而是把几个此前容易分开讨论的问题接成一条开发链:先借广泛视频获得视觉与运动经验,再用稀缺的多视角和结构化标注完成驾驶专门化;随后让模型适应自己的生成历史,并把输出扩展到七路摄像头和 LiDAR。
它也认真处理了训练数据偏科。论文称,原始车队池里 82.8%的片段带有直路标签,夜间、雨天、路口和行人交互等情况只占少数。团队从质量筛选后的约 186万段素材中选出 497,773 段,保留长尾与安全相关场景,再按转弯幅度、速度和加速度平衡具体训练窗口。这个细节说明,世界模型的实用性不仅取决于网络结构,也取决于它是否真正见过足够多的少见情况。
为了降低重复调用成本,团队又通过一致性训练和分布匹配,把原本多步完成的生成过程蒸馏成 few-step inference,即少数几步推理。蒸馏可以理解为让一个较快的学生模型模仿较慢的教师模型。方向很明确:交互仿真若每前进一步都要付出昂贵计算,就很难成为日常开发工具。
局限与未知
- 现有材料没有披露蒸馏后的具体步数、速度、分辨率和连续生成时长。“少步推理”不等于已经达到实时运行。
- 论文设置了视觉质量、控制保真度、跨视角一致性、重复生成鲁棒性、效率和 LiDAR 合成等评测,但现有材料没有提供关键成绩及完整基线数字,不能判断它在这些维度上领先多少。
- 系统接受预先给定的轨迹和场景配置,再生成相应观察;它没有建立从底层驾驶动作到车辆与交通参与者动力学的完整闭环。更准确地说,HelloWorld 展示的是一套面向实用工具链的统一框架,而不是实用化已经完成。