训练可控的世界模型,像教 AI“向前走”或“向左转”:光给它看行车录像还不够,通常还得附上每个时刻的方向盘、油门记录。Action Forcing想省掉这套昂贵的同步动作标注,直接从普通视频的画面变化里找回控制信号。
它先追踪相邻画面中的像素位移,从摄像机自身移动造成的规律变化,也就是“自运动”中提取动作。随后用主成分分析(PCA,一种找出主要变化方向的统计方法),把复杂的像素运动压缩成两个主要控制轴。论文称,这两个轴对应可正可负、可调强弱、还能组合的油门与转向指令;模型推理时也不必先提供完整的像素运动轨迹。
最值得注意的是,作者称训练素材中持续倒车片段只占约 1%,模型仍学会了倒车,并能把油门与转向组合起来;多款对照系统则常常不会倒车,甚至难以保持静止。这说明普通视频或许能成为可控世界模型的训练材料。不过方法只能找回数据里实际出现过的运动方向,效果结论目前也主要来自论文作者的实验。