训练视频世界模型,过去像是先买下一座工厂才能做实验:数据、算力和复杂流程都把小团队挡在门外。MiniWorld想把它缩成一间可复现的实验室。视频世界模型会根据此前画面和动作,预测环境接下来如何变化,相当于给智能体准备一台内部模拟器。论文作者称,完整模型可在单台8卡服务器上用数天完成训练。
它最值得注意的设计,是把视频切成按时间排列的小段:每一段可以充分理解段内画面,但预测时只能参考此前片段,不能“偷看未来”。这让训练方式更贴近实际的连续生成,也方便模型边生成边保留历史信息。作者还开放了数据处理、训练、推理和评测代码,以及模型权重。
这里的“从零训练”主要指世界模型本身不从大型视频生成模型继续改造;视频压缩仍使用预训练的 Wan2.2 VAE——一种把画面压成更省算力表示的模型。效果与资源门槛目前均来自论文作者自述。