你先给 AI 一张街景,再按下“向左转”,它不只要生成一段看起来像左转的视频,还得记住原来的道路、建筑和光线;几秒后你再要求停车,它又要从当前状态接着演下去。普通视频模型擅长一次生成一段成片,却不擅长这样边接收指令、边延续世界。
Astronex-World 1.0 想把视频生成器改造成这种可持续操控的环境模拟器。它同时接受文字、首帧图像、逐帧相机轨迹、连续动作和 embodiment identifier——用来区分不同身体或控制载体的编号,还能在指定时刻插入文字事件。作者发布了双向与因果两种 5B 模型,均从 Wan2.2-TI2V-5B 继续训练,并支持文生视频和图生视频。
不过,本文所有性能数字都来自作者报告,没有独立第三方复核;“实时”目前主要对应单张 NVIDIA L20 上以 24 fps 流式输出,不等于端到端操作一定低延迟。
两个模型,各做一半工作
这里的“世界模型”,可以理解为一台学习环境变化规律的预测器:给它当前画面和动作,它推测接下来会看到什么。
Astronex没有强迫一个模型同时兼顾成片质量和持续交互,而是保留两种形态。双向模型能同时参考一段视频的前后内容,适合整段生成、控制适配,也在训练中充当教师。因果模型只能利用已经生成的历史,再逐步预测未来,因此更适合持续续写。
关键改造是“块因果注意力”。注意力是模型判断当前画面该参考哪些信息的机制。Astronex把视频切成小段:同一段内部可以互相参考,新段却只能查看已经完成的旧段。这样既保留一小段内部的整体协调,又不会偷看未来。
生成完一段后,模型还会保存其中的 KV Cache——此前计算过的中间结果,像把查过的资料留在桌边。下一段直接复用,不必从头重算整段历史。推理时,每块包含八个潜在帧;模型默认用八步 UniPC 采样,也支持速度更快、但清晰度和稳定性较低的四步生成。
控制不只是一句提示词
提示词可以说“镜头向前”,却很难精确描述每一帧该怎样移动。Astronex因此把控制信号直接送入模型。
相机部分使用 PRoPE,将相机内参和外参注入全部 30 个 Transformer 层。内参描述镜头怎样成像,外参描述相机在空间中的位置和朝向。动作部分则是一条 64 维连续信号流,并结合 embodiment identifier 调节每一层。说白了,文字负责说明场景和事件,相机参数规定视点怎么走,动作信号规定受控主体怎么动。
因果模型还允许在生成途中追加文字事件。例如,一段行驶视频已经生成到一半,此时插入“前方出现障碍物”。此前完成的画面和缓存不会重算,事件只影响后续内容,同时后续仍会参考既有场景。作者给出的配对示例中,事件切换前两次生成的平均 RGB 差异为 1.8/255,切换后为 9.5/255。
为了延续较长视频,模型保留最近 20 个潜在帧,并把最早四帧设为长期不丢弃的“注意力锚点”。这相当于一边记住最近发生的事,一边始终留着开场画面,减少场景在持续生成中越走越偏。
五阶段训练,重点是学会面对自己的错误
训练从已有的视频生成能力出发,共分五个阶段。第一阶段为双向模型加入相机和动作控制。第二阶段把注意力改成只能读取历史的块因果结构。第三阶段让较密集的 25 步教师轨迹指导 12 步学生轨迹,为少步生成打基础。
问题在于,模型持续生成时,后续看到的并非永远是真实视频,而是自己刚刚生成、可能已有误差的画面。误差会一段段回流,造成运动衰减、几何漂移、偏色和细节流失。第四阶段因此混合相机控制、第一人称游戏、驾驶和机器人场景,并让模型在训练中接触自己的滚动输出。第五阶段再用非对称 DMD/DMD2 做分布匹配——让少步生成的结果更接近教师所代表的视频分布,同时加入运动保持约束,避免画面退化成变化很小的“安全答案”。
作者称,全部五阶段后训练可在两张 NVIDIA L20 48 GB GPU 上完成;因果模型则可在单张同型号 GPU 上,以 832×480、24 fps 流式生成。
小模型成绩不错,但短板也很清楚
在作者按官方代码完成的 WBench 评测中,Astronex在只考导航的 Navi 158 上得到 73.5 分,在包含事件编辑、主体动作和视角切换的 Full 289 上得到 70.0 分。
Full 289 榜单中,这个 5B 模型高于 13.6B 的 LongCat-Video(69.9)和 14B 的 Helios(69.7),距离 22B 的 LTX-2.3(70.9)相差 0.9 分。参数更少却进入更大模型的分数区间,是它最值得关注的结果。
但分项也说明“可交互”还没有完全解决。Full 289 的画质得分为 78.3,一致性为 82.4,交互项只有 47.6。论文也提到,当前适配器只暴露一个最早的文字切换点,同一案例中的多个定时事件会被合并,这会影响事件和视角切换表现。
它更像一块面向交互环境的通用底座,而不是已经完成的机器人或驾驶系统。模型预留了动作输入和动作序列输出接口,可在后训练中接入具身智能与自动驾驶数据;这表示接口具备扩展空间,不代表它已经通过真实机器人、道路驾驶或安全关键场景验证。
局限与未知
- “实时”尚缺端到端输入延迟、首帧延迟、单步响应时间、持续运行稳定性和完整软硬件配置。24 fps 输出本身不能证明操作后能低延迟响应。
- 两张 L20 完成五阶段训练的说法建立在 Wan2.2-TI2V-5B既有权重之上;论文没有把数据处理、前期预训练和全部实验成本合并成一个可比较数字。
- WBench成绩及同榜模型比较均由作者报告。分辨率、帧长、推理预算和具体版本是否完全一致,仍需第三方复现;“开放”具体覆盖权重、代码、数据还是许可证,现有材料也未说明。