你按下“前进”,画面里的街道随之靠近;脚步声跟着响起,远处的人继续说话,背景音乐也没有突然断掉。它不是一段提前做好的视频,而是一个会根据你的移动继续生成的世界。EchoWM想解决的,正是这件事:把持续导航、720p画面、环境声、音乐和语音放进同一个生成系统。
这类系统叫“世界模型”——它根据当前状态和接下来的动作,预测世界会怎样变化,像在内部运行一个可操纵的模拟器。EchoWM团队进一步称它为“可进入生成媒体”:内容不再只能播放,而会随用户导航即时改变。
需要先说明,本文依据目前唯一的信源,即EchoWM团队发布的论文。系统能力、训练方法和效果均为作者自述,尚无独立复现;论文也没有披露主要评测的具体分数和统计显著性。
它把什么放进了同一个世界?
EchoWM是一种全模态(omnimodal)世界模型。“全模态”是说画面、环境声、音乐和语音由同一系统联合生成,而不是先做视频,再让另一个工具事后配音。这样做的目标,是让看见和听见的事件在时间上对应。
用户给它一份参考画面和文字描述,再持续提供导航控制。系统据此生成720p视频与音频,并支持多轮接续。这里的720p只代表输出分辨率,不能直接等同于画质优秀。
它的交互范围也有明确边界。EchoWM控制的是导航和视角变化,不是任意角色行为。前进、转向、升降或旋转可以用相机运动表达;攻击、跳跃和操作物体等语义动作,则不在这套接口之内。
关键不是按键,而是“相机想去哪”
不同游戏和场景的控制方式并不统一。同一个“前进”键,在第一人称场景里可能推动观察者,在第三人称场景里却会同时牵动角色移动、镜头跟随和画面构图。角色撞到障碍物时,按键已经发出,相机却可能没有前进。
EchoWM因此不把键盘指令直接当作统一语言,而是使用camera intent,即“相机意图”。离散按键和连续位姿都会先转成相对6-DoF轨迹。6-DoF是“六自由度”:三种空间位移加三种旋转,比“前进、左转”更连续,也能表达升降、侧倾以及位移与转动的组合。
“相对”则表示所有运动都以起始镜头为参照。这样,无论原始视频在哪个坐标系中拍摄,模型关心的都是镜头从起点如何移动。
在第一人称画面里,这条轨迹直接描述观察者运动。在第三人称画面里,模型只接收相机轨迹,不接收角色轨迹、控制器状态或摄影机支架参数;角色怎样移动、镜头怎样跟随,由模型从数据中学习。论文所说“不需要视角专用控制器”,具体指的是这类第三人称相机—角色关系,不能扩大理解为整套系统完全不需要控制机制。
不同数据里的“一米”要先对齐
把许多来源的视频混在一起训练,还有一个隐蔽问题:运动尺度可能不一致。如果逐条视频各自归一化,一次小幅挪动和一次长距离前进可能被压成同样大小;接续生成时,速度也可能突然改变。
团队的做法是从训练轨迹整体估计一个稳健尺度,并在全部训练和推理轨迹中共用。超过范围的异常轨迹被剔除,而不是强行截短;旋转量保持不变。说白了,它先统一各套数据中的“尺子”,再让模型学习怎样移动。
轨迹随后通过UCPE(Unified Camera Positional Encoding,一种把镜头之间的相对几何关系放进注意力计算的方法)注入视频模型。它着重描述两个时刻的镜头如何相对变化,减少全局坐标原点不同带来的干扰。
没有一种数据什么都擅长
真实网络视频画面和声音丰富,却没有可靠的按键记录与相机轨迹;模拟器能提供精确几何信息,声音又不够自然。EchoWM没有寻找一套“完美数据”,而是组合四种来源:团队内部采集的游戏录像、玩家上传的网络游戏录像、Unreal Engine模拟数据,以及一般网络视频。
四类数据各管一段。内部游戏数据带有原生立体声音频和操作日志;网络游戏录像补充更自然的控制节奏、对话与玩家评论;Unreal Engine提供真实尺度的相机位姿和可控运动;一般网络视频扩大真实场景、声音和镜头语言的覆盖面。团队还从控制训练混合集中抽样分析了28,605条轨迹,其中包含直行、斜行、折返和环绕等运动。
论文特别区分“下达了什么操作”和“实际发生了什么运动”。前者是控制意图,后者会受到碰撞、地形和游戏物理影响。当前模型最终使用实际相机轨迹作为统一条件,操作日志主要留作对齐、分析和未来研究。
先学会看和听,再学会听指挥
训练分四步进行。第一步让模型继续学习联合生成画面和声音,建立视觉动态、环境声和语音能力。第二步冻结主体模型,只训练一条轻量的轨迹控制通路,让它集中学习“怎样跟随镜头”。第三步用兼顾视听质量与轨迹可靠性的数据,小幅联合调整两部分。
最后是自回归后训练。“自回归”可以理解为模型把自己刚生成的片段当作下一段的上下文,继续往后写。这样做是为了让它适应真实使用时并不完美的自生成历史,而不是训练时始终依赖干净的真值片段,从而支持更长时间和多轮的接续生成。
数据文本也经过隔离。训练轨迹控制时,团队移除了会直接描述人物或镜头运动的叙事字段,避免模型偷看文字答案;场景、风格、主体和初始视角仍然保留。到了联合训练阶段,声音和语音描述可以加入,运动叙事依旧排除。
为什么值得关注?
EchoWM最有意思的地方,不是单项能力首次出现,而是把几件此前容易分开的事接到了一起:同一套相机轨迹接口覆盖第一、第三人称;同一模型联合生成画面、环境声、音乐和语音;生成还能沿用户输入继续展开。
这让世界模型从“会响应操作的无声画面”,向更完整的生成媒体迈了一步。它试图让声音成为世界反馈的一部分:脚步、碰撞和环境声提示空间变化,语音承接人物与叙事。产品想象力也由此出现——用户面对的不再只是一条生成结果,而是一处能够继续探索的内容空间。
局限与未知
- 论文称EchoWM在WBench Navigation排名第一,并在SANA-WM-Bench取得较高视觉质量,但未给出本文可核验的具体指标、对照模型、分数或显著性,因此无法判断领先幅度。
- 作者称系统能在多类主体和长时程生成中保持环境声与语音同步;材料没有提供同步误差、持续时长或失败案例,这一结论仍待独立测试。
- 当前接口主要控制导航与视角,不能表达攻击、跳跃或物体操作等任意角色动作;数据校准、渐进训练和长时程稳定性也尚缺第三方复现。