在虚拟街道里转身,画面变了,汽车声却还停在原来的方向,沉浸感会立刻破功。Noiz AI与多所机构研究人员发布的 HelixWorld 1.0,试图补上这一块:据量子位报道,它能根据用户操作,实时生成24 FPS画面和48 kHz立体声。前者是常见影视帧率,后者指每秒采样4.8万次、包含左右声道。
关键不只是给视频配音。HelixWorld把画面和声音放进同一套 Transformer——一种负责理解上下文并生成内容的模型架构——联合生成,让转身、前进等操作同时改变视野和声场。为避免系统越生成越跑偏,团队还让模型在训练时读取自己生成过、可能带误差的历史,再预测正确结果,相当于提前练习“带错继续走”。这让世界模型从只会生成会动的画面,迈向连续的视听反馈;不过目前效果主要来自团队与报道方披露,权重和代码计划在数周内开源。