Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.045 — 2026-08-18
NEWS 约 1 分钟

有声世界模型开始实时生成

HelixWorld让世界模型同步生成24 FPS画面与48 kHz立体声,交互开始有了“声场”。

IMAGE — 量子位

在虚拟街道里转身,画面变了,汽车声却还停在原来的方向,沉浸感会立刻破功。Noiz AI与多所机构研究人员发布的 HelixWorld 1.0,试图补上这一块:据量子位报道,它能根据用户操作,实时生成24 FPS画面和48 kHz立体声。前者是常见影视帧率,后者指每秒采样4.8万次、包含左右声道。

关键不只是给视频配音。HelixWorld把画面和声音放进同一套 Transformer——一种负责理解上下文并生成内容的模型架构——联合生成,让转身、前进等操作同时改变视野和声场。为避免系统越生成越跑偏,团队还让模型在训练时读取自己生成过、可能带误差的历史,再预测正确结果,相当于提前练习“带错继续走”。这让世界模型从只会生成会动的画面,迈向连续的视听反馈;不过目前效果主要来自团队与报道方披露,权重和代码计划在数周内开源。


供稿材料 SOURCES — 1

← 返回 2026-08-18 · 科技板块