你正驾驶雪橇穿过雪地。手指按键调整方向,同时输入一句“让骑手欢呼并撑开雨伞”。画面没有停下重做,而是接着原来的场景往下生成:雪橇继续前进,人物开始欢呼,雨伞随之打开。
这正是 Zing-0.5 想解决的问题。过去的生成视频主要供人观看;不少交互式世界模型虽然允许移动镜头,却很难在探索途中改变人物、事件或环境。Zing Team 与 SeedLeap.ai 在 2026 年 9 月 15 日发布的技术报告中,把键盘动作和在线文字指令放进同一个持续生成过程,试图让视频从“播放的内容”变成“可以参与的环境”。
需要先说明:本文涉及的性能、成本和演示效果均来自团队自己的技术报告,尚无独立复现或第三方评测。“可玩世界”仍是研究方向,而非已经得到普遍验证的产品能力。
两种控制,做的是两件事
Zing-0.5 是一个拥有 50 亿参数的自回归世界模型。世界模型学习环境如何随时间和动作变化,再预测下一刻可能出现什么;“自回归”则意味着模型依据已经生成的画面继续往后生成,像逐段续写故事。
键盘和文字在这里各司其职。键盘负责连续、直接的控制,例如前后左右移动或改变视角。文字负责表达更高层的意图,例如改变天气、让角色采取某种行为,或在环境里引入一个事件。
团队没有先把键盘操作转换成一条精确的虚拟摄影机轨迹,而是直接把 W/A/S/D 等移动键以及 I/J/K/L 等视角键交给模型。每个方向还带有连续强度,用来表示动作幅度。这个强度只代表相对控制量,不等于现实中的固定距离。动作分支新增约 368 万参数,约占 50 亿参数主干的 0.074%。
文字控制则带有时间对齐信息:模型知道一句指令应从视频的哪个区间开始生效。否则,“让天气转晴”可能提前出现,也可能在指令已经过去后才姗姗来迟。训练数据把动作序列和分段文字标在同一条视频时间线上,让模型学习移动、事件和视觉结果之间的对应关系。
先看完整事件,再学短步生成
真正棘手的地方是时间尺度。用户希望系统迅速响应,所以模型必须一小段一小段地生成;但一个事件往往横跨多个小段。比如“树木燃烧并洒下金色火花”,不可能只凭其中几帧学会完整发展过程。
Zing-0.5 因而安排了两个角色。一个“段级教师”一次观察并处理完整的文字指令区间,用前后信息理解事件怎样展开;一个“块级学生”只生成较短的视频块,以便及时接受下一次键盘或文字输入。团队再用分布匹配蒸馏——让较小、较快的生成过程逼近教师所代表的结果分布——把完整事件的知识教给逐块生成的学生。
模型最终每个视频块只做四步去噪。去噪可以理解为从随机噪声中逐步整理出清晰画面;步骤越少,计算越快,但也更难保住质量。为减少长时间生成中的误差累积,团队还让学生用自己生成的历史继续训练,并混入带噪声、模糊等扰动的历史画面。这样,模型训练时不会永远只面对干净答案。
初始画面也被单独处理。报告称,质量较差的第一帧会让后续误差更容易滚大,因此系统先完成文生图,再从这张图继续生成视频。训练还加入 30 秒游戏片段,让模型接触更长的视觉历史。
实时不只取决于模型
生成速度之外,系统还要记住刚才发生了什么。Zing-0.5 使用 KV Cache——模型保存的中间计算结果,作用类似随手记下的草稿,避免每次都从头计算。它保留开头的一部分视觉信息和最近一段画面;旧内容逐渐移出,以限制显存与计算量。文字指令更新时,系统替换文字缓存,但保留视觉缓存,因此无需重新启动整个生成过程。
在团队披露的部署中,一台配有 8 张 RTX 5090 的服务器同时运行 8 路独立视频流,每张 GPU 负责一路。系统在 832 × 480 分辨率下以客户端可见的 24 FPS 播放,未限速的稳定测量为 24.63 FPS。团队估算服务器租赁成本约为每路每分钟 0.009 美元。
这些数字需要连同条件一起看:它们来自特定的八卡配置和一流一卡布局。报告没有给出计价地区、精度设置、端到端延迟等完整条件,因此 0.009 美元只能视为团队的场景化估算,不能直接当作普适部署价格。
它证明了什么?
报告展示了多种连续交互:用户一边用键盘导航,一边通过文字加入彩虹、火焰投射物,或让飞行中的坐骑喷火。关键不只是“能听文字”,而是新事件发生后,用户仍能继续移动并观察结果,生成过程不必从头开始。
量化评测目前主要覆盖导航。Zing-0.5 在 WBench Navigation 的 158 个图像条件案例中取得 81.0 的综合分和 88.5 的一致性分。综合分与 JoyAI-Echo-1.5 的四步版本相同,略低于其双向版本的 81.6;表中 HiDream-O1-World 为 80.9,Alaya-EVOKE 三步版本为 80.8。Zing-0.5 的物理合理性分数为 73.8,是报告所列系统中的最高值,但交互分数 84.2 并非最高。
这组结果说明它在该导航测试上具有竞争力,却不能单独证明文字事件控制同样稳定。联合控制目前主要由团队挑选的录制案例提供定性证据。模型权重、推理代码和 Zing-SGLang 服务实现据报告已发布,为后续复现留下了入口。
真正的难题,是让结果算数
Zing-0.5 值得关注,是因为它把两类互补的意图接到同一条生成流里:键盘回答“我往哪里走”,文字回答“我希望这里发生什么”。这让人可以看到结果后再决定下一步,形成探索、干预和反馈的循环。
但报告也清楚指出,短暂出现的变化不等于持久世界。模型主要依靠有限的视觉历史,没有单独记录物体状态,也没有明确执行世界规则。一件物品离开镜头后是否仍在原位,一次变化经过多次转向后是否仍然有效,目前没有机制保证。
局限与未知
- 24 FPS 和成本数字来自团队给出的特定部署,缺少足够条件,尚不能外推到其他硬件与运行环境。
- WBench 结果只覆盖 158 个导航案例;报告没有披露统计波动,也没有用量化指标验证在线文字控制。
- 连续演示证明选定案例可以运行,但尚未证明复杂场景下的泛化能力,以及早期操作的后果能否长期保留。
所以,“进入可玩时代”更适合看作一个方向变化:视频模型开始接受人在生成过程中的连续干预。Zing-0.5 已经把控制接口、增量生成和实时系统接到一起;距离一个能记住选择、遵守规则并长期维持后果的世界,仍有关键一步。