生成一段带声音的视频,通常要让模型反复计算很多轮,像画画时不断修改草稿。FastVideo 发布的 FastH3 Preview v1,试图把这个过程压到四次 Transformer forward——也就是输入完整通过模型网络四次——便从文字生成同步视频和音频。它切中了视频生成最直观的痛点:等待时间和计算成本。
这个预览模型训练到第 1300 步,采用 data-free DMD2 蒸馏和 VSA-H3,并达到 90% 稀疏性。蒸馏是让少步骤模型模仿原模型;稀疏性则让大量计算连接暂时不工作。不过,少算几步不等于任何机器上都会同样快:官方测试配置使用四张 B200 GPU,模型还依赖 FastVideo 的 VSA-H3 注意力后端。用户也可只下载配套 LoRA——一组叠加在基础模型上的轻量适配参数。
FastVideo 明确提醒,这一版本尚未蒸馏 FL2VA 和 Ref2VA;复杂运动、精细细节及部分音频可能仍不及基础 MiniMax H3。四步生成已经把速度问题推到台前,接下来真正值得看的,是它能否在更普遍的硬件上把速度兑现,同时守住画质和声音。