Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.059 — 2026-09-01
REPO 约 1 分钟

四步视频模型登上热榜

FastH3把同步音视频生成压到四次完整计算,但画质、声音与硬件门槛仍待观察。

IMAGE — HF Trending Models(模型榜单)

生成一段带声音的视频,通常要让模型反复计算很多轮,像画画时不断修改草稿。FastVideo 发布的 FastH3 Preview v1,试图把这个过程压到四次 Transformer forward——也就是输入完整通过模型网络四次——便从文字生成同步视频和音频。它切中了视频生成最直观的痛点:等待时间和计算成本。

这个预览模型训练到第 1300 步,采用 data-free DMD2 蒸馏和 VSA-H3,并达到 90% 稀疏性。蒸馏是让少步骤模型模仿原模型;稀疏性则让大量计算连接暂时不工作。不过,少算几步不等于任何机器上都会同样快:官方测试配置使用四张 B200 GPU,模型还依赖 FastVideo 的 VSA-H3 注意力后端。用户也可只下载配套 LoRA——一组叠加在基础模型上的轻量适配参数。

FastVideo 明确提醒,这一版本尚未蒸馏 FL2VA 和 Ref2VA;复杂运动、精细细节及部分音频可能仍不及基础 MiniMax H3。四步生成已经把速度问题推到台前,接下来真正值得看的,是它能否在更普遍的硬件上把速度兑现,同时守住画质和声音。


供稿材料 SOURCES — 1

← 返回 2026-09-01 · 开源板块