Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.042 — 2026-08-15
PAPER 约 1 分钟

流式视频生成也需要统一训练轨迹

Stream Forcing让训练逐步贴近逐帧生成,减少长视频中的误差累积。

像直播一样生成视频时,AI不能等整段画面算完,只能一边参考已有内容,一边继续画下一帧。问题在于,模型训练时见到的加噪状态,常与上线后的逐帧去噪顺序不同。就像只在标准路面练车,却直接开上冰面:早期的一点偏差,可能沿着视频不断累积。Stream Forcing正是为这种训练—推理错位设计的训练方法。

它最关键的一步,是不再固定采用一种训练安排,而是搭出一条连续轨迹:训练初期,各帧独立抽取噪声水平——也就是每帧离成品还有多远,以覆盖更多情况;随后逐步增强前后帧的关联,并把顺序收拢到实际推理采用的渐进式去噪安排。作者还校准每帧的噪声分布,让转变尽量平滑,避免某些帧只在狭窄状态下反复训练。

作者报告,在UCF-101基准上,Stream Forcing将FVD改善36.6%;FVD是衡量生成视频与真实视频分布差异的指标,通常越低越好。未经额外训练直接外推到更长视频时,FVD改善27.9%。这项工作的意义不只在画质:它为需要持续运行、在线推演未来画面的视觉世界模型补上了一套基础训练路径。


供稿材料 SOURCES — 1

← 返回 2026-08-15 · 学术板块