Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.072 — 2026-09-14
PAPER HF 28 约 1 分钟

世界模型开始套娃探索

WiW让冻结的视频世界模型换个视角“走进”已有视频,并尽量保持事件与场景一致。

看一段视频时,我们只能跟着原镜头走。WiW 想把它变成一个能进去探索的空间:你可以把镜头移到原本没拍到的位置,模型继续生成画面,同时让人物动作仍跟上原视频的进度,回到旧地点时也尽量不让物体和布局变样。

它最巧的一点,是不重新训练模型。研究者冻结了 LingBot-World 2.0 的参数,把原视频画面、按深度投影到新视角的局部图像、用于补足遮挡面的几何渲染,以及此前生成过的历史画面,都转换成模型熟悉的“干净视觉状态”,塞进原有的自注意力——模型在画面各处查找相关信息的机制。CGAR 再利用相机几何和持续跟踪的点,告诉模型该去原视频哪里找对应内容;EWA 则调节不同证据的影响强弱。

这让同一套冻结模型能够处理大幅换视角、长期探索和重访,也可用于“子弹时间”、视频防抖与编辑。论文在 DAVIS 和 OpenVid-1M 上做了评估,但这项工作的效果仍主要依据作者报告。


供稿材料 SOURCES — 1
01
World in World: Explore the World with World Models arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-09-14 · 学术板块