Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.041 — 2026-08-14
PAPER H 5 约 6 分钟

Sekai2:边探索边学世界

Sekai2把长视频、镜头路线和分时标注接到一起,让世界模型不只看风景,还能记路、重访和继续探索。

你沿街走了十分钟,拐进公园,又从另一条路回到刚才的路口。人一眼就知道这是同一个地方。但对生成视频的 AI 来说,难点不只是把画面接下去:它还得记住路口原来的样子,分清树叶晃动和镜头转向,并在你改变路线后继续生成合理的世界。

Sekai2 要补的正是这类训练材料。它不是一个新的世界模型,而是一套面向交互式世界建模的真实视频数据集。所谓视频世界模型,是根据已有画面和动作预测接下来会看到什么的系统,可以把它理解成一个会生成画面的环境模拟器。要让这种模拟器从“播放一段视频”走向“让人进入并探索”,训练数据也得从零散镜头变成有路线、有时间线、还能重访旧地点的连续观察。

以下规模、覆盖范围和质量判断均来自 Sekai2 论文,尚无第二个独立信源交叉验证;论文也没有报告用该数据训练下游模型后的效果。

缺的不是更多视频,而是三样东西同时出现

网上并不缺视频。问题在于,常见的大规模视频语料虽然内容丰富,却往往没有相机轨迹,也没有精确到时间段的文字说明。另一些空间数据会记录镜头位置,但通常服务于场景重建、视角合成或短距离控制,不以分钟级的持续探索为重点。

Sekai2试图把三类信息放到同一条时间线上。

第一是长时间连续画面。数据集共收录 128,892 个发布片段,来自 10,428 个源视频,总计 2,826 小时,覆盖 113 个国家或地区。这里不能简写成“113 个国家”,因为论文混用了国家与地区口径。若把所有视频统一切成最长 120 秒、彼此不重叠的分析段,其中 43,594 段完整达到两分钟,共 1,453 小时,占全部影像时长的 51.4%。这个比例说的是时长,不是片段数量。

第二是相机轨迹——相机每一刻在哪里、朝向哪里,就像给摄影师画出一条移动路线。模型有了这条路线,才更容易区分“街上的车动了”和“只是镜头向右转了”。论文称,每个发布片段都配有相机轨迹。团队使用 ViPE 估计相机内外参数和逐帧位姿,并通过质量检查排除无效、突跳或明显漂移的结果。

第三是时间对齐语义。它不只给整段视频写一句简介,还标出某项变化发生在哪段时间。Sekai2把说明拆成主体运动、环境动态、静态场景内容和相机行为,并形成 649,597 个时间对齐语义段。比如,同一段画面可以分别说明“行人穿过街道”“树叶随风摆动”“路口与建筑保持不变”以及“镜头向前移动后左转”。这些字段帮助模型判断是谁在动、什么没变,以及变化究竟来自世界还是镜头。

需要注意,128,892 个发布片段、43,594 个两分钟分析段和 649,597 个语义段属于三种层级,不能当成同一种“片段”相加或比较。

真正关键的一步,是让路线绕回来

Sekai2最值得看的部分不是规模,而是 982 个全景序列。团队沿带有环路、转弯和重复到访的非线性路线采集全景视频。全景画面保留四周环境,不必靠镜头不断转向才能看到侧面;更重要的是,采集者会离开一个地点,经过一段路后再从不同方向回来。

这相当于给世界模型出了一道记忆题。只沿直线向前生成时,模型可以不断依据最近画面续写;一旦回到旧地点,它就必须让先前出现过的建筑、道路和空间关系重新对上。论文认为,这种重复观察可为持久场景表示、长期空间记忆和几何一致性提供关键监督。这里的“监督”,就是训练时可供模型学习的正确线索。

长路线也会带来测量误差。相机位置的微小偏差会一路累积,最终让本应闭合的路线对不上。Sekai2先寻找相隔较远、但可能拍到同一地点的画面,再用几何关系核验这些“回环”是否真实,最后据此修正轨迹。没有可靠回环的序列则保留原始估计。论文摘要没有明确说明这 982 个全景序列是否已经包含在前述 128,892 个片段和 2,826 小时统计中,因此不宜自行合并口径。

它把数据整理成了可控制的训练材料

团队并非简单汇总视频,而是把 Sekai 的既有探索影像、新收集的视频和全景采集放进统一管线。管线先识别剪辑转场,避免模型把跳切误学成世界瞬间变化;随后过滤编码异常、严重曝光问题、黑边、长期存在的界面元素、字幕、水印和大块屏幕文字,再估计相机轨迹并生成分层标注。

标注同时提供整段和局部时间区间两个层级。完整提示词包含场景、运动与相机信息;短提示词去掉相机描述。这样一来,训练者既可以让模型照着指定镜头路线生成,也可以只描述场景,让相机条件单独替换。交互式生成——画面随着用户或智能体的动作继续演化,而非一次性播放固定视频——需要的正是这种可拆分控制。

为什么值得关注

Sekai2指向了世界模型的一道基础门槛:模型要“进入世界”,不能只学下一秒长什么样,还要知道观察者怎么移动、变化何时发生,以及离开后再回来时世界是否仍然成立。

它的贡献因此更像训练基础设施,而不是一次模型成绩刷新。论文列出的潜在用途包括长时程视频生成、相机可控合成和交互式世界模型预训练。把长程连续画面、镜头路线、分时语义和重访结构接在一起,为这些方向提供了一套可复用的数据组织方式。

局限与未知

  • 论文声称数据具有完整的位姿与字幕覆盖、广泛的地域和语义多样性,以及高度非冗余的时间描述。这些属于作者的语料分析结论;材料没有给出足够完整的阈值、对照数据和全部指标,不能把它们写成外部验证事实。
  • 论文只做了视觉质量、轨迹和标注等数据层面的推理式检查,没有报告训练世界模型后的生成质量、控制能力或重访一致性提升。Sekai2是否真能让模型“记得旧路”,仍需下游实验回答。
  • 数据来自多种来源,地理分布也可能不均。覆盖 113 个国家或地区说明范围广,却不等于各地获得了均衡、同等质量的呈现。

供稿材料 SOURCES — 1
01
Sekai2: From World Exploration to Interactive World Modeling arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-14 · 学术板块