Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.029 — 2026-08-02
PAPER 约 7 分钟

CG-World:给世界模型一份总账

CG-World把画面背后的状态、动作与因果分支记进同一本账。

你看到杯子被拿起、倾斜,最后水洒了。普通视频只留下这几秒画面,却不会告诉 AI:手用了什么动作,杯子何时接触桌面,摩擦力怎样变化,又是什么触发了泼洒。对“世界模型”来说,这正是缺掉的一页账。世界模型要学习“采取某个动作后,环境会怎样变化”,不能只模仿画面。CG-World 的思路,是把状态、动作、事件和观测放进统一协议,让 AI 不只看到结果,也能追踪结果如何发生。

这项工作来自 Yiming Cai 等人的一篇 arXiv 论文,数据与实验目前都只有作者这一处信源。论文披露了具体设置和指标,但尚无独立复现。

不只保存成片,也保存片场总账

现有数据往往各管一段。视频数据擅长记录“看见了什么”,机器人轨迹会补上部分动作,模拟器则能提供内部状态,但不同引擎和参数体系很难直接互通。CG-World 想补的是结构性缺口:把同一段变化过程中的多类信息,按统一时间线对齐。

它的数据来自获准用于研究和再分发的工业计算机图形制作项目。工业 CG 流程不只产出最终视频,还会留下角色骨骼、控制器、运动曲线、相机、灯光、物理缓存和接触事件等中间记录。论文把这些记录整理成“世界状态”——某一时刻环境中所有关键事实的集合,相当于生成画面背后的总账。

协议把数据分为七类:实体、结构、静态属性、动态状态、关系、事件与规则,以及观测。这里的“观测”包括 RGB 画面、深度、分割、法线、光流和点云等。多通道渲染(multi-pass rendering)则把颜色、深度、阴影等成分分别输出,让模型看到成片背后的结构。

这个区分很关键。画面只是从某个相机角度得到的结果,不等于世界本身。同一个场景换相机、灯光或遮挡,观测会变,底层状态却可能不变。CG-World 因而把 latent states、observations、relations、events 和 branch metadata 分开记录,再用统一时间码重新装进同一个时空样本。

约 85 万段,但每段都不长

CG-World v1 包含约 850,000 个有效片段,每段 1—5 秒,中位时长 2.6 秒。其中 433,500 段具有完整的多模态对齐,510,000 段包含物理重算;95% 的有效片段覆盖同一镜头的多个动作版本,每段有 3—5 个 take。

为减少数据泄漏,作者按制作项目、共享资产、历史版本和同源分支分组切分。训练、验证和测试集分别为 637,500、127,500 和 85,000 段,占 75%、15% 和 10%。v1 主数据没有通过程序化随机场景或重新模拟来扩增,状态与观测来自通过制作质量控制的保存记录。

它还定义了三级能力。L1 只要求观测、相机参数、坐标系和统一时间;L2 再加入动作、动态状态、关系和事件;L3 进一步记录干预变量、不变量、分支谱系和替代结果。换句话说,数据不只是“发生过什么”,还可以记录“如果改一个条件,会发生什么”。

把“如果当时”变成可核对的数据

CG-World 将分支分成事实轨迹、观测干预、动作干预、机制干预和严格反事实。观测干预只换相机、灯光或图像退化方式,不改底层轨迹;动作干预会改变抓取位置、速度或释放时机;机制干预则改变质量、摩擦、黏度或约束规则。

“严格反事实”要求更严:先保存真实发生的那条轨迹,再固定外部环境和未被干预的机制,只替换一个动作、状态或机制变量,并记录个体层面的不同结果。这像把同一场事故倒回原点,只改一个条件,而不是另拍一段看起来相似的视频。

v1 的干预与反事实子集来自桌面容器操作场景,包括 1,000 个同源分支组、100,000 条观测干预分支、5,000 条严格动作反事实分支和 5,000 条严格机制反事实分支。它还记录滑落、泼洒、碰撞和过早释放等失败结果。约 9% 的子集来自历史项目版本,其余由程序生成。

三组实验说明了什么

第一组实验用 LTX-2.3-22b-dev 做受几何条件控制的视频生成。LPIPS 和 FVD 都是生成结果与真实视频之间的距离,数值越低越好。表中 Mixed Depth/Canny 训练在两种控制下都给出最低数值:Depth 的 LPIPS/FVD 为 0.278523/326.324,Canny 为 0.304219/368.162。值得注意的是,论文正文称“CG-World 单模态监督最好”,并把相对 Official Union 的降幅写成 37.57% 等;这些百分比实际对应表中的 Mixed Union,而不是 CG-World 单模态行。表格与文字存在内部不一致,因此不宜据此下更强结论。

第二组实验让 Cosmos3-Nano 根据当前画面和文字指令预测未来 16 步动作。相比 LIBERO-LoRA,CG-World-LoRA 的动作均方误差从 0.08061 降至 0.05326,平移误差从 0.34084 降至 0.27152,旋转误差从 4.53336° 降至 2.13520°;夹爪 F1 从 0.89354 升至 0.95726。作者据此认为,连续的状态与动作记录能提供单条演示轨迹缺少的运动结构。

第三组实验把这种运动经验迁移给 OpenVLA-7B。加入 CG-World 预适配后,PickCube 成功率由 4.0% 升至 39.0%;在训练中未见的 StackCube 上,基线均为 0%,该方案达到 25.0%。抓取后的 Lift 成功率也由 68.7% 升至 88.3%。这些结果支持“结构化监督可以迁移”的判断,但实验仍限于论文设定的模型、任务和模拟环境。

为什么值得关注

CG-World 最有意思的地方,不是又增加了一批视频,而是改变了数据的记账方式。它要求每个状态、动作、事件、观测和因果分支都有可追踪的位置。若这种协议能被更多工具链采用,研究者就可能在同一份数据上分别研究生成、动作预测和反事实推理,而不用每次重新拼接互不兼容的记录。

局限与未知

  • 这些状态来自工业 CG 制作,不是真实世界的物理真值。论文也承认数据带有叙事选镜、修饰动作、引擎与求解器偏差,以及合成流程造成的状态—画面错位。
  • 论文计划在录用后、最迟 camera-ready 阶段发布完整 v1。L1/L2 和部分 L3 将采用非商业学术研究许可;完整项目文件形式的原始 L3 数据需要用途审查和受控访问协议。当前公开下载状态不能从材料中确认。
  • 作者计划继续采集并通过社区协作扩展数据,还准备以真实—虚拟配对衡量偏差。这仍是后续计划,CG-World 尚不能被视为已经获得行业采用的共享基础设施。

供稿材料 SOURCES — 1

← 返回 2026-08-02 · 学术板块