把一个球从空中松开,AI 生成的视频可能很像实拍:球向下掉,碰地,再弹起来。但若逐帧测量,你可能发现它下落得太慢,反弹时机也不对。过去不少评测主要问“看起来真不真”;GAUGE 想问得更严格:画面里的物体,是否真的按现实中的速度、碰撞和形变运动?
GAUGE 是一个以真实实验测量为参照的诊断型基准。所谓诊断型,不只是给系统一个总分,而是把问题拆开,检查它究竟错在碰撞、摩擦、动量传递,还是材料形变。研究者用它同时检查两类系统:按数学规则计算运动的物理引擎,以及根据初始画面预测后续视频的世界模型——也就是让 AI 在“脑中”预演接下来会发生什么。
论文提供了相当完整的实验和评测设计,但所有结果目前都来自作者在 arXiv 发布的这一项研究,尚无材料显示已有第三方复现或同行评审确认。
先把现实世界量下来
GAUGE 收录 22 个受控任务族,覆盖刚体、柔性绳索、织物和三维可变形物体。场景从斜面滑块、弹跳球和牛顿摆,一直延伸到甩动布料、拉伸泡沫和弯曲悬臂梁。它们分别考察碰撞、摩擦、振荡、自接触与形变等过程。
关键不只是场景多,而是每个场景都有现实参照。研究团队用 16 台红外相机,以 180 Hz 记录实验;定位精度达到亚毫米级,处理后轨迹统一为 30 fps。每项评测任务采集 20 次独立真实实验。整套数据约含 1560 次动作捕捉试验,并附有测量不确定性。
团队还测量了物体尺寸、质量和密度,并通过斜面、碰撞、织物测试和拉伸实验,校准摩擦、恢复、织物刚度以及软体材料参数。换句话说,这把“尺”不只记录球去了哪里,也记录实验中的球、布和泡沫究竟是什么性质。
物理引擎也会偏科
研究者在其中 14 个任务族上测试 Isaac Sim 6.0.0、Genesis 1.12.0 和 Newton 1.3.0。场景使用实测初始状态和物理参数重建,其余设置保持默认,不针对单项任务调优。评测主要比较模拟轨迹与多次真实实验平均轨迹的差异,并允许通过动态时间规整(DTW——在不打乱先后顺序的前提下对齐快慢不同的两段运动)区分空间偏差和时间错位。
结果没有出现通吃各类任务的引擎。普通接触和滑动相对容易:Isaac Sim 在转盘任务中的归一化 RMSE 为 0.17,Genesis 在斜面滑块上的 RMSE 为 0.58。这里低于 1,表示模拟与现实平均轨迹的差异,小于真实实验自身的典型波动。
冲击和快速形变则明显困难。弹跳球任务里,即使最好的结果,RMSE 仍是现实波动基线的 15.63 倍。牛顿摆中,Isaac Sim 与 Newton 的归一化动量传递效率只有 0.20 和 0.26,Genesis 没有生成有效运行结果。
布料的“偏科”更突出。静态拉伸时,部分引擎的误差接近现实波动;到了快速甩布,表现最好的 Genesis,RMSE 也达到基线的 8.54 倍,Isaac Sim 则达到 128.26 倍。体积可变形物体的最佳结果同样大致高出相应现实基线一个数量级。一个引擎能算好缓慢弯曲,并不意味着它能算好快速、局部而复杂的形变。
会写对公式,不等于算对物理
世界模型的测试范围更窄。研究者只在 5 个刚体任务上评估 6 个模型:Cosmos3-Nano、Cosmos3-Super-I2V、Wan-2.2、Wan-2.7、Seedance 2.0 和 Genie 3。模型从同一张初始图和标准化文字提示生成未来视频,研究者再用 SAM3 分割并追踪物体,把像素运动换算成二维现实轨迹。
GAUGE 特意分开检查两件事:轨迹是否符合预期方程的形式,以及方程里的数值是否正确。比如自由落体的位移应随时间平方变化。模型可能画出一条形状正确的曲线,却把加速度算错,就像列对了解题公式,却代入了错误参数。
弹跳球实验正好暴露了这种差别。Cosmos3-Super-I2V 加入负向提示后,在衡量额外曲率的 QFI 指标上最好,但推断出的加速度仍不正确。Seedance 2 给出的加速度最接近实测值,却依然远低于重力加速度。
钟摆也类似。Wan-2.2 和 Genie 3 的振荡拟合度均达到 0.99,看上去很像周期运动;它们给出的周期却分别是 1.93 秒和 1.90 秒,而实测为 1.06 秒。最接近的 Wan-2.7 也要 1.83 秒,约长 73%。世界模型学到的可能只是“钟摆应该来回摆”,还没有掌握它应该以多快的节奏摆。
提示词也不是稳定的补丁。同一条约束不合理运动的负向提示,能把 Cosmos3-Super-I2V 在弹跳球上的 QFI 从 270.69 降到 12.50,却会把它在木质斜面滑块上的 QFI 从 13.61 推高到 569.36。效果取决于模型和任务,因此不能只挑一次有利生成来判断物理能力。
为什么这把尺值得关注
物理保真度问的不是画面漂不漂亮,而是运动是否与真实测量一致。这个区别对具身智能尤其重要:机器人若长期在错误的碰撞、摩擦或材料规律中训练,可能学会利用仿真瑕疵;到了现实环境,原本有效的策略就可能失灵。
GAUGE 的价值,正在于把“哪里不对”说得更具体。它显示物理引擎并非天然可靠,也显示生成式世界模型可以掌握方程外形,却错过加速度、动量和时间尺度。统一的现实实验基础,还让两类原本分开评测的系统有了可比较的诊断框架。
局限与未知
- 这还不是经过多方验证的行业统一尺度。现有结论只适用于论文测试的三款物理引擎、六个世界模型及所选任务,不能外推到全部系统。
- 世界模型目前只测了 5 个刚体任务,并依赖二维轨迹;布料和三维软体涉及深度变化、遮挡、自接触与分布式形变,尚未纳入同等评测。
- 材料和参数范围仍有限,流体以及流体与刚体、软体的耦合过程也不在当前版本中。GAUGE 更像一把刚开始刻度化的尺,而不是物理真实性已经有了最终答案。