你拍下一只来回摆动的袋子。普通的视频模型可以重放它,也可能换个角度生成一段相似画面。但如果你伸手推一下袋子,它并不知道这股新力该怎样传遍袋身。LaGSplat 想跨过的正是这道坎:从一段或少量普通视频里,同时恢复物体的外观和运动规律,让用户在之后施加视频中从未出现过的力,并立即看到物体移动或变形。
这里的“普通视频”是单目视频,也就是只由一台摄像机拍摄、没有双目设备直接提供深度。仅凭这样的画面推断三维形状,本就像闭上一只眼判断远近;LaGSplat 还要进一步辨认物体怎么运动、受力后会怎么响应。它试图把视频世界模型从“生成看起来合理的下一帧”,推进到“运行一个可以动手干预的物理模型”。
本文事实与效果均据 LaGSplat 论文。目前材料没有外部复现或第三方评测,文中的“实时”“合理”等表述仍是作者报告的结果。
不再按时间播放,而是按状态生成
很多动态场景重建方法把时间当作按钮:输入第 20 秒,就还原第 20 秒的场景。效果可以很逼真,但本质上仍是在翻阅录好的影片。用户施加一股新力后,系统没有对应的“第几秒”可以查询。
LaGSplat 换了一个索引。它不用时间直接控制画面,而是先把物体当前的运动状态压缩为潜状态 。潜状态可以理解为一组精简的内部数字:不保存每个像素的变化,只保留足以描述主要运动的少量坐标。摆锤可能只需要一个角度;可变形物体则需要若干被视频实际激发的运动模式。
同一个 同时承担两份工作。第一,它是学习到的耗散拉格朗日系统的广义坐标。拉格朗日力学是一套用动能、势能等量描述运动的经典框架;“耗散”则允许系统因阻尼逐渐损失能量,而不是永远振荡。第二, 控制 Gaussian Splatting 解码器,把当前状态重新渲染成画面。
Gaussian Splatting 可以理解为用许多带颜色、透明度和形状的三维小斑点拼出场景。关键不只是它能渲染,而是这些斑点是随物体移动的显式点。一个斑点对应物体上的某个位置,因此用户的力有了明确的落点。相比之下,只在固定像素或连续场中计算颜色的表示,不会天然告诉系统“被推的是哪一块物质”。
一股力怎样进入画面里的物体?
这是 LaGSplat 最关键的一步。潜状态稍微变化,Gaussian 点的位置也会随之变化。两者之间的局部关系由雅可比矩阵 表示——它可以理解为一张转换表,记录每个潜坐标改变一点,会把画面中的点往哪里带、带多远。
当用户在物体某处施加力 时,系统通过
把它转换成潜空间里的广义力,再送进运动方程。这样,用户推的是画面里的具体位置,真正被积分计算的却是那几个紧凑的潜坐标。随后解码器再把新的状态还原成 2D 或 3D 画面。
这套转换依赖的是物体“怎样随状态移动”,而不是训练时见过哪些外力。因此,按照作者的解释,即使训练视频里从未有人推过物体,系统仍可在推理时接收新力,无需重新训练。论文展示的案例覆盖刚体、可变形体、自由运动和受到外力的真实系统,包括摆锤、振荡刚体、悬挂袋子及气动执行器;部分受迫系统实验还结合了传感器测量。
作者将这一点概括为两种结构的拼接:Gaussian Splatting 提供可以落脚的运动点,Euler–Lagrange 方程提供可以接收外力的动力学右端。只有画面而没有机械方程,力无处进入运动规律;只有方程而没有显式运动点,用户点击画面后,力又难以可靠地映射回内部坐标。
物理结构为什么重要?
另一条路线是让神经网络自由预测下一个状态。它更灵活,却未必知道系统应该损失能量、趋向平衡,长时间外推可能越跑越远。LaGSplat 主动缩小模型的自由度:只在少量广义坐标上学习带耗散的 Euler–Lagrange 方程。
这是一种明确的交换。模型不再试图覆盖所有可能运动,而是用经典力学结构约束预测。作者报告称,在训练视频没有展示最终平衡状态的案例中,无机械约束的预测器会发散,LaGSplat 则能按结构趋向稳定平衡;对于训练中未见的外力,也能给出有界响应。论文同时称,系统可以在任意时刻改变力的方向和大小,并实时渲染 2D 或 3D 响应。
这项工作的意义不在于生成更像真的碰撞视频,而在于辨认“这一个被拍摄物体”的运动规律。很多物理视频生成方法把预设的模拟器或跨场景学到的先验带进新画面,得到某种看起来合理的运动。LaGSplat 选择相反方向:用该物体自己的录像学习模型,再让新外力沿这套已识别的动力学传播。它牺牲了对陌生物体的即用性,换取与被拍对象自身运动的对应。
局限与未知
- 视频只展示了哪些运动,模型就只能学到哪些运动模式。始终不动的部位或从未出现的变形方向没有对应潜坐标;对这些位置施力时,模型可能把它们当作无限刚硬,场景不产生响应。
- 仅凭自由运动视频不能确定力的绝对单位。预测的方向和响应形状可以由运动关系决定,但幅度仍差一个全局比例。一次“已知力—位移”测量可以校准它;没有测量时,只能手动选择尺度。因此,“任意大小的力”不应理解为无限幅度下都可靠。论文也明确把可信范围限定在状态没有远离训练数据覆盖区域的情形。
- 论文的 3D 设置需要深度或多视角监督,实验中用每帧生成的合成新视角辅助训练。现有材料未给出帧率、分辨率、延迟、三维重建误差或系统化基线数字,也不足以验证真实物理参数是否可辨识。“实时”依赖什么硬件,以及作者所称 CNN、NeRF 解码器“不能做到”是否只针对其设定,仍需完整评测与独立复现。