Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.092 — 2026-10-04
PAPER H 1 约 7 分钟

向世界提问:让模型主动验证物理规律

ATW 不再让模型看视频猜答案,而是搭建可运行世界,用实验验证物理判断。

你看见一辆玩具车冲向斜坡。现在问 AI:如果车更重,它会落在哪里?只盯着视频,模型很容易凭画面和语言经验猜答案。真正困难的是,质量、摩擦力和弹性这些性质并没有写在画面上。它们只能从运动中反推;而“如果更重”描述的事情,视频里根本没有发生。

论文《Asking the World》提出另一条路线:别急着回答,先搭一个能运行的假想世界,再到里面做实验。研究团队把这套系统称为 Asking the World(ATW)。它把视频物理推理分成两步:World Modeling 负责还原一个够用的物理世界,World Probing 负责主动试验,寻找能回答问题的证据。

这项工作的数字、比较和方法细节都来自研究团队发表的单篇论文,尚缺独立复现。下面提到的提升均为作者报告的百分点差值。

先造世界,但不必复制整个世界

ATW 的第一步不是把视频中的一切都重建出来。它先看问题,再决定哪些东西值得建模。

如果问题关心碰撞后的方向,系统可能需要物体身份、位置、速度和碰撞关系。如果问题关心布料、绳索或流体,它就要换用相应的物理表示。这里的“表示”,可以理解为系统决定用哪套规则描述一个东西:台球适合按刚体处理,布料则不能当成不会变形的硬块。

模型会借助视觉工具取得物体遮罩、运动轨迹和场景几何。遮罩告诉它物体边界在哪里,轨迹说明物体怎样移动,几何信息则帮助确定空间关系和初始状态。它还会显式绑定视频里的对象与模拟器里的对象,避免在后续实验中改错目标。

更棘手的是潜在物理属性——质量、摩擦力或弹性等无法直接从像素中读取的性质。ATW 为此使用基于 CEM 的系统辨识。系统辨识,就是反过来根据已经看到的运动,估计背后的物理参数;CEM(交叉熵方法)则会反复采样候选参数,让模拟轨迹与视频轨迹比较,再把搜索范围逐渐收缩到表现更好的区域。

这有点像调一台看不见内部设置的弹球机:不断试不同参数,看哪组设置最能复现眼前的运动。论文还强调,如果误差一直降不下来,问题未必只是参数不准,也可能是一开始认错了物体,或选错了物理表示。建模智能体可以回头修正,再重新拟合。

关键变化是:模型开始做针对性实验

完成建模后,ATW 会提交一个“可执行世界”——它不是一段关于物理过程的文字解释,而是一套真的可以继续运行、修改条件并观察结果的模拟环境。

第二阶段 World Probing 随后接手。面对性质问题,它可以直接读取拟合出的属性;面对预测问题,它可以让世界继续运行;面对反事实问题,它会复制一个分支,修改条件后再比较结果。基础世界不会被破坏,不同问题和不同干预产生的轨迹也分别保存。

主动探测的价值,在于多个解释都说得通时,系统不会立刻押注,而会选择更能区分它们的测试。就像医生面对两个相似诊断时追加一项针对性检查。ATW 也不会依赖预先写死的操作流程,而是根据场景、问题和执行反馈,决定下一步观察什么、改动什么。

支撑这些操作的是 PolyWorld Engine。它是研究团队基于 Warp 开发的轻量级多物理场模拟器,可以把刚体、软体、布料、绳索、流体及其耦合交互放进同一个场景。模拟器向智能体提供的是绑定物体、读取属性、继续运动、创建干预分支和比较结果等语义操作,而不是要求模型直接操纵底层代码。

提升主要来自“运行起来”

在 CLEVRER 上,ATW 使用 Gemini-3-Flash 作为基础视觉语言模型(VLM,即同时处理图像或视频与文字的模型),取得 80.82% 的整体逐题准确率。逐题准确率要求一道题的所有选项都判断正确。这个结果比直接使用 Gemini-3-Flash 高 46.50 个百分点,比 GPT-5.5 高 13.58 个百分点,也比训练自由方法 PhysMind 高 8.27 个百分点。

CLEVRER 主要考察刚体碰撞中的解释、预测和反事实推理。ATW 在反事实问题上达到 75.16%,比 GPT-5.5 高 23.83 个百分点。这类问题恰好最需要运行一个“原视频里没有发生”的分支,因此也最能体现可执行世界的作用。

在覆盖连续介质和不同材料的 ContPhy 上,ATW 的整体准确率为 70.56%,比直接使用 Gemini-3-Flash 高 28.10 个百分点,比 GPT-5.5 高 3.53 个百分点。不过它并非全面领先 GPT-5.5:在反事实题上低 6.46 个百分点,在目标驱动题上低 1.93 个百分点。

论文还评测了三个真实场景,共 60 段视频和问题:台球反事实、弹球预测和玩具车预测。ATW 分别取得 85%、70% 和 60%,整体为 71.67%;GPT-5.5 的整体结果是 43.33%。这个样本不大,但至少说明该方法并非只在合成画面中运行。

消融实验进一步回答了提升来自哪里。在 CLEVRER 的 100 个场景子集上,只给模型视频时,整体准确率为 35.40%;加入结构化感知信息后为 42.07%;建立并运行一次世界后升至 75.40%;允许系统根据反馈调整建模与探测后达到 82.30%。ContPhy 子集也呈现同一顺序:47.08%、51.38%、59.08% 和 68.00%。换句话说,识别得更细有帮助,但更大的变化来自把物理假设真正运行起来;主动修正又在此基础上继续增加收益。

为什么这条路线值得看

过去的两种常见做法各有短板。直接让 VLM 回答,物理规律仍藏在模型内部,很难检查它到底依据了什么。固定工具流程虽然能提供明确证据,却往往预先指定了表示、材料或推理步骤,换一种现象就可能不再适用。

ATW 的新意不只是“给大模型接一个模拟器”,而是让问题反过来决定世界该怎么建、实验该怎么做。世界模型——预测采取动作后环境如何变化的内部模拟器——由此不再只是生成未来画面的机器,也成了可以提出假设、运行分支和核对证据的工作台。

这也改变了物理推理的基本姿势:答案不再只是模型对视频的一次性判断,而是一次可以追踪的过程——先提出一个足够回答问题的世界,再向这个世界提问。

局限与未知

  • 全部结果来自同一研究团队。论文虽给出评测协议、样本规模和消融实验,但材料未提供随机波动、统计显著性以及外部复现结果。
  • 不同基础模型接收的输入并不完全一致:Gemini 基线接收视频,GPT、Qwen 和 GLM 接收八帧均匀采样画面。各模型的具体版本、提示设置和工具权限也不足以完整核验,因此跨模型比较需要谨慎。
  • 真实世界评测只有三个场景、60 段视频和问题,且预测准确率低于台球反事实任务。它能说明方法在这些场景中有效,但还不足以单独证明广泛的“通用物理推理”能力;论文也明确指出,未经独立验证,不应把它用于安全关键场景。

供稿材料 SOURCES — 1

← 返回 2026-10-04 · 学术板块