想象你对电脑说:“让一颗子弹穿过悬空的水球,镜头绕场景旋转半圈。”普通视频模型可以画出一段看似合理的影像,但水怎样破裂、子弹怎样运动、转到背面后场景是否仍然一致,都可能露馅。GS-Agent 换了一条路:它不直接猜下一帧像什么,而是让多个 AI 像一支小型特效团队那样分工,搭好三维场景,再交给物理引擎运行。
这里的“4D”不是多出一个神秘的空间维度,而是“三维空间加时间”:物体不只摆在那里,还会运动、碰撞、流动和形变。论文标题为《GS-Agent: Creating 4D Physical Worlds With Generative Simulation》,发表于 arXiv,编号 2607.21522。以下效果与数据均来自研究团队的论文及项目页,尚无第三方复现。
它不是画视频,而是在搭一个世界
生成式基础模型——从大量数据中学习通用规律、再按文字指令生成内容的模型——很擅长产出画面。但一段视频看起来像真的,不等于背后存在一个自洽的世界。模型可能画出漂亮的水花,却没有真正计算重力、碰撞或材料形变;用户想精确修改物体速度、相机路线,也不容易。
GS-Agent 把物理引擎放进生成闭环。物理引擎可以理解为游戏幕后那套计算规则:它根据重力、碰撞、材料等条件,决定物体下一刻怎样运动。系统的最终产物也不只是像素,而是一套可以执行的仿真脚本。场景能够继续运行,也能重新调整。
这套系统属于 Agentic system:它不是接到指令后一次性吐出答案,而是拆解目标、调用工具、检查中间结果,再反复修正。GS-Agent 使用 GPT-5 等基础模型理解要求并生成代码,底层采用 Genesis 物理引擎。
三个 Agent,像一支微型制作组
系统把工作交给三个专长不同的 Agent。
Manager Agent 像导演兼制片人。它理解用户要求,列出步骤,把任务逐项交出去,并检查结果。它还设置重力、时间步长和求解精度等全局参数,控制仿真前进或重置,最后启动录像。
Entity Agent 管“场景里有什么,以及它们怎样动”。它先从 BlenderKit 和 PolyHaven 素材库检索三维资产;找不到时调用 Meshy 生成模型,多次失败后再退回球体、方块等基础形状。随后,它调整物体尺寸、方向和位置,避免穿模,并为刚体、液体或可变形物体选择材料参数。这里的难点不只是给物体贴上“软”或“硬”的标签,而是要让参数与实际形变和求解器设置匹配。它还可以用代码控制位置、速度、力和粒子发射过程。
Render Agent 管镜头和灯光。它把“环绕拍摄”“跟随某个物体”这类自然语言要求写成随仿真时间执行的相机轨迹,也负责光源位置、颜色和强度。由于镜头运动由代码定义,系统可以只修改运镜,不必重做底层物理过程。
三个 Agent 通过消息协作,也会读取程序运行信息、物理边界检查、图片和视频等多模态反馈。关键思路很像真实制作流程:先分工搭建,再看片、找错、返工,而不是指望一个模型一步到位。
物理引擎也需要一层“翻译”
论文认为,直接把复杂的仿真器接口全部暴露给 AI,容易引发语法错误、离谱参数甚至引擎崩溃。因此,团队设计了结构化的 Agent-Simulator Interface,把底层操作包装成语义更明确的工具。
消融实验支持这一设计。完整 GS-Agent 的 State PIS 为 0.83;去掉多 Agent 分工后降至 0.42,去掉专门的 Agent-Simulator Interface 后为 0.57。State PIS 衡量理论上应保持稳定的物理量是否真的稳定;GS-Agent 可以直接从物理引擎读取每个时刻的三维质心运动,而只输出像素的视频模型无法取得这种内部状态。
完整系统的文本对齐分数为 29.9,美学分数为 47.6。去掉多 Agent 后,两项分别为 27.9 和 47.3;去掉专门接口后为 26.8 和 44.6。这说明分工和工具抽象带来的提升,主要不只是“画面更漂亮”,还包括物理稳定性和指令执行。
它和视频模型比出了什么
团队在两组场景上评测:NewtonGen 基准中的 24 个场景,覆盖 12 种物理规律;以及自行收集的 30 个复杂场景,包含多物体碰撞、非连续动态和运动镜头。对手包括文生视频模型 Sora-2、Wan2.2,以及软件工程 Agent SWE-Agent 和加入视觉反馈的版本。所有输出统一为 720p。
论文展示的案例包括海绵断裂、子弹穿过水球,以及相机旋转 180 度。研究团队称,视频模型有时能在表面上遵循文字,却会生成突兀断裂、不合理的流体变化,或在镜头转向后保留不应相同的背景。SWE-Agent 系列能调用仿真,物理结果较合理,却常在材料参数、渲染质量或完整执行指令上失手。GS-Agent 在团队报告的比较中兼顾了物理合理性、文本对齐和控制能力。
15 名参与者的用户研究也更偏好 GS-Agent 的物理合理性、镜头控制和内容对齐;纯美学方面,它略逊于参评的闭源前沿模型。论文原文未完整给出量表点数,因此这里不延伸解读评分幅度。
真正有意思的是“能继续改”
GS-Agent 的优势不止是生成一段成片。用户还可以用自然语言增加实体、改变速度或修改相机路线。系统会产出深度图、分割掩码、表面法线和粒子级动态等对齐数据。研究团队据此提出,它未来可能服务于机器人训练与评估;不过这仍是应用愿景,并非论文已经验证的结果。
论文还展示了一次自动排错:导入的浴缸模型并不完全防水,仿真中的水从角落漏出。系统识别问题后,用代码在几何体角落增加刚性材料补丁,并再次运行验证。这个例子说明,把生成、观察和修复串成闭环,可能比单次生成更重要。
局限与未知
- 所有结果目前都来自研究团队自身。论文虽提供基准、消融和用户研究,但尚无第三方复现;“电影化”“丰富交互”等描述也带有主观色彩。
- 系统的上限受物理与图形仿真技术限制。仿真内部一致,不等于它完整还原真实世界;材料模型或参数不准,结果仍可能偏离现实。
- 基础模型需要判断运动是否正确、镜头是否自然,但论文承认这种自我批评能力仍不完善。“一句话生成”也是媒体化概括:论文支持从自然语言描述出发,却未证明输入必然只有一句,也未明确所有场景都能全程无人介入。