Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.056 — 2026-08-29
PAPER HF 18 约 6 分钟

代码Agent开始充当世界大脑

代码管世界如何变化,视频模型管它长什么样:Agent开始从工具调用者变成模拟器的“大脑”。

你在游戏里推翻一座城的统治者,然后远走他乡。几个月后回来,这座城不该只是换一张“混乱街道”的画面。谁接班、卫兵如何巡逻、商路是否中断、不同派系怎样重新结盟,都应当从此前的事件继续发展。现在的视频模型很会生成逼真的下一幕,却很难长期记住并推演这些看不见的后果。

Westlake AGI Lab 提出的 Code World Model,换了一个分工方式:让 coding agent——能编写、执行和修改程序的 AI Agent——充当“world brain”,用代码维护世界状态、规则和历史;再让视频模型把推演结果变成画面。说白了,一个负责世界究竟发生什么,另一个负责它看起来是什么样。

以下效果均来自论文作者自己的原型展示。材料没有给出定量指标、基线测试或第三方复现,因此更适合把它看成一条得到初步演示的新路线,而不是已经成熟的通用世界模拟器。

视频会续写画面,却未必理解世界

世界模型(world model)可以理解为一个供 AI 预演的模拟器:采取某个动作后,环境可能怎样变化?Agent 可以先在里面比较几条行动路线,再决定现实中怎么做,这就是规划(planning)。

视频模型天然适合表现环境。它从大量数据中学到人物、场景、运动和互动通常长什么样,这些经验叫作生成先验(generative prior)。但视频只记录结果,不直接展示背后的规则。游戏画面能告诉模型一支箭射中了敌人,却不会把射程、碰撞判定和生命值计算一并交出来。

问题到了长时间尺度会更明显。论文指出,当前视频模型的训练上下文通常短于一分钟,而一个事件的后果可能在世界中的几天甚至几年后才显现。角色离开镜头后做了什么,也没有连续画面可供追踪。仅靠不断生成下一帧,世界容易有画面,却没有真正持续运转。

把“大事判断”和“日常运转”拆开

Code World Model 的关键不是让语言模型亲自计算每一次移动。它把世界运行分成两个节奏。

coding agent 处理低频但复杂的决定:理解新事件,判断长期影响,选择已有机制,或者修改世界规则。例如城主遇刺后,它可以启动紧急状态,改变派系目标,并加入巡逻、继承与消息传播机制。

代码负责高频、重复且需要稳定结果的更新:坐标、朝向、碰撞、攻击距离、冷却时间、伤害与连续触发。代码执行式模拟,就是把状态和变化规则写成程序,再运行程序算出下一步。这样,“门已经打开”“物品已经消耗”之类的后果可以明确保存,而不必期待视频模型从旧画面中猜回来。

两者构成持续循环:事件发生后,Agent读取当前状态,调用或局部修改程序;程序推进大量变量;执行结果、测试和新反馈再成为下一次判断的依据。代码不是预先写死的游戏规则,而是 Agent 可以持续维护的外部执行系统。

这也是“世界大脑”这个说法真正有意思的地方。代码Agent不再只是临时调用一个工具完成任务,而是在维护一个会继续运行、还能改变自身机制的环境。当然,“world brain”仍是论文的概念性命名,现有证据远未证明它已能承担开放现实世界的复杂性。

代码怎样把结果交给视频模型?

直接把所有状态写成文字,看起来最省事。可论文称,近期视频世界模型即便另有相机控制通道,也难以仅凭密集文字准确执行逐帧的位置、运动和镜头轨迹。理论上,文字可以描述每个像素;实际上,这会消耗大量 token,也不利于实时交互。

完整搭建一套高质量 3D 世界又太重。它需要几何模型、素材、动画、材质和渲染系统,还会提前限制最终画面能长成什么样。

研究团队因此设计了 proxy representation,可译作“代理表示”。它像一份极简的动态舞台调度表,只记录当前画面必须服从的粗粒度信息:实体位置、姿态、轨迹、空间关系和相机运动。一个确定性的轻量编译器把它转换成 proxy video,再交给视频模型作为逐帧约束。

proxy 不负责纹理、材质、精细光照和局部动作。结构化文字告诉模型角色外观和动作含义,proxy 告诉它人在哪里、往哪走、镜头怎么动;视频模型再用生成先验补足视觉细节。论文将这种取舍概括为“条件带宽”:proxy 太简单,约束不够;细到逐关节控制,coding agent 又难以可靠维护。目标是只写下当前画面必须遵守的最少状态。

它证明到了哪一步?

团队构建了获得 proxy—observation pairs 的数据流程,即把代理条件与最终观察画面对齐。游戏数据可在同一次运行中同步记录目标视频,以及相机、实体和场景状态。现实视频则可借助 3D 重建与物体标注离线生成 proxy,不要求动作标签。不过,“使用现实视频构建数据”不等于系统已经通过真实世界任务验证。

论文称,MiniMax-H3 在配对游戏数据上微调后,面对 coding agent 搭建的简单交互世界,能够定性遵循角色位置、动作轨迹、场景布局和相机运动等 proxy 规格,同时保留较丰富的画面细节与动态。这里的关键词是“简单”“定性”和“原型”:材料没有报告成功率、数据规模、测试集、基线差距或消融实验,MiniMax-H3 的具体版本和微调设置也不明确。

为什么值得关注

这项工作的价值不在于它已经造出一个可任意模拟现实的世界,而在于重新划分了能力边界。世界模型不必把规则推理、长期记忆、数值执行和视觉生成全塞进同一个网络。代码可以保存因果后果并稳定运行;coding agent 可以在遇到新情况时修改机制;视频模型则继续发挥视觉表现力。

如果这条路线成立,Agent用于规划的预演场就可能从“调用几个固定工具”,走向一个可编程、可检查、可修改并持续演化的环境。它也给长期一致性提供了另一种答案:不只是让视频模型记住更多旧画面,而是把真正需要持续生效的状态放进可执行世界里。

局限与未知

  • 论文只给出简单交互世界中的定性展示,没有量化评测与独立复现,无法判断效果幅度和稳定性。
  • proxy 仍要求系统把重要世界状态转成合适的视觉约束;条件应当多细、复杂世界能否可靠维护,现有材料没有回答。
  • 每次生成新观察都要运行视频模型,计算成本与延迟高于传统渲染。论文认可这一代价,但没有提供实际速度或成本数据。

供稿材料 SOURCES — 1

← 返回 2026-08-29 · 学术板块