Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.058 — 2026-08-31
PAPER HF 43 约 7 分钟

GameWAM:游戏世界开始边玩边想

GameWAM让游戏智能体一边操作、一边预测后果,并在每次反馈后重新规划。

你让 AI 在《Minecraft》里捡起一件物品,再打开菜单使用它。它不只要认出眼前画面,还得记住物品已经捡走,分清移动视角和移动鼠标,并在画面突然变化后立刻调整操作。传统游戏智能体往往只回答“现在该按什么”,世界模型则更擅长回答“按下去会发生什么”。GameWAM 想把这两件事放进同一个模型:边玩,边预测自己会把世界推向哪里。

论文作者 Yuncheng Guo、Zhanqiu Zhang、Yiwen Guo 和 Weijia Li 将它称为 World-Action Model(世界动作模型,简称 WAM)——既学习动作造成的视觉后果,也学习为了完成任务该采取什么动作。作者称,这是他们所知首个面向原生闭环游戏玩法与 GUI 控制的 WAM;这里的“首个”是论文自行界定的优先权主张,尚无独立信源验证。本文的效果和分析也均来自这篇论文。

不只是看画面后按键

GameWAM 同时生成两条未来:一条是接下来可能看到的游戏画面,另一条是可以真正执行的键盘—鼠标轨迹。两条生成过程并行运行,共享已经发生的视觉历史,但在同一个预测区块内,尚未完成的未来画面和动作不会直接互相偷看。

这套安排使用 block-causal conditioning——按时间区块限定信息能看向哪里——以及 flow matching。后者是一种生成方法,可以把随机起点逐步变成符合条件的画面或动作。模型由并行的 Video DiT 和 Action DiT 负责两种输出;DiT 可以理解为用 Transformer 完成生成任务的模型骨架。

关键不在于让 AI 多生成一段视频,而在于视觉预测也参与训练控制能力。论文的消融实验支持这一点:完整模型在 Minecraft 评测中的平均成功率为 50.7%;取消未来视频监督后降至 35.7%,改用更稀疏的时间采样则为 36.7%。这说明快速变化的画面并非附属信号。至少在论文设置中,要求模型推演视觉后果,确实与更好的行动表现相关。

同一只鼠标,有两套语法

游戏的“原生操作”不是从几个整齐选项中挑一个。角色可能同时按住多个键,连续移动镜头,偶尔点击鼠标;打开背包后,同一段鼠标位移又从转动视角变成移动光标。这就是异构原生操作:物理输入相同,含义、尺度和出现频率却不同。

GameWAM 每个动作步骤先判断当前属于 gameplay 还是 GUI 模式,再调用对应的动作预测分布。连续动作还按模式分别归一化,也就是先把数值换算到适合各自统计范围的尺度;键盘等离散动作则继续共享表示。它没有把界面操作另做成一个脱离游戏的代理,而是让两种模式共用一套键盘—鼠标空间。

这项拆分并非纯粹的结构偏好。论文报告,把两种模式强行合并为统一动作分布后,平均成功率从 50.7%降至 38.3%。训练数据也为此专门对齐:作者整理了同步的 gameplay 与 GUI 轨迹,并对关键事件附近的片段进行更密集采样。去掉这种 event-anchored sampling——围绕事件锚点重点取样——平均成功率降至 38.0%。

想远一点,只走一小段

长任务还有一个矛盾:看得越远,智能体越容易在真正执行时错过新变化;每走一步都重新想,又可能缺少方向感。

GameWAM 的 block-cycle control 采用“预测得长,承诺得短”。模型先规划一段超过实际执行长度的动作,但只执行开头较短的一截。新画面回来后,它丢弃尚未执行的后续动作,再重新规划。这就是闭环控制:每执行一段便观察结果,而不是一开始就把整串操作写死。让预测长度与执行长度完全相同后,论文中的平均成功率降至 41.3%,显示额外前瞻与频繁反馈可以同时有用。

记忆也分成两层。当前周期内,模型保留细粒度上下文;跨周期后,近期画面仍以压缩形式保存,更早的信息则汇入固定的长期记忆槽。它要保留的是“持久世界状态”:即使暂时不在屏幕里,门是否打开、物品是否已取走等变化仍会影响以后。取消跨周期历史后,平均成功率为 46.7%;GUI 和战斗任务变差,但具身任务的点估计反而略升,说明这部分收益依任务而异。

成绩之外,还有一次有价值的失控

作者在 Minecraft Universe 和四张地图组成的 ViZDoom 套件上做了闭环评测。论文表格中,GameWAM 在 Minecraft 的 Mini 与完整任务集上分别取得 50.7%和 46.6%的平均成功率;具身、GUI、战斗三类任务每个成功回合的执行步数分别为 138、155 和 203。作者称这些成功率高于所列对比模型,同时各类任务使用的原生动作更少。ViZDoom 中,它相对 Game-TARS 持续改善,并在四个场景里达到有竞争力或领先的平均回报。

不过,“动作更少”不能单独等同于效率更高。论文沿用了各基线公开报告的评测协议,而材料没有给出统计显著性,也不足以确认不同系统的动作定义、决策频率和预算完全一致。因此,这组结果更适合看作有希望的单篇论文证据,而非已经坐实的全面领先。

更值得注意的是,作者主动报告了一种失效模式:Low-Frequency Action Source Imprinting(低频动作源印刻,LASI)。生成动作时,模型从随机源出发;如果跨多次重新规划反复使用同一个随机源,某些样本会持续把镜头带向同一方向,严重时角色只能原地打转。作者固定其他条件并干预频域后发现,随机源中的低频部分会系统性牵引生成镜头运动的大致方向。每次重新规划时重新采样,可以减轻这种偏差在整局游戏中的累积,却没有消除模型对随机源的底层敏感性。

为什么值得关注

GameWAM 推进的不是“AI 又会玩一种游戏”,而是控制范式的变化:策略不再只对眼前画面作出反应,也被要求预测行动之后的世界;画面生成也不再只是展示可能性,而要反过来约束可执行动作。快速画面、长期记忆和键鼠界面被放进同一个闭环,使游戏成为检验“预测中的世界”能否真正指导行动的试验场。

局限与未知

  • 所有结论目前都来自 GameWAM 论文自身,“首个 WAM”与性能优势尚缺独立复现。
  • 论文比较采用各基线报告的协议,跨系统的动作数和效率不一定完全可比。
  • LASI 是作者在该模型中观察到的失效模式,重新采样只能缓解累积偏差;它是否普遍存在于其他生成式控制模型中,材料尚未回答。

供稿材料 SOURCES — 1
01
GameWAM: A World Action Model for Video Games arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-31 · 学术板块