画面里的角色还能打,不等于这局游戏真能玩。比如血量已经归零,角色却继续交手;技能槽没满,必杀技却照样出现。StatePlay想解决的正是这种“看着合理、规则已坏”的问题:游戏世界模型——根据玩家动作续写游戏过程的模拟器——不能只预测下一帧,还得记住血量、技能槽和计时器等内部状态。
团队为《Street Fighter 3》采集了画面、玩家动作与模拟器内部状态同步的数据,并让模型同时预测状态和画面。其关键设计是把两类信息分开处理、再彼此沟通:状态预测会反过来约束画面生成,让“能否放技能”“是否该结束”等事件有据可循,而不是只凭像素猜测。
作者报告,StatePlay对关键状态变量的平均归一化 L1 距离低于 0.06——可理解为经过统一尺度换算后的预测误差;相比不显式记录状态的最佳基线,生成过程的玩法机制一致性提高 18.6%。这些结果来自论文实验,且目前验证集中在《Street Fighter 3》这一种游戏,能否推广到规则更复杂的世界仍待检验。