你让 AI 做一款小游戏,它很可能很快交出一个能打开、能移动、甚至看起来像模像样的版本。真正麻烦的事在后面:按钮会不会挡住画面,写进代码的功能能不能在游玩时触发,修好一个问题会不会弄坏另一个,连续改六轮后游戏还是否可玩。
这正是 GameXpert-Bench 想回答的问题。它不再只考代码 Agent——在语言模型外加上读写文件、运行程序和检查结果等工具的系统——能否“一次生成”,而是把考场延伸到找错、修复和持续优化。游戏很适合做这种压力测试,因为逻辑、画面、声音、界面、操作和状态变化必须同时配合;任何一环失灵,玩家拿到的都可能只是一个能启动、却不好玩的半成品。
论文用 3 条评测轨道覆盖这种面向用户的开发过程。不过,这不是商业游戏从立项到发行的全部流程。本文数字与结论均来自论文自身,尚无第三方复现。
不是交一张截图就算完工
第一条轨道 GameGen 考“从零做出来”。Agent 面对空白工作区,只收到一条自然语言需求,没有模板、现成素材或指定引擎,要自行完成一款可在浏览器运行的游戏。任务共 97 个,横跨 11 种类型,其中 44 个要求 3D 渲染。
这种端到端评测,像考厨师能否从菜单一路做到上桌,而不只考切菜。论文既看最终制品——也就是 Agent 交出的完整游戏文件——也看实际运行行为。评测先从不同模型生成的游戏中整理共同的行为清单,再由人工审核,区分核心事件与额外内容。代码里出现了某段逻辑还不算完成;Agent 必须在运行中进入相应状态、触发事件,并让预期效果真正出现,才能得分。
GameGen 分成四个等权维度:核心要求的完整度、额外玩法与内容的丰富度、视觉质量,以及真实游玩体验。前两项结合代码检查和实时交互,后两项由人判断。它因此能拆开两个经常被混为一谈的问题:游戏“功能齐不齐”,与玩家“玩起来好不好”。
在 15 个模型、97 款游戏的测试中,Claude-Opus-5 总分最高,为 79.7;Claude-Fable-5 为 75.8,Kimi-K3 为 71.3。Claude-Opus-5 在完整度、丰富度和视觉质量上领先,Claude-Fable-5 的玩家体验得分最高。
更有解释力的是整体落差:15 个模型的完整度平均为 77.5,丰富度只有 46.1。换句话说,当前 Agent 较会先搭出能玩的骨架,却不太稳定地补上更多机制、关卡与互动。3D 又进一步放大了难度:平均总分从 2D 游戏的 65.9 降至 3D 的 60.1,15 个模型中有 14 个在 3D 子集上表现更差。
写了,不等于真的能用
论文检查了 43,081 个游戏事件。其中 2,293 个、约 5.32%,在静态代码检查时看似已经实现,运行后却失败或只能部分工作。超过一半这类问题来自加载失败或崩溃;其余常见原因包括状态跳转错误、反馈缺失,以及画面没有作出应有响应。
这说明制品评测不能只读代码。就像菜谱写着“烤二十分钟”,不代表端上来的菜已经熟了。游戏必须真正跑起来,接受操作,再由行为结果证明功能存在。
界面也是普遍薄弱点。论文用一组与错位、遮挡、溢出和出屏有关的关键词检查评测报告,在 1,455 次“模型—游戏”运行中标出 221 次,占 15.2%;所有受测模型都出现过此类问题。Agent 可以分别生成看似合理的按钮、面板和文字,却未必能让它们在不同运行状态下稳定共处。
会做新功能,还得会找旧问题
第二条轨道 GameFix 考诊断与修复。研究团队从 50 个内部、经人工复核的可玩关卡出发,用可逆的小改动注入缺陷。每个关卡同时包含 19 至 27 个 bug,再以两种提示模式形成每轮 100 个修复任务。
一种模式直接列出所有异常,Agent 只需定位并修好;另一种是 Self-Discovery,也就是“自行发现”。提示只透露部分主观或表现层症状,反向控制、障碍无法通过等客观缺陷则被隐藏,Agent 必须自己游玩、检查并发现问题。
修复结果不用语言模型打分,而是由确定性的行为测试验证。Fail-to-Pass(F2P)检查原先坏掉的行为是否已经恢复;Pass-to-Pass(P2P)检查原本正确的功能有没有被顺手弄坏。只有同时修好目标行为并守住旧功能,才算成功。论文将 19 至 27 个 bug 解释为刻意设计的长程压力测试,并不声称真实游戏通常会一次暴露这么多问题。
供稿截取内容没有给出 GameFix 各模型的具体成绩,因此无法比较谁修得最好。但论文的总体判断是:缺陷被明确告知时,Agent 表现明显更可靠;要求自行发现时,模型差距拉大,而在一次任务中接近修完多个 bug 仍不常见。
六轮修改,考的是“别把桌子掀了”
第三条轨道 GameOpt 从已有的可玩版本开始,连续提出六轮优化请求。它包含 17 条请求链,共 102 个请求,起点来自真实的人类—Agent 开发轨迹;每一轮都接着上一轮产生的版本继续做。
请求涉及玩法、关卡设计、平衡、美术、界面和音频。最终评测不只看新要求有没有实现,还做回归检查——也就是确认早先已经实现的功能没有在后续修改中退化。论文称,领先 Agent 往往能在六轮中保留被明确要求的功能,但对核心游戏循环的保护,以及多个产品维度之间的均衡改进,仍不稳定。材料没有提供 GameOpt 的分模型得分,不能进一步判断差距有多大。
为什么这比常规代码榜单更值得看
GameXpert-Bench 最重要的提醒,不是哪一个模型暂时排第一,而是“一次生成质量”不足以代表开发能力。Agent 若只能快速搭出初版,却不会主动发现运行时缺陷,也无法验证自己的修改,更不能在反复迭代中守住已有功能,就还不是可靠的开发搭档。
游戏把这道差距展示得尤其直观。代码可以看起来完整,截图可以显得漂亮,页面也可以顺利打开;但玩家一按键,所有环节必须同时兑现。真正接近专家开发的 Agent,不只要会写,还要会观察、验证、修复,并控制每次改动的连锁反应。
局限与未知
- 论文评估的是由代码 Agent 直接完成的生成、修复和优化三阶段,不能据此等同于完整商业游戏开发流程。
- GameFix 使用保密的内部关卡,虽有可逆缺陷和确定性测试,但外部研究者目前无法据材料独立核验这套封闭任务。
- GameFix 与 GameOpt 的完整分模型结果未出现在供稿截取内容中;关于“更擅长明确需求、较不擅长主动发现与持续保全”的判断,目前仍是论文作者的综合结论。