你让 AI 看一张游戏截图,它很容易说出“天快黑了,附近有怪物”。但如果不准暂停,要它一边观察变化,一边找资源、避开危险、完成一个几分钟的目标,事情就完全不同了。它不仅要看懂眼前,还得记住目标,发现题目没说的准备工作,并在走错后改计划。
美团 LongCat 团队发布的 MineExplorer,正是把多模态大模型——能同时处理图像、文字等信息的模型——放进这样的考场。它使用 Minecraft 构造动态开放世界:环境不会把全部信息一次摆在模型面前,而会随着时间和动作持续变化。团队称它是首个支持分钟级开放世界长程任务的评测基准。不过,目前材料全部来自美团技术博客,尚无独立信源交叉验证,“首个”等表述应视为团队主张。
难点不是看见,而是把路走完
据美团技术博客,MineExplorer 收录了 813 个人工验证的任务实例,难度从 1-hop 到 4-hop。这里的 hop 可以理解为目标背后的依赖层数:单跳任务直接做就行;多跳任务则藏着若干前置条件。
比如,指令只告诉你采集某种材料,却不提醒你必须先取得合适的工具。模型要自己发现这条依赖链。所谓长程规划,就是把远期目标拆成相互依赖的步骤,并在环境变化或中途失败时重新安排。链条越长,早期一个小错误越可能拖垮最终结果。
团队把每个复合任务写成四元组:
其中, 是自然语言指令, 是初始状态, 是依赖图, 是规则化的里程碑检查器。依赖图采用 DAG——有向无环图,可以把它想成一张只能向前推进的任务清单:某些节点必须完成,后续节点才有条件开始。关键是,指令不会把图里的所有节点直接告诉模型。
里程碑检查器则不只看最终成败,还检查关键中间状态。这样可以分清模型究竟没形成计划、卡在某个前置步骤,还是走到最后才执行失误。
每个实例最多运行 1800 个环境步,每步 0.1 秒,也就是约 3 分钟连续交互。对人来说三分钟很短,对需要反复观察、决策和行动的模型来说,却已经足以让早期判断不断影响后续局面。
考的不是 Minecraft Wiki
Minecraft 自带大量专有规则。如果测试只是奖励“谁背过游戏百科”,就很难说明模型具备通用探索能力。团队因此让 LLM 裁判——由大语言模型充当的筛选器——判断原子任务主要依赖通用常识还是游戏专有机制,并过滤后者。
这个方向合理,但“过滤”不等于彻底解耦。博客没有披露裁判模型、具体判定标准和人工复核方式,因此目前只能说 MineExplorer 试图减少游戏知识的影响,不能认定影响已经消失。
MineExplorer 还把能力分成感知、推理和行动三类,共 14 项:模型既要识别空间、实体、状态和资源,也要处理常识、因果与关系,最后还得移动、采集、放置、合成或攻击。换句话说,它测的不是一道题答得对不对,而是“看见—想清—做出来”这条链能否持续运转。
多一层前置条件,就多一次掉队机会
团队评测了 Claude、GPT、Gemini 等八个模型家族的 18 款模型。按博客数据,表现最好的 Claude-Opus-4.6,整体任务成功率(TSR)为 41 分。材料没有说明这里是百分比还是百分制得分,因此不宜改写成 41%。
更有信息量的是难度曲线:Claude-Opus-4.6 从 1-hop 的 77 分降到 4-hop 的 12 分。单步目标尚能处理,一旦必须自行补齐多层前置条件,成绩便明显下滑。这比单一总分更能说明长程任务的问题:模型不是完全不会,而是难以让多个正确判断在较长时间里连续成立。
博客还称,多数模型呈现“感知分数高于行动分数,行动分数高于推理分数”的排序。以 Claude-Opus-4.6 为例,其感知分为 61.91,推理分为 54.71。团队据此把断层概括为“会看,但不会想”。更克制的说法是:在这套评测里,模型把观察组织成有效策略的能力,比识别当前画面的能力更弱。
对 Claude-Opus-4.6 失败样本的归因中,导航失败接近 60%。这个数字只适用于该模型的失败案例,不能外推到全部 18 款模型。但它提醒我们,知道目标是什么,与真正抵达目标,并不是同一种能力。
更多时间和画面,没有直接补上规划
团队的消融实验——通过改变单个设置来观察影响——显示,把任务上限增加到 1800 步,没有挽救原本失败的任务。增加历史画面帧数也并非越多越好:超过某个未披露的程度后,性能反而下降,博客将其解释为过期观察干扰当前判断。
这不能推导出“更多计算或记忆永远无效”。它只说明,在博客展示的特定设置里,单纯延长行动时间或继续堆叠历史画面,没有自动解决信息对齐和长程规划问题。模型缺的可能不只是容量,而是筛选哪些旧信息仍然有效、哪些前置条件尚未满足的机制。
为什么值得现在看
固定图片问答很像在温室里认植物:光线稳定,目标明确,所有线索都摆在眼前。开放世界则更像真正下地干活。环境会变,条件不会主动列清楚,模型必须持续校正。
MineExplorer 的价值,不在于又做出一张模型排行榜,而在于把“最终失败”拆成可检查的过程,并让隐藏前置条件随 hop 数逐层加深。它提醒我们:某些评测上的高分,不能直接兑换成持续行动能力。会描述世界,也不等于能在世界里完成事情。
团队还称已开源多智能体自动造题代码和基于 Minecraft 的可训练沙盒环境。其造题流程由一个 orchestrator——负责安排协作顺序的协调者——组织五个专业 Agent,经历初始化和 debate(辩论修订)两个阶段。按团队人工评估,该流程令任务有效率提高约 30 个百分点、质量分提高约 0.5 分;但博客未给出基线、量表、样本量和显著性信息,这两个增益暂时只能作为单方结果理解。
局限与未知
- 材料未给出 18 款模型的完整版本、评测日期、采样次数、方差、运行配置及各 hop 样本量,模型间排名的稳定性无法判断。
- LLM 裁判的标准与复核流程未披露,Minecraft 专有知识究竟被排除到什么程度仍待核查。
- 开源范围、许可证以及代码和环境能否复现博客结果,还需要从论文与仓库独立验证。