你请了一位家教长期陪练。起初,题库很有用;等你把题做熟,进步就慢了。更好的家教会观察你卡在哪里,再出一道“稍微踮脚才能做成”的新题。SPADE想让语言Agent拥有这样的家教,只不过家教和学生由同一个大语言模型(LLM)分饰,而且它生成的不只是题目,而是一整套能够运行的训练世界。
这项工作的价值正在于换了瓶颈:过去常问Agent怎样解题,SPADE开始追问,谁能持续生产适合它下一阶段的训练环境。以下方法、实验结果和判断均来自论文作者报告,目前没有独立复现。
同一个模型,一边出题,一边闯关
SPADE全称是 Self-Play in Adaptive Synthetic Executable Environments。它是一套自我对弈强化学习框架——系统反复生成挑战、尝试解决,再根据结果调整双方。棋类AI也常用自我对弈;SPADE把“对手”从另一个棋手扩展成了训练环境本身。
同一个LLM轮流扮演两个角色。Environment Designer(环境设计者)负责写环境,Reasoning Agent(推理Agent)负责在里面行动。两者共享模型参数,只用不同的角色提示区分工作。
这里的“环境”不是一段文字题面,而是一份可执行的Python程序。它包含状态如何变化、奖励怎样计算,以及答案如何验证。程序采用 OpenAI Gym 式接口:reset()负责开局,step()接收一次动作,再返回新状态、奖励和任务是否结束。这样,一次作答的推理题和需要连续调用工具的多步任务,都能接进同一条训练管线。
以工具任务为例,环境设计者会生成一组模拟工具、会被工具修改的后台状态,以及三到五条依次到来的用户指令。推理Agent必须多轮调用工具,完成全部要求才拿到奖励。生成的候选环境还要通过语法和执行检查;工具环境另有重置与可完成性检查。
所以,“Agent自己造世界”需要收窄理解。它造的是受验证约束的合成训练程序,不是真实世界,更不是无边界地任意创造。
好题不是越难越好
让出题者专门难倒学生,很容易得到无解题;让它只讨好学生,又会不断生产送分题。SPADE用一种叫“基于提示的遗憾值”(hint-based regret)的信号寻找中间地带。
环境设计者为每个环境附上一条 privileged hint——只有评估时特定一组尝试能看到的额外提示,例如关键思路、部分解法或预期答案格式,但不能直接泄露答案。推理Agent分别在有提示和无提示的条件下尝试,二者平均奖励之差就是遗憾值:
如果有提示能做成、没提示做不成,差距就大,说明任务大致落在Agent的能力边缘:并非不可解,却仍有东西可学。如果两边都成功,题目可能已经太简单;如果有提示也失败,它又可能太难。
这类似课程学习——教材随着学生水平逐步升级。SPADE还加入一个目标难度区间,用来约束环境的通过率;遗憾值则在合适难度内挑出更有教学价值的环境。论文称,环境设计者和推理Agent都通过强化学习更新,也就是根据获得的奖励调整生成与行动策略。
新鲜内容从哪里来?
同一个模型左右互搏有个明显风险:它知道什么,出题素材也大致受限于什么,还可能反复生成自己偏爱的套路。SPADE为环境设计者加入两个外部支点。
第一个是语料 grounding,也就是每轮先抽取文档,让新环境落在外部材料提供的内容上。游戏设置使用数学和科学文档;工具设置使用代码语料,其中包括算法实现和API文档。语料主要扩展“题目讲什么”。
第二个是 environment memory(环境记忆)。系统保存过去生成的环境,并记录遗憾值和技能标签,让设计者参考高价值旧题,也避开已经太简单或始终太难的例子。记忆主要控制“题目有多难”。论文的消融实验——逐项移除组件观察变化——据此把语料和累积记忆称为成功的关键组件;这仍是作者实验内部的结论,不等于外部确认。
论文还报告,完整SPADE在训练后期约有三分之一的新环境处于可学习区间。没有语料支撑的一个运行片段,则在第290至312步连续41次生成同一种旋转迷宫。作者据此认为,外部语料负责维持题材广度,环境设计者的学习负责把难度继续向前推。
成绩说明了什么?
游戏实验使用三种Qwen3骨干模型:4B、8B和 Qwen3-30B-A3B。评测覆盖八个训练时未使用的数学、科学、代码和程序化推理基准。以30B-A3B为例,SPADE的套件平均分为58.3;最强固定环境基线 Fixed-env RLVE 为53.0,基础模型为50.2。也就是说,相比最强固定环境训练高5.3分,相比基础模型高8.1分。4B和8B相对最强固定环境基线的优势分别为1.6分和1.7分,30B-A3B的差距更大。
工具使用实验也覆盖三个模型规模。30B-A3B经过SPADE训练后,BFCL v4 multi-turn平均分从49.0升至54.7,增加5.7分;ACEBench-Agent平均分从62.0升至75.9,增加13.9分。作者解释,ACEBench-Agent的有状态、多步骤结构,与训练时生成的数据库、工具接口和多次调用目标最相似。
这些结果真正支持的,是“会变化的训练环境可能比固定题库更耐用”,尤其当模型规模增大时。它们还不足以证明系统已经获得开放式、无限持续的自我改进。
为什么值得关注
SPADE最有意思的地方,不是又换了一种解题算法,而是把环境设计本身变成可学习组件。固定课程只能决定从现有题库里先学什么、后学什么;SPADE试图让出题机制也随着学生成长,持续生成新的可执行任务。
这会把AI训练的生产逻辑向前推一步:训练数据不再只是静态库存,环境也不只是人工搭好的舞台。模型同时学习怎样行动、什么挑战值得下一轮练习。若这条路线成立,未来竞争的重点可能不只是谁拥有更多题,而是谁拥有更稳定、更丰富、也更难被投机利用的“自动教材编写机制”。
局限与未知
- 现有证据全部来自论文作者。不同工具环境系统在训练数据、预算、基础模型和评测流程上并不一致,横向领先不能视作严格同条件比较。
- 实验仍是有限模型、有限训练步数和有限基准。论文所说的“开放式持续自我改进”应理解为研究目标,而非已经实现的能力。
- 环境、奖励和验证代码都由模型生成。论文设置了执行检查和防奖励投机措施,但现有材料不足以说明这套机制在更长训练、更复杂任务中能否持续可靠。