你想训练一个 AI 助手完成“查订单、核对退款、更新表格,再发出通知”。只给它一段操作说明还不够。订单系统、表格和通知工具都得真的能用;前一步产生的信息要能传到下一步;最后还要判断它是否完整做对。
这正是 Agent 后训练的难处。所谓 Agent 后训练,是通用模型完成基础训练后,再通过执行任务、调用工具和接受反馈,学习如何行动。它需要的不是一摞静态问答题,而是一批可以进入、操作并产生后果的训练场。
Skill2Env 和 CompoWorld 从两个方向处理这个问题:前者先问“要练什么能力”,再倒推出任务和环境;后者把可复用服务组合起来,让任务跨越多个系统。合在一起看,Agent 训练正在从自动造题,走向规模化造世界。
本文关于 Skill2Env 的细节来自论文全文;CompoWorld 仅有 hf-daily-papers 转述的摘要。两项工作的具体成绩目前都属于作者报告,不能视作外部复现。
不是先造场景,而是先定能力
Skill2Env 的起点是 skill——包含领域知识、操作流程、工具说明,有时还附带脚本、模板和参考资料的可复用能力包。问题在于,知道“怎样处理文档”,距离造出一道真正有挑战、可以执行和评分的文档任务,还有很长一段路。
它因此把顺序反了过来:先确定 Agent 应该练什么,再设计训练场。论文把能力需求分成五类:理解环境、制定计划、使用 skill、在长流程中保持一致,以及出错后恢复。
这些抽象能力会被翻译成 difficulty patterns,也就是可重复使用的“出题难法”。例如,若要考察环境理解,可以把证据分散在多个文件中,或让部分约束不直接写明;若要考察规划,可以让后续操作依赖前一步结果,或者限制累计资源。论文称初始库包含 100 种这类模式。
这像是先决定要考“能否发现分散证据并处理冲突”,再据此布置文件、工具和线索,而不是随手搭一个办公室场景,最后才猜它能训练什么。
蓝图管住整座训练场
选好难度模式后,Skill2Env 会生成 task blueprint——一份供出题方使用的任务蓝图。它同时规定目标、挑战、环境事实、信息边界和验收条件。
信息边界尤其重要。哪些内容直接告诉 Agent,哪些藏在工作区里等它发现,哪些必须推断,以及哪些参考答案只能留在出题方手中,都要提前划清。随后,系统依据同一份蓝图共同生成四部分:任务说明、提供工具与运行支持的执行底座、保存文件和状态的工作区,以及评分器。
评分器采用 rubric,也就是拆开的验收清单。适合程序检查的项目用确定性规则判断;其余项目交给大模型评分,并保留支持证据。各项按权重汇总成最终奖励。这样考的不是“回答看起来像不像”,而是 Agent 是否真的改变了正确的状态、交付了要求的结果。
论文从超过 4.7 万个公开 skill 文件夹中,按实用性、运行兼容性和部署可行性筛出超过 3000 个,最终生成 2963 个可执行任务。
做得太顺,就把世界变难
一次生成的任务可能徒有复杂外表,Agent 却能绕过关键挑战。Skill2Env 因此加入 Iterative Task Hardening,直译是“迭代式任务加固”。
Agent 先实际做题。系统再查看执行轨迹和各项评分,判断哪些难点已经被轻松解决、是否存在捷径,以及失败究竟来自能力不足,还是题目和评分器本身有问题。确认环境有效后,它会加强原有难度模式,或加入新的兼容模式,并同步修改蓝图、任务、工作区和评分器。执行中发现的通用难点,还可以进入模式库,供以后复用。
在论文的一组配对实验里,同一批 500 个任务经过两轮加固后,DeepSeek-V4-Flash 的满分率从 48.40%降到 24.80%,再降到 15.40%;平均交互轮数从 25.91 增至 36.54 和 38.85。也就是说,难度不是靠文字描述宣称,而是通过 Agent 的实际表现来校准。
更关键的是,变难之后的数据似乎也更有训练价值。在训练轨迹数量同为 500 条、质量门槛相同的比较中,七项基准平均分从初始任务的 40.58,上升到一轮加固后的 42.51、两轮后的 42.87。
CompoWorld:让多个环境接起来
Skill2Env解决的是“怎样围绕能力造好一个训练场”。CompoWorld继续追问:怎样让训练场跨越多个服务。
它把服务当作可重组的积木。编码 Agent 根据工具规格实现并验证服务,为服务设置带类型的状态和共享接口;无法可靠实现的工具则由 world model——模拟工具行为与状态变化的模型——处理。系统再用依赖图描述服务之间的信息关系,并通过随机游走生成路径,让一个服务的输出成为另一个服务的输入,由此构造跨服务任务。
据论文摘要,CompoWorld 建成 448 个服务,提供 10,130 个工具;研究者使用 3000 条 SFT(监督微调,即让模型学习高质量示范轨迹)和 1000 个 RL(强化学习,即依据任务奖励调整行为)任务训练 Qwen3.6-35B-A3B。其奖励设计会更重视同一批尝试中通过率较低的验收项,把训练注意力推向尚未完整完成的部分。
摘要报告称,训练后的模型在八项基准上比原始 backbone——未经这轮后训练的基础模型——平均提高 9.17 分;在 AutomationBench 上超过 Claude Opus 4.6,并在所比较的 Agent 专用 35B-A3B 模型中居首。不过,摘要没有列出八项基准的组成、平均方式和逐项成绩,排行榜也依赖评测版本、协议、模型配置与参评集合,因此这些说法更适合视为待核验的作者结果。
真正值得看的,是生产方式变了
Skill2Env 用能力需求控制单个世界的训练价值,CompoWorld 用服务组合扩大世界的数量和跨度。两者共同指向一种新的数据生产方式:训练样本不再只是“问题—答案”,而是任务、工具、状态、反馈和验收标准组成的完整交互过程。
Skill2Env 提供了较具体的迁移证据。用其环境产生的 1500 条高分轨迹微调 Qwen3.6-35B-A3B 后,模型在七项基准上的非加权平均分由 36.6 升至 45.0,增加 8.4 分。其中 SkillsBench 提高 14.3 分,Terminal-Bench 2.1 提高 13.5 分。四种不同执行框架下的 Terminal-Bench 2.1 成绩也都上升。论文据此认为,训练所得不只是在记某一套题,而是部分迁移成了更通用的执行能力。
但它仍未追上所有强模型。论文表格中,多款前沿模型在若干基准上继续领先。这也提醒我们:批量造世界解决的是训练环境供给问题,不等于已经解决通用 Agent 本身。
局限与未知
- CompoWorld 目前只有摘要材料。448 个服务、10,130 个工具和 9.17 分提升的验证过程、逐项结果与消融实验均未披露。
- 两项工作的环境、轨迹和成绩都由各自论文单方报告;现有材料不能提供独立复现,也不能用两篇论文互相印证具体数字。
- 合成训练场能否覆盖真实系统中的长期变化、意外状态和维护成本,供稿材料没有回答。