让 AI 订一趟行程,不只是查一次信息:它得先找班次,再依据结果调用下一项工具,中途状态还会变化。过去的 Agent 强化学习——让 AI 在反复尝试和奖惩中学会行动——多在工具很少的固定沙盒里训练。ToolVerse 想把练习场做大:它自动构建了近 422 个可执行 MCP 环境,包含约 4438 种工具,让 Agent 真正操作工具并接收反馈。
最值得注意的是任务怎么变长。研究团队把工具画成“依赖图”:前一步的输出若是后一步的输入,就用连线标出。动态解锁采样会先开放没有前置条件的工具,完成后才解锁下一批,由此生成 GUST 数据集。这样拼出的长时程任务——许多步骤环环相扣的任务——不是随意拉长对话,而是让早期操作真实影响后续选择。
长链条也更难判断哪一步做对了。ToolVerse 因此按交互轮次分配更细的训练反馈,而非只看最终成败。作者称,这套框架提升了模型的长程工具使用能力;现有材料未给出具体提升数字。