训练Agent连续调用工具,像教人操作一套复杂软件:每点一步,都要让真实系统返回结果,再决定下一步。问题是,这类“可执行环境”——能真正运行代码、查询数据库或改变网页状态的系统——搭建、运行和核验都很贵。EnvACE瞄准的正是这笔成本:让Agent先把环境的反应学进自己脑中。
具体来说,同一个模型轮流扮演两个角色:先作为Agent发起工具调用,再作为环境,生成这次调用可能带来的反馈,随后根据这份反馈继续行动。整段训练轨迹因此可以在模型内部展开,不必逐步查询外部环境。它还为“行动”和“模拟环境”分别计算训练基准,再用任务最终是否成功的奖励共同优化两种能力。作者称,这种“世界排练”在 BFCL-v4、τ-Bench、VitaBench 和 FinMCP-Bench 上总体优于扩大环境规模的基线;测试时也能先私下预演候选动作。不过,脑内环境若模拟错了,误差也可能沿长任务逐步累积。