你让 AI 修一个软件问题,它不只是写代码,还要翻仓库、改文件、跑测试,再根据报错继续行动。过去的强化学习常把这套真实工作流程塞进训练框架预设的接口里;LEGO-RL则把 Agent harness——负责提供工具、保存仓库状态和回传执行结果的外层运行框架——直接视为训练环境的一部分。这值得关注,因为代码Agent学到什么,不只取决于模型,也取决于它实际能看见什么、做什么。
最关键的一步,是在 harness 调用模型时截获原始生成 token(模型逐个产生的文字单位)和相关记录。即使 harness 后来压缩上下文或重写历史,训练器仍能按当时真正发生的过程重新计算动作概率,避免“执行的是一段轨迹,更新的却是另一段”。框架还用沙箱隔离执行,并分阶段防范奖励投机——例如篡改测试来骗取高分。作者在 OpenHands SDK、Claude Code 和 OpenCode 三种原生 harness 上训练 Qwen3.5-35B-A3B,并自述其在 SWE-bench Verified 上均有提升;供稿文本中的具体提升数字缺失,因此不宜进一步量化。