让机器人拆灯,不只是“抓住再放下”:它得连续完成多个相互依赖的动作,前面一点偏差,可能到最后才暴露。EmbodiedSWE尝试让代码Agent——能写程序、运行测试并根据结果改代码的AI——接手这类长程灵巧操作,再把解法用来训练机器人。
团队搭建了包含28项任务的仿真基准,涉及组装、收纳、切割、液体与柔软物体等,最长需持续操作半小时。Agent可以读取完整仿真状态,反复试验控制程序;在每次运行限时4小时的设置下,作者报告最强模型的成功率为82%。不过,这些程序通常针对单个任务反复调试,离通用能力仍有距离。
更值得注意的是,EmbodiedSWE-Gen会把一份验证成功的程序扩展成大量不同轨迹,作为监督信号——也就是告诉模型“怎样做更对”的训练示范。作者称,仅用500条Agent生成的仿真示范微调VLA(把视觉和语言指令直接转成动作的模型),便让真实机器人完成了四阶段拆灯任务。它提示了一条新路径:代码Agent不只替机器人解题,也可能成为批量生产训练材料的“老师”。