Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.042 — 2026-08-15
PAPER H 60 约 1 分钟

失败轨迹也能教会代码Agent

FailForge把代码Agent的失败记录炼成解题套路,救回逾26%的难题。

让代码Agent修软件,常见做法像批改习题:多做几遍,只留下通过测试的答案。问题是,越难的题越可能次次失败,最值得研究的过程反而全被扔掉。FailForge专门回收这些“废稿”。代码Agent是能浏览代码库、改文件并运行测试的语言模型系统;它的一整套操作和反馈叫作轨迹。传统的拒绝采样微调(RFT)只拿成功轨迹训练,FailForge则从持续失败中寻找可迁移的办事套路。

具体来说,诊断Agent会综合失败轨迹、测试输出、推理记录,并参考历史修复补丁,提炼出简短的程序性经验,例如应按什么顺序排查接口和调用关系。它把这条经验交给Agent再试一次;若新轨迹通过测试,就加入训练集。训练时,经验提示会被拿掉,让模型把套路学进去,而非在实际使用时依赖外部提醒。作者报告称,这套方法救回了逾26%的原失败实例;用扩充后的数据训练Qwen3.5-4B,在SWE-bench Verified上的问题解决率比强RFT基线高6.6个百分点,提升主要来自最难的问题。上述效果来自论文作者实验,摘要未披露独立复现结果。


供稿材料 SOURCES — 1

← 返回 2026-08-15 · 学术板块