让 AI 修一个大型代码库,常见的浪费不是补丁写不好,而是它像第一次进仓库的新人:反复搜关键词、翻目录、打开源码,迟迟找不到该改哪几个文件。CodeGrep 把这一步单独交给一个“代码检索 Agent”——只负责找文件的助手,希望把编码 Agent 消耗在定位上的 Token(模型处理文本的计量单位)变成可训练、可优化的能力。
它基于 Qwen3-14B-Instruct,使用 grep、glob 和 read 三类只读工具搜索内容、匹配路径并查看源码,再把候选文件交给参数不再调整的 OpenHands 编码 Agent。训练采用 GRPO:让模型对同一问题做多组尝试,再用组内成绩强化较好的搜索路线。论文最值得注意的发现是,检索并非“有就比没有好”:准确度不足时,错误文件反而会带偏后续修复;只有越过一定的精度门槛,检索才开始节省轮次和 Token。作者称 CodeGrep 在 SWE-bench Verified——要求 Agent 修复真实开源项目故障的测试集——上带来小幅且可复现的成功率提升,同时取得更明显的效率收益;但供稿文本中的具体数值缺失,暂不能据此判断增益幅度。