同一个人写代码,桌上若堆满旧日志,和有人及时收走废纸、在他反复碰壁时提醒换条路,结果可能很不一样。编码 Agent 也是如此:它不只是一颗负责推理的模型,还套着 Agent 外壳——负责整理上下文、提供工具、执行命令并决定是否继续工作的运行框架。Sydney Lewis 的研究追问:模型和任务都不变,只换外壳策略,成绩会变多少?
作者用同一套 Yuj 外壳做配对比较。对照组始终把完整对话按时间顺序交给模型;实验组则在上下文窗口——模型一次能看到的信息容量——快满时,机械压缩较旧的工具输出,并在模型重复失败命令或停滞时提示它换种做法。在 SWE-bench Verified 的 169 个任务上,窗口限制为 20,480 tokens、每次最多运行 480 秒,作者报告 fail-to-pass 比例——原本失败的测试被修好的比例——均值从 28% 升至 49%,完整解决数从 43 个增至 72 个;同一套未重新调参的策略也改善了另外三种模型的两项指标。
这说明编码 Agent 评测测到的是“模型加外壳”的整套系统,单看底座模型名称容易失真。不过,实验一次改动了压缩、停滞干预和命令保护等整套策略,尚不能判断究竟哪一项贡献最大。