Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.075 — 2026-09-17
PAPER 约 1 分钟

编码Agent的能力,多少来自脚手架

固定同一模型只换脚手架,私有测试显示榜单成绩并非只由模型决定。

同一位程序员,换一套办事流程,成绩会变多少?编码 Agent 也有类似问题:模型之外,还包着“脚手架”——负责读文件、运行测试、根据报错重试的工具、提示词和控制流程。榜单通常把整套系统一起打分,因此很难看出高分究竟来自模型,还是外层编排。

这项研究用私有且控制训练数据污染的题库做配对对照:让同一模型完成同一批任务,只更换脚手架。80 道配对任务中,Claude Opus 4.8 使用原生与中立脚手架的通过率为 48.8% 和 50.0%;GPT-5.5 则为 55.6% 和 54.4%。作者称,两组结果都不足以确认哪种脚手架平均更强。

更值得注意的是,Opus 的差异随任务类型反转:原生脚手架在代码仓库任务上落后 9.0 个百分点,在竞赛题上却领先 23.7 个百分点。这一分组是看过数据后才做的,论文明确把它列为待复现实验检验的线索。换句话说,编码 Agent 榜单不仅在比模型和脚手架,也可能在比脚手架恰好适不适合那类题。论文


供稿材料 SOURCES — 1

← 返回 2026-09-17 · 学术板块