同一个AI模型,换一套办事流程,表现可能就变了。好比给同一位员工不同的说明书、工具箱和检查制度,最后交出的成果自然不同。HarnessOpt-Bench因此不只测模型权重,还测它能否优化Agent harness——包围模型的整套运行外壳,包括提示、工具、记忆、控制流和编排规则。
评测中,模型拿到一套初始外壳、带评分的反馈和固定测试预算,可以修改整个代码库,最后提交一个版本。真正计分使用搜索期间不可见的留出测试集;受信执行环境还会限制资源、保存每版方案,避免靠偷看答案或无限试错取胜。
作者在4项任务上测试5个前沿模型,共完成111次计分运行。结果显示,在统一编码外壳下,不同模型之间的差距,平均大于同一模型改用原生外壳带来的差距;原生外壳也没有稳定优势。重点不是“模型不重要”,而是Agent能力来自模型与外壳的共同作用,评测若只报模型名,仍漏掉了系统真正如何完成任务。