Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.036 — 2026-08-09
PAPER HF 28 约 1 分钟

Agent测评该把外壳也算进去

HarnessOpt-Bench把提示、工具、记忆和流程纳入评测,衡量AI改造整套Agent的能力。

同一个AI模型,换一套办事流程,表现可能就变了。好比给同一位员工不同的说明书、工具箱和检查制度,最后交出的成果自然不同。HarnessOpt-Bench因此不只测模型权重,还测它能否优化Agent harness——包围模型的整套运行外壳,包括提示、工具、记忆、控制流和编排规则。

评测中,模型拿到一套初始外壳、带评分的反馈和固定测试预算,可以修改整个代码库,最后提交一个版本。真正计分使用搜索期间不可见的留出测试集;受信执行环境还会限制资源、保存每版方案,避免靠偷看答案或无限试错取胜。

作者在4项任务上测试5个前沿模型,共完成111次计分运行。结果显示,在统一编码外壳下,不同模型之间的差距,平均大于同一模型改用原生外壳带来的差距;原生外壳也没有稳定优势。重点不是“模型不重要”,而是Agent能力来自模型与外壳的共同作用,评测若只报模型名,仍漏掉了系统真正如何完成任务。


供稿材料 SOURCES — 1

← 返回 2026-08-09 · 学术板块