Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.058 — 2026-08-31
NEWS 约 2 分钟

Terminal Bench 4.0:编码Agent重新排位

Terminal Bench 4.0 更新榜单:GLM-5.3 与 Fable 5 暂难分高下,也暴露了 Agent 评测的成本难题。

IMAGE — r/LocalLLaMA 日榜

你让两个 AI 各自修一次代码,成功的那个就更强吗?未必。编码 Agent 会读文件、运行命令、修改代码,再接受自动验收;一次成败既受模型影响,也取决于工具、任务编排和运气。Terminal-Bench 正是用真实终端任务比较整套 Agent 系统,而不只是考几道代码题。

新榜单没有明确赢家

据 LocalLLaMA 社区用户 SorosAhaverom 转述,Terminal Bench 4.0 已发布。帖子标题称,计入误差范围后,GLM-5.3 与 Fable 5 处于同一水平。

误差范围指有限任务和重复运行带来的随机波动。两者落在这一范围内,只能说明现有测量不足以可靠断言谁更强,不能写成确定并列。帖子也没有提供双方分数、运行次数、置信区间或统计方法。

另一个关键变量是 harness——给 Agent 提供提示、工具、环境和循环控制的测试脚手架。同一模型换一套 harness,成功率和 token 消耗都可能变化。因此,榜单排的不只是“模型智力”,也是整套系统的表现。

榜单也得追着模型跑

帖子提到,Terminal Bench 团队计划更快迭代题目,以跟上新模型发布,并应对“基准饱和”:当越来越多系统逼近高分,旧题就很难继续拉开差距。快速换题和提高难度,目标是让榜单保持辨别力;目前材料不足以证明这一目标已经实现。

这次更新值得关注,不只因为名次变化。GLM-5.3 与 Fable 5 暂时无法被可靠区分,提醒我们别把小幅领先当成能力定论。

局限与未知

  • 全部信息来自一篇 Reddit 帖子,尚无材料内的第二信源印证。
  • “Fable 5”是否为正式名称或拼写错误,仍待核对。
  • 发帖者称大型评测约需 5–10B tokens,但未说明是单模型、全榜还是多次运行的消耗,不能据此估算具体成本。

供稿材料 SOURCES — 1

← 返回 2026-08-31 · 开源板块