你让两个 AI 各自修一次代码,成功的那个就更强吗?未必。编码 Agent 会读文件、运行命令、修改代码,再接受自动验收;一次成败既受模型影响,也取决于工具、任务编排和运气。Terminal-Bench 正是用真实终端任务比较整套 Agent 系统,而不只是考几道代码题。
新榜单没有明确赢家
据 LocalLLaMA 社区用户 SorosAhaverom 转述,Terminal Bench 4.0 已发布。帖子标题称,计入误差范围后,GLM-5.3 与 Fable 5 处于同一水平。
误差范围指有限任务和重复运行带来的随机波动。两者落在这一范围内,只能说明现有测量不足以可靠断言谁更强,不能写成确定并列。帖子也没有提供双方分数、运行次数、置信区间或统计方法。
另一个关键变量是 harness——给 Agent 提供提示、工具、环境和循环控制的测试脚手架。同一模型换一套 harness,成功率和 token 消耗都可能变化。因此,榜单排的不只是“模型智力”,也是整套系统的表现。
榜单也得追着模型跑
帖子提到,Terminal Bench 团队计划更快迭代题目,以跟上新模型发布,并应对“基准饱和”:当越来越多系统逼近高分,旧题就很难继续拉开差距。快速换题和提高难度,目标是让榜单保持辨别力;目前材料不足以证明这一目标已经实现。
这次更新值得关注,不只因为名次变化。GLM-5.3 与 Fable 5 暂时无法被可靠区分,提醒我们别把小幅领先当成能力定论。
局限与未知
- 全部信息来自一篇 Reddit 帖子,尚无材料内的第二信源印证。
- “Fable 5”是否为正式名称或拼写错误,仍待核对。
- 发帖者称大型评测约需 5–10B tokens,但未说明是单模型、全榜还是多次运行的消耗,不能据此估算具体成本。