Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.030 — 2026-08-03
PAPER H 10 约 1 分钟

语言模型Agent能不能真正值夜班

ORCA-bench把真实故障线索交给Agent,测试它能否像值班工程师一样查出根因。

半夜收到一句“结账坏了”,真正难的不是改代码,而是先找出哪里坏了。值班(On-call,轮班响应线上故障,不一定只在夜间)工程师要把指标、日志、请求追踪和源码拼起来,从一堆连带异常中锁定根因。ORCA-bench测试的正是这项能力,而不是让语言模型Agent在一份静态代码里解题。

它搭建了一个持续运行六天的微服务系统——也就是由许多互相调用的小服务组成的应用,其中包含19个服务、13种编程语言。Agent从含糊的用户报告出发,通过真实工具查看指标、日志和追踪,再对照完整源码诊断故障。任务还会改变报告的具体程度、发现故障的时间,以及多个故障是否同时出现。最值得注意的是,论文作者称,拿走源码后,所有评测指标都会下降;这说明值班诊断不能只靠“看图找异常”,还要把运行现象与程序逻辑对上。

作者据五款前沿Agent的实验判断,它们尚不足以安全接管生产值班。况且测试系统公开、任务彼此隔离,真实生产环境通常更大、更动态;因此这更像一次条件较好的模拟值班,而不是毕业考试。


供稿材料 SOURCES — 1
01
ORCA-bench: How Ready Are Language Model Agents for Oncall? arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-03 · 学术板块