让 AI 帮你修云服务,难点不在于它会不会背 AWS 知识,而在于它能否找出配置错误、改对资源,又不误伤别的系统。亚马逊云科技发布的开源工具 aws-bench,正是给这类云端 Agent 出的一套实操题:它考查真实云资源上的诊断、部署和运维,而不是静态问答。
每道题会在隔离的 AWS 账户中,用 AWS CDK stack——一组可统一创建和销毁的云资源配置——搭出一致场景。Agent 随后拿到权限受限的凭证,在沙箱容器里操作。完成后,系统或检查实时 AWS 状态,或交给 LLM judge——另一个按规则评分的大语言模型——判定结果。预置任务覆盖可观测性、数据库、无服务器架构和多服务排障等场景,也支持 Claude Code、Codex、Kiro CLI 等 Agent。
它的价值是把评测从“懂不懂”推进到“能不能可靠动手”。不过据 InfoQ 报道,AWS 尚未公布成绩或标准化排行榜;多数任务依赖 LLM judge,官方文档也提示遗留状态可能造成误判或随机失败。运行测试还需要较高的 AWS 组织权限,目前仅限 us-east-1,并可能持续产生费用。