线上服务一出故障,线索往往散在日志、监控指标、调用链和操作手册里,工程师得来回翻找。OpenSRE想做一套“可组装的AI值班助手”:SRE(站点可靠性工程)团队可以连接已有的60多种工具,自定义调查流程,让Agent在自己的基础设施上收集证据、分析告警并协助处理Incident——也就是影响服务运行的线上故障。
它更值得关注的地方,不只是让AI调用工具。项目还提供训练与评测环境,用合成故障测试Agent能否找准根因、拿出必要证据,并避开故意放入的干扰线索;另一组端到端测试则覆盖Kubernetes、EC2、CloudWatch、Lambda等云端场景。换句话说,OpenSRE试图把“看起来会排障”变成可以重复检验的能力。项目目前仍是Public Alpha:核心流程可供早期探索,但API和集成方式可能继续变化,稳定性也尚未完全成熟。