今天,当你把告警直接丢给通用智能体,它列得出十种可能,却不知道你的系统此刻正在发生什么,更不知道你的团队过去是怎么解决这类问题的。

精准的故障排查,靠的不仅是更聪明的模型,而是三样东西同时在线:实时上下文、历史经验、以及沉淀打磨过的排查方法。

前两样,观测云用统一数据底座 GuanceDB 3.1、统一目录和笔记知识库解决。而第三样方法,就是今天要聊的 Runbook。

Runbook:应对故障,观测 AI 智能体的标准化执行手册

在观测云,Runbook 不再是一份落灰的文档,而是观测 AI 智能体团队应对故障的的标准化执行手册:它可以来源于人类专家经验总结、也可以来源于观测 AI 智能体团队历史任务的处理过程,最终沉淀为观测 AI Agent 团队可以持续复用的,针对某类问题的解决方案。

它解决了故障排障里的三个问题:

  • 每次排查路径都不一样——这次先看日志,下次先看指标;

  • 步骤遗漏——忘了核对某个信号,根因方向会直接跑偏;

  • 经验无法复用——同一个故障,三个月后换个人重新排查一遍。

有了 Runbook,观测 AI 智能体面对的不再是“请你分析一下这个故障”这种开放题,而是一道有标准解法的应用题:先巡检核心指标 → 再按错误率/延迟/Apdex 分诊 → 沿 Trace 下钻 → 关联变更事件 → 输出结论并验证。每一步该查什么、用什么工具查、查到什么算异常、异常后往哪走,全部固化在流程里。

Runbook 从哪来?三条生成路径,覆盖 Copilot 与 Agent Teams

观测云同时支持 Obsy AI Copilot 和 Guance AI Agent Teams 两种形态生成 Runbook,让经验沉淀发生在工作的每一个现场。

路径一:Copilot 在现场一键生成

当你正在看一个仪表板、一条告警或一组 Trace 时,Copilot 带着当前页面的完整上下文——图表组、筛选条件、时间范围、数据源,完成分析后,可以直接「生成 Runbook」。

以一个典型的「应用性能监控」仪表板为例,Copilot 分析完全部图表组后,生成的 APM 排障 Runbook 会自动包含:Runbook 目标与术语、仪表板结构速览、日常巡检流程(含健康判定标准)、告警响应流程(错误率告警 + 延迟告警)、慢调用排查流程(含 Trace 分析示例)、错误率异常排查流程、Apdex 下降排查流程、常见问题及处置、附录(图表索引、命令参考、联系方式)。生成即可下载、编辑、沉淀进知识库。

图片

路径二:Agent Teams 在任务完成后自动沉淀

观测 AI 智能体执行任务时,会记录完整的分析路径和操作步骤。任务完成后,AI 将这次“成功排障的过程”自动转化为对应 Runbook 或复盘内容——也就是说,每一次真实故障的处理,都在为团队生产下一次复用的标准流程。任务解决,经验入库。

图片

图片

路径三:自然语言描述直接生成

“我们排查 Redis 慢查询,一般是先看 slowlog,再看内存碎片率,然后核对最近的 Lua 脚本变更……”,让技术专家直接把他的排障经验这段话告诉观测云 AI,它会结构化为一份可执行的 Runbook,供观测云 AI 智能体直接引用。

图片

图片

图片

观测 AI 智能体如何使用 Runbook ?拆解任务、分布执行、完整验证

观测 AI 智能体接到任务后,会按照 Runbook 将目标拆解为有序步骤逐步执行,并结合观测 AI 智能体团队的协作能力,完成跨工具、跨系统的复杂动作——查指标、翻日志、钻 Trace、核对变更、评估影响。每一步执行都有明确的状态和验证标准,关键写操作进入人工审批,执行结果回到生产信号中二次确认。

  • 对人来说,Runbook 意味着不用每次都重新交代背景;

  • 对 Agent 来说,Runbook 意味着每次都用团队验证过的最佳路径解题。执行遗漏和偏差,被流程本身消灭。

而且它是一个飞轮:每次执行的过程和结论会回写,Runbook 在复用中持续修订——团队用得越多,它越贴近你的系统真实样貌。

一些 Benchmark

我们在内部基准环境中,基于 218 个真实历史故障工单回放(覆盖慢调用、错误率突增、资源水位、数据库、缓存、网络六类高频场景),对三种排查方式做了对照测试:

图片

在试点客户生产环境(某零售平台,为期 8 周)的实测中,观测 Agent Teams + Runbook 体系带来的变化同样直接:

  • MTTR 平均下降 57%,其中“定位”环节的耗时占比从约 70% 压缩到 30% 以内;

  • 夜间告警自助闭环率提升至 68%,三分之二的三更半夜,值班同学看完结论确认即可,不再需要电话叫醒专家;

  • 高频 Top 50 故障场景中,92% 已被 Runbook 覆盖,且覆盖率随每次任务自动增长。

这套体系里,通用AI Agent与 Agent Teams + Runbook 之间 30 个百分点的准确率差距,几乎不来自模型能力本身,而来自上下文、记忆与方法的差距。这正是观测云 AI 智能体团队的天然优势——完整数据,语义和经验沉淀。

让经验成为组织的资产

过去,一家公司的故障排查能力,往往过度依赖核心工程师的个人能力。他们如果没有及时响应,系统的可靠性就打了折扣。

Runbook 和知识库把经验沉淀为组织的资产:

  • 经验不再随人流动。 每一次排障过程被自动沉淀为 Runbook 与复盘,留在工作空间里,而不是某个人的浏览器收藏夹和聊天记录。

  • 新人第一天,观测云工作空间里已经有了“老师傅”。 借助 观测 AI 智能体和 Runbook,入职一周的值班同学也能跑出接近专家水准的排查路径。试点客户中,新人独立完成首次生产排障的上手时间,从平均 4~6 周缩短到约 0.5 周。

  • 专家的时间被还给专家。 当重复性排障被标准流程接管,资深工程师终于可以把精力投向架构优化、容量规划和与观测 AI 智能体一起,通过 Runbook 之外的泛化能力,解决那些真正没有被遇到过的新问题。

结尾

故障排查这件事,比拼的是每一次都以同样的水准、同样短的时间收敛问题。

现在,立刻在观测云免费开通 Obsy AI 智能服务,体验 Obsy AI Copilot 和 AI Agent Teams 强大的故障排查能力;开通观测 Agent Teams,让 观测 AI 智能体团队 7×24 安全的在你生产环境里跑起来,

Logo

这里是“一人公司”的成长家园。我们提供从产品曝光、技术变现到法律财税的全栈内容,并连接云服务、办公空间等稀缺资源,助你专注创造,无忧运营。

更多推荐