SRE 知识工作流
建立 SRE 故障知识库:整理 runbook 与故障复盘
把 runbook、故障复盘与批准的事件笔记整理成有来源、可审核且不会悄悄过期的值班知识。
文章封包
Workflows
维护 runbook、故障复盘与值班知识的 SRE、平台工程与 on-call 团队
9 分钟阅读
01
用一个服务、环境与故障类型固定来源边界。
02
让诊断步骤、缓解限制与验证信号回到当前 runbook 或故障复盘。
03
每次故障或系统变更后审核过期步骤,不让旧建议悄悄留在值班流程。
信任 runbook 前,先检查来源与审核状态
这是 Wenlan App 确定性测试数据的真实桌面画面,不是故障或客户工作区。画面显示带来源数量的 Pages 与审核队列;SRE 可以用同一个界面让来源变化与未解决冲突保持可见。

- 01
固定故障知识边界
选定一个服务、环境、故障类型与批准来源,不导入不受控的运维资料库。
- 02
整理可审核的 runbook Page
保存症状、证据、只读检查、缓解限制、停止条件与验证信号,并连接到当前来源。
- 03
故障或变更后再验证
检查引用修订、stale 状态与未解决冲突,再在批准的非生产环境演练。
故障知识包示例
这是审核字段的结构示例,请用一个服务与故障类型的批准证据替换每一行。
- 证据输入
- 当前 runbook、有日期的故障复盘、架构笔记或脱敏事件摘要,并附负责人和修订。
- 运维主张
- 一个症状、诊断步骤、缓解边界或验证信号,连接到准确支持段落。
- 审核结果
- 当前有效、互相矛盾、已经过期、不安全或仍未解决,并记录服务版本、环境、审核人和下次测试。
01
先回答:一个故障类型维护一份可复现的知识
每个服务或运维边界建立一份故障知识库。只加入批准的 runbook、故障复盘、架构笔记与脱敏事件摘要;维护症状、前置条件、只读诊断、缓解限制、停止条件、验证信号、负责人和审核日期。
Wenlan 能让支持的文档连接到有来源 Pages、引用、修订、stale 状态、lint 与人工审核。它不会监控生产环境、接收告警、导入实时 telemetry、执行 runbook、批准变更或替代故障管理系统。
02
故障稳定后,再整理来源
从一个服务、环境与故障类型开始。把实时监控、原始日志、凭证、客户数据与变更批准留在专用系统,只把经过批准且可以引用的文档加入来源边界。
保存每份来源的日期、修订、负责人和适用环境。把观察事实、假设、缓解措施与确认原因分开,不要为了写出顺畅摘要而把多个 contributing factors 压成一个原因。
03
建立故障到 runbook 的审核闭环
每次故障或系统变更后,只刷新受影响的知识,并让负责人重新验证步骤。
- 记录服务、环境、故障类型、来源修订与知识负责人。
- 保存症状、适用条件、只读检查、风险、停止条件与验证信号。
- 来源或系统改变时,先把受影响内容标成 stale。
- 在 staging 或桌面演练中测试步骤、链接、预期输出与回退方式。
- 值班使用前打开准确来源;检索到 runbook 不等于获准执行生产变更。
完成 Wenlan 与 AI 客户端设置后
wenlan status
wenlan sources add ~/Ops/approved-incident-knowledge
/distill <服务与故障类型>
/pages <服务故障 runbook>
/lint
/curate04
保留生产操作的安全边界
监控、告警分派、telemetry、故障指挥、权限、变更批准、rollback 执行与紧急访问仍应留在专用系统。Wenlan 不会对生产环境验证命令,也不能保证 runbook 安全。
操作前由具名负责人核对服务版本、环境、权限、风险、预期输出、停止条件与 rollback。这份知识提供可检查上下文,不是自动执行授权。
让一个故障教训能够复现
选定一个服务与故障类型,连接当前 runbook 与故障复盘,再在下一次值班前审核每个运维主张。
FAQ