SRE 知識工作流
建立 SRE 事故知識庫:整理 runbook 與事故復盤
把 runbook、事故復盤與核准的事件筆記整理成有來源、可審查且不會默默過期的值班知識。
文章封包
Workflows
維護 runbook、事故復盤與值班知識的 SRE、平台工程與 on-call 團隊
9 分鐘閱讀
01
用一個服務、環境與事故類型固定來源邊界。
02
讓診斷步驟、緩解限制與驗證訊號回到目前 runbook 或事故復盤。
03
每次事故或系統變更後審查過期步驟,不讓舊建議默默留在值班流程。
信任 runbook 前,先檢查來源與審查狀態
這是 Wenlan App 確定性測試資料的真實桌面畫面,不是事故或客戶工作區。畫面顯示有來源數量的 Pages 與審查佇列;SRE 可以用相同介面讓來源變動與未解衝突保持可見。

- 01
固定事故知識邊界
選定一個服務、環境、事故類型與核准來源,不匯入不受控的操作檔案庫。
- 02
整理可審查的 runbook Page
保存症狀、證據、唯讀檢查、緩解限制、停止條件與驗證訊號,並連回目前來源。
- 03
事故或變更後再驗證
檢查引用修訂、stale 狀態與未解衝突,再於核准的非生產環境演練。
事故知識封包範例
這是審查欄位的結構範例,請以一個服務與事故類型的核准證據取代每一列。
- 證據輸入
- 目前 runbook、有日期的事故復盤、架構筆記或去識別事件摘要,並附負責人與修訂。
- 操作主張
- 一個症狀、診斷步驟、緩解邊界或驗證訊號,連到確切支持段落。
- 審查結果
- 目前有效、互相矛盾、已過期、不安全或仍未解,並記錄服務版本、環境、審查者與下次測試。
01
先回答:一個事故類型維護一份可重做的知識
每個服務或操作邊界建立一份事故知識庫。只加入核准的 runbook、事故復盤、架構筆記與去識別事件摘要;維護症狀、前置條件、唯讀診斷、緩解限制、停止條件、驗證訊號、負責人與審查日期。
Wenlan 能讓支援的文件連到有來源 Pages、引用、修訂、stale 狀態、lint 與人工審查。它不會監控正式環境、接收告警、匯入即時 telemetry、執行 runbook、核准變更或取代事故管理系統。
02
事故穩定後,再整理來源
從一個服務、環境與事故類型開始。把即時監控、原始 log、憑證、客戶資料與變更核准留在專用系統,只把經核准且可引用的文件加入來源邊界。
保存每份來源的日期、修訂、負責人與適用環境。把觀察事實、假設、緩解措施與確認原因分開,不要為了寫出順暢摘要而把多個 contributing factors 壓成一個原因。
03
建立事故到 runbook 的審查閉環
每次事故或系統變更後,只刷新受影響的知識,並讓負責人重新驗證步驟。
- 記錄服務、環境、事故類型、來源修訂與知識負責人。
- 保存症狀、適用條件、唯讀檢查、風險、停止條件與驗證訊號。
- 來源或系統改變時,先把受影響內容標成 stale。
- 在 staging 或 tabletop 演練中測試步驟、連結、預期輸出與回復方式。
- 值班使用前打開確切來源;檢索到 runbook 不等於獲准執行正式變更。
完成 Wenlan 與 AI 客戶端設定後
wenlan status
wenlan sources add ~/Ops/approved-incident-knowledge
/distill <服務與事故類型>
/pages <服務事故 runbook>
/lint
/curate04
保留正式操作的安全邊界
監控、告警分派、telemetry、事故指揮、權限、變更核准、rollback 執行與緊急存取仍應留在專用系統。Wenlan 不會對正式環境驗證命令,也不能保證 runbook 安全。
操作前由具名負責人核對服務版本、環境、權限、風險、預期輸出、停止條件與 rollback。這份知識提供可檢查情境,不是自動執行授權。
讓一個事故教訓能被重做
選定一個服務與事故類型,連接目前 runbook 與事故復盤,再於下一次值班前審查每個操作主張。
FAQ