Skip to content

事故响应

事故响应目标是尽快降低用户影响、恢复服务并从系统层面避免复发,而不是在故障中寻找责任人。

准备

  • 定义严重等级、值班表、升级路径和状态通知渠道。
  • 为高风险服务维护 Dashboard、依赖图、回滚步骤和 Runbook。
  • 部署、配置、功能开关和基础设施变更进入统一时间线。
  • 定期演练错误发布、Secret 泄漏、仓库不可用和集群故障。

响应流程

  1. 确认:验证告警、用户影响、范围和当前变更。
  2. 指挥:指定 Incident Commander、技术处理和沟通角色。
  3. 止损:回滚、切流、关闭功能、限流或降级,优先恢复核心能力。
  4. 调查:保留日志、指标、Trace、配置和部署证据,建立时间线。
  5. 恢复:逐步恢复流量,持续观察 SLI,确认积压任务和数据一致性。
  6. 关闭:通知相关方,安排复盘并跟踪整改项。

沟通

内部更新应固定节奏,说明事实、影响、当前动作和下次更新时间。对外状态通知使用用户可理解的影响描述,不发布未经验证的根因。

复盘

复盘记录影响、发现方式、时间线、根因、促成因素以及哪些防线未生效。整改项必须有负责人、截止时间和验收方式;优先修复能降低同类事故概率或缩短恢复时间的系统性问题。

Secret 泄漏时先吊销凭据再清理历史;安全事件还需遵循证据保全、合规和通知流程。

Powered by VitePress