Skip to content

日志、指标、链路与告警

统一上下文

服务应传播 Trace ID,并在结构化日志中记录 Trace ID、服务、环境、版本和请求结果。禁止记录密码、Token、完整身份证件或支付信息。

OpenTelemetry 提供统一的 API、SDK、语义约定和 Collector,可把遥测数据发送到不同后端。它解决采集与传输标准化,不替代存储、查询和告警平台。

观测重点

  • 面向用户:成功率、延迟、关键业务结果和前端体验。
  • 面向服务:请求量、错误、延迟、饱和度及依赖调用。
  • 面向资源:CPU、内存、磁盘、网络、队列和连接池。
  • 面向变更:部署版本、配置修改、功能开关和扩缩容事件。

告警原则

  • 告警应对应需要人立即采取的动作,并链接 Dashboard 和 Runbook。
  • 优先根据 SLO 消耗或用户影响告警,资源阈值用于诊断和容量预警。
  • 设置持续时间、抑制、分组和维护窗口,减少瞬时抖动与告警风暴。
  • 记录负责人、严重等级和升级路径;定期删除无动作或长期静默的告警。

数据治理

根据排障、合规和成本设置采样与保留期。高基数 Label 会显著增加指标成本;Debug 日志不应在生产无限保留。遥测管道自身也需要队列、丢弃量和延迟监控。

Powered by VitePress