适用场景

三支柱不是三套工具,而是三种视角:指标告诉你"有没有问题",链路告诉你"慢在哪一段",日志告诉你"为什么"。

配置步骤(三支柱打通与排障案例)

# 排障路径
# 1) 指标告警:某接口 P99 突增 → 找到时间窗口
# 2) 链路:定位慢在数据库调用 → 得到 trace_id
# 3) 日志:按 trace_id + 时间检索,看到慢 SQL 与锁等待
# 4) 处置与复盘

关键参数与建议

  • 指标:聚合数据,用于告警与趋势(Prometheus 类)
  • 日志:明细数据,用于定位与取证(集中日志平台)
  • 链路:请求级数据,用于定位跨服务瓶颈(Tracing)
  • 统一标识:trace_id 贯穿日志与链路,方便跳转
  • 采样与成本:全量指标 + 采样链路 + 分级日志

容易踩的坑

  • 三套系统各自为政,无法串联
  • 时间未同步,跨系统对不上
  • 日志缺少关键字段(SQL、下游地址)

验证与巡检

# 验证:做一次演练,记录从告警到定位的耗时
  • 巡检:演练耗时趋势改善

小结

可观测性的验收场景:给一个用户报障时间点,能在 5 分钟内定位到具体接口、具体下游、具体错误。做到就合格。

> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。