适用场景

没有指标的稳定性讨论都是感觉:用户说卡、运维说正常。SLI/SLO 把感觉变成数字,错误预算把"要不要发版"变成规则。

配置步骤(SLO 与错误预算)

# 示例:核心接口可用性 SLO 99.9%(月度)
# 错误预算 = 月度 43.2 分钟不可用
# 消耗规则:
#   <50% 正常发布
#   50%~100% 控制变更频率
#   >100% 冻结高风险变更,专治稳定性

关键参数与建议

  • SLI 选择:可用性(成功率)、延迟(P95/P99)、吞吐、数据正确性
  • SLO 设定:基于业务可接受度,而不是"越高越好"(99.9% 与 99.99% 成本差很大)
  • 错误预算:1 - SLO,用于平衡发布速度与稳定性
  • 测量口径:统计窗口、排除项(计划维护)要明确
  • 治理:预算耗尽时冻结高风险变更,优先稳定性工作

容易踩的坑

  • SLO 定得过高(99.99%),团队长期在救火
  • 错误预算无实际约束力,形同虚设
  • 未排除计划维护窗口,指标永远不达标

验证与巡检

# 证据:SLO 看板、错误预算消耗记录、变更冻结记录
  • 巡检:月度 SLO 报告、预算规则被执行

小结

SRE 指标落地的关键不是工具,而是业务方认可目标值。目标定完写进协议,之后讨论就有共同语言。

> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。