适用场景
没有指标的稳定性讨论都是感觉:用户说卡、运维说正常。SLI/SLO 把感觉变成数字,错误预算把"要不要发版"变成规则。
配置步骤(SLI 定义与采集)
# 可用性 SLI = 成功请求 / 总请求(按接口维度)
# 延迟 SLI = P95/P99 响应时间
# 数据正确性 SLI = 对账差异率
# 采集来源:网关日志、APM、业务埋点
关键参数与建议
- SLI 选择:可用性(成功率)、延迟(P95/P99)、吞吐、数据正确性
- SLO 设定:基于业务可接受度,而不是"越高越好"(99.9% 与 99.99% 成本差很大)
- 错误预算:1 - SLO,用于平衡发布速度与稳定性
- 测量口径:统计窗口、排除项(计划维护)要明确
- 治理:预算耗尽时冻结高风险变更,优先稳定性工作
容易踩的坑
- 只统计 2xx 不统计业务失败(如返回 200 但业务错误)
- 全站平均掩盖单接口问题
- 采集口径与业务理解不一致
验证与巡检
# 验证:SLI 与业务对账数据一致
- 巡检:SLI 定义文档、与业务口径一致性确认
小结
SRE 指标落地的关键不是工具,而是业务方认可目标值。目标定完写进协议,之后讨论就有共同语言。
> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。