4SRE 站点可靠性工程

面向已掌握 K8s + DevOps 工具栈的运维/开发人员,从可靠性理念到工程实践。 前置:Linux基础 → K8s+容器化 → DevOps工程实践

路线表#

阶段章节核心知识点
—01-路线总览定位·学习顺序·与DevOps的边界
一 理念基石02-SRE是什么Google起源·软件工程做运维·与DevOps关系
03-可靠性目标SLI-SLO-SLASLI选型·SLO制定(为何非100%)·SLA与赔付·三者关系
04-错误预算Error Budget计算·预算用尽=停发布·速度与稳定平衡
二 减负与自动化05-消除琐事Toil什么算toil·50%上限·自动化优先级
06-自动化工程手动→自愈演进阶梯·工具化思维
三 可观测与告警07-四个黄金信号延迟/流量/错误/饱和度·白盒vs黑盒
08-告警工程症状vs原因告警·告警疲劳·可执行性
四 事件响应09-On-call值班轮班制度·响应时间分级·交接与心理负荷
10-事件管理Incident Command·IC/CL/OL角色·SEV严重等级
11-故障复盘无指责Postmortem·时间线/根因·行动项闭环
五 可靠性设计12-分布式可靠性模式冗余/降级·熔断/限流·重试退避·故障隔离
13-容量规划需求预测·压测基准·资源水位/自动扩缩
14-发布工程发布即风险·渐进式发布·自动回滚触发条件
六 韧性验证15-混沌工程稳态假设·故障注入·爆炸半径·演练
16-SRE与研发协作嵌入式SRE·可靠性准入·责任共担
面试题5类概念解释/对比辨析/原理追问/场景排查/方案设计

与DevOps的边界#

主线:DevOps管「工具怎么搭」,SRE管「指标怎么定、决策怎么做」

重叠主题DevOps已覆盖(引用)SRE重点(补充)
可观测性Prometheus/Grafana/Loki部署配置(DevOps Ch25-28)黄金信号/SLI-SLO设计/告警工程(Ch7-8)
发布策略蓝绿/金丝雀/滚动配置(DevOps Ch17)可靠性视角/自动回滚触发(Ch14)
告警Alertmanager路由/抑制(DevOps Ch25)症状vs原因/燃烧率告警(Ch8)
稳定性质量门禁(DevOps Ch13)熔断/限流/降级(Ch12)

SRE章节中引用DevOps工具层内容时标注"见DevOps路线ChX",不重复编写。

正文精讲 15

    理念基石
    1. 02 SRE 是什么
    2. 03 可靠性目标:SLI / SLO / SLA
    3. 04 错误预算(Error Budget)
    减负与自动化
    1. 05 消除琐事(Toil)
    2. 06 自动化工程
    可观测性与告警
    1. 07 四个黄金信号(Four Golden Signals)
    2. 08 告警工程
    事件响应
    1. 09 On-Call 值班
    2. 10 事件管理(Incident Management)
    3. 11 故障复盘(Blameless Postmortem)
    系统可靠性设计
    1. 12 分布式可靠性模式
    2. 13 容量规划(Capacity Planning)
    3. 14 发布工程
    韧性验证
    1. 15 混沌工程(Chaos Engineering)
    2. 16 SRE 与研发协作

    面试题 6

    答案默认折叠,点题目展开;可开「自测模式」全部收起。