posts

Posts

221
分类 标签
Posts 封面
可观测性

分布式链路追踪实战:Jaeger 与 Tempo 选型对比

系统梳理 Jaeger 与 Tempo 的架构差异与适用场景,结合 OpenTelemetry SDK 插桩、TraceQL 查询、采样策略和 Traces/Metrics/Logs 关联,给出可落地的生产实战方案。

◷ 11 min 链路追踪 · Jaeger · Tempo
Posts 封面
SRE

On-Call 工程实践:从告警响应到 Runbook 设计

好的 On-Call 体系不是让人 24 小时盯着屏幕,而是让每一次叫醒都有价值。从告警质量到 Runbook 设计,从轮班制度到数据驱动改进,这篇文章是我们团队在生产环境打磨 3 年的实践总结。

◷ 4 min SRE · On-Call · 告警
Posts 封面
SRE

SRE 故障管理全生命周期:从响应到复盘

故障处理不只是技术问题,更是协作和信息流问题。这篇文章完整梳理了从故障触发到 Post-Mortem 归档的每个环节,包括 IC 角色的意义、15 分钟定界框架,以及如何让 Post-Mortem 真正推动改进而不是走过场。

◷ 4 min SRE · 故障管理 · Post-Mortem
Posts 封面
可观测性

Pyroscope 持续性能剖析生产实战:给每一行代码一个性能画像

为什么 metrics/logs/traces 之外还需要 profiling,它解决的是什么问题,Pyroscope 的架构是什么,怎样以 2%~5% overhead 把它铺到整个 K8s 集群。

◷ 7 min Pyroscope · Profiling · 可观测性
Posts 封面
云原生

Crossplane:用 GitOps 方式管理云资源(AWS/阿里云)

Crossplane 把 AWS RDS、S3、EKS 变成 K8s CRD,用 GitOps 方式持续协调云资源状态。记录从概念到落地的实践过程和踩坑经验。

◷ 4 min Crossplane · GitOps · AWS
Posts 封面
博客

SRE 核心理念:从运维思维到可靠性工程

SRE 不是给运维换了个更好听的名字。它是一套用软件工程思维解决可靠性问题的方法论。本文从 Error Budget 切入,覆盖 SLI/SLO 制定、Toil 识别、On-call 设计、故障复盘文化,以及从传统运维转型 SRE 的实际路径。

◷ 4 min SRE · 可靠性 · 运维
Posts 封面
基础设施

OpenTofu 实战:开源 Terraform 管理 AWS 和阿里云基础设施

Terraform 改协议了,OpenTofu 是开源的替代。本文介绍 OpenTofu 核心概念,并给出创建 AWS EKS 和阿里云 ACK 的完整配置示例,以及 State 管理、Module 复用和 Atlantis GitOps 集成方案。

◷ 6 min OpenTofu · Terraform · IaC
Posts 封面
可观测性

Grafana Mimir 长期指标存储实战:从单集群 Prometheus 到 10 亿级 series

从一套 Prometheus HA pair 起步,一路扩到跨三地多活 Mimir,把 series 数从千万推到十亿级。本文把架构、配置、监控、事故按顺序讲清楚。

◷ 8 min Mimir · Prometheus · 可观测性