posts

Posts

221
分类 标签
Posts 封面
Kubernetes

SLO/SLI/Error Budget 从理论到落地:SRE 可靠性工程实战

从 SLI 指标选取到 Error Budget 消耗速率告警,系统讲解 SRE 可靠性工程体系的落地实践,包括 Prometheus recording rules 计算 SLI、多窗口 burn rate 告警规则配置、SLO 违规复盘流程,以及与开发团队 …

◷ 6 min SRE · SLO · SLI
Posts 封面
可观测性

Cilium Hubble 实战:用 eBPF 看透 Kubernetes 网络

Cilium Hubble 是 Kubernetes 下最接近交换机镜像端口的东西。本文讲清楚它的架构、关键配置和生产上如何读 flow 定位网络问题。

◷ 6 min Cilium · Hubble · eBPF
Posts 封面
可观测性

VictoriaMetrics:比 Prometheus 更省资源的监控存储方案

Prometheus 撑不住了?本文对比 VictoriaMetrics 与 Prometheus 的核心差异,介绍 remote_write 无缝迁移方案,以及 VM 在资源占用、压缩率、查询性能上的实际提升。

◷ 3 min VictoriaMetrics · Prometheus · 监控
Posts 封面
可观测性

Thanos 实战:多 K8s 集群 Prometheus 统一监控与长期存储

记录我们将三套 EKS 集群的独立 Prometheus 迁移到 Thanos 统一监控体系的全过程,重点覆盖选型决策、生产配置和踩坑总结。

◷ 5 min Thanos · Prometheus · Kubernetes
Posts 封面
可观测性

OpenTelemetry 落地实践:统一采集 Traces、Metrics、Logs

从为什么选 OpenTelemetry 讲起,给出 DaemonSet + Gateway 的 Collector 部署架构、关键配置和实际踩坑记录。

◷ 4 min OpenTelemetry · 可观测性 · Traces
Posts 封面
可观测性

Grafana Tempo 大规模分布式追踪实战:从 OTel 接入到 TraceQL 调优

Tempo 是目前最便宜的分布式追踪后端。本文把架构、接入、TraceQL、tail sampling、成本优化、事故案例都串起来,供团队直接抄作业。

◷ 8 min Tempo · Tracing · 可观测性
Posts 封面
可观测性

可观测性三支柱实战:Metrics/Logs/Traces 联动

监控告诉你系统挂了,可观测性告诉你为什么挂。本文从三支柱的核心差异出发,讲透 Prometheus+Loki+Tempo 的联动排障流程,覆盖 OpenTelemetry 采集标准、Exemplar 原理与配置,以及可观测性建设的优先级策略。

◷ 6 min 可观测性 · Prometheus · Loki
Posts 封面
DevOps

DORA 指标与平台工程效能度量:用数据驱动 DevOps 改进

DORA 四个指标不是考核工具,是诊断工具。从 CI/CD 流水线和 Incident 系统采集数据,找到部署频率低、前置时间长的真实原因,然后用平台工程手段系统性改进。本文给出采集方案、Grafana 看板设计和常见误用陷阱。

◷ 4 min DevOps · DORA · 平台工程