Posts
基于 Error Budget 的 Prometheus 告警设计——燃烧率告警实战
错误率告警有一个致命问题:它不告诉你问题有多紧急。1% 的错误率,持续 2 小时和持续 10 分钟,对 SLO 的威胁完全不同。燃烧率告警从 Error Budget 消耗速度出发,让每一次告警都携带"紧急程度"信息。
告警带图实战:Grafana Render + 钉钉推送趋势图
收到告警只有一行数字,还要登录 Grafana 才能看趋势图——这是告警体验最大的痛点之一。本文介绍如何将 Grafana Image Renderer 与 Alertmanager Webhook 结合,实现告警消息自动附带趋势图的完整方案。
Prometheus 进程监控:process-exporter 实战与告警配置
K8s 有完善的 Pod 监控体系,但裸机和 VM 上运行的进程如何监控?本文介绍 process-exporter 的部署与配置实践,覆盖进程组匹配、核心指标、告警规则设计及实际踩坑经验。
Kibana 实战:从日志查询到 Dashboard 可视化的完整指南
Kibana 是我们 ELK 体系里使用频率最高的工具。这篇文章把我在实际运维中积累的 Kibana 使用技巧整理成体系,从 Discover 查询到 Dashboard 制作,再到 ILM 管理。
高级运维/DevOps 工程师面试题精选:系统设计与深度考察
高级运维面试考什么?本文整理 5 道系统设计题和 10 道深度技术题,每题给出答题框架。从监控体系设计到 K8s 调度器原理,从生产事故复盘到新技术引入决策,帮你建立完整的回答思路。
DevOps/运维工程师面试题精选:K8s、Linux、网络高频考点
基于真实面试经验整理的运维/DevOps 面试题,覆盖 K8s 调度、故障排查、Linux 内核、网络协议等方向,附「面试官真正想考的点」,帮你把答案说到位。
SLSA 软件供应链等级实施:从 L1 到 L3 的工程化路径
一份 SLSA v1.0 框架的实战落地笔记:讲清楚 Build Track 从 L1 到 L3 的具体要求、用 GitHub Actions 官方 generator 和 Tekton Chains 生成 provenance、用 slsa-verifier …
阿里云 SDK 运维自动化:ECS/ACK/RDS 资源管理与巡检脚本
用阿里云 Python SDK 实现 ECS 实例查询与监控、ACK 节点状态检查、RDS 慢查询巡检,整合成 HTML 格式巡检报告自动推送钉钉。