posts

Posts

221
分类 标签
Posts 封面
可观测性

Alertmanager 完全指南:路由、抑制、静默与多渠道通知

告警太多和告警太少一样有害。Alertmanager 的路由、抑制、分组机制是控制告警噪声的核心手段,本文从一个真实的多环境告警体系出发,讲清楚每个配置的意图和陷阱。

◷ 7 min Alertmanager · Prometheus · 告警
Posts 封面
可观测性

Grafana API 自动化:用代码管理 Dashboard、数据源和告警

手动点 UI 管理 Grafana Dashboard 在多环境场景下是噩梦。用 API 把 Dashboard 代码化,实现版本控制和环境同步,才是正确姿势。本文提供完整的 Python 工具脚本和实战踩坑。

◷ 8 min Grafana · API · 自动化
Posts 封面
数据库

PostgreSQL 运维实战:配置调优、连接池、慢查询与高可用

系统梳理 PostgreSQL 运维核心技能:从 shared_buffers、WAL 参数调优,到 PgBouncer 事务模式配置;从 pg_stat_statements 慢查询分析到 PITR 时间点恢复;以及主从流复制、膨胀表清理和 …

◷ 10 min PostgreSQL · 数据库 · 运维
Posts 封面
Kubernetes

Kueue 批处理调度实战:让 Kubernetes 真正承担 AI/HPC 工作负载

把 AI 训练任务塞进 Kubernetes,第一天你会发现原生调度器完全不够用:没有队列、没有 quota、没有 gang scheduling、没有公平共享、preemption 语义一塌糊涂。Kueue 是 sig-scheduling 官方给出的答案, …

◷ 8 min Kueue · Kubernetes · 批处理
Posts 封面
可观测性

Prometheus 服务发现深度解析:kubernetes_sd_configs 实战

在 K8s 环境里手动维护 Prometheus scrape targets 是不现实的,kubernetes_sd_configs 配合 relabel_configs 是解决这个问题的核心机制。本文从原理到实践,把这套体系讲透。

◷ 6 min Prometheus · 服务发现 · Kubernetes
Posts 封面
平台工程

vcluster 虚拟集群实战:比 namespace 强一百倍的多租户方案

namespace 不是隔离边界,它只是一层命名约定。ClusterRole、CRD、webhook、LimitRange 全都穿透 namespace。真正的多租户需要每个租户有自己的 kube-apiserver。vcluster 让这件事便宜到几乎免费 …

◷ 7 min vcluster · 多租户 · Kubernetes
Posts 封面
ELK Stack

Elastic Agent + Fleet:下一代统一日志采集管理实践

Filebeat + Metricbeat + Auditbeat 三个 Agent 各管一摊,配置分散难以维护。Elastic Agent 将它们统一为一个 All-in-One Agent,配合 Fleet 实现中央化管理。本文记录从部署到踩坑的完整实践过 …

◷ 6 min Elastic Agent · Fleet · ELK
Posts 封面
可观测性

EFK 日志系统实战:Fluent Bit + Fluentd + Elasticsearch 完整部署

讲清楚为什么要 Fluent Bit + Fluentd 两层架构,给出可直接参考的完整 ConfigMap 配置和 ES 索引模板设计。

◷ 5 min EFK · Elasticsearch · Fluent Bit