Posts
自研 Kubernetes Admission Webhook 开发实战:从零到生产
Kubernetes 的 admission 体系是一个强大但脆弱的扩展点。webhook 挂了能让集群所有 Pod 创建卡死。写一个能上生产的 webhook 不难,但要让它在面对各种怪异请求、证书轮换、集群升级、大流量突发时都不挂,就是另一回事了。这是一份 …
数据库运维实践:MySQL 高可用与 PostgreSQL 调优经验
数据库运维不复杂,但细节多、出问题代价大。本文整理了 MySQL 主从复制、慢查询分析、PostgreSQL 连接池这几个高频话题的实战经验,以及一些日常运维 SQL 备忘。
Kafka 运维实战:消息堆积排查、分区再平衡与监控体系
系统梳理 Kafka 运维核心技能:消费者延迟监控告警、消息堆积根因分析、分区扩容规划、Rebalance 风暴处理,以及 KEDA 基于 lag 自动扩缩的配置实践。
Cluster API 实战:用声明式的方式管理 Kubernetes 集群的生命周期
用 Terraform 建集群是起手式,但集群一旦多起来 Terraform 的代码量和状态管理开始爆炸。Cluster API 把'集群'本身做成了 Kubernetes CRD——你在 Management Cluster 里 kubectl apply …
MongoDB 运维入门:部署、备份与生产性能调优
MongoDB 运维从选型到调优:何时选 MongoDB、Replica Set 三节点部署、索引设计、mongodump 备份,以及 wiredTiger、连接池、大文档等生产踩坑。
KubeVirt 生产实战:在 Kubernetes 上跑虚拟机的完整路线
Broadcom 吃掉 VMware 之后,VMware 替代方案成了所有基础设施团队的议题。KubeVirt 1.8 已经是个相当成熟的选择,能在 Kubernetes 里跑真正的 VM——不是轻量容器、不是 microVM,是完整的 …
Alertmanager Webhook 开发:自定义告警处理与 API 集成
Alertmanager 内置的通知渠道不支持钉钉、飞书等国内工具,Webhook 是扩展告警通知的标准方式。本文用 Python Flask 实现完整的 Webhook 接收器,涵盖消息格式化、降噪去重、Alertmanager API 集成和 K8s 部署 …
Descheduler 深度实战:Kubernetes 自动再平衡的正确打开方式
kube-scheduler 只在 Pod 创建那一刻做决策,之后集群状态变了它就不管了。几个月下来,你的集群会变成 hot node + cold node 混杂、同一个 Deployment 的 Pod 全挤在一个 node、failure-domain …