posts

Posts

221
分类 标签
Posts 封面
SRE

On-Call 轮值管理实战:从告警疲劳到可持续值班

On-call 不是福利也不是惩罚,是一份职责。把它做成可持续的工程实践,比任何高级监控工具都重要。

◷ 5 min On-Call · SRE · 告警
Posts 封面
ELK Stack

Elasticsearch 集群部署实战:ECK 在 K8s 上的生产级配置

从集群角色规划到 ECK Operator 落地,结合生产环境踩坑经验,完整讲解 Elasticsearch 在 Kubernetes 上的生产级部署方案。

◷ 5 min Elasticsearch · ELK · Kubernetes
Posts 封面
云原生

eBPF 可观测性实践:Cilium 网络监控与 Tetragon 安全审计

eBPF 正在重塑云原生可观测性的底层基础。本文记录在 K8s 集群中落地 Cilium + Hubble 网络监控和 Tetragon 安全审计的实践经验。

◷ 3 min eBPF · Cilium · Tetragon
Posts 封面
Kubernetes

混沌工程实战:Chaos Mesh 在 K8s 中注入故障

混沌工程不是破坏系统,而是在可控环境中提前暴露脆弱点。本文记录了我用 Chaos Mesh 在生产级 K8s 集群中设计并执行混沌演练的完整过程,包括安装、实验配置、Workflow 编排和游戏日流程设计。

◷ 4 min chaos-engineering · chaos-mesh · Kubernetes
Posts 封面
DevOps

Backstage 开发者门户实战:构建内部开发者平台

当团队规模超过 50 人,服务数量超过 100 个,「配置漂移」和「信息孤岛」就成了真实痛点。Backstage 是解决这个问题的平台工程利器。本文从部署到定制,完整拆解如何用 Backstage 构建真正能用起来的内部开发者平台。

◷ 11 min Backstage · 平台工程 · 开发者体验
Posts 封面
Kubernetes

OPA/Kyverno:K8s 准入控制策略实战

没有准入控制的 K8s 集群就像一个没有门卫的机房——任何人都能随意进出。本文记录了我在多个生产集群部署 Kyverno 策略的实战经验,涵盖资源限制强制、镜像来源白名单、标签规范、以及与 OPA Gatekeeper 的对比选型思路。

◷ 5 min kyverno · opa · Kubernetes
Posts 封面
SRE

故障响应与 Blameless 复盘:让每一次事故都变成组织资产

事故响应不是英雄主义,是一套可重复的流程。把流程、模板、文化讲清楚,让每次事故都能沉淀成组织资产。

◷ 6 min 故障响应 · Postmortem · SRE
Posts 封面
安全

供应链安全:Trivy 镜像扫描 + Cosign 签名验证实践

你的镜像安全吗?本文梳理容器供应链的主要攻击面,手把手演示 Trivy 扫描、Cosign 签名、K8s 准入控制三层防护的搭建过程,并给出 GitLab CI 集成示例。

◷ 4 min Trivy · Cosign · 安全