Posts
221 篇
ELK Stack
Filebeat + Logstash 日志采集管道:大规模日志处理实战
大流量日志场景下,Fleet 直写 ES 会出现严重写入堆积。本文记录了我们从 Fleet 切换到 Filebeat + Kafka + Logstash 管道的全过程,重点讲 Logstash pipeline 配置和性能调优。
零信任
SPIFFE/SPIRE 工作负载身份实战:零信任网络的身份基石
一份从生产部署出发的 SPIFFE/SPIRE 实战笔记:讲清楚 SVID、节点证明、工作负载证明、信任域联邦这些核心概念,用 Kubernetes + Istio + 非 K8s 工作负载的混合场景展示 SPIRE 如何统一身份,并分享升级、备份、Agent …
ELK Stack
ELK 集群监控:用 Prometheus + Grafana 监控 Elasticsearch 健康
Kibana 内置的 Stack Monitoring 免费功能有限,告警媒介也受商业授权约束。我们最终选择 Prometheus + Grafana 方案监控 ELK 集群,这篇文章记录完整的落地过程和踩坑。
ELK Stack
Elasticsearch 备份与恢复:快照管理与跨集群迁移实践
Snapshot API 配置、S3 IRSA 认证、定时快照脚本,以及跨集群迁移三种方案的对比与实战踩坑。
安全
Falco 运行时安全实战:从规则开发到生产级调优
一份来自生产环境的 Falco 实战笔记:从 eBPF 驱动选型、规则开发方法论、误报治理,到与 Falcosidekick、Loki、SIEM 的告警联动,覆盖 0.40/0.41/0.42 三个版本的关键变更与真实踩坑案例。
ELK Stack
Elasticsearch 查询实战:从 URI Search 到 DSL 复杂聚合
ES 查询是每个运维必须掌握的技能。这篇文章从 URI Search 快速上手,到 DSL bool 查询、聚合分析,再到运维常用的 _cat API,配合真实排障场景整理成一篇实战手册。
可观测性
Prometheus 高基数治理实战:从 8 亿 series 到可控增长
高基数是 Prometheus 生态里最常见的性能杀手。这篇把「为什么发生、怎么发现、怎么治理」讲清楚,并给出一套可推广的组织治理方案。
ELK Stack
Elasticsearch 索引策略:ILM 生命周期管理与写入性能优化
ILM 四阶段配置、rollover 策略、bulk 写入调优,以及分片数规划和 mapping 爆炸的避坑指南。
没有匹配的文章,试试减少筛选条件。