posts

Posts

221
分类 标签
Posts 封面
可观测性

可观测性建设:从 Prometheus 采集到 Grafana 告警联动

可观测性不是装几个监控工具,而是让系统在出问题时能快速定位根因。这篇文章从采集架构到 PromQL 到告警路由,覆盖我们在生产环境中实际遇到的 cardinality 爆炸、告警噪音等问题。

◷ 5 min 可观测性 · Prometheus · Grafana
Posts 封面
存储

MinIO 分布式对象存储生产实践:从 Erasure Code 到多租户

自建对象存储曾经是件麻烦事,直到 MinIO 把 S3 API + Erasure Code + 简单部署这件事做到了极致。这篇文章是我在三套生产 MinIO 集群上的运维笔记,覆盖从硬件选型到故障救火的全链路。同时会聊一下 2024 年 MinIO 商业化策 …

◷ 6 min MinIO · 对象存储 · 分布式存储
Posts 封面
编程

Python 对接 Prometheus:查询监控数据与告警状态自动化

用 Python 直接调 Prometheus HTTP API,实现服务存活巡检、可用率日报生成,最后接入钉钉每日自动推送集群健康摘要。

◷ 5 min Python · Prometheus · 监控
Posts 封面
编程

Python 异步编程实战:asyncio 在 AI 应用中的使用

AI 应用天然是 I/O 密集型的:等 LLM 响应、等向量数据库检索、等多个工具调用返回。同步写法在这里是性能杀手。这篇文章从 event loop 原理讲到实际的 AI 应用模式,重点是 asyncio.gather 并发调用、SSE 流式输出处理和常见陷 …

◷ 8 min Python · asyncio · 异步编程
Posts 封面
数据库

MongoDB 分片集群实战:从 shard key 设计到 chunk 均衡的全链路

很多团队把 MongoDB 分片当成"设个 shard key 就完事",结果上线半年后发现 80% 数据在一个 shard 上、balancer 每天搬几十 GB 却怎么都追不上、某个 collection 出现 jumbo chunk …

◷ 7 min MongoDB · 分片 · 数据库运维
Posts 封面
编程

Python 自动化运维:从脚本到完整工具的工程化实践

系统梳理 Python 运维自动化的工程化方法:boto3 操作 AWS 资源、Kubernetes Python SDK 使用、Click/Typer CLI 框架选型、数据库批量运维脚本、钉钉 Webhook 集成,以及类型注解与错误处理的实践经验。

◷ 8 min Python · 自动化 · 运维
Posts 封面
数据库

Redis Cluster 扩缩容与数据迁移实战:从 SETSLOT 到 Atomic Slot Migration

很多团队把 Redis Cluster 当成"开箱即用"的分布式 Redis,直到要做扩缩容或数据迁移时才发现:SETSLOT 协议里有十几种状态,迁移过程中客户端重定向要么不生效要么风暴,migrate 卡住没法断,big key 直接把 …

◷ 7 min Redis · Redis Cluster · 数据库运维
Posts 封面
数据库

Redis 运维实践:持久化配置、集群模式与生产监控

Redis 运维看起来简单,但真到了生产出了问题才知道水有多深。本文整理了持久化、集群、监控、故障处理等核心运维主题。

◷ 5 min Redis · 数据库 · 运维