26-日志栈选型
日志是可观测性三支柱中"细但贵"的信号——保留完整事件上下文,能回答"这一次到底发生了什么",但数据量大、存储成本高。本章覆盖 EFK vs Loki 两套主流日志栈的架构对比、采 …
日志是可观测性三支柱中"细但贵"的信号——保留完整事件上下文,能回答"这一次到底发生了什么",但数据量大、存储成本高。本章覆盖 EFK vs Loki 两套主流日志栈的架构对比、采 …
链路追踪(Traces)记录一次请求穿过整个分布式系统的完整路径。单体应用看日志够用,一旦一个请求穿 5、6 个微服务,没有链路追踪排障就是盲人摸象。本章覆盖 OpenTelemetry 接入、Jaeger/Tempo …
前三章分别讲了指标、日志、追踪三支柱。单独看任何一个支柱都是片面的,三者联动才能快速定位根因。本章把三支柱缝合成一张可下钻的网,覆盖统一 Labels 关联、Grafana 统一界面、告警收敛与降噪。 监控 vs 可观测 …
传统研发流程里,安全测试往往排在最后——等功能开发完毕才交给安全团队做渗透测试,结果要么上线前发现一堆高危漏洞,要么"先上线再说",安全变成摆设。DevSecOps 的核心思想:安全左移,把安全检查前 …
密钥管理是安全的地基。再花哨的安全工具,只要有一个长期密码躺在 YAML 文件里,都等于零——那就是免费的绕过路径。本章覆盖 HashiCorp Vault 的动态密钥与租约模型、云 KMS 方案、External …
平台工程(Platform Engineering)是近年 DevOps 领域最热的话题之一。它不是 DevOps 的替代品,而是把 DevOps 实践产品化。本章简要介绍平台工程的核心概念——IDP、黄金路径、开发者体 …
Backstage 是 Spotify 开源的内部开发者平台(IDP)框架,目前是构建 IDP 的事实标准。本章简要介绍 Backstage 的架构、软件目录、模板脚手架、插件生态与 TechDocs。 为什么需要 …
学习目标:能对生产 GPU 集群做主动健康监控(nvidia-smi / DCGM / DCGM Exporter → Prometheus);看懂 GPU 故障谱系(Xid / SXid / ECC / 温度功耗)并 …