09 Agent 评测与可观测
学习目标:能观察每次 Agent 执行的模型调用、工具调用、RAG 检索、失败点、成本和任务成功率,并能用基准集做轨迹级评测和回归。 重点度:必会(10 分) 前置要求:Ch5 Agent Runtime、Ch6 工作 …
学习目标:能观察每次 Agent 执行的模型调用、工具调用、RAG 检索、失败点、成本和任务成功率,并能用基准集做轨迹级评测和回归。 重点度:必会(10 分) 前置要求:Ch5 Agent Runtime、Ch6 工作 …
概述# On-call 是 SRE 工作中最直接影响工程师生活质量的部分。Google SRE Book 里有明确约束:SRE 的 on-call 工作量不能超过总时间的 25%。这不是福利,是工程要求——超了就说明告警 …
CI(Continuous Integration,持续集成)是 DevOps 工具链的核心环节。本章不讲具体工具,讲 CI 的概念框架:为什么需要 CI、流水线的标准结构、缓存与并行、触发策略、以及一个完整 CI 闭环 …
K8s 中 Pod 的生命周期是短暂的——调度、重启、扩缩容都会改变 Pod IP。如果客户端直接用 Pod IP 访问服务,Pod 一重建 IP 就变了,所有连接瞬间断裂。Service 的出现正是为了解决这个问题:它 …
Linux 运维基础 · 第九章 目标:理解进程生命周期,掌握查看、控制、调试进程的方法 1. 概述# 进程是操作系统的核心管理单元。运维每天做的就是"看看进程在不在、响应正不正常、要不要重启、为什么吃这么多 …
学习目标:能设计不会随便越权、能审计、能人工确认、能限制成本、能防混淆代理人攻击的 Agent 执行系统。 重点度:必会(7 分) 前置要求:Ch4 Tool Calling、Ch5 Agent Runtime、Ch8 …
概述# 告警响了、值班人 ack 了,然后呢?90% 的团队没有结构化的响应流程——群聊里 30 个人问"谁能看一下",5 个人在查、8 个人在聊天、业务方没人通报。本章建立规范化的事故响应流程,核心 …
GitHub Actions 是 GitHub 内置的 CI/CD 平台,2018 年上线后迅速成为 SaaS CI 的主流选择。本章讲它的核心概念:workflow YAML 结构 …