02 大规模训练稳定性保障
学习目标:能保障千卡级分布式训练的稳定运行——理解「掉卡即中断」的同步训练特性;掌握「故障检测 → 中断 → checkpoint 恢复 → 重调度」的自动恢复闭环;会用 NCCL_DEBUG 等手段排查训练 …
学习目标:能保障千卡级分布式训练的稳定运行——理解「掉卡即中断」的同步训练特性;掌握「故障检测 → 中断 → checkpoint 恢复 → 重调度」的自动恢复闭环;会用 NCCL_DEBUG 等手段排查训练 …
学习目标:能解释 AI 集群为什么依赖高速网络;能从运维视角说清 RDMA / InfiniBand / RoCEv2 的区别与选型;能做 RoCE 无损网络的 PFC/ECN 配置检查与丢包定位;能用 …
学习目标:能从运维视角把 K8s GPU 集群管起来(device plugin / GPU Operator / NFD / Volcano/Kueue 的运维面);能设计和运维配额、抢占、优先级、多租户隔离,会治理 …
学习目标:能说清 AI Infra 是什么、边界在哪(vs MLOps vs 平台工程);能分清「运维/SRE 方向」和「研发方向」的分野,知道自己走哪条、JD 怎么辨;能画出 AI Infra 的分层全景图;能说出模 …
定位:把 Agent 做成可用产品 对应主路线:Ch2(LLM 应用基础)、Ch3(RAG)、Ch4(Tool Calling)、Ch6(工作流编排)、Ch11(产品化集成) 核心能力领域# 1. Agent 产品设计 …
定位:把训练、推理、评测、发布做成平台能力,让业务团队自助完成模型上线 对应主路线:Ch2(推理服务化)、Ch5(稳定性与可观测)、Ch6(平台治理) 典型团队:公司内部 AI 平台部、中台团队、MLOps 团队 核心 …
定位:把模型变成高并发、低延迟、可稳定调用的服务 对应主路线:Ch1(推理基础)、Ch2(推理服务化)、Ch3(性能优化)、Ch5(稳定性) 典型团队:推理服务团队、LLM 服务团队、AI Infra 核心团队 核心能 …
定位:企业知识库 / 问答 / 文档分析 对应主路线:Ch3(RAG / Context 工程) 核心能力领域# 1. 文档解析与处理# 多格式文档解析(PDF / Word / Excel / HTML / …