05 AI Infra 全景与岗位地图(导读)
学习目标:能说清 AI Infra 是什么、边界在哪(vs MLOps vs 平台工程);能分清「运维/SRE 方向」和「研发方向」的分野,知道自己走哪条、JD 怎么辨;能画出 AI Infra 的分层全景图;能说出模型全生命周期每一步运维负责什么;能对照岗位地图定位目标岗位与技能差距;了解国产化(昇腾)运维的差异。 重点度:导读章(先读这章建立全局观,再展开各专题;求职定位必读)
概述#
这一章是整个 AI Infra 路线的导读和地图。前面的专题(推理服务化、性能优化、算力调度、网络运维、平台治理)都是"点",这一章把它们连成"面",并回答三个求职者最关心的问题:
1. AI Infra 到底是什么?边界在哪?(别和 MLOps / 平台工程搞混)
2. 我该走"运维/SRE"还是"研发"?(🔑 决定你要点哪棵技能树)
3. 有哪些岗位、各要什么?(对照 JD 定位自己)一句话定位本路线:本路线练的是AI Infra 运维 / 智算平台 SRE——保障 GPU 集群和 AI 平台跑得稳、跑得省,不是写推理引擎和训练框架。下面反复强调这个分野。
一、AI Infra 是什么、边界在哪#
AI Infra(AI 基础设施) = 支撑 AI 模型从训练到上线运行的整套底层设施与平台,往下管硬件(GPU/网络/存储),往上给算法/业务提供"能训练、能部署、能调用"的能力。
和几个近义词的边界(面试常被问):
| 概念 | 关注点 | 和 AI Infra 的关系 |
|---|---|---|
| AI Infra | GPU 算力、集群、网络、存储、推理/训练平台的底座 | 本体,最靠近硬件 |
| MLOps | 模型的生命周期流程:数据→训练→评测→部署→监控→迭代的流程自动化 | 站在 AI Infra 之上,偏"流程/流水线" |
| 平台工程(Platform Eng) | 给开发者做自助平台(内部开发者平台 IDP) | 方法论层,AI Infra 平台可看作它在 AI 领域的落地 |
| LLMOps | MLOps 在大模型时代的延伸:Prompt、RAG、评测、推理成本 | AI Infra 之上、更贴近大模型应用 |
边界记忆:
越靠近 GPU/网络/内核 → 越是 AI Infra(本路线重点)
越靠近数据流水线/模型迭代流程 → 越是 MLOps
越靠近 Prompt/RAG/应用 → 越是 LLMOps
三者叠在一起,AI Infra 是最底下那层地基。二、🔑 AI Infra 运维 vs 研发的分野#
这是全章最重要的一节。同样叫 "AI Infra 工程师",运维方向和研发方向是两棵完全不同的技能树,投错简历、点错技能会很痛苦。
两个方向到底干什么#
| 维度 | 运维 / SRE 方向(本路线) | 研发方向 |
|---|---|---|
| 核心职责 | 保障集群/平台跑稳、跑省:部署、监控、排障、调度、治理 | 造轮子:写推理引擎、训练框架、通信库、算子、调度器 |
| 典型产出 | 稳定的 GPU 集群、可观测大盘、SLO 达标、利用率报表 | vLLM 类推理引擎、自研训练框架、CUDA/算子、调度器 |
| 关键技能 | K8s、GPU 运维、网络(RDMA/RoCE)、Prometheus/DCGM、故障处理、成本治理 | CUDA/C++、分布式训练原理、编译器、深入算法与系统实现 |
| 面对的问题 | "训练为什么变慢""卡为什么掉""利用率为什么低""怎么不丢包" | "怎么让 kernel 更快""怎么设计 KV Cache 调度""怎么写通信原语" |
| 日常状态 | 值班、排障、扩缩容、变更、优化利用率 | 写代码、做 benchmark、优化性能、发版本 |
JD 怎么区分(求职实操)#
看到这些词 → 偏【运维/SRE】(本路线目标)
SRE、稳定性、可观测、监控告警、故障处理、on-call、
K8s 运维、GPU 集群运维、资源调度、利用率、成本优化、
DCGM/Prometheus/Grafana、RDMA/RoCE 运维、平台运维
看到这些词 → 偏【研发】(本路线不覆盖)
推理引擎开发、训练框架研发、CUDA、算子优化、kernel、
通信库、编译器、C++/系统编程、"从 0 设计调度器"、
高性能计算研发、深度学习框架判断口诀:JD 里 "保障 / 稳定 / 运维 / 监控 / 排障 / 调度使用" 多 → 运维;"开发 / 实现 / 优化 kernel / 造框架" 多 → 研发。
本路线专攻运维/SRE 方向。研发方向不是不好,而是另一条路(要补 CUDA、分布式训练系统、编译),不在本路线范围。
三、分层全景图#
AI Infra 从下到上分五层,运维在每一层都有活:
┌─────────────────────────────────────────────────────────┐
│ ⑤ 业务 / 应用层 │
│ LLM 应用、Agent、RAG 应用(AI Infra 的"客户") │
├─────────────────────────────────────────────────────────┤
│ ④ 模型平台 / LLMOps 层 │
│ 模型仓库、评测、Prompt/RAG 管理、模型版本与灰度 │
├─────────────────────────────────────────────────────────┤
│ ③ 训练平台 + 推理平台 │
│ 训练:作业提交、分布式训练、checkpoint、断点续训 │
│ 推理:模型服务化、AI Gateway、限流熔断、弹性伸缩 │
├─────────────────────────────────────────────────────────┤
│ ② 资源调度层 │
│ K8s + Volcano/Kueue、配额/队列/抢占、GPU 共享、碎片治理 │
├─────────────────────────────────────────────────────────┤
│ ① 硬件层 │
│ GPU/NPU + 高速网络(IB/RoCE/NVLink) + 高性能存储 │
└─────────────────────────────────────────────────────────┘
↑ 越往下越"硬",越是 AI Infra 运维的主战场对照本路线各专题的落点:
- ①硬件层 → 专题「AI 网络运维」(RDMA/RoCE/NCCL)+ GPU 硬件健康(XID/DCGM)
- ②调度层 → 主线「算力资源调度」+ 专题「智算平台运维与资源治理」
- ③推理/训练平台 → 主线「推理服务化」「推理性能优化」「线上稳定性与可观测」
- ④模型平台/LLMOps → 主线「模型工程化与平台治理」
四、模型全生命周期的运维触点#
模型从数据到迭代,每一步运维都有明确的保障职责——把"AI Infra 运维具体在忙什么"落到实处:
数据 → 训练 → checkpoint → 评测 → 推理上线 → 监控 → 迭代| 阶段 | 运维负责什么(不负责什么) |
|---|---|
| 数据 | 保障高性能存储/数据管道吞吐(别让 GPU 等数据);不负责数据清洗算法 |
| 训练 | 分配算力、Gang 调度、保障网络无损、盯 GPU 健康、处理 straggler/挂机重启;不负责写训练代码 |
| checkpoint | 保障 checkpoint 存储可靠+够快(大模型 ckpt 上百 GB)、抢占前能存、断点能续;不负责决定存什么 |
| 评测 | 提供评测算力和环境隔离;不负责设计评测指标 |
| 推理上线 | 模型服务化、AI Gateway、限流熔断、弹性伸缩、灰度发布、多版本共存;不负责推理引擎实现 |
| 监控 | 建可观测体系:延迟(TTFT/TPOT)、吞吐、GPU 利用率、成本、SLO 告警;这是运维主场 |
| 迭代 | 支撑快速回滚、A/B、影子流量;保障迭代不影响线上稳定 |
贯穿全程的运维主线:稳定性(不挂)+ 可观测(看得见)+ 成本(省)+ 效率(快速交付)。
五、岗位地图#
同属 AI Infra 运维,细分岗位各有侧重。对照定位自己:
| 岗位 | 主要干啥 | 核心技能 |
|---|---|---|
| AI Infra 运维 / GPU SRE | GPU 集群整体稳定性、on-call、故障处理、硬件健康 | K8s、GPU 运维、DCGM、网络、故障处理、SRE 方法论 |
| 智算平台运维 | 调度平台、配额/队列/多租户、利用率与成本治理 | Volcano/Kueue 运维、资源治理、成本归因、平台化 |
| 推理平台运维 | 推理服务稳定性、AI Gateway、限流弹性、延迟/吞吐 SLO | 推理服务化、可观测、限流熔断、弹性伸缩、性能调优 |
| Training Infra 运维 | 大规模训练保障、通信网络、checkpoint、断点续训、straggler | 分布式训练运维、RDMA/NCCL 排障、大规模集群 |
这几个岗位技能重叠度很高,都建立在同一底座上:
K8s + GPU + 网络 + 可观测 + 故障处理
区别只是"更偏训练侧 / 推理侧 / 平台侧"。
本路线打的就是这个共同底座 → 四个方向都能投。进阶方向:往上走做智算平台架构师(设计整个平台),往管理走做AI Infra 团队负责人。
六、国产化运维#
信创/国产化是国内 AI Infra 运维绕不开的一块,尤其昇腾(华为 Ascend)。运维要知道:国产卡的运维逻辑和 NVIDIA 一样,但工具链、故障码、生态全换了一套。
昇腾生态对照(英伟达 → 昇腾)#
| 层次 | NVIDIA | 昇腾(Ascend) | 运维含义 |
|---|---|---|---|
| 芯片 | GPU(H100…) | NPU(910B/910C 训练、310 推理) | 硬件形态不同 |
| 服务器 | DGX/HGX | Atlas 800 训练/推理服务器 | — |
| 底层软件栈 | CUDA | CANN(异构计算架构) | 相当于昇腾的 "CUDA" |
| 集合通信 | NCCL | HCCL | 多机通信排障换一套工具 |
| 推理引擎 | TensorRT-LLM / vLLM | MindIE | 推理平台运维对象不同 |
| 训练框架 | PyTorch | MindSpore / PyTorch+昇腾插件 | — |
| 监控命令 | nvidia-smi | npu-smi | 运维天天用,下面详述 |
npu-smi:昇腾的 nvidia-smi#
运维查 NPU 状态的第一命令,用法和 nvidia-smi 神似:
npu-smi info # 总览:每张 NPU 的健康、显存、利用率、温度、功耗
npu-smi info -t board -i 0 # 看指定卡的板级信息
npu-smi info -t power -i 0 # 功耗
watch -n 1 npu-smi info # 实时刷(等价 watch nvidia-smi)监控接入:昇腾侧同样有 Prometheus exporter 把 NPU 指标(利用率/显存/温度/故障)送进 Grafana,可观测方法论和 NVIDIA 一致,只是指标名和采集器换了。
CANN 全面开源(2025→2026)#
- 华为于 2025 年 8 月在昇腾计算产业峰会宣布 CANN 全面开源开放,并计划到 2025 年底至 2026 年初,把算子、Ascend C、图引擎、加速库以及 MindIE 等陆续开源到社区(GitCode)。
- 对运维的意义:工具链更透明、可自己定位问题和打补丁,昇腾生态从封闭走向开放,长期利好国产卡运维的可维护性;但当前生态成熟度、文档和社区仍不及 CUDA,踩坑会更多。
国产卡运维差异(踩坑提示)#
1. 工具链全换:nvidia-smi→npu-smi、NCCL→HCCL、nccl-tests→hccl 测试工具
2. 驱动/固件:昇腾有自己的 driver + CANN toolkit,版本匹配同样是坑区
3. 故障码不同:XID 那套不通用,昇腾有自己的故障诊断和错误码体系
4. 生态成熟度:算子/模型适配、第三方文档不如 CUDA 丰富,问题排查更靠官方
5. 集群管理:华为有 MindCluster/MindX 一类的集群管理套件,运维对象换一套
6. 多机通信:RDMA 底座仍是 IB/RoCE,但集合通信走 HCCL,排障命令和日志不同运维心法:把 NVIDIA 那套运维思维(监控→排障→保障→治理)平移过来,然后逐一把"工具名"翻译成昇腾对应物即可——方法论通用,工具要重学。
小结#
这一章给整条路线建立全局观:
是什么 → AI Infra 是最底层的算力/集群/平台地基(区别于 MLOps 流程、LLMOps 应用)
走哪条 → 🔑 运维/SRE(保障跑稳跑省,本路线)vs 研发(造引擎/框架/算子),JD 一眼辨
全景图 → 硬件→调度→训练/推理平台→模型平台→业务,运维在每层都有活
生命周期 → 数据到迭代每一步都有运维触点,主线是 稳定+可观测+成本+效率
岗位 → GPU SRE / 智算平台 / 推理平台 / Training Infra 运维,共享同一底座
国产化 → 昇腾:npu-smi/CANN/HCCL/MindIE,方法论通用、工具链重学给学习者的路径建议:
- 先读这章建立地图,再回去展开各专题,知道每个知识点落在全景哪一层。
- 认清方向:本路线是运维/SRE,别被研发向 JD(CUDA/写引擎)带偏,也别在面试里把自己讲成研发。
- 打通用底座:K8s + GPU 运维 + 网络 + 可观测 + 故障处理,四个细分岗位都能投。
- 国产化作为差异化加分项:会 NVIDIA 运维的基础上补昇腾(npu-smi/CANN/MindIE),在国内市场很吃香。
至此,AI Infra 运维路线的主线与广度专题闭环:从推理服务化、性能优化、算力调度,到网络运维、平台治理,再到本章的全景与岗位地图——覆盖了一个智算平台 SRE 需要的完整视野。