路线图

05 AI Infra 全景与岗位地图(导读)

星辉 2026-07-02 阅读 3 min 608 字 路线图
05 AI Infra 全景与岗位地图(导读) 封面

学习目标:能说清 AI Infra 是什么、边界在哪(vs MLOps vs 平台工程);能分清「运维/SRE 方向」和「研发方向」的分野,知道自己走哪条、JD 怎么辨;能画出 AI Infra 的分层全景图;能说出模型全生命周期每一步运维负责什么;能对照岗位地图定位目标岗位与技能差距;了解国产化(昇腾)运维的差异。 重点度:导读章(先读这章建立全局观,再展开各专题;求职定位必读)


概述#

这一章是整个 AI Infra 路线的导读和地图。前面的专题(推理服务化、性能优化、算力调度、网络运维、平台治理)都是"点",这一章把它们连成"面",并回答三个求职者最关心的问题:

text
1. AI Infra 到底是什么?边界在哪?(别和 MLOps / 平台工程搞混)
2. 我该走"运维/SRE"还是"研发"?(🔑 决定你要点哪棵技能树)
3. 有哪些岗位、各要什么?(对照 JD 定位自己)

一句话定位本路线:本路线练的是AI Infra 运维 / 智算平台 SRE——保障 GPU 集群和 AI 平台跑得稳、跑得省,不是写推理引擎和训练框架。下面反复强调这个分野。


一、AI Infra 是什么、边界在哪#

AI Infra(AI 基础设施) = 支撑 AI 模型从训练到上线运行的整套底层设施与平台,往下管硬件(GPU/网络/存储),往上给算法/业务提供"能训练、能部署、能调用"的能力。

和几个近义词的边界(面试常被问):

概念关注点和 AI Infra 的关系
AI InfraGPU 算力、集群、网络、存储、推理/训练平台的底座本体,最靠近硬件
MLOps模型的生命周期流程:数据→训练→评测→部署→监控→迭代的流程自动化站在 AI Infra 之上,偏"流程/流水线"
平台工程(Platform Eng)给开发者做自助平台(内部开发者平台 IDP)方法论层,AI Infra 平台可看作它在 AI 领域的落地
LLMOpsMLOps 在大模型时代的延伸:Prompt、RAG、评测、推理成本AI Infra 之上、更贴近大模型应用
text
边界记忆:
  越靠近 GPU/网络/内核 → 越是 AI Infra(本路线重点)
  越靠近数据流水线/模型迭代流程 → 越是 MLOps
  越靠近 Prompt/RAG/应用 → 越是 LLMOps
  三者叠在一起,AI Infra 是最底下那层地基。

二、🔑 AI Infra 运维 vs 研发的分野#

这是全章最重要的一节。同样叫 "AI Infra 工程师",运维方向和研发方向是两棵完全不同的技能树,投错简历、点错技能会很痛苦。

两个方向到底干什么#

维度运维 / SRE 方向(本路线研发方向
核心职责保障集群/平台跑稳、跑省:部署、监控、排障、调度、治理造轮子:写推理引擎、训练框架、通信库、算子、调度器
典型产出稳定的 GPU 集群、可观测大盘、SLO 达标、利用率报表vLLM 类推理引擎、自研训练框架、CUDA/算子、调度器
关键技能K8s、GPU 运维、网络(RDMA/RoCE)、Prometheus/DCGM、故障处理、成本治理CUDA/C++、分布式训练原理、编译器、深入算法与系统实现
面对的问题"训练为什么变慢""卡为什么掉""利用率为什么低""怎么不丢包""怎么让 kernel 更快""怎么设计 KV Cache 调度""怎么写通信原语"
日常状态值班、排障、扩缩容、变更、优化利用率写代码、做 benchmark、优化性能、发版本

JD 怎么区分(求职实操)#

text
看到这些词 → 偏【运维/SRE】(本路线目标)
  SRE、稳定性、可观测、监控告警、故障处理、on-call、
  K8s 运维、GPU 集群运维、资源调度、利用率、成本优化、
  DCGM/Prometheus/Grafana、RDMA/RoCE 运维、平台运维

看到这些词 → 偏【研发】(本路线不覆盖)
  推理引擎开发、训练框架研发、CUDA、算子优化、kernel、
  通信库、编译器、C++/系统编程、"从 0 设计调度器"、
  高性能计算研发、深度学习框架

判断口诀:JD 里 "保障 / 稳定 / 运维 / 监控 / 排障 / 调度使用" 多 → 运维;"开发 / 实现 / 优化 kernel / 造框架" 多 → 研发。

本路线专攻运维/SRE 方向。研发方向不是不好,而是另一条路(要补 CUDA、分布式训练系统、编译),不在本路线范围。


三、分层全景图#

AI Infra 从下到上分五层,运维在每一层都有活:

text
┌─────────────────────────────────────────────────────────┐
│  ⑤ 业务 / 应用层                                          │
│     LLM 应用、Agent、RAG 应用(AI Infra 的"客户")          │
├─────────────────────────────────────────────────────────┤
│  ④ 模型平台 / LLMOps 层                                    │
│     模型仓库、评测、Prompt/RAG 管理、模型版本与灰度          │
├─────────────────────────────────────────────────────────┤
│  ③ 训练平台  +  推理平台                                    │
│     训练:作业提交、分布式训练、checkpoint、断点续训          │
│     推理:模型服务化、AI Gateway、限流熔断、弹性伸缩          │
├─────────────────────────────────────────────────────────┤
│  ② 资源调度层                                              │
│     K8s + Volcano/Kueue、配额/队列/抢占、GPU 共享、碎片治理   │
├─────────────────────────────────────────────────────────┤
│  ① 硬件层                                                  │
│     GPU/NPU  +  高速网络(IB/RoCE/NVLink)  +  高性能存储      │
└─────────────────────────────────────────────────────────┘
        ↑ 越往下越"硬",越是 AI Infra 运维的主战场

对照本路线各专题的落点:

  • ①硬件层 → 专题「AI 网络运维」(RDMA/RoCE/NCCL)+ GPU 硬件健康(XID/DCGM)
  • ②调度层 → 主线「算力资源调度」+ 专题「智算平台运维与资源治理」
  • ③推理/训练平台 → 主线「推理服务化」「推理性能优化」「线上稳定性与可观测」
  • ④模型平台/LLMOps → 主线「模型工程化与平台治理」

四、模型全生命周期的运维触点#

模型从数据到迭代,每一步运维都有明确的保障职责——把"AI Infra 运维具体在忙什么"落到实处:

text
数据 → 训练 → checkpoint → 评测 → 推理上线 → 监控 → 迭代
阶段运维负责什么(不负责什么)
数据保障高性能存储/数据管道吞吐(别让 GPU 等数据);不负责数据清洗算法
训练分配算力、Gang 调度、保障网络无损、盯 GPU 健康、处理 straggler/挂机重启;不负责写训练代码
checkpoint保障 checkpoint 存储可靠+够快(大模型 ckpt 上百 GB)、抢占前能存、断点能续;不负责决定存什么
评测提供评测算力和环境隔离;不负责设计评测指标
推理上线模型服务化、AI Gateway、限流熔断、弹性伸缩、灰度发布、多版本共存;不负责推理引擎实现
监控建可观测体系:延迟(TTFT/TPOT)、吞吐、GPU 利用率、成本、SLO 告警;这是运维主场
迭代支撑快速回滚、A/B、影子流量;保障迭代不影响线上稳定

贯穿全程的运维主线:稳定性(不挂)+ 可观测(看得见)+ 成本(省)+ 效率(快速交付)。


五、岗位地图#

同属 AI Infra 运维,细分岗位各有侧重。对照定位自己:

岗位主要干啥核心技能
AI Infra 运维 / GPU SREGPU 集群整体稳定性、on-call、故障处理、硬件健康K8s、GPU 运维、DCGM、网络、故障处理、SRE 方法论
智算平台运维调度平台、配额/队列/多租户、利用率与成本治理Volcano/Kueue 运维、资源治理、成本归因、平台化
推理平台运维推理服务稳定性、AI Gateway、限流弹性、延迟/吞吐 SLO推理服务化、可观测、限流熔断、弹性伸缩、性能调优
Training Infra 运维大规模训练保障、通信网络、checkpoint、断点续训、straggler分布式训练运维、RDMA/NCCL 排障、大规模集群
text
这几个岗位技能重叠度很高,都建立在同一底座上:
  K8s + GPU + 网络 + 可观测 + 故障处理
区别只是"更偏训练侧 / 推理侧 / 平台侧"。
本路线打的就是这个共同底座 → 四个方向都能投。

进阶方向:往上走做智算平台架构师(设计整个平台),往管理走做AI Infra 团队负责人


六、国产化运维#

信创/国产化是国内 AI Infra 运维绕不开的一块,尤其昇腾(华为 Ascend)。运维要知道:国产卡的运维逻辑和 NVIDIA 一样,但工具链、故障码、生态全换了一套。

昇腾生态对照(英伟达 → 昇腾)#

层次NVIDIA昇腾(Ascend)运维含义
芯片GPU(H100…)NPU(910B/910C 训练、310 推理)硬件形态不同
服务器DGX/HGXAtlas 800 训练/推理服务器
底层软件栈CUDACANN(异构计算架构)相当于昇腾的 "CUDA"
集合通信NCCLHCCL多机通信排障换一套工具
推理引擎TensorRT-LLM / vLLMMindIE推理平台运维对象不同
训练框架PyTorchMindSpore / PyTorch+昇腾插件
监控命令nvidia-sminpu-smi运维天天用,下面详述

npu-smi:昇腾的 nvidia-smi#

运维查 NPU 状态的第一命令,用法和 nvidia-smi 神似:

bash
npu-smi info              # 总览:每张 NPU 的健康、显存、利用率、温度、功耗
npu-smi info -t board -i 0    # 看指定卡的板级信息
npu-smi info -t power -i 0    # 功耗
watch -n 1 npu-smi info   # 实时刷(等价 watch nvidia-smi)

监控接入:昇腾侧同样有 Prometheus exporter 把 NPU 指标(利用率/显存/温度/故障)送进 Grafana,可观测方法论和 NVIDIA 一致,只是指标名和采集器换了。

CANN 全面开源(2025→2026)#

  • 华为于 2025 年 8 月在昇腾计算产业峰会宣布 CANN 全面开源开放,并计划到 2025 年底至 2026 年初,把算子、Ascend C、图引擎、加速库以及 MindIE 等陆续开源到社区(GitCode)。
  • 对运维的意义:工具链更透明、可自己定位问题和打补丁,昇腾生态从封闭走向开放,长期利好国产卡运维的可维护性;但当前生态成熟度、文档和社区仍不及 CUDA,踩坑会更多。

国产卡运维差异(踩坑提示)#

text
1. 工具链全换:nvidia-smi→npu-smi、NCCL→HCCL、nccl-tests→hccl 测试工具
2. 驱动/固件:昇腾有自己的 driver + CANN toolkit,版本匹配同样是坑区
3. 故障码不同:XID 那套不通用,昇腾有自己的故障诊断和错误码体系
4. 生态成熟度:算子/模型适配、第三方文档不如 CUDA 丰富,问题排查更靠官方
5. 集群管理:华为有 MindCluster/MindX 一类的集群管理套件,运维对象换一套
6. 多机通信:RDMA 底座仍是 IB/RoCE,但集合通信走 HCCL,排障命令和日志不同

运维心法:把 NVIDIA 那套运维思维(监控→排障→保障→治理)平移过来,然后逐一把"工具名"翻译成昇腾对应物即可——方法论通用,工具要重学。


小结#

这一章给整条路线建立全局观:

text
是什么 → AI Infra 是最底层的算力/集群/平台地基(区别于 MLOps 流程、LLMOps 应用)
走哪条 → 🔑 运维/SRE(保障跑稳跑省,本路线)vs 研发(造引擎/框架/算子),JD 一眼辨
全景图 → 硬件→调度→训练/推理平台→模型平台→业务,运维在每层都有活
生命周期 → 数据到迭代每一步都有运维触点,主线是 稳定+可观测+成本+效率
岗位   → GPU SRE / 智算平台 / 推理平台 / Training Infra 运维,共享同一底座
国产化 → 昇腾:npu-smi/CANN/HCCL/MindIE,方法论通用、工具链重学

给学习者的路径建议:

  1. 先读这章建立地图,再回去展开各专题,知道每个知识点落在全景哪一层。
  2. 认清方向:本路线是运维/SRE,别被研发向 JD(CUDA/写引擎)带偏,也别在面试里把自己讲成研发。
  3. 打通用底座:K8s + GPU 运维 + 网络 + 可观测 + 故障处理,四个细分岗位都能投。
  4. 国产化作为差异化加分项:会 NVIDIA 运维的基础上补昇腾(npu-smi/CANN/MindIE),在国内市场很吃香。

至此,AI Infra 运维路线的主线与广度专题闭环:从推理服务化、性能优化、算力调度,到网络运维、平台治理,再到本章的全景与岗位地图——覆盖了一个智算平台 SRE 需要的完整视野。