5AI-Infra 工程师

定位#

面向国内 AI Infra、AI Inference、LLMOps、大模型推理平台、训推平台、智算平台等岗位方向。默认学习者已具备 Linux、Docker、Kubernetes、CI/CD、基础可观测、基础后端开发能力。

核心问题#

AI Infra 的核心问题不是"如何调用一个大模型 API",而是:一个模型如何从"本地能跑"变成"可服务化、可并发、可观测、可灰度、可回滚、可治理成本、可合规上线"的基础设施能力。

学习顺序#

text
模型推理基础 → 推理服务化 → 推理性能优化 → 算力资源调度 → 线上稳定性与可观测 → 模型工程化与平台治理 → 岗位分支深入

路线表#

阶段核心内容
模型推理基础【10分/必会】prompt/token/prefill/decode/streaming/context/MoE/MLA
推理服务化【20分/必会】vLLM/SGLang/编排层Dynamo/OpenAI-API/TP-PP-EP/模型加载
推理性能优化【25分/必会】TTFT/TPOT/KV Cache/PD分离/MoE推理/分级KV/EPLB/量化
算力资源调度【15分/需要会】GPU共享/MIG/Queue/Quota/Volcano/Kueue/HAMi
线上稳定性与可观测【20分/必会】AI Gateway/限流熔断/弹性伸缩/OTel GenAI/DCGM/成本治理
模型工程化与平台治理【10分/需要会】Model Registry/Eval/灰度回滚/合规备案/内容安全

2026 现状速览#

维度2026 现状
架构分层引擎层(vLLM/SGLang/TRT-LLM)之上出现编排层(NVIDIA Dynamo/llm-d)
PD 分离Prefill/Decode 分离已生产主流
模型形态前六大模型全是 MoE,Dense 旗舰绝迹
KV Cache分级 KV(LMCache/HiCache)转生产,GPU→CPU→远端三级
国产算力昇腾 950PR 量产(FP4),DeepSeek-V4 完全跑在昇腾上
可观测OpenTelemetry GenAI 语义约定成为 LLM 可观测事实方向(多数属性仍 experimental,未 stable)
合规国内大模型上线必须备案 + 内容安全评估

前置条件#

岗位分支#

完成主路线后按目标岗位深入:

正文精讲 6

  1. 01 模型推理基础
  2. 02 推理服务化
  3. 03 推理性能优化
  4. 04 算力资源调度
  5. 05 线上稳定性与可观测
  6. 06 模型工程化与平台治理

广度专题 5

  1. 01 GPU 集群运维与故障管理
  2. 02 大规模训练稳定性保障
  3. 03 AI 网络运维
  4. 04 智算平台运维与资源治理
  5. 05 AI Infra 全景与岗位地图(导读)

面试题 7

答案默认折叠,点题目展开;可开「自测模式」全部收起。

岗位分支 6