面向国内 AI Infra、AI Inference、LLMOps、大模型推理平台、训推平台、智算平台等岗位方向。默认学习者已具备 Linux、Docker、Kubernetes、CI/CD、基础可观测、基础后端开发能力。
AI Infra 的核心问题不是"如何调用一个大模型 API",而是:一个模型如何从"本地能跑"变成"可服务化、可并发、可观测、可灰度、可回滚、可治理成本、可合规上线"的基础设施能力。
模型推理基础 → 推理服务化 → 推理性能优化 → 算力资源调度 → 线上稳定性与可观测 → 模型工程化与平台治理 → 岗位分支深入| 阶段 | 核心内容 |
|---|---|
| 模型推理基础【10分/必会】 | prompt/token/prefill/decode/streaming/context/MoE/MLA |
| 推理服务化【20分/必会】 | vLLM/SGLang/编排层Dynamo/OpenAI-API/TP-PP-EP/模型加载 |
| 推理性能优化【25分/必会】 | TTFT/TPOT/KV Cache/PD分离/MoE推理/分级KV/EPLB/量化 |
| 算力资源调度【15分/需要会】 | GPU共享/MIG/Queue/Quota/Volcano/Kueue/HAMi |
| 线上稳定性与可观测【20分/必会】 | AI Gateway/限流熔断/弹性伸缩/OTel GenAI/DCGM/成本治理 |
| 模型工程化与平台治理【10分/需要会】 | Model Registry/Eval/灰度回滚/合规备案/内容安全 |
| 维度 | 2026 现状 |
|---|---|
| 架构分层 | 引擎层(vLLM/SGLang/TRT-LLM)之上出现编排层(NVIDIA Dynamo/llm-d) |
| PD 分离 | Prefill/Decode 分离已生产主流 |
| 模型形态 | 前六大模型全是 MoE,Dense 旗舰绝迹 |
| KV Cache | 分级 KV(LMCache/HiCache)转生产,GPU→CPU→远端三级 |
| 国产算力 | 昇腾 950PR 量产(FP4),DeepSeek-V4 完全跑在昇腾上 |
| 可观测 | OpenTelemetry GenAI 语义约定成为 LLM 可观测事实方向(多数属性仍 experimental,未 stable) |
| 合规 | 国内大模型上线必须备案 + 内容安全评估 |
完成主路线后按目标岗位深入:
答案默认折叠,点题目展开;可开「自测模式」全部收起。