岗位分支 · Inference
定位:把模型变成高并发、低延迟、可稳定调用的服务 对应主路线:Ch1(推理基础)、Ch2(推理服务化)、Ch3(性能优化)、Ch5(稳定性) 典型团队:推理服务团队、LLM 服务团队、AI Infra 核心团队
核心能力领域#
1. 推理引擎深入#
- vLLM:PagedAttention + Continuous Batching 原理与调优,GPU memory utilization / max-num-seqs / max-model-len / enable-prefix-caching 等参数实战调优
- SGLang:RadixAttention 原理,多轮对话/Agent 场景优化,schedule-policy lpm,约束解码
- TRT-LLM:engine 编译流程,FP8 深度优化,与 Triton 集成
- 引擎对比选型:不同场景(通用/Agent/极致延迟/多轮对话/MoE)何时选谁
引擎选型决策:
text
MoE 模型(DeepSeek V3/V4)→ SGLang(MLA/MoE 优化最深度)
Agent / 多轮对话 / RAG → SGLang(RadixAttention 命中率 60-85%)
极致低延迟 + NVIDIA 全栈 → TRT-LLM + Triton
快速上线 / 通用场景 → vLLM(社区最大、上手最快)
多模型混部(CV+NLP+LLM) → Triton Inference Server
国产 NPU(昇腾) → vllm-ascend 或 MindIE2. 多卡分布式推理#
- TP(张量并行):单机 NVLink 域内,--tensor-parallel-size 配置
- PP(流水线并行):跨机部署首选,pipeline-parallel-size
- EP(专家并行):MoE 模型专属,EPLB 负载均衡
- DP(数据并行):多实例 + 网关分流(优先级最高,最简单)
- NCCL 调优:NCCL_DEBUG/NCCL_IB_HCA/NCCL_P2P_LEVEL/NCCL_SOCKET_IFNAME 等环境变量
并行策略选型表:
| 业务特征 | 推荐方案 |
|---|---|
| 7B/13B,QPS < 100 | 单卡 + DP 多实例 |
| 70B FP16 | 单机 8 卡 TP=8 |
| 70B 高并发 | 多实例 × 单机 TP=8 + 网关分流 |
| 405B FP8 | 单机 TP=8 或 2 机 TP=8 PP=2 |
| MoE(DeepSeek V3/V4) | TP + EP 组合 |
3. 性能指标与瓶颈分析#
- TTFT / TPOT:分别反映 prefill 和 decode 阶段的瓶颈
- tokens/s / QPS / P95 / P99:吞吐与长尾延迟
- GPU 利用率 / 显存 / KV Cache 使用率:资源层面瓶颈
- 定位套路:TTFT 高 → 查 prefill 瓶颈;TPOT 高 → 查内存带宽或 batch size;QPS 低 → 查 KV Cache 池子大小
性能调优顺序:
text
监控基线 → max-model-len → 显存参数 → 量化 → 调度参数
→ Prefix Cache → Chunked Prefill → PD 分离 → 分级 KV → Kernel 优化4. 服务稳定性#
- OpenAI-Compatible API:Chat Completions / Streaming / Embedding
- 限流、熔断、Fallback:LiteLLM + 自建网关
- 多模型路由:model alias 设计、cost-based / latency-based / kv-aware routing
- 灰度与回滚:网关级流量比例切换
5. 2026 新增能力(加分→主流)#
- PD 分离部署(vLLM KVConnector / Dynamo disaggregated):已从加分项升级为生产主流
- 分级 KV Cache(LMCache/HiCache):长上下文/RAG 降本核心
- Speculative Decoding(EAGLE):代码补全等规律强场景 2-3x
- 编排层(NVIDIA Dynamo / llm-d):大规模多节点 PD 分离必备
- MoE 推理 + EPLB:MoE 模型必备
加分方向#
- 推理压测方案设计(真实业务分布、多种 prompt 长度混合)
- 自定义 CUDA/Triton Kernel(岗位分支 E 方向)
- 多芯推理兼容层(岗位分支 F 方向)
技能树#
text
基础(必备)
├── Python / Bash
├── Docker / K8s(部署能力)
├── HTTP/gRPC(API 层)
└── Linux 性能分析(top/nvidia-smi)
推理引擎
├── vLLM(必会,参数调优 + 源码理解)
├── SGLang(必会,RadixAttention + 约束解码)
├── TRT-LLM(加分,编译 + FP8)
└── Triton Inference Server(加分,多模型混部)
分布式
├── TP / PP / EP / DP 原理与实操
├── NCCL 环境变量与排障
└── Ray(跨机分布式后端)
性能优化
├── KV Cache / Continuous Batching / PagedAttention 原理
├── PD 分离 / 分级 KV / MoE EPLB(2026 主流)
├── 量化(FP8/INT4/FP4)
└── Speculative Decoding
稳定性
├── LiteLLM Gateway
├── 限流 / 熔断 / Fallback / 灰度 / 回滚
└── Prometheus + Grafana 监控学习路径建议#
text
1. 先掌握推理基础(Ch1):prefill/decode,KV Cache,MoE,MLA
2. 再学推理服务化(Ch2):vLLM/SGLang 部署,OpenAI API,多卡分布式
3. 然后深入性能优化(Ch3):TTFT/TPOT 分析,PD 分离,分级 KV,量化
4. 最后学稳定性(Ch5):LiteLLM 网关,限流熔断,弹性伸缩
5. 加分:编排层(Dynamo)、Speculative Decoding、Kernel 优化项目经验建议#
简历表达参考:
text
构建高并发 LLM 推理服务,支撑日均千万级请求:
- vLLM/SGLang 引擎选型与调优,TP=8 多卡部署,FP8 量化
- TTFT 从 2s 优化到 800ms(PD 分离 + Chunked Prefill + Prefix Cache)
- 吞吐提升 3x(分级 KV + KV-aware routing,128K 上下文 80% 命中率省 69% prefill 成本)
- LiteLLM 网关统一接入,限流熔断 fallback,秒级灰度回滚
- MoE 模型(DeepSeek-V4)部署,EPLB 解决专家路由不均衡典型面试题方向#
如何优化 vLLM/SGLang 推理吞吐?TTFT/TPOT 分别怎么分析和优化?
- 答题思路:先建监控基线 → 显存参数 → 调度参数 → Prefix Cache → PD 分离 → 分级 KV;TTFT 高查 prefill,TPOT 高查显存带宽
设计一个支持多模型、限流、熔断的推理服务
- 答题思路:LiteLLM Gateway + Model alias + Virtual Key + RPM/TPM 限流 + Fallback 链 + 灰度回滚
如何处理长上下文导致的延迟?Prefill chunked、分级 KV 怎么配置?
- 答题思路:Chunked Prefill 防止单请求堵死 batch + 分级 KV(LMCache)省 69% prefill 成本 + PD 分离 + 限流
怎么用编排层(Dynamo)做多节点 PD 分离部署?
- 答题思路:Dynamo 调度 prefill 节点组 + decode 节点组,KV 跨节点传输(100Gbps+ RDMA),KV-aware routing
MoE 模型推理怎么优化?专家路由不均衡怎么解决?
- 答题思路:EPLB 动态重映射 expert + TP+EP 组合并行 + MLA 压缩 KV 腾显存给 expert