路线图

岗位分支 · Inference

星辉 2026-07-02 阅读 3 min 502 字 路线图
岗位分支 · Inference 封面

定位:把模型变成高并发、低延迟、可稳定调用的服务 对应主路线:Ch1(推理基础)、Ch2(推理服务化)、Ch3(性能优化)、Ch5(稳定性) 典型团队:推理服务团队、LLM 服务团队、AI Infra 核心团队


核心能力领域#

1. 推理引擎深入#

  • vLLM:PagedAttention + Continuous Batching 原理与调优,GPU memory utilization / max-num-seqs / max-model-len / enable-prefix-caching 等参数实战调优
  • SGLang:RadixAttention 原理,多轮对话/Agent 场景优化,schedule-policy lpm,约束解码
  • TRT-LLM:engine 编译流程,FP8 深度优化,与 Triton 集成
  • 引擎对比选型:不同场景(通用/Agent/极致延迟/多轮对话/MoE)何时选谁

引擎选型决策

text
MoE 模型(DeepSeek V3/V4)→ SGLang(MLA/MoE 优化最深度)
Agent / 多轮对话 / RAG    → SGLang(RadixAttention 命中率 60-85%)
极致低延迟 + NVIDIA 全栈   → TRT-LLM + Triton
快速上线 / 通用场景        → vLLM(社区最大、上手最快)
多模型混部(CV+NLP+LLM)   → Triton Inference Server
国产 NPU(昇腾)           → vllm-ascend 或 MindIE

2. 多卡分布式推理#

  • TP(张量并行):单机 NVLink 域内,--tensor-parallel-size 配置
  • PP(流水线并行):跨机部署首选,pipeline-parallel-size
  • EP(专家并行):MoE 模型专属,EPLB 负载均衡
  • DP(数据并行):多实例 + 网关分流(优先级最高,最简单)
  • NCCL 调优:NCCL_DEBUG/NCCL_IB_HCA/NCCL_P2P_LEVEL/NCCL_SOCKET_IFNAME 等环境变量

并行策略选型表

业务特征推荐方案
7B/13B,QPS < 100单卡 + DP 多实例
70B FP16单机 8 卡 TP=8
70B 高并发多实例 × 单机 TP=8 + 网关分流
405B FP8单机 TP=8 或 2 机 TP=8 PP=2
MoE(DeepSeek V3/V4)TP + EP 组合

3. 性能指标与瓶颈分析#

  • TTFT / TPOT:分别反映 prefill 和 decode 阶段的瓶颈
  • tokens/s / QPS / P95 / P99:吞吐与长尾延迟
  • GPU 利用率 / 显存 / KV Cache 使用率:资源层面瓶颈
  • 定位套路:TTFT 高 → 查 prefill 瓶颈;TPOT 高 → 查内存带宽或 batch size;QPS 低 → 查 KV Cache 池子大小

性能调优顺序

text
监控基线 → max-model-len → 显存参数 → 量化 → 调度参数
→ Prefix Cache → Chunked Prefill → PD 分离 → 分级 KV → Kernel 优化

4. 服务稳定性#

  • OpenAI-Compatible API:Chat Completions / Streaming / Embedding
  • 限流、熔断、Fallback:LiteLLM + 自建网关
  • 多模型路由:model alias 设计、cost-based / latency-based / kv-aware routing
  • 灰度与回滚:网关级流量比例切换

5. 2026 新增能力(加分→主流)#

  • PD 分离部署(vLLM KVConnector / Dynamo disaggregated):已从加分项升级为生产主流
  • 分级 KV Cache(LMCache/HiCache):长上下文/RAG 降本核心
  • Speculative Decoding(EAGLE):代码补全等规律强场景 2-3x
  • 编排层(NVIDIA Dynamo / llm-d):大规模多节点 PD 分离必备
  • MoE 推理 + EPLB:MoE 模型必备

加分方向#

  • 推理压测方案设计(真实业务分布、多种 prompt 长度混合)
  • 自定义 CUDA/Triton Kernel(岗位分支 E 方向)
  • 多芯推理兼容层(岗位分支 F 方向)

技能树#

text
基础(必备)
├── Python / Bash
├── Docker / K8s(部署能力)
├── HTTP/gRPC(API 层)
└── Linux 性能分析(top/nvidia-smi)

推理引擎
├── vLLM(必会,参数调优 + 源码理解)
├── SGLang(必会,RadixAttention + 约束解码)
├── TRT-LLM(加分,编译 + FP8)
└── Triton Inference Server(加分,多模型混部)

分布式
├── TP / PP / EP / DP 原理与实操
├── NCCL 环境变量与排障
└── Ray(跨机分布式后端)

性能优化
├── KV Cache / Continuous Batching / PagedAttention 原理
├── PD 分离 / 分级 KV / MoE EPLB(2026 主流)
├── 量化(FP8/INT4/FP4)
└── Speculative Decoding

稳定性
├── LiteLLM Gateway
├── 限流 / 熔断 / Fallback / 灰度 / 回滚
└── Prometheus + Grafana 监控

学习路径建议#

text
1. 先掌握推理基础(Ch1):prefill/decode,KV Cache,MoE,MLA
2. 再学推理服务化(Ch2):vLLM/SGLang 部署,OpenAI API,多卡分布式
3. 然后深入性能优化(Ch3):TTFT/TPOT 分析,PD 分离,分级 KV,量化
4. 最后学稳定性(Ch5):LiteLLM 网关,限流熔断,弹性伸缩
5. 加分:编排层(Dynamo)、Speculative Decoding、Kernel 优化

项目经验建议#

简历表达参考:

text
构建高并发 LLM 推理服务,支撑日均千万级请求:
- vLLM/SGLang 引擎选型与调优,TP=8 多卡部署,FP8 量化
- TTFT 从 2s 优化到 800ms(PD 分离 + Chunked Prefill + Prefix Cache)
- 吞吐提升 3x(分级 KV + KV-aware routing,128K 上下文 80% 命中率省 69% prefill 成本)
- LiteLLM 网关统一接入,限流熔断 fallback,秒级灰度回滚
- MoE 模型(DeepSeek-V4)部署,EPLB 解决专家路由不均衡

典型面试题方向#

  1. 如何优化 vLLM/SGLang 推理吞吐?TTFT/TPOT 分别怎么分析和优化?

    • 答题思路:先建监控基线 → 显存参数 → 调度参数 → Prefix Cache → PD 分离 → 分级 KV;TTFT 高查 prefill,TPOT 高查显存带宽
  2. 设计一个支持多模型、限流、熔断的推理服务

    • 答题思路:LiteLLM Gateway + Model alias + Virtual Key + RPM/TPM 限流 + Fallback 链 + 灰度回滚
  3. 如何处理长上下文导致的延迟?Prefill chunked、分级 KV 怎么配置?

    • 答题思路:Chunked Prefill 防止单请求堵死 batch + 分级 KV(LMCache)省 69% prefill 成本 + PD 分离 + 限流
  4. 怎么用编排层(Dynamo)做多节点 PD 分离部署?

    • 答题思路:Dynamo 调度 prefill 节点组 + decode 节点组,KV 跨节点传输(100Gbps+ RDMA),KV-aware routing
  5. MoE 模型推理怎么优化?专家路由不均衡怎么解决?

    • 答题思路:EPLB 动态重映射 expert + TP+EP 组合并行 + MLA 压缩 KV 腾显存给 expert