岗位分支 · Platform
定位:把训练、推理、评测、发布做成平台能力,让业务团队自助完成模型上线 对应主路线:Ch2(推理服务化)、Ch5(稳定性与可观测)、Ch6(平台治理) 典型团队:公司内部 AI 平台部、中台团队、MLOps 团队
核心能力领域#
1. 模型生命周期管理#
Platform 工程师的核心产出是模型从训练产出到线上服务的闭环:
text
训练产出 checkpoint → Registry 注册 → 评测流水线 → 准入门禁
→ 灰度发布 → 全量上线 → 持续监控 → 效果劣化自动回滚关键设计:不是"用脚本串起来",而是做成平台能力——模型提交者通过 UI/API 自助走完流程,不依赖 Infra 人工介入。
生命周期各环节的工程产出:
- 上传:模型权重上传到对象存储,自动触发元信息注册
- 评测:Argo Workflows 编排评测 DAG,并行跑通用/业务/安全/性能评测
- 准入:四道闸自动判定(评测达标+安全通过+性能达标+备案就绪)
- 灰度:网关层按比例/租户/地域分流,全程监控
- 发布:标记 production,老版本归档但不删除
- 回滚:网关秒级切回老版本,Registry 标记 rolled-back
- 监控:效果劣化检测 + 成本归因 + 自动回滚
2. Model Registry 与 Eval Pipeline#
- Registry:MLflow 或自研,记录每个模型版本的元信息、评测结果、阶段状态、备案信息
- Eval Pipeline:Argo Workflows / Kubeflow Pipelines 编排自动化评测,含通用 benchmark + 业务专项 + 安全评测 + 性能评测 + 合规评测
- 准入门禁:评测不达标自动拦截,达标才能进入 staging
Registry 的核心数据模型:
yaml
model: qwen3-instruct
version: v3
status: production
artifacts:
weights: s3://models/qwen3-72b/v3/
engine_config: {tp: 4, max_model_len: 32768}
eval_results: {mmlu: 0.82, safety_reject_rate: 0.987}
approval: {approver: nlp-lead, status: approved}
backup_count: 3
filing_info: {model_name: "通义千问", filing_no: "网信算备xxx号"}3. AI Gateway 与多租户#
- Virtual Key 体系:每个业务线一个 Team → Key → 配额 + 限流 + 成本上限
- 权限模型:谁能调哪些模型、能看到哪些 Metrics
- 成本计量:按 team/model/feature 维度统计,配 Grafana 面板 + 预算告警
- 模型路由:Model alias 设计,底层模型可替换
多租户资源池设计:
text
root
└── ai-org(公司 AI 总配额)
├── team-nlp(weight=30, guarantee=64 GPU)
├── team-recommend(weight=30, guarantee=64 GPU)
├── team-research(weight=20, guarantee=32 GPU)
└── emergency(weight=100, 不可抢占)4. 合规与安全#
- 备案材料自动化收集(模型信息、训练数据说明、安全评测报告)
- 内容安全闸口:输入审核 + 输出审核 + 拒答机制
- Prompt Injection 防护:多层防御,见 Ch6 内容安全部分
- 审计日志:全量 LLM 调用可追溯(Prompt + Response + Token + Cost)
5. 发布与回滚#
- 灰度系统:支持按比例、按租户、按地域灰度
- 回滚机制:保留最近 N 个 production 版本,一键回滚(网关 + Registry 联动)
- 回滚要秒级见效:网关层切流量,不依赖 Pod 重启
加分方向#
- GPU 调度策略(Volcano/Kueue 集成)
- OpenTelemetry GenAI 语义约定全链路接入
- 租户级成本分析与优化建议
- 模型效果在线采样评估系统
- 编排层(Dynamo/llm-d)集成
技能树#
text
基础(必备)
├── K8s / Docker / Helm(见 DevOps 路线)
├── Python / Go(平台开发)
├── PostgreSQL / Redis(元数据存储)
├── Argo Workflows(流水线编排)
└── 对象存储(S3/OSS/MinIO)
AI Infra 专项
├── LiteLLM Proxy(AI Gateway)
├── MLflow Model Registry
├── vLLM/SGLang 部署(引擎层理解)
├── Volcano/Kueue 队列管理
└── OpenTelemetry GenAI(可观测)
进阶
├── 多租户计费系统设计
├── 备案合规自动化
├── 模型评测平台设计
└── 成本治理与优化学习路径建议#
text
1. 先掌握推理服务化(Ch2):能部署 vLLM/SGLang,理解 OpenAI API
2. 再学 AI Gateway(Ch5):LiteLLM 部署,Virtual Key,限流熔断
3. 然后学平台治理(Ch6):Model Registry,Eval Pipeline,灰度回滚
4. 最后补合规(Ch6 后半):备案四要素,内容安全,Prompt Injection
5. 加分项:编排层(Dynamo)、GPU 调度(Volcano)、OTel GenAI项目经验建议#
简历表达参考:
text
构建公司内部大模型推理平台,支持 20+ 模型、10+ 业务线、100+ GPU 卡:
- LiteLLM 网关统一接入,Virtual Key 多租户隔离,按 Team/Model 维度成本统计
- MLflow Registry + Argo Workflows 实现模型评测到上线的自动化流水线
- 网关层灰度发布(10% → 50% → 100%),秒级回滚能力
- 内建备案合规闸口(LlamaGuard 内容审核 + 拒答机制 + 审计日志)
- Prometheus + Grafana + OTel GenAI 可观测体系典型面试题方向#
如何设计模型生命周期管理?上线准入、版本评测、发布回滚全流程
- 答题思路:Registry → Eval Pipeline → 四闸准入 → 灰度 → 回滚闭环,强调平台化(自助流程)和可审计
如何做多租户的权限、审计和成本统计?
- 答题思路:Team → Virtual Key → 模型白名单 + 预算 + RPM/TPM;LiteLLM SpendLogs 全量审计;Grafana 按 Team/Model 拆分
如何设计模型评测流水线?怎么把训练、评测、发布串成平台能力?
- 答题思路:Argo Workflows DAG,分层评测(通用+业务+安全+性能+合规),自动准入判定
如何在平台层内建备案合规与内容安全闸口?
- 答题思路:备案四要素自动化收集 + LiteLLM Guardrails 集成 LlamaGuard + 输入输出双重审核 + 全量审计
如何设计多租户 GPU 资源池?
- 答题思路:Volcano 层级队列 + PriorityClass + 借用机制 + 碎片治理