岗位分支 · RAG知识库Agent工程师
定位:企业知识库 / 问答 / 文档分析 对应主路线:Ch3(RAG / Context 工程)
核心能力领域#
1. 文档解析与处理#
- 多格式文档解析(PDF / Word / Excel / HTML / Markdown)
- OCR(扫描件、图片文档)
- 表格 / 公式 / 图表抽取
- 文档结构保留(标题层级、段落、列表)
- 工具:Marker / Docling / unstructured / PyMuPDF
2. Chunking 策略#
- 固定长度 / 按结构 / 递归切分 / 语义切分
- chunk_size / overlap 调参
- metadata 设计(source / page / section / acl)
- 多粒度索引(粗粒度召回 + 细粒度精读)
3. Embedding 与 Vector DB#
- 选型:BGE-M3 / Qwen3-Embedding / OpenAI / Cohere
- Vector DB:Milvus / Qdrant / pgvector / 腾讯 VectorDB
- 索引算法:HNSW / IVF-PQ
- metadata filter(权限感知检索)
4. 检索链路#
- Hybrid Search(向量 + BM25 + RRF 融合)
- Rerank(BGE-Reranker / Cohere Rerank)
- Query Rewrite(HyDE / Multi-Query)
- 引用溯源(每个回答附 chunk 引用)
5. 权限感知检索#
- 按用户权限过滤 metadata(部门/级别/项目组)
- 检索时就过滤(不是先检索后过滤)
- 引用按权限显示(用户能看答案但看不到机密源)
6. RAG Eval#
- 评测维度:召回 / 精度 / 忠实度 / 答案正确性 / 引用正确性
- 工具:Ragas / TruLens / DeepEval
- 回归数据集(线上失败转 eval case)
7. 知识库更新流水线#
- 增量更新(新文档入库自动 chunking + embedding)
- 版本管理(文档改了怎么处理旧 chunk)
- 失效检测(chunk 引用的文档被删/改了)
- 灰度发布(新知识库先小流量验证)
技术栈重点#
| 技术 | 优先级 |
|---|---|
| 文档解析 / Chunking | 必会 |
| Embedding / Vector DB | 必会 |
| Hybrid Search / Rerank | 必会 |
| RAG Eval | 必会 |
| Agentic RAG / GraphRAG | 加分 |
| 权限感知检索 | 加分 |
| 知识库更新流水线 | 加分 |
典型面试题方向#
- 如何做权限感知检索?为什么"先检索后过滤"是反模式?
- 引用忠实度怎么评?LLM-as-a-Judge 怎么校准?
- 知识库更新流水线怎么设计?增量更新 vs 全量重建各适用什么场景?
- 文档中表格/公式/图表怎么处理?直接 chunk 会丢什么信息?
- RAG 召回正确但回答错误,怎么排查?从 trace 哪几步入手?
- Agentic RAG vs 传统 RAG 的边界?什么场景该升级?
- GraphRAG 什么时候值得用?成本和复杂度怎么权衡?
加分方向#
- Agentic RAG(多轮检索、query 改写决策)
- GraphRAG(跨文档关系查询)
- 权限感知检索(企业场景刚需)
- 知识库更新流水线(自动化运维)
- 多模态 RAG(图片/视频检索)