路线图

岗位分支 · RAG知识库Agent工程师

星辉 2026-07-02 阅读 1 min 203 字 路线图
岗位分支 · RAG知识库Agent工程师 封面

定位:企业知识库 / 问答 / 文档分析 对应主路线:Ch3(RAG / Context 工程)


核心能力领域#

1. 文档解析与处理#

  • 多格式文档解析(PDF / Word / Excel / HTML / Markdown)
  • OCR(扫描件、图片文档)
  • 表格 / 公式 / 图表抽取
  • 文档结构保留(标题层级、段落、列表)
  • 工具:Marker / Docling / unstructured / PyMuPDF

2. Chunking 策略#

  • 固定长度 / 按结构 / 递归切分 / 语义切分
  • chunk_size / overlap 调参
  • metadata 设计(source / page / section / acl)
  • 多粒度索引(粗粒度召回 + 细粒度精读)

3. Embedding 与 Vector DB#

  • 选型:BGE-M3 / Qwen3-Embedding / OpenAI / Cohere
  • Vector DB:Milvus / Qdrant / pgvector / 腾讯 VectorDB
  • 索引算法:HNSW / IVF-PQ
  • metadata filter(权限感知检索)

4. 检索链路#

  • Hybrid Search(向量 + BM25 + RRF 融合)
  • Rerank(BGE-Reranker / Cohere Rerank)
  • Query Rewrite(HyDE / Multi-Query)
  • 引用溯源(每个回答附 chunk 引用)

5. 权限感知检索#

  • 按用户权限过滤 metadata(部门/级别/项目组)
  • 检索时就过滤(不是先检索后过滤)
  • 引用按权限显示(用户能看答案但看不到机密源)

6. RAG Eval#

  • 评测维度:召回 / 精度 / 忠实度 / 答案正确性 / 引用正确性
  • 工具:Ragas / TruLens / DeepEval
  • 回归数据集(线上失败转 eval case)

7. 知识库更新流水线#

  • 增量更新(新文档入库自动 chunking + embedding)
  • 版本管理(文档改了怎么处理旧 chunk)
  • 失效检测(chunk 引用的文档被删/改了)
  • 灰度发布(新知识库先小流量验证)

技术栈重点#

技术优先级
文档解析 / Chunking必会
Embedding / Vector DB必会
Hybrid Search / Rerank必会
RAG Eval必会
Agentic RAG / GraphRAG加分
权限感知检索加分
知识库更新流水线加分

典型面试题方向#

  1. 如何做权限感知检索?为什么"先检索后过滤"是反模式?
  2. 引用忠实度怎么评?LLM-as-a-Judge 怎么校准?
  3. 知识库更新流水线怎么设计?增量更新 vs 全量重建各适用什么场景?
  4. 文档中表格/公式/图表怎么处理?直接 chunk 会丢什么信息?
  5. RAG 召回正确但回答错误,怎么排查?从 trace 哪几步入手?
  6. Agentic RAG vs 传统 RAG 的边界?什么场景该升级?
  7. GraphRAG 什么时候值得用?成本和复杂度怎么权衡?

加分方向#

  • Agentic RAG(多轮检索、query 改写决策)
  • GraphRAG(跨文档关系查询)
  • 权限感知检索(企业场景刚需)
  • 知识库更新流水线(自动化运维)
  • 多模态 RAG(图片/视频检索)