路线图

岗位分支 · Agent-Safety-Evaluation工程师

星辉 2026-07-02 阅读 1 min 211 字 路线图
岗位分支 · Agent-Safety-Evaluation工程师 封面

定位:Agent 评测 / 安全 / 红队 / 合规 对应主路线:Ch9(评测与可观测)、Ch10(安全护栏)


核心能力领域#

1. Agent Eval 体系#

  • 评测维度(任务成功率 / 工具成功率 / 轨迹合理性 / 成本 / 延迟)
  • Trajectory Evaluation(不只看最终结果)
  • LLM-as-a-Judge(含校准、多 judge 投票)
  • Human Annotation(双盲标注、一致性、仲裁)
  • 回归数据集(线上失败 → eval case)

2. 基准谱系#

  • SWE-bench / Terminal-Bench(编码类)
  • τ-bench(工具调用/对话)
  • GAIA(通用助手)
  • WebArena(浏览器任务)
  • 自定义业务基准

3. 工具调用评估#

  • 工具选择准确率(golden tool 标注)
  • 参数填写准确率(golden args 标注)
  • 工具调用顺序合理性
  • 工具失败处理能力

4. RAG Eval#

  • 检索召回 / 精度
  • 生成忠实度(faithfulness)
  • 引用正确性
  • 工具:Ragas / TruLens / DeepEval

5. Trace / 可观测#

  • Trace 三层结构(Run / Step / LLM·Tool Call)
  • Trace 工具(LangSmith / Langfuse / OTel GenAI)
  • 异常行为检测(突然调大量工具 / 读敏感文件)
  • 实时告警

6. Prompt Injection 防护#

  • 直接注入检测(关键词 / 模型分类 / 异常检测)
  • 间接注入防护(untrusted data 标记)
  • 多层防御(Input / System Prompt / 数据隔离 / Output / 权限 / 监控)
  • 越狱攻击测试

7. 红队测试#

  • 模拟攻击者视角测 Agent
  • Prompt injection 攻击库
  • 工具调用滥用测试
  • 越权测试
  • 供应链攻击模拟

8. 权限测试#

  • 工具权限边界测试(每个工具能做什么不能做什么)
  • Confused Deputy 测试
  • 凭证最小化验证
  • 审计日志完整性

9. 安全基准集#

  • 自动回归评测(每次发版前跑)
  • 安全 benchmark(业界标准 + 自建)
  • 隐私流分析(Agent 是否泄露敏感数据)
  • 工具调用风险建模

技术栈重点#

技术优先级
Agent Eval / LLM-as-a-Judge必会
Trajectory / Tool Call / RAG Eval必会
Prompt Injection 防护必会
权限测试 / 红队测试必会
Trace / 观测必会
审计必会
自动回归评测加分
安全基准集加分
隐私流分析加分
工具调用风险建模加分

典型面试题方向#

  1. 如何做轨迹级回归评测?每次发版必跑什么用例?
  2. 如何做红队测试?Prompt injection 攻击库怎么建?
  3. LLM-as-a-Judge 怎么校准?评审模型本身不准怎么办?
  4. 如何建工具调用风险模型?每个工具的风险维度有哪些?
  5. Agent 是否泄露敏感数据怎么自动检测?隐私流分析怎么做?
  6. 间接 Prompt Injection 怎么测?检索内容里藏恶意指令能复现吗?
  7. 安全基准集怎么建?业界基准 vs 业务基准怎么平衡?
  8. Confused Deputy 怎么测?构造什么场景能复现?
  9. 审计日志怎么设计才能完整又不过载?哪些必须记哪些可省?

加分方向#

  • 自动回归评测体系
  • 安全基准集(业界贡献)
  • 隐私流分析
  • 工具调用风险建模
  • Agent 安全框架(开源贡献)
  • 红队工具开发
  • 合规自动化(备案 / 审计报告生成)