岗位分支 · Agent-Safety-Evaluation工程师
定位:Agent 评测 / 安全 / 红队 / 合规 对应主路线:Ch9(评测与可观测)、Ch10(安全护栏)
核心能力领域#
1. Agent Eval 体系#
- 评测维度(任务成功率 / 工具成功率 / 轨迹合理性 / 成本 / 延迟)
- Trajectory Evaluation(不只看最终结果)
- LLM-as-a-Judge(含校准、多 judge 投票)
- Human Annotation(双盲标注、一致性、仲裁)
- 回归数据集(线上失败 → eval case)
2. 基准谱系#
- SWE-bench / Terminal-Bench(编码类)
- τ-bench(工具调用/对话)
- GAIA(通用助手)
- WebArena(浏览器任务)
- 自定义业务基准
3. 工具调用评估#
- 工具选择准确率(golden tool 标注)
- 参数填写准确率(golden args 标注)
- 工具调用顺序合理性
- 工具失败处理能力
4. RAG Eval#
- 检索召回 / 精度
- 生成忠实度(faithfulness)
- 引用正确性
- 工具:Ragas / TruLens / DeepEval
5. Trace / 可观测#
- Trace 三层结构(Run / Step / LLM·Tool Call)
- Trace 工具(LangSmith / Langfuse / OTel GenAI)
- 异常行为检测(突然调大量工具 / 读敏感文件)
- 实时告警
6. Prompt Injection 防护#
- 直接注入检测(关键词 / 模型分类 / 异常检测)
- 间接注入防护(untrusted data 标记)
- 多层防御(Input / System Prompt / 数据隔离 / Output / 权限 / 监控)
- 越狱攻击测试
7. 红队测试#
- 模拟攻击者视角测 Agent
- Prompt injection 攻击库
- 工具调用滥用测试
- 越权测试
- 供应链攻击模拟
8. 权限测试#
- 工具权限边界测试(每个工具能做什么不能做什么)
- Confused Deputy 测试
- 凭证最小化验证
- 审计日志完整性
9. 安全基准集#
- 自动回归评测(每次发版前跑)
- 安全 benchmark(业界标准 + 自建)
- 隐私流分析(Agent 是否泄露敏感数据)
- 工具调用风险建模
技术栈重点#
| 技术 | 优先级 |
|---|---|
| Agent Eval / LLM-as-a-Judge | 必会 |
| Trajectory / Tool Call / RAG Eval | 必会 |
| Prompt Injection 防护 | 必会 |
| 权限测试 / 红队测试 | 必会 |
| Trace / 观测 | 必会 |
| 审计 | 必会 |
| 自动回归评测 | 加分 |
| 安全基准集 | 加分 |
| 隐私流分析 | 加分 |
| 工具调用风险建模 | 加分 |
典型面试题方向#
- 如何做轨迹级回归评测?每次发版必跑什么用例?
- 如何做红队测试?Prompt injection 攻击库怎么建?
- LLM-as-a-Judge 怎么校准?评审模型本身不准怎么办?
- 如何建工具调用风险模型?每个工具的风险维度有哪些?
- Agent 是否泄露敏感数据怎么自动检测?隐私流分析怎么做?
- 间接 Prompt Injection 怎么测?检索内容里藏恶意指令能复现吗?
- 安全基准集怎么建?业界基准 vs 业务基准怎么平衡?
- Confused Deputy 怎么测?构造什么场景能复现?
- 审计日志怎么设计才能完整又不过载?哪些必须记哪些可省?
加分方向#
- 自动回归评测体系
- 安全基准集(业界贡献)
- 隐私流分析
- 工具调用风险建模
- Agent 安全框架(开源贡献)
- 红队工具开发
- 合规自动化(备案 / 审计报告生成)