Posts
RAG 评估体系:RAGAS 指标与幻觉检测实践
RAG 系统上线后,'感觉回答质量还不错'不是一个可持续的评估方式。RAGAS 提供了一套可量化的评估框架,让你能追踪 Faithfulness、Answer Relevancy 等指标随时间的变化,并在每次改动后自动验证系统质量没有退化。
Advanced RAG:超越 Naive RAG 的高级检索增强技术
系统拆解 Naive RAG 的三类失败模式,提供混合检索、HyDE、查询改写、Parent-Child 分块等高级技术的完整实现
Earthly 在 Monorepo 的构建统一:Earthfile + Satellites 实战
Bazel 复杂度太高,Makefile 表达力不够,Dockerfile 只能构建一个镜像——Earthly 填的就是这个缝:像 Dockerfile 一样熟悉,像 Makefile 一样组合,像 Bazel 一样可并发、可缓存、可复用。本文讲清楚它在 …
大模型赋能运维:LLM 在故障排查和自动化中的实际应用
LLM 不能替代运维工程师,但确实能把重复性、低价值的工作自动化掉。本文分享我在实际工作中用 Claude 落地的几个场景。
AI Agent 设计模式:从单步到复杂工作流
Agent不是更智能的ChatGPT调用,它是一个能自主规划和执行多步骤任务的循环系统。本文拆解ReAct推理循环、Tool调用设计原则、Multi-Agent协作模式、Human-in-the-loop设计,以及告警分析Agent和巡检Agent的实战实现。
Nix + devcontainer:彻底终结 works on my machine
新同事入职第一天配环境要花一天,CI 和本地构建结果不一致,升级 Node 16 到 20 引发连锁故障——这些痛都源于'环境不是代码'。Nix 把工具链当成代码版本化,和 direnv/devcontainer 配合能做到 'git clone 后 10 秒 …
LLM 应用安全:Prompt Injection 防御与 AI Guardrails 实战
我们的 AI 客服系统曾被一个用户用一句话绕过所有限制,让它泄露了内部知识库的敏感信息。这篇文章系统梳理 LLM 应用的安全威胁模型,以及我们在生产系统中实施的防御层次。
Dagger 实战:用代码而不是 YAML 编写 CI/CD
每次迁移 CI 平台(Jenkins → GitLab → GitHub Actions → Tekton),业务流水线都要重写一遍。Dagger 的思路是:把流水线写成可移植的代码(Go/Python/TS),底层引擎负责执行和缓存,CI 平台只是调用方。本 …