posts

Posts

221
分类 标签
Posts 封面
大模型

RAG 评估体系:RAGAS 指标与幻觉检测实践

RAG 系统上线后,'感觉回答质量还不错'不是一个可持续的评估方式。RAGAS 提供了一套可量化的评估框架,让你能追踪 Faithfulness、Answer Relevancy 等指标随时间的变化,并在每次改动后自动验证系统质量没有退化。

◷ 7 min RAG · RAGAS · 大模型评估
Posts 封面
AI/机器学习

Advanced RAG:超越 Naive RAG 的高级检索增强技术

系统拆解 Naive RAG 的三类失败模式,提供混合检索、HyDE、查询改写、Parent-Child 分块等高级技术的完整实现

◷ 6 min RAG · 向量检索 · AI
Posts 封面
CI/CD

Earthly 在 Monorepo 的构建统一:Earthfile + Satellites 实战

Bazel 复杂度太高,Makefile 表达力不够,Dockerfile 只能构建一个镜像——Earthly 填的就是这个缝:像 Dockerfile 一样熟悉,像 Makefile 一样组合,像 Bazel 一样可并发、可缓存、可复用。本文讲清楚它在 …

◷ 7 min Earthly · Monorepo · BuildKit
Posts 封面
AIOPS

大模型赋能运维:LLM 在故障排查和自动化中的实际应用

LLM 不能替代运维工程师,但确实能把重复性、低价值的工作自动化掉。本文分享我在实际工作中用 Claude 落地的几个场景。

◷ 5 min AI · 大模型 · LLM
Posts 封面
AI应用

AI Agent 设计模式:从单步到复杂工作流

Agent不是更智能的ChatGPT调用,它是一个能自主规划和执行多步骤任务的循环系统。本文拆解ReAct推理循环、Tool调用设计原则、Multi-Agent协作模式、Human-in-the-loop设计,以及告警分析Agent和巡检Agent的实战实现。

◷ 7 min AI Agent · 设计模式 · ReAct
Posts 封面
平台工程

Nix + devcontainer:彻底终结 works on my machine

新同事入职第一天配环境要花一天,CI 和本地构建结果不一致,升级 Node 16 到 20 引发连锁故障——这些痛都源于'环境不是代码'。Nix 把工具链当成代码版本化,和 direnv/devcontainer 配合能做到 'git clone 后 10 秒 …

◷ 6 min Nix · devcontainer · direnv
Posts 封面
AI/机器学习

LLM 应用安全:Prompt Injection 防御与 AI Guardrails 实战

我们的 AI 客服系统曾被一个用户用一句话绕过所有限制,让它泄露了内部知识库的敏感信息。这篇文章系统梳理 LLM 应用的安全威胁模型,以及我们在生产系统中实施的防御层次。

◷ 5 min AI · 安全 · Prompt Injection
Posts 封面
CI/CD

Dagger 实战:用代码而不是 YAML 编写 CI/CD

每次迁移 CI 平台(Jenkins → GitLab → GitHub Actions → Tekton),业务流水线都要重写一遍。Dagger 的思路是:把流水线写成可移植的代码(Go/Python/TS),底层引擎负责执行和缓存,CI 平台只是调用方。本 …

◷ 8 min Dagger · CI/CD · BuildKit