posts

Posts

221
分类 标签
Posts 封面
AI/机器学习

LLM 成本优化实战:从 Token 预算到模型路由

我们的 AI 功能上线第一个月,LLM API 账单是 $18,000。通过模型路由、Prompt Caching 和 Batch API,第三个月降到了 $3,200。这篇文章记录具体怎么做到的。

◷ 7 min AI · 成本优化 · LLM
Posts 封面
AI/机器学习

LLM Tool Use 完全指南:Function Calling 设计模式与生产实践

从工程视角深入 LLM Tool Use:覆盖 OpenAI 与 Claude API 差异、工具 Schema 设计、并发调用、错误恢复,附完整运维助手代码示例

◷ 8 min AI · Function Calling · Tool Use
Posts 封面
CI/CD

Tekton Pipelines 企业级落地:从 Task 抽象到供应链签名

Jenkins 扛不动 K8s Native 的调度压力,GitLab Runner 又太 monolithic。Tekton 把 'CI job' 拆成 Task + Pipeline + PipelineRun 三层 CRD,所有执行都是 Pod,天然贴合 …

◷ 9 min Tekton · CI/CD · Kubernetes
Posts 封面
大模型

LLM 微调入门:LoRA 让大模型适配私有场景

什么时候该微调、什么时候该用提示工程?本文给出决策框架,然后用Unsloth+QLoRA实战微调Qwen2.5-7B,覆盖数据格式、训练监控、权重合并、部署到vLLM测试,以及10个真实踩坑记录。

◷ 4 min LoRA · 微调 · QLoRA
Posts 封面
AI/机器学习

LLM 生产服务化:vLLM 部署与 GPU 推理优化实战

团队把 Ollama 搬上生产后,高峰期请求排队超过 30 秒,用户纷纷反映 AI 功能不可用。这篇文章记录我们迁移到 vLLM 的全过程,包括 PagedAttention、Continuous Batching 原理,以及 Kubernetes GPU 部 …

◷ 5 min AI · vLLM · LLM
Posts 封面
大模型

2026 大模型全景:主力模型横评与选型指南

GPT-5.4、Claude Opus 4.6、Gemini 2.5 Pro、Llama 4 Scout、DeepSeek V3.2——2026年4月的大模型格局已经和一年前完全不同。本文从工程师视角梳理当前主力模型的真实规格与适用边界,给出场景化选型矩阵,并 …

◷ 4 min 大模型 · LLM · GPT
Posts 封面
CI/CD

ko 实战:无 Dockerfile 构建 Go 容器镜像的正确姿势

同样是构建 Go 镜像,用 Dockerfile + BuildKit 要 2-3 分钟,用 ko 只需要 5-20 秒。差距来自 ko 不走 daemon、不写 tar、直接把 Go 编译产物塞进 OCI manifest。本文讲清楚这套 …

◷ 8 min ko · Go · 容器构建
Posts 封面
CI/CD

BuildKit 缓存生产实战:从多阶段到远端 Registry Cache

BuildKit 的缓存体系看似简单一行 --cache-to,实际生产里坑极多:mode=max 在多架构下的 manifest 行为、registry 后端每层 0.3s 的验证开销、cache mount 在 --cache-to=registry 下不 …

◷ 8 min BuildKit · 容器构建 · CI