Posts
Linux 内核网络参数深度调优:高并发场景实战
在高并发场景下,Linux 默认内核参数往往成为系统瓶颈。本文从原理出发,系统讲解 TCP backlog、TIME_WAIT、keepalive、内存缓冲区、conntrack、网卡队列(RSS/RPS/RFS)的调优方法,并提供 K8s 节点专属的 …
FastGPT 知识库问答系统:从部署到应用
FastGPT是专注知识库问答的开源平台,相比Dify上手更快。本文覆盖MongoDB+PgVector部署、知识库创建与文档导入、Flow工作流配置、相似度阈值调优、API接入钉钉,以及运维知识库的实战案例。
LLaMA Factory 微调工具链实战:从数据准备到 LoRA 合并的全流程
LLaMA Factory 把大模型微调的很多 trick 工程化了。本文按一个完整项目的节奏讲:数据、SFT、LoRA、DPO、合并、评估和常见坑。
容器镜像构建优化:BuildKit、多阶段构建与供应链安全
深入剖析容器镜像构建优化的每个环节:BuildKit 并行构建与 Secrets 注入、Go/Python/Node.js 多阶段 Dockerfile 模板、--mount=type=cache 与远程缓存、Distroless vs Alpine 选型 …
ClickHouse 生产运维实战:集群部署、副本分片、性能调优与故障排查
ClickHouse 高吞吐 OLAP 能力背后有一套独特的运维范式:ReplicatedMergeTree、ZooKeeper/Keeper、分布式表、物化视图、TTL、MergeTree 家族选型。本文按生产落地路径,从集群规划、副本分片、写入优化、查询调 …
SGLang 结构化生成实战:RadixAttention、约束解码与多轮对话优化
SGLang 是被低估的 LLM 推理框架,RadixAttention 对多轮对话和 Agent 场景收益巨大。本文讲清 SGLang 的核心机制、前端 DSL、约束解码、部署方式和踩坑。
Dify 私有化部署与 RAG 应用构建实战
Dify是当前私有化部署最成熟的LLM应用构建平台。本文覆盖Docker Compose部署、多模型Provider配置、知识库创建与切片调优、RAG对话应用构建、工作流编排,以及API发布与生产监控。
Triton Inference Server 生产部署:模型编排、动态批处理与多框架混部
把 Triton 从一个陌生的 NVIDIA 推理服务器讲清楚:model repository、backend、动态批处理、ensemble、BLS、Python backend、生产监控和踩坑实录。