Posts
Ollama 在 K8s 上跑大模型:本地 LLM 的运维实践
在 Kubernetes 上部署 Ollama 运行本地大模型,从 GPU 调度到 CPU 推理降级,再到运维场景的实际集成,记录完整的踩坑与实践过程。
Ray Serve 模型部署实战:Deployment、DAG 编排与弹性伸缩
Ray Serve 是被很多团队忽视的模型服务框架。它在复杂 DAG、异构资源、弹性伸缩上的表现远超单纯的 FastAPI。本文讲清它的核心抽象和生产落地。
GitHub Copilot 工程化使用:不只是代码补全
GitHub Copilot不只是Tab补全。Copilot Chat的/fix /explain /tests命令、workspace上下文、Copilot for CLI、在Terraform/Dockerfile/K8s YAML中的实际用法,以及提高补 …
Volcano 批调度实战:AI 训练集群的 Gang Scheduling、队列与抢占
K8s 默认调度器对 AI 训练极不友好。Volcano 把 HPC 调度理念搬进 K8s:Gang Scheduling、Queue、Fairshare、Preemption、拓扑亲和。这篇讲清楚它在 AI 训练集群的落地。
Cursor AI 编程助手深度使用指南
Cursor不是装了AI插件的VSCode,它重新设计了人机协作的交互模型。本文拆解Tab补全、@上下文引用、Composer、Agent模式、.cursorrules配置,并以重构运维脚本为例演示完整工作流。
ComfyUI + Stable Diffusion:工作流自动化图像生成
对比SDXL/FLUX/SD3生态选型,讲清楚ComfyUI vs WebUI如何选,然后深入ComfyUI安装、节点图工作流设计、常用节点配置,重点讲API无头调用和服务器端批量生成部署方案。
FluxCD vs ArgoCD 深度对比与迁移实战:架构、语义、多租户与选型决策
GitOps 的两条主流路线——FluxCD 与 ArgoCD——在架构、语义、运维成本和扩展性上有显著差异。本文基于官方文档和生产实战,按同步模型、应用抽象、多租户隔离、Helm 支持、可观测性、扩展机制逐项对比,给出选型决策树,并提供一套可复用的从 …
Unsloth 高效微调实战:单卡 QLoRA 的极致性能与内部原理
Unsloth 用手写 Triton kernel 把单卡 LoRA 微调速度和显存压到极致。本文讲清 Unsloth 的原理、和 LLaMA Factory/TRL 的组合用法,以及真实使用的坑。