热门图集

Kubernetes 弹性伸缩的控制论:从 HPA 比例控制、VPA 分位推荐到 Karpenter 即时供给的工程全解

从控制论与排队论拆解 K8s 三层弹性伸缩:HPA 的期望副本数公式与死区/稳定窗口如何抑制振荡,纯滞后(指标延迟+冷启动)如何吃掉相位裕度,VPA 的指数衰减分位直方图如何给 request 定价,Karpenter 如何用 FFD 装箱与 disruption budget 做秒级节点供给与压实。含 Go/Python 可运行代码与生产参数清单。

LLM 流式推理的自适应调度引擎:背压传播、批处理优化与过载保护

在 LLM 推理服务中,Streaming(流式)输出带来了极致的用户体验,但也给服务端带来了独特的调度难题。本文深入探讨如何在流式推理场景下构建具备背压感知、自适应批处理和过载保护的生产级调度系统,涵盖 GPU 显存预算器、AIMD 自适应批处理、分级降级策略及 Token Bucket 限流等核心技术。