一、推理部署的时代命题

大语言模型从"能训练"走向"能用"的关键一步是推理部署(Deployment)。与训练的分布式策略不同,推理延迟由组合特性决定:首token延迟(TTFT)受Prefill阶段串行计算影响;吞吐(Tokens/Second)依赖KV Cache容量与Batch调度;成本则与GPU显存和Batching效率密切相关。当前工业级推理解决方案已形成三类产品:高吞吐量引擎(vLLM/SGLang)、标准化网关(Inference Gateway)和低延迟定制栈(TensorRT-LLM)。

二、PagedAttention与Continuous Batching:vLLM的核心贡献

2.1 内存碎片问题的根源

传统推理服务为每个请求一次性分配最大Seq长度的KV Cache显存。由于序列长度不可预测,这种连续分配造成严重内部碎片(Internal Fragmentation)外部碎片(External Fragmentation)——OSU团队的研究表明,静态分配导致约60~80%的GPU显存浪费。

2.2 PagedAttention机制

vLLM借鉴OS虚拟内存的分页思想:将KV Cache拆分为固定大小(Block/Page),Logic Block由Page Table映射到物理Block。好处有四:(1)按需分配——仅分配实际序列长度所需Page数;(2)零浪费——内部碎片仅最后一块尾部;(3)共享前缀——System Prompt的KV Cache可跨请求拷贝引用同一物理块(Copy-on-Write);(4)Swap-out——不活跃请求的KV页可Swap到CPU DRAM,释放GPU显存给新请求。

2.3 Continuous Batching(Iteration-level Scheduling)

传统Static Batching必须等待Batch中最慢请求结束后才释放整组资源。vLLM提出的Continuous Batching改为迭代级调度:每个Decode-Step完成后检查新请求队列,立即将新请求加入当前Batch运行;同时将有OOM风险的已完成请求或Swap-out请求剔除。这使得GPU利用率从传统的约50%提升至90%+。

三、SGLang:结构化生成与RadixAttention

3.1 核心创新

SGLang(Structured Generation Language)由UC Berkeley团队首创,相比vLLM有两个关键差异化能力:(1)RadixAttention——用RadixTree管理Prefix Cache,自动识别多个请求间的共享前缀并复用KV Cache;(2)结构化生成约束——通过CFG(上下文无关文法)或正则表达式约束LLM输出格式,实现JSON/XML的确定性输出,吞吐量提升3倍以上。

3.2 RadixAttention与Prefix Caching对比

纯粹的Prefix Caching(如vLLM)仅在Exact-Match的Prefix上命中缓存。SGLang的RadixAttention将前缀存入Radix Tree,自动匹配最长公共部分。测试中,ShareGPT场景(大量通用前缀)下吞吐提升30~50%。

四、Inference Gateway:LLM流量入口的新抽象

4.1 为什么需要推理网关

企业部署多模型(vLLM加载的Llama + a加载的Qwen)时面临统一入口、权限控制、计费、智能路由等需求。Inference Gateway(Kubernetes SIG项目)正是解决这一层问题的标准网关。

4.2 关键能力

  • Model/Backend路由:同一/openai/v1/chat/completions端点,根据model字段路由到不同LLM Pod
  • Endpoint-Picker(EPP):通过插件化接口实现自定义调度策略(最空闲/最短队列/区域感知)
  • Token-Based 限流与计费:按模型API Token计数,而非简单HTTP请求数
  • Fallback & 重试:主模型Pod Down时自动切换到备用Pod,结合Header重试幂等Token

五、生产部署推荐架构

一个可落地的生产级推理部署方案:

  1. Engine层:vLLM(PagedAttention)或SGLang(RadixAttention)提供引擎托管
  2. 网关层:Inference Gateway统一流量接入 + GPU Instance Group按模型切片
  3. Scale层:KEDA基于KV-Cache利用率或排队请求数自动弹性伸缩
  4. 可观测层:Prometheus采集TTFT/Throughput/Cache-Hit-Rate,Grafana看板实时展示SLA

六、总结

大模型推理部署正从"单机脚本化"走向"云原生基础设施化"。vLLM解决内存管理与Batch调度痛点,SGLang在Prefix Caching与结构化生成上更进一步,Inference Gateway则补齐了企业级API管控最后一环。随着Speculative Decoding、Chunked Prefill、Split-fuse等新技术落地,每Token推理成本将持续降低,LLM SaaS的可持续商业模式正在加速到来。

点赞(0) 打赏

评论列表 共有 0 条评论

暂无评论
立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部