人工智能

大模型语料去重工程实战:从 MinHash-LSH 的概率曲线到 10TB 语料流水线

拆解预训练语料去重的三层漏斗:归一化精确去重、MinHash-LSH 近重复召回、embedding 语义兜底。从 MinHash 的无偏估计性质与 1-(1-s^r)^b 分带概率曲线出发,给出签名、分桶、候选复核与连通分量的可运行代码,并总结倾斜桶、阈值拍脑袋、去重后分布偏斜等生产级坑点与验收清单。

LLM 流式推理的自适应调度引擎:背压传播、批处理优化与过载保护

在 LLM 推理服务中,Streaming(流式)输出带来了极致的用户体验,但也给服务端带来了独特的调度难题。本文深入探讨如何在流式推理场景下构建具备背压感知、自适应批处理和过载保护的生产级调度系统,涵盖 GPU 显存预算器、AIMD 自适应批处理、分级降级策略及 Token Bucket 限流等核心技术。

GPT-5时代大模型推理调度系统深度实战:连续批处理、分块预填充与抢占重调度的全链路工程

随着GPT-5、Claude 4.5等超大上下文模型的部署,推理服务调度层成为性能瓶颈的核心。本文从vLLM v0.6+与SGLang 0.4的调度器源码出发,深度拆解Continuous Batching、Chunked Prefill、Preemption三大核心机制的实现细节,给出完整的调度循环Rust伪代码和实测性能基准。