人工智能

Agentic AI评估工程:衡量多智能体协作效能与涌现能力,构建智能时代的度量衡体系

2026年AI Agent评估工程实践全景:从LLM评测到Agent评估的范式转变,组件级→系统级→涌现层三级评估体系,4A涌现度量框架(Additionality/Adaptability/Autonomy/Alignment),CI/CD评估流水线设计,影子评估工程化,评估反模式识别,以及Agent评估标准化与伦理问题。

LLM 流式推理的自适应调度引擎:背压传播、批处理优化与过载保护

在 LLM 推理服务中,Streaming(流式)输出带来了极致的用户体验,但也给服务端带来了独特的调度难题。本文深入探讨如何在流式推理场景下构建具备背压感知、自适应批处理和过载保护的生产级调度系统,涵盖 GPU 显存预算器、AIMD 自适应批处理、分级降级策略及 Token Bucket 限流等核心技术。

大模型语料去重工程实战:从 MinHash-LSH 的概率曲线到 10TB 语料流水线

拆解预训练语料去重的三层漏斗:归一化精确去重、MinHash-LSH 近重复召回、embedding 语义兜底。从 MinHash 的无偏估计性质与 1-(1-s^r)^b 分带概率曲线出发,给出签名、分桶、候选复核与连通分量的可运行代码,并总结倾斜桶、阈值拍脑袋、去重后分布偏斜等生产级坑点与验收清单。