从 Function Calling 到确定性编排:生产级 AI Agent 工具调用层的工程化 从 Function Calling 协议本质出发,构建一个可落地的工具调用运行时,并讨论确定性编排与自由规划的取舍、生产级必补的三个工程坑,以及 Agent 的适用边界。 大语言模型 2026年09月29日 0 点赞 0 评论 59 浏览
LLM 推理引擎架构演进:PagedAttention、Continuous Batching 与 vLLM/SGLang 深度工程 深度解析现代 LLM 推理引擎 PagedAttention 和 Continuous Batching 两大核心技术,结合 vLLM 与 SGLang 工程案例,完整拆解 KV Cache 内存管理、Iteration-Level 调度、RadixAttention 缓存复用的底层原理与生产最佳实践。 推理部署 2026年09月29日 0 点赞 0 评论 37 浏览
AI 推理引擎的批处理与内存管理:从 Continuous Batching 到 PagedAttention 的工程实践 本文深入剖析现代推理引擎解决吞吐-延迟-显存矛盾的两大核心技术:Continuous Batching(迭代级批处理)和 PagedAttention(分页KV Cache)。从操作系统内存管理视角,详解其CUDA实现内核、Prefix Caching机制、分离式架构演进,并提供生产环境调优与避坑指南。 推理部署 2026年09月29日 0 点赞 0 评论 40 浏览
机密 AI 推理实战:在 Intel TDX / AMD SEV-SNP 可信执行环境中部署 LLM 推理服务 深入探讨如何利用现代CPU的可信执行环境(TEE)构建机密AI推理体系,在Intel TDX和AMD SEV-SNP硬件保护下部署LLM推理服务,确保数据在使用过程中(Data-in-Use)始终处于加密保护状态。 推理部署 2026年09月29日 0 点赞 0 评论 51 浏览
构建一个有手有脑的 AI Agent:ReAct 推理循环、函数调用与多智能体编排实战 深入剖析生产级 AI Agent 的工程实现:ReAct 推理闭环、function calling 强类型工具契约、分层记忆与主管-Worker 多智能体编排,附可运行 Python 代码与上线四道保险。 推理部署 2026年09月29日 0 点赞 0 评论 45 浏览
Model Context Protocol (MCP) 工程实践:构建 AI Agent 的万能接口 深入解析 MCP 协议的核心架构设计、消息传输机制、安全模型,通过生产级实战案例(文件系统 Agent、数据库查询 Agent、多工具协作文档生成 Agent)展示从零构建健壮 MCP Server 的完整路径。涵盖 2026 年 MCP 生态的 Streamable HTTP 扩展、安全模型演进与多 Agent 协作架构。 大语言模型 2026年09月29日 0 点赞 0 评论 35 浏览
LLM 推理引擎显存与调度深度实战:从 PagedAttention 到 Continuous Batching 与 Prefix Caching 的生产调优 从显存算术出发拆解LLM推理成本:KV Cache容量模型、PagedAttention分页管理、Continuous Batching迭代级调度、Prefix Caching前缀复用,以及vLLM/SGLang生产级调优清单与踩坑记录。 推理部署 2026年09月29日 0 点赞 0 评论 44 浏览
AI Agent 上下文工程实战:从上下文腐烂到 Compaction、Offloading 与多智能体隔离 深入剖析 AI Agent 长时运行中的上下文腐烂问题:四种失败模式、上下文预算建模,以及 Write/Select/Compress/Isolate/Cache/Forget 六大策略,附上下文管理器、两阶段压缩、子智能体隔离与前缀缓存布局的完整 Python 实现。 大语言模型 2026年09月29日 0 点赞 0 评论 64 浏览
AI Agent 长程记忆工程实战:从分层记忆模型到遗忘机制与生产级检索闭环 从工程落地视角拆解 AI Agent 长程记忆子系统:情景/语义/程序性三层记忆模型、抽取-去重-固化的写入链路、BM25+向量+元数据过滤的三路混合检索与 RRF 融合、时间衰减与冲突消解驱动的遗忘机制、以及记忆召回率/污染率/无效召回率三大评测指标,附可运行的 Python 实现与生产落地清单。 大语言模型 2026年09月29日 0 点赞 0 评论 42 浏览
MoE 专家并行深潜:从 All-to-All 通信瓶颈到 DeepEP 的工程突围 从 MoE 层的两次 All-to-All 出发量化分析专家并行的通信瓶颈,解析路由负载均衡、capacity 截断、EP 与 TP 的适用性差异,以及 DeepEP 的双域 buffer、纯 RDMA 低延迟 kernel 与通信计算重叠设计,并给出生产环境落地 checklist。 人工智能 2026年09月29日 0 点赞 0 评论 49 浏览
AI Agent 的代码执行沙箱:WebAssembly 与 WASI 0.2 的安全边界工程实践 Agent 生成的代码该在哪一层被隔离?本文对比容器/gVisor/Firecracker 与 WebAssembly,论证 WASM 在短生命周期不可信代码场景的成本与安全优势,并用 WIT 接口定义、Rust+Wasmtime 完整实现(fuel 计量、epoch 中断、内存上限)讲透最小权限沙箱的工程落地。 大语言模型 2026年09月29日 0 点赞 0 评论 41 浏览
投机解码深度实战:从草稿-验证采样到 EAGLE 树状草稿,把 LLM 解码延迟砍一半 从内存墙出发推导投机解码的第一性原理,给出可直接运行的接受-拒绝采样完整实现与残差重采样推导,对比独立草稿模型/Medusa/MTP/EAGLE/n-gram 五条路线,讲透树状草稿与 tree attention mask,最后给出 vLLM、SGLang 生产配置、四种不该开启的场景与真实接受率调优方法论。 大语言模型 2026年09月29日 0 点赞 0 评论 67 浏览
LLM 推理引擎内部原理:PagedAttention、Continuous Batching 与现代推理架构剖析 深入剖析现代 LLM 推理引擎的核心机制——PagedAttention 内存管理和 Continuous Batching 调度策略,揭示 vLLM 如何将吞吐量提升 2-4 倍 推理部署 2026年09月29日 0 点赞 0 评论 48 浏览
MCP 协议深度实战:从零手写一个 Server,拆解 AI Agent 的「USB-C 接口」 从 JSON-RPC 握手报文到可上生产的只读数据库 MCP Server,深度拆解 MCP 协议的三大能力原语、工具描述设计、传输层选型、间接提示注入风险与上下文成本优化,给出 AI Agent 工具层的工程实践结论。 大语言模型 2026年09月29日 0 点赞 0 评论 45 浏览
LLM 后训练量化深度实战:从 GPTQ/AWQ 到 FP8 与 KV Cache 量化的显存-带宽极限工程 从 Roofline 模型定量证明 decode 阶段 Tensor Core 利用率仅 0.33% 的内存墙困境出发,系统拆解 LLM 后训练量化的完整工程栈:group-wise 量化粒度、SmoothQuant 的 outlier 迁移、GPTQ 的 Hessian 误差补偿、AWQ 的激活感知缩放、FP8 延迟缩放与 KV Cache 分级量化,并给出逐层重建误差定位法与生产选型决策树。 模型微调 2026年09月29日 0 点赞 0 评论 53 浏览