人工智能
AI Agent 软件工程全流程落地:从代码补全到自治研发团队的工程实践
从系统工程视角拆解AI Agent覆盖软件研发全流程的核心技术栈、工程陷阱与落地路径,包含编码、审查、测试、部署、运维全阶段的实战架构与代码示例。
MCP 协议深度实战:AI Agent 通用互操作协议的架构设计与工程落地
深度解析 Anthropic 推出的 Model Context Protocol (MCP) 协议架构设计原理、三大核心原语(Tools/Resources/Prompts)、传输层抽象以及生产环境工程实践,涵盖安全、可观测性、容错和扩展性等关键话题,并对比 MCP 与 A2A 协议的互补关系
AI 模型量化技术深度实战:从 GPTQ 到 BitNet 的推理降本工程
2026年大模型推理成本已成为AI商业化落地的核心瓶颈。本文系统梳理从训练后量化(PTQ)到量化感知训练(QAT),再到1.58-bit BitNet的技术演进路径,结合工程实践剖析GPTQ、AWQ、SmoothQuant、GGUF等主流方案的原理差异与适用场景。
LLM推理PD分离架构深度工程实践:从Prefill-Decode异构到分布式KV Cache传输
深入剖析LLM推理PD分离架构的工程实践:从Prefill-Decode异构到分布式KV Cache传输,涵盖DistServe、Mooncake、NVIDIA Dynamo等系统的设计原理与传输协议优化。
Linux内核DMA-BUF显式同步与跨驱动缓冲区共享:从零构建零拷贝GPU计算管线
在现代AI推理管线中,数据搬运的耗时往往超过计算本身。CPU与GPU、GPU与GPU、存储与加速器之间的零拷贝数据共享,是突破性能瓶颈的关键。Linux内核的DMA-BUF子系统正是解决这一问题的核心基础设施,而显式同步机制(explicit fencing)则是保证多设备并发访问正确性的基石。本文将深入DMA-BUF的内部机制,从零实现一个跨驱动的零拷贝GPU计算管线。
