端侧 AI 推理引擎:从模型压缩到硬件加速的全栈工程实践 端侧AI推理引擎全栈技术解析:从模型量化(GPTQ/AWQ/BitNet)、推理引擎架构设计、NPU/GPU/CPU异构调度到KV Cache内存管理,系统拆解在毫瓦级设备上运行大模型的核心工程实践。 AI应用开发 2026年10月02日 0 点赞 0 评论 4 浏览