编程开发

FPGA 加速 AI 推理:从 HLS 到自定义 RTL 的架构工程实践

本文系统性地探讨如何利用 HLS 快速构建 AI 推理原型,以及如何通过自定义 RTL 实现生产级性能。结合 Xilinx VCK190 开发板的 INT8 脉动阵列、Attention 硬件设计、主机端控制器等完整代码示例,并给出 TinyLlama-1.1B 模型的实测性能数据与 GPU 对比分析。