引言:x86与ARM之外的第三极
AI芯片市场长期被NVIDIA(GPU)、Google(TPU)和Intel(Habana)垄断,但RISC-V开源指令集架构(ISA)正开辟新赛道。2024-2025年,SiFive、Tenstorrent、Esperanto及阿里平头哥等玩家加速RISC-V AI芯片商业化,挑战ARM在AI推理低功耗场景的统治地位。本文深入剖析RISC-V AI芯片架构、开源生态与产业变革。
1. RISC-V的AI扩展指令集
1.1 V扩展与矩阵运算
RISC-V V扩展(Vector)支持SIMD向量运算,vtype寄存器定义元素宽度(8/16/32/64位)和寄存器分组,替代传统固定宽度SIMD(如AVX-512)。相比ARM SVE2,RISC-V V扩展更简洁(~180条指令 vs ~300条指令),降低实现复杂度。
1.2 自定义指令余量
RISC-V预留大量opcode空间(custom-0/1/2/3)供厂商自定义而不破坏标准兼容性。AI芯片厂商常用此集成专属矩阵乘法(Matrix INT8/FP16 MAC)、稀疏计算、激活函数等算子加速器,而这些无需等待标准批准。
2. 主要RISC-V AI芯片产品
2.1 SiFive Intelligence系列
SiFive的X280矢量处理器集成NNA(Neural Network Accelerator)协处理器,支持INT8/FP16矩阵乘加运算,算力达4 TOPS/W性能比。客户包括Tenstorrent的Grayskull和Wormhole系列(用于AI训练/推理服务器)和Tenstorrent的Grayskull E75(AI推理PCIe加速卡,8核RISC-V + 9个Tensix核心)。
2.2 阿里平头哥玄铁C910/C920
玄铁C910采用12级双发射乱序流水线,集成512位矢量单元(含矩阵扩展),SPECint2006实测9.7/GHz,达到ARM Cortex-A76水平。C920进一步优化AI推理:集成INT8 MAC单元,矩阵乘算力提升3倍。已在边缘AI盒子、工业视觉检测中规模部署。
2.3 Esperanto ET-SoC-1
单芯片集成1088个RISC-V核心(ET-Maxion + ET-Minion),Minion核心专为AI负载优化的低功耗核心,整体能效比达30 TOPS/W(INT8),用于边缘推理微服务器。
3. RISC-V AI软件生态
3.1 编译器与工具链
LLVM/MLIR已支持RISC-V V扩展代码生成,TVM编译器将PyTorch/TensorFlow模型编译为RISC-V目标代码。阿里平头哥开源"无剑"SoC平台和"剑池"CDK,支持一键生成Linux+AI加速器固件。
3.2 算子库与框架
Compute Library for RISC-V(CL4RV)提供优化矩阵乘、卷积、激活函数等常用算子库,支持自动向量化。TFLite Micro和ONNX Runtime均已提供RISC-V后端支持。
4. 与ARM AI芯片的对比
| 维度 | RISC-V | ARM Ethos-N系列 |
|------|--------|----------------|
| licensing费用 | 免费 | $0.1-$1/芯片 |
| 定制灵活性 | 高(自定义指令) | 中(外接加速器) |
| 软件生态 | 中(快速发展) | 中(与ARM处理器协同) |
| 典型性能 | 2-4 TOPS/W | 5+ TOPS/W |
| 主要玩家 | 平头哥、Tenstorrent | ARM(通用授权) |
5. 应用场景与部署实践
5.1 边缘AI盒子
某安防厂商基于平头哥C920开发AI盒子:支持8路30fps 1080p视频分析(人脸识别+车牌检测),功耗仅15W。部署流程:PyTorch训练→PTQ量化INT8→TVM编译→RISC-V Linux运行,端到端延迟120ms。
5.2 端侧MCU级AI
Tahoma-lite(32位RISC-V + NNA)在不到1mW功耗下运行关键词唤醒和简单手势识别,适合可穿戴设备。
6. 开源硬件的机遇与挑战
机遇:1)RISC-V国际基金会拥有4000+会员,生态快速扩张;2)中国芯片自主可控需求推动国产替代;3)开源RV芯片设计(如CVA6、BOOM)降低研发门槛。
挑战:1)单核性能仍落后ARM Cortex-A76级别约10-15%;2)AI算子库不如cuDNN、ARM NN成熟;3)多核Cache一致性协议实现碎片化。
7. 未来趋势
1)RISC-V AI芯片从"功能替代"走向"架构创新",探索Chiplet互联(UCIe)+ RISC-V异构计算新范式;2)开源EDA工具(如OpenROAD)与RISC-V协同降低SoC设计门槛;3)RISC-V服务器AI推理卡(Tenstorrent Wormhole)将挑战NVIDIA L40S在推理场景的性价比。
8. 总结
RISC-V在AI芯片领域正处于"跨越鸿沟"阶段:边缘端已有成熟方案(平头哥、Esperanto),推理卡开始替代中低端GPU。对于AI芯片创业者和嵌入式团队,RISC-V + 自定义NNA加速器是一条自主可控的差异化路径。建议关注TVM对RISC-V的编译优化进展和平头哥的全志开发板的量产进度。

发表评论 取消回复