引言:计算架构遭遇"存储墙",破局从存算一体开始
传统冯·诺依曼架构中,数据在处理器和存储器之间的搬运消耗了60-90%的能效。2026年,从LPDDR6/HBM4近存计算到ReRAM忆阻器存内计算,再到光计算芯片,多种存算一体技术路线正从实验室走向产业化。
1. 近存计算(Processing-in-Memory/P-NN):从概念到产品
将计算单元嵌入DRAM或HBM存储芯片中,大幅减少数据搬运:
- HBM4近存AI加速器:SK海力士和三星在HBM4中集成Tiny NPU核心,每个堆栈提供4 TOPS算力,专注于向量操作和张量加,与GPU形成互补
- LPDDR6存内计算:面向移动终端,在LPDDR6存储控制器中集成矩阵乘加单元,手机端侧LLM推理延迟降低4倍
- UCIe互联扩展:(AI理解应更精确...)Chiplet标准化互联使近存计算模组可与不同制程的计算芯片混搭,灵活构建存算一体化系统
2. ReRAM/PCM忆阻器:存内计算的终极形态
利用电阻状态直接表示和计算权重:
- 模拟存内计算(Analog CIM):ReRAM交叉阵列实现向量矩阵乘法(VMM),算力密度达到100 TOPS/W,比GPU高两个数量级
- 训练与推理的双重挑战:ReRAM目前主要擅长推理(权重固定),训练时器件非理想特性(变异、漂移)仍是研究热点
- 产业化进展:IBS(Mythic)和Syntiant的ReRAM智算芯片已小规模量产,主要用于语音唤醒和低功耗视觉推理场景
3. 光计算芯片:光的并行优势
利用光的干涉和衍射实现矩阵运算:
- 硅光矩阵引擎:Lightmatter的Envise和Lightelligence的PACE平台,通过MZI(Mach-Zehnder干涉仪)网格实现光学矩阵乘法,算力随规模线性增长
- 光子卷积处理器:针对CNN等结构化运算,定制光子卷积核,在图像识别任务上实现比A100高10倍的能效比
- 混合光电系统:实际落地中,光计算作为计算加速协处理器,与传统电子系统通过SerDes互联,而非完全替代电子计算
4. 存储技术演进:LPDDR6与HBM4
新型存储介质本身也在快速演进:
- LPDDR6(2026 Q2量产):速率达14.4 Gbps,带宽比LPDDR5X提升50%,同时Bank Group架构优化了随机访问延迟
- HBM4(2026下半年量产):单堆栈容量32GB(16层×2GB),4堆栈提供128GB容量,带宽突破2TB/s
- 高带宽低延迟的内存池化:LPDDR6搭配Compute Express Link(CXL 3.1),实现跨设备内存共享,支撑智算中心的弹性内存分配
5. 产业格局与生态挑战
- 设计工具生态缺失:ReRAM和光学计算缺乏标准EDA工具,设计流程依赖厂商定制的SDK和参考设计
- 编程模型碎片化:不同存算一体架构有不同的编程抽象(ReRAM用PULP、光学用自定义Compiler),缺乏统一标准
- 制造成本:ReRAM需要后道工序兼容CMOS产线,初期良率不佳导致单位算力成本高于预期
- 应用场景聚焦:2026年存算力市场主要聚焦三大方向——智算中心(HBM4近存)、终端侧AI(LPDDR6存内计算)、IoT/边缘(ReRAM超低功耗推理)
结语
2026年存算一体技术正处于从"论文到产品"的关键拐点。近存计算(XBM4/LPDDR6)将率先大规模部署,模拟存算(ReRAM)在特定场景展现能效优势,光计算则是长期愿景。无论哪种路线,核心目标一致:打破存储墙,让数据在哪里存储就在哪里计算。

发表评论 取消回复