引言:计算架构遭遇"存储墙",破局从存算一体开始

传统冯·诺依曼架构中,数据在处理器和存储器之间的搬运消耗了60-90%的能效。2026年,从LPDDR6/HBM4近存计算到ReRAM忆阻器存内计算,再到光计算芯片,多种存算一体技术路线正从实验室走向产业化。

1. 近存计算(Processing-in-Memory/P-NN):从概念到产品

将计算单元嵌入DRAM或HBM存储芯片中,大幅减少数据搬运:

  • HBM4近存AI加速器:SK海力士和三星在HBM4中集成Tiny NPU核心,每个堆栈提供4 TOPS算力,专注于向量操作和张量加,与GPU形成互补
  • LPDDR6存内计算:面向移动终端,在LPDDR6存储控制器中集成矩阵乘加单元,手机端侧LLM推理延迟降低4倍
  • UCIe互联扩展:(AI理解应更精确...)Chiplet标准化互联使近存计算模组可与不同制程的计算芯片混搭,灵活构建存算一体化系统

2. ReRAM/PCM忆阻器:存内计算的终极形态

利用电阻状态直接表示和计算权重:

  • 模拟存内计算(Analog CIM):ReRAM交叉阵列实现向量矩阵乘法(VMM),算力密度达到100 TOPS/W,比GPU高两个数量级
  • 训练与推理的双重挑战:ReRAM目前主要擅长推理(权重固定),训练时器件非理想特性(变异、漂移)仍是研究热点
  • 产业化进展:IBS(Mythic)和Syntiant的ReRAM智算芯片已小规模量产,主要用于语音唤醒和低功耗视觉推理场景

3. 光计算芯片:光的并行优势

利用光的干涉和衍射实现矩阵运算:

  • 硅光矩阵引擎:Lightmatter的Envise和Lightelligence的PACE平台,通过MZI(Mach-Zehnder干涉仪)网格实现光学矩阵乘法,算力随规模线性增长
  • 光子卷积处理器:针对CNN等结构化运算,定制光子卷积核,在图像识别任务上实现比A100高10倍的能效比
  • 混合光电系统:实际落地中,光计算作为计算加速协处理器,与传统电子系统通过SerDes互联,而非完全替代电子计算

4. 存储技术演进:LPDDR6与HBM4

新型存储介质本身也在快速演进:

  • LPDDR6(2026 Q2量产):速率达14.4 Gbps,带宽比LPDDR5X提升50%,同时Bank Group架构优化了随机访问延迟
  • HBM4(2026下半年量产):单堆栈容量32GB(16层×2GB),4堆栈提供128GB容量,带宽突破2TB/s
  • 高带宽低延迟的内存池化:LPDDR6搭配Compute Express Link(CXL 3.1),实现跨设备内存共享,支撑智算中心的弹性内存分配

5. 产业格局与生态挑战

  1. 设计工具生态缺失:ReRAM和光学计算缺乏标准EDA工具,设计流程依赖厂商定制的SDK和参考设计
  2. 编程模型碎片化:不同存算一体架构有不同的编程抽象(ReRAM用PULP、光学用自定义Compiler),缺乏统一标准
  3. 制造成本:ReRAM需要后道工序兼容CMOS产线,初期良率不佳导致单位算力成本高于预期
  4. 应用场景聚焦:2026年存算力市场主要聚焦三大方向——智算中心(HBM4近存)、终端侧AI(LPDDR6存内计算)、IoT/边缘(ReRAM超低功耗推理)

结语

2026年存算一体技术正处于从"论文到产品"的关键拐点。近存计算(XBM4/LPDDR6)将率先大规模部署,模拟存算(ReRAM)在特定场景展现能效优势,光计算则是长期愿景。无论哪种路线,核心目标一致:打破存储墙,让数据在哪里存储就在哪里计算。

点赞(0) 打赏

评论列表 共有 0 条评论

暂无评论
立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部