AI集群的光互连革命:硅光子学共封装光学(CPO)架构深度工程实践

当AI集群规模从千卡迈向万卡,一个关键瓶颈正在悄然改写数据中心的基本架构——铜互连的物理极限已经提前到来。NVIDIA GB200 NVL72 rack通过NVLink 5.0实现了1800 GB/s的rack级带宽,但rack之间的互连呢?传统的可插拔光模块(Pluggable Optics)每端口功耗已高达15–25W,在51.2T交换机上意味着光模块功耗几乎与交换芯片本身持平。硅光子学共封装光学(Co-packaged Optics, CPO)技术的成熟,正在从根本上重新定义AI超算的互连拓扑和能效比。本文从物理层到系统架构,深度拆解CPO的工程实现、关键技术权衡以及生产部署的真实挑战。

一、可插拔光模块的能耗困境

理解CPO的价值,必须先看清传统可插拔方案的物理极限。一个400G DR4光模块的内部架构大致如下:交换芯片通过PCB走线和连接器连接到模块内的DSP,DSP再驱动激光器调制输出光信号。这条信号链上,每个环节都在消耗能量。

以一个典型51.2T CPO交换机为例:16个3.2T端口(1024×50G PAM4或512×100G PAM4),若使用可插拔FR4模块(8×50G),每端口功耗约12–15W,总光模块功耗达到12–19.2kW。而采用CPO架构后,去掉DSP重定时器和连接器,每端口功耗降至5–7W(含激光器),整体节省40–60%的互连功耗。对于万卡AI集群而言,这意味着每年节省数百万美元的电力成本,以及散热系统的一次性资本支出缩减。

更深层的差异在于:可插拔模块受限于分立元件(激光器、调制器、波导)和PCB铜走线损耗,在单通道100G PAM4以上速率时,信号完整性问题急剧恶化。CPO将这些光学元件通过先进封装技术直接集成在交换芯片的基板上,铜互连长度从厘米级缩短到毫米级,这在物理层面上将互连功耗降低了一个数量级。

二、CPO的物理层架构——光在哪里,如何耦合

CPO的核心思想是"光进铜退"——将光子引擎(Photonic Engine)与交换芯片共封装在同一基板上。但这简单的描述下隐藏着三个核心工程问题:激光器在哪?光如何耦合进芯片?光在芯片上如何分配?

2.1 外置激光器(ELSFP/Optical Power Source)

目前业界公认的方案是外置激光器(External Laser Source)。原因很直接:硅基调制器(基于硅折射率热光/电光效应)已经成熟可靠,但硅是间接带隙半导体,发光效率极低。III-V族材料(InP/GaAs)是理想的光源,但与CMOS工艺的兼容性和良率问题尚未完全解决。

目前主流方案采用Edge Coupling(边缘耦合)或Surface Grating Coupler(光栅耦合)将外部激光通过光纤或光纤阵列(Fiber Array)耦合进硅光子芯片。边缘耦合损耗约1–2dB/面,带宽密度受限于波导间距(通常≥250μm);光栅耦合允许垂直入射,支持二维耦合阵列,但耦合损耗在3–5dB/面,且对波长敏感。

以NVIDIA的CPO交换机方案为例,外部激光源通过光纤输入到光子引擎上。每个光子引擎集成微环调制器(Ring Modulator)阵列,负责将电信号调制到指定波长的光载波上。这种架构的优势在于:激光器作为独立可维护单元可现场更换,极大的提高了系统的MTBF(平均无故障时间)。

2.2 波分复用(WDM)——一根光纤中的8路数据

在CPO中,单根光纤通常携带8路甚至16路不同波长的光信号,每路波长承载一个独立的调制通道。这就是密集波分复用(DWDM)在chip-to-chip层面的应用。其核心元件是微环谐振器(Microring Resonator),一个直径约20–50μm的环形波导具有尖锐的波长选择性,只"允许"特定谐振波长的光通过。

微环谐振器的波长选择特性:
传输率 T(λ) = (Δλ² + (γ/2)²) / ((λ-λ₀)² + (γ/2)²)
其中 λ₀ 是谐振波长,γ 是谐振峰半宽(FWHM)

微环的谐振波长通过热调谐(Thermal Tuning)控制,典型调谐效率约0.1–0.2 nm/mW,温度每升高1°C谐振波长漂移约0.08–0.1 nm。这意味着每个微环需要一个独立的热控制环路(通常PID),在16路WDM系统中就是16个并行调谐环路,每个环路需要持续监控传输功率谱并锁定谐振峰。这个控制过程需要us级响度的反馈机制。

热调谐本身存在串扰难题:一个微环的加热器产生的热场会扩散到相邻微环,导致光谱重叠(Channel Cross-talk)。这要求微环间距的设计需要满足热串扰<1%的严格要求,当前主流方案通过深沟槽隔离(Deep Trench Isolation)和数字前馈补偿表(Look-up Table for thermal crosstalk pre-compensation)将相邻通道抑制比(Adjacent Channel Suppression Ratio)控制在30dB以上。

三、数字与模拟的协同——CPO中的SerDes架构重构

CPO对传统交换机架构的根本冲击不在光层,而在电气层——它消灭了传统DSP重定时器的必要性。

在可插拔模块中,SerDes(串化/解串器)在交换芯片端发送信号后,经过PCB走线和连接器到达模块内的CDR/DSP进行时钟恢复和信号再生。CPO将调制器直接驱动连接到交换芯片的模拟输出端,信号路径由"SerDes → 长PCB走线 → 连接器 → 短PCB走线 → DSP"简化为"短走线 → 硅光子调制器"。

这带来一项根本性的设计变更:传统Datacenter SerDes(如56G/112G PAM4)的设计余量(Link Budget)必须重新分配。PCB走线上的信号衰减和抖动(ISI)被大幅压缩,余量可以释放给更激进的信道设计。实际结果是CPO可以将信号摆幅从传统的800mV PAM4降低到200–300mV级别,功耗降低60%以上。

参数 可插拔400G FR4 CPO (×8 WDM)
信号路径长度 ~8–12 cm ~1–3 cm
SerDes摆幅 800mV PAM4 250mV PAM4
重定时DSP 需要 不需要
每端口功耗 12–15W 5–7W
信号路径损耗 20–30dB 8–12dB

这种架构变革对交换芯片的SerDes IP设计提出了严格要求:驱动输出必须直接与调制器的电容负载匹配(典型微环容性负载约5–10fF/mm),这意味着需要片上阻抗控制和预加重(Pre-emphasis)来补偿高频损耗。当前最先进方案如Groge和Broadcom采用源极串联终端(Source-Series Termination),并将预加重FIR集成在Tx模拟前端。

四、CPO的封装——2.5D集成的工程现实

CPO的封装是通过2.5D中介层(Interposer)将硅光子芯片和电子芯片(EIC)并排集成在同一基板上。这个看似简单的版图设计蕴含着极其复杂的封装工程挑战。

4.1 热膨胀系数(CTE)失配

硅的CTE约为2.6 ppm/°C,而III-V族激光器材料的CTE在4–6 ppm/°C范围。在回流焊(Reflow)过程达260°C的热循环中,CTE失配会导致键合界面的剪切应力。这对需要亚微米精度对准的边缘耦合光纤阵列意味着:必须使用低模量底部填充胶(Underfill)或者将激光器子底座(Submount)通过机械隔离结构与主芯片分离,使其具备热膨胀自由度。

当前主流方案如Intel的CPO激光器集成采用铟(In)焊料或金锡(AuSn)合金倒装焊,并配合环氧树脂Underfill填充光纤槽以提供应力量化保护。在1000次热循环(-55°C/125°C)测试后,耦合效率退化<0.5dB被认为是工业级可靠性门槛。

4.2 2.5D集成的版图划分

传统交换机封装中,交换ASIC是一个巨大的单片芯片(通常800mm²以上)。CPO则把部分I/O功能拆解到硅光子引擎上。版图设计需要平衡的关键维度包括:光引擎的数量(更多引擎=更细粒度=更好良率但更多互连)、走线长度(光子引擎到基板边缘的光纤阵列引出处要最短)、热源分布(数字开关电路的热量需要与光电子器件热隔离)。

典型的CPO交换机布局:BASE板上包含一个大型交换ASIC和4–8个Silicon Photonic Tile(每个Tile集成WDM/调制/波导分配),整个组装通过EMIB或CoWoS技术放在同一interposer上。光纤阵列(FFA)通过Z-block或MT连接器从Tile边缘引出面板。

五、CPO的可靠性——工程上的最大障碍

如果说CPO在技术上已经是ready的,那么生产部署的最大障碍在于可维护性(Serviceability)。传统可插拔模块支持热插拔(Hot-swap),任何模块故障可以在几分钟内替换。CPO将激光器、调制器、波导全部封装在交换机内部,一个元件故障等于整台交换机下线。

业界目前的解决思路是冗余激光器池(Redundant Laser Pool):

  1. 配置N+M冗余激光器(如16+2配置),每个激光器通过光纤开关连接到所有光引擎;
  2. 激光器配备在线光功率监测(Optical Power Monitor),内置光电二极管和TIA实现us级故障检测;
  3. 当检测到某激光器失效,系统通过光开关矩阵(通常基于MEMS或热光开关)在微秒级别将冗余激光器切入;
  4. 路由引擎在切换过程中保持无丢包的链路层热切换。

Broadcom的测试结果表明:配合冗余激光器方案和在线损伤预决策(Proactive Fault Monitoring),CPO交换机支持99.999%可用性(年停机时间<5.3分钟),接近传统可插拔方案的高可用性水平。

另一个可靠性层面的关注点在于光纤到芯片耦合处的长期稳定性。回流焊和湿热环境会导致环氧树脂退化,产生微弯损耗增加。当前工业级(NEBS Level 3)标准要求光耦合效率退化<1dB在20年生命周期,CPO光纤耦合结构需要通过双85测试(85°C/85%相对湿度,1000小时)后耦合效率退化<0.5dB。

六、从CPO到OIO——光学I/O的终极愿景

CPO只是光互连革命的起点。更激进的Optical I/O(OIO)方案正在紧锣密鼓地研发中,它的目标是彻底消除芯片到芯片(Chip-to-Chip)的铜互连。

在OIO架构中,每个计算芯片(GPU/CPU)集成硅光子I/O单元,通过光纤直接连接到其他芯片或者交换芯片。这种架构的核心优势在于:通信距离不影响功耗(铜互连的功耗随距离线性增长,光互连的激光器一旦开启功耗恒定),这意味着不管GPU是在同一个rack还是相隔三个rack,每bit通信能耗都维持恒定。

对于万卡AI集群来说,OIO的意义是根本性的重构——数据中心从"拓扑感知计算"(Topology-Aware Placement)中解放出来,不再需要精细地规划GPU的物理位置以最小化通信距离。计算任务可以被自由调度到任何可用算力,由光学互连网络的均匀低延迟特性保证通信效率。

当前OIO尚处于实验室阶段(Ayar Labs等初创公司的工程样片已展示TeraPHY I/O tile良率),预计2028–2030年开始生产部署。但从CPO到OIO,"交换芯片封光学"这一步已经为未来的"计算芯片封装学"奠定了工艺基础和产业生态。

七、结论:光互连决定AI集群的物理上限

回顾AI超算架构的演进历程,每一次物理层的范式转移都会重新定义系统架构:从PCIe总线到NVLink,从InfiniBand到NVSwitch,现在轮到了铜互连到光互连的跃迁。CPO通过在交换芯片内部将电子信号直接转换为光信号,一举解决了功耗、带宽密度和维护性三大传统光互连的固有矛盾。

它不会完全取代可插拔光学——在数据中心网络的传统前端(Leaf-Spine)层,可插拔模块的灵活性仍然不可替代。但在AI集群的后端网络(GPU Fabric)和rack内部,CPO将成为51.2T以上速率交换机的标配方案。

更深远的意义在于:CPO是AI基础设施第一次在封装层面进行根本性创新。它不再仅仅依赖半导体制程的进步(摩尔定律),而是通过电子学与光子学的深度融合,在互连物理层实现数量级的突破。当台积电的CoWoS产能、硅光子代工厂(如GlobalFoundries Fotonix)的工艺良率、以及高速互连设计经验三者同步成熟时,AI集群的光互连革命将在2026–2028年间全面展开。谁解决了CPO的封装工程和可靠性门槛,谁就掌握了下一代AI超算集群的物理基础设施主导权。

点赞(0) 打赏

评论列表 共有 0 条评论

暂无评论
立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部