在这篇文章中,我们围绕共封装光学器件(Co-Packaged Optics,CPO)做一个系统性的梳理,重点关注规模化场景——毕竟这已经是处理大规模并行 AI 计算带宽时公认的核心瓶颈。
本文试图把 CPO 的器件物理、制造工艺和电路设计串成一条线,为所有关注这一领域的工程师构建一个相对完整的技术选择与权衡框架。内容来源于我参加 ISSCC 光学短期课程/论坛、DesignCon 以及 ECTC 等会议的经验积累,也融入了与相关领域专家交流后获得的见解。
需要说明的是,本文将重点讨论系统架构师在连接机架内托架的中距离 O 波段 224Gbps PAM4 CPO 场景下通常会考虑的技术方案,并补充必要的背景知识。这类架构以及基于 VCSEL 的短距离光器件变体,都适用于托架和机架这类典型长度范围内的大规模并行 GPU 数据传输。
有一个容易混淆的点值得提前点出:有些材料专门负责产生光,有些材料则专门负责操控光。这两个领域的技术经常被混为一谈——当然,InP 是个例外,它两者都能胜任。
本文仅为教育用途,面向广大读者。文中讨论的方案并非一成不变,而是我认为目前最常见的商业实现方式,并不意在推荐任何特定供应商或拓扑结构。除我介绍的方案外,业界还有许多其他优秀的替代路线。若你是该领域的专家并发现文中错误,欢迎联系我更正。
共封装光学器件的封装架构概述
先从更广泛的光通信背景出发,重新审视一下 CPO。
一般而言,调制光载波主要有两条技术路线:

一、直接调制——通过电信号控制激光源(如 VCSEL 和 DFB)的开关状态,从而实现对光信号的调制。

二、外部调制——激光源保持连续发光,外部调制器在电场作用下改变材料的光学特性(电吸收、电光等),将数据加载到光载波上。
由于成本低、功耗小且结构相对简单,基于强度调制-直接检测(IM-DD)的可插拔收发器几十年来一直是数据中心网络的主力。然而,ASIC 与收发器之间高速电信号必须经过铜线传输,由此带来的信号完整性挑战使得远距离传输越来越难以实现。

根据数据传输距离的差异,光通信主要使用四个光频段:
- 850nm 波段:配合直接调制的 VCSEL,用于短距离传输,比如托盘内部。
- O 波段:用于中距离数据通信和 CPO,覆盖 Scale-up 与 Scale-out 场景。
- C 波段和 L 波段:主要用于电信及相干长途传输(Scale-across)。
由于本文聚焦规模化生产场景下的 CPO,后续将重点讨论 O 波段的外部调制方案。相干光调制本身非常复杂,暂不在本文展开。
CPO:从可插拔到 Scale-up 和 Scale-out

CPO 的核心目标很直接:最大限度地降低功耗,同时尽量缩短信号在铜线上的传输距离,以突破高频传输的物理限制。CPO 尽可能在靠近 ASIC 芯片的位置完成电光(EO)和光电(OE)域转换,让数据高效地以光的形式在芯片之间流动。CPO 引擎还支持更轻量的 SerDes 电路,不再需要像传统方案中那样复杂且高功耗的数字信号处理器(DSP)来驱动和校正长距离铜线上的信号。
CPO 最初是为横向扩展(Scale-out)交换机托架设计的,主要目标是解决基于 DSP 的可插拔收发器造成的前面板空间拥挤问题。CPO 交换机直接连接到网络交换 ASIC,例如博通的 Tomahawk、思科的 Silicon One 或英伟达的 Spectrum-X / Quantum-X。值得注意的是,截至 2026 年 9 月,CPO 在横向扩展环境中尚未大规模部署,但早期且范围有限的部署已经开始出现。

在 2026 年 2 月举行的 DesignCon 大会上,Meta 的 AI 架构师 Halil Cirit 指出,当前 224G/通道的构建模块是 1.6T 光引擎,配备 8 个 224G-PAM4 O 波段 MZM 硅光子芯片。马赫-曾德尔调制器(MZM)属于宽带器件,通常具备良好的热稳定性,拥有成熟的制造生态系统,并且在 51.2T / 102.4T 大型交换机 ASIC 封装中占用面积可接受。总体而言,这类调制器在线性度、低失真和集成便利性方面表现优异。
不过,随着 AI 对海量数据的需求持续膨胀,CPO 正在成为纵向扩展(Scale-up)领域连接大规模并行 GPU 的主要交换方案。把这项技术从横向扩展移植到纵向扩展,会面临数据速率提升和与 xPU 集成等方面的诸多挑战:
- SiPh 的带宽限制(约 56 - 60GHz):这正好卡在 224G PAM4 信号的奈奎斯特频率(56GHz)边缘。
- ASIC 芯片与 HBM、功率模块争夺封装面积。
- 高发热 GPU 的热特性带来的热管理压力。
- 计算/交换托架全生命周期内底层组件的可靠性与可维护性。
因此,要将现有横向扩展方案移植到纵向扩展场景,就必须对标准调制器架构和底层材料进行根本性改造。在光子学层面,环形调制器和电吸收调制器因尺寸紧凑,被普遍视为最有前景的两条路线。
CPO 解决了 AI 数据移动中带宽扩展的关键瓶颈,但仍需结合其他可能限制数据流动的因素综合评估:
- 模型架构与稀疏 MoE 并行性:更新、更大的模型架构以及稀疏混合专家(MoE)并行策略,可能成为横向扩展域中的新瓶颈。
- 网络争用:网络争用会导致计算资源利用率不足。正如 OpenAI 所指出的,高延迟以及单个数据包在横向扩展/纵向扩展交换机之间传输时的网络争用,可能阻塞整个并行计算过程。相比 Rubin 这类时间架构,网络争用对空间/数据流架构的破坏性更大。
- 448Gbps 以上光调制器的电气域瓶颈:即使拥有速度顶尖的光调制器和光电探测器,如果驱动器/TIA 无法足够快速地驱动或检测信号,性能也无从发挥。通常,EIC 驱动器会成为带宽瓶颈。
尽管目前带宽扩展仍是公认的首要瓶颈,但上述三个因素对有效扩展同样重要,这样才能应对未来模型架构的不可预测性,以及可能超出扩展范围的稀疏 MoE 工作负载。
CPO 的主要组成

光子器件通常难以实现单片集成,原因在于硅的光产生能力较差。硅具有间接带隙,电子-空穴复合需要通过声子保持动量守恒,同时以光子的形式释放能量。正因如此,硅激光器一直被视为光子学领域的“圣杯”级器件。
因此,O 波段光通信通常将“光产生”和“光操控”分开处理,因为材料往往只针对其中一项功能进行专门设计。例如 InP 或 GaAs 等 III-V 族半导体只需能量转移即可发光。然而,与 Si 和 Si₃N₄ 相比,这些材料的无源光损耗较大。此外,它们的加工步骤往往与用于制造电子集成电路(EIC)的 CMOS 工艺并不兼容。

在 CPO 技术的早期阶段,各模块是独立芯片,以二维方式集成在同一中介层上,从而尽量缩短芯片之间的互连距离。发送端由以下模块组成:
- EIC 驱动器:将电信号放大后驱动外部调制器或直接调制激光器。
- 激光器:提供特定波长的载波光信号,用于承载调制数据。对于 O 波段,激光器可以是耦合到外部调制器的外部 ELSFP/OSFP 光源,也可以是外部调制的 DFB 激光器(EML)。
- PIC:光子集成电路,包含无源光波导和外部调制器。
- 光纤:通过单模光纤传输光信号。光纤通常经由光纤阵列单元(FAU)与 PIC 连接,FAU 采用 V 型槽阵列配合边缘耦合器或光栅耦合器。
接收端则需要满足以下条件:
- 光电探测器——通常是 PIN 二极管,负责将光信号转换为电信号。
- 跨阻放大器(TIA)——将光电探测器输出的电流放大为电压信号。
封装方案及挑战

在大规模后硅封装中,光学封装是成本和产能方面最大的瓶颈。
目前存在多种 2.5D 和 3D 复杂集成方案,用于管理来自外部激光光源的光信号。上图展示了 12 种不同的 PIC、EIC 与中介层集成技术。其中有几点观察值得注意:
- 方案 c 是近期最常见的实现方式,因为它尽可能缩短了 EIC 和 PIC 之间的电路路径。这有助于最大限度地减少驱动器、TIA 与光调制器/光电探测器之间的寄生电容和电感。
- 铜-铜混合键合技术在高速连接中正变得越来越重要。EIC 驱动器/接收器的带宽通常受限于 μ 凸点固有的寄生电容(数十 fF 量级)。对关键连接采用混合键合,是提升数据吞吐量的重要手段。
- 部分配置将 EIC 和 PIC 放置在共享中介层的两侧。这类配置适用于复杂布线或多芯片桥接场景,但会增加成本、组装步骤和热阻。

对于封装而言,主要挑战集中在良率和精密耦合两个方面。
光学器件对制造和封装组装过程中的任何瑕疵都极其敏感。波导和接口处的锯齿状边缘或不连续性会直接导致光损耗和散射,进而影响激光器的工作特性。封装环节给 CPO 开关的大规模生产带来了几个实际难题:
- 光耦合的制造公差:在批量生产中,将光纤阵列单元(FAU)以纳米级对准公差连接到光子封装上,本身就是一项巨大挑战。
- 可拆卸性:这是提高现场 CPO 单元故障时可维护性的关键特性。目前主要有两种可选方案:其一是采用 V 型槽的直接光纤连接方式,因其对准简单常用于传统光收发器,但需要一根粗大的光纤电缆永久悬挂,占用大量面板空间;其二是光纤边缘耦合配合玻璃耦合器,因其可拆卸性正变得越来越流行,可以在插入前对 CPO 模块进行完整组装和测试。
- 键合良率:对于 448Gbps 以上的高速信号,混合键合几乎是必选项,但其良率本身就有限,因此应只用于必要的连接。遗憾的是,混合键合对良率的要求非常高,即使是最成熟的方案,晶圆对晶圆(W2W)的单次组装良率也只有 98-99%,芯片对晶圆(D2W)约为 90-95%。更具体的良率数据并未公开,且受保密协议约束——在我看来,这也是业界对混合键合技术成熟度存在诸多不切实际乐观情绪的主要原因。
- 热管理:热膨胀系数不匹配会在凸点和封装材料上产生剪切应力/应变。玻璃对热膨胀系数不匹配尤为敏感,因为其热膨胀系数远低于硅,而硅会对凸点施加应力。
- 缺乏标准化:电子领域拥有非常成熟的工具流程和标准体系,但光学领域却远非如此,有时甚至让人感觉像身处“蛮荒西部”。尽管 OIF 等主要组织致力于制定模块外形尺寸等通用标准,但这些标准大多停留在组件层面,尚未延伸到系统层面。
光操控:PIC 调制器材料选项

接下来聚焦光操控的两大主力技术:绝缘体上硅(SOI)和氮化硅(Si₃N₄)。需要留意的是,“SiPh”这个词在语言习惯上常被当作统称,覆盖 CPO 中的所有技术选项,但严格来说,它特指 CPO 中的绝缘体上硅。
先回顾一个基本原理:在标准光波导中,波导材料的折射率必须高于周围氧化物包层,才能满足全内反射条件,将光限制在波导内部。

现代主流硅光电器件依赖两种材料:绝缘体上硅(SOI)和氮化硅(Si₃N₄)。
一、绝缘体上硅(SOI) 采用标准 CMOS 技术在硅芯片上集成光学元件。
硅利用自由载流子等离子体色散效应,通过马赫-曾德尔调制器(MZM)和环形调制器对光进行调制。外延锗硅(GeSi)则支持电吸收调制(EAM)以及用于光电探测器的 PIN 结结构。
SOI 一直是 224G PAM4 面板的首选材料,但对于未来的 CPO 交换机,它面临几个扩展性挑战:
- 带宽限制:SOI 调制器的带宽限制在 56-60GHz,勉强能够处理在 56GHz 奈奎斯特频率下运行的 224G 数据速率。这使得硅并非 448Gbps 高速调制的理想材料。
- 双光子吸收(TPA):从根本上限制了耦合进波导的激光功率上限。
二、氮化硅(Si₃N₄) 是一种绝缘材料,从可见光谱(400nm)到中红外光谱(4000nm)都保持透明。
由于以下原因,Si₃N₄ 非常适合用于无源布线:
- 低损耗光波导能高效处理高功率激光器。
- 5 eV 的巨大带隙完全消除了双光子吸收。
- 低热光系数(比硅低 7.5 倍),使其在靠近高温 GPU 时具备良好的热稳定性。
- 低折射率有助于实现高效的光纤到芯片边缘耦合。
然而,Si₃N₄ 在调制和检测方面先天不足:
- 作为绝缘体,它无法形成 PN 结或自由载流子。
- 由于热光系数较低,热光加热器对光线的有效调谐范围较差。
Si 和 Si₃N₄ 通常以两层的形式共集成,层叠排布,各司其职:
- Si/TFLN/InP 层负责调制。
- Si₃N₄ 层处理低损耗、高功率的布线,并执行 WDM 复用。
- Ge/InP 层负责光电探测。
光子集成电路设计中最具挑战性的问题之一,是实现层与层之间光的垂直传输。光栅耦合器是片外耦合的主要手段;绝热定向耦合器常用于芯片内部层间耦合,其中波导呈“锥形”排列,迫使光沿垂直方向传播到邻近的锥形波导。带有 45° 反射镜的光学 TSV 是目前光传输领域的新兴趋势,多篇 ECTC 2026 论文已发表相关研究成果。不过,光学 TSV 对对准和清洁的要求非常严格。

CPO 调制的新兴方向
接下来重点介绍几种将数据速率扩展到 448Gbps 的新兴路线。其中一种已具备商业可行性,另一种则是业界梦寐以求的“圣杯”。
一、TFLN——薄膜铌酸锂(LiNbO₃),被广泛视为下一代 224G/448G 单通道调制器最有前景的候选材料。
铌酸锂并非新材料,由于其无啁啾特性和高可靠性,一直是电信光纤领域的主力。然而,传统器件体积较大,且需要较高的驱动电压,因此并不直接适用于 CPO 场景。
在 TFLN 中,一层 300-500nm 厚的铌酸锂薄膜被键合在硅衬底上。TFLN 利用泡克尔斯效应(线性电光效应)调制光,其折射率随外加电场线性且几乎瞬时地变化。这是因为与硅的自由载流子耗尽机制不同,TFLN 中没有物理电子或空穴的移动。
TFLN 具备多项非常适合 CPO 的优势:
- 电极间距紧密:电极间距仅 1-2 微米。
- 极低的半波电压($V_\pi L \approx 1.5 - 2.5\ \mathrm{V\cdot cm}$),可由低压驱动器驱动。
- 带宽可达 100-145GHz。
然而,TFLN 在前端晶圆厂中会带来严重的污染风险:
- 锂与 CMOS 晶圆厂不兼容,因为锂会使硅栅极氧化物中毒,设备上的残留痕迹可能损坏价值数十亿美元的 CMOS 晶圆批次。
- 正因如此,像台积电这样的顶级晶圆厂出于充分理由,不会将锂集成到前端 CMOS 生产线中。
- 因此,TFLN 光调制器只能在专门的光子代工厂中制造,与主流 CMOS 生产线物理隔离,最后再与硅芯片组合在一起。
二、钛酸钡(BTO) 被广泛认为是 CPO 的“圣杯”材料。
BTO 是一种铁电钙钛矿氧化物,具有非常高的泡克尔斯张量系数,只需极小的电场变化即可实现巨大的光学相移。BTO 的优势包括:
- 极低的驱动电压($V_\pi L \approx 0.2 - 0.5\ \mathrm{V\cdot cm}$),无需功耗可观的放大器/驱动器即可直接从原始 CMOS 电平驱动。
- 占地面积小。
- 与 CMOS 晶圆厂兼容。
不过,由于以下原因,BTO 技术目前尚不成熟:
- 需要利用分子束外延法生长均匀、无缺陷的 BTO 薄膜。
- 受晶界效应影响,波导光损耗较高(2-5dB/cm)。
- BTO 在居里温度 120℃ 之前通常呈铁电性,需要进行电极化处理才能最大化其电光效应。
简而言之,BTO 潜力巨大,有望在紧凑的外形尺寸下实现低驱动电压和超过 100GHz 的工作频率。但别忘了,它同样需要性能匹配的 EIC 来足够快速地驱动和接收信号。
此外,还有其他几种潜在材料正在积极研究中,例如有机电光(OEO)聚合物、等离子体调制器和混合等离子体调制器等。
需要再次强调的是,本文仅涵盖了 CPO 技术版图的一部分,还有大量相关科普内容值得继续探索和分享。
免责声明:本文由作者原创。文章内容系作者个人观点,转载仅为传递不同观点,不代表本平台立场。如有异议,欢迎联系指正。