找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖
Claude、GPT 海外模型 API 接入云原生前端项目实战教程50G互联网架构师面试指南
大模型全栈开发课程企业级DevOps全栈实践零基础产品经理就业课程

6088

积分

0

好友

771

主题
发表于 前天 00:36 | 查看: 2| 回复: 0

三代 PCIe 规范正在重写高速互连的规则:单通道速率从 64 GT/s 一路推到 256 GT/s。

PCIe 插槽与高速信号走线示意图

如果过去十年的计算有一场静悄悄的变革,它发生在终端用户看不见的连接器和信号走线里。每块 AI 加速器、NVMe SSD、GPU 和现代网卡,都依赖同一根少被提起的骨干:PCI Express。就在业界刚开始消化 PCIe Gen 5 的承诺时,PCI-SIG 已经把三代新规范推到台前:Gen 6、Gen 7,以及全新的 Gen 8。后者已于 2026 年 4 月 23 日形成 Revision 8.0、Draft 0.5 规范。

这三代加在一起,构成 PCIe 历史上最激进的一次带宽爬升。只需三步,单通道原始数据速率翻了四倍,x16 级双向带宽越过每秒 1 TB,物理层把铜互连推到 64 GHz 奈奎斯特频率。直到不久前,这一频段还被认为将迫使业界转向光学互连。

下文按物理层、数据链路层和事务层,梳理 Gen 6、Gen 7 与 Gen 8 之间到底改了什么,以及这些变化对下一波人工智能、高性能计算和数据中心基础设施意味着什么。

为何三代紧挨着来

原因很简单:人工智能负载把旧路线图打乱了。

训练大模型、向 GPU 输送数据、扩展 CXL 这类内存互联,都在用原来“每 3 到 4 年一代”的 PCIe 节奏跟不上的方式冲击互连。PCI-SIG 的回应是压缩时间表——Gen 6 已经定稿,Gen 7 在各版草案中推进,Gen 8 已发布 Draft 0.5。每一代都把单通道带宽翻倍,同时保住工程师最看重的几件事:向后兼容、低延迟,以及仍可接受的功耗。

关键指标对比:Gen 6 / Gen 7 / Gen 8

项目 PCIe Gen 6 PCIe Gen 7 PCIe Gen 8(Draft 0.5)
单通道原始数据速率 64 GT/s 128 GT/s 256 GT/s
单通道奈奎斯特频率 16 GHz 32 GHz 64 GHz
单位间隔(UI) 31.25 ps 15.625 ps 7.8125 ps
x16 级双向带宽 约 256 GB/s 约 512 GB/s 约 1024 GB/s
信号调制 PAM4 PAM4 PAM4
Flit / 编码 Flit 模式 + FEC + 64 位 CRC Flit 模式 + FEC + 64 位 CRC 不变——同一套 Flit 布局、FEC 和 64 位 CRC
首次(原始)误码率 10^-6 10^-6 10^-6(轻量级 FEC + 64 位 CRC + 链路级重试)
最大焊盘到焊盘通道损耗 16 GHz 下 -32 dB 32 GHz 下 -36 dB 64 GHz 下 -36 dB
发送均衡 4 抽头(C−2、C−1、C0、C+1) 4 抽头 4 抽头——与 Gen 6/7 相同
接收均衡 CTLE + DFE CTLE + DFE 参考 CTLE + 基于 ADC 的 FFE(48 后光标、8 预光标)+ 1 抽头 DFE
重定时器 可选 可选 可选——无重定时器距离与 Gen 4–7 相同
低功耗模式 L0p L0p LTSSM 不变(L0p、L1、L2);Draft 0.5 无新低功耗特性
新特性 Flit 模式 (Gen 7 增量) 链路分区(x16 作为两条 256 GT/s 的 x8 链路)

注:关于 256 GT/s 下的 x16 带宽,规范是靠把一个 x16 端口分区成两条独立的 x8 链路来给出满 x16 级带宽,而不是跑单条 x16 链路。单条 x16 链路在 256 GT/s 下运行,实际上正被认真考虑从规范中整项拿掉。

从表里可以直接读出三点。

其一,PAM4 信号会继续用下去。PCIe 6 引入了它,Gen 7 和 Gen 8 没有放弃。Gen 8 在 64 GHz 奈奎斯特频率、7.8125 ps 单位间隔上跑 PAM4,靠的是同一套均衡和 FEC 工具,而不是新的调制方式。

其二,延续是主调:Gen 8 更像精修,而不是推倒重来。Flit 布局、FEC 与 CRC 计算、重传机制、环回序列、4 抽头发送均衡,以及参考时钟要求,都明确与 Gen 7 保持一致。首次通过误码率仍是 10^-6,由同样的轻量级 FEC、64 位 CRC 和链路级重试来纠正。通道预算也按住了:在新的 64 GHz 奈奎斯特频率上仍是 -36 dB,无重定时器的最大传输距离有意与 Gen 4 到 Gen 7 保持相同。草案里没有光学或硅光要求,也没有机器学习辅助均衡。撑住 256 GT/s 的,是一套常规但相当激进的基于 ADC 的接收机,以及更紧的抖动预算。

其三,真正新的结构思路只有链路分区(Link Partitioning)。与其去做一个在 256 GT/s 下宽得不切实际的 x16 控制器,两个链路伙伴可以协商,把一个 x16 端口拆成两条独立的 x8 链路。这是 Gen 8 最显眼的变化,规范也公开权衡:是否让它成为最高速率下拿到满带宽的唯一路径。

物理层在变什么

Gen 8 草案对 Gen 7 物理层的复用,超出一般预期。不过它加了一套实质性的新机制,以及面向 256 GT/s 的新电气指标。

电气层面的要点很直白。Gen 8 以 PAM4 跑 256 GT/s,奈奎斯特频率 64 GHz,单位间隔 7.8125 ps。突发纠错前的最大首次通过误码率仍是 10^-6,与 Gen 6、Gen 7 相同,同样由轻量级 FEC、64 位 CRC 和链路级重试来清理。

焊盘到焊盘的最大通道损耗为 64 GHz 下 -36 dB,与 Gen 7 在 32 GHz 上给出的预算数值相同;无重定时器的最大距离明确与 Gen 4 到 Gen 7 保持一致。发送端和参考时钟的抖动限制确实收紧了:主要发送抖动项大约是 Gen 7 的一半。

发送端仍用熟悉的 4 抽头均衡器(两个预光标系数 C−2、C−1,一个主光标 C0,一个后光标 C+1),与 Gen 6/7 相同。接收侧的参考设计是基于 ADC 的架构:参考 CTLE,直流增益范围 -15 dB 到 0 dB;前馈均衡器带 48 个后光标抽头和 8 个预光标抽头;再加单抽头 DFE,并约束 h1/h0 < 0.5,以限制 DFE 突发误码。

通道要在 256 GT/s 下合规,规范要求顶部眼图高度至少 10 mV、顶部眼图宽度至少 0.10 UI(0.78125 ps),对应误码率 10^-6。

真正新的结构是链路分区,而且它直接出现在链路训练握手里。TS1 有序集的 EFM_CNTL1 符号新增了 2 比特的链路分区控制(LPC)字段:00b 表示端口打算运行在不超过 128 GT/s,不需要链路分区;01b 表示端口打算运行在不低于 256 GT/s,且具备链路分区能力;10b 表示端口打算运行在不低于 256 GT/s,且正在启用链路分区;11b 为保留。

两个链路伙伴在 Configuration.Linkwidth.Start 阶段交换 LPC 值(此时 Flit_Mode_Requirements_Met 已置位);若需要分区,则在转入 Configuration.Linkwidth.Accept 时完成。重定时器必须在两个伪端口上观察 LPC 字段,并跟随实际发生的分区,但不影响协商结果。分区后的链路共用边带,不复制边带。这一机制与 CEM、M.2 等外形规范里的链路细分方案彼此独立。

数据链路层有意按兵不动

PCIe Gen 6 是把数据链路层按 Flit 模式彻底改架构的一代:固定长度 Flit,带 FEC 和 64 位 CRC,取代此前各代的可变长数据包流。Gen 7 则细化了事务如何打进这些 Flit。

Gen 8 的数据链路故事,按设计就是一场“无事发生”。Flit 布局、FEC 与 CRC 计算、把 TLP 字节打进 Flit 的规则(每个半 Flit 的 TLP),以及重传机制,都明确与 Gen 7 相同。环回序列也不变。

这次冻结是有意的,它指向真正的工程难题。要打满一条工作在 256 GT/s 的 x16 链路,需要每方向 256 字节宽、工作频率 2 GHz 的数据通路。控制器若面对 64 字节缓存行或 32 字节 DRAM 访问,就得在单个时钟周期内完成多次同时访问,同时还要遵守 PCIe 的排序规则。把上层机制按住,PCI-SIG 就把 Gen 8 的工程预算全部压到这个问题上,而这正是链路分区要缓解的。

事务层与配置空间

Gen 8 的配置空间改动,沿用前几代的同一套路:新速率配一套自己的扩展能力,再把枚举数据速率的字段整体更新一遍。

对 Gen 8 来说,就是新增物理层 256.0 GT/s 扩展能力,与前几代按速率划分的能力结构相对应,并把所有引用数据速率的配置字段更新到可以通告和选择 256 GT/s。物理层相关的数据速率标识及其他引用已按 256 GT/s 更新,草案还增加了 256 GT/s 合规码型和 256 GT/s EIEOS(电气空闲退出有序集),用于链路拉起和测试。

对固件和枚举代码,实际含义还是那句老话:按 Gen 5 时代速率向量写的软件,必须先认识新的 256 GT/s 数据速率和新的能力结构,才能正确枚举 Gen 8 设备。

Gen 8 说明了什么

因为还只是 Draft 0.5,Gen 8 仍有未决问题。轮廓已经清楚,而且和有时听到的“光学转型故事”并不一样。

主线是延续。Flit 格式、FEC、64 位 CRC、重传、均衡方案、环回序列和参考时钟都从 Gen 7 带过来。通道仍是电的:同样是 -36 dB 损耗预算(现在在 64 GHz 上量),无重定时器的最大距离也与 Gen 4 到 Gen 7 相同。草案没有光学或硅光硬性要求,也没有机器学习辅助均衡。主要工作由基于 ADC 的常规接收机完成(参考 CTLE 后面是 48+8 抽头 FFE 和单抽头 DFE),以及收紧的抖动预算。

真正的新想法是结构上的,而不是物理上的。Gen 8 给 256 GT/s 下 256 字节数据通路供数的答案,是链路分区。与其做一颗宽得吓人的单一 x16 控制器,两个链路伙伴协商把 x16 端口拆成两条独立的 x8,各自跑 256 GT/s。草案公开提出,干脆取消对单条 x16 链路在 256 GT/s 下的支持;果真如此,双 x8 分区就会成为最高速率下拿到满 x16 级带宽的唯一办法。具体来说,规范定义了两项能力:能力 A(256 GT/s 下满宽 x16)是可选的,并标注“正被认真考虑取消”;能力 B(拆成两条 x8)对任何支持 256 GT/s 的设备都是强制的。

不变的是向后兼容。支持 256 GT/s 就意味着支持所有更低速率;x16 能力的设备,只要对端最高只到 128 GT/s 或以下,仍会训练成单条 x16 链路。Gen 8 插槽仍然可以插入 Gen 3 卡。这份承诺,比什么都更能把 PCIe 留在产业中心。

从 PCIe Gen 6 到 Gen 8 的这一跳,与其说是推倒重来,不如说是把同一组螺丝拧得更紧:还是 PAM4,还是 Flit/FEC/CRC,还是同一套均衡和参考时钟,推到 256 GT/s 和 64 GHz 奈奎斯特频率。真正新的是结构上的一步——链路分区——让很宽的链路在最高速率下不必配一颗宽得不切实际的控制器;以及单条 x16 链路在 256 GT/s 下还能否活下来,目前仍是公开问题。

系统架构师来说,近期要做的并不是去准备奇特的光学方案,而是为分区链路、基于 ADC 的接收机,以及 64 GHz 所要求的更紧抖动和通道预算做规划。对软件和固件团队来说,新的物理层 256.0 GT/s 扩展能力和更新后的数据速率字段,意味着按 Gen 5 写的 PCIe 枚举代码需要认真改一遍。

PCIe 已经不只是把服务器内部部件连起来的总线。它正在变成人工智能时代的结构。Gen 6、Gen 7 和 Gen 8,就是把这张结构铺起来的三步。

原文: https://www.electronicdesign.com/technologies/industrial/article/55399189/logic-fruit-technologies-the-bandwidth-arms-race-inside-the-leap-from-pcie-gen-6-to-gen-8




上一篇:TOM集团服务器遭网络攻击 港交所披露数据加密事件
下一篇:LibreOffice 26.8 正式发布:零AI零云端,Writer段落排版大升级
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-21 01:55 , Processed in 0.624176 second(s), 40 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表