适用于 100G、200G、400G 和 800G 基础设施的 InfiniBand 和以太网互连产品。
互连产品已成为扩展 AI 集群的关键支柱。随着 AI 模型呈指数级增长,AI 工厂在带宽、距离、可靠性和能效方面面临物理限制。
NVIDIA LinkX™ 光收发器、线缆和 CPO 是 NVIDIA 全栈 AI 解决方案不可或缺的组成部分,可为各种应用程序、传输距离和速率的 AI 工厂提供所需的性能、可靠性和扩展性。
LinkX 产品为 NVIDIA Quantum InfiniBand 和 NVIDIA Spectrum™-X 以太网架构提供端到端支持,适用于交换机到交换机、服务器到交换机以及存储系统。
所有 LinkX 产品均在 NVIDIA 系统中经过全面设计、认证、测试和支持,以更大限度地缩短生成首个 Token 的时间,并更大限度地提升集群性能和正常运行时间。
LinkX 借助专为支持数百万个 GPU 而设计的光模块交付、产能和供应链弹性来实现 AI 工厂规模网络。
NVIDIA 可插拔光模块与光电一体封装技术降低了网络功耗,CPO 的能效是通用收发器的 5 倍。
LinkX 光模块减少或消除了数字信号处理器 (DSP) 重定时,从而提供低且一致的低延迟,显著提高了 AI 网络的响应速度。
NVIDIA 光模块具有更高的可靠性、更少的故障点,从而延长集群正常运行时间。
LinkX 已在 NVIDIA 网络系统中经过认证和测试,可为客户提供适用于 AI 基础设施的端到端性能和支持。
LinkX 简化了安装与维护,支持跨系统互操作性,并致力于更快的生成首个 Token。
NVIDIA LinkX 提供全面的端到端互连产品,更大限度地发挥 NVIDIA Quantum InfiniBand 和 Spectrum-X 以太网的网络性能。
| 特性 | CPO | 1.6T/800G OSFP | 800G/400G OSFP | 400G QSFP-DD |
| 调制方式 | 200G PAM4 | 200G PAM4 | 100G PAM4 | 50G PAM4 |
| 协议 | InfiniBand 和以太网 | InfiniBand 和以太网 | InfiniBand 和以太网 | 仅以太网 |
| 最大 DAC 传输距离 | n/a | n/a | 3 米 | 2.5 米 |
| 最大 LACC 传输距离 | n/a | 2.5 米 | 5 米 | 5 米 |
| 最大光模块传输距离 | 500 米 (DR)/2 公里 (FR) | 500 米 (DR)/2 公里 (FR) | 500 米 (DR)/2 公里 (FR) | 500 米 (DR)/2 公里 (FR) |
| 交换机连接器 | MPO12/MMC16 | OSFP | OSFP | QSFP-DD |
| 网卡 (NIC) 连接器 | OSFP/QSFP112 | OSFP/QSFP112 | OSFP/QSFP112 | QSFP56/QSFP28 |
| 兼容的交换机 | Q3450-LD、SN6800、SN6810 | Q3400/3200、SN6600 | QM9700、SN5610 | SN5400、SN4700 |
| 兼容的网卡 (NIC) | NVIDIA ConnectX™-9 | ConnectX-7/8 | ConnectX-7 | ConnectX-6/7 |
NVIDIA LinkX 是一个由无源和有源铜缆、光收发器、无源跳线线缆及光电一体封装 (CPO) 组成的产品线,旨在为高性能 AI 工厂网络提供支持。作为 NVIDIA 全栈 AI 解决方案的重要组成部分,LinkX 产品可提供扩展现代 AI 集群所需的带宽、可靠性和能效。
LinkX 产品端到端支持 NVIDIA Quantum InfiniBand 和 Spectrum-X 以太网架构,可与各种 AI 工厂网络配置兼容。
LinkX 支持交换机到交换机、服务器到交换机以及存储系统之间的连接,可为整个 AI 工厂基础设施提供全面的连接。
随着 AI 模型规模和复杂性的不断增长,互连产品成为 AI 集群的关键支柱。带宽、距离、可靠性和能效方面的限制都可能成为 AI 性能的瓶颈。LinkX 专为应对这些挑战而设计,可确保 AI 工厂始终以满负荷运行。
LinkX 产品涵盖各种应用,传输距离及最高可达 1.6Tb/s 的速率。对于 XDR 双端口 800G 和单端口 1.6T 以太网部署,铜缆选项 (LACC/AEC) 可达 2.5 - 3 米,而单模收发器可达 500 米 (DR4) 和 2 公里 (FR4)。
光电一体封装 (CPO) 将光器件直接集成到网络芯片中,以降低功耗并提高高速传输时的信号完整性。LinkX 提供 CPO 解决方案,其中硅光调制器直接安装在交换机 IC 上,而不是安装在单独的可插拔收发器中。
XDR (eXtreme Data Rate) 是 NVIDIA 的 800G InfiniBand 技术。基于 200G PAM4 (四级脉冲幅度调制) 信令,以约 100 GHz 的时钟频率,每个时钟脉冲编码 2 位数据,与 NDR 的 100G PAM4 相比,每通道吞吐量翻倍。
DR4 (数据中心级) 利用 MPO-12/APC 连接器,在 8 根光纤上采用 4 个并行通道实现了高达 500 米的传输距离。FR4 (远距离) 利用朗讯 (Lucent) 连接器,将不同激光波长的 4 个通道多路复用到一对光纤中,实现高达 2 公里的传输距离。这两种类型不可互换。DR4 是并行通道,而 FR4 是多路复用通道,因此它们无法直接连接。
IHS (集成散热片) 收发器在插头中内置散热鳍片,专用于 NVIDIA Quantum 交换机 (Q3400、Q3200 和 Spectrum SN56x0 以太网交换机)。RHS (附加散热片) 收发器采用平顶设计,用于 ConnectX-8 网卡和计算系统。由于散热需求不同,这两种类型的线缆不能互换使用。
两者都是有源铜缆技术,但用途不同。AEC 在两端使用数字信号处理器 (DSP) 来恢复和重定时信号,传输距离可达 3 米,主要用于交换机之间的连接,每端功耗约为 27 瓦。LACC 使用低功耗线性放大器 IC (约 4 瓦) 将信号传输距离扩展至 2.5 米,用于交换机到网卡 (例如 ConnectX-8) 的连接。
在 XDR 的 200G PAM4 信号速率下,无源 DAC 线缆的最大可用长度不足 0.7 米,这在大多数部署中都太短,不实用。因此,所有 NVIDIA XDR 铜缆均为有源 (LACC 或 AEC),有效传输距离可达 2.5 - 3 米。
200G PAM4 XDR 信号的时钟频率约为 100GHz,而 NDR 的 100G PAM4 时钟频率约为 50GHz。更快的信号转换速度会导致线缆更像天线,将信号能量辐射出去。这种信号衰减限制了铜缆的有效传输距离,因此 XDR LACC 比 NDR ACC 传输距离短。
XDR 和 CPO 部署使用与 NDR/400G 相同的 MPO-12/APC 单模交叉光纤,这意味着客户可以重复利用现有的 NDR 光纤基础设施。NVIDIA 提供长度从 3 米到 150 米的直通式和 1:2 分线式 MPO-12/APC 线缆。对于超过 150 米的传输距离或 LC-LC 光纤,应使用 Corning、Panduit 或 CommScope 等第三方供应商的产品。
基于 XDR DR4 的收发器使用 MPO-12/APC (12 芯多纤维推进式、斜面抛光连接器) 连接器。斜面抛光设计可以减少可能导致数据信号失真的回反射。在 12 个光纤位置中,仅使用其中的 8 个:4 个发送,4 个接收。相比之下,基于 FR4 的收发器 (传输距离为 2 公里) 则使用双工 LC 连接器。
可以,但有一些细节需要注意。Q3200 交换机支持 NDR 400G 线缆和收发器,以向下兼容 100G PAM4 以及 50G PAM4 HDR。Q3400 交换机仅支持部分选定的 NDR 线缆和收发器。XDR 收发器本身无法自动降速 (downshift) 至 100G PAM4。向下兼容性是在交换机或主机网卡 (HCA) 层面上进行处理的,而不是由线缆或收发器本身来实现。
不能。铜缆 (包括 DAC 直连铜缆、LACC 线性有源铜缆和 AEC 有源电缆) 无法与 Q3450 CPO 交换机配合使用。CPO 交换机仅使用 MMC-12/APC 光纤连接。
NVIDIA 提供了一系列网络工具,以便根据您选择的互连技术 (InfiniBand 或以太网) 来正确配置集群。
通过 NVIDIA Academy 探索关于 NVIDIA Quantum InfiniBand 网络的深度技术培训课程。
NVIDIA LinkX 产品为 NVIDIA Spectrum-X 交换机、Quantum 交换机、ConnectX 网卡和 BlueField™ DPU 提供针对 AI 优化的网络连接。