NVIDIA Quantum InfiniBand 交换机和一体机

完整的交换机和网络管理一体机产品系列,面向大规模 AI 和超级计算。

概览

提供更出色的数据吞吐和网络计算能力,为研究与创新加速

NVIDIA Quantum InfiniBand 是全球可完全卸载的 NVIDIA 网络计算平台。凭借无与伦比的数据吞吐量和密度,它带来了突破性的性能飞跃,能够以更低的成本和复杂性实现卓越的数据中心性能。NVIDIA Quantum InfiniBand 还提供自愈网络功能、增强服务质量 (QoS)、拥塞控制和自适应路由,从而实现最高的整体应用吞吐量。

加速计算和网络推动 AI 时代的超级计算

了解 NVIDIA Quantum-X Photonics InfiniBand 硅光交换机如何助力 AI 工厂大幅降低能耗和运营成本。

开启 NVIDIA 硅光网络交换机 —— NVIDIA Quantum-X 硅光技术

观看 NVIDIA Quantum-X800 CPO 交换机的实际运行演示,连接 NVIDIA GB300 机架,展示全球领先的用于代理式 AI 的硅光技术。

优势

NVIDIA Quantum InfiniBand 交换机亮点

网络计算

NVIDIA 可扩展分层聚合和归约协议 (SHARP)™ v4,实现 9 倍性能提升

规模最高

两级胖树拓扑,包含超过 10,000 个节点

NCCL 优化

SHARP 加速,实现高达 2.5 倍性能提升

自愈网络架构

极速恢复,弹性提升 1,000 倍

产品

NVIDIA Quantum InfiniBand 交换机和一体机

NVIDIA Quantum-X800 InfiniBand 交换机

NVIDIA Quantum-X800 InfiniBand 交换机具备 800 Gb/s 的吞吐量、超低延迟、先进的 NVIDIA 网络计算,以及多项可提升科学计算和 AI 数据中心整体应用性能的特性。

NVIDIA Quantum-X 硅光交换机通过最大限度地减少光学元件和电子元件之间的距离和连接数量,进一步降低了总功耗和延迟。

NVIDIA Quantum-2 InfiniBand 交换机系列

NVIDIA Quantum-2 InfiniBand 交换机具备 400 Gb/s 吞吐量、网络计算、智能加速引擎、灵活性和稳健的架构,在科学计算 AI 和超大规模云基础设施中实现无与伦比的性能,同时降低成本和复杂性。

NVIDIA Skyway 网关连接 InfiniBand 和以太网

NVIDIA® Skyway™ 设备是一款 1.6 Tb/s 的 InfiniBand 到以太网网关,在 InfiniBand 和以太网端各支持 8 个 100 或 200 Gb 端口。客户可以根据需求,随着时间的推移,轻松扩展 Skyway 设备的数量。

NVIDIA MetroX-3 XC 系统

NVIDIA MetroX®-3 XC 将 InfiniBand 的传输距离扩展至长达 40 公里。MetroX-3 XC 支持远程数据中心 (包括边缘基础设施) 之间以及数据中心与远程存储基础设施之间互连互通,支持在长距离传输和密集波分复用 (DWDM) 基础设施上实现加密传输。

创新

NVIDIA Quantum InfiniBand 创新技术

InfiniBand 交换机软件

NVIDIA NVOS 是一款面向高性能数据中心的 InfiniBand 交换机操作系统,能够构建可扩展至数千个计算和存储节点的网络,同时还提供监控和配置功能。

网络计算

NVIDIA Quantum InfiniBand 交换机采用 SHARP™ 技术,可卸载和加速数据归约算法,提高科学计算和 AI 应用的性能和可扩展性。

可扩展的科学计算软件

NVIDIA HPC-X® 是一套完整的消息传递接口 (MPI) 和共享内存访问 (SHMEM) /分区全局地址空间 (PGAS) 软件套件,其利用 InfiniBand 网络计算和加速引擎来优化科研和工业应用。

Unified Fabric Manager (UFM)

借助 NVIDIA UFM® 平台,数据中心管理员能够高效地对 InfiniBand 网络基础设施进行调配、监控、管理和主动故障排查。

资源

深入了解 NVIDIA CPO 硅光交换机

与传统收发器相比,NVIDIA CPO 交换机的能效提升 5 倍,弹性提升 10 倍,部署速度提升 1.3 倍,提供了驱动新一代 AI 工厂所需的规模。

点亮 NVIDIA Quantum-X InfiniBand 硅光交换机

当 NVIDIA Quantum-X CPO Q3450 交换机搭配 ConnectX®-8 SuperNIC™ 连接 GB300 机架,展示了 NVIDIA 硅光横向扩展网络——全球领先的代理式 AI 解决方案。

NVIDIA SHARP 网络计算技术

采用 SHARP 技术的 NVIDIA Quantum InfiniBand 交换机直接在网络内执行数据归约,与传统方法相比,速度明显提升,且 CPU 开销更低。

利用 NVIDIA SHARP 最大限度地提升分布式深度学习的性能

NVIDIA SHARP 利用 Quantum 交换机内的网络计算技术,显著提升分布式机器学习工作负载的性能。

NVIDIA Quantum-X800 交换机 Datasheet

NVIDIA Quantum-2 交换机 Datasheet

NVIDIA Quantum 交换机 Datasheet

NVIDIA Skyway Datasheet

NVIDIA MetroX-3 XC 系统 Datasheet

NVIDIA MetroX-2 XC 系统用户手册

利用 NVIDIA Quantum InfiniBand 实现一键式多租户安全

利用 NVIDIA Quantum InfiniBand 简化 AI 网络运维

利用 MetroX 远程互连系统,将数据中心转变为超大型数据中心

关于 NVIDIA Quantum InfiniBand 交换机和一体机的常见问题解答

InfiniBand 是一个高性能互连标准,专为在计算节点之间实现低延迟、高带宽的通信而设计。对于将计算分布在数百或数千个 GPU 上的 AI 训练和科学计算工作负载,网络延迟直接影响作业完成时间。NVIDIA Quantum InfiniBand 也是唯一支持网络计算的互连平台,它可将 AllReduce 等集合运算卸载到交换机结构本身,从而释放 GPU 周期用于实际计算。

传统的交换机设计使用可插拔的光学收发器将交换机 ASIC 连接到光纤。每个收发器都是一个分立元件,会消耗电力、产生热量,并可能出现故障。在集群规模下,这意味着在部署的生命周期内需要管理和更换数千个独立的收发器。

NVIDIA Quantum-X InfiniBand Photonics 交换机将光学引擎直接与交换机芯片集成,彻底省去了可插拔收发器。这缩短了芯片和光纤之间的电气路径,从而可降低功耗和延迟,而分立元件数量的减少提高了可靠性,并简化了长期运维。

网络计算是指 NVIDIA Quantum 交换机能够在网络内执行数据处理运算,无需主机 CPU 或 GPU 参与。关键能力是 NVIDIA SHARP,它可将 AllReduce 等集合运算直接卸载到交换机上。对于分布式 AI 训练,这可以减少节点间通信所花费的时间,并释放 GPU 周期用于计算。SHARP 可加速大多数并行仿真代码核心的集合运算,从而降低延迟和 CPU 开销。对于利用 NCCL、OpenMPI、UCX 或其他符合标准的 MPI 栈的应用,只需更改极少代码即可获益,使网络计算在从 AI 训练到分子动力学和气候建模的各个领域中都能发挥作用。

对于新的大规模 AI 部署,最佳选择是 NVIDIA Quantum-X800 InfiniBand。它具备 800Gb/s XDR 连接能力,专为新一代 AI 工厂而设计,可提供其需要的最大横向扩展带宽、低延迟、自适应路由、拥塞控制以及面向 AI 和科学计算集合通信的 SHARP 网络计算技术。对于 Hopper 代际或成本优化的部署而言,Quantum-2 NDR 400Gb/s 仍然是一个不错的选择,但对于新的 Blackwell 规模集群,Quantum-X800 可提供最佳的长期性能提升空间。Q3200 是 Quantum-X800 2U 风冷交换机平台,非常适合需要高端口密度和实用迁移路径的大型或混合代际环境。

NVIDIA Unified Fabric Manager (UFM) 是用于 NVIDIA Quantum InfiniBand 部署的网络管理平台。UFM (作为集成设备以及独立软件提供) 处理网络中的调配、实时监控、诊断和主动故障排除。NVIDIA UFM Cyber-AI 是一款专用设备,用于在可能预示安全威胁或硬件问题的异常网络行为影响到作业之前将其检测出来。

这是组织在扩展现有集群或分阶段建设时的一个常见考虑因素。一般来说,NVIDIA Quantum InfiniBand 的设计是向前兼容的:在不同代际的 InfiniBand 上运行的适配器和交换机将自动协商到适当的共同速度。对于需要连接 Quantum-X800 (XDR,800 Gb/s) 和 Quantum-2 (NDR,400 Gb/s) 环境的部署,NVIDIA 推荐 Q3200,这是一款专为桥接这两代产品而设计的多速率交换机。NVIDIA InfiniBand 交换机文档中介绍了使用 Q3200 时拓扑、端口映射和网络配置的特定设计考虑事项。

是的。NVIDIA Skyway™ 设备专为这类用例设计,提供 InfiniBand 到以太网网关。Skyway 允许 InfiniBand 计算集群与以太网连接的存储系统、管理网络或其他以太网基础设施进行通信,而无需对任何一种环境进行更改。随着跨网络带宽需求的增长,可以增量部署和扩展多台 Skyway 设备。

后续步骤

准备好开始了吗?

配置您的集群

该在线工具可以帮助您根据包含两级交换机系统和 Dragonfly+ 拓扑的胖树配置集群。

参加网络课程

通过 NVIDIA Academy 探索有关 NVIDIA Quantum InfiniBand 网络的深度技术培训主题。

如何购买 NVIDIA 网络解决方案?

请访问 NVIDIA 市场,详细了解如何购买 NVIDIA 网络解决方案。