NVIDIA NVLink Fusion

为半定制 AI 基础设施应用经过业界验证的 AI 纵向扩展性能与机架级体系架构。

概览

采用 NVLink Fusion 的半定制 AI 工厂

NVIDIA NVLink™ Fusion 是高带宽、低延迟的连接技术和 IP,使超大规模数据中心和 AI 原生企业能够将定制的 XPU 和 CPU 部署到 NVIDIA 全球领先的 AI 基础设施平台中。利用 NVIDIA 经过验证的纵向扩展和横向扩展技术栈及生态系统,以及 MGX™ 机架级架构,降低半定制 AI 工厂的开发复杂性、提升性能并加速上市时间。通过在单一统一架构上标准化,NVLink Fusion 简化了数据中心的运维工作,实现了灵活的数据中心容量重新配置,并使定制的 XPU 能够与 GPU 无缝集成,实现异构计算。

AWS AI 基础设施将与 NVIDIA NVLink Fusion 集成,加速 Trainium4 部署

了解 AWS 如何使用 NVLink Fusion 加速 Trainium4 部署。

借助 NVIDIA NVLink Fusion 实现半定制计算平台与机架级架构的集成

了解 NVIDIA NVLink Fusion 如何帮助超大规模数据中心用户构建半定制 AI 基础设施,将其 ASIC 或 CPU 与 NVIDIA GPU 相集成,同时实现统一可扩展硬件基础设施的标准化。

借助 NVLink Fusion,高性能 AI 工厂可以快速扩展,并受益于构成 NVIDIA 机架级架构的所有组件。

优势

NVLink Fusion 的优势

卓越的纵向扩展性能

要释放 AI 工厂的全部潜力,所有加速器之间必须实现快速无缝通信。NVIDIA NVLink 6 可实现 2 个 XPU all-to-all 互连,单个 XPU 带宽达 3.6 TB/s,未来的路线图配置支持高达 1,152 的域规模,以提升 AI 性能和投资回报。

经过生产验证的技术生态系统和供应链

全面的 NVLink Fusion 技术生态系统,包括 XPU 设计合作伙伴、CPU 合作伙伴和 IP 供应商,帮助超大规模数据中心和 AI 原生企业优化 XPU 设计并简化开发流程。MGX 生态系统提供全面的机架级架构,帮助采用者的超大规模数据中心连接到 NVIDIA 用于其自身 MGX 系统的同一条成熟供应链,从而消除新机架设计和供应商管理的复杂性,并加速上市时间。

灵活的重新配置和部署风险缓解

采用 MGX 机架架构的一个关键优势是,基于 XPU 和 GPU 的系统 (例如 Vera Rubin NVL72) 可以轻松设计到同一数据中心中,共同同一套机架及机架占用空间、网络、冷却、供电和管理系统。这种统一的方法使 NVLink Fusion 采用者能够将数据中心的设计和建设与芯片的就绪和供应情况分离,并能够随着需求的变化,使用基于 XPU 或 GPU 的系统的不同组合,轻松重新配置数据中心容量。

面向异构 AI 基础设施的统一架构

NVLink Fusion 采用者可以在同一数据中心部署不同类型的 XPU (或 XPU 和 GPU),从而实现异构计算,以支持解耦式推理和其他非对称工作负载。

成果是一个单一、半定制的 AI 工厂,这是任何一家公司都无法独自建成的。

平台

NVIDIA NVLink Fusion 技术

NVIDIA NVLink

NVIDIA NVLink 6 和 NVLink Switch 芯片在 72 个加速器的 NVLink 域 (NVL72) 中实现 260 TB/s 的带宽,并支持 NVIDIA Scalable Hierarchical Aggregation and Reduction Protocol (SHARP)™ FP8 技术实现 4 倍带宽效率。

NVIDIA NVLink-C2C

NVIDIA NVLink-C2C 将行业领先的 NVLink 技术扩展到芯片之间的直连。助力 NVIDIA 合作伙伴通过 chiplets 创造新型集成产品,实现 NVIDIA GPU 或 CPU 与客户定制芯片的高带宽一致性连接。

AI 基础设施平台

NVIDIA 提供模块化的 AI 工厂技术产品组合,包括 NVIDIA GPU、NVIDIA Vera CPU、光电一体封装 (CPO) 交换机、ConnectX® SuperNICs™、BlueField® DPU 以及用于优化 AI 工作流和管理 AI 基础设施的 Mission Control™ 软件。

全机架解决方案也可用于半定制 AI 工厂集成,包括 Vera Rubin NVL72 机架 (可以与基于 XPU 的系统混合,用于解耦式推理)、Vera CPU 机架 (用于支持代理式 AI 系统和强化学习)、NVIDIA LPX 机架 (用于辅助高上下文和低延迟推理)、NVIDIA STX 机架 (用于 AI 原生存储) 以及 NVIDIA SPX 机架 (用于横向扩展网络)。

采用企业

NVLink Fusion 生态系统

借助 NVLink Fusion 扩展 AI 推理性能

了解 NVIDIA NVLink Fusion 如何满足复杂 AI 模型日益增长的需求。