NVIDIA NVLink Fusion

为半定制 AI 基础设施应用经过业界验证的 AI 纵向扩展性能与机架级体系架构。

概览

采用 NVLink Fusion 的半定制 AI 工厂

NVIDIA NVLink™ Fusion 是高带宽、低延迟的连接技术和 IP,使超大规模数据中心和 AI 原生企业能够将定制的 XPU 和 CPU 部署到 NVIDIA 全球领先的 AI 基础设施平台中。利用 NVIDIA 经过验证的纵向扩展和横向扩展技术栈及生态系统,以及 MGX™ 机架级架构,降低半定制 AI 工厂的开发复杂性、提升性能并加速上市时间。通过在单个架构上采用统一的标准化,NVLink Fusion 可简化整个数据中心的运营管理,实现数据中心的灵活调配,并支持自定义 XPU 与 GPU 无缝协同,满足异构计算需求。

NVIDIA NVLink Fusion 借助 NVHBM 自定义高带宽内存实现扩展

Amazon 旗下 Annapurna Labs 将成为首家与 NVIDIA 在 NVHBM 领域的合作伙伴,将 AWS 的定制芯片与 NVIDIA 的内存技术及 NVLink 横向扩展架构相结合,以提升 AI 工作负载的性能与效率。

借助 NVIDIA NVLink Fusion 实现半定制计算平台与机架级架构的集成

了解 NVIDIA NVLink Fusion 如何帮助超大规模数据中心用户构建半定制 AI 基础设施,将其 ASIC 或 CPU 与 NVIDIA GPU 相集成,同时实现统一可扩展硬件基础设施的标准化。

借助 NVLink Fusion,高性能 AI 工厂可以快速扩展,并受益于构成 NVIDIA 机架级架构的所有组件。

优势

NVLink Fusion 的优势

卓越的纵向扩展性能

要充分释放 AI 工厂的潜力,需要高速内存以及所有加速器之间快速、无缝的通信。NVIDIA NVHBM 可提升内存带宽并降低功耗,同时 NVIDIA NVLink 6 以每个 XPU 3.6 TB/s 的速度实现 72 个 XPU 的 all-to-all 连接,未来路线图域规模可达 1152 个,从而进一步提升 AI 的性能和投资回报率。

经过生产验证的技术生态系统和供应链

全面的 NVLink Fusion 技术生态系统,包括 XPU 设计合作伙伴、CPU 合作伙伴和 IP 供应商,帮助超大规模数据中心和 AI 原生企业优化 XPU 设计并简化开发流程。MGX 生态系统提供全面的机架级架构,帮助采用者的超大规模数据中心连接到 NVIDIA 用于其自身 MGX 系统的同一条成熟供应链,从而消除新机架设计和供应商管理的复杂性,并加速上市时间。

灵活的重新配置和部署风险缓解

采用 MGX 机架架构的一个关键优势是,基于 XPU 和 GPU 的系统 (例如 Vera Rubin NVL72) 可以轻松设计到同一数据中心中,共用同一套机架、机架空间、网络、冷却、供电和管理系统。这种统一的方法使 NVLink Fusion 采用者能够将数据中心的设计和建设与芯片的就绪和供应情况分离,并能够随着需求的变化,使用基于 XPU 或 GPU 的系统的不同组合,轻松重新配置数据中心容量。

面向异构 AI 基础设施的统一架构

NVLink Fusion 采用者可以在同一数据中心部署不同类型的 XPU (或 XPU 和 GPU),从而实现异构计算,以支持解耦式推理和其他非对称工作负载。

成果是一个单一、半定制的 AI 工厂,这是任何一家公司都无法独自建成的。

平台

NVIDIA NVLink Fusion 技术

NVIDIA NVLink

NVIDIA NVLink 6 和 NVLink Switch 芯片在 72 个加速器的 NVLink 域 (NVL72) 中实现 260 TB/s 的带宽,并支持 NVIDIA Scalable Hierarchical Aggregation and Reduction Protocol (SHARP)™ FP8 技术实现 4 倍带宽效率。

NVIDIA NVLink-C2C

NVIDIA NVLink-C2C 将行业领先的 NVLink 技术扩展到芯片之间的直连。助力 NVIDIA 合作伙伴通过 chiplets 创造新型集成产品,实现 NVIDIA GPU 或 CPU 与客户定制芯片的高带宽一致性连接。

NVIDIA NVHBM

NVIDIA NVHBM 是定制的新一代高带宽内存 (HBM) 架构。它包含定制的 HBM 基础裸片和内存控制器,由 NVIDIA 设计,并通过领先内存厂商的验证,可增加带宽、降低 HBM 功耗并节省 XPU 计算芯片的空间。

AI 基础设施平台

NVIDIA 提供模块化的 AI 工厂技术产品组合,包括 NVIDIA GPU、NVIDIA Vera CPU、光电一体封装 (CPO) 交换机、ConnectX® SuperNICs™、BlueField® DPU 以及用于优化 AI 工作流和管理 AI 基础设施的 Mission Control™ 软件。

全机架解决方案也可用于半定制 AI 工厂集成,包括 Vera Rubin NVL72 机架 (可以与基于 XPU 的系统混合,用于解耦式推理)、Vera CPU 机架 (用于支持代理式 AI 系统和强化学习)、NVIDIA LPX 机架 (用于辅助高上下文和低延迟推理)、NVIDIA STX 机架 (用于 AI 原生存储) 以及 NVIDIA SPX 机架 (用于横向扩展网络)。

采用企业

NVLink Fusion 生态系统

借助 NVLink Fusion 扩展 AI 推理性能

了解 NVIDIA NVLink Fusion 如何满足复杂 AI 模型日益增长的需求。