概览
行业领先的开放、封闭和行业模型均基于 NVIDIA 技术构建。NVIDIA 通过在计算、网络、存储、显存和软件领域采用极致的协同设计,提供行业领先的每瓦性能并实现持续优化。这缩短了训练时间、降低了训练成本,并为模型构建者赋予了智能体能力。
无论是预训练万亿参数的混合专家 (MoE) 模型、使用强化学习对推理智能体进行后训练,还是微调特定领域的研究型智能体,NVIDIA 加速计算平台都能为全球领先的 AI 公司提供生产级训练。
优势
NVIDIA 平台可缩短训练时间,提供高训练有效吞吐量以及不断优化的完整软件栈,从而持续提升性能。
与上一代相比,NVIDIA Blackwell 的训练速度提升高达 3 倍,每美元训练性能提升近 2 倍。NVIDIA 在从 LLM 预训练到微调,再到图神经网络的所有 MLPerf Training 基准测试中均拔得头筹,并随着每一次的软件发布持续扩大领先优势。
采用端到端 FP8 精度的 NVIDIA NeMo™ RL 可为生产级强化学习 (RL) 提供更高的推演吞吐量和稳定的收敛。训练多环境、多轮智能体,使其持续学习,并以极低成本实现与 BF16 相同的模型精度。
混合专家并行、NVFP4 精度和 NVL72 规模化扩展使 NVIDIA 成为全球最智能 MoE 模型的首选平台,涵盖从开源 OSS 模型到前沿专有系统。在相同的功耗范围内,更快地训练更多参数。
从 Megatron-Core 和 NeMo 等 NVIDIA 库到 PyTorch、JAX、vLLM、SGLang 和 Ray 等行业框架,每种主要的训练、后训练和推理框架都在 NVIDIA 上原生运行。开放权重、开放方案、开放贡献:Hugging Face 上的 150 万个 AI 模型在 NVIDIA® CUDA® 上运行。
产品
NVIDIA 在计算、网络、存储、显存和 AI 软件领域提供极致协同设计,也是业界唯一垂直集成、水平开放的 AI 训练平台。
用例
对 AI 模型进行预训练,使其具备理解语言、识别音频、视频或图像,或识别数据中的关系等基础能力,然后再使其适应特定任务。通过启用系统级健康检查、在运行时快速检测故障并自动恢复训练,最大限度提升 AI 训练的有效吞吐量。
使用 NeMo RL 训练推理智能体和工具调用模型,支持端到端 FP8 推演、推测性解码与多环境训练。NeMo RL 被前沿 AI 实验室用于推动代理式 AI 时代。
借助 NeMo AutoModel 的配方和精选数据集,将开放的基础模型 (如 Nemotron、Meta Llama、Mistral 和 Google Gemma 4) 适配为特定领域应用。NeMo AutoModel 原生兼容 Hugging Face 和 PyTorch,并支持在所有 NVIDIA 云和本地部署集群上运行。
资源
探索 NVIDIA 技术博客、点播会议和开发者视频,深入了解 AI 训练基础设施、基准测试和最佳实践。
案例研究
从前沿 AI 实验室到领先企业,全球最雄心勃勃的团队均使用 NVIDIA 技术更快地训练更智能的模型。
NVIDIA 全栈平台支持生产级规模的预训练、强化学习后训练以及监督微调,从而优化前沿、开源和企业级 AI 模型的训练时间、训练成本和有效吞吐量。
NVIDIA 加速计算平台包括 NVIDIA Blackwell Ultra 和 Rubin GPU、Vera 和 Grace CPU、NVLink 和 NVSwitch 纵向扩展网络、ConnectX 和 BlueField DPU SuperNIC,以及 Spectrum-X 网络,均采用极致的协同设计,可用于训练万亿参数的前沿 AI 模型。
NVIDIA 原生支持 PyTorch、JAX、vLLM、SGLang 和 Ray,以及专有库,包括 Megatron Core、NeMo RL、NeMo AutoModel 和 NCCL。超过 150 万个 Hugging Face 模型在 CUDA 上运行。
领先的 AI 实验室、AI 原生企业、初创公司及企业 —— 包括 OpenAI、xAI、Arcee AI、罗氏、礼来和 Hudson River Trading —— 在基于 NVIDIA Blackwell 的系统上训练前沿和特定领域的模型。
与上一代产品相比,NVIDIA Blackwell 的训练速度提升高达 3 倍,每美元训练性能提升近 2 倍,在 LLM 预训练、微调和图神经网络的全部 MLPerf Training 基准测试中均取得领先成绩。
利用经过验证的 AI 基础设施解决方案和 NVIDIA 合作伙伴的蓝图来训练前沿模型。
将最新研究、基准测试结果和客户案例直接发送至您的收件箱。