白皮书
AI 基于 Token 运行。如何使用、扩展、生成并将 Token 变现将决定您的 AI 竞争优势。针对每种用例选择最优模型与上下文长度,部署能最大化每瓦 Token 产出量及最小化每 Token 成本的基础设施,从而大规模地推动收入和利润增长。
数据中心正逐渐演变为 AI Token 工厂。过去它们处理交易并提供网页服务,现在它们产生了一种新的输出:Token,即 AI 模型在推理过程中生成的智能输出的基本单位。随着 AI 从实验转向生产,推理已成为主导工作负载,Token 已成为企业必须学会生产、管理和变现的新型商品。
什么是 Token 经济学?它是 Token 生成与使用的经济性问题,也是该生态系统中频繁使用的术语,但可能缺乏精确性。为了深入探讨 Token 经济学的真正含义,将其表述为 Token 的估值、消费、供应以及变现方式会很有帮助。
Token 经济学包含四个相互关联的支柱:
Token 经济学的每个支柱不是孤立存在的。关于供应的决策会直接影响利润,需求预测决定基础设施要求,而 Token 效用则决定了收费标准的上限。这四大支柱相互依存,能否做好这四大支柱,是区分可持续 AI 企业和代价高昂的实验的关键所在。本白皮书将深入探讨每个支柱,为企业规划或扩展 AI 部署提供框架。
并非所有 Token 都具有相同价值。Token 的价值取决于两个维度:
智能程度越高,交互速度越快,生成 Token 的成本就越高。但从这些 Token 获取的价值与具体用例有关,完全取决于用例中能否利用这些 Token。经过后训练的小型语言模型 (SLM) 可以以极低的成本,在特定领域的任务上达到甚至超过规模更大、更智能的模型。批量文档处理工作流与实时编码助手的交互性需求有很大差异。只有当应用程序能够利用这些附加功能时,它们的价值才值得付费。
Token 效用的最佳理解是一个连续谱:一端是由基础型或经过后训练的小型语言模型 (SLM) 支持的高吞吐、低交互性工作负载,例如搜索和聊天机器人;另一端则是接近实时的工作负载,这类任务需要使用参数规模最大的模型和超长上下文,例如智能体式编程和自动化任务。首要任务是将每个用例映射到该连续谱上的正确位置。
一种切实可行的方法是,先借助前沿模型能力完成原型开发与验证,再通过评估建立严格的服务级目标 (SLO),最终针对规模化部署进行优化,并合理匹配模型与资源规模。以下问题有助于引导该流程:
正确建立它们的映射关系,会产生直接的下游影响。它决定部署哪些模型、如何确定基础设施需求规模,以及最终对所生成 Token 的收费标准。Token 效用是需求、供应以及变现决策建立的基础。
NVIDIA AI 基础设施支持广泛的专有模型与开放权重模型,让客户能够灵活选择最佳 Token 价值。NVIDIA 还构建了 Nemotron,这是一系列专为构建长时间运行且可自我进化的智能体而设计的高效、多模态的开放模型。例如,较之同类模型,Nemotron 3 Ultra 完成编码基准测试使用的总 Token 数和每轮 Token 数都更少,从而将代理式任务的成本降低达 30%。
如何预测 Token 需求?从用例入手是将需求作为预测和基础设施规划工具的最有效方式。市场正在经历应用场景的快速扩张,覆盖从消费者和企业聊天机器人到编码和代理式自动化等领域。这种转变正在迅速改变需求格局,从数万亿 Token 规模提升到千万亿 Token 规模,颠覆性改变了 Token 的工作负载、需求特点及其单位成本。
企业需要掌握方法来预测自身需求,以便规划与其 AI 用例相关的资本支出与运营支出。第一性原理驱动的方法包括三个层级:
三层 Token 需求预测模型,涵盖从通过工作负载乘数进行的基数估算,到决定现实基础设施需求的运维需求变量。三层模型具有颜色编码:绿色表示与传统软件容量规划共享的组件;橙色标记 Token 服务独有变量 (每个请求 Token 数、推理、智能体循环)。
基于 1 级需求估算是容量规划的起点。它们可作为理解概念验证部署要求的基准,但很少能够扩展到生产环境。工作负载需求乘数能够将 Token 需求扩大一个数量级。如下面的示例所示,如果基础设施仅根据基本需求估算配置,相关应用每天将出现超过 6 亿 Token 的缺口。
运维需求 (第 3 层) 的考量需要在更精细的层次上对需求进行建模。此 Token 需求预测工作表提供了一个填空版本,帮助您了解这三个层级。
Token 需求预测与传统软件容量规划相比,其偏离程度可能比看起来要小。大多数输入指标,如会话、请求、重试、缓存命中率、时间模式以及延迟服务级别协议 (SLA) 等,与基础设施团队已熟悉的实践基本一致。服务 Token 有三个特有的变量:每个请求 Token 数、推理开销以及智能体循环。不同部署的需求组合区别不在于方法,而在于具体情境:案例、部署它的组织,以及融入工作流中的应用设计决策。
随着代理式工作负载的规模扩大以及 Token 需求增加,将这三个层级视为动态模型而非一次性试验的企业组织将能够预估最合适的基础设施规模。
Token 供应从根本上讲与效率有关:最大化 Token 输出,同时最小化生成 Token 的成本。
实现这一目标需要跨模型效率、系统效率和软件效率的协同优化。没有任何单一组件可单独满足需求。这三项必须与生态系统协同设计。NVIDIA 将此称为“极致协同设计”,它涵盖模型与算法、计算、网络、内存、存储、软件以及合作伙伴与客户生态系统,各部分协同工作,使整体大于各部分之和,并使系统能够以最低的 Token 成本运作。
模型效率
混合专家模型 (MoE) 架构仅为每个 Token 激活相关参数,可显著提升模型效率。例如,Kimi K2.5 具有 1 万亿参数,但每个 Token 仅激活 320 亿个,以极低的计算成本提供更大的稠密模型所具备的智能。隐性成本是分散在 GPU 上的专家之间的通信。MoE 推理会在不同批次的 GPU 之间生成繁重的全对全通信,如果底层系统无法大规模处理该流量,那么效率提升就会归零。
系统效率
NVIDIA Grace Blackwell 机架级扩展系统通过 NVIDIA NVLink™ 交换机连接 72 个 GPU,实现全对全带宽 1,800 GB/s。这种更大的 GPU 域允许专家分布在多达 72 个 GPU 上,而不会受到固定网格、单节点配置或现成的基于以太网的扩展方法所受到的通信瓶颈的限制。这可确保在生产环境中实现 MoE 模型的理论效率。
软件效率
充分发挥硬件潜力,需要在三个架构层次上优化的软件栈:基础设施访问、应用加速,以及编排与服务。NVIDIA 提供了强大的软件栈,可以同时实现所有优化。这比听起来要难得多,但正是这种累积效应带来了 Token 交付量方面的飞跃式提升。开源生态系统和 NVIDIA 持续软件优化,可提升现有硬件的生产力。
极致协同设计的结果是,Grace Blackwell 机架级扩展系统上的单位 Token 成本达到行业内最低。
在企业限制范围内优化
大多数企业需要在现有数据中心规模和环境限制下优化 Token 成本。例如,机架的平均功率密度约为 27 千瓦 (kW),75% 的数据中心仍采用风冷而非水冷。企业除了人工智能之外,通常还有数据处理或图形处理等混合工作负载,而且前期可用资金有限,难以应对这些限制。NVIDIA 提供各种专用解决方案。NVIDIA HGX™ Blackwell GPU 可将风冷 AI 工厂的 Token 成本降至最低。NVIDIA RTX PRO™ Blackwell 服务器版 GPU 在企业推理工作负载中,Token 效率最高可达上一代 NVIDIA Hopper™ 系统的 3 倍。
Token 生成效率
重要指标:每兆瓦吞吐量和每 Token 成本
大多数企业组织仍然使用每 GPU 小时成本、每秒峰值浮点运算 (FLOPS) 或每美元 FLOPS 等输入指标来评估 AI 基础设施。这些不应是用于评估 AI 基础设施的指标。通过四项测量方法比较 NVIDIA Blackwell 和 Hopper 可证明这一点:
最重要的指标是每兆瓦吞吐量和每 Token 成本。
每兆瓦吞吐量影响您的收入和每 Token 成本,决定每次交互的盈利能力以及业务增长速度。这些指标将硬件性能、软件优化和实际应用情况整合到一个指标中。有关更深入的推理 TCO,请参阅重新思考 AI TCO:为何每 Token 成本才是唯一重要的指标。
随着代理式 AI 的成熟,与每 Token 成本一起出现的还有相邻概念:每 Token 智能、每任务 Token 以及每任务成本。每项任务成本是模型生成智能的效率 (每个 Token 的智能) 以及模型使用 Token 完成任务的效率 (每个任务的 Token) 的函数。
效用定义了 Token 的价值。需求预测了将消耗多少 Token,以及由谁消耗。供应决定了生产成本。
变现将这三大支柱整合在一起,并回答了核心业务问题:如何为 Token 定价和销售,从而实现有利且可持续的经济效益?
没有单一的经济模型能够说明如何实现 Token 变现。目前已形成四项关键策略,分别适用于不同的业务场景和基础条件。
以下定价机制适用于直接销售 Token 的场景。对于基于 Token 构建的产品和服务,整体思路在概念上类似,但企业还需要将其为最终客户创造的额外价值纳入考量。
无论组织选择哪种模式,正确把握定价的基本原则都是基础。
如何确定 Token 定价
在为 Token 定价时,应考虑三个重要因素:
Token 收入最终取决于 Token 输出、Token 价格以及不同定价层级间的需求分布。利润率取决于生成 Token 的成本。因此,基础设施决策与营收直接相关。NVIDIA Vera Rubin 平台可提升吞吐量,并将每个 Token 的成本降低 10 倍。此外,搭载 LPX 的 Vera Rubin 能够支持高交互性、高智能工作负载,这些负载通常能够获得溢价,从而拓展高端价格区间的收入机会,并提升利润率。
以下案例研究说明了企业组织如何在四种模型中将这些策略付诸实践:直接销售 Token、构建 AI 原生产品、增强现有商品 / 产品和服务,以及变革内部运营。本指南前文列出的性能与效率数据,充分体现了全面协同设计可达成的目标。以下案例研究展示了企业组织在这一过程中所处的不同阶段,其成果取决于模型选择、序列长度、数值精度、推理优化以及硬件部署的不同组合。
总结
Cohere 成立于 2019 年,是一家领先的主权 AI 公司,致力于打造基础模型和端到端产品,以解决现实商业问题。Cohere 适用于 Token 经济的两个方面:既构建自己的模型,又构建使用这些模型的产品与解决方案。Cohere 的主要大语言模型 (LLM) 是 Command/North 模型系列,包括 Command A Vision (多模态) 和 Command A Translate,以及用于搜索的 Embed 和 Rerank。
Cohere 还开发了 North,这是一个安全的企业级 AI 工作空间,员工与可定制的 AI 智能体一起工作。这些智能体能够通过 RAG 检索公司数据、使用各种工具、执行工作流,并驱动自动化流程。
目标
由于 North 基于 Cohere 自己的模型运行,每次交互都需要 Token,且对延迟敏感,因此推理效率直接影响 Cohere 的利润率与产品质量。因此,Cohere 需要最优的 AI 基础设施,以降低 Token 成本、降低延迟,并实现每节点高吞吐量。Cohere 会针对不同模型、硬件和负载水平运行持续的基准测试计划。
解决方案
Cohere 将其生产模型从 NVIDIA Hopper GPU 迁移到 NVIDIA Blackwell GPU 和 Grace Blackwell 超级芯片,通常以 FP8 精度运行。
结果
在 Cohere 自己的内部基准测试中,将 NVIDIA Hopper GPU 与 NVIDIA Blackwell GPU 进行比较,团队发现:
条形图显示 Blackwell GPU 在匹配条件测试下相较于 Hopper GPU 的峰值吞吐量提升 (高达 64 个用户)。
技术进步带来商业价值
更高的每节点吞吐量和较低的延迟可转化为利润率和更好的产品。
总体而言,Cohere 通过在 NVIDIA Blackwell 上交付其模型和解决方案,实现了更高的利润率、更大的规模、更大的灵活性,并提供了更好的客户体验。
为进一步说明,下表显示了 Cohere 与 NVIDIA Blackwell 合作取得的总体业务影响。
注意:测量吞吐量与公开的 GPU 价格相结合,旨在说明影响趋势,并非 Cohere 的实际成本。
每百万 Token 的示例成本 (GPU 数量相同;3.50 美元/Hopper GPU•时 和 6.00 美元/Blackwell GPU•时 = 1.71 倍溢价)。
| 模型 (场景) | 每百万 Token 的 Hopper GPU 成本 | 每百万 Token 的 Blackwell GPU 成本 | 吞吐量增益 | 每美元 Token 数 |
|---|---|---|---|---|
| Command A Translate (1K/100) | 0.39 美元 | 0.26 美元 | 2.62 倍 | +53% (-35% 成本) |
| Command A+ (10K/1K) | 0.128 美元 | 0.113 美元 | 1.93 倍 | +13% (-11% 成本) |
| Command A Vision (1 张图像) | 1.99 美元 | 1.83 美元 | 1.87 倍 | +9% (-8% 成本) |
每美元 Token 收益 = 吞吐量收益/GPU 溢价。如果吞吐量超过 ~1.7 倍 (长上下文、高并发、翻译),NVIDIA Blackwell 可真正节省每 Token 成本。随着 Blackwell GPU/Hopper GPU 价格差距的缩小,这一优势也在不断增强 (云端费率通常接近 1.5 倍)。
总结
Perplexity 是一个 AI 智能体平台,专注于精准 AI。该公司的平台利用包括 NVIDIA Nemotron™ 3 Ultra 在内的 15 种 AI 模型,通过工作流将每个工作负载路由到具有最优性价比的模型,从而为我们的客户优化性能、质量与成本。
“每一代 NVIDIA 硬件都给我们带来了某些具体的效益。NVIDIA Hopper 让我们为自己的模型集群提供服务。NVIDIA Blackwell 具有更大的 NVLink 域和 Tensor Core 上的 MXFP8,可在多个节点上提供服务,而不会增加延迟。正因为如此,我们正在推进的工作负载才具备经济可行性。” – Denis Yarats,Perplexity 联合创始人兼 CTO
目标
Perplexity 的商业目标是提供消费级规模的精准 AI 服务,同时保持企业级可靠性和增长所需的经济性。Perplexity 的生产基础设施目前每天已处理超过 5000 万次查询,覆盖由 15 个模型组成的模型集群;其首 Token 生成时间 (TTFT) 的第 50 百分位 (P50) 根据任务类型不同而有所差异,从快速搜索的 2.4 秒到深度推理任务的约 13 秒不等。随着越来越多的流量转向 Perplexity Computer 中持续数小时的智能体任务,Perplexity 正在让单位智能的成本更低、速度更快、可靠性更高,从而使成本和延迟相对于流量和任务复杂度实现亚线性增长。
解决方案
Perplexity 的 AI 基础设施基于多代 NVIDIA 硬件,包括 NVIDIA Hopper 和 NVIDIA Blackwell,并采用 NVIDIA 的数据中心软件栈进行编排与优化。
Perplexity 基于 NVIDIA 构建了推理栈,在不牺牲模型精度或增加延迟的情况下,降低每个 Token 的成本。每一代连续的 GPU 性能都会显著提升,并且当与 FlashInfer、CuTe DSL、SHARP、MXFP8 量化以及分离式预填充和解码服务相结合时,它们能够提高每 GPU 小时的 Token 产出。
结果
Perplexity 在多节点 NVIDIA Grace Blackwell 超级芯片上的输出 Token 成本与单节点 NVIDIA Hopper GPU 相比,降低至原来的 1/2 到 1/4,同时将 MoE 模型上的调度延迟降低了 46.5%。
降低延迟
下图比较了使用 NVLink 和 NVLS 传输的 NVIDIA Hopper GPU 和 NVIDIA Grace Blackwell 超级芯片的 MoE 调度延迟,结果显示,与使用 NVLS 的 NVIDIA Hopper GPU 相比,采用 NVLS 的 NVIDIA Grace Blackwell 超级芯片可将调度延迟降低 46.5% (313.3μs 与 586.1μs)。
Perplexity
吞吐量提升
下图绘制了 Grace Blackwell 超级芯片 (EP = 4/8/16) 和 Hopper GPU (EP = 8/16) 的每 GPU 解码吞吐量随解码速度的变化曲线,结果显示,得益于更大的 NVLink 域,Grace Blackwell 超级芯片多节点部署在相同解码速度下,每 GPU 吞吐量比 Hopper GPU 单节点提升了 2–4 倍。
Perplexity
总结
Canva 的使命是助力全球设计。Canva 的 AI 设计工具套件可以帮助任何人创作出最出色的作品,涵盖从社交媒体帖子到演示文稿和短视频等各种形式。他们的设计套件中最热门的功能之一是图像转视频 AI 生成器,它可以将静态照片转化为简短的动画剪辑,无需软件,且可在任何设备上运行。
“与 NVIDIA 合作有助于 Canva 提升图像到视频等 AI 赋能创意体验的效率,同时保持用户期望的速度和质量。效率是让更多人使用先进创意工具的关键。” – Canva AI 研究负责人 Stefano Corazza
目标
Canva 目前每月拥有超过 2.65 亿活跃用户,是全球使用最广泛的三大 AI 应用之一。为了使每个人都能使用广受欢迎的图像转视频 AI 生成器,Canva 建立了由 NVIDIA 提供支持的专用推理基础设施。这可确保生成的视频符合最高行业标准,同时将单次生成成本和延迟保持在合理水平。
解决方案
Canva 在 NVIDIA 平台上运行其图像到视频推理栈,实现在不牺牲模型精度或增加延迟的情况下降低单次生成成本。该特性由一个扩散 Transformer 视频模型提供支持,该模型在 NVIDIA Blackwell GPU 上运行。得益于优化的分布式推理与后处理流程,结合硬件专用 kernels,Canva 可按每 GPU 小时生成更多视频,将免费的图像转视频体验扩展到全球用户群。
结果
Canva 在 NVIDIA Blackwell GPU 上每 GPU 小时的视频生成量比 NVIDIA Hopper GPU 多 70%。
如何使用此工作表:在每个 [_blank_] 中填写相应的数字。每一层的输出都会传递给下一层。每个部分下方的数学公式都会准确展示具体进行了哪些运算,以及这些数值是如何逐层传递的。
Layer 1: Base Demand
We're sizing this deployment for [__________] users, each running about [__________] tasks every day. A typical request sends [__________] input tokens, and the model gives back [__________] output tokens.
Inputs
A. Users ......................... [__________]
B. Tasks per user per day ........ [__________]
C. Input sequence length (ISL) ...... [__________] tokens
D. Output sequence length (OSL) ...... [__________] tokens
The Math
Sessions / Day = A × B
= [_____] × [_____]
= [_______________] sessions/day
Tokens / Request = C + D
= [_____] + [_____]
= [_______________] tokens/request
Base Tokens / Day = Sessions × Tokens/Request
= [_____] × [_____]
= [_______________] tokens/day
Base Tokens / Month = Daily × 30
= [_______________] tokens/month
Layer 2: Workload Multipliers
Each step burns about [__________] hidden reasoning tokens, and a single task chains through [_____] agent steps. Failures and fallbacks add a [_____]× retry overhead, and we attach a [__________] token system prompt to every call. Prompt caching is hitting [_____]% of system-prompt tokens.
Inputs
E. Reasoning tokens per step ....... [__________]
F. Agent steps per task ............ [_____]
G. Retry multiplier ................ [_____] ×
H. System prompt tokens per step ... [__________]
I. Cache hit rate .................. [_____] %
The Math
Adjusted Tokens / Request = Tokens/Req + E
= [_____] + [_____]
= [_______________]
Tokens / Task (with steps) = Adjusted × F
= [_____] × [_____]
= [_______________]
Tokens / Task (with retries) = Above × G
= [_____] × [_____]
= [_______________]
Cache Savings / Day = H × (I / 100) × F × Sessions
= [_____] × [_____] × [_____] × [_____]
= [_______________] tokens saved/day
Effective Tokens / Day = (Tokens/Task × Sessions) − Cache Savings
= [_____] − [_____]
= [_______________] tokens/day
Effective Tokens / Month = Daily × 30
= [_______________] tokens/month
Layer 3: Operational Shaping
About [_____]% of daily traffic lands inside a [_____]-hour business window. Inside that peak, real traffic bursts to [_____]× the windowed average, and seasonal spikes stretch us another [_____]×. To meet latency SLAs, maintain [_____]× extra headroom.
Inputs
J. Peak hour concentration ......... [_____] %
K. Peak window hours ............... [_____] hours
L. Burst ratio ..................... [_____] ×
M. Seasonal spike factor ........... [_____] ×
N. Latency SLA headroom ............ [_____] ×
The Math
Avg TPM (24-hour) = Effective Daily ÷ 1,440
= [_____] ÷ 1,440
= [_______________] tokens/min
Avg TPM (peak window) = (Effective Daily × J/100) ÷ (K × 60)
= ([_____] × [_____]) ÷ ([_____] × 60)
= [_______________] tokens/min
Peak Burst TPM = Peak TPM × L
= [_____] × [_____]
= [_______________] tokens/min
Peak TPM + SLA = Burst × N
= [_____] × [_____]
= [_______________] tokens/min
Peak TPM + Seasonal = Above × M
= [_____] × [_____]
= [_______________] tokens/min
NVIDIA Token 经济学专注于优化每瓦生成 AI Token 的成本与收入,通过极致协同设计降低每个 Token 的总体成本。如需讨论基础设施定价或软件许可,您可以通过以下表格联系我们。