2026 年 10 月 15 — 16 日
苏州金鸡湖国际会议中心 A 馆
开发者日汇集来自全国的开发者、AI 领域科技爱好者和行业领袖,共同探讨 AI 开发技术的最新趋势。
主论坛将汇聚重磅嘉宾 —— NVIDIA Cosmos Lab 副总裁刘洺堉将解读世界基础模型与物理 AI 的最新突破,应用深度学习研究方向 (ADLR) 副总裁 Bryan Catanzaro 将分享 Nemotron™ 开源模型从架构到部署的全链路实践。大会还开设大语言模型训练与推理、开源模型与运行时、物理 AI / 机器人、AI 基础设施四大技术分论坛,更有 NVIDIA 黑客松总决赛路演等精彩内容。十月苏州,现场见!
如对注册有任何疑问及反馈,请发送邮件至 china_developer@nvidia.com,我们会为您解答。
2026 NVIDIA 黑客松总决赛路演:2026 年度各场开发者黑客松的优秀团队现场展示项目、并由专家评委打分决出优胜团队。
实战培训:NVIDIA 深度学习培训中心 (DLI) 面向开发者提供免费的全天实战培训与实训营,聚焦代理式 AI、仿真与物理 AI、智能体前沿技术,提升端到端的开发实战能力。
NVIDIA 认证:NVIDIA 深度学习培训中心 (DLI) 面向开发者提供免费的 NVIDIA 认证现场考试,涵盖生成式 AI、多模态、AI 基础架构和数据科学,验证技能,拓展个人职业生涯,构建高效技术团队。
主论坛欢迎 / 开幕:欢迎致辞
颁奖:颁奖典礼
演讲:聆听技术专家分享,深入了解大模型的训练与推理、开源模型、物理 AI 与机器人,以及 AI 基础设施领域的最新进展。
NVIDIA 认证:NVIDIA 深度学习培训中心 (DLI) 面向开发者提供免费的 NVIDIA 认证现场考试,涵盖生成式 AI、多模态、AI 基础架构和数据科学,验证技能,拓展个人职业生涯,构建高效技术团队。
主论坛 |
|
| 9:30 ─ 9:40 | 欢迎致辞 Ankit Patel | NVIDIA 开发者市场副总裁 |
| 9:40 ─ 10:20 | Cosmos 与世界模型 —— 构建理解物理世界的 AI 刘洺堉 | NVIDIA Cosmos Lab 副总裁 介绍世界基础模型如何让 AI 理解物理环境、预测演化并规划动作。开发者将了解可扩展、可控且具备物理依据的数据生成,说明其对机器人、自动驾驶等物理 AI 为何关键,以及如何把真实数据、仿真与生成式世界模型结合起来,加速开发并降低实机测试的成本与风险;物理 AI 的下一步,取决于模型、仿真平台、开发者与产业伙伴共同构成的生态。 |
| 10:20 ─ 11:00 | NVIDIA 与开源 AI 生态赋能开发者 Bryan Catanzaro | NVIDIA 应用深度学习研究方向 (ADLR) 副总裁 介绍 NVIDIA Nemotron™ 开源模型的构建方式,覆盖架构、训练数据、权重、后训练配方与评测。开发者将了解如何检视、适配并部署这些模型,将其应用于物理 AI、生物、科学与机器人等场景,以及开放数据、开放权重与可复现配方对透明度、监管和生产部署的意义。 |
| 11:00 ─ 11:50 | 圆桌 - 从开放到可控:开源 AI 技术栈的 Harness 实践 赖俊杰 | NVIDIA 工程和解决方案副总裁 吴自华 | NVIDIA GPU 计算专家 Ligeng Zhu | NVIDIA Research 研究员 周宇 | Dify 工程后端工程师 / 产品经理 张家驹 | vLLM 社区大使 周旭 | StepFun 阶跃星辰开放平台 Harness 产品经理 |
大语言模型训练与推理专场 |
|
| 13:30 ─ 14:15 | 基于 CuteDSL 的 MegaMoE 实现 张毅 | NVIDIA GPU 计算专家 申邦渝 | NVIDIA 计算架构工程师 MoE 模型在 Expert Parallel 部署下,专家层通常由 all-gather、expert GEMM、topk reduce、reduce-scatter 四个阶段串行组成,通信与计算无法重叠,小 batch 场景下 launch 与同步开销尤为突出。 本次分享介绍我们基于 CuTeDSL 在 Blackwell/Hopper 架构上实现的 MegaMoE:将 token dispatch、FC1 + SwiGLU + 量化、FC2 以及跨 rank combine 全部融合进一个 persistent kernel,用 warp specialization 让通信 warp 与 GEMM warp 并发常驻,实现高效的通算融合。 |
| 14:15 ─ 15:00 | 结合 Megatron Core 的 DeepSeek-V4 大规模训练实践解析 白鸿骁 | NVIDIA GPU 计算专家 本场演讲以 DeepSeek-V4 在 NVIDIA GPU 上的训练为例,介绍如何基于 Megatron Core 优化多种上下文长度下的执行路径、显存策略和并行负载。通过一系列优化实验,解析如何结合模型特性、软硬件约束与性能数据,做出优化决策。 |
| 15:00 ─ 15:45 | 面向高效 LLM 服务的 KV Cache 压缩 黄薇 | NVIDIA GPU 计算专家 徐频捷 | NVIDIA GPU 计算专家 超长上下文智能体应用推高了 KV Cache 存储需求,并冲击 TTFT 与推理吞吐。本场概述现有 KV Cache 压缩方法,通过 KVTC、nvCOMP 与 TurboQuant 等案例,讨论如何在真实推理系统中落地这些技术、以及会遇到哪些工程挑战。 |
| 15:45 ─ 16:30 | Dynamo:为智能体推理基础设施加速 卢翔龙 | NVIDIA 解决方案架构师 智能体负载把推理 SLA 从单次请求变成整个会话:上下文持续增长、工具调用与生成交错,同一会话的 KV Cache 能否命中直接决定成本。 本场介绍 NVIDIA Dynamo 的四个开源机制,以及讨论公开智能体轨迹数据上的实验结果与特性适用边界。 |
开源模型与运行时专场 |
|
| 14:00 ─ 14:30 | 超越多模态:以开放权重构建全模态 AGI 李元 | MiniMax 开源生态负责人 本场将介绍 MiniMax 如何从单一模态的理解进一步拓展到文本、语音、图像与视频的统一多模态理解、生成与交互,并以 M3、H3 等模型探索原生音视频生成。演讲还将讨论开放权重对部署、微调与扩展的意义,以及与 NVIDIA、推理框架和开源社区一起,让全模态模型更加高效、易用和普及。 |
| 16:00 ─ 16:30 | 基于 SGLang 规模化服务 Agentic AI 蔡尚铭 | SGLang 社区核心开发者 本场将介绍 SGLang 如何通过集群级上下文复用,实现智能体工作负载的规模化推理服务。内容涵盖 Prefill/Decode 分离与分层 KV Cache、利用 UnifiedRadixTree 统一管理不同注意力架构的缓存,以及如何通过缓存与会话感知路由,提升上下文复用率和资源利用率,并降低端到端时延。 |
| 17:00 ─ 17:30 | NVIDIA 推理栈与开放生态 钟莹莹 | NVIDIA 解决方案架构经理 本场将介绍开发者与合作伙伴如何在 NVIDIA 加速平台上优化自有模型、推理工作流与服务场景;如何用 NVIDIA 推理工具构建服务、调优性能并借助 dashboard 选型;以及 NVIDIA 如何通过优化、系统集成与参考工作流,帮助开源模型与框架进入可扩展的生产服务。 |
物理 AI / 机器人专场 |
|
| 13:30 ─ 14:05 | GPU 加速的第一人称视角数据流水线 杜鹃 | NVIDIA 解决方案架构师 本报告介绍一套以第一人称视角 (EgoCentric) 为核心的数据处理流水线,能够将人体动作捕捉数据高效转化为机器人可直接使用的动作数据。重点会包含如何进行 GPU 的分析和优化提高数据处理的吞度,以及如何在视频数据基础上假如基于物理的约束。 |
| 14:05 ─ 14:40 | NVIDIA 世界模型 Cosmos 推动跨领域物理 AI 发展 肖萌萌 | NVIDIA 解决方案架构师 冀永南 | NVIDIA 医疗行业生态负责人 本次演讲介绍 Cosmos 3 世界模型的架构设计,解析其对物理 AI 开发迭代的加速作用。展示 Cosmos 赋能的智能驾驶、医疗场景生成与场景理解应用,讲解基于 Cosmos 开发的 Alpamayo 模型如何助力智能汽车 VLA 构建,并探讨 Isaac Sim、医疗专用 Cosmos-H, Gr00T-H 等 NVIDIA 物理 AI 技术,如何赋能自主手术与医疗物理 AI。 |
| 14:40 ─ 15:15 | 机器人学习技术栈的实践优化:Isaac Lab 3.0 运行时加速与 SONIC 全身控制训练 康晖 | NVIDIA 加速计算专家 王飒 | NVIDIA 加速计算专家 该演讲第一个部分首先聚焦 Isaac Lab 3.0 的 Newton 与 Warp 路径,以及在此基础上的 Direct-Warp 加速工作。结合 Unitree RL Lab 的迁移案例,介绍相关优化技巧,同时分享 G1 环境中的性能结果,以及物理后端和执行路径改变后的训练正确性验证。然后聚焦 Whole-Body Control 和视觉机器人学习工作负载优化。该演讲还会介绍如何高效地用 SONIC 训练 Whole-Body Control 模型。 |
| 15:15 ─ 15:50 | 基于 Isaac Lab 的 GPU 加速异构仿真与多任务强化学习训练 张瑞 | NVIDIA 解决方案架构师 异构多任务模拟对于从零开始的强化学习 (RL) 以及视觉语言增强 (VLA)/弱监督适应 (WAM) 强化学习 (RL) 的后期训练都至关重要。第二部分将展示 Isaac Lab 3.0 如何支持异构仿真和多任务强化学习 (RL) 训练。 |
| 15:50 ─ 16:25 | 基础模型的训练和推理优化 郑涛 | NVIDIA 解决方案架构师 康齐瀚 | NVIDIA 加速计算专家 机器人基础模型的推理性能直接影响机器人系统的响应速度与实时性。本次分享以 GR00T、Pi 等模型为例,介绍 Jetson Thor 平台上面向实时推理的加速方法与最佳实践,并分享端侧部署的运行时内存优化技巧,帮助在有限资源约束下提升系统性能与部署性价比。 |
AI 基础设施专场 |
|
| 13:30 ─ 14:05 | NVIDIA KV Cache 卸载框架 王斌 | NVIDIA 解决方案架构师 本场介绍 NVIDIA 最新的 KV Cache 卸载方案,梳理 KVCR 整套框架如何协同工作,以支撑更长上下文与更高吞吐的推理服务。 |
| 14:05 ─ 14:40 | NIXL 框架及其在推理中的用法 王璟珣 | NVIDIA 解决方案架构师 本场介绍如何用 NIXL 实现接近硬件上限的 KVCache 传输与权重同步,如何灵活搭建多层 KVCache 存储,以及 NIXL 近期新增的能力如何服务推理系统。 |
| 14:40 ─ 15:15 | NVIDIA DSX:为下一代 AI 工厂最大化每瓦 Token 彭少丽 | NVIDIA 解决方案架构师 本场从 AI 工厂面临的能效与吞吐挑战出发,介绍 NVIDIA DSX 的架构、蓝图与软件栈,以及它能为客户带来的价值与落地路径,目标是提升下一代 AI 工厂的每瓦 Token。 |
| 15:15 ─ 15:50 | 智能体基础设施:DOCA Vault/DOCA Argus/DOCA VFS 杨雪 | NVIDIA 解决方案架构师 本场介绍面向智能体的 DOCA 基础设施:Argus 在 BlueField DPU 上做无代理运行时安全与数据路径隔离;Vault 以零信任方式保护智能体文件访问;VFS 则把模型与工具产物等文件 I/O 从主机 CPU 卸载到可组合、隔离的存储。 |
参加活动需要拥有 NVIDIA 账户。
填写申请表,根据您的时间安排申请可以参加以及感兴趣的活动。
当您的参会申请获得批准后,您将收到确认电子邮件及短信。请确保将 nvidia.com 域名添加到您的安全列表中,以避免电子邮件被标记为垃圾邮件。
亲临现场,准时出席您报名的活动。
直击 Agent 实战落地,见证开发者巅峰对决!
席位有限,立即注册!请于表单置顶处勾选「2026 NVIDIA 黑客松总决赛路演」,填写信息完成报名。
免费报名 AI 开发实战培训。每位报名者最多可选择 1 门培训 (全天或半天)。
席位有限,以收到确认邮件为准。
免费报名现场考试,每位报名者最多可选择 1 门 Associate 级别认证。
席位有限,以收到确认邮件为准。
注册参加开发者日,选择您感兴趣的活动并与在场行业专家和同道中人交流互动。