跳到主要内容

引领物理AI与下一代算力革命

· 阅读需 13 分钟
otqsoft
Front And Rear End Engineers @ gitee

在CES 2026上,英伟达创始人兼CEO黄仁勋发表了主题为 “计算的炼金术”(The Alchemy of Computation) 的演讲。本次演讲的核心论点是:计算行业正在经历从软件到硬件的全面重构,AI将从数字世界走向物理世界,而英伟达通过其全栈技术,正成为这场新工业革命的基石引擎。

核心战略:引领双重平台变革

英伟达指出,计算行业正同时经历两场十年一遇的平台级变革

  1. 从通用计算到加速计算:传统计算范式正在被加速计算所取代。
  2. 从传统应用到生成式AI:应用范式正在被生成式AI重塑。

这场变革导致了整个技术栈的全面重构,具体表现为:从代码驱动转向模型驱动、从CPU转向GPU、从预编译转向生成式、从应用优先转向AI优先。这催生了一个价值高达10万亿美元的待现代化的计算市场。

三大技术革命支柱

基于上述战略判断,英伟达发布了支撑未来发展的三大技术支柱。

物理AI革命:让AI走进现实世界

英伟达认为,AI的下一个前沿是突破屏幕限制,进入并理解物理世界,即 “物理AI(Physical AI)” 。其核心架构是 “三位一体” ,即训练计算机、推理计算机、模拟计算机,其中模拟是几乎所有物理AI工作的基础。

  • 关键平台与模型:
    • COSMOS:被称为物理AI的 “ChatGPT时刻” ,是一个世界基础模型。它能基于物理规律生成无限多样的合成数据,用于生成物理AI技能、对齐多模态信息等。
    • Alpha Mayo:全球首个推理型AI,采用端到端训练,能根据摄像头输入推理下一步行动及原因,旨在解决自动驾驶等领域的“长尾难题”。
    • Omniverse:作为机器人的创世引擎,用于生成海量合成数据训练机器人。
  • 重大产业合作:
    • 梅赛德斯-奔驰达成战略合作,目标在2026年第一季度让搭载其DRIVE Thor平台及Alpha Mayo模型的车辆全球上路,合作规模目标达1亿辆
    • 西门子达成战略合作,将英伟达AI全栈集成至工业软件中,贯穿设计、生产、运营全生命周期,定义 “未来工厂 = 巨型机器人”

开源模型与智能体系统:重构软件生态

英伟达宣布致力于 “锻造世界顶级的开源模型” ,并发布了覆盖多领域的开源模型矩阵,例如:

  • Nemo Tron 3:语言模型,采用混合SSM架构,实现极速推理。
  • OpenFold 3:生物学模型,用于理解蛋白质结构与生成。
  • ForecastNet:物理世界模型,旨在革新天气预测。

同时,演讲强调未来AI的新原子单元是AI代理(Agent),需具备规划、推理、执行和研究能力。为此,英伟达提出了 “智能体路由(Agent Routing)” 技术,可动态组合调用多个专家模型,构建专属AI系统。

Vera Rubin平台:下一代AI算力底座

为应对AI性能需求每年10倍的增长与晶体管性能增长(仅1.6倍/年)之间的巨大差距,英伟达发布了全新Vera Rubin计算平台,该平台已全面投产。

  • 设计理念:采用极致协同设计,整合自研芯片与技术。
  • 核心组件与性能:
    • Rubin GPU:晶体管数量比前代增长1.6倍,浮点性能提升5倍
    • Vera CPU:为AI超算定制,每瓦性能是前代Grace的2倍
    • BlueField-4 DPUSpectrum-X AI以太网NVLink 6 Switch:提供极高的网络互联带宽。
  • 物理创新:采用零线缆、零风扇、直接芯片液冷设计,使用45℃温水冷却,极大简化数据中心部署。
  • 研发投入:该平台研发总计投入了15,000工程师年

总体定位

英伟达将自身定位为 “世界领先平台的AI引擎” 。通过上述从物理AI、开源软件生态到下一代算力基础设施的全栈布局,英伟达旨在从硬件、软件到应用全面引领下一波AI浪潮,推动一场新的工业革命。

物理AI技术深度解析

物理AI并非一个单一的产品,而是英伟达为应对“AI走出屏幕”这一核心挑战所构建的一整套技术体系。它旨在赋予AI系统理解并安全作用于物理世界的能力,其实现依赖于一个被官方称为“三位一体”的架构,以及支撑该架构的多个关键平台组件。

🔬 核心理念与使命

其核心使命在于突破AI的“屏幕限制”,解决传统AI模型普遍缺乏的物理常识。这些常识包括对重力、摩擦力、运动与因果关系的理解。同时,它旨在弥合因真实世界数据“收集缓慢、昂贵且永不满足”而产生的数据鸿沟

⚙️ 三位一体技术架构

物理AI的实现依赖于一个全新的基础计算架构,由三类专用计算机组成:

  • 训练计算机:负责对物理AI模型进行大规模的训练与优化。

  • 推理计算机:负责将训练好的模型高效地部署到终端(如汽车、机器人),进行实时决策与响应。

  • 模拟计算机:被定义为“几乎所有物理AI工作的基础”。通过创建物理级精准的虚拟世界,提供无限、安全、可控的环境来生成合成数据、验证算法和预演复杂交互,是连接训练与推理的关键桥梁。

    img

🧠 核心技术组件解析

物理AI技术栈由以下几个已发布的关键平台与模型构成:

  1. COSMOS:世界基础模型
    • 定位:物理AI领域的 “ChatGPT时刻”。它是一个基于物理规律构建的生成式模型。
    • 功能:
      • 生成无限合成数据:能够根据物理定律,生成无限多样、物理连贯的合成数据(如视频序列),为机器人、自动驾驶等系统提供近乎无限的训练素材。
      • 多模态对齐:将语言、图像、3D模型与动作指令对齐,形成统一的世界表示。
      • 交互与推理:支持交互式闭环模拟,并能对物理场景进行推理、分析与预测。
    • 价值:从根本上解决了高质量物理数据稀缺的瓶颈,实现了 “计算炼成数据” 的范式。
  2. Alpha Mayo:首个推理型AI“大脑”
    • 定位:全球首个端到端训练的推理型AI。
    • 核心特性:
      • 端到端映射:直接实现从传感器(如摄像头)输入到行动指令的输出,极大地简化了系统复杂性。
      • 长尾场景推理能力:其核心突破在于能够推理“下一步行动及原因”。这意味着面对从未见过的复杂场景(“长尾问题”),它能基于对物理世界的理解进行逻辑推导,而非依赖预先记录的海量数据。
    • 部署基石:运行在专为机器人系统设计的DRIVE Thor芯片之上,该芯片具备最高等级的功能安全认证和双处理器冗余设计。
  3. Omniverse:机器人的“创世引擎”
    • 定位:物理AI的虚拟训练场与开发平台。
    • 作用:作为物理级精准的仿真宇宙,Omniverse 是运行COSMOS和训练Alpha Mayo等AI的底层环境。它使得在虚拟世界中大规模、低成本、高效率地测试和迭代物理AI算法成为可能。

🚗 产业落地:从技术到规模化应用

物理AI技术已锁定明确的标杆应用,并进入大规模部署阶段:

  1. 自动驾驶与智慧出行
    • 合作方:与梅赛德斯-奔驰达成深度战略合作。
    • 落地计划:自2026年第一季度起,全球将有1亿辆新车搭载基于DRIVE Thor和Alpha Mayo的物理AI系统,并支持持续的OTA更新。
    • 安全冗余:采用双堆栈安全设计,融合“经典自动驾驶堆栈”(确保绝对安全与可追溯性)与“Alpha Mayo AI堆栈”(提供卓越性能与推理能力)。
  2. 工业制造与未来工厂
    • 合作方:与西门子达成战略合作。
    • 愿景:定义 “未来工厂 = 巨型机器人” 。将英伟达物理AI全栈技术深度集成到西门子的工业软件中,贯穿产品设计、生产制造、运营维护的全生命周期,实现物理世界与数字世界的智能闭环。

这一系列技术的协同,标志着AI从处理数字信息的软件,正式进化为能够理解、推理并安全操作物理实体的新一代智能系统。

Vera Rubin计算平台技术解析

为弥合AI算力需求每年10倍增长与晶体管性能每年仅1.6倍增长之间的根本性矛盾,英伟达推出了采用“极致协同设计”理念的Vera Rubin平台。它并非单一芯片的迭代,而是一个从底层芯片、互联网络到物理散热进行全栈重构的系统级AI算力底座,旨在为全球AI工厂提供满足未来指数级需求的基础设施。

🔩 设计哲学:极致的协同设计

Vera Rubin平台的核心设计思想是打破传统硬件堆叠的路径依赖,将GPU、CPU、DPU、网络交换机及物理冷却系统进行深度整合与协同优化。这一理念旨在系统性解决数据在计算、存储和传输过程中的每一个瓶颈,而非进行单点性能提升。为此,英伟达累计投入了15,000工程师年进行研发,体现了其系统级创新的深度与广度。

img

🧩 核心硬件架构:全栈自研的算力模块

一个标准的Vera Rubin计算模块是一个高度集成的系统单元,其核心构成如下:

  • 4颗 Rubin GPU:作为主要的AI算力引擎。
  • 2颗 Vera CPU:为AI超算定制的“智慧大脑”。
  • 4颗 BlueField-4 DPU:用于卸载虚拟化、安全与网络任务的“智能管家”。
  • 8个 ConnectX-9 网络接口卡

该模块实现了零线缆、零软管、零风扇的物理设计,将包含2.2万亿个晶体管的复杂系统集成在一个重量约2吨的紧凑单元中。

1. Rubin GPU:性能与能效的飞跃

Rubin GPU在架构上实现了代际跨越:

  • 晶体管与性能:晶体管数量较前代Blackwell架构提升1.6倍,并在此基础之上实现了5倍的浮点性能提升。
  • MVF P4 张量引擎:这是其关键创新,支持硬件级自适应精度。该引擎无需软件干预,即可在处理器内部动态调整计算精度与结构,在吞吐量与精度之间实现最优平衡,为混合精度训练与推理提供底层硬件支持。

2. Vera CPU:为AI定制的“智慧大脑”

Vera CPU专为协同GPU进行大规模AI计算而设计:

  • 能效核心:采用88核 / 176线程设计,其每瓦性能是前代Grace CPU的2倍
  • 空间多线程技术:确保每个线程都能获得完整的执行性能,避免资源争抢。
  • 惊人的I/O性能:专门优化了GPU间的高速数据共享能力,确保数据在CPU与GPU之间以及GPU与GPU之间能够极速流动。

3. BlueField-4 DPU:让计算更纯粹

BlueField-4 DPU作为每个计算节点的标准配置,其核心使命是卸载。它将虚拟化、安全策略、存储访问和网络功能等任务从CPU/GPU上剥离,使得主计算单元能够专注于纯粹的AI计算任务,同时保障了多租户环境下的安全隔离。

🌐 互联与数据流重构:消除网络瓶颈

Vera Rubin平台重新定义了数据中心内部的数据流动方式,旨在让“网络成本趋近于零”。

  • 机架内神经(NVLink 6 Switch):提供高达240 TB/s的机架内互联带宽。这一带宽被官方形容为超过全球互联网总带宽的2倍,彻底消除了GPU间数据交换的瓶颈。
  • AI工厂动脉(Spectrum-X AI以太网):用于连接不同机架与集群,其网络吞吐性能较传统方案提升25%,显著降低了大规模AI训练与推理中的网络通信开销。

🏗️ 物理与能效工程:重新定义数据中心

平台的物理设计是其颠覆性优势之一:

  • 100% 直接芯片液冷:整个计算模块采用直接液冷设计,使用45℃的温水作为冷却液。这一创新使得数据中心无需再配备昂贵的冷水机组,极大简化了基础设施,降低了整体能耗与复杂度。
  • 部署革命:得益于高度集成与简化的设计,将一个Vera Rubin计算模块的部署时间从传统方式的数小时缩短至仅需5分钟,大幅提升了数据中心的运营效率和灵活性。

📊 平台整体性能指标

通过上述全栈协同设计,Vera Rubin平台实现了碾压式的性能飞跃(官方对比前代平台):

  • 峰值推理性能提升:5倍
  • 峰值训练性能提升:3.5倍
  • 单个计算模块AI算力:100 PFLOPS

🎯 解决的核心挑战:面向未来的架构

Vera Rubin的设计前瞻性地瞄准了下一代超大规模AI模型的核心瓶颈——KV缓存(Key-Value Cache)**问题。KV缓存是Transformer类模型推理时的“工作记忆”,随着模型参数增至万亿级、上下文长度趋向无限,KV缓存的规模将爆炸性增长,导致每生成一个Token都需要读取海量数据,成为网络流量激增的“万恶之源”。 为突破此瓶颈,平台集成了硅光子连接技术**。该技术采用台积电(TSMC)的Co-op硅光子集成工艺,将光模块直接与芯片连接。其首款产品**Spectrum-X 新一代AI以太网交换机可提供512个200 Gbps端口,以光子替代电子进行高速数据传输,从根本上为未来模型所需的海量数据流动做好了准备。

最后更新时间: 2026/7/31 13:40:35|访问次数: 0|豫ICP备2025159864号|