NVIDIA Vera Rubin 正式登场,正迈向十亿瓦级规模部署。
Vera Rubin NVL72 的量产正全面加速,CoreWeave、Google Cloud、Microsoft Azure 和 Oracle Cloud Infrastructure 等合作伙伴的机架已投入运行。Vera Rubin 的供应链覆盖 30 个国家的 350 多家工厂,拥有迄今为止规模最大、最成熟的机架级供应链,旨在全面满足客户的算力需求。
Vera Rubin 平台从芯片到电网进行了全栈协同设计,旨在提供最高的每瓦性能和最低的 Token 成本。CoreWeave 针对 DeepSeek-R1 的首次基准测试结果充分证明了这一点:其每兆瓦吞吐量比 Grace Blackwell NVL72 提升了 10 倍——这直接切中了电力受限的 AI 工厂最关心的核心指标。
通过极致协同设计提升性能
取得这一突破的关键在于七款芯片和五种机架托盘之间的极致协同设计。五种机架系统包括 Vera Rubin NVL72、Vera CPU 机架、Groq 3 LPX、Spectrum-6 SPX 和 Vera BlueField-4 STX。它们被作为一个完整的系统进行工程研发,而非由通用产品简单拼凑而成。
NVIDIA Vera CPU 正是其核心所在。它重新定义了“AI 工厂 CPU”应有的形态。专为智能体时代设计,其定制 Olympus 核心相较竞品的芯粒 (chiplet) 方案,单线程性能提升 2 倍、核间带宽提升 3 倍、内存延迟降低 40%,使其成为面向最关键智能体负载时最高效的单线程 CPU。
以专属定制网络,加速 AI 工厂建设
在网络方面,该平台的第六代 NVLink 纵向扩展技术在处理复杂工作负载时,相比通用以太网,吞吐量提升超过 2 倍、延迟降低 1/3、数据包处理速率提升 10 倍。在横向扩展方面,Spectrum-X 以太网集成 102.4T 的 Spectrum-6 交换机系统、1.6T 的 ConnectX-9 SuperNIC、自适应路由、高级拥塞控制、遥测技术以及开放的操作系统支持,使其 RDMA 带宽比通用以太网高出 1.6 倍。
包括 CoreWeave、微软、SpaceXAI 和 Tesla 在内的全球领先的 AI 基础设施建设者率先采用 Spectrum-6 交换机,以加速其 AI 工厂的建设。此外,采用 NVIDIA 光电一体化封装 (CPO) 技术用于横向扩展,这是全球首款实现量产的同类型交换机,与传统可插拔收发器相比,其能效提升了 5 倍,平均无故障间隔时间 (MTBI) 提升了 10 倍。CoreWeave、Lambda 和 OCI 率先采用该技术。
Spectrum-XGS 以太网跨站点吞吐量提升 1.9 倍,实现跨站点性能增强。满足十亿瓦级 AI 工厂的建设不再局限于单一建筑的需求。
同时,NVLink Fusion 向第三方 XPU 开放了 NVIDIA 基础设施平台,为合作伙伴能够借助成熟的 NVLink 纵向扩展堆栈和生态系统,实现产品的快速上市。
节省部署时间,节约水资源
经过三代机架级协同设计的迭代,NVIDIA 打造出的 Vera Rubin NVL72 系统实现了托盘内无电缆、无风扇、无液冷软管的极简设计,将计算托盘的组装时间从过去的数小时大幅缩短至仅需 1 分钟。
45 摄氏度的液冷进水温度设计,使得系统无需冷水机组,仅靠干式冷却器即可运行。对于新建的 AI 工厂而言,这种高温干式冷却结合闭环液冷系统,每兆瓦每年可节省数百万加仑的水资源。
NVIDIA Vera Rubin 驱动欧洲开放模型时代

Vera Rubin 正为欧洲的 AI 基础设施注入下一代性能。
Vera Rubin 也是微软与 Mistral 新一轮深化合作的基石。该合作将前沿 AI 带到了欧洲,把开放的欧洲模型与云环境及客户管理的环境相结合,使各国政府和重点监管行业能够按照自身需求采用 AI 技术。
这项合作的背后,是一项旨在扩大欧洲 AI 基础设施的数十亿美元新协议。Mistral 正在扩充其 GPU 算力,通过引入数千个最新的 NVIDIA Vera Rubin GPU,增加面向客户的 AI 算力供给,并为训练、推理和大规模部署提供共享平台。
NVIDIA Vera Rubin 正迈入全面量产阶段。这款机架级 AI 超级计算机将七款协同设计的全新芯片整合为一个统一系统,它将调用数万个 GPU,为新一代 Mistral Compute 和微软欧洲的 AI 基础设施提供动力。
欧洲希望在遵循自身法律的情况下,在本地完全自主可控地运行全球最强大的 AI。同时,其面临的挑战也在不断升级:智能体系统消耗的 Token 数量可达传统 AI 应用的 15 倍,这使得高效的基础设施成为重点。满足这一需求不仅需要庞大的计算能力,更需要 AI 在实现高效扩展的同时,满足区域对数据控制、治理、可靠性及战略自主的要求。
Vera Rubin 为欧洲的开放模型生态系统提供了计算基础。其全栈架构融合了加速计算、网络与软件,使模型和智能体能够从训练到生产实现高效运行。
为企业级 AI 打造的开放模型
微软、Mistral 与 NVIDIA 共同在公共云、云连接以及完全断开连接的私有云环境中,提供适配的 AI——将开放模型的灵活性与大规模运行所需的基础设施结合。
Mistral Medium 3.5 和 OCR 4 现已在 Microsoft Foundry 上线,同时 Mistral 模型也已集成至 Microsoft Copilot Studio。客户可以通过 Azure Local 和 Foundry Local 在云端和客户自主控制的环境中使用相同的模型、工具和运行模式。
符合欧洲标准的 AI
政府机构可将 AI 应用于涉及敏感业务的工作流;医疗和金融服务机构可在满足区域合规要求的前提下进行部署;制造商可在本地处理数据以实现更快速的决策。与 NVIDIA GB200 NVL72 相比,Vera Rubin NVL72 每兆瓦的 Token 产出提升高达 10 倍,每百万 Token 的成本降至原来的十分之一,在同等功耗下提供更强大的智能算力。
打造真正适配当地语言、文化与法规的 AI 不应要求组织在创新、经济效益与控制权之间做出取舍。以 Vera Rubin 为计算基础,依托微软和 Mistral 提供的自主云基础设施与欧洲开放模型,欧洲完全可以三者兼得。
详情请参阅微软与 Mistral 的新闻稿。
CoreWeave 基准测试显示,NVIDIA Vera Rubin 系统每兆瓦 Token 吞吐量达 Blackwell 的 10 倍

通过与 NVIDIA 进行极致的协同设计,CoreWeave 正依托 Vera Rubin NVL72 实现数量级的性能跃升。
与 CoreWeave 等合作伙伴的紧密协作,对于将新一代 NVIDIA 加速计算成功部署至 AI 工厂至关重要。
经过数月的联合工程研发,CoreWeave 成为首家完成 Vera Rubin NVL72 部署与验证的 AI 云服务提供商——他们首次公布了基于实际运行硬件测得的性能数据。
CoreWeave 在 Vera Rubin NVL72 上运行了 DeepSeek-R1 基准测试。结果显示,与 Grace Blackwell NVL72 相比,Vera Rubin NVL72 每兆瓦每秒 Token 吞吐量提升了 10 倍。
每兆瓦 Token 吞吐量是决定 AI 基础设施能否实现大规模盈利的核心指标。每兆瓦产出的 Token 越多,意味着在同等电力预算下能产出更多的智能算力,或者在显著降低功耗的情况下处理相同的工作负载。Jane Street 等 AI 实验室和企业将采用 Vera Rubin 平台,在 CoreWeave 云上扩展其 AI 工厂。
借助 NVIDIA Spectrum-X 突破瓶颈
DeepSeek R1 采用的混合专家 (MoE) 架构,在大规模部署场景下 GPU 间的 all-to-all 通信成为一项关键需求:每个 Token 都必须在分布式的专家子网络中进行路由。Vera Rubin NVL72 配备的 260 TB/s all-to-all NVLink 6 互连架构彻底消除了这一限制,使整个机架能够作为统一的加速器运行。
CoreWeave 是首批部署 NVIDIA Spectrum-X 以太网 SN6600-LD,将其作为 Vera Rubin NVL72 交换网络架构的企业之一。
CoreWeave 基于 102.4 Tb/s 的 Spectrum-6 交换芯片并采用液冷设计,部署了高密度交换机架,单机架可提供 1.64 Pb/s 的带宽,容量较上一代风冷交换机提升了 100%。此外,CoreWeave 还提供完全无阻塞、多平面、多轨方案的 Spine and Leaf 网络架构,确保使用 Vera Rubin NVL72 构建的系统 GPU 之间无阻塞互连通信。
NVIDIA Vera Rubin 系统驱动全新 Google Cloud A5X 实例,助力 Ineffable Intelligence 发展

NVIDIA Vera Rubin NVL72 正在为 Google Cloud 的首个 A5X 实例提供算力支持,该实例现已由伦敦初创公司 Ineffable Intelligence 率先采用。
Ineffable Intelligence 致力于开发新一代智能“Superlearner”系统,该系统能够通过经验持续学习,从而在各个领域实现新的突破。
Ineffable Intelligence 的智能体直接从与环境的交互中学习,而非依赖静态数据集。Ineffable 没有使用大语言模型(LLMs),而是通过强化学习来开发“Superlearner”系统。该系统在持续模拟的大规模并行环境中生成经验,并迅速将这些经验转化为策略更新与评估。这种紧密耦合的学习闭环对算力、内存带宽和互连技术提出了极高的要求,需要基础设施能够在极大的规模下以极低的延迟运行。
Ineffable Intelligence 联合创始人 Lasse Espeholt 表示:“下一个研究时代,必须依托下一代的硬件。能与 NVIDIA 和 Google Cloud 的团队合作,让我们得以抢先体验 Vera Rubin,我们深感荣幸。这两个团队给予了极具价值的支持:我们的系统几乎立即完成部署并启动运行,目前已经在为 Superlearners 系统测试基础设施。”
NVIDIA Vera Rubin NVL72 专为这类智能体训练而设计,能够提供可预测的低延迟、高利用率,以及远超上一代系统的单位智能算力产出。这使其成为大规模强化学习的理想平台选择。
在 Google Cloud Next 上发布的 Google Cloud A5X 实例是基于 NVIDIA Vera Rubin NVL72 机架级系统构建的裸金属实例。与上一代相比,其每 Token 推理成本降低至 1/10,每兆瓦 Token 吞吐量提升了 10 倍。
A5X 采用 NVIDIA ConnectX-9 SuperNICs 并结合了新一代 Google Virgo 网络,能够在单一站点内扩展至数万个 NVIDIA Rubin GPU,在跨多站点配置下更可扩展至近百万个 GPU 集群。这为客户提供了一套统一的、针对 AI 优化的技术栈,用于前沿模型、开放模型、智能体模型和物理 AI 模型的训练、微调和服务部署,同时实现了性能、成本和可持续性的全面优化。
这一基础设施旨在助力解锁下一代强化学习系统,推动超级学习和超级智能领域的突破。
NVIDIA Vera CPU 助力 DeepInfra AI 云实现编排速度翻倍

DeepInfra 的基准测试结果显示,NVIDIA Vera CPU 的运行速度是其他 CPU 的 2 倍以上,并且能够支持更多并发的 AI 智能体。
作为 NVIDIA 开放 AI 生态系统的早期伙伴,云平台 DeepInfra 基于其生产级 AI 智能体基础设施,独立设计并运行了基准测试。DeepInfra 每周处理近 5 万亿个 Token,其中约 30% 由智能体系统驱动。其云平台专为高吞吐量的 AI 推理而打造。
基准测试表明,在保持相同服务质量的前提下,Vera CPU 支持的并发 AI 智能体数量比其他 CPU多出高达 1.6 倍,编排速度快 2.2 倍,同时还能提高基础设施的利用率和成本效益。这些结果充分证明,NVIDIA Vera CPU 能够提供生产级智能体 AI 所需的成本效益、低延迟和高吞吐量。
随着 AI 智能体承担起越来越复杂的推理、规划、工具调用和数据传输任务,对于编排每次模型调用前后相关的工作而言,CPU 的性能正变得愈发重要。
作为 NVIDIA 面向 AI 工厂的极致协同设计理念的一部分,Vera CPU 专为智能体工作负载而打造。DeepInfra 的基准测试充分凸显了 NVIDIA Vera CPU 如何帮助云服务提供商提升基础设施利用率、提高成本效益,并在保持相同服务质量的前提下支持更多并发的 AI 智能体。
深入了解 NVIDIA Vera Rubin 平台。
