XPU 如何满足世界级 AI 工厂的需求

通过部署定制芯片并结合领先的 AI 基础架构,超大规模企业和 AI 原生公司能够构建兼具专业化与规模化的灵活 AI 工厂。
作者

为了大规模生成智能,AI 工厂需要持续运行,其经济效益由交付的输出决定:每秒 Token 数、每瓦特 Token 数、每 Token 成本、利用率和正常运行时间。

这需要将 AI 基础设施作为完整的工厂来设计和构建,而不是简单地将加速器堆积在一起。

构建定制 XPU 的超大规模企业和 AI 原生公司不仅要考虑 XPU 本身的设计,还要考虑整个 AI 平台的设计和开发,包括纵向扩展和横向扩展网络、整机架方案、生产工厂软件以及强大的供应商生态系统。

面对 AI 工厂规模需求,这条路径既复杂又昂贵,成为 XPU 快速推向市场的根本性障碍。

打破这一限制意味着要将定制 XPU 与经过验证、成熟可靠的基础架构相结合,使建造者能够将创新重点放在最重要的地方,同时利用已有的技术解决其他问题。

NVLink Fusion 正是为满足这种需求而打造,将 XPU 连接到 NVIDIA 领先的 AI 基础设施,为半定制 AI 算力工厂提高性能、加快上市速度并降低风险。

通过高速纵向扩展释放 XPU 性能

对于运行万亿参数模型,混合专家模型 (MoE) 和代理式 AI 等现代工作负载,如果纵向扩展网络性能无法满足需求,利用率就会显著下降,每 Token 成本也会上升。

纵向扩展网络解决方案必须在以下三个关键维度上表现出色:

  • 交付性能:端到端网络性能、网络计算和成熟的软件集成。
  • 工厂可靠性:高正常运行时间、持续的状态监控和遥测,以及工厂持续运行期间的组件级可维护性。
  • 平台成熟度:通过使用成熟的技术堆栈降低运营风险,这些技术堆栈在大规模部署方面拥有良好的记录,并实现了投资回报。

例如,NVLink Fusion 将 XPU 引入 NVIDIA NVLink 纵向扩展互连域。第六代 NVLink 提供领先的高带宽、低延迟网络实现 72 个 XPU 的互连域。与基于通用以太网的替代解决方案相比,XPU 到 XPU 传输的端到端延迟降低至三分之一,数据包速率提高 10 倍。

NVLink Fusion 还包含 NVIDIA NVLink-C2C 技术,可将 XPU 连接到 NVIDIA Vera CPU 或其他生态系统 CPU,能效最高可达 PCIe 接口的 6 倍,显著减少代理式 AI 系统在控制和计算之间的性能瓶颈。

经过验证的堆栈和生态系统,助力开发和部署

开发定制 XPU 的团队往往面临将 XPU 创新成果转化为数据中心部署所需工作量和复杂性的巨大挑战。其中包括:

  • 集成高速 CPU 和纵向扩展接口
  • 采购并验证纵向扩展网络解决方案
  • 设计计算托盘和交换机托盘
  • 设计和验证整机架方案,包括散热和供电系统
  • 集成安全与存储
  • 管理复杂的供应商生态系统

理想的平台应能提供上述所有这些功能,使团队能够专注于关键的技术创新,在其余部分则采用经过验证的成熟方案。

NVLink Fusion 为快速开发、集成和部署提供了生态系统支持,涵盖 ASIC 设计、CPU 以及 IP 和光互连合作伙伴。

英特尔数据中心芯片工程副总裁兼总经理 Tim Wilson 表示:“NVLink Fusion 让客户能够自由选择最能满足其工作负载需求的 CPU 架构、性能水平和软件功能。”

采用 NVLink Fusion 的用户可以无缝使用 NVIDIA MGX 机架级方案,以及与 MGX 系统相同的供应链。制造合作伙伴负责设计和集成,MGX 供应商则提供机架、散热、供电以及新兴的 800 VDC 等基础组件

QCT 和 Quanta Computer 的产品和解决方案负责人 Jack Luoh 表示:“对 Vera RubinNVL72,我们可以看到,生产线上的系统构建已实现近乎 100% 的自动化。如果 XPU 采用 NVLink Fusion,这些投资中的大部分都可以无缝利用。”

借助基础设施标准化管理风险

AI 工厂的规划无需等待芯片准备就绪才启动。电力采购、设施设计、冷却系统、机架布局和网络架构早在最终加速器组合可用之前就可以开始了。受限于单一芯片选择的数据中心可能会面临进度延误的风险。

不同的工作负载可能适合不同的加速器,包括 XPU、GPU、CPU 和 LPU。GPU 系统可以与半定制系统协同运行,用于训练、后训练、推理、检索和服务。

MediaTek 企业高级副总裁兼数据中心和计算事业部总经理 Vince Hu 表示:“NVLink Fusion 计划的价值在于客户可以先采用 NVIDIA GPU 部署其机架级解决方案,然后再将 XPU 的开发解耦,并以不同的节奏开发。”

NVLink Fusion 通过统一的架构解决了这些挑战。基于 XPU 和 GPU 的系统,例如 Vera Rubin NVL72,可以共用机架空间、网络、冷却、供电和管理系统。运营商可以在尚未确定芯片组合的同时进行扩容,然后根据工作负载需求、芯片供应和业务优先级的变化重新调配容量。

GUC 主席兼首席战略官 Lie-Szu Juang 表示:“NVLink Fusion 让超大规模企业或定制 ASIC 设计商集成自有的定制 CPU 或 XPU,并将 NVIDIA 技术与第三方流程相结合,从而构建统一的机架级架构。”

为 AI 工厂进行设计、验证和运营

AI 工厂建设成本高昂,一旦出错可能需要付出昂贵的代价返工。基础设施必须在开始施工之前完成验证。NVLink Fusion 与 NVIDIA DSX AI 工厂参考架构保持一致,实现建筑、供电、冷却、计算和网络的协同设计。NVIDIA Omniverse DSX AI 工厂 Blueprint 为十亿瓦级 AI 工厂提供了数字孪生及开放参考设计,助力合作伙伴能够在正式部署前同步对设施和技术进行建模。

在机架层面,可维护性也是性能的一部分。参考计算托盘采用 100% 液冷技术,无风扇、无电缆且无软管,并且支持单托盘拔出维护,机架其余部分仍可正常运行。NVLink Switch 托盘同样采用液冷设计,支持在服务期间持续运行。

亚马逊公司 Annapurna Labs 高级硬件开发经理 CC Lee 表示:“借助 NVLink Fusion,我们可以使用经过验证的 NVL72 机架设计来缩短产品上市时间,并且可以对接多个供应商,帮助我们将更多产品交付给客户。

软件是 AI 工厂的能力底座。用于分布式工作负载的 NVIDIA NCCL、用于资源解耦的 NVIDIA Dynamo 和 NIXL,以及用于集群管理、遥测和调试的 NVIDIA Mission Control 可帮助运营商将异构 AI 基础设施作为协同系统运行。

借助 NVLink Fusion,XPU 现在可以对接业界领先的 AI 平台,助力超大规模企业和 AI 原生公司构建统一的半定制 AI 工厂。这种模式汇聚众多厂商的优势,打造出凭单一企业无法实现的基础设施。

详细了解 NVLink Fusion