AI 创新先锋拥抱 NVIDIA Vera:为何在大规模场景下,极致单线程 CPU 性能至关重要

专为智能体时代打造的 NVIDIA Vera 开创了全新 CPU 品类,目前已获得 Perplexity 等 AI 创新先锋的采用。NVIDIA CPU 产品路线图持续演进,未来将推出搭载 Rigel 核心的 NVIDIA Rosa CPU。
作者

在大规模部署中追求极致单线程性能的 CPU,开创了专为智能体 AI 时代打造的全新 CPU 品类。

在智能体系统的构建与部署全过程中,CPU 直接决定了推理能力、响应速度和模型学习等关键环节。CPU 是执行 AI 模型指令的处理器,负责完成工具调用、代码执行、数据处理、KV 缓存以及结果分析等具体工作。

对于 AI 工厂中的智能体而言,速度至关重要。

CPU 调用工具的速度越快,智能体执行当前任务的速度也就越快。

对于 AI 工厂而言,GPU 利用率是数据中心最宝贵的资源。因此,任何等待任务完成的时间都会限制 AI 工厂的收益;更糟糕的是,如果 GPU 在等待 CPU 完成任务时处于闲置状态,还会直接导致其利用率下降。因此,AI 工厂需要具备极致单线程性能的 CPU,以实现 AI 工厂收益和智能体性能的最大化。

如今的数据中心 CPU 并非为大规模部署下的高速运行而设计。

尽管市面上的 PC 和工作站早已拥有了高性能的 CPU,但数据中心 CPU 的发展方向逐渐偏离了单线程性能的提升。随着云计算的兴起,CPU 厂商开始打造拥有更多核心的数据中心 CPU,为了尽可能控制成本,不得不牺牲部分单线程性能。

为了优化每个可租用核心的成本,CPU 的设计增加了单个芯片的核心数量,同时压缩了用于提升核心性能的硅片面积——例如高性能内存互连架构和更高的单核指令处理能力。而向芯粒(Chiplet)架构的演进虽然进一步降低了成本,却也随之带来了“芯粒税(Chiplet Tax)”,导致单个 CPU 的核心再也无法充分获得整颗芯片的全部内存性能。

AI 智能体需要一款专为规模化部署打造、具备极致单线程性能的 CPU。

在大规模场景下部署具备极致单线程性能的 CPU,能够确保在系统满载状态下,智能体的每一个执行步骤依然保持高速。每个核心都能以完整性能完成智能体任务,且不会受到其他核心的拖慢。这种大规模极致单线程 CPU 采用了截然不同的设计理念,旨在实现以下目标:

  • 在高负载下保持强劲的单核性能
  • 为每个核心提供充足的内存带宽,确保活跃核心获得持续的数据供给
  • 可预测的低延迟

每个核心都能在不被其他核心拖慢的情况下独立完成任务,这不仅带来了卓越的吞吐量,更重要的是,实现了极致的单核任务处理性能。

NVIDIA Vera 正是这种全新 CPU 设计的典范。

大规模极致单线程 CPU 如何为运行智能体循环而生

AI 智能体并不会在处理完单次请求后就停止运行,而是以循环模式运作。模型负责推理下一步操作,CPU 执行模型外围的工作,执行结果返回后,模型再决定下一步操作,如此循环往复。

这种运行模式产生了一种全新的算力需求特征,而这正是传统 CPU 未曾专门优化过的场景。传统 CPU 的工作通常是间歇性且由用户驱动的,由人类触发一系列短暂交互构成。而智能体工作则是持续且并行的:庞大的智能体集群持续运行,每个智能体都在推进一系列步骤,且每一步都依赖于上一步的执行结果。

CPU 核心数越多,意味着单个 CPU 能处理更多的智能体任务,因此数据中心 CPU 需要配备大量核心来最大化任务吞吐量。

然而,增加 CPU 核心数并不能缩短单个智能体循环中每个步骤的耗时。更多的核心无法让任何单一任务运行得更快。事实上,专为追求最大化核心数量而设计的 CPU,在核心争抢资源时,甚至可能会拖慢每个单核的性能。

单核性能对于加快每一步任务的完成速度至关重要。增加核心带来的吞吐量具有一定价值,但不足以满足需求。由于每个动作都依赖于前一步的执行结果,单核速度才真正决定了智能体循环的推进速度。

归根结底,最顶尖的智能体 CPU 需要具备极致的单线程性能,且每一个核心都必须毫无妥协地释放这一性能。人类以秒计时,而智能体则以纳秒为度量单位。NVIDIA Vera 正是为这种全新类别的工作以及极致速度而生。

NVIDIA Vera:专为智能体打造的大规模极致单线程 CPU

NVIDIA Vera 是一款在大规模部署下具备极致单线程性能的 CPU,它从底层架构开始专为智能体循环而设计:即专门处理在模型调用间隙的各项任务,包括智能体调用工具、处理数据、运行代码以及验证结果等一系列工作。

NVIDIA Vera CPU

Vera 的核心是 NVIDIA 专门设计的 CPU 核心 Olympus,其每周期指令数(IPC)较 NVIDIA Grace 提升了 50%。这一点至关重要,因为智能体的许多执行步骤都是串行的。无论是工具调用、代码执行、测试运行还是数据处理,都必须等当前步骤完成后,下一次模型调用才能使用其结果。更快的核心能更迅速地推进每一个循环。

Vera 将这些高速核心与高达 1.2TB/s 的 LPDDR5X 内存带宽相结合,并将内存功耗控制在 40 瓦以内。此外,它还采用了单片式计算裸片设计,提供高达 3.4TB/s 的核心间带宽,比其他数据中心 CPU 高出 3 倍,确保活跃核心始终获得充足的数据供给,并保持数据传输的可预测性。这使得全部 88 个核心都能充分发挥 CPU 的内存性能,而不会因资源瓶颈导致任何核心运行缓慢。

这一设计最终带来了更快的智能体循环。在代表智能体执行的高负载 CPU 工作负载下,Vera 的持续单核性能达到了 x86 处理器的 1.8 倍。

这些性能优势在工具调用、代码执行、数据处理步骤和结果验证等环节中不断累积,帮助 AI 工厂利用现有的 GPU 完成更多的智能体工作。

Perplexity 在其日常运行的智能体工作中对 Vera 进行了实测。在真实的编码工作流中——即克隆代码仓库并在沙箱中运行测试套件——Vera 的完成速度达到了 x86 的 1.5 倍,并发启动多个沙箱的速度最高可达 1.9 倍。目前,Perplexity 正计划在其即将推出的生产系统中部署 Vera。

智能体同样高度依赖数据。它们需要不断地查询、检索、筛选和传输信息,而 Vera 能够更快速地处理这些 CPU 端的数据工作负载。合作伙伴测试结果显示,与领先的 x86 服务器 CPU 相比,Vera 在 Starburst 大规模 SQL 分析中的速度提升了 3 倍,而在 Redpanda 实时流处理场景下,延迟降低为原来的 1/6。

智能体工作并非单一的工作负载。智能体需要运行工具和沙箱、处理数据、响应请求,并通过强化学习训练下一代模型——而这一切都依赖于相同的底层能力。

单个 Vera 处理器即可应对所有类型的任务,无需为不同类型的任务配备不同的 CPU。此外,由于 Vera 既是 NVIDIA Vera Rubin 平台中 GPU 的主机 CPU,也是 NVIDIA BlueField-4 STX 存储处理器的动力核心,整个 AI 工厂得以在同一架构和同一工具链上运行。

NVIDIA 的脚步并未停止。NVIDIA 的下一代 Rosa CPU 将搭载 Rigel 核心,继续推进在智能体 AI 时代的 CPU 发展路线图。Rigel 是 NVIDIA 的下一代 Arm v9.2 CPU 核心,在保持相同硅片面积的前提下,实现了比 Olympus 更高的单核性能。其关键改进主要包括更高效的指令供给、更大的 L2 缓存以及更高效的内存管理。

专为智能体速度而生

在智能体 AI 时代,全球将涌现数十亿个智能体,而每一个智能体都需要依靠 CPU 来行动、校验、检索、运行任务并验证结果。在这个全新的市场中,智能体完成的任务本身就是产品。更快的智能体循环能让每一个 GPU 将更多时间用于创造收入的工作,而不是等待。

NVIDIA Vera,正是为这一未来而生的 CPU。

了解更多关于 NVIDIA Vera CPU 的信息。