在大规模部署中追求极致单线程性能的 CPU,开创了专为智能体 AI 时代打造的全新 CPU 品类。
在智能体系统的构建与部署全过程中,CPU 直接决定了推理能力、响应速度和模型学习等关键环节。CPU 是执行 AI 模型指令的处理器,负责完成工具调用、代码执行、数据处理、KV 缓存以及结果分析等具体工作。
对于 AI 工厂中的智能体而言,速度至关重要。
CPU 调用工具的速度越快,智能体执行当前任务的速度也就越快。
对于 AI 工厂而言,GPU 利用率是数据中心最宝贵的资源。因此,任何等待任务完成的时间都会限制 AI 工厂的收益;更糟糕的是,如果 GPU 在等待 CPU 完成任务时处于闲置状态,还会直接导致其利用率下降。因此,AI 工厂需要具备极致单线程性能的 CPU,以实现 AI 工厂收益和智能体性能的最大化。
如今的数据中心 CPU 并非为大规模部署下的高速运行而设计。
尽管市面上的 PC 和工作站早已拥有了高性能的 CPU,但数据中心 CPU 的发展方向逐渐偏离了单线程性能的提升。随着云计算的兴起,CPU 厂商开始打造拥有更多核心的数据中心 CPU,为了尽可能控制成本,不得不牺牲部分单线程性能。
为了优化每个可租用核心的成本,CPU 的设计增加了单个芯片的核心数量,同时压缩了用于提升核心性能的硅片面积——例如高性能内存互连架构和更高的单核指令处理能力。而向芯粒(Chiplet)架构的演进虽然进一步降低了成本,却也随之带来了“芯粒税(Chiplet Tax)”,导致单个 CPU 的核心再也无法充分获得整颗芯片的全部内存性能。
AI 智能体需要一款专为规模化部署打造、具备极致单线程性能的 CPU。
在大规模场景下部署具备极致单线程性能的 CPU,能够确保在系统满载状态下,智能体的每一个执行步骤依然保持高速。每个核心都能以完整性能完成智能体任务,且不会受到其他核心的拖慢。这种大规模极致单线程 CPU 采用了截然不同的设计理念,旨在实现以下目标:
- 在高负载下保持强劲的单核性能
- 为每个核心提供充足的内存带宽,确保活跃核心获得持续的数据供给
- 可预测的低延迟
每个核心都能在不被其他核心拖慢的情况下独立完成任务,这不仅带来了卓越的吞吐量,更重要的是,实现了极致的单核任务处理性能。
NVIDIA Vera 正是这种全新 CPU 设计的典范。
大规模极致单线程 CPU 如何为运行智能体循环而生
AI 智能体并不会在处理完单次请求后就停止运行,而是以循环模式运作。模型负责推理下一步操作,CPU 执行模型外围的工作,执行结果返回后,模型再决定下一步操作,如此循环往复。
这种运行模式产生了一种全新的算力需求特征,而这正是传统 CPU 未曾专门优化过的场景。传统 CPU 的工作通常是间歇性且由用户驱动的,由人类触发一系列短暂交互构成。而智能体工作则是持续且并行的:庞大的智能体集群持续运行,每个智能体都在推进一系列步骤,且每一步都依赖于上一步的执行结果。
CPU 核心数越多,意味着单个 CPU 能处理更多的智能体任务,因此数据中心 CPU 需要配备大量核心来最大化任务吞吐量。
然而,增加 CPU 核心数并不能缩短单个智能体循环中每个步骤的耗时。更多的核心无法让任何单一任务运行得更快。事实上,专为追求最大化核心数量而设计的 CPU,在核心争抢资源时,甚至可能会拖慢每个单核的性能。
单核性能对于加快每一步任务的完成速度至关重要。增加核心带来的吞吐量具有一定价值,但不足以满足需求。由于每个动作都依赖于前一步的执行结果,单核速度才真正决定了智能体循环的推进速度。

归根结底,最顶尖的智能体 CPU 需要具备极致的单线程性能,且每一个核心都必须毫无妥协地释放这一性能。人类以秒计时,而智能体则以纳秒为度量单位。NVIDIA Vera 正是为这种全新类别的工作以及极致速度而生。
NVIDIA Vera:专为智能体打造的大规模极致单线程 CPU
NVIDIA Vera 是一款在大规模部署下具备极致单线程性能的 CPU,它从底层架构开始专为智能体循环而设计:即专门处理在模型调用间隙的各项任务,包括智能体调用工具、处理数据、运行代码以及验证结果等一系列工作。

Vera 的核心是 NVIDIA 专门设计的 CPU 核心 Olympus,其每周期指令数(IPC)较 NVIDIA Grace 提升了 50%。这一点至关重要,因为智能体的许多执行步骤都是串行的。无论是工具调用、代码执行、测试运行还是数据处理,都必须等当前步骤完成后,下一次模型调用才能使用其结果。更快的核心能更迅速地推进每一个循环。
Vera 将这些高速核心与高达 1.2TB/s 的 LPDDR5X 内存带宽相结合,并将内存功耗控制在 40 瓦以内。此外,它还采用了单片式计算裸片设计,提供高达 3.4TB/s 的核心间带宽,比其他数据中心 CPU 高出 3 倍,确保活跃核心始终获得充足的数据供给,并保持数据传输的可预测性。这使得全部 88 个核心都能充分发挥 CPU 的内存性能,而不会因资源瓶颈导致任何核心运行缓慢。
这一设计最终带来了更快的智能体循环。在代表智能体执行的高负载 CPU 工作负载下,Vera 的持续单核性能达到了 x86 处理器的 1.8 倍。
这些性能优势在工具调用、代码执行、数据处理步骤和结果验证等环节中不断累积,帮助 AI 工厂利用现有的 GPU 完成更多的智能体工作。
Perplexity 在其日常运行的智能体工作中对 Vera 进行了实测。在真实的编码工作流中——即克隆代码仓库并在沙箱中运行测试套件——Vera 的完成速度达到了 x86 的 1.5 倍,并发启动多个沙箱的速度最高可达 1.9 倍。目前,Perplexity 正计划在其即将推出的生产系统中部署 Vera。
智能体同样高度依赖数据。它们需要不断地查询、检索、筛选和传输信息,而 Vera 能够更快速地处理这些 CPU 端的数据工作负载。合作伙伴测试结果显示,与领先的 x86 服务器 CPU 相比,Vera 在 Starburst 大规模 SQL 分析中的速度提升了 3 倍,而在 Redpanda 实时流处理场景下,延迟降低为原来的 1/6。
智能体工作并非单一的工作负载。智能体需要运行工具和沙箱、处理数据、响应请求,并通过强化学习训练下一代模型——而这一切都依赖于相同的底层能力。
单个 Vera 处理器即可应对所有类型的任务,无需为不同类型的任务配备不同的 CPU。此外,由于 Vera 既是 NVIDIA Vera Rubin 平台中 GPU 的主机 CPU,也是 NVIDIA BlueField-4 STX 存储处理器的动力核心,整个 AI 工厂得以在同一架构和同一工具链上运行。
NVIDIA 的脚步并未停止。NVIDIA 的下一代 Rosa CPU 将搭载 Rigel 核心,继续推进在智能体 AI 时代的 CPU 发展路线图。Rigel 是 NVIDIA 的下一代 Arm v9.2 CPU 核心,在保持相同硅片面积的前提下,实现了比 Olympus 更高的单核性能。其关键改进主要包括更高效的指令供给、更大的 L2 缓存以及更高效的内存管理。
专为智能体速度而生
在智能体 AI 时代,全球将涌现数十亿个智能体,而每一个智能体都需要依靠 CPU 来行动、校验、检索、运行任务并验证结果。在这个全新的市场中,智能体完成的任务本身就是产品。更快的智能体循环能让每一个 GPU 将更多时间用于创造收入的工作,而不是等待。
NVIDIA Vera,正是为这一未来而生的 CPU。
了解更多关于 NVIDIA Vera CPU 的信息。