- 在 Artificial Analysis 基准测试中,Groq 3 LPX 在智能体编程及其他对延迟敏感的工作负载中,展现出行业领先的速度。
- NVIDIA Groq 3 LPX 通过大幅提升 Token 生成速率,进一步扩展了 NVIDIA Vera Rubin 系统的推理性能。
- Nebius 成为首家采用 NVIDIA Groq 3 LPX 的 AI 云服务商。
NVIDIA 今日在 Hot Chips 大会上宣布,其交互式 AI 推理加速器 NVIDIA Groq 3 LPX 现已全面量产。作为 NVIDIA Vera Rubin 平台的扩展,Groq 3 LPX 通过实现超快的 Token 生成速度,大幅提升了 AI 推理性能,从而为高度响应的智能体系统提供强力支持。
智能体系统能够在数百乃至数千个推理步骤中生成海量 Token,因此,更快的 Token 生成速度对于智能体进行实时推理、执行任务以及完成复杂任务至关重要。
Vera Rubin 系统为各类 AI 工厂提供了最通用的训练与推理平台。NVIDIA Groq 3 LPX 通过大幅提升 Token 生成速率,进一步扩展了 Vera Rubin 的推理性能,为上下文密集型工作负载提供卓越的用户体验,使智能体能够以极高的速度执行任务。
NVIDIA Groq 3 LPX 正在不断突破 AI 推理的性能边界。在 Artificial Analysis 基准测试中,在运行开源智能体模型 Gemma 4 31B 并处理 10 万 Token 的上下文时,Groq 3 LPX 创造了每秒 3,400 个输出 Token 的纪录 —— 这是该模型迄今为止记录到的最快性能表现。
Groq 3 LPX 能将智能体编程等任务的完成时间从数小时缩短至数分钟。其在智能体及延迟敏感型工作负载上的响应速度比同类型平台快了 4 倍。
NVIDIA 创始人兼首席执行官黄仁勋表示:“推理是 AI 的增长引擎。NVIDIA Grace Blackwell 和 NVL72 以前所未有的性能和效率飞跃,彻底改变了大语言模型的推理方式。Vera Rubin 在此基础上进一步发展,通过专为智能体 AI 时代打造、针对工作负载优化的 AI 工厂配置,并借助 LPX 实现超快的 Token 生成速度,不断突破性能边界。这正在改变智能的生成方式,在全球 AI 算力需求加速飙升的当下,为 AI 吞吐量、效率和响应速度带来了又一次巨大的飞跃。”
Groq 3 LPX —— 交互式 AI 推理加速器
智能体 AI 带来了两项截然不同的计算挑战:高效处理海量上下文,以及以极低延迟生成 Token。
NVIDIA Groq 3 LPX 专为提升 Vera Rubin 平台的交互性而打造 —— 它决定了为单个用户生成 Token 的速率,从而决定了智能体完成每一步任务的快慢。
更快的生成速度,使智能体能够在保持流畅用户体验的同时,拥有更充裕的时间去检查文件、编写和测试代码、调用工具、验证结果并进行迭代。
Groq 3 LPX 在 AI 云领域势头强劲
AI 云正日益成为 AI 经济的引擎,为企业和开发者提供先进的基础设施,以支持大规模的训练、推理与逻辑运算。对于提供延迟敏感型、高并发推理工作负载的云服务商而言,NVIDIA Groq 3 LPX 提供了一种在成熟的机架级系统中部署差异化计算的途径。
Nebius 作为领先的 AI 云服务商,计划将 NVIDIA Groq 3 LPX 引入其生产级推理平台 Nebius Token Factory,为开发者提供极致的 Token 生成速度,以支持快速响应的智能体 AI 应用。
Nebius 首席技术官 Danila Shtan 表示:“在推理过程中,生成阶段是决定 AI 系统实际响应速度的关键,而这正是 NVIDIA Groq 3 LPX 旨在加速的核心环节。作为首家通过 Nebius Token Factory 将其引入生产环境的 AI 云服务商,我们确保智能体循环的每一步都能带来即时响应的体验 —— 这一切都通过开发者已经在使用的同一套 API 来实现,完全无需迁移到新的技术栈。”
继 Nebius 之后,专注于 AI 推理的云服务商 Groq 也计划成为该平台的首批采用者。
专为 AI 工厂打造的极致协同设计
通过对七款芯片和五个专用机架的极致协同设计,NVIDIA Vera Rubin 成为了最全面的 AI 工厂平台。
NVIDIA Vera Rubin 与 Groq 3 LPX 旨在满足客户 AI 工厂多样化的工作负载需求,服务对象涵盖前沿模型开发者与开放模型服务提供商。
这些机架级平台搭载了 NVIDIA BlueField®-4 DPU,并与 NVIDIA Vera CPU 机架、NVIDIA Vera BlueField-4 STX 存储以及 NVIDIA Spectrum™-6 SPX 以太网协同工作,旨在以最高的每瓦吞吐量和最低的推理延迟,对多智能体系统进行极致优化。
