英伟达宣布,互动式AI推理加速器Nvidia Groq 3 LPX现已全面投产。作为Nvidia Vera Rubin平台的扩展,Groq 3 LPX通过实现超高速令牌生成,极大提升了AI推理能力,适用于高度响应的代理系统。


代理系统能够在数百甚至数千个推理步骤中生成大量代币,这使得加速代币生成对于代理推理、行动和完成复杂任务时至关重要。
Vera Rubin NVL72 系统为每个 AI 工厂提供了最灵活的训练和推断平台。Nvidia Groq 3 LPX 通过大幅提升令牌生成速率,进一步提升了 Vera Rubin NVL72 的推理性能,为上下文密集的工作负载提供优质用户体验,使代理能够以极高速度行动。
Nvidia Groq 3 LPX 正在推动 AI 推理的前沿。它在运行开源代理模型Gemma 4 31B的人工分析基准测试中,实现了每秒3,400个输出令牌的纪录,该模型拥有10万个令牌上下文,对代理系统至关重要——这是该模型有史以来的最快性能。
Groq 3 LPX 支持在几分钟内完成诸如编码的代理任务,使响应速度比最近的替代平台快4倍,满足代理和延迟敏感工作负载的需求。
“推理是人工智能的增长引擎。英伟达创始人兼首席执行官黄仁森表示:“Nvidia Grace Blackwell 和 NVL72 以前所未有的性能和效率飞跃,彻底革新了大型语言模型推断。”“Vera Rubin通过为代理AI时代设计的工作负载优化AI工厂配置,进一步推动性能前沿,实现超高速令牌生成。这改变了智能的生产方式,带来了AI吞吐量、效率和响应速度的又一巨大飞跃,正值全球对AI计算需求的加速之际。”
Groq 3 LPX——交互式AI推理加速器
代理人工智能带来了两个不同的计算挑战:高效处理海量上下文和以极低延迟生成代币。
Nvidia Groq 3 LPX 专为扩展 Vera Rubin 的交互性而设计——即为单个用户生成代币的速度,决定代理完成每一步工作的速度。
更快的生成速度让代理有更多时间检查文件、编写和测试代码、调用工具、验证结果和迭代,同时保持响应式的用户体验。
Groq 3 LPX的 AI 云动力
AI 云正成为 AI 经济的引擎,为企业和开发者提供大规模训练、推理和推理的先进基础设施。对于服务延迟敏感、高流量推理工作负载的供应商,Nvidia Groq 3 LPX为在经过验证的机架级系统中部署差异化计算提供了途径。
领先的AI云Nebius计划将Nvidia Groq 3 LPX引入其生产推理平台Nebius Token Factory,为开发者提供极高的代币生成速度,以实现高度响应的代理AI应用。
Nebius首席技术官Danila Shtan表示:“生成是决定AI系统响应能力的推理阶段,而这正是Nvidia Groq 3 LPX旨在加速的目标。”“作为首个通过Nebius Token Factory将其带入生产的AI云,我们确保代理流程的每一步都感觉即时——通过开发者已经使用的相同API,无需迁移到新的协议栈。”
继Nebius之后,专为AI推理开发的云Groq计划成为该平台最早采用者之一。
极致的AI工厂协同设计
通过对七颗芯片和五个专用机架的极致协同设计,Nvidia Vera Rubin成为最全面的AI工厂平台。
Nvidia Vera Rubin NVL72 和 Groq 3 LPX 满足客户 AI 工厂的各种工作负载需求,包括前沿模型制造商和开放模型服务提供商。
这些机架平台配备Nvidia BlueField-4 DPU,并与Nvidia Vera CPU机架、Nvidia Vera BlueField-4 STX存储和Nvidia Spectrum-6 SPX以太网结合,优化多代理系统,实现每瓦最高吞吐量和最低延迟推断。