Nvidia 的 Groq 3 LPX 主打速度优势
The Decoder··作者 Maximilian Schreiner
关键信息
3,400 tokens/秒 这一数据是在 50 次连续请求、100,000 token 上下文窗口下测得的,而且据称在 10,000 到 100,000 token 的输入长度之间表现保持稳定。批评者指出,Groq 的架构需要至少 64 颗芯片才能达到这一结果,而 Cerebras 只需一到两颗加速器就能完成同类模型工作,因此这个对比并不完全是同类比较。
资讯摘要
Nvidia 表示,其 Groq 3 LPX 推理加速器已经进入全面量产,并将其定位为面向智能体工作负载的“交互式 AI 推理加速器”。该芯片在 Hot Chips 2026 上公布,Nvidia 说它是 Vera Rubin 平台的延伸,并计划在今年晚些时候正式上线。Nvidia 还把这款产品放进更大的 AI 基础设施战略中,强调它的重点是更快的 token 生成速度,尤其适用于编程和智能体任务。公司认为,更高的吞吐量很重要,因为智能体会在很多推理步骤中不断生成、检查和修改输出。按 Nvidia 的说法,这种速度可以把原本要花数小时的编码任务压缩到几分钟。
报道中最受关注的公开数据来自 Artificial Analysis:在 Gemma 4 31B、100,000 token 上下文窗口条件下,系统测得每秒 3,400 个 token。Nvidia 称这不仅是该模型有史以来最高纪录,也大约是 Cerebras 所称 882 tokens/秒 的四倍。不过,《The Register》认为这个对比对 Nvidia 更有利,因为它的方案需要更多芯片,而 Cerebras 只需更少的加速器就能运行同类模型。报道还指出,Groq 的架构依赖小容量、偏 SRAM 的 LPU,并通过机架级互联扩展,而像 DeepSeek V3 这样更大的模型则可能需要超过 1,300 颗加速器。Nebius 预计会成为首批通过 Token Factory 提供这款芯片的云厂商之一,Groq 自身也属于早期用户。

资讯正文
英伟达表示,其 Groq 3 LPX 的速度是 Cerebras 的四倍,但这笔账要复杂得多
要点
- 英伟达正在其新的推理加速器 Groq 3 LPX 上进入全面量产阶段,该产品针对 AI 智能体的快速 token 生成进行了优化。
- 在一项基准测试中,该系统达到了每秒 3,400 个 token,英伟达称这一成绩是竞争对手 Cerebras 的四倍。
- 但专家认为这种对比对英伟达有利得过头,因为其架构至少需要 64 颗芯片才能达到这一结果,而 Cerebras 只需一到两台加速器即可实现。
英伟达已将其专用推理加速器 Groq 3 LPX 推向全面量产。一项独立基准测试显示,它在 token 生成方面的峰值成绩很高,但专家警告说,这种对比对英伟达有利得过头。
在 Hot Chips 2026 大会上,英伟达宣布 Groq 3 LPX 已进入全面量产。英伟达将这款芯片称为“交互式 AI 推理加速器”,它延续了 Vera Rubin 平台的设计,旨在为代理式 AI 系统提供超快的 token 生成能力。英伟达表示,它将在今年晚些时候正式上线。
在去年 12 月下旬,公司以约 200 亿美元收购了 Groq 的许可,并聘请了创始人 Jonathan Ross 和总裁 Sunny Madra。Groq 的处理器面向推理而非 AI 训练进行优化。
速度对代理式应用非常重要,因为智能体会在数百到数千次推理步骤中消耗大量 token。系统生成 token 的速度越快,在相同时间窗口内就能容纳更多推理步骤和工具调用。因此,在用户可接受的等待时间内,智能体可以更频繁地迭代、检查文件、编写并测试代码,以及验证结果。英伟达表示,这可将编码任务压缩到“几分钟而不是几小时”。
Artificial Analysis 的一项基准测试旨在展示 Groq 3 LPX 的运行速度:在开放模型 Gemma 4 31B、上下文窗口为 100,000 token 的情况下,这个 LPX 机架在连续 50 次请求中达到了每秒 3,400 个 token 的成绩。其性能在输入长度从 10,000 到 100,000 token 之间都保持稳定。这是该模型有史以来记录到的最高数值。英伟达表示,这意味着这款加速器比次优方案——Cerebras 芯片每秒 882 个 token——快四倍。
为什么这个纪录在实际应用中看起来不同
Groq 采用一种以 SRAM 为主的数据流架构。The Register 指出,问题在于每个 LPU 只有 500 MB 内存,比 288 GB 的 Rubin GPU 少了 576 倍。因此,模型会通过以太网被拆分到多个加速器上,一整个机架最多可容纳 256 个 LPU。在这种混合配置中,GPU 负责计算密集的 prefill 阶段,LPU 则负责带宽密集的 decode 阶段。
在这种设置下,《The Register》指出,Gemma 4 31B 是一种最理想的情况:一个可以完全装进单个机架中的稠密模型。随着架构扩展到更大的专家混合模型,其可扩展性仍然是一个悬而未决的问题。以 DeepSeek V3 为例,它需要 1,342 个加速器,或者略多于五个机架。Cerebras 的比较也没有提到芯片数量。对于该模型,Cerebras 只需要一两个加速器,而 Nvidia 至少需要 64 个。而且,这项比较完全没有把 Cerebras 最新的 CS-4 一代算进去。
Nebius 计划成为第一家通过其 Token Factory 提供这款芯片的云服务商,而 Groq 本身也是早期用户之一。
来源与参考
收录于 2026-08-26