谷歌Frozen v2芯片瞄准Gemini优化推理

The Decoder··作者 Matthias Bastian

关键信息

与谷歌面向多种模型的通用 TPU 不同,Frozen v2 被描述为针对 Gemini 架构定制,但仍然可以加载新的权重。最初的 Frozen 方案据称是把权重直接嵌入芯片,但由于过于僵化、容易过时而被放弃;谷歌尚未确认最终会把多少架构硬编码进芯片。

资讯摘要

据报道,谷歌正在内部开发一款名为 Frozen v2 的新服务器芯片,目标是围绕 Gemini AI 模型家族进行设计。其核心思路不是完全依赖通用加速器,而是把 Gemini 架构的一部分直接写进硅片里。The Information 引述消息人士称,这款芯片在按单位功耗生成的 token 数来衡量时,效率可能比谷歌现有的 TPU 芯片高出 6 到 10 倍。报道称,谷歌计划在 2028 年左右部署这款芯片,并把它视为专用芯片的较小规模试验,而不是主力产品线。这个名字也呼应了机器学习里的“冻结”概念,只不过这里被冻结到硬件中的,是模型的一部分结构。

报道还称,最初的 Frozen 方案来自 Jeff Dean,最早想法是把模型权重直接嵌入芯片。后来这一方案被放弃,因为它会把硬件绑定到某一个 Gemini 版本,过快失去时效性。Frozen v2 于是改为嵌入架构而不是权重,这样后续仍然可以加载新的权重。谷歌没有公开证实这一消息,但它对 TechCrunch 表示,公司一直在研究和试验新的软硬件协同方案,以为用户和客户提供更高的性能和效率。

谷歌Frozen v2芯片瞄准Gemini优化推理

资讯正文

谷歌的“Frozen v2”芯片据称将 Gemini 的架构直接写入硅中,以提升效率

据悉,谷歌正在内部研发一款名为“Frozen v2”的新服务器芯片,它将 Gemini AI 模型的架构直接嵌入硅中。

据《The Information》援引消息人士称,这款芯片在提供 AI 回复方面的效率可能会比谷歌现有的 TPU 芯片高出 6 到 10 倍。谷歌计划从 2028 年开始部署它,并将 Frozen v2 视为专用芯片的一次试运行,其产量会低于 TPU 产品线。

与可兼容多种模型的谷歌 TPU 不同,Frozen v2 将 Gemini 模型结构的一部分直接构建进硬件。这个名字延续了 AI 模型里“冻结”参数的逻辑,也就是把数值锁定,使其不再变化。对于 Frozen v2 而言,模型的一部分会被永久“冻结”到芯片本身中,从而减少计算步骤并加快响应速度。

据报道,这一最初构想来自 Google Deepmind 首席科学家 Jeff Dean。他最早的 Frozen 设计要求将模型权重直接嵌入芯片。权重是决定 AI 模型如何回应查询的具体设定。谷歌后来放弃了这一方案,因为那样芯片只能兼容单一版本的 Gemini,而且很快就会过时。

Frozen v2 采取了更灵活的路线,嵌入的是模型架构而不是权重,也就是底层蓝图而非经过调校的参数。新权重仍然可以加载到芯片上。至于最终会有多少架构被真正硬编码进芯片,目前尚未决定,据《The Information》报道。

从 AI 推理中榨取更好的利润率

由于这款芯片只有在谷歌继续采用同样的模型架构时才能工作,它大概不会成为面向外部客户的产品。谷歌目前已经向 Meta 出租 TPU,向外部云客户提供 TPU,并通过“TPU@Premises”项目将其定位为 Nvidia 的替代方案,内部目标是拿下 Nvidia 年收入的 10%。相比之下,Frozen v2 的目标是缓解谷歌内部在 AI 算力上的紧张局面。

如果这款芯片兑现其承诺,它仍可能成为一项重大的竞争优势。在 AI 业务中,公司对推理成本的优化能力正日益决定其利润率。谷歌可以利用 Frozen v2 以更低价格运行强大的模型,并从 OpenAI 和 Anthropic 手中夺取市场份额。

来源与参考

  1. 原始链接
  2. Google is working on a new AI chip designed to make Gemini more efficient | TechCrunch
  3. Google's "Frozen v2" chip reportedly bakes Gemini's architecture directly into silicon for efficiency gains

收录于 2026-07-21