Google 发布 Gemini 3.5 Transcribe

Google DeepMind News··作者 Diego Melendo Casado

关键信息

Google 表示,该模型可处理口语中的重复修正、专有词汇、多语言语音以及预录音频中的最多三位说话人,支持 85 种以上语言。官方给出的 WER 指标为流式 4.0%、非流式 2.6%,并称相较 Chirp 3,最终转写耗时提升了 70%。

资讯摘要

Google 发布了 Gemini 3.5 Transcribe,并将其描述为目前最精确的语音转文字模型,目标是支持更智能的语音交互。公司表示,这个模型不只是传统语音识别,而是能够把原始音频直接转换成更准确、格式更规范的文本,同时更好地处理背景噪音、复杂术语和口语中的重复修正。Google 还提到,消费者已经在 Gemini 应用和 Android 中接触到这类能力,例如 Android 上的 Rambler 以及 macOS 版 Gemini 应用。现在,开发者可以通过 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform 使用它。该模型提供两种接口:Live API 中的 gemini-3.5-transcribe-live 面向低延迟双向流式场景,Interactions API 中的 gemini-3.5-transcribe 面向预录音频。

Google 说它适合语音代理、实时字幕和通话后分析等工作流,并提供删除填充词、保留自我更正和自动排版等“智能转写”能力。对于更复杂的任务,它还可以通过函数调用把图像生成和文件分析等工作交给其他 Gemini 模型,目前这一能力已在 Gemini macOS 应用中提供。Google 表示,该模型支持自定义词汇、可自动识别并转写 85 种以上语言,并能为预录音频中的最多三位说话人做说话人归属。与 Chirp 3 相比,Google 声称它在词错误率和最终转写耗时方面都有明显提升,其中最终转写时间改善了 70%。

Google 发布 Gemini 3.5 Transcribe

资讯正文

借助 Gemini 3.5 Transcribe 实现智能转录

今天,我们推出 Gemini 3.5 Transcribe,这是我们迄今为止最精准的语音转文本模型,专为智能语音交互而设计。不同于在背景噪音、复杂术语和口语冗余清理方面表现吃力的传统语音识别模型,Gemini 3.5 Transcribe 能直接将原始音频转化为准确、润色过且格式规范的文本。

在我们的各类产品中,例如 Gemini 应用以及 Android,我们已经看到消费者开始从这款转录模型中受益,获得了新的语音能力,比如 Android 上的 Rambler,以及 macOS 版 Gemini 应用中的相关功能。如今,开发者可以通过 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent Platform,使用 Gemini 3.5 Transcribe 构建类似能力。

我们将 3.5 Transcribe 打造成能够无缝接入开发者工作流的模型,无论你是在构建语音代理、实时字幕工具,还是通话后分析管线。该模型可通过两个独立 API 使用:

- 实时流式处理:通过 Live API 使用 gemini-3.5-transcribe-live,为交互式语音应用提供持续的双向流式传输,延迟低于一秒。

- 预录音频处理:通过 Interactions API 使用 gemini-3.5-transcribe,对录制音频、会议内容、通话记录等进行转录,并提供说话人归属和词级时间戳。

获取更精准、更智能的转录

Gemini 3.5 Transcribe 旨在捕捉你的自然说话风格,以更好地理解你的意图并识别自定义词汇,从而让你能够用语音执行任务。

- 智能转录:可无缝处理自我纠正(例如“我们周二见——不,周三”),删除填充词(如“嗯”和“啊”),并自动为文本排版格式化。

- 函数调用:该模型可以通过函数调用将复杂任务(例如图像生成和文件分析)委派给其他 Gemini 模型。目前可在 Gemini macOS 应用中使用。

- 更精准的转录:根据 Artificial Analysis 的测量,在流式场景下的平均词错误率(WER)为 4.0%,在非流式使用场景下为 2.6%。它在嘈杂的真实环境中表现出色,能够准确识别邮政编码和订单 ID 等字母数字实体。

- 自定义词汇:可识别专业术语和独特拼写,并通过无缝适配你提供的自定义词汇来调整转录结果。

- 全球语言支持:可自动检测并转录 85 种以上语言,无缝处理地区口音和多样方言。

- 多说话人识别:在预录音频中可准确归属最多三位说话人的发言,并提供时间戳(对 3 位以上说话人的支持仍处于实验阶段)。

Gemini 3.5 Transcribe 的性能相较于我们之前的转录模型 Chirp 3 有了重大提升,不仅提供了新能力,词错误率也更低,延迟更是显著改善。例如,根据 Artificial Analysis 的测量,从开始到最终转录的时间提升了 70%。在 FLEURS 基准测试中,覆盖一组顶级语言和地区,该模型展现出精准的多语言表现,优于 Chirp 3,并在流式模式下达到 5.50% 的 WER,在非流式使用场景中达到 5.04% 的 WER。

体验智能转录和高级听写

除了 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 之外,3.5 Transcribe 还超越了标准语音转文字,使在 Google 生态中工作变得更加自然直观。通过将具备上下文感知的理解直接带入 Gboard、Antigravity、Gemini 应用和 Chrome 等日常界面,它能够轻松捕捉细微差别、意图以及行内编辑。

- 在 Android 版 Gboard 上,通过新的 Rambler 功能,3.5 Transcribe 能将口述想法转化为格式良好的文本,并过滤掉语气词。你还可以用语音进行编辑、更正拼写错误并改变写作风格。

- 在 Google Antigravity 中,3.5 Transcribe 会在你授权的情况下结合屏幕上下文和聊天历史,以确保对文件名、代理思考和当前文档的转录精准无误。

- 在 Google AI Studio 中,你可以在 Build 模式下使用 3.5 Transcribe,随时用语音进行 vibe coding 开发应用。

- 在 macOS 版 Gemini 应用中,3.5 Transcribe 不仅能将你的自然口语转录为整洁、格式化的文本,还支持可与屏幕上下文无缝配合的语音命令,从而驱动复杂工作流程。它会在后台调用其他 Gemini 模型来处理繁重工作,让你只需借助语音,就能轻松总结本地文件、跨应用重用文本,或在光标处直接生成图片。

- 即将登陆 Chrome,你将可以在任何网页输入框中通过说话来输入文字——用语音更自然、更轻松地口述回复、起草帖子,或在 Chrome 中向 Gemini 发出提示。

阅读早期评价

借助 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发平台让开发者能够轻松构建并部署高性能的语音驱动界面。这些平台在幕后管理复杂的实时媒体流基础设施,让开发者可以完全专注于打造用户体验。

Vivo、Intellitek Health 和 Lingopal 等公司也对 3.5 Transcribe 给出了积极反馈,强调了其令人印象深刻的延迟表现、准确性以及广泛的语言支持。

今天就开始使用 3.5 Transcribe

- 面向开发者:已在 Gemini API 中通过 Google AI Studio 和 Google Antigravity 开放公测。

- 面向企业:已通过 Gemini Enterprise Agent Platform 开放公测,并即将登陆面向客户体验的 Gemini Enterprise。

- 面向所有用户:已在 macOS 版 Gemini 应用中提供英文支持,在部分国家和语言的 Android 版 Rambler 中提供支持,并即将登陆 Chrome。

来源与参考

  1. 原始链接
  2. Intelligent transcription with Gemini 3.5 Transcribe