Gemini 3.5 Transcribe 提升多语言实时语音识别

The Decoder··作者 Matthias Bastian

关键信息

文章提到,该模型可以在转写过程中去除填充词并纠正口误,而不是只在事后处理。它还支持函数调用,把任务交给其他 Gemini 模型处理,这说明它被设计成可融入更大的多模型工作流。

资讯摘要

Google 推出了 Gemini 3.5 Transcribe,这是一款面向多语言、低延迟转写的新语音转文字模型。文章称,它支持 85 种以上语言,并且能够在实时转写时自动去除填充词、纠正口误。该模型在流式模式下据称可达到 4.0% 的词错误率。文章还指出,它相比 Google 之前的语音模型 Chirp 3 延迟降低了 70%。

除了转写能力之外,Gemini 3.5 Transcribe 还可以通过函数调用把任务交给其他 Gemini 模型。也就是说,它不只是一个独立的 ASR 系统,而是可以作为更大 Gemini 工作流的一部分来使用。文章将这次更新描述为实时语音识别的重要改进,尤其适合多语言场景。

Gemini 3.5 Transcribe 提升多语言实时语音识别

资讯正文

<p><img alt="" class="attachment-full size-full wp-post-image" height="1152" src="https://the-decoder.com/wp-content/uploads/2026/07/google_gemini-1.png" style="height: auto; margin-bottom: 10px;" width="2048" /></p>

来源与参考

  1. 原始链接
  2. Google's Gemini 3.5 Transcribe turns speech to text in 85 languages while auto-correcting your verbal stumbles

收录于 2026-08-28