谷歌发布 Gemini 3.5 Transcribe

Ars Technica AI··作者 Ryan Whitwam

关键信息

谷歌表示,Gemini 3.5 Transcribe 从语音输入到最终文本的速度比此前的语音转文字引擎 Chirp 3 快约 70%。其实时语音错误率据称降至 5.5%,而 Chirp 3 为 7.32%;谷歌文档还将其描述为支持低延迟转写、语言检测、说话人分离、时间戳和智能转写等功能。

资讯摘要

谷歌推出了 Gemini 3.5 Transcribe,这是 Gemini 3.5 系列中的一款语音转文字模型。公司表示,这个模型的目标是简化语音输入流程,自动去掉“呃”之类的口头填充词,并清理用户说话中的自我修正,让输出文本更整洁。它已经在 Pixel 11 的 Gboard“Rambler”功能中使用。谷歌还表示,这项能力接下来会更广泛地进入其生态系统。

性能方面,谷歌称它从语音输入到最终转写文本的速度比早期的 Chirp 3 快约 70%。谷歌同时给出的实时语音错误率为 5.5%,低于 Chirp 3 的 7.32%。虽然绝对提升并不算巨大,但对于经常需要手动修改语音识别结果的用户来说,这类改进仍然很有价值。整体来看,这次发布更像是面向日常语音输入体验的实用升级,而不是一次引人注目的 AI 突破。

谷歌发布 Gemini 3.5 Transcribe

来源与参考

  1. 原始链接
  2. Google announces Gemini 3.5 Transcribe for AI-powered speech-to-text

收录于 2026-08-27