谷歌发布 Gemini 3.5 Transcribe
Ars Technica AI··作者 Ryan Whitwam
关键信息
谷歌表示,Gemini 3.5 Transcribe 从语音输入到最终文本的速度比此前的语音转文字引擎 Chirp 3 快约 70%。其实时语音错误率据称降至 5.5%,而 Chirp 3 为 7.32%;谷歌文档还将其描述为支持低延迟转写、语言检测、说话人分离、时间戳和智能转写等功能。
资讯摘要
谷歌推出了 Gemini 3.5 Transcribe,这是 Gemini 3.5 系列中的一款语音转文字模型。公司表示,这个模型的目标是简化语音输入流程,自动去掉“呃”之类的口头填充词,并清理用户说话中的自我修正,让输出文本更整洁。它已经在 Pixel 11 的 Gboard“Rambler”功能中使用。谷歌还表示,这项能力接下来会更广泛地进入其生态系统。
性能方面,谷歌称它从语音输入到最终转写文本的速度比早期的 Chirp 3 快约 70%。谷歌同时给出的实时语音错误率为 5.5%,低于 Chirp 3 的 7.32%。虽然绝对提升并不算巨大,但对于经常需要手动修改语音识别结果的用户来说,这类改进仍然很有价值。整体来看,这次发布更像是面向日常语音输入体验的实用升级,而不是一次引人注目的 AI 突破。

来源与参考
收录于 2026-08-27