Topic
#speech-to-text
按主题聚合的新闻视图。
Topic Feed
主题:speech-to-text
共 3 条

Gemini 3.5 Transcribe 提升多语言实时语音识别
Google 的 Gemini 3.5 Transcribe 现在可以识别 85 种以上语言的语音,并且能实时去除口头禅和纠正口误。该模型在流式模式下据称可达到 4.0% 的词错误率,且相较 Chirp 3 的延迟降低了 70%。

Google 发布 Gemini 3.5 Transcribe
Google 推出了 Gemini 3.5 Transcribe,这是一款面向智能语音交互和高精度转写的新语音转文字模型。该模型现已通过 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform 提供,并分别支持实时流式处理和预录音频处理。

微软发布VibeVoice:带说话人分离的开源语音转文字模型
微软发布了VibeVoice,这是一个新的MIT许可证语音转文字模型,内置说话人分离功能,并针对本地推理进行了优化。它支持.wav和.mp3文件,可在M5 Max芯片的Mac上约8分钟内完成一小时音频的转录。