Topic

#speech-to-text

按主题聚合的新闻视图。

主题:speech-to-text

共 3 条

  1. Gemini 3.5 Transcribe 提升多语言实时语音识别

    The Decoder·

    Gemini 3.5 Transcribe 提升多语言实时语音识别

    Google 的 Gemini 3.5 Transcribe 现在可以识别 85 种以上语言的语音,并且能实时去除口头禅和纠正口误。该模型在流式模式下据称可达到 4.0% 的词错误率,且相较 Chirp 3 的延迟降低了 70%。

  2. Google 发布 Gemini 3.5 Transcribe

    Google DeepMind News·

    Google 发布 Gemini 3.5 Transcribe

    Google 推出了 Gemini 3.5 Transcribe,这是一款面向智能语音交互和高精度转写的新语音转文字模型。该模型现已通过 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform 提供,并分别支持实时流式处理和预录音频处理。

  3. 微软发布VibeVoice:带说话人分离的开源语音转文字模型

    Simon Willison·

    微软发布VibeVoice:带说话人分离的开源语音转文字模型

    微软发布了VibeVoice,这是一个新的MIT许可证语音转文字模型,内置说话人分离功能,并针对本地推理进行了优化。它支持.wav和.mp3文件,可在M5 Max芯片的Mac上约8分钟内完成一小时音频的转录。