Microsoft 发布面向实时语音代理的新模型
The Decoder··作者 Maximilian Schreiner
关键信息
Microsoft 表示,MAI-Transcribe-2-Streaming 在 Artificial Analysis 上的准确率排名第一,但这些准确率和性能说法主要来自 Microsoft 自身披露。MAI-Voice-2.1-Flash 的延迟为 150 毫秒,价格从每百万字符 22 美元降至 15 美元;转录服务在年底前的介绍价为每小时音频 0.54 美元,两款语音模型都能根据几秒钟的参考音频克隆声音,并配有用于限制滥用的安全措施。
资讯摘要
Microsoft AI 推出了 MAI-Transcribe-2-Streaming,这是一款面向实时对话和语音代理的语音转文本模型。Microsoft 表示,该模型支持 60 种语言,并能在略超过 100 毫秒后生成首个部分转录结果。这样的响应速度旨在让语音代理在用户尚未说完话时就开始回应,而不是必须等待完整句子结束。Microsoft 同时发布了 MAI-Voice-2.1,该模型可以用同一种声音说 23 种语言,并为每种语言采用相应的母语口音。
其 MAI-Voice-2.1-Flash 版本据称可达到 150 毫秒延迟,价格则从每百万字符 22 美元降至 15 美元。两款语音模型都能仅凭几秒钟的参考音频克隆声音,并内置了旨在减少滥用的安全措施。这些模型可通过 Microsoft Foundry 和 MAI Playground 使用,两款语音模型也已上线 OpenRouter;在一项约有 4000 人参加的测试中,大约一半参与者认为生成的声音来自真人。

资讯正文
Microsoft AI 发布面向语音代理的新转录和文本转语音模型
Microsoft AI 发布了 MAI-Transcribe-2-Streaming,这是一款用于实时转录的新模型。Microsoft 表示,该模型在 Artificial Analysis 的准确率排名中位居第一。该模型支持转录 60 种语言,并能在刚刚超过 100 毫秒内提供首批部分结果。Microsoft 称,这使语音代理能够在人们尚未说完一句话时就做出回应。在今年年底之前,按照介绍期价格,使用该模型处理一小时音频的费用为 0.54 美元。
Microsoft 还发布了两款新的文本转语音模型。MAI-Voice-2.1 的设计目标是用同一种声音说 23 种语言,并且在每种语言中都使用原生口音。Microsoft 表示,MAI-Voice-2.1-Flash 版本的延迟可达到 150 毫秒,价格则从每 100 万字符 22 美元降至 15 美元。
两款语音模型都只需几秒钟的参考音频即可克隆一种声音,同时内置的安全措施旨在防止滥用。这些模型可通过 Microsoft Foundry 和 MAI Playground 等平台使用,两款语音模型也已登陆 OpenRouter。在一项测试中,约有一半的 4,000 名参与者认为这些声音来自真人。
来源与参考
收录于 2026-10-03