Qwen Audio 3.0 TTS Plus 登顶语音合成榜单

The Decoder··作者 Matthias Bastian

关键信息

该模型支持 16 种语言,包括塔加洛语、马来语、泰语、越南语以及多种中文方言。阿里巴巴还表示,它可以根据自然语言风格指令进行控制,甚至识别如“[angry]”或“[giggles]”这类非语言标签,同时在克隆声音时,对嘈杂或回声较重的参考音频也比早期版本更稳健。

资讯摘要

据报道,阿里巴巴的 Qwen Audio 3.0 TTS Plus 已经在文本转语音排行榜中取得领先。这个版本分为两个型号:Flash 主要面向实时交互,延迟大约为 300 毫秒;Plus 则主要用于生成更高质量的语音。阿里巴巴称,该模型支持 16 种语言,其中包括塔加洛语、马来语、泰语、越南语等覆盖率较低的语言,以及多种中文方言。它还提供更强的语音可控性,用户既可以通过自然语言来调节说话风格,也可以使用像“[angry]”和“[giggles]”这样的标签加入非语言提示。

另一个改进是声音克隆能力增强,尤其是在参考录音存在噪声或回声时表现更好。不过,文章也指出它的速度仍然是短板:Qwen Audio 3.0 TTS Plus 的生成速度只有每秒 16 个字符,明显落后于 Sonic 3.5 和 Simba 3.2 等竞争对手。其价格为每百万字符 27.60 美元,通过 Alibaba Cloud Model Studio 提供。文章还提供了一组音频样本,供读者对比效果。

Qwen Audio 3.0 TTS Plus 登顶语音合成榜单

资讯正文

阿里巴巴的 Qwen Audio 3.0 TTS Plus 在文本转语音排行榜中领先竞争对手

该模型有两个版本。Flash 版面向实时交互,延迟约为 300 毫秒;而 Plus 版则主打高质量语音输出。它支持 16 种语言,包括覆盖较少的语言,如塔加洛语、马来语、泰语和越南语,以及多种中文方言。用户可以用自然语言来引导说话风格,也可以使用诸如“[angry]”或“[giggles]”之类的标签加入非语言提示。阿里巴巴还表示,与此前版本相比,该模型在克隆声音时,对带有噪声或回声较重的参考录音处理得更好。

来源与参考

  1. 原始链接
  2. Alibaba's Qwen Audio 3.0 TTS Plus tops the competition in the text-to-speech rankings

收录于 2026-07-22