阿里巴巴发布 Qwen Audio 3.1 并大幅下调接口价格

The Decoder··作者 Matthias Bastian

关键信息

ASR-Next 可通过时间戳识别多名说话者,并检测情绪、环境声音和机器噪声;TTS-Next 则结合语言模型与扩散方法,一次生成语音、音效和背景音频。这些能力与降价幅度均来自厂商声明,现有资料未提供针对新模型的独立基准验证。

资讯摘要

阿里巴巴 Qwen 团队推出了 Qwen Audio 3.1,共包含五款模型,覆盖自动语音识别、文本转语音、音频生成和实时语音交互。标准 ASR 模型提升了多语言及方言识别能力,并可自动清理转写文本中的语气词和重复内容。ASR-Next 进一步支持带时间戳的多说话者识别,还能检测情绪、环境声音和机器噪声。TTS 模型支持多语言合成和自然的跨语言音色迁移,用户可通过自然语言提示控制情绪、语速与表达风格。

TTS-Next 将语言模型与扩散方法结合,可一次生成语音、音效和背景音频。实时模型能够边说边听并立即响应打断;Qwen 称,它在检测到用户情绪低落时还会放慢语速,以更具同理心的方式回应。伴随此次发布,阿里巴巴表示 TTS、Realtime 和 ASR 的接口价格分别降低约 70%、85% 和最高 95%。

阿里巴巴发布 Qwen Audio 3.1 并大幅下调接口价格

资讯正文

阿里巴巴的 AI 团队 Qwen 发布了 Qwen-Audio-3.1,其中包括五款用于自动语音识别(ASR)、文本转语音(TTS)和实时交互的模型。ASR 模型提升了多语言及方言识别能力,并能自动清理填充词和重复内容。ASR-Next 增加了带时间戳的多说话人识别功能,还可以检测情绪、环境声和机器噪声。TTS 支持多语言合成,并能实现自然的跨语言音色迁移。用户可以通过简单的文本提示词控制情绪、语速和风格,例如:“用尖锐且威严的语气朗读这段内容,要求对方给予尊重。”

TTS-Next 将语言模型与扩散方法相结合,可一次生成语音、音效和背景音频。实时模型支持同时说话和聆听,并可即时打断。据 Qwen 称,当模型检测到用户情绪低落时,会以更慢的速度、更具同理心的方式作出回应。阿里巴巴同时还大幅下调了价格:TTS 降价约 70%,Realtime 降价约 85%,ASR 最高降价 95%。更多详情可参阅官方博客和 Qwen Cloud。

来源与参考

  1. 原始链接
  2. Alibaba launches Qwen Audio 3.1 with new models and slashes AI audio prices by up to 95 percent

收录于 2026-09-24