ElevenLabs 发布 Eleven v4,让 AI 语音更生动、更一致。
The Decoder··作者 Jonathan Kemper
关键信息
Eleven v4 可以理解内联标签或自然语言指令,以控制情绪、节奏、反应、音效和发音;此前在 v3 中不可用的 Professional Voice Clones 也已恢复支持。150 毫秒延迟及与竞争模型的比较来自 ElevenLabs 自行开展的测试,因此独立基准测试可能得出不同结果。
资讯摘要
ElevenLabs 发布了语音合成模型 Eleven v4,旨在更准确地执行表演指令,并在长篇制作中保持声音身份的一致性。与 Eleven v3 相比,它能更可靠地生成笑声、耳语和关门声等效果,同时分析脚本的语气、节奏和整体上下文。用户可以通过音频标签或普通语句指导表演,也可以使用音标式拼写来控制姓名和技术术语的发音。该模型支持超过 90 种语言,高于 v3 的约 70 种,并且单次请求最多可处理 10,000 个字符,相当于约十分钟音频。
ElevenLabs 表示,克隆声音可以用接近母语的口音说其他语言,并避免逐渐回到原始声音的母语口音;Instant Voice Clone 则只需要十秒参考音频。独立的 Eleven v4 Turbo 面向实时语音代理,据称可在 150 毫秒内开始输出可听语音;该公司测试显示,Cartesia Sonic 3.6 和 GPT-4o mini TTS 的对应时间分别为 262 毫秒和 814 毫秒。v4 和 Turbo 的标准 API 价格分别为每百万字符 80 美元和 40 美元,10 月 12 日前的临时优惠价分别为 22 美元和 11 美元,两款模型现已在 ElevenAgents、ElevenCreative 和 API 中提供。ElevenLabs 还将 v4 定位为使用授权声音克隆进行多语言配音的工具,但其性能、延迟和竞争优势目前主要来自厂商自身报告。

资讯正文
ElevenLabs 新款 v4 语音模型让 AI 声音更具表现力且更加一致
要点
- ElevenLabs 发布了语音模型 Eleven v4,该模型能够更准确地遵循指令提示,并在较长的作品中保持声音的一致性。
- 新版本支持 90 多种语言,改进了声音克隆功能,并且单次请求最多可处理 10,000 个字符。
- Eleven v4 Turbo 面向语音智能体,响应时间为 150 毫秒。ElevenLabs 称,这一速度快于竞争对手的模型。
ElevenLabs 正式发布新款语音模型 Eleven v4。该模型能够更准确地遵循指令提示,并在较长的作品中保持声音一致。新的模型架构还为面向实时语音智能体的 Turbo 版本提供支持。
与上一代模型相比,Eleven v4 能够更可靠地生成笑声、耳语以及关门撞击声等声音。面向语音智能体的 Turbo 版本可在大约 150 毫秒内开始生成语音。Eleven v3 于一年多前发布,已经支持这些音频标签,但执行这些标签的准确性较低。
更强的一致性
ElevenLabs 表示,v4 采用了一种新架构,可以分析脚本的语气、节奏和上下文。用户既可以通过标签或普通语句下达指令,也可以使用语音拼写来设定人名和技术术语的发音。该公司称,发音控制功能现在更加可靠。即使用户多次重新生成个别台词,旁白和角色的声音在整部作品中也应当保持一致。
Eleven v4 单次请求最多可处理 10,000 个字符,大约相当于十分钟的音频。有声书等篇幅较长的作品会使用多个片段生成,其节奏和演绎方式预计能在片段衔接时保持一致。在对话中,AI 说话者会根据整个场景的上下文作出回应,而不是孤立地演绎每一句台词。
新版本支持 90 多种语言,高于 v3 的约 70 种。克隆声音在说其他语言时应能呈现母语般的口音,并且不会随着时间推移逐渐恢复为原来的口音。v3 不支持的 Professional Voice Clones 功能现已重新可用,而“Instant Voice Clone”仅需十秒钟的音频。
Turbo 旨在让富有表现力的语音智能体响应更快
ElevenLabs 还推出了速度更快的 v4 版本,适用于客户服务电话或游戏角色等实时场景。该公司表示,语音智能体开发者过去不得不在速度与表现力之间作出取舍,而 v4 Turbo 旨在兼顾两者。
在 ElevenLabs 的测试中,Turbo 可在 150 毫秒内开始输出可听见的语音,相比之下,Cartesia Sonic 3.6 需要 262 毫秒,OpenAI 的 GPT-4o mini TTS 则需要 814 毫秒。ElevenLabs 将 Turbo 与其 ElevenAgents 平台结合起来进行了优化。
更高质量的声音克隆让 v4 适用于配音。ElevenLabs 强调,用户可以在其支持的所有语言中使用同一名演员的声音。该公司会向声音背后的本人取得授权。配音演员可以在 ElevenLabs 的声音库中提供经过大量训练的个人声音克隆,并在付费用户使用该声音时获得收入。ElevenLabs 已经通过一个专门的市场提供 Michael Caine 等名人的声音。
两款模型上线时均提供临时降价优惠
ElevenLabs 的标准 API 定价为:v4 每百万字符 80 美元,Turbo 每百万字符 40 美元。截至 10 月 12 日,这两项价格将分别降至 22 美元和 11 美元。据 ElevenLabs 介绍,订阅每月 22 美元 Creator 套餐或更高级别套餐的用户,可以在 ElevenCreative 中免费使用 v4 两周,用量上限为其每月额度的两倍。Artificial Analysis 列出的 Sonic 3.6 价格为每百万字符 49 美元,Gemini 3.8 Flash TTS 为每百万字符 16.49 美元。
目前,这两款模型均已在 ElevenAgents、ElevenCreative 及 API 中上线。根据 ElevenLabs 的文档,该公司默认将客户数据存储在美国。企业客户可以将数据存储在欧盟、印度或新加坡的隔离环境中,但部分处理工作可能会在所选区域之外进行。在欧盟,客户可以通过使用不保留数据的模式,将 API 处理限制在该区域内完成。
ElevenLabs 还在 9 月中旬发布了 Music 2.5 模型,旨在生成内容更丰富、听感更自然的歌曲。
来源与参考
收录于 2026-09-30