Suno推出同步生成语音与音乐的功能
The Verge AI··作者 Jess Weatherbed
关键信息
Speech提供基于提示词的Simple模式和基于脚本的Advanced模式,并支持调节AI声音的性别、说话风格和生成变化程度;用户也可以关闭背景音乐。单次生成时长约为八分钟,但Suno提醒,测试版中的口音、停顿和其他声音细节仍可能不稳定。
资讯摘要
Suno正在从AI音乐生成领域扩展出去,推出了能够根据描述或预先准备的脚本生成 spoken voice 的Speech功能。Speech目前以公开测试版形式登陆Suno网页端和移动应用,并且可以同时生成旁白与背景音乐。Suno首席产品官Jack Brody称,这是该公司首个将声音和音乐作为一个连贯音轨共同生成的音频模型,同时强调音乐仍然是Suno产品愿景的核心。背景音乐是可选项,如果用户只需要干净的语音,可以通过开关将其关闭。
Suno认为,语音与音乐结合后,可用于带有舒缓配乐的诗歌、戏剧化配音以及更有活力的励志演讲。用户需要进入Create选项卡,再选择Speech;Simple模式允许用户用提示词描述想要的内容,Advanced模式则允许输入准确脚本。Advanced设置还可以调整AI声音的性别、说话风格以及每次生成的变化程度,单次生成最长约八分钟。Suno承认测试版仍不完善,例如英国口音可能突然偏向澳大利亚口音,戏剧性停顿也可能过度,但公司表示会根据用户反馈持续改进。

资讯正文
Suno 正在拓展 AI 音乐领域,推出了一项可根据脚本或提示描述生成口语声音的新功能。目前,Speech 已在 Suno 的网页端和移动端以公开测试版形式推出,用户可以同时生成旁白和与之搭配的背景音乐。
Suno 首席产品官 Jack Brody 在公告中表示:“音乐始终是 Suno 以及我们所构建的一切的核心。与此同时,我们的愿景一直延伸到人类表达的其他形式。今天,我们通过 Speech 拓展了 Suno 的可能性:这是首个将语音和音乐作为一条连贯音轨共同生成的音频模型。”
AI 生成语音并不是什么新鲜事——DeepMind 已经进行了十年的深度学习语音合成实验,Adobe 有一款文本转语音工具,而 ElevenLabs 自 2023 年推出以来,已经成为这一领域最知名的平台之一。Suno 只是加入了这场竞争——这很可能是为了实现平台多元化,因为其音乐生成器已经引发了大量诉讼。
将 AI 音乐与生成的声音结合起来,是 Suno 对文本转语音工具的一种独特尝试。这项功能是可选的:如果你只想要纯净的语音,可以通过开关轻松关闭背景音乐。但其设计理念是为某些生成式口语内容的使用场景提供配合,例如为诗歌搭配舒缓的配乐,或为戏剧性旁白和鼓舞人心的演讲搭配更有活力的音乐。
要使用这项功能,请选择“Create”选项卡,然后进入 Speech。该功能有两种模式:Simple 模式允许你通过提供的提示框描述想要生成的内容,例如“一个正在召集船员的海盗船长”;Advanced 模式则允许你添加自定义脚本,适合已经明确知道希望它说什么的情况。高级设置还可以调整 AI 声音的性别、说话风格,以及每次生成的声音具有多大程度的变化。Speech 的最长时长约为 8 分钟。
Suno 承认,这项功能还远未完善,但表示将根据用户反馈持续改进 Speech。Brody 说:“测试版真的就意味着测试版。英国口音有时可能会‘走神’跑到澳大利亚,然后再回来。戏剧性的停顿可能会非常戏剧化。你几乎肯定会发现一些我们从未想到过的用途。”
来源与参考
收录于 2026-10-03