Google推出可用提示词设计声音的Gemini Flash TTS

The Decoder··作者 Matthias Bastian

关键信息

这些模型支持逐行表演指令、双人对话、非语言声音,并提供超过2000种预设声音;声音克隆要求本人录制匹配的口头同意声明,生成的音频还会带有不可听见的SynthID水印。文章作者的测试显示,口音和语调控制较为可信,但部分输出出现高频背景啸声,其中一段音频在结尾还发生了声音漂移。

资讯摘要

Google正通过Gemini API和Google AI Studio逐步推出Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS,之后还计划提供Gemini Enterprise API访问。两款模型都支持100多种语言,创作者既可以为每一行台词指定演绎方式,也可以让模型自行理解剧本提示。定位更高的Flash TTS面向游戏角色、有声书和播客等创意项目,而Flash-Lite则针对大规模、低成本的配音、音频制作和语音智能体进行了优化。Flash TTS可以根据角色、口音和发声特征的文字描述生成全新声音,Google还提供了超过2000种预设声音,其中包括多种地区变体。

其克隆功能能够利用30秒音频创建声音档案,但必须由同一个声音录制口头同意声明,而且每段生成音频都会加入不可听见的SynthID水印。模型还能生成双人对话、笑声、叹息和其他指定反应,Google称其可以连续生成数小时音频,同时将说话者声音漂移控制在较低水平。不过,文章作者的实际测试发现了偶发的高频背景噪声,其中一段音频在结尾出现声音变化,而已公布的音色、音高、语速和口音重混控制功能尚未开放。

Google推出可用提示词设计声音的Gemini Flash TTS

资讯正文

要点

- Google 发布了两款新的文本转语音模型 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,支持 100 多种语言。Flash TTS 可以根据文本描述创建新声音,其声音克隆功能则可利用 30 秒的音频样本建立声音档案。

- Flash TTS 面向播客、有声书和游戏角色等创意用途,而 Flash-Lite TTS 专为大规模、低成本的语音生成而设计,适用于配音、音频内容和语音智能体。

- 两款模型都支持为每句台词添加表演指令、生成双人对话,以及笑声和叹息等非语言声音。它们正通过 Gemini API 和 Google AI Studio 逐步推出,之后还将开放 Gemini Enterprise API 访问。

Google 正在推出用于语音生成的两款新模型:Gemini 3.8 Flash TTS 和 Flash-Lite TTS。Flash TTS 可以根据文本描述创建新声音;两款模型均支持 100 多种语言,并允许用户为每句对话分别添加表演指令。

Google 表示,Gemini 3.8 Flash TTS 专为游戏角色、有声书和播客等创意项目设计,而 Gemini 3.8 Flash-Lite TTS 则侧重于大规模、低成本的语音生成,适用于配音、音频内容和语音智能体。

Flash TTS 允许用户通过文本描述创建声音

借助 Gemini 3.8 Flash TTS,用户可以从零开始设计声音。Google 表示,一段文本提示词即可定义声音的角色、口音和声音特征,并覆盖多种语言和方言。对于不想从头开始的用户,Google 提供了包含 2,000 多种预设声音的声音库,其中包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。

声音克隆功能可以根据一段 30 秒的音频样本建立声音档案。使用该功能时,被克隆声音的本人必须录制一段口头同意声明,而且该录音中的声音必须与样本相匹配。Google 表示,Gemini 音频模型生成的每个音频片段都会带有不可听见的 SynthID 水印,以帮助检测 AI 生成的语音。

Google 还宣布了“Voice Remixing”功能,用户将可借此调整声音库中语音的音色、音高、语速和口音,但该功能目前尚未开放。

脚本指令让用户能够控制对话及表达方式

两款模型都允许用户为每句台词编写指令,也可以让模型自行解读脚本提示。Google 表示,这些模型能够生成数小时的音频,同时将“说话者漂移”降至最低,也就是说,声音几乎不会随着时间推移而发生变化。

该公司称,双声模式可以根据一份脚本生成对话,同时让两种声音保持清晰可辨。用户还可以在脚本中加入笑声、叹息声以及“mhm”之类的声音,从而将反应和停顿准确安排在所需位置。

在我自己的两次测试中,我使用了一个预设语音,并通过风格提示词要求它模仿一名恼火的柏林人,以浓重的德国口音说英语。风格控制生成了颇为逼真的口音和语调,但两次测试的部分片段中,背景里都出现了尖锐的啸声。其中一次测试里,声音在片段结尾处还发生了变化。

风格提示词:一名来自柏林、以英语为外语的德国本地男性,说话带有浓重且极易辨认的德国口音。他显然不是英语母语者:他用德语方式发音,并把德语的节奏和语调套用到英语句子中。“th”变成“z”或“d”(如“ze”“sink”“dat”),“w”变成“v”(如“vat”“vell”),词尾辅音则发得更硬(如把“good”说成“goot”,把“bad”说成“bat”)。“r”是喉音,低沉而浑厚,绝不会发成英语中的“r”。元音平直而短促,没有美式或英式英语中的柔和感。

声音带有鼻音,略显紧绷,音高处于中音区,伴有沙哑的颤音和类似 Kermit 的摇摆感,但更加粗粝,也没那么像木偶。听起来就像凌晨 2 点一个疲惫的柏林人。

表达方式:语速快、短促、生硬且断断续续。他在寻找某个英语单词时会短暂停顿,有时会直接平淡地插入对应的德语词,而不作翻译。偶尔会因恼火而突然上扬音调。整体语气冷淡、讥讽、毫不在意,而且对自己竟然不得不解释任何事情都略感恼火——更让他恼火的是,他还得用英语来解释。

Google 开始推出这两款模型,企业 API 访问随后开放

Google 正通过 Gemini API 和 Google AI Studio 推出这两款模型。Flash TTS 也已在 Gemini Notebook 中提供,而 Flash-Lite TTS 则已登陆 Google Vids。Google 表示,这两款模型很快也将支持通过 Gemini Enterprise API 访问。

包括 Agora、LiveKit、Pipecat 和 Vercel 在内的开发者平台已经支持通过 Gemini API 进行集成。Google 尚未公布这些新模型的区域端点,不过此前的 TTS 模型曾提供欧盟境内的数据处理服务。

Google 表示,免费层级中的数据会被用于改进其产品,而付费层级中的数据则不会。付费价格以每百万 token 的美元价格列出,其中文本 token 按输入计费,音频 token 按输出计费。

来源与参考

  1. 原始链接
  2. Google's new Flash TTS models let you design AI voices from scratch using text descriptions

收录于 2026-09-24