Google推出可用提示词设计声音的Gemini Flash TTS
The Decoder··作者 Matthias Bastian
关键信息
这些模型支持逐行表演指令、双人对话、非语言声音,并提供超过2000种预设声音;声音克隆要求本人录制匹配的口头同意声明,生成的音频还会带有不可听见的SynthID水印。文章作者的测试显示,口音和语调控制较为可信,但部分输出出现高频背景啸声,其中一段音频在结尾还发生了声音漂移。
资讯摘要
Google正通过Gemini API和Google AI Studio逐步推出Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS,之后还计划提供Gemini Enterprise API访问。两款模型都支持100多种语言,创作者既可以为每一行台词指定演绎方式,也可以让模型自行理解剧本提示。定位更高的Flash TTS面向游戏角色、有声书和播客等创意项目,而Flash-Lite则针对大规模、低成本的配音、音频制作和语音智能体进行了优化。Flash TTS可以根据角色、口音和发声特征的文字描述生成全新声音,Google还提供了超过2000种预设声音,其中包括多种地区变体。
其克隆功能能够利用30秒音频创建声音档案,但必须由同一个声音录制口头同意声明,而且每段生成音频都会加入不可听见的SynthID水印。模型还能生成双人对话、笑声、叹息和其他指定反应,Google称其可以连续生成数小时音频,同时将说话者声音漂移控制在较低水平。不过,文章作者的实际测试发现了偶发的高频背景噪声,其中一段音频在结尾出现声音变化,而已公布的音色、音高、语速和口音重混控制功能尚未开放。

资讯正文
要点
- Google 发布了两款新的文本转语音模型 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,支持 100 多种语言。Flash TTS 可以根据文本描述创建新声音,其声音克隆功能则可利用 30 秒的音频样本建立声音档案。
- Flash TTS 面向播客、有声书和游戏角色等创意用途,而 Flash-Lite TTS 专为大规模、低成本的语音生成而设计,适用于配音、音频内容和语音智能体。
- 两款模型都支持为每句台词添加表演指令、生成双人对话,以及笑声和叹息等非语言声音。它们正通过 Gemini API 和 Google AI Studio 逐步推出,之后还将开放 Gemini Enterprise API 访问。
Google 正在推出用于语音生成的两款新模型:Gemini 3.8 Flash TTS 和 Flash-Lite TTS。Flash TTS 可以根据文本描述创建新声音;两款模型均支持 100 多种语言,并允许用户为每句对话分别添加表演指令。
Google 表示,Gemini 3.8 Flash TTS 专为游戏角色、有声书和播客等创意项目设计,而 Gemini 3.8 Flash-Lite TTS 则侧重于大规模、低成本的语音生成,适用于配音、音频内容和语音智能体。
Flash TTS 允许用户通过文本描述创建声音
借助 Gemini 3.8 Flash TTS,用户可以从零开始设计声音。Google 表示,一段文本提示词即可定义声音的角色、口音和声音特征,并覆盖多种语言和方言。对于不想从头开始的用户,Google 提供了包含 2,000 多种预设声音的声音库,其中包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。
声音克隆功能可以根据一段 30 秒的音频样本建立声音档案。使用该功能时,被克隆声音的本人必须录制一段口头同意声明,而且该录音中的声音必须与样本相匹配。Google 表示,Gemini 音频模型生成的每个音频片段都会带有不可听见的 SynthID 水印,以帮助检测 AI 生成的语音。
Google 还宣布了“Voice Remixing”功能,用户将可借此调整声音库中语音的音色、音高、语速和口音,但该功能目前尚未开放。
脚本指令让用户能够控制对话及表达方式
两款模型都允许用户为每句台词编写指令,也可以让模型自行解读脚本提示。Google 表示,这些模型能够生成数小时的音频,同时将“说话者漂移”降至最低,也就是说,声音几乎不会随着时间推移而发生变化。
该公司称,双声模式可以根据一份脚本生成对话,同时让两种声音保持清晰可辨。用户还可以在脚本中加入笑声、叹息声以及“mhm”之类的声音,从而将反应和停顿准确安排在所需位置。
在我自己的两次测试中,我使用了一个预设语音,并通过风格提示词要求它模仿一名恼火的柏林人,以浓重的德国口音说英语。风格控制生成了颇为逼真的口音和语调,但两次测试的部分片段中,背景里都出现了尖锐的啸声。其中一次测试里,声音在片段结尾处还发生了变化。
风格提示词:一名来自柏林、以英语为外语的德国本地男性,说话带有浓重且极易辨认的德国口音。他显然不是英语母语者:他用德语方式发音,并把德语的节奏和语调套用到英语句子中。“th”变成“z”或“d”(如“ze”“sink”“dat”),“w”变成“v”(如“vat”“vell”),词尾辅音则发得更硬(如把“good”说成“goot”,把“bad”说成“bat”)。“r”是喉音,低沉而浑厚,绝不会发成英语中的“r”。元音平直而短促,没有美式或英式英语中的柔和感。
声音带有鼻音,略显紧绷,音高处于中音区,伴有沙哑的颤音和类似 Kermit 的摇摆感,但更加粗粝,也没那么像木偶。听起来就像凌晨 2 点一个疲惫的柏林人。
表达方式:语速快、短促、生硬且断断续续。他在寻找某个英语单词时会短暂停顿,有时会直接平淡地插入对应的德语词,而不作翻译。偶尔会因恼火而突然上扬音调。整体语气冷淡、讥讽、毫不在意,而且对自己竟然不得不解释任何事情都略感恼火——更让他恼火的是,他还得用英语来解释。
Google 开始推出这两款模型,企业 API 访问随后开放
Google 正通过 Gemini API 和 Google AI Studio 推出这两款模型。Flash TTS 也已在 Gemini Notebook 中提供,而 Flash-Lite TTS 则已登陆 Google Vids。Google 表示,这两款模型很快也将支持通过 Gemini Enterprise API 访问。
包括 Agora、LiveKit、Pipecat 和 Vercel 在内的开发者平台已经支持通过 Gemini API 进行集成。Google 尚未公布这些新模型的区域端点,不过此前的 TTS 模型曾提供欧盟境内的数据处理服务。
Google 表示,免费层级中的数据会被用于改进其产品,而付费层级中的数据则不会。付费价格以每百万 token 的美元价格列出,其中文本 token 按输入计费,音频 token 按输出计费。
来源与参考
收录于 2026-09-24