Gemini 3.8 TTS 演练场支持多角色与自定义语音
Simon Willison··作者 Simon Willison
关键信息
该演练场利用 Gemini API 的开放 CORS 策略直接从浏览器发起请求;API 密钥仅保留在页面内存中并直接发送给 Google,不会写入已保存或分享的网址。Willison 的测试显示,Gemini 3.8 Flash TTS 生成一段 1 分 18 秒的双角色音频约耗时 20 秒,成本为 2.74 美分。
资讯摘要
Google 于 2026 年 9 月 23 日发布了 gemini-3.8-flash-tts 和 gemini-3.8-flash-lite-tts 两款文本转语音模型。它们提供超过 2,000 种语音,并可根据一段 30 秒音频样本创建自定义语音,前提是提交者拥有该声音或取得了使用权。Simon Willison 使用 GPT-6 Astra,并借助 Gemini API 的开放 CORS 策略,构建了一个浏览器端演练场。用户既可以选择单一语音,也可以编排包含多个具名角色的对话,并为每个角色指定不同的声音和表达风格。
编排设置可以保存在可加入书签或分享的网址中,而 API 密钥不会被写入网址,只保留在页面内存里。界面还展示底层请求 JSON 和响应详情,便于开发者理解如何集成该 API。作为演示,Willison 让 Claude 4.5 Opus 编写了一段剧本,生成两只鹈鹕讨论是否搬到 Pacifica Pier 的对话。该音频长 1 分 18 秒,使用 Gemini 3.8 Flash TTS 生成约耗时 20 秒,费用为 2.74 美分。

资讯正文
工具:Gemini 3.8 TTS Playground
Google 今天发布了两款新的 Gemini 文本转语音模型:`gemini-3.8-flash-tts` 和 `gemini-3.8-flash-lite-tts`。
它们提供一个包含 2,000 多种声音的语音库,还可以创建自定义声音,“只需一段 30 秒的本人声音样本,或一段你有权使用的声音样本”。
我利用底层 Gemini API 开放的 CORS 策略,使用 GPT-6 Astra 通过 vibe coding 的方式编写了这个可自带密钥的 Playground 界面。
该 API 的一个显著特点是,可以轻松定义多个角色之间的完整对话,并为每个角色设置不同的声音和声音风格指令。
下面是一段简短的演示音频,两只鹈鹕正在讨论是否应该搬到 Pacifica Pier。我让 Claude 4.5 Opus 编写了脚本,并生成了一个使用该工具渲染音频的 URL。
使用 Gemini 3.8 Flash TTS(而不是价格更低的 Flash-Lite)生成这段 1 分 18 秒的音频耗时约 20 秒,成本为 2.74 美分。
来源与参考
收录于 2026-09-24