用于体验 Gemini Live 音频的浏览器工具
Simon Willison··作者 Simon Willison
关键信息
该实现不使用外部库,而是连接 Google 的双向 WebSocket 端点,并使用 AudioContext 完成麦克风采集和音频播放。用户必须授予麦克风权限;界面还提示,转写内容可能包含播放前就被打断的语音,使用耳机则有助于减少回声。
资讯摘要
Google 发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两个新的语音到语音模型。Simon Willison 认为,它们整体上与 OpenAI 的 GPT-Live 系列较为相似。他让 GPT-6 Astra Extra High 参考模型文档,为这些新模型生成了一个网页界面。用户可以选择模型和声音预设,输入可选的系统提示词,并在浏览器中开始语音对话。
模型说话时,用户可以直接打断它,也可以发送文字消息来中断当前回复。页面提供会话控制、麦克风静音、麦克风音量指示器、计时器、状态信息,以及可下载或清除的转写记录。实现部分不依赖任何库,而是使用 Google 的 GenerativeService 双向 WebSocket 端点,并通过 Web Audio API 的 AudioContext 完成音频采集和播放。

资讯正文
工具:Gemini Live audio
Google 今天发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking,这是两款全新的语音到语音模型,整体形态与 OpenAI 的 GPT-Live 系列相似。
我将文档交给 GPT-6 Astra Extra High,让它为我构建了这个网页界面,用于试用这些新模型。你可以选择模型和语音预设,输入可选的系统提示词,然后通过浏览器开始语音对话;对话过程中还可以在模型说话时打断它。
[图片:一个带有文字记录的语音聊天网页界面截图。顶部按钮包括“开始会话”“结束会话”和“麦克风静音”,旁边有麦克风音量计和显示 0:33 的计时器。状态显示为“正在聆听”。界面提示:使用耳机可减少回声。开始会话时会请求麦克风访问权限。文字记录区域带有“下载文字记录”和“清除”按钮。Gemini:是的,运行得非常好。我能清楚地听到你的声音。今天我能为你做些什么?你:好吧,这效果相当不错。告诉我一些加州褐鹈鹕的有趣事实。Gemini:它们以壮观的俯冲捕鱼而闻名,巨大的喉囊最多可以容纳三加仑的水和鱼。它们在濒危之后也实现了很好的恢复——此处标记为“已打断”。你:不,其实告诉我一些不同的事实。Gemini:它们会在近海岛屿上群居筑巢,喉囊最多可以容纳三加仑的水。底部有一个文本输入框,提示文字为“或输入消息……”,旁边是“发送”按钮;下方还注明:发送消息会打断当前回复。文字记录可能包含在播放前就被打断的语音内容。]
该实现没有使用任何库。它连接到 <code>wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent?key=...</code> WebSocket 端点,并使用 Web Audio API 的 <code>AudioContext</code> 同时进行音频采集和播放。
如果想开始使用这个 WebSockets API,可以参考 Gemini Live 教程。
来源与参考
收录于 2026-09-17