Google 为 Gemini Enterprise 推出实时虚拟形象

Google DeepMind News··作者 Shuo-yiin Chang

关键信息

Live Avatar 可以同时处理音频和视觉输入,并在异步工具获取信息时继续对话;它还支持在 97 种语言之间切换,同时调整唇形同步和面部表情。Google 表示生成内容带有不可察觉的 SynthID 水印,但公告没有提供充分的基准测试、延迟数据或详细安全评估。

资讯摘要

Google 在上周推出 Gemini 3.8 Live 后,宣布了 Gemini 3.8 Live with Live Avatar。此次更新通过将视频生成与语音结合,为 Google 的原生实时对话模型增加了近实时的视觉形象。虚拟形象能够倾听、观察和说话,并通过唇形同步、面部表情以及自然的轮流发言,让对话更加接近真人交流。Google 将该功能定位于企业场景,例如客户服务和互动式操作讲解,并表示它已经在 Gemini Enterprise 中提供。

Live Avatar 可以同时处理音频和视觉输入,而 Gemini 的推理能力支持在后台异步调用工具,使代理能够获取数据而不中断对话。Google 以酒店入住办理为例,展示了这种持续互动的工作流程。该功能支持覆盖 97 种语言的多语言语音到语音同步,并允许组织使用预设虚拟形象,或根据高质量参考图片申请定制形象,但定制功能需要企业许可名单批准。Google 还表示,音频和视频输出都带有 SynthID 水印,以帮助识别 AI 生成内容并减少错误传播或身份归属错误。

Google 为 Gemini Enterprise 推出实时虚拟形象

来源与参考

  1. 原始链接
  2. Gemini 3.8 Live with Live Avatar gives Google’s AI a face
  3. Introducing Gemini 3.8 Live with Live Avatar

收录于 2026-09-25