Tavus头像在一分钟视频通话中几乎达到真人水平

The Decoder··作者 Matthias Bastian

关键信息

Griffin能够同时处理并生成语音、面部表情、声音语调、手势、停顿和视频;在Tavus所称的NVIDIA测试中,它的感知类人程度得分为3.83,真人为3.92,此前最佳AI模型为2.80。目前只有能力较弱的Griffin-Lite向部分测试者开放研究预览版,完整版本仍需解决安全问题,而且现有测试证据与Tavus关系密切。

资讯摘要

Tavus宣布了Griffin,并将其描述为首个“人类交互模型”,英文简称为HIM。与传统的文本对话系统不同,Griffin面向实时面对面视频互动,并能够双向处理音频和视频。它会理解语音、面部表情、声音语调、手势和停顿等信号,同时生成自己的语音和视觉回应。在Tavus进行的一项研究中,48%的参与者在一分钟视频通话后相信自己交谈的是真人。

Tavus表示,以往系统在类似指标上的最高比例不超过2%。Tavus还称,一项独立的NVIDIA测试为Griffin评出了3.83的类人程度得分,接近真人的3.92,并高于此前AI模型的最高得分2.80。目前可用的Griffin-Lite仅作为研究预览版提供给部分测试者,Tavus表示,更强大的版本要等安全问题得到解决后才会推出。该公司列出的潜在用途包括辅导、练习困难对话以及基于摄像头的技术支持。

Tavus头像在一分钟视频通话中几乎达到真人水平

资讯正文

Tavus称,在一次一分钟的通话中,近半数受试者将其AI视频化身误认为真人。

Tavus推出了Griffin,公司称其为首个“人类交互模型”(Human Interaction Model,HIM)。这是一类旨在实时理解并进行面对面交流的模型。Griffin在接收和生成视频的同时,会处理语音、面部表情、语调、手势和停顿。

在Tavus开展的一项研究中,48%的参与者在进行一分钟的视频通话后,相信Griffin是真人。此前的系统最高仅达到2%。Tavus称,一项由Nvidia独立进行、用于衡量人工智能在直接音视频对话中具有人类感程度的测试显示,Griffin得分为3.83分。真人得分为3.92分,而此前表现最好的AI模型得分为2.80分。

目前已有一款名为Griffin-Lite的预览版本,作为“面向特定测试者的研究预览”提供。Tavus表示,更强大的版本将在“安全问题得到解决”后推出。Tavus列出的潜在用途包括辅导、练习困难对话,以及基于摄像头的技术支持。

这家总部位于旧金山的AI初创公司成立于2020年,已融资约6400万美元。公司最初为销售和营销领域构建个性化AI视频,随后扩展到让数字化身参与实时视频对话。有关Griffin的更多详情,请参阅Tavus的研究报告。

来源与参考

  1. 原始链接
  2. Nearly half of test subjects mistook Tavus' AI video avatar for a real person on a one-minute call

收录于 2026-10-02