Synthesia将数字化身用于互动公关和培训
TechCrunch AI··作者 Dominic-Madori Davis
关键信息
这个数字化身由多张照片和一段两分钟的语音录音制作而成,并被限定为只回答一篇指定报道相关的问题。其系统结合了语音转文字、智能代理语言模型、文字转语音和Synthesia的视频模型;客户还可以选择Cartesia、ElevenLabs、Google或OpenAI等提供商的模型,并决定托管方式。
资讯摘要
Synthesia的企业事务负责人Alexandru Voica向记者介绍了一个互动数字化身,该化身经过训练,可以回答有关Synthesia的常见问题。这种体验不同于使用AI生成公关文案,因为数字化身能够进行互动回应,而不是只重复预先写好的信息。Synthesia最初成立于英国,是一家数字化身初创公司;公司表示其在当年早些时候达到40亿美元估值,并在前一年实现超过1亿美元的ARR。Synthesia邀请记者前往纽约办公室,通过拍摄多张照片和录制两分钟语音来制作数字分身。
公司制作了只能朗读脚本的个人化身,也制作了能够聆听和回应的互动化身,并提供戴眼镜或不戴眼镜的版本。这个互动化身以记者关于“为什么风险投资支持的初创公司比非风险投资支持的初创公司更容易实施欺诈”的文章为训练内容,并被设计为只回答与该报道有关的问题。其技术结合了语音识别、语言理解、语音生成和视频动画,而Synthesia的产品主要分为脚本视频、互动Sessions以及用于构建相关产品的API平台。

资讯正文
今年夏天,视频生成初创公司 Synthesia 的企业事务负责人 Alexandru Voica 给我发来一个链接,介绍他们公关团队的最新成员时,我感到很惊讶。那是一个他的互动虚拟化身,经过训练,可以回答有关 Synthesia 的常见媒体问题,比如公司是做什么的以及如何运作。就在前一天,我还参加了一场讨论会,其间公关从业者问我是否介意收到使用 AI 生成文本撰写的推介邮件。但 Alexandru 的虚拟化身远不止于此——在我看来,这似乎是 AI 用于公关的终极形态。
9 月,Synthesia 邀请我参观了位于纽约的新办公空间。Synthesia 最初成立于英国,如今已成为炙手可热的数字化身初创公司,与 D-ID、HeyGen 和 Colossyan 等公司并列。今年早些时候,该公司的估值达到 40 亿美元,并表示去年年度经常性收入(ARR)已突破 1 亿美元。
Synthesia 可以让企业利用 AI 化身制作互动培训视频。该公司最近还推出了一款名为 Roleplay Sessions 的产品,让员工可以与能够回应并评估其回答的互动 AI 化身进行练习,例如练习销售推介。
我参加新办公室开幕活动时,他们问我是否想拥有自己的 AI 化身,我甚至没有丝毫犹豫就答应了。当然,我愿意拥有自己的数字孪生体。那天我的穿搭很可爱,头发也打理得很整齐。
在见到自己的数字孪生体之前,我对虚拟化身一直无所谓,但我觉得它们迟早会成为日常网络生活的一部分。我听说有人在 Instagram 上创建与自己相像的虚拟化身,帮助自己制作社交媒体内容。我觉得这一切非常有趣,也许正因如此,如今我毫不介意把我的数字孪生体介绍给大家。这是 Synethsia 第一次为记者制作数字化身(或者说,第一次为 Voica 之外的任何人制作数字化身)。它以我那篇关于为什么有风险投资支持的初创公司比没有获得风投支持的初创公司更容易实施欺诈的报道为训练内容,并且只会回答与那篇报道有关的问题。
下面只需点击“在新窗口中开始”即可开始。
你可以向它提问,例如:
- 我为什么决定撰写这篇报道?
- 这篇研究论文讲的是什么?
- 研究人员得出了什么结论?
为了制作这个化身,我进入了 Synthesia 办公室内的一间小型摄影棚。他们为我拍摄了大量照片,并录下了一段两分钟的声音。我必须同意制作这些化身,然后,数字版 Dom 就这样诞生了。他们为我制作了一个个人化身(只会朗读我提供的任何脚本),并分别制作了戴眼镜和不戴眼镜的版本;此外,他们还为我制作了两个互动化身(可以与我对话并听我说话),同样分别有戴眼镜和不戴眼镜的版本。
我们选定了一篇文章,用来训练这个互动化身。随后,其中一个团队构建了我的互动化身,其运行依托于语音转文本、视频、语言和文本转语音模型的组合。我的化身技术栈包括 Synthesia 自研的视频和语音模型,不过该公司也允许客户选择 Cartesia、ElevenLabs、Google 或 OpenAI 等其他实验室提供的替代方案。企业还可以选择将化身托管在自己指定的云平台上,或者付费让 Synthesia 负责托管。
语音转文本模型会将人们说的话转换成文字,智能体语言模型则理解这些文字,并据此采取行动;文本转语音模型把回应转换成音频;最后,视频模型(由 Synthesia 构建)会让头像在说话时做出动画效果。
总体而言,Synthesia 构建了三类产品:第一类是视频创作与分发平台,使用经典头像,用户输入一段脚本,头像便会将其复述出来;第二类是名为 Sessions 的智能体平台,人们可以在调查或角色扮演中与这些头像互动;第三类是 API 平台,用户可以将 Synthesia 的视频和语音模型与其他技术服务结合起来,构建互动式头像或其他类型的产品。
Synthesia 团队花了几天时间制作我的头像。我先试用了个人头像,输入了一段相当普通的脚本,想看看我的 AI 声音听起来是什么样。我让它谈谈纽约已经进入秋季——这是我一年中最喜欢的时节。声音相当准确,令我欣慰的是,它没有录入我录制音频样本时嗓音中的沙哑感。
我把它展示给几位不懂技术的朋友,他们觉得这既有趣又令人毛骨悚然。
随后我又给他们看了我的互动头像。这个头像是确定性的,也就是说,它只会说出训练时设定好的回应。在这个案例中,训练内容是我的创投欺诈故事。我问它一些问题,比如我在 TechCrunch 之前在哪里工作,以及我住在纽约的哪个地方,但每一次,它都把我引回到那个故事上。
我的朋友们觉得它的声音听起来不太像我,外貌也不如个人头像相似,但尽管如此,它仍然足够相像,多少让人感到诡异。我妈妈称它“太神奇了”,这对她来说已经是相当高的评价。她和我父亲不断试图问它一些“只有他们才知道”的关于我的问题——但模型并没有回答,而是每次都把他们重新引向那个创投欺诈故事。
测试完模型后,她开玩笑说:“我不记得自己生过两个你。”
这次经历让我开始思考新闻业的未来可能是什么样。人们打开新闻,却发现新闻是由一个头像播报的,他们会接受吗?一位投资人立刻告诉我,不会。当然,如今社交媒体和其他新闻分享平台上充斥着 AI 垃圾内容,人们对此已经有很强烈的反弹。但我询问的其他人并不那么确定。头像能否增强记者的能力,甚至取代记者?首席执行官们会不会愿意与一名记者的 AI 头像交谈,而不是与真人记者交谈?
我喜欢自己的职业,是因为它让我能够与人建立联系、撰写报道,并研究新的主题。但新闻业最重要的部分是信任。我不认为这件事能够被外包给 AI。
在新闻业之外,我相信克隆自己的想法可能会很有吸引力。这样一来,假期结束后就不用再抽时间补工作,因为总会有一个你的版本待在那里,回答各种问题。
我们还得看看,数字化身在美国企业界会如何发展。不过,既然我现在也有了自己的数字化身,我的感受很复杂。最初的新鲜感过去后,我仔细端详着它,直到它停止说话,然后等待着——至于在等什么,我也说不清。也许我在等它眨眼。或者说点新东西,或者微笑,或者只是让我知道它明白这一切。
因为我的数字孪生是确定性的,所以它们永远不会这样做。但我可以想象,如果数字孪生具有非确定性——也就是说,由一个可以自由发表长篇议论的聊天机器人驱动——人们会多么容易对它产生一丝“AI精神病”。
我告诉过一位投资人,无论数字孪生的未来如何,我都预测我们这一代,也就是Z世代,可能不会习惯它们。它们让人感觉像科幻作品:我们曾在电影里看到的一切,如今都已经成为现实。不过我得说,比起人形机器人,我觉得数字化身没那么令人不安。至少有了数字化身,如果事情变得诡异,我随时都可以退出登录。
不过在那之前,下面就是我的个人数字化身,它会为你概述本周我们网站上的所有头条新闻!
来源与参考
收录于 2026-09-27