Fish Audio 融资 5200 万美元种子轮
TechCrunch AI··作者 Ivan Mehta
关键信息
Fish Audio 表示,其控制库包含超过 15,000 个自然语言控制项,并且过去一年发布了 5 个模型,其中包括 4 个语音生成模型和 1 个语音转文字模型。其最新的 S2.1 Pro 模型只通过付费 API 提供,而其中 3 个语音生成模型已经开源。
资讯摘要
总部位于帕洛阿尔托的 Fish Audio 已完成 5200 万美元的种子轮融资,用于扩大其 AI 语音模型业务。该轮融资由 Coreline Ventures 和 Capital Today 领投,359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners 和 HF0 参与投资。公司表示,这笔资金将帮助其开发更先进的模型,并同时服务创作者和企业客户。Fish Audio 目前称,其开源和托管产品合计已有超过 800 万用户,年经常性收入达到 2100 万美元。该公司的产品思路是:创作者需要更有表现力的语音,而企业客户则需要更可控、更适合业务流程的语音。CEO 兼联合创始人 Rissa Cao 表示,Fish Audio 拥有超过 15,000 个自然语言控制项,以支持这些不同场景。Fish Audio 最初是前 Nvidia 研究员 Shijia Liao 的一个小项目,他因为市场上合成语音不够生动,而用单块 GPU 训练了早期语音模型并将其开源。如今,Fish Speech 的 GitHub 仓库已经超过 31,000 个星标,并被独立开发者、游戏设计师和创作者使用。
过去一年里,公司发布了 5 个模型,其中包括 4 个语音生成模型和 1 个语音转文字模型,并开源了其中 3 个语音生成模型。其最新的 S2.1 Pro 模型只能通过付费 API 使用。Fish Audio 还提供面向创作者和团队的月度付费方案,以及企业版 API 和平台,并称 HeyGen、Sanas 等公司已经在使用。与此同时,公司也面临过关于语音授权和同意的争议:它允许用户提交自己的声音用于训练,并在使用时向其支付报酬,但一些创作者此前指控自己的声音在未获同意的情况下被上传。Cao 说,Fish Audio 现在已经自动化了下架流程,创作者只需提供一段语音样本或合同,就能在 3 分钟内移除相关声音;不过,未经授权的上传在被举报前仍可能继续留在平台上。Coreline 的合伙人 Osuke Honda 表示,社区驱动模式只有在创作者信任平台时才真正成立,并呼吁建立可验证的声音所有权、更清晰的授权条款、更便捷的举报和下架机制,以及最终的收入分成机制。Fish Audio 还表示,最初只做开源项目和面向创作者的计划时,公司运营非常高效,并不需要外部资本,但随着其想要开发更先进的模型并扩展企业业务,且投资人兴趣升温,公司才决定融资。

资讯正文
AI 生成语音模型的市场规模巨大。创意类场景需要 AI 语音模型具备更强的表现力,而希望自动化客服和销售运营的企业则需要它们更容易被控制。
总部位于帕洛阿尔托的 Fish Audio 希望凭借其超过 15,000 条自然语言控制指令的库来满足所有这些使用场景。自去年上线以来,这家初创公司如今已有超过 800 万人使用其开源版或托管版模型,年经常性收入达到 2100 万美元。
为了继续扩大这一势头,该初创公司周二表示,已完成一轮 5200 万美元的 seed 融资,由 Coreline Ventures 和 Capital Today 领投。此轮融资还吸引了 359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners 和 HF0 参与。
Fish Audio 最初只是前 Nvidia 研究员 Shijia Liao 的一个小项目。他对市面上缺乏表现力的合成语音感到不满,于是在一块单 GPU 上训练了一个语音生成模型,随后将其开源。GitHub 上的 Fish Speech 仓库如今已有超过 31,000 个星标,并被独立开发者、电子游戏设计师和创作者使用。
该公司在过去一年推出了五款模型:四款语音生成模型和一款语音转文字模型。它已开源其中三款语音生成模型,但最新的 S2.1 Pro 模型仅可通过其付费 API 使用。
Fish Audio 提供面向创作者和团队的付费月度套餐,可解锁一定分钟数的生成时长以及声音克隆功能。该公司还提供其 API 和平台的企业版本,并表示 HeyGen 和 Sanas 等机构已经在使用。
Fish Audio 首席执行官兼联合创始人 Rissa Cao 表示:“每家企业都有不同的使用场景和偏好。比如,像 HeyGen 这样使用我们的声音来驱动 AI 头像的公司,希望声音具备真实感;游戏工作室则希望角色的声音更有表现力;而像 LiveKit 这样的语音代理公司,则希望声音更自然、延迟更低,同时又足够有表现力,能用于通话。”
这家初创公司构建其声音库的一种方式,是邀请用户提交自己的声音用于模型训练,并在这些声音被使用时给予补偿。不过,这也在几个月前引发了一些麻烦,因为一些创作者指称,他们的声音在未经同意的情况下被上传到了 Fish Audio。该初创公司当时设有 DMCA 下架流程来处理此类问题,但下架本身耗时很长。
Cao 告诉 TechCrunch,公司现在已经将下架流程自动化。她说,创作者可以提交一段简短的声音样本或一份合同,证明某个被上传的声音属于自己,而他们的声音将在不到三分钟内从这家初创公司的平台上移除。
尽管如此,这仍然不能阻止任何人在未经艺术家知情的情况下上传其声音。并且在艺术家发现之前,只要他们没有申请移除,其声音就会继续在平台上被使用。
Coreline Ventures 合伙人 Osuke Honda 表示,只有在创作者信任平台的情况下,社区驱动模式才行得通。
“只有当创作者信任平台时,以社区为中心的方式才可能成为持久优势。这意味着,知情同意、透明度和署名必须被内置到产品中,而不是事后才补救。我认为,这个行业需要朝着可验证的声音所有权、清晰的许可条款、便捷的举报和下架流程发展,并最终走向收益分成模式:当创作者的声音被授权或用于商业用途时,他们能获得经济回报,”他说。
Cao 说,当这家初创公司最初只是把产品作为一个面向创作者的开源项目来提供时,它的运营效率很高,也不需要外部资本。但随着投资者兴趣升温,公司希望开发更先进的模型,并且希望能够服务企业客户,这促使它寻求融资。
展望未来,Fish Audio 计划在今年发布一款音频理解模型。它也在开发一个语音转语音模型。
语音生成市场竞争激烈,ElevenLabs、WellSaid、Cartesia、Speechify、Async(前身为 Podcastle)和 Krisp 等公司都在争夺创作者和企业客户的预算。
359 Capital 合伙人 Rico Mallozzi 表示,面向开发者的更细粒度控制,以及更具成本效率的模型训练,将帮助 Fish Audio 更好地与大型 AI 实验室竞争。
“我认为他们凭借现有团队所构建出的成果——那些最先进的模型——与一些资金更雄厚的 AI 实验室或公司相比,令人难以置信。这表明,他们在缩小听起来像机器的声音与更接近人声之间的差距方面,展现了很强的技术实力,”Mallozzi 在电话中告诉 TechCrunch。
本文已更新,以反映该公司在种子轮融资中筹集了 5200 万美元。”}
来源与参考
收录于 2026-07-29