Meta推出低延迟实时音频模型

The Decoder··作者 Jonathan Kemper

关键信息

Meta 表示,该模型会动态调整每个词输出前的等待时长,在需要时用更多上下文换取更高准确率。它最多可区分 20 多个说话人,能处理超过一小时的会话,并支持语码转换;但 Meta 没有披露参数量、训练数据规模或音频数据来源,也不会开源权重。

资讯摘要

Meta 的 Superintelligence Labs 发布了 Muse Voice Transcribe,这是其首个实时音频感知模型。该系统可以在人说话时同步转录语音、检测句子边界,并区分不同说话人,而不需要依赖额外的下游组件。Meta 表示,这个模型属于 Spark 家族,目标是在实时场景中兼顾速度和准确率。

该模型把音频切成 80 毫秒一段,并在每一段之后决定是输出下一个词,还是继续聆听以获取更多上下文。这样做的好处是,遇到困难词时可以多等一会儿提高准确率,而简单词则能更快输出。Meta 说,它用强化学习训练了这种行为,同时优化低错误率和短延迟。

Muse Voice Transcribe 还把说话人标注和句子检测直接集成到了同一个模型里。它会在转录文本中标记说话人切换,并为不同片段分配 A 到 Z 的标识符。Meta 表示,它最多可以同时区分 20 多位说话人,并且无需后处理就能处理超过一小时的录音;在一个包含 8 个人的演示中,系统可以实时把词分配给具体说话人。

该模型用 70 多种语言训练,其中 25 种进行了更深入测试,并且支持语码转换,也就是说话人在一句话中切换两种语言。Meta 还表示,语言提示、关键词和上下文可以进一步提升准确率,尤其对“Meta”“Muse”或“Menlo Park”这类专有名词更有帮助。报道把这次发布与扎克伯格关于“个人超级智能”的更大愿景联系起来,认为可靠的语音识别是 AI 眼镜和个人 AI 助手的基础。

在定价方面,Meta 也采取了明显的低价策略。该模型的价格是每小时 0.18 美元,或每 1000 分钟音频 3 美元,低于报道中提到的 OpenAI、ElevenLabs、Cartesia 和 Deepgram 等竞品。Muse Voice Transcribe 目前已经用于 Meta AI 和 Muse Code 的语音听写,也可通过 Meta Model API 使用。Meta 没有披露模型规模、训练数据量或音频数据来源,并且不会发布权重。

Meta推出低延迟实时音频模型

资讯正文

Meta 的新实时音频模型是永不停歇聆听的 AI 助手的基础

Meta 的 Superintelligence Labs 发布了他们首个实时音频感知模型。它可以在实时对话中转录语音、区分说话者,并检测句子边界。

这款 Spark 系列模型将输入音频分割成 80 毫秒的片段。每处理完一个片段,它就会决定是继续聆听,还是将下一个词输出为文本,从而控制在完成转录之前收集多少上下文。

等待时间越长,准确率通常越高,但延迟也会更长。根据 Meta 的说法,Muse Voice Transcribe 会根据每个词的难度动态调整等待时间。简单的词会更快输出,较难的词则会获得更多聆听时间。Meta 使用强化学习训练了这种行为,同时奖励模型在降低错误率和缩短延迟这两方面的表现。

无需额外系统即可实现说话者区分和句子检测

Meta 将其余功能直接集成到同一个模型中,而不依赖单独的系统。对于说话者归属,模型会在连续文本中标记说话者切换,并用从 A 到 Z 的标识符标注每一段话。对于句子边界,模型会标出每次话语开始和结束的位置。这两项任务都与语音识别联合训练。

该模型一次可以区分 20 多名说话者,并且能够处理超过一小时的录音,而无需后处理。Meta 表示,在一段有八个人的房间演示中,系统能够实时将词语分配给各个说话者。

Meta 表示,Muse Voice Transcribe 的训练数据覆盖了 70 多种语言,其中 25 种经过了深入测试。该模型还可以处理 code-switching,即说话者在一句话中途切换两种语言的情况。关于语言、关键词和上下文的提示还能进一步提高准确率,尤其是像 “Meta”、“Muse” 或 “Menlo Park” 这样的专有名词。

Meta 将这次发布与 CEO Mark Zuckerberg 所设想的“personal superintelligence”联系起来。在一段安排好的演示中,Meta 员工认为,可靠的语音识别是个人 AI 代理的基础,这些代理可以通过 AI 眼镜在真实对话中进行聆听。在德国,最近曾讨论禁止 Meta 的摄像眼镜,不过德国联邦网络局决定不推进这一禁令。

可用性

Muse Voice Transcribe 目前已为 Meta AI 和 Muse Code 中的语音听写提供支持,并可通过 Meta Model API 使用。用户可以在任何应用中按住 “Fn” 键来试用。

Meta 在定价上压低了行业水平。按每小时 0.18 美元,或每 1,000 音频分钟 3 美元计算,它的价格低于 Cartesia Ink-2 的 4 美元,以及 ElevenLabs Scribe v2 Realtime 和 Deepgram Flux 的 6.50 美元。

这延续了 Muse Spark 1.1 和 Muse Spark 1.2 的策略:Meta 在价格上竞争,而不是在峰值性能上较量。该公司尚未披露这款模型的参数量、训练数据规模或音频数据来源,也不会发布权重。

Meta 在 2025 年夏天以 Superintelligence Labs 为统筹重组了其 AI 部门,从 OpenAI、Google DeepMind 和 Apple 招募顶级研究人员,提供的薪酬方案在四年内最高可达 3 亿美元。但并不是所有人都留下来了。有些人仅仅几周后就回到了 OpenAI。

来源与参考

  1. 原始链接
  2. Meta's new real-time audio model is the foundation for AI assistants that never stop listening

收录于 2026-09-07