Nvidia发布免费实时说话人识别模型
The Decoder··作者 Jonathan Kemper
关键信息
Nemotron 3 Diarization可以与Parakeet等语音识别模型配合,生成带有“speaker_2”等匿名标签的转录文本,但不会识别说话人的真实姓名。参与人数增加、背景噪声较强或存在混响时,错误率会升高,因此最多八人的能力并不代表在所有环境中都能保持相同表现。
资讯摘要
Nvidia发布了Nemotron 3 Diarization,这是一款用于判断对话中每个时间点由谁讲话的人工智能模型。该模型约有1亿个参数,Nvidia免费提供其模型权重。它最多可以区分八名说话人,还能识别两人或多人同时讲话的时间段。该系统既支持预先录制的音频,也支持实时音频,因此适合需要在对话进行过程中即时处理的应用。
将它与Parakeet等语音识别系统结合后,可以生成按说话人整理的转录文本。这些标签是匿名的,例如“speaker_2”,所以系统能够区分不同声音,但不会确认说话人的真实身份。参与人数越多,或者录音中存在明显的背景噪声和混响,模型的错误率就越高。

资讯正文
Nvidia 发布可免费使用的 1 亿参数模型,可实时识别最多八名说话者
Nvidia 发布了 Nemotron 3 Diarization,这是一款能够识别对话中任意时刻是哪位说话者正在发言的 AI 模型。该模型约有 1 亿个参数,其权重可免费使用。它能够区分最多八名说话者,并检测多人同时发言的情况。参与人数增加、背景噪声较大或存在混响时,错误率会升高。该模型与 Parakeet 等语音识别系统结合后,可以生成带有说话者标签的转录文本,不过标签只能是“speaker_2”这类匿名名称。它既支持录音,也支持实时音频。
来源与参考
收录于 2026-09-28