ITBear旗下自媒体矩阵:

小米开源CocktailASR-1大模型:破解“鸡尾酒会难题” 引领语音识别新变革

   时间:2026-09-11 18:46:44 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

在语音识别领域,长期存在一个棘手难题——当多人同时讲话时,传统自动语音识别(ASR)模型难以精准区分并识别特定说话人的声音,这一“鸡尾酒会难题”一直困扰着行业发展。不过,小米近日开源的工业级目标说话人语音识别大模型CocktailASR-1,为解决该问题带来了新的突破。

CocktailASR-1采用了创新的基于参考声纹的目标说话人识别机制,与传统语音识别任务输入方式截然不同。用户只需提供一段参考音频,模型就能借助声纹嵌入技术,在多人混合音频中精准定位目标说话人,仅转录该特定人物的语音内容,同时自动过滤掉其他人的说话内容、混响以及背景噪声,将复杂的混合音频识别任务转化为高效的目标说话人识别任务。

从底层架构设计来看,CocktailASR-1运用了端到端的大语言模型架构,由D2V2音频编码器、Adapter以及大模型解码器串联组成,所有权重整合在同一个检查点中。在实际应用时,输入格式是将参考音频与目标单声道音频进行拼接,中间插入一秒静音作为分隔。这种设计赋予了模型极高的通用性,无论是单人场景还是复杂的多元场景,都无需切换模型就能轻松应对。

多项基准测试数据充分证明了CocktailASR-1的强大实力。在模拟多说话人测试中,该模型在LibriMix2mix和LibriSpeechMix2mix数据集上的字错率(WER)分别低至4.11%和2.90%。与之相比,同赛道的多款知名模型在混合场景下的表现差强人意,例如在LibriMix3mix测试中,部分竞品的字错率高达76%到121%,而CocktailASR-1的字错率仅为12.29%,优势十分显著。在更具挑战的真实会议录制场景,如AMISDM和AliMeetingFar中,该模型同样大幅领先现有的各类解决方案。在单人场景下,它在LibriSpeech、WenetSpeech以及CommonVoice-zh等数据集上也实现了全面超越。

除了具备突破性的识别精度,CocktailASR-1在工程落地和实用性方面还有两大亮点功能。其一是强大的负样本拒识能力。当参考音频对应的人未参与当前对话时,模型能够直接输出空文本,有效避免智能音箱、车载语音助手等智能设备被旁人声音误触发。测试显示,该模型在多个数据集上的负样本拒识率表现优异。其二是支持思维链推理功能,模型在输出最终答案前,会通过特定标签展示判断说话人的推理过程,虽然对精度影响极小,但大大提升了系统的可解释性和调试便利性。

目前,CocktailASR-1的相关代码已在GitHub按照Apache2.0协议正式开源,其依赖环境极为简单,仅需torch、torchaudio、transformers和soundfile等基础库,就能轻松从HuggingFace加载并部署使用。小米此次在语音技术底层逻辑上的创新变革,意味着语音识别正从传统的“捕获所有声音”模式,迈向聚焦于“锁定一个声音”的新发展阶段。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version