首页权益货源平台推荐博客论坛资源大全IDC/CDN高性价比支付接口那个较好站长工具必备清单全网各大系统程序其他好用必备站点全网熟知各大网站

小米开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1

IT之家 9 月 11 日消息,小米技术今日发文宣布,小米正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1。

官方表示,Xiaomi-CocktailASR-1 旨在解决“鸡尾酒会”难题(IT之家注:当前语音识别技术已经可以以较高精度识别一个人所讲的话,但是当说话的人数为两人或者多人时,语音识别率就会极大地降低,这一难题被称为鸡尾酒会问题)。

该模型采用端到端 LLM 架构,以目标说话人的一段参考音频作为声纹提示,可在多人同时说话的复杂环境中,精准提取并仅转录目标用户的语音。在多个主流多说话人测试集上均达到 SOTA,大幅领先现有方案。

同时,其单人识别性能比肩标准 ASR 模型,可无缝兼顾单人说话场景;具备拒识非目标说话人干扰语音的能力,目标不在场时输出空文本,有效避免误触发;此外还支持思维链推理模式,为识别结果提供可解释推理过程。

IT之家附相关链接:

萤火站长导航 提供的一切软件、教程和内容信息仅限用于学习和研究目的; 不得将上述内容用于商业或者非法用途, 否则一切后果请用户自负. 本站信息来自网络收集整理, 版权争议与本站无关. 如果您喜欢该程序和内容, 请支持正版.
上一篇TrendForce 数据:十大芯片设计企业营收 2026Q2 同比增长 73%,AMD 升至第三
下一篇 英伟达黄仁勋:网络安全是 AI 下一个重要市场,驳斥 AI 恐慌论