Xiaomi-CocktailASR-1是一款由小米(Xiaomi)于2026 年 9 月推出的目标说话人语音识别大模型,主要用于在多人同时说话的复杂环境中精准提取并转录目标用户的语音,支持目标说话人参考音频识别、负样本拒识与思维链推理,适用于会议记录、客服质检、车载语音助手等场景。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 目标说话人语音识别大模型 |
| 出品方 | 小米(Xiaomi) |
| 发布时间 | 2026 年 9 月 11 日 |
| 开源协议 | Apache 2.0 |
| 开源平台 | GitHub / HuggingFace |
| 模型架构 | 端到端 LLM(Data2Vec 音频编码器 + Adapter + Qwen3-8B 解码器) |
| 参数量 | 0.6B 音频编码器 + 8B 语言模型 |
| 上下文长度 | 未公开 |
| 支持语种 | 中文、英文等多语种 |
| 参考音频长度 | 1–4 秒 |
| 推理速度 | 未公开 |
| 适用场景 | 多人会议、车载语音、客服录音、家庭智能设备 |

Xiaomi-CocktailASR-1 的核心能力
Xiaomi-CocktailASR-1 针对「鸡尾酒会问题」设计,属于 自然语言处理(NLP) 中语音识别方向的前沿课题,其端到端建模也建立在 机器学习 尤其是大模型推理的基础之上;核心能力聚焦于在多人混聊场景中精准锁定目标说话人,无需先做语音分离预处理即可直接端到端完成识别与转录。模型基于大规模多说话人数据训练,采用端到端 LLM 架构:以 Data2Vec 音频编码器(约 0.6B 参数)提取声学特征,经 Adapter 对齐后交由 Qwen3-8B 语言模型解码生成文本。
目标说话人精准锁定
给定目标说话人 1–4 秒参考音频,模型即可在多人混杂录音中只转录目标人的发言;当目标人不在场时输出空文本,避免误触发。
端到端大模型架构
与传统「语音分离 + ASR」两段式方案不同,Xiaomi-CocktailASR-1 将参考音频提供的声纹线索与目标混合音频一同输入单一模型,由 0.6B 音频编码器与 8B 语言模型联合完成从波形到文字的端到端映射,减少了级联误差并简化了部署链路。
负样本拒识能力
对非目标说话人干扰具备强拒识能力,在负样本集上误识别率极低;即使参考音频对应的人不在当前对话中,也会直接返回空文本。由于模型内置拒识机制,正样本有小概率被误判为空,但其在主要测试集上的误拒率(FRR)仅 0.01%–0.73%,对正常使用影响极小。
思维链推理模式
支持思维链推理:在 <think> 标签中输出推理过程(说话人数量、相似度档位、判定结果),在 <answer> 标签中输出最终结果;启用 CoT 后 LibriMix 2mix 词错误率可由 4.11% 进一步降至 3.87%,代价是推理时延有所增加。
单人场景无缝切换
在单人说话场景下识别性能比肩标准 ASR 模型,无需在多人/单人模式间切换,可实现无缝兼容。
多语种与情感控制
支持中文、英文等多语种识别,并可通过参考音频传递情感信息,实现情感可控的语音识别。
Xiaomi-CocktailASR-1 与同类语音识别模型的对比
| 对比维度 | Xiaomi-CocktailASR-1 | Qwen3-ASR | Whisper Large-v2 |
|---|---|---|---|
| 开发方 | 小米 | 阿里 | OpenAI |
| 模型定位 | 目标说话人语音识别 | 通用语音识别 | 通用语音识别 |
| 目标说话人参考音频 | ✓ 支持 | ✗ 不支持 | ✗ 不支持 |
| 负样本拒识 | ✓ 支持 | ✗ 不支持 | ✗ 不支持 |
| LibriMix 2mix WER(多说话人) | 4.11% | 68.75% | 未公布 |
| LibriSpeechMix 2mix WER | 2.90% | 92.17% | 16.90%(单人) |
| 单说话人 LibriMix 2mix WER | 1.73% | 1.87%(Qwen3-ASR-1.7b) | 2.70% |
| 开源协议 | Apache 2.0 | 闭源 | Apache 2.0 |
| 思维链(CoT)推理 | ✓ 支持 | ✗ 不支持 | ✗ 不支持 |
整体来看,Xiaomi-CocktailASR-1 在多人混聊场景下的表现显著优于通用语音模型。在 LibriMix 2mix 测试集上,其词错误率(WER)仅 4.11%,而 Qwen3-ASR 高达 68.75%,差距超过 16 倍;在更接近真实的会议录音(AliMeeting)上,Xiaomi-CocktailASR-1 的 WER 约 21.81%,同样领先于通用方案。开源方面,它与 Whisper 同样采用 Apache 2.0 协议,可在商用场景下自由使用。
若想在真实会议、客服通话等场景直接使用成熟的语音转写服务,可了解 讯飞听见:专业的智能语音转写平台,支持多人会议实时转写与说话人分离,适合对快速落地而非自研模型有需求的团队。
Xiaomi-CocktailASR-1 的应用场景与适用人群
Xiaomi-CocktailASR-1 特别适用于多人同时说话的复杂场景,可大幅提升语音识别在真实环境中的可用性。在会议、车载、客服、播客等真实多人场景中,传统方案需先做说话人分离再做识别,流程繁琐;本模型一步到位,显著降低部署复杂度。
- 多人会议记录:在团队会议、圆桌讨论中精准锁定发言目标,自动分离不同说话人内容
- 车载语音助手:在车内多人交谈时仅识别目标乘客指令,避免误触发
- 客服录音质检:从客服与多位客户的通话中提取特定客户发言,便于质量评估
- 播客与访谈剪辑:从多嘉宾长音频中快速提取指定嘉宾的发言片段,便于二次创作
与先做说话人分离、再做语音识别的两段式方案相比,Xiaomi-CocktailASR-1 直接「给定参考音频即转录目标人」,省去了分离与对齐环节,在目标明确、只需单人内容的场景下效率更高。
适用人群:需要多人语音识别场景的产品经理、客服团队管理者、车载系统开发者、会议记录工具开发者等。
Xiaomi-CocktailASR-1 的使用方法
使用 Xiaomi-CocktailASR-1 无需复杂的预处理流程,准备两段音频即可开始识别。详细步骤如下:
- 获取参考音频:准备目标说话人 1–4 秒的参考录音(内容不限,用于提供声纹提示)
- 获取混合音频:准备需要识别的多人大声混杂录音(单通道即可)
- 调用推理:将两段音频拼接(中间插入 1 秒静音)输入模型,运行仓库中的推理脚本
- 获取结果:模型输出目标说话人的转录文本;若目标人不在场则返回空文本
运行环境需 Python 3.10+、PyTorch 与 Transformers,并通过 trust_remote_code 加载 HuggingFace 上的模型定义。
模型权重与推理代码已发布在 HuggingFace 与 GitHub,可直接查看 Xiaomi-CocktailASR-1 开源仓库 获取。
Xiaomi-CocktailASR-1 的价格与开源情况
Xiaomi-CocktailASR-1 完全开源免费,采用 Apache 2.0 协议,可在商用场景下自由使用,无任何按量计费或授权费用。
模型权重与推理代码均已发布在 GitHub 与 HuggingFace(Ease3/Xiaomi-CocktailASR-1),用户可直接下载部署,无需申请商业许可。
Xiaomi-CocktailASR-1 的常见问题
Xiaomi-CocktailASR-1 需要什么样的参考音频?
Xiaomi-CocktailASR-1 只需要 1–4 秒的目标说话人参考音频,内容不限,用于提供声纹特征。
Xiaomi-CocktailASR-1 支持哪些语种?
Xiaomi-CocktailASR-1 支持中文、英文等多语种识别,具体语种覆盖情况请参考官方文档。
Xiaomi-CocktailASR-1 在单人场景下表现如何?
在单人说话场景下,Xiaomi-CocktailASR-1 的 LibriMix 2mix 词错误率约 1.73%,与主流通用 ASR 模型基本持平。
思维链推理会提升准确率吗?
会。启用 CoT 后 LibriMix 2mix 词错误率可由 4.11% 进一步降至 3.87%,但推理时延会相应增加。
Xiaomi-CocktailASR-1 的开源协议是什么?
Xiaomi-CocktailASR-1 采用 Apache 2.0 协议,可自由商用和修改,无需支付授权费用。
浙公网安备33010202004812号