Xiaomi-CocktailASR-1

小米开源目标说话人语音识别大模型,凭声纹提示在多人重叠语音中只转录目标说话人

Xiaomi-CocktailASR-1 是小米推出并开源的工业级目标说话人语音识别(Target-Speaker ASR)大模型,采用端到端 LLM 架构,以目标说话人的一段参考音频作为声纹提示,可在多人同时说话的鸡尾酒会场景中精准提取并仅转录目标用户语音,在 AliMeeting、AMI、LibriMix 等多说话人测试集上达到 SOTA,单人场景比肩标准 ASR;支持非目标说话人拒识(目标不在场时输出空文本)与思维链推理模式,代码与权重已在 GitHub、HuggingFace 开放

复杂推理语音转录说话人分离
访问官网
收录动态

1

最近更新

2026-09-11

评价样本

未收录

GitHub Stars

27

工具功能

这个工具能做什么、适合谁用,以及目前已识别的核心能力。

工具简介

Xiaomi-CocktailASR-1 是小米推出并开源的工业级目标说话人语音识别(Target-Speaker ASR)大模型,采用端到端 LLM 架构,以目标说话人的一段参考音频作为声纹提示,可在多人同时说话的鸡尾酒会场景中精准提取并仅转录目标用户语音,在 AliMeeting、AMI、LibriMix 等多说话人测试集上达到 SOTA,单人场景比肩标准 ASR;支持非目标说话人拒识(目标不在场时输出空文本)与思维链推理模式,代码与权重已在 GitHub、HuggingFace 开放

核心功能

3 项已整理
复杂推理
语音转录
说话人分离

价格信息

暂无可验证价格信息

暂无足够准确的价格信息。

基础信息

更新频率
近 7 天 1 条收录动态
最近更新
2026-09-11
覆盖行业

更新日志

按时间记录功能更新、版本发布、新工具入库等重要变化。

  1. 2026-09-11开源

    小米正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1:端到端 LLM 架构,以参考音频作声纹提示,在多人重叠语音中仅转录目标说话人,在 AliMeeting、AMI、LibriMix 等多说话人测试集达到 SOTA,支持非目标说话人拒识与思维链推理,代码权重已上线 GitHub 与 HuggingFace。

Xiaomi-CocktailASR-1 常见问题

关于 Xiaomi-CocktailASR-1 的定位、核心功能、价格与最近更新。

Xiaomi-CocktailASR-1 是什么?

Xiaomi-CocktailASR-1 是小米推出并开源的工业级目标说话人语音识别(Target-Speaker ASR)大模型,采用端到端 LLM 架构,以目标说话人的一段参考音频作为声纹提示,可在多人同时说话的鸡尾酒会场景中精准提取并仅转录目标用户语音,在 AliMeeting、AMI、LibriMix 等多说话人测试集上达到 SOTA,单人场景比肩标准 ASR;支持非目标说话人拒识(目标不在场时输出空文本)与思维链推理模式,代码与权重已在 GitHub、HuggingFace 开放。

Xiaomi-CocktailASR-1 有哪些核心功能?

Xiaomi-CocktailASR-1 当前已核验的核心功能包括:复杂推理、语音转录、说话人分离。

Xiaomi-CocktailASR-1 如何收费?

AI Equal 当前没有收录 Xiaomi-CocktailASR-1 的可验证价格信息。

Xiaomi-CocktailASR-1 最近有什么更新?

2026-09-11:小米正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1:端到端 LLM 架构,以参考音频作声纹提示,在多人重叠语音中仅转录目标说话人,在 AliMeeting、AMI、LibriMix 等多说话人测试集达到 SOTA,支持非目标说话人拒识与思维链推理,代码权重已上线 GitHub 与 HuggingFace。