Qwen-Audio-3.1

通义千问 Qwen-Audio-3.1:五模型覆盖语音识别、合成与实时对话

Qwen-Audio-3.1 是阿里巴巴 Qwen 团队推出的语音模型系列,含 ASR、ASR-Next、TTS、TTS-Next 与实时交互五款模型。ASR 支持多语言与多地区中文方言识别、长音频转写、说话人分离与文本规范化,可在噪声环境稳定工作;TTS 为生产级语音合成系统,支持 16 种语言、20 个汉语方言区,可按自然语言指令控制情感、语速与风格,最长一次性合成约 3 分钟

语音合成语音转录语音转录文本规范化说话人分离
访问官网
收录动态

1

最近更新

2026-09-23

评价样本

未收录

社区规模

工具功能

这个工具能做什么、适合谁用,以及目前已识别的核心能力。

工具简介

Qwen-Audio-3.1 是阿里巴巴 Qwen 团队推出的语音模型系列,含 ASR、ASR-Next、TTS、TTS-Next 与实时交互五款模型。ASR 支持多语言与多地区中文方言识别、长音频转写、说话人分离与文本规范化,可在噪声环境稳定工作;TTS 为生产级语音合成系统,支持 16 种语言、20 个汉语方言区,可按自然语言指令控制情感、语速与风格,最长一次性合成约 3 分钟

核心功能

4 项已整理
语音合成
语音转录
语音转录文本规范化
说话人分离

价格信息

暂无可验证价格信息

暂无足够准确的价格信息。

基础信息

更新频率
近 7 天 1 条收录动态
最近更新
2026-09-23
覆盖行业

更新日志

按时间记录功能更新、版本发布、新工具入库等重要变化。

  1. 2026-09-23版本发布

    阿里巴巴 Qwen 团队发布 Qwen-Audio-3.1,含 ASR、ASR-Next、TTS、TTS-Next 与实时交互五款模型。ASR 增强多语言与方言识别并自动清理口癖重复;ASR-Next 支持带时间戳的多说话人识别及情绪、环境音、机器噪声检测;TTS 支持多语言合成与跨语言音色迁移,可用文本指令控制情感、语速、风格;TTS-Next 单次生成语音、音效与背景音;实时模型支持边听边说、随时打断并据情绪调整回应。同时大幅降价:TTS 约降 70%,Realtime 约降 85%,ASR 最高降 95%。

Qwen-Audio-3.1 常见问题

关于 Qwen-Audio-3.1 的定位、核心功能、价格与最近更新。

Qwen-Audio-3.1 是什么?

Qwen-Audio-3.1 是阿里巴巴 Qwen 团队推出的语音模型系列,含 ASR、ASR-Next、TTS、TTS-Next 与实时交互五款模型。ASR 支持多语言与多地区中文方言识别、长音频转写、说话人分离与文本规范化,可在噪声环境稳定工作;TTS 为生产级语音合成系统,支持 16 种语言、20 个汉语方言区,可按自然语言指令控制情感、语速与风格,最长一次性合成约 3 分钟。

Qwen-Audio-3.1 有哪些核心功能?

Qwen-Audio-3.1 当前已核验的核心功能包括:语音合成、语音转录、语音转录文本规范化、说话人分离。

Qwen-Audio-3.1 如何收费?

AI Equal 当前没有收录 Qwen-Audio-3.1 的可验证价格信息。

Qwen-Audio-3.1 最近有什么更新?

2026-09-23:阿里巴巴 Qwen 团队发布 Qwen-Audio-3.1,含 ASR、ASR-Next、TTS、TTS-Next 与实时交互五款模型。ASR 增强多语言与方言识别并自动清理口癖重复;ASR-Next 支持带时间戳的多说话人识别及情绪、环境音、机器噪声检测;TTS 支持多语言合成与跨语言音色迁移,可用文本指令控制情感、语速、风格;TTS-Next 单次生成语音、音效与背景音;实时模型支持边听边说、随时打断并据情绪调整回应。同时大幅降价:TTS 约降 70%,Realtime 约降 85%,ASR 最高降 95%。

Qwen-Audio-3.1:功能、价格、更新日志与同类对比 | AI Equal