Qwen-Audio

阿里通义千问音频语言大模型,支持语音对话与音频分析

Qwen-Audio是阿里通义千问团队推出的音频语言大模型系列,能够接受多种音频信号输入并执行音频分析或根据语音指令进行文本回复。模型支持语音聊天和音频分析两种交互模式,用户可无需文本输入直接进行语音交互,也可提供音频和文本指令进行分析。最新版本Qwen-Audio-3.0-Realtime在智商、Agent工具调用、共情对话和双工交互流畅度四条主线上同步升级

智能体语音合成语音对话
访问官网
收录动态

3

最近更新

2026-07-20

评价样本

未收录

GitHub Stars

2,090

工具功能

这个工具能做什么、适合谁用,以及目前已识别的核心能力。

工具简介

Qwen-Audio是阿里通义千问团队推出的音频语言大模型系列,能够接受多种音频信号输入并执行音频分析或根据语音指令进行文本回复。模型支持语音聊天和音频分析两种交互模式,用户可无需文本输入直接进行语音交互,也可提供音频和文本指令进行分析。最新版本Qwen-Audio-3.0-Realtime在智商、Agent工具调用、共情对话和双工交互流畅度四条主线上同步升级

核心功能

3 项已整理
智能体
语音合成
语音对话

价格信息

暂无可验证价格信息

暂无足够准确的价格信息。

基础信息

更新频率
近 7 天 3 条收录动态
最近更新
2026-07-20
覆盖行业
内容创作、客服与服务、教育培训、游戏

更新日志

按时间记录功能更新、版本发布、新工具入库等重要变化。

  1. 2026-07-20版本发布

    阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,含实时交互Flash版(首包延时300ms级)与高质量Plus版。支持在文本中嵌入[gasp]、[giggles]、[angry]等细粒度结构化标签精确控制语气情绪;覆盖16种语言并新增阿拉伯语/越南语/马来语/菲律宾语,方言强化训练支持20种中国方言;语音克隆可在高噪声高混响环境过滤干扰,输出从24kHz提升至48kHz,单次合成最长3分钟。两款模型即日起在阿里云百炼开放调用,Plus版登顶Artificial Analysis榜单。

  2. 2026-07-15版本发布

    阿里巴巴发布Qwen-Audio-3.0-Realtime实时语音交互对话模型,在智商、Agent工具调用、共情对话和双工交互流畅度四条主线同步升级。无需明确指令即可自行调用外部工具,调用结果自动融入对话记忆;支持FunctionCall标准协议引入MCP、API、知识库;内置多模态感知双工控制子模型,支持边说边听、随时打断插话。模型API预留audio_prompt字段可锁定声纹。

  3. 2026-07-14版本发布

    阿里巴巴最新文本转语音模型 Qwen-Audio-3.0-TTS-Plus 在 Artificial Analysis 语音竞技场排行榜上以 1,236 Elo 分登顶提供商语音类别第一名,超越 Simba 3.2、Gemini 3.1 Flash TTS 和 Sonic 3.5。定价为每百万字符 27.59 美元,生成速度每秒 16 字符。

Qwen-Audio 常见问题

关于 Qwen-Audio 的定位、核心功能、价格与最近更新。

Qwen-Audio 是什么?

Qwen-Audio是阿里通义千问团队推出的音频语言大模型系列,能够接受多种音频信号输入并执行音频分析或根据语音指令进行文本回复。模型支持语音聊天和音频分析两种交互模式,用户可无需文本输入直接进行语音交互,也可提供音频和文本指令进行分析。最新版本Qwen-Audio-3.0-Realtime在智商、Agent工具调用、共情对话和双工交互流畅度四条主线上同步升级。

Qwen-Audio 有哪些核心功能?

Qwen-Audio 当前已核验的核心功能包括:智能体、语音合成、语音对话。

Qwen-Audio 如何收费?

AI Equal 当前没有收录 Qwen-Audio 的可验证价格信息。

Qwen-Audio 最近有什么更新?

2026-07-20:阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,含实时交互Flash版(首包延时300ms级)与高质量Plus版。支持在文本中嵌入[gasp]、[giggles]、[angry]等细粒度结构化标签精确控制语气情绪;覆盖16种语言并新增阿拉伯语/越南语/马来语/菲律宾语,方言强化训练支持20种中国方言;语音克隆可在高噪声高混响环境过滤干扰,输出从24kHz提升至48kHz,单次合成最长3分钟。两款模型即日起在阿里云百炼开放调用,Plus版登顶Artificial Analysis榜单。