
Qwen-Audio
阿里通义千问音频语言大模型,支持语音对话与音频分析
Qwen-Audio是阿里通义千问团队推出的音频语言大模型系列,能够接受多种音频信号输入并执行音频分析或根据语音指令进行文本回复。模型支持语音聊天和音频分析两种交互模式,用户可无需文本输入直接进行语音交互,也可提供音频和文本指令进行分析。最新版本Qwen-Audio-3.0-Realtime在智商、Agent工具调用、共情对话和双工交互流畅度四条主线上同步升级
6
2026-08-17
未收录
2,099
工具功能
这个工具能做什么、适合谁用,以及目前已识别的核心能力。
工具简介
Qwen-Audio是阿里通义千问团队推出的音频语言大模型系列,能够接受多种音频信号输入并执行音频分析或根据语音指令进行文本回复。模型支持语音聊天和音频分析两种交互模式,用户可无需文本输入直接进行语音交互,也可提供音频和文本指令进行分析。最新版本Qwen-Audio-3.0-Realtime在智商、Agent工具调用、共情对话和双工交互流畅度四条主线上同步升级
核心功能
价格信息
暂无可验证价格信息暂无足够准确的价格信息。
基础信息
- 更新频率
- 近 7 天 1 条收录动态
- 最近更新
- 2026-08-17
- 覆盖行业
- 内容创作、客服与服务、程序员、教育培训、金融、游戏、医疗健康
更新日志
按时间记录功能更新、版本发布、新工具入库等重要变化。
- 2026-08-17功能更新
Qwen-Audio-3.0 系列语音模型(ASR/TTS/Realtime 三款)正式上线千问 AI 平台与阿里云百炼平台,开发者可通过 API 调用并订阅 Token Plan 使用;该系列已在千问 App、千问办公、Qoder 等产品中应用,并在 Artificial Analysis 7 月语音榜单斩获识别、实时交互、合成三赛道全球第一。
- 2026-07-31版本发布
阿里发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash:上下文一致性、行业词识别与热词定制化三项系统性优化,新增语音润色能力可输出结构化文本;内置医疗、IT编程、股票、社会名人等领域词库,医疗场景识别率突破 95.36%;已在会议纪要、实时字幕、教育录播、智能客服等场景验证,并以 1.7% 错字率登顶 Artificial Analysis ASR 榜单。
- 2026-07-23功能更新
Qwen-Audio-3.0-TTS Flash 与 Plus 两款语音合成模型已在 OpenRouter 平台上线,开发者可通过 OpenRouter API 统一调用,支持 16 种语言、自然语言指令及 [gasp]、[giggles]、[angry] 等内联情绪提示。
- 2026-07-20版本发布
阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,含实时交互Flash版(首包延时300ms级)与高质量Plus版。支持在文本中嵌入[gasp]、[giggles]、[angry]等细粒度结构化标签精确控制语气情绪;覆盖16种语言并新增阿拉伯语/越南语/马来语/菲律宾语,方言强化训练支持20种中国方言;语音克隆可在高噪声高混响环境过滤干扰,输出从24kHz提升至48kHz,单次合成最长3分钟。两款模型即日起在阿里云百炼开放调用,Plus版登顶Artificial Analysis榜单。
- 2026-07-15版本发布
阿里巴巴发布Qwen-Audio-3.0-Realtime实时语音交互对话模型,在智商、Agent工具调用、共情对话和双工交互流畅度四条主线同步升级。无需明确指令即可自行调用外部工具,调用结果自动融入对话记忆;支持FunctionCall标准协议引入MCP、API、知识库;内置多模态感知双工控制子模型,支持边说边听、随时打断插话。模型API预留audio_prompt字段可锁定声纹。
- 2026-07-14版本发布
阿里巴巴最新文本转语音模型 Qwen-Audio-3.0-TTS-Plus 在 Artificial Analysis 语音竞技场排行榜上以 1,236 Elo 分登顶提供商语音类别第一名,超越 Simba 3.2、Gemini 3.1 Flash TTS 和 Sonic 3.5。定价为每百万字符 27.59 美元,生成速度每秒 16 字符。
Qwen-Audio 常见问题
关于 Qwen-Audio 的定位、核心功能、价格与最近更新。
Qwen-Audio 是什么?
Qwen-Audio是阿里通义千问团队推出的音频语言大模型系列,能够接受多种音频信号输入并执行音频分析或根据语音指令进行文本回复。模型支持语音聊天和音频分析两种交互模式,用户可无需文本输入直接进行语音交互,也可提供音频和文本指令进行分析。最新版本Qwen-Audio-3.0-Realtime在智商、Agent工具调用、共情对话和双工交互流畅度四条主线上同步升级。
Qwen-Audio 有哪些核心功能?
Qwen-Audio 当前已核验的核心功能包括:智能体、语音合成、语音对话、语音转录。
Qwen-Audio 如何收费?
AI Equal 当前没有收录 Qwen-Audio 的可验证价格信息。
Qwen-Audio 最近有什么更新?
2026-08-17:Qwen-Audio-3.0 系列语音模型(ASR/TTS/Realtime 三款)正式上线千问 AI 平台与阿里云百炼平台,开发者可通过 API 调用并订阅 Token Plan 使用;该系列已在千问 App、千问办公、Qoder 等产品中应用,并在 Artificial Analysis 7 月语音榜单斩获识别、实时交互、合成三赛道全球第一。