Qwen-Audio是阿里通义千问团队推出的音频语言大模型系列,能够接受多种音频信号输入并执行音频分析或根据语音指令进行文本回复。模型支持语音聊天和音频分析两种交互模式,用户可无需文本输入直接进行语音交互,也可提供音频和文本指令进行分析。最新版本Qwen-Audio-3.0-Realtime在智商、Agent工具调用、共情对话和双工交互流畅度四条主线上同步升级。
Capability Timeline
语音合成
生成语音、配音、旁白或音频内容。
相关工具
11Google Vids 是 Google Workspace 中的 AI 视频创作与编辑工具,用户可通过文本提示和参考图片生成视频,使用 Gemini Omni 多模态模型进行背景替换、光线修复和特效添加,支持逐步编辑。2026年更新后支持上传自拍和录音创建个性化数字分身,可让用户在自己的视频中出镜。
Higgsfield AI 是一个 AI 原生创意套件,支持用户通过文本提示或参考图生成图像、视频和语音内容,并可编辑和放大媒体。平台内置 AI 智能体可自动化创意工作流,支持网页和移动端。近期发布了 After Effects MCP/插件,由 Fable 5 驱动,允许用户在 AE 项目内直接调用 Claude,自动构建合成、设置关键帧、编写表达式并运行 ExtendScript 重复工作,所有生成内容均为可编辑的 AE 场景。
Nativ 是一款 macOS 桌面应用,基于 MLX-VLM 针对 Apple Silicon(M1+)优化,让用户无需账户、订阅或云端即可在本地运行 Google、Cohere、Liquid AI 等开放模型。应用支持语言、视觉、视频、代码、音频等多模态交互,提供实时 tokens/秒、内存压力、首 token 延迟等性能指标,并内置本地端点,可对接 Codex、Claude Code、OpenCode 等编码智能体。项目以 MIT 许可完全开源。
Virbo AI是万兴科技旗下的AI视频生成工具,提供350+ AI虚拟人、400+多语种语音、照片开口说话、文本转语音与精准口型同步能力,支持AI生成与真人拍摄混合创作,面向电商带货、品牌营销与跨境多语言视频场景。
万兴剧厂是万兴科技推出的AI驱动一站式精品影视/漫剧内容创作平台,支持小说IP快速改编、剧本智能拆解、角色一致性生成、智能分镜、配音合成与后期剪辑全链路工作流,帮助创作者低成本规模化生产动画级漫剧与AI影视内容。
百度智能云是百度旗下的全栈AI云平台,提供从算力底座(百舸AI计算平台、天池超节点)、大模型服务(千帆大模型平台、文心系列模型)到Agent开发与应用的全栈能力。平台支持企业构建数字员工、视觉智能体、深度研究助手等AI应用,并提供AI安全护栏、内容审核、数据分析等企业级服务。在WAIC 2026上展出的天池256超节点支持256卡互联,推理效率提升50%。
LiveKit 是开源的语音 AI Agent 开发与运行平台,提供完整工具链构建、测试、部署和监控实时语音智能体。核心能力包括:通过开源 Agents SDK 编写 Agent 逻辑、LiveKit Inference 推理网关支持 50+ AI 模型开箱即用(STT/LLM/TTS)、LiveKit Cloud 全球云平台负责路由与自动扩缩、原生电话与 SIP 集成、端到端会话可观测性与遥测。支持多模态低延迟高并发对话,OpenAI 基于 LiveKit Cloud 构建 ChatGPT 高级语音功能。
Patter 是开源语音 AI SDK,支持 Python 和 TypeScript,可让开发者在 4 行代码内为 AI 代理分配电话号码。集成 Twilio、Telnyx、Plivo 等运营商,支持 OpenAI Realtime、Deepgram STT、ElevenLabs TTS 等语音管线,提供动态变量、输出护栏、延迟仪表盘、通话录音和回归评估等能力,MIT 许可证。
Sesame 是 Sesame AI 推出的个人 AI 智能体产品,提供语音模式交互、双工通话和工具访问能力(提醒、笔记等)。其 iOS 应用正在开发日历和邮件连接器,允许 AI 智能体读取并操作这些应用,同时内部测试自定义技能功能,用户可添加自定义提示词扩展 Agent 能力。
Speechify 是全球最大的 AI 语音平台之一,服务超过 5500 万用户。提供文字转语音(TTS)、语音克隆、AI 语音对话、语音输入、AI 笔记、AI 播客制作及文本转语音 API。2026 年推出 Speechify Developer Platform,搭载 Simba 3.2 语音模型,支持开发者构建低于 100ms 延迟的流式实时语音 Agent。

