功能图谱

Capability Timeline

语音合成

生成语音、配音、旁白或音频内容。

11 个工具10 条动态

相关工具

11

阿里通义千问音频语言大模型,支持语音对话与音频分析

Qwen-Audio是阿里通义千问团队推出的音频语言大模型系列,能够接受多种音频信号输入并执行音频分析或根据语音指令进行文本回复。模型支持语音聊天和音频分析两种交互模式,用户可无需文本输入直接进行语音交互,也可提供音频和文本指令进行分析。最新版本Qwen-Audio-3.0-Realtime在智商、Agent工具调用、共情对话和双工交互流畅度四条主线上同步升级。

语音对话语音合成智能体
近7天 3 动态2,090 Stars

AI 原生创意套件,支持图像/视频/语音生成与 AE 插件集成

Higgsfield AI 是一个 AI 原生创意套件,支持用户通过文本提示或参考图生成图像、视频和语音内容,并可编辑和放大媒体。平台内置 AI 智能体可自动化创意工作流,支持网页和移动端。近期发布了 After Effects MCP/插件,由 Fable 5 驱动,允许用户在 AE 项目内直接调用 Claude,自动构建合成、设置关键帧、编写表达式并运行 ExtendScript 重复工作,所有生成内容均为可编辑的 AE 场景。

视频生成图像编辑图像生成语音合成智能体
近7天 1 动态
NA

在 Mac 上本地运行开放模型的免费开源桌面应用

Nativ 是一款 macOS 桌面应用,基于 MLX-VLM 针对 Apple Silicon(M1+)优化,让用户无需账户、订阅或云端即可在本地运行 Google、Cohere、Liquid AI 等开放模型。应用支持语言、视觉、视频、代码、音频等多模态交互,提供实时 tokens/秒、内存压力、首 token 延迟等性能指标,并内置本地端点,可对接 Codex、Claude Code、OpenCode 等编码智能体。项目以 MIT 许可完全开源。

代码补全对话助手视频处理图像理解语音合成
近7天 1 动态

百度旗下全栈AI云平台,提供大模型服务、Agent开发与AI算力

百度智能云是百度旗下的全栈AI云平台,提供从算力底座(百舸AI计算平台、天池超节点)、大模型服务(千帆大模型平台、文心系列模型)到Agent开发与应用的全栈能力。平台支持企业构建数字员工、视觉智能体、深度研究助手等AI应用,并提供AI安全护栏、内容审核、数据分析等企业级服务。在WAIC 2026上展出的天池256超节点支持256卡互联,推理效率提升50%。

安全检测翻译模型训练学习深度研究图像理解
近7天 1 动态

开源语音 AI Agent 开发与实时推理运行平台

LiveKit 是开源的语音 AI Agent 开发与运行平台,提供完整工具链构建、测试、部署和监控实时语音智能体。核心能力包括:通过开源 Agents SDK 编写 Agent 逻辑、LiveKit Inference 推理网关支持 50+ AI 模型开箱即用(STT/LLM/TTS)、LiveKit Cloud 全球云平台负责路由与自动扩缩、原生电话与 SIP 集成、端到端会话可观测性与遥测。支持多模态低延迟高并发对话,OpenAI 基于 LiveKit Cloud 构建 ChatGPT 高级语音功能。

应用构建语音对话语音合成语音转录智能体
近7天 0 动态
PA

开源语音 AI 代理 SDK,4 行代码接入电话号码

Patter 是开源语音 AI SDK,支持 Python 和 TypeScript,可让开发者在 4 行代码内为 AI 代理分配电话号码。集成 Twilio、Telnyx、Plivo 等运营商,支持 OpenAI Realtime、Deepgram STT、ElevenLabs TTS 等语音管线,提供动态变量、输出护栏、延迟仪表盘、通话录音和回归评估等能力,MIT 许可证。

隐私防护语音对话语音合成语音转录智能体
近7天 0 动态1,011 Stars

AI 语音助手:文字转语音、语音克隆与实时语音 Agent 平台

Speechify 是全球最大的 AI 语音平台之一,服务超过 5500 万用户。提供文字转语音(TTS)、语音克隆、AI 语音对话、语音输入、AI 笔记、AI 播客制作及文本转语音 API。2026 年推出 Speechify Developer Platform,搭载 Simba 3.2 语音模型,支持开发者构建低于 100ms 延迟的流式实时语音 Agent。

对话助手文件分析语音对话语音合成语音转录
近7天 0 动态