功能图谱

Capability Timeline

语音对话

通过语音输入与语音回复进行实时或连续对话。

17 个工具21 条动态

相关工具

17

Gemini是Google推出的AI助手,支持多语言实时语音互译与生成式创作,助力高效规划

Gemini是Google打造的生成式AI助手,能够帮助用户完成写作、规划与头脑风暴等核心任务。该工具支持70种以上语言的实时语音到语音翻译,具备流式连续音频生成与自动语种检测功能,可精准保留原始语调、语速和音调,并拥有出色的强抗噪能力。借助生成式AI技术,用户可流畅开展跨语言交流、内容生成及多场景智能协作

对话助手翻译联网搜索用量与费用管控语音对话
近7天 4 动态

阿里通义千问音频语言大模型,支持语音对话与音频分析

Qwen-Audio是阿里通义千问团队推出的音频语言大模型系列,能够接受多种音频信号输入并执行音频分析或根据语音指令进行文本回复。模型支持语音聊天和音频分析两种交互模式,用户可无需文本输入直接进行语音交互,也可提供音频和文本指令进行分析。最新版本Qwen-Audio-3.0-Realtime在智商、Agent工具调用、共情对话和双工交互流畅度四条主线上同步升级。

语音对话语音合成智能体
近7天 3 动态2,090 Stars

苹果全平台 AI 系统,集成 Siri、图像生成与隐私保护

Apple Intelligence 是苹果全平台 AI 系统,深度集成于 iOS、iPadOS、macOS 和 visionOS。提供 Genmoji 表情生成、Siri 智能助手、图像理解与描述、HomeKit 视频摘要、无障碍辅助、Workout Buddy 运动指导等能力。采用设备端处理与 Private Cloud Compute 保护隐私,通过 Foundation Models 框架向第三方应用开放 AI 能力。

对话助手图像理解图像生成文件分析隐私防护
近7天 1 动态

开源离线本地语音AI助手,支持沙箱化命令执行

AURA(Autonomous Unified Response Architecture)是一个开源、完全离线运行的本地语音 AI 助手系统,用户交互人格名为 Kommy。核心语音管线为:唤醒词 -> Whisper 语音转文字 -> Ollama 本地 LLM -> ChromaDB RAG/记忆 -> Piper 语音合成。系统通过沙箱化执行器执行 Git、Docker、文件系统等开发者命令,所有数据不离开本地机器,无需云服务或 API 密钥。项目正在积极开发中,已通过 629 项测试。

语音对话智能体
近7天 1 动态1 Stars

人与AI智能体共建的开源自托管工作空间

Buzz 是 Block 开源的自托管工作空间,将团队聊天、AI 智能体、工作流与 Git 托管整合进同一身份系统。底层基于 Nostr 中继,所有消息、工作流步骤、代码评审与 git 事件均为同一日志中的签名事件。智能体可像人一样打开仓库、提交补丁、评审代码、运行工作流并参与语音讨论。

办公协作代码审查语音对话智能体自动化工作流
近7天 1 动态1,579 Stars

全球 AI 视频生成平台,提供实时世界模型与游戏引擎

PixVerse 是全球 AI 视频生成平台,提供文生视频、图生视频、视频编辑、口型同步、音频生成等能力。旗舰模型 V6 支持电影级镜头控制与角色表演。2026 年 1 月发布 R1 实时世界模型,将视频转变为可交互的连续流,并推出 PixVerse Game Engine 将实时世界模型应用于游戏创作,玩家可用自然语言交互,世界实时响应。平台还提供 API、智能体、营销中心、画布等企业级工作流工具。

世界模型视频处理视频生成图像编辑音乐生成
近7天 1 动态

苹果AI驱动的智能助手,深度集成于全平台操作系统

Siri是苹果的智能语音助手,在iOS 27中升级为AI驱动的新版本。它能访问用户设备上的邮件、照片和信息,感知屏幕内容,回答世界知识问题,并集成Spotlight搜索。新版Siri基于Apple Intelligence的Foundation Models在设备端运行,结合Private Cloud Compute保障隐私数据不被存储,支持iPhone、iPad、Mac、Apple Watch、AirPods、Apple TV和Vision Pro等全平台,并首次提供独立应用入口。

对话助手图像理解图像生成文件分析隐私防护
近7天 1 动态

Spotify 数字音乐流媒体服务,让用户发现和播放海量歌曲、播客与有声书。

Spotify 是全球领先的数字音乐流媒体平台,提供数百万首歌曲、播客和有声书的访问。用户可通过个性化推荐发现新音乐、创建播放列表并追踪个人收听历史。Spotify 内置 AI DJ 功能,为 Premium 用户提供个性化音乐推荐和评论,支持多语言。2026 年 7 月起进一步推出 AI 语音对话功能测试版,支持在应用内通过语音或文字与 Spotify 进行多轮对话,控制播放、查询歌曲艺术家信息、回顾收听历史及回答常识性问题。

对话助手语音对话
近7天 1 动态

阿里千问全模态模型订阅套餐,一个 Key 畅用编程与智能体工具

Token Plan 是阿里千问 AI 平台推出的模型订阅套餐,提供个人版与团队版,用户在统一订阅体系下通过一个 API Key 调用文本、语音、图像等全模态模型能力,抢先体验 Qwen3.8-Max-Preview 等先进模型。套餐按 Credits 计量,兼容 OpenAI / Anthropic 协议的主流 Coding 与 Agent 工具,支持联网搜索、知识检索等工具能力,并可同时运行多个 Agent 并发任务。

代码生成联网搜索图像理解语音对话智能体
近7天 1 动态

阿里旗下 AI 语音输入法,支持语音转文字与自动润色

千问输入法是阿里旗下从说话出发的 AI 输入工具,核心基于 CosyVoice 语音大模型实现语音输入与转录,支持 9 种方言及中英混合识别,单次录音最长 3 分钟。口述后系统自动过滤语气词、纠正口误、理顺语序并分段排版,生成结构化文本,可用于邮件、周报、会议纪要等场景。无广告无弹窗无需注册。

文案生成语音对话语音转录
近7天 1 动态

Google DeepMind 开源多模态模型家族,覆盖端侧到服务器

Gemma 4 是 Google DeepMind 推出的开源权重模型家族,包含 2B/4B 小模型、31B 稠密模型、26B MoE 与 12B 统一多模态模型四种架构。支持文本、图像、视频、音频输入与文本输出,上下文窗口最高 256K,内置函数调用与系统提示词支持,强化编码与 Agent 能力,可在手机、浏览器到云端服务器多环境部署,Apache 2.0 许可允许商用微调。

代码生成对话助手视频处理图像理解语音对话
近7天 0 动态

开源语音 AI Agent 开发与实时推理运行平台

LiveKit 是开源的语音 AI Agent 开发与运行平台,提供完整工具链构建、测试、部署和监控实时语音智能体。核心能力包括:通过开源 Agents SDK 编写 Agent 逻辑、LiveKit Inference 推理网关支持 50+ AI 模型开箱即用(STT/LLM/TTS)、LiveKit Cloud 全球云平台负责路由与自动扩缩、原生电话与 SIP 集成、端到端会话可观测性与遥测。支持多模态低延迟高并发对话,OpenAI 基于 LiveKit Cloud 构建 ChatGPT 高级语音功能。

应用构建语音对话语音合成语音转录智能体
近7天 0 动态
PA

开源语音 AI 代理 SDK,4 行代码接入电话号码

Patter 是开源语音 AI SDK,支持 Python 和 TypeScript,可让开发者在 4 行代码内为 AI 代理分配电话号码。集成 Twilio、Telnyx、Plivo 等运营商,支持 OpenAI Realtime、Deepgram STT、ElevenLabs TTS 等语音管线,提供动态变量、输出护栏、延迟仪表盘、通话录音和回归评估等能力,MIT 许可证。

隐私防护语音对话语音合成语音转录智能体
近7天 0 动态1,011 Stars

AI 语音助手:文字转语音、语音克隆与实时语音 Agent 平台

Speechify 是全球最大的 AI 语音平台之一,服务超过 5500 万用户。提供文字转语音(TTS)、语音克隆、AI 语音对话、语音输入、AI 笔记、AI 播客制作及文本转语音 API。2026 年推出 Speechify Developer Platform,搭载 Simba 3.2 语音模型,支持开发者构建低于 100ms 延迟的流式实时语音 Agent。

对话助手文件分析语音对话语音合成语音转录
近7天 0 动态