Gemini是Google打造的生成式AI助手,能够帮助用户完成写作、规划与头脑风暴等核心任务。该工具支持70种以上语言的实时语音到语音翻译,具备流式连续音频生成与自动语种检测功能,可精准保留原始语调、语速和音调,并拥有出色的强抗噪能力。借助生成式AI技术,用户可流畅开展跨语言交流、内容生成及多场景智能协作
Capability Timeline
语音对话
通过语音输入与语音回复进行实时或连续对话。
相关工具
17Qwen-Audio是阿里通义千问团队推出的音频语言大模型系列,能够接受多种音频信号输入并执行音频分析或根据语音指令进行文本回复。模型支持语音聊天和音频分析两种交互模式,用户可无需文本输入直接进行语音交互,也可提供音频和文本指令进行分析。最新版本Qwen-Audio-3.0-Realtime在智商、Agent工具调用、共情对话和双工交互流畅度四条主线上同步升级。
通义千问(Qwen)是阿里巴巴云开发的大语言模型系列,提供对话助手、代码生成、智能体工具调用、256K至100万token长文本理解、多语言翻译和创意写作等能力。模型涵盖Dense和MoE架构,支持思考与非思考模式切换,可通过Qwen Chat、API及多种推理框架使用。
Apple Intelligence 是苹果全平台 AI 系统,深度集成于 iOS、iPadOS、macOS 和 visionOS。提供 Genmoji 表情生成、Siri 智能助手、图像理解与描述、HomeKit 视频摘要、无障碍辅助、Workout Buddy 运动指导等能力。采用设备端处理与 Private Cloud Compute 保护隐私,通过 Foundation Models 框架向第三方应用开放 AI 能力。
AURA(Autonomous Unified Response Architecture)是一个开源、完全离线运行的本地语音 AI 助手系统,用户交互人格名为 Kommy。核心语音管线为:唤醒词 -> Whisper 语音转文字 -> Ollama 本地 LLM -> ChromaDB RAG/记忆 -> Piper 语音合成。系统通过沙箱化执行器执行 Git、Docker、文件系统等开发者命令,所有数据不离开本地机器,无需云服务或 API 密钥。项目正在积极开发中,已通过 629 项测试。
Buzz 是 Block 开源的自托管工作空间,将团队聊天、AI 智能体、工作流与 Git 托管整合进同一身份系统。底层基于 Nostr 中继,所有消息、工作流步骤、代码评审与 git 事件均为同一日志中的签名事件。智能体可像人一样打开仓库、提交补丁、评审代码、运行工作流并参与语音讨论。
Inkling 是 Thinking Machines Lab 发布的首个开源权重 MoE 模型,总参数量975B、活跃参数41B,支持100万token上下文窗口。模型原生支持文本、图像和音频理解,具备代码生成、智能体工具调用等能力,可通过 Tinker 平台进行微调定制。
PixVerse 是全球 AI 视频生成平台,提供文生视频、图生视频、视频编辑、口型同步、音频生成等能力。旗舰模型 V6 支持电影级镜头控制与角色表演。2026 年 1 月发布 R1 实时世界模型,将视频转变为可交互的连续流,并推出 PixVerse Game Engine 将实时世界模型应用于游戏创作,玩家可用自然语言交互,世界实时响应。平台还提供 API、智能体、营销中心、画布等企业级工作流工具。
Siri是苹果的智能语音助手,在iOS 27中升级为AI驱动的新版本。它能访问用户设备上的邮件、照片和信息,感知屏幕内容,回答世界知识问题,并集成Spotlight搜索。新版Siri基于Apple Intelligence的Foundation Models在设备端运行,结合Private Cloud Compute保障隐私数据不被存储,支持iPhone、iPad、Mac、Apple Watch、AirPods、Apple TV和Vision Pro等全平台,并首次提供独立应用入口。
Spotify 是全球领先的数字音乐流媒体平台,提供数百万首歌曲、播客和有声书的访问。用户可通过个性化推荐发现新音乐、创建播放列表并追踪个人收听历史。Spotify 内置 AI DJ 功能,为 Premium 用户提供个性化音乐推荐和评论,支持多语言。2026 年 7 月起进一步推出 AI 语音对话功能测试版,支持在应用内通过语音或文字与 Spotify 进行多轮对话,控制播放、查询歌曲艺术家信息、回顾收听历史及回答常识性问题。
Token Plan 是阿里千问 AI 平台推出的模型订阅套餐,提供个人版与团队版,用户在统一订阅体系下通过一个 API Key 调用文本、语音、图像等全模态模型能力,抢先体验 Qwen3.8-Max-Preview 等先进模型。套餐按 Credits 计量,兼容 OpenAI / Anthropic 协议的主流 Coding 与 Agent 工具,支持联网搜索、知识检索等工具能力,并可同时运行多个 Agent 并发任务。
千问输入法是阿里旗下从说话出发的 AI 输入工具,核心基于 CosyVoice 语音大模型实现语音输入与转录,支持 9 种方言及中英混合识别,单次录音最长 3 分钟。口述后系统自动过滤语气词、纠正口误、理顺语序并分段排版,生成结构化文本,可用于邮件、周报、会议纪要等场景。无广告无弹窗无需注册。
Gemma 4 是 Google DeepMind 推出的开源权重模型家族,包含 2B/4B 小模型、31B 稠密模型、26B MoE 与 12B 统一多模态模型四种架构。支持文本、图像、视频、音频输入与文本输出,上下文窗口最高 256K,内置函数调用与系统提示词支持,强化编码与 Agent 能力,可在手机、浏览器到云端服务器多环境部署,Apache 2.0 许可允许商用微调。
LiveKit 是开源的语音 AI Agent 开发与运行平台,提供完整工具链构建、测试、部署和监控实时语音智能体。核心能力包括:通过开源 Agents SDK 编写 Agent 逻辑、LiveKit Inference 推理网关支持 50+ AI 模型开箱即用(STT/LLM/TTS)、LiveKit Cloud 全球云平台负责路由与自动扩缩、原生电话与 SIP 集成、端到端会话可观测性与遥测。支持多模态低延迟高并发对话,OpenAI 基于 LiveKit Cloud 构建 ChatGPT 高级语音功能。
Patter 是开源语音 AI SDK,支持 Python 和 TypeScript,可让开发者在 4 行代码内为 AI 代理分配电话号码。集成 Twilio、Telnyx、Plivo 等运营商,支持 OpenAI Realtime、Deepgram STT、ElevenLabs TTS 等语音管线,提供动态变量、输出护栏、延迟仪表盘、通话录音和回归评估等能力,MIT 许可证。
Speechify 是全球最大的 AI 语音平台之一,服务超过 5500 万用户。提供文字转语音(TTS)、语音克隆、AI 语音对话、语音输入、AI 笔记、AI 播客制作及文本转语音 API。2026 年推出 Speechify Developer Platform,搭载 Simba 3.2 语音模型,支持开发者构建低于 100ms 延迟的流式实时语音 Agent。
Vidu AI 是生数科技自研的AI视频生成模型与内容生产平台,可将文字和图像转化为高质量动态视频,并保持主体一致性。支持文生视频、图生视频、参考生视频等多种生成模式,3步即可完成创意视频创作。




