Castor 是一款开源的视频投屏命令行工具,使用 Go 语言开发。它通过无头 Chrome 从网页中自动定位真实视频流,经 ffmpeg 实时转码后,通过 DLNA/UPnP 协议投射到智能电视、Kodi、VLC 或 Plex,无需 Chromecast 或 AirPlay,号称无延迟。支持 Homebrew 安装,当前最新版本 1.4.1。
Capability Timeline
语音转录
将音频、语音内容自动转录为文字的能力,包括本地或云端 AI 转录
相关工具
13Screenpipe 是一个开源、本地优先的 AI 记忆层工具,24/7 捕获用户屏幕、音频和操作行为,将真实工作转化为可搜索记忆、SOP、会议跟进、每日总结和个人 CRM,并支持生成 AI 智能体。用户可控制录制范围、排除特定应用和窗口、自主选择数据存储位置,确保隐私安全。企业可跨机器映射重复工作流,保留流程知识并暴露瓶颈。GitHub 获 20K+ 星标、130+ 贡献者,由 YC S26 支持。
Inkling 是 Thinking Machines Lab 发布的首个开源权重 MoE 模型,总参数量975B、活跃参数41B,支持100万token上下文窗口。模型原生支持文本、图像和音频理解,具备代码生成、智能体工具调用等能力,可通过 Tinker 平台进行微调定制。
LiTranslate 是 MIT 开源、可完全自托管的视频/音频字幕生成与本地化工具。浏览器端用 ffmpeg.wasm 提取音频,服务端由转录 Agent(Whisper 类模型)和翻译 Agent(指令型 LLM)两个独立后台任务处理,字幕逐条流式写入 SQLite,刷新页面可断点续跑。内置完整时间轴字幕编辑器,支持多语言轨道并排管理与 SRT、VTT、ASS、TXT 导出,模型经 OpenRouter 兼容接口自由配置。
MacWhisper 是一款适用于 Mac 设备的 AI 驱动转录应用,由独立开发者 Jordi Bruin 开发。支持在本地运行 OpenAI Whisper 和 Nvidia Parakeet 等 AI 模型,可直接处理音频、视频、会议及系统音频的转录任务,适用于播客制作等音视频处理场景。所有转录在设备本地完成,数据不离开机器,适合处理敏感音频。还支持 Zoom、Teams 等会议自动录制转录、发言人识别、字幕导出等多种格式。
Nativ 是一款 macOS 桌面应用,基于 MLX-VLM 针对 Apple Silicon(M1+)优化,让用户无需账户、订阅或云端即可在本地运行 Google、Cohere、Liquid AI 等开放模型。应用支持语言、视觉、视频、代码、音频等多模态交互,提供实时 tokens/秒、内存压力、首 token 延迟等性能指标,并内置本地端点,可对接 Codex、Claude Code、OpenCode 等编码智能体。项目以 MIT 许可完全开源。
千问输入法是阿里旗下从说话出发的 AI 输入工具,核心基于 CosyVoice 语音大模型实现语音输入与转录,支持 9 种方言及中英混合识别,单次录音最长 3 分钟。口述后系统自动过滤语气词、纠正口误、理顺语序并分段排版,生成结构化文本,可用于邮件、周报、会议纪要等场景。无广告无弹窗无需注册。
百度智能云是百度旗下的全栈AI云平台,提供从算力底座(百舸AI计算平台、天池超节点)、大模型服务(千帆大模型平台、文心系列模型)到Agent开发与应用的全栈能力。平台支持企业构建数字员工、视觉智能体、深度研究助手等AI应用,并提供AI安全护栏、内容审核、数据分析等企业级服务。在WAIC 2026上展出的天池256超节点支持256卡互联,推理效率提升50%。
LiveKit 是开源的语音 AI Agent 开发与运行平台,提供完整工具链构建、测试、部署和监控实时语音智能体。核心能力包括:通过开源 Agents SDK 编写 Agent 逻辑、LiveKit Inference 推理网关支持 50+ AI 模型开箱即用(STT/LLM/TTS)、LiveKit Cloud 全球云平台负责路由与自动扩缩、原生电话与 SIP 集成、端到端会话可观测性与遥测。支持多模态低延迟高并发对话,OpenAI 基于 LiveKit Cloud 构建 ChatGPT 高级语音功能。
LM Studio Bionic 是 LM Studio 推出的开源模型 AI 智能体工具,支持本地端侧模型运行和云端调用 GLM 5.2、Kimi K2.6、Qwen 3.6 等开源模型。可处理编程、研究及复杂文档工作,内置 MCP 协议集成,云端请求遵循零数据保留隐私政策。支持 macOS、Windows 和 Linux 平台。
MOSS-Transcribe-Diarize-0.9B 是 OpenMOSS 开源的高性能端到端音频理解模型,面向会议、通话、播客、访谈等长时多说话人场景,支持一次性语音转写与说话人分离,自动输出带精确时间戳和说话人标签的结构化文本,无需独立的发言人识别模型。在 INTERSPEECH 2026 多语种语音理解挑战赛中获得第一名。
Patter 是开源语音 AI SDK,支持 Python 和 TypeScript,可让开发者在 4 行代码内为 AI 代理分配电话号码。集成 Twilio、Telnyx、Plivo 等运营商,支持 OpenAI Realtime、Deepgram STT、ElevenLabs TTS 等语音管线,提供动态变量、输出护栏、延迟仪表盘、通话录音和回归评估等能力,MIT 许可证。
Speechify 是全球最大的 AI 语音平台之一,服务超过 5500 万用户。提供文字转语音(TTS)、语音克隆、AI 语音对话、语音输入、AI 笔记、AI 播客制作及文本转语音 API。2026 年推出 Speechify Developer Platform,搭载 Simba 3.2 语音模型,支持开发者构建低于 100ms 延迟的流式实时语音 Agent。



