Castor 是一款开源的视频投屏命令行工具,使用 Go 语言开发。它通过无头 Chrome 从网页中自动定位真实视频流,经 ffmpeg 实时转码后,通过 DLNA/UPnP 协议投射到智能电视、Kodi、VLC 或 Plex,无需 Chromecast 或 AirPlay,号称无延迟。支持 Homebrew 安装,当前最新版本 1.4.1。
Capability Timeline
视频处理
剪辑、成片、视频增强、模板化处理或视频工作流自动化。
相关工具
21ClipFlow 是一款面向 iPhone 和 iPad 的视频与音频编辑器,专注于无需时间线的轻量视频处理。支持裁剪、拼接、压缩、反转、滤镜、字幕、静音、模糊、格式转换等操作,大多数处理在设备本地完成,处理结果可直接传递到下一步工具。Version 1.9 新增部分反转功能和 13 种滤镜样式。
Google Flow 是 Google Labs 推出的 AI 创意工作室,基于谷歌先进的生成模型,集成 Veo 3.1 视频生成、Nano Banana 图像生成与编辑以及 Gemini Omni 对话式视频编辑能力,可从任意输入参考创建和编辑视频,并内置智能创意 Agent 陪伴从构思到执行的全流程。目前已上线 iOS TestFlight Beta 版。
Google Vids 是 Google Workspace 中的 AI 视频创作与编辑工具,用户可通过文本提示和参考图片生成视频,使用 Gemini Omni 多模态模型进行背景替换、光线修复和特效添加,支持逐步编辑。2026年更新后支持上传自拍和录音创建个性化数字分身,可让用户在自己的视频中出镜。
LiTranslate 是 MIT 开源、可完全自托管的视频/音频字幕生成与本地化工具。浏览器端用 ffmpeg.wasm 提取音频,服务端由转录 Agent(Whisper 类模型)和翻译 Agent(指令型 LLM)两个独立后台任务处理,字幕逐条流式写入 SQLite,刷新页面可断点续跑。内置完整时间轴字幕编辑器,支持多语言轨道并排管理与 SRT、VTT、ASS、TXT 导出,模型经 OpenRouter 兼容接口自由配置。
MOSS-VL 是 OpenMOSS 团队推出的开源多模态视觉理解模型系列,基于 Cross-Attention 架构与 XRoPE 时空位置编码,三个 11B 参数模型均以 Apache-2.0 协议开源。MOSS-VL-Realtime 支持在持续视频流输入时同步感知与生成,可随时打断、实时回答并自主决定何时回复;MOSS-VL-Instruct 适用于离线长视频理解与深度对话;MOSS-VL-Base 提供预训练基座,支持 256K 上下文窗口。
Nativ 是一款 macOS 桌面应用,基于 MLX-VLM 针对 Apple Silicon(M1+)优化,让用户无需账户、订阅或云端即可在本地运行 Google、Cohere、Liquid AI 等开放模型。应用支持语言、视觉、视频、代码、音频等多模态交互,提供实时 tokens/秒、内存压力、首 token 延迟等性能指标,并内置本地端点,可对接 Codex、Claude Code、OpenCode 等编码智能体。项目以 MIT 许可完全开源。
NVIDIA 的实时流分析工具包,用于 GPU 加速的视频与图像智能处理
NVIDIA DeepStream SDK 是一个基于 GStreamer 的开源实时流分析工具包,专为 AI 驱动的多传感器处理、视频、音频和图像理解而设计。它提供硬件加速解码/编码、TensorRT 推理、目标追踪和消息代理集成,支持 dGPU 和 Jetson 边缘设备部署。开发者可通过 Agent 技能用自然语言自动生成多摄像头视频分析管道,大幅缩短开发周期。
OpenChatCut 是一款免费开源(AGPL)、本地优先的桌面 AI 视频编辑器,作为 ChatCut 的开源替代品。用户用自然语言描述剪辑需求,内置智能体或经 MCP 接入的 Codex、Claude 等外部智能体直接在真实多轨时间线上完成素材整理、剪辑、字幕、转场、音乐和动效,每步可见可撤销,导出可继续编辑。
PixVerse 是全球 AI 视频生成平台,提供文生视频、图生视频、视频编辑、口型同步、音频生成等能力。旗舰模型 V6 支持电影级镜头控制与角色表演。2026 年 1 月发布 R1 实时世界模型,将视频转变为可交互的连续流,并推出 PixVerse Game Engine 将实时世界模型应用于游戏创作,玩家可用自然语言交互,世界实时响应。平台还提供 API、智能体、营销中心、画布等企业级工作流工具。
VideoAny 是一个浏览器端 AI 创作工作室,将视频、图像和音频生成整合在同一工作台中,界面提供巴西葡萄牙语版本。支持文生视频、图生视频、视频转视频、视频换脸、口型同步以及提示词驱动的图像生成与编辑,用户可在同一账户内比较 Seedance、Kling、Sora 等多个模型、选择格式与生成设置并管理生成资产,新账户可先用赠送额度体验。
Viggle AI 是基于 3D 生成模型的 AI 视频创作平台,提供视频生成、实时换脸、动作控制等功能。用户可将任意角色混入视频制作热门 Meme,或通过 PINOC 从视频提取骨骼动画并导出 FBX/GLB。其游戏 Fight Anyone 3D 让用户自定义角色、生成 3D 动作和场景进行 PvE、PvP 和好友对战。
WeRide WITT 是文远知行 WeRide 自研的物理 AI 认知基础大模型,全称 World Intelligence Toward Truth。基于视觉语言大模型(VLM)能力,WITT 引入"最小物理事实单元"概念,打通视频、图像、文本等多模态信息,将连续变化的真实场景拆解为可被识别和验证的事实单元。WITT 具备事实提取、事实推理、事实验证、事实编排四大核心能力,内置视频数据引擎支持关键词或自然语言检索海量视频数据,与文远知行世界模型 WeRide GENESIS 协同训练自动驾驶车端模型。
Xmax AI 是实时交互视频模型平台,核心产品 X2.0 支持毫秒级实时视频生成。提供五大能力模块:CharX 实时角色替换、ClothX 实时换装、VibeX 实时风格渲染、MoX 触屏动画交互、DimX 次元生物召唤。支持摄像头实时流处理、参考图片驱动生成和 Prompt 文字控制,开放 SDK 与 API 供开发者接入,单张消费级显卡即可运行。
将 YouTube 吉他教学视频自动转为 PDF 吉他谱的开源 CLI 工具
youtube-guitar-tab-parser 是一款开源 CLI 工具,可将 YouTube 吉他教学视频自动转换为 PDF 格式吉他谱。它下载视频后采样帧画面,使用 Claude 视觉模型定位乐谱区域,裁剪每帧并基于每行乐谱上的小节编号去重,最终将不同小节垂直拼接为 PDF。支持自定义截图间隔、采样帧数、去重阈值等参数,无需额外配置即可使用。
ClipMatch 是一款 AI 视频编辑工具,用户上传相册素材后,通过 AI 脚本写作辅助撰写脚本,再由 clip matching 技术将每行脚本与合适的镜头自动配对,最终导出适配 Instagram、TikTok、YouTube Shorts、LinkedIn 等平台的短视频内容,全程无需时间线编辑。
Creatify是一款AI广告视频生成平台,能将产品链接快速转化为高转化视频。用户可通过节点编辑器、对话式数据查询或批量生成模式,在几分钟内创建并测试多种广告变体。平台支持多广告账户一键连接与自动适配各社媒规格,内置A/B测试功能,并能基于广告数据对话与行业竞品策略库持续优化投放表现,显著降低制作成本
Gemini Omni Flash 是一款由 Google DeepMind 推出的下一代 AI 视频生成与编辑模型。该工具支持通过自然语言进行多轮对话式视频修改,能够结合物理规律与现实世界知识生成符合逻辑的动态画面。用户可输入文本、图像、音频或手绘草图作为参考,模型将其融合并输出连贯的10秒视频。它还支持画面内物体与角色替换、文字与语音节奏同步以及多步骤一致性精修,致力于提供高质量的视频生成与迭代体验
Gemma 4 是 Google DeepMind 推出的开源权重模型家族,包含 2B/4B 小模型、31B 稠密模型、26B MoE 与 12B 统一多模态模型四种架构。支持文本、图像、视频、音频输入与文本输出,上下文窗口最高 256K,内置函数调用与系统提示词支持,强化编码与 Agent 能力,可在手机、浏览器到云端服务器多环境部署,Apache 2.0 许可允许商用微调。
全球使用最广泛的搜索引擎产品,每日处理数十亿查询
Google Search是全球使用最广泛的搜索引擎产品,由Google运营。用户通过搜索框输入查询词,获取网页、图片、新闻等多种搜索结果。Google Search也是Alphabet公司最重要的收入来源产品。
Runway Agent 是 Runway 推出的智能创意助手,通过对话式交互帮助用户从单一创意出发,完成视频、图像等多模态内容的生成与编辑。支持在单界面内将视频片段、音频和图片整合到时间线,直接产出完整视频。可上传 PDF 分析广告表现数据,自动提出策略建议并生成创意素材。面向营销人员、内容创作者和影视制作团队,提供端到端创意工作流。



