功能图谱

Capability Timeline

视频处理

剪辑、成片、视频增强、模板化处理或视频工作流自动化。

21 个工具21 条动态

相关工具

21

谷歌基于 Veo 等生成模型的 AI 视频创作工作室

Google Flow 是 Google Labs 推出的 AI 创意工作室,基于谷歌先进的生成模型,集成 Veo 3.1 视频生成、Nano Banana 图像生成与编辑以及 Gemini Omni 对话式视频编辑能力,可从任意输入参考创建和编辑视频,并内置智能创意 Agent 陪伴从构思到执行的全流程。目前已上线 iOS TestFlight Beta 版。

视频处理视频生成图像编辑图像生成智能体
近7天 1 动态

开源 AI 视频字幕生成与多语言翻译平台

LiTranslate 是 MIT 开源、可完全自托管的视频/音频字幕生成与本地化工具。浏览器端用 ffmpeg.wasm 提取音频,服务端由转录 Agent(Whisper 类模型)和翻译 Agent(指令型 LLM)两个独立后台任务处理,字幕逐条流式写入 SQLite,刷新页面可断点续跑。内置完整时间轴字幕编辑器,支持多语言轨道并排管理与 SRT、VTT、ASS、TXT 导出,模型经 OpenRouter 兼容接口自由配置。

翻译视频处理语音转录
近7天 1 动态15 Stars

OpenMOSS 开源实时视频流多模态理解模型系列

MOSS-VL 是 OpenMOSS 团队推出的开源多模态视觉理解模型系列,基于 Cross-Attention 架构与 XRoPE 时空位置编码,三个 11B 参数模型均以 Apache-2.0 协议开源。MOSS-VL-Realtime 支持在持续视频流输入时同步感知与生成,可随时打断、实时回答并自主决定何时回复;MOSS-VL-Instruct 适用于离线长视频理解与深度对话;MOSS-VL-Base 提供预训练基座,支持 256K 上下文窗口。

视频处理
近7天 1 动态391 Stars
NA

在 Mac 上本地运行开放模型的免费开源桌面应用

Nativ 是一款 macOS 桌面应用,基于 MLX-VLM 针对 Apple Silicon(M1+)优化,让用户无需账户、订阅或云端即可在本地运行 Google、Cohere、Liquid AI 等开放模型。应用支持语言、视觉、视频、代码、音频等多模态交互,提供实时 tokens/秒、内存压力、首 token 延迟等性能指标,并内置本地端点,可对接 Codex、Claude Code、OpenCode 等编码智能体。项目以 MIT 许可完全开源。

代码补全对话助手视频处理图像理解语音合成
近7天 1 动态
NV

NVIDIA 的实时流分析工具包,用于 GPU 加速的视频与图像智能处理

NVIDIA DeepStream SDK 是一个基于 GStreamer 的开源实时流分析工具包,专为 AI 驱动的多传感器处理、视频、音频和图像理解而设计。它提供硬件加速解码/编码、TensorRT 推理、目标追踪和消息代理集成,支持 dGPU 和 Jetson 边缘设备部署。开发者可通过 Agent 技能用自然语言自动生成多摄像头视频分析管道,大幅缩短开发周期。

视频处理图像理解智能体自动化工作流
近7天 1 动态

全球 AI 视频生成平台,提供实时世界模型与游戏引擎

PixVerse 是全球 AI 视频生成平台,提供文生视频、图生视频、视频编辑、口型同步、音频生成等能力。旗舰模型 V6 支持电影级镜头控制与角色表演。2026 年 1 月发布 R1 实时世界模型,将视频转变为可交互的连续流,并推出 PixVerse Game Engine 将实时世界模型应用于游戏创作,玩家可用自然语言交互,世界实时响应。平台还提供 API、智能体、营销中心、画布等企业级工作流工具。

世界模型视频处理视频生成图像编辑音乐生成
近7天 1 动态

浏览器端 AI 创作工作台,集成视频、图像与音频生成

VideoAny 是一个浏览器端 AI 创作工作室,将视频、图像和音频生成整合在同一工作台中,界面提供巴西葡萄牙语版本。支持文生视频、图生视频、视频转视频、视频换脸、口型同步以及提示词驱动的图像生成与编辑,用户可在同一账户内比较 Seedance、Kling、Sora 等多个模型、选择格式与生成设置并管理生成资产,新账户可先用赠送额度体验。

视频处理视频换脸视频生成图像生成
近7天 1 动态

文远知行自研物理AI认知基础大模型

WeRide WITT 是文远知行 WeRide 自研的物理 AI 认知基础大模型,全称 World Intelligence Toward Truth。基于视觉语言大模型(VLM)能力,WITT 引入"最小物理事实单元"概念,打通视频、图像、文本等多模态信息,将连续变化的真实场景拆解为可被识别和验证的事实单元。WITT 具备事实提取、事实推理、事实验证、事实编排四大核心能力,内置视频数据引擎支持关键词或自然语言检索海量视频数据,与文远知行世界模型 WeRide GENESIS 协同训练自动驾驶车端模型。

世界模型视频处理图像理解
近7天 1 动态

实时交互AI视频模型平台,支持角色替换、换装与触屏交互

Xmax AI 是实时交互视频模型平台,核心产品 X2.0 支持毫秒级实时视频生成。提供五大能力模块:CharX 实时角色替换、ClothX 实时换装、VibeX 实时风格渲染、MoX 触屏动画交互、DimX 次元生物召唤。支持摄像头实时流处理、参考图片驱动生成和 Prompt 文字控制,开放 SDK 与 API 供开发者接入,单张消费级显卡即可运行。

视频处理视频换脸视频生成
近7天 1 动态
YO

将 YouTube 吉他教学视频自动转为 PDF 吉他谱的开源 CLI 工具

youtube-guitar-tab-parser 是一款开源 CLI 工具,可将 YouTube 吉他教学视频自动转换为 PDF 格式吉他谱。它下载视频后采样帧画面,使用 Claude 视觉模型定位乐谱区域,裁剪每帧并基于每行乐谱上的小节编号去重,最终将不同小节垂直拼接为 PDF。支持自定义截图间隔、采样帧数、去重阈值等参数,无需额外配置即可使用。

视频处理图像理解文档生成
近7天 1 动态157 Stars

Creatify是面向营销与电商团队的AI广告视频生成平台,一键创建高转化广告变体

Creatify是一款AI广告视频生成平台,能将产品链接快速转化为高转化视频。用户可通过节点编辑器、对话式数据查询或批量生成模式,在几分钟内创建并测试多种广告变体。平台支持多广告账户一键连接与自动适配各社媒规格,内置A/B测试功能,并能基于广告数据对话与行业竞品策略库持续优化投放表现,显著降低制作成本

视频生成视频处理
近7天 0 动态

支持自然语言对话与多模态输入的下一代AI视频生成与编辑模型

Gemini Omni Flash 是一款由 Google DeepMind 推出的下一代 AI 视频生成与编辑模型。该工具支持通过自然语言进行多轮对话式视频修改,能够结合物理规律与现实世界知识生成符合逻辑的动态画面。用户可输入文本、图像、音频或手绘草图作为参考,模型将其融合并输出连贯的10秒视频。它还支持画面内物体与角色替换、文字与语音节奏同步以及多步骤一致性精修,致力于提供高质量的视频生成与迭代体验

视频处理视频生成
近7天 0 动态

Google DeepMind 开源多模态模型家族,覆盖端侧到服务器

Gemma 4 是 Google DeepMind 推出的开源权重模型家族,包含 2B/4B 小模型、31B 稠密模型、26B MoE 与 12B 统一多模态模型四种架构。支持文本、图像、视频、音频输入与文本输出,上下文窗口最高 256K,内置函数调用与系统提示词支持,强化编码与 Agent 能力,可在手机、浏览器到云端服务器多环境部署,Apache 2.0 许可允许商用微调。

代码生成对话助手视频处理图像理解语音对话
近7天 0 动态

Runway 推出的智能创意 Agent,从一句话到成品视频全流程协作

Runway Agent 是 Runway 推出的智能创意助手,通过对话式交互帮助用户从单一创意出发,完成视频、图像等多模态内容的生成与编辑。支持在单界面内将视频片段、音频和图片整合到时间线,直接产出完整视频。可上传 PDF 分析广告表现数据,自动提出策略建议并生成创意素材。面向营销人员、内容创作者和影视制作团队,提供端到端创意工作流。

对话助手视频处理视频生成图像生成文件分析
近7天 0 动态