功能图谱

Capability Timeline

视频生成

根据文字、图片或素材生成视频内容。

24 个工具22 条动态

相关工具

24

小米380亿参数具身智能世界基础模型

Xiaomi-Robotics-U0是小米推出的380亿参数多模态自回归世界基础模型,专为具身智能设计。在单一框架内统一文生图、图像编辑、多视角具身场景生成、具身迁移和具身视频生成五项任务,支持跨多种机器人形态的高质量多视角场景生成,并实现结构化可控的具身迁移编辑,同时保持多视角一致性与交互动态。

具身导航世界模型视频生成图像编辑图像生成
近7天 2 动态

谷歌基于 Veo 等生成模型的 AI 视频创作工作室

Google Flow 是 Google Labs 推出的 AI 创意工作室,基于谷歌先进的生成模型,集成 Veo 3.1 视频生成、Nano Banana 图像生成与编辑以及 Gemini Omni 对话式视频编辑能力,可从任意输入参考创建和编辑视频,并内置智能创意 Agent 陪伴从构思到执行的全流程。目前已上线 iOS TestFlight Beta 版。

视频处理视频生成图像编辑图像生成智能体
近7天 1 动态

AI 原生创意套件,支持图像/视频/语音生成与 AE 插件集成

Higgsfield AI 是一个 AI 原生创意套件,支持用户通过文本提示或参考图生成图像、视频和语音内容,并可编辑和放大媒体。平台内置 AI 智能体可自动化创意工作流,支持网页和移动端。近期发布了 After Effects MCP/插件,由 Fable 5 驱动,允许用户在 AE 项目内直接调用 Claude,自动构建合成、设置关键帧、编写表达式并运行 ExtendScript 重复工作,所有生成内容均为可编辑的 AE 场景。

视频生成图像编辑图像生成语音合成智能体
近7天 1 动态

英伟达开源物理AI世界基础模型平台

NVIDIA Cosmos 是一个开源的物理 AI 基础世界模型平台,包含 Cosmos 3 基础版及 Cosmos 3 Edge 等模型。它可作为视觉语言模型对复杂真实场景中的物体、交互和意图进行推理,支持质量检测、公共安全、交通监控、物流和自动驾驶等实时告警与密集描述。同时可加速机器人策略学习,作为世界动作模型骨干适配特定任务和领域行为;还可作为可控的物理世界模拟器预测多种方案并闭环评估结果;并支持从文本、图像、视频、环境声音和动作输入生成无限合理的合成视频数据,用于训练物理 AI。

具身导航模型训练学习目标检测世界模型视频生成
近7天 1 动态

全球 AI 视频生成平台,提供实时世界模型与游戏引擎

PixVerse 是全球 AI 视频生成平台,提供文生视频、图生视频、视频编辑、口型同步、音频生成等能力。旗舰模型 V6 支持电影级镜头控制与角色表演。2026 年 1 月发布 R1 实时世界模型,将视频转变为可交互的连续流,并推出 PixVerse Game Engine 将实时世界模型应用于游戏创作,玩家可用自然语言交互,世界实时响应。平台还提供 API、智能体、营销中心、画布等企业级工作流工具。

世界模型视频处理视频生成图像编辑音乐生成
近7天 1 动态

浏览器端 AI 创作工作台,集成视频、图像与音频生成

VideoAny 是一个浏览器端 AI 创作工作室,将视频、图像和音频生成整合在同一工作台中,界面提供巴西葡萄牙语版本。支持文生视频、图生视频、视频转视频、视频换脸、口型同步以及提示词驱动的图像生成与编辑,用户可在同一账户内比较 Seedance、Kling、Sora 等多个模型、选择格式与生成设置并管理生成资产,新账户可先用赠送额度体验。

视频处理视频换脸视频生成图像生成
近7天 1 动态

阿里开源音乐舞蹈视频生成模型,支持多种舞蹈风格

Wan-Dancer-14B 是阿里巴巴开源的14B参数音乐到舞蹈视频生成模型,采用分层框架实现分钟级连贯舞蹈视频生成。用户上传角色和歌曲即可生成与节拍同步的舞蹈视频,支持街舞、踢踏、拉丁、K-Pop、中式古典等多种风格,并可本地部署运行,大幅降低内容创作者使用门槛。模型权重和推理代码均已开源。

视频生成
近7天 1 动态

实时交互AI视频模型平台,支持角色替换、换装与触屏交互

Xmax AI 是实时交互视频模型平台,核心产品 X2.0 支持毫秒级实时视频生成。提供五大能力模块:CharX 实时角色替换、ClothX 实时换装、VibeX 实时风格渲染、MoX 触屏动画交互、DimX 次元生物召唤。支持摄像头实时流处理、参考图片驱动生成和 Prompt 文字控制,开放 SDK 与 API 供开发者接入,单张消费级显卡即可运行。

视频处理视频换脸视频生成
近7天 1 动态

Creatify是面向营销与电商团队的AI广告视频生成平台,一键创建高转化广告变体

Creatify是一款AI广告视频生成平台,能将产品链接快速转化为高转化视频。用户可通过节点编辑器、对话式数据查询或批量生成模式,在几分钟内创建并测试多种广告变体。平台支持多广告账户一键连接与自动适配各社媒规格,内置A/B测试功能,并能基于广告数据对话与行业竞品策略库持续优化投放表现,显著降低制作成本

视频生成视频处理
近7天 0 动态
DW

开源具身世界模型,统一视频预测、动作生成与价值评估

DW05 是原力灵机(Dexmal)发布的开源具身世界模型,采用 MoT 架构,以 Wan 为骨干网络,配合 Video Expert、Action Expert、Value Expert 三大专家模块,统一未来视频预测、动作生成与状态价值评估。支持语言、图像/视频、机器人类型、状态和动作多模态输入,可预测动作执行后的未来状态、生成失败轨迹并对任务进度打分,用于 VLA 模型后训练中的强化学习环境。已发布模型权重、推理代码和训练代码,采用 Apache-2.0 许可证。

具身导航强化学习训练世界模型视频生成
近7天 0 动态55 Stars

支持自然语言对话与多模态输入的下一代AI视频生成与编辑模型

Gemini Omni Flash 是一款由 Google DeepMind 推出的下一代 AI 视频生成与编辑模型。该工具支持通过自然语言进行多轮对话式视频修改,能够结合物理规律与现实世界知识生成符合逻辑的动态画面。用户可输入文本、图像、音频或手绘草图作为参考,模型将其融合并输出连贯的10秒视频。它还支持画面内物体与角色替换、文字与语音节奏同步以及多步骤一致性精修,致力于提供高质量的视频生成与迭代体验

视频处理视频生成
近7天 0 动态

Runway 推出的智能创意 Agent,从一句话到成品视频全流程协作

Runway Agent 是 Runway 推出的智能创意助手,通过对话式交互帮助用户从单一创意出发,完成视频、图像等多模态内容的生成与编辑。支持在单界面内将视频片段、音频和图片整合到时间线,直接产出完整视频。可上传 PDF 分析广告表现数据,自动提出策略建议并生成创意素材。面向营销人员、内容创作者和影视制作团队,提供端到端创意工作流。

对话助手视频处理视频生成图像生成文件分析
近7天 0 动态

多模型AI图像生成工具,支持精准局部重绘与智能参考控制,助力设计与电商高效创作

Seedream是一款多模型AI图像生成工具,可将文本提示快速转化为高清视觉图像。用户可通过打点画框交互与提示词标记实现精准局部编辑,结合色卡配色与商品换色功能高效制作电商素材。工具支持智能参考控制与接口接入,提供高质量画面重绘与细节增强,满足设计师、电商运营及内容创作者的视觉工作流需求

视频生成图像编辑图像生成图像增强
近7天 0 动态