通义千问(Qwen)是阿里巴巴云开发的大语言模型系列,提供对话助手、代码生成、智能体工具调用、256K至100万token长文本理解、多语言翻译和创意写作等能力。模型涵盖Dense和MoE架构,支持思考与非思考模式切换,可通过Qwen Chat、API及多种推理框架使用。
Capability Timeline
视频生成
根据文字、图片或素材生成视频内容。
相关工具
24Xiaomi-Robotics-U0是小米推出的380亿参数多模态自回归世界基础模型,专为具身智能设计。在单一框架内统一文生图、图像编辑、多视角具身场景生成、具身迁移和具身视频生成五项任务,支持跨多种机器人形态的高质量多视角场景生成,并实现结构化可控的具身迁移编辑,同时保持多视角一致性与交互动态。
DeepFake(deepfakeai.pro)是一个在线一体化 AI 创作工作室,将 AI 换脸视频、图片生成、图生视频/文生视频、对口型、AI 头像与 AI 音乐生成整合在同一工作流中,并强调基于同意的合规创作与安全控制,适合内容创作者快速完成从参考图到视频、图像、音频的完整创意项目。
Google Flow 是 Google Labs 推出的 AI 创意工作室,基于谷歌先进的生成模型,集成 Veo 3.1 视频生成、Nano Banana 图像生成与编辑以及 Gemini Omni 对话式视频编辑能力,可从任意输入参考创建和编辑视频,并内置智能创意 Agent 陪伴从构思到执行的全流程。目前已上线 iOS TestFlight Beta 版。
Google Vids 是 Google Workspace 中的 AI 视频创作与编辑工具,用户可通过文本提示和参考图片生成视频,使用 Gemini Omni 多模态模型进行背景替换、光线修复和特效添加,支持逐步编辑。2026年更新后支持上传自拍和录音创建个性化数字分身,可让用户在自己的视频中出镜。
HappyHorse 是阿里云旗下的 AI 视频生成模型,当前公开版本为 1.1。该模型可在一晚时间内完成一支完整 PR 短片制作,曾在东京 AI 视频黑客松中凭借 15 秒短片《连接现实的工程师》获得卓越奖,官方渠道提供免费试用入口,适合需要快速产出宣传视频的用户。
Higgsfield AI 是一个 AI 原生创意套件,支持用户通过文本提示或参考图生成图像、视频和语音内容,并可编辑和放大媒体。平台内置 AI 智能体可自动化创意工作流,支持网页和移动端。近期发布了 After Effects MCP/插件,由 Fable 5 驱动,允许用户在 AE 项目内直接调用 Claude,自动构建合成、设置关键帧、编写表达式并运行 ExtendScript 重复工作,所有生成内容均为可编辑的 AE 场景。
NVIDIA Cosmos 是一个开源的物理 AI 基础世界模型平台,包含 Cosmos 3 基础版及 Cosmos 3 Edge 等模型。它可作为视觉语言模型对复杂真实场景中的物体、交互和意图进行推理,支持质量检测、公共安全、交通监控、物流和自动驾驶等实时告警与密集描述。同时可加速机器人策略学习,作为世界动作模型骨干适配特定任务和领域行为;还可作为可控的物理世界模拟器预测多种方案并闭环评估结果;并支持从文本、图像、视频、环境声音和动作输入生成无限合理的合成视频数据,用于训练物理 AI。
PixVerse 是全球 AI 视频生成平台,提供文生视频、图生视频、视频编辑、口型同步、音频生成等能力。旗舰模型 V6 支持电影级镜头控制与角色表演。2026 年 1 月发布 R1 实时世界模型,将视频转变为可交互的连续流,并推出 PixVerse Game Engine 将实时世界模型应用于游戏创作,玩家可用自然语言交互,世界实时响应。平台还提供 API、智能体、营销中心、画布等企业级工作流工具。
VideoAny 是一个浏览器端 AI 创作工作室,将视频、图像和音频生成整合在同一工作台中,界面提供巴西葡萄牙语版本。支持文生视频、图生视频、视频转视频、视频换脸、口型同步以及提示词驱动的图像生成与编辑,用户可在同一账户内比较 Seedance、Kling、Sora 等多个模型、选择格式与生成设置并管理生成资产,新账户可先用赠送额度体验。
Viggle AI 是基于 3D 生成模型的 AI 视频创作平台,提供视频生成、实时换脸、动作控制等功能。用户可将任意角色混入视频制作热门 Meme,或通过 PINOC 从视频提取骨骼动画并导出 FBX/GLB。其游戏 Fight Anyone 3D 让用户自定义角色、生成 3D 动作和场景进行 PvE、PvP 和好友对战。
Virbo AI是万兴科技旗下的AI视频生成工具,提供350+ AI虚拟人、400+多语种语音、照片开口说话、文本转语音与精准口型同步能力,支持AI生成与真人拍摄混合创作,面向电商带货、品牌营销与跨境多语言视频场景。
Wan-Dancer-14B 是阿里巴巴开源的14B参数音乐到舞蹈视频生成模型,采用分层框架实现分钟级连贯舞蹈视频生成。用户上传角色和歌曲即可生成与节拍同步的舞蹈视频,支持街舞、踢踏、拉丁、K-Pop、中式古典等多种风格,并可本地部署运行,大幅降低内容创作者使用门槛。模型权重和推理代码均已开源。
Xmax AI 是实时交互视频模型平台,核心产品 X2.0 支持毫秒级实时视频生成。提供五大能力模块:CharX 实时角色替换、ClothX 实时换装、VibeX 实时风格渲染、MoX 触屏动画交互、DimX 次元生物召唤。支持摄像头实时流处理、参考图片驱动生成和 Prompt 文字控制,开放 SDK 与 API 供开发者接入,单张消费级显卡即可运行。
万兴剧厂是万兴科技推出的AI驱动一站式精品影视/漫剧内容创作平台,支持小说IP快速改编、剧本智能拆解、角色一致性生成、智能分镜、配音合成与后期剪辑全链路工作流,帮助创作者低成本规模化生产动画级漫剧与AI影视内容。
阿里云百炼是全链路大模型服务平台,提供百余款千问系列及第三方大模型即开即用,内置Agent工具链支持MCP托管与智能体搭建,支持Vibe Coding编程开发、图像生成、视觉理解、视频生成等多元AI能力,覆盖从模型调用到应用部署的一站式AI落地流程。
Animos 是一款基于浏览器的动画制作工具,专为设计师和内容创作者打造。用户可选择30+种预设动画模板,导入图片或视频素材,微调后导出4K分辨率的MP4/WebM动画,适用于作品集和设计展示。整个流程在浏览器中完成,无需安装软件。
ClipMatch 是一款 AI 视频编辑工具,用户上传相册素材后,通过 AI 脚本写作辅助撰写脚本,再由 clip matching 技术将每行脚本与合适的镜头自动配对,最终导出适配 Instagram、TikTok、YouTube Shorts、LinkedIn 等平台的短视频内容,全程无需时间线编辑。
Creatify是一款AI广告视频生成平台,能将产品链接快速转化为高转化视频。用户可通过节点编辑器、对话式数据查询或批量生成模式,在几分钟内创建并测试多种广告变体。平台支持多广告账户一键连接与自动适配各社媒规格,内置A/B测试功能,并能基于广告数据对话与行业竞品策略库持续优化投放表现,显著降低制作成本
DW05 是原力灵机(Dexmal)发布的开源具身世界模型,采用 MoT 架构,以 Wan 为骨干网络,配合 Video Expert、Action Expert、Value Expert 三大专家模块,统一未来视频预测、动作生成与状态价值评估。支持语言、图像/视频、机器人类型、状态和动作多模态输入,可预测动作执行后的未来状态、生成失败轨迹并对任务进度打分,用于 VLA 模型后训练中的强化学习环境。已发布模型权重、推理代码和训练代码,采用 Apache-2.0 许可证。
Gemini Omni Flash 是一款由 Google DeepMind 推出的下一代 AI 视频生成与编辑模型。该工具支持通过自然语言进行多轮对话式视频修改,能够结合物理规律与现实世界知识生成符合逻辑的动态画面。用户可输入文本、图像、音频或手绘草图作为参考,模型将其融合并输出连贯的10秒视频。它还支持画面内物体与角色替换、文字与语音节奏同步以及多步骤一致性精修,致力于提供高质量的视频生成与迭代体验
Runway Agent 是 Runway 推出的智能创意助手,通过对话式交互帮助用户从单一创意出发,完成视频、图像等多模态内容的生成与编辑。支持在单界面内将视频片段、音频和图片整合到时间线,直接产出完整视频。可上传 PDF 分析广告表现数据,自动提出策略建议并生成创意素材。面向营销人员、内容创作者和影视制作团队,提供端到端创意工作流。
Seedream是一款多模型AI图像生成工具,可将文本提示快速转化为高清视觉图像。用户可通过打点画框交互与提示词标记实现精准局部编辑,结合色卡配色与商品换色功能高效制作电商素材。工具支持智能参考控制与接口接入,提供高质量画面重绘与细节增强,满足设计师、电商运营及内容创作者的视觉工作流需求
Vidu AI 是生数科技自研的AI视频生成模型与内容生产平台,可将文字和图像转化为高质量动态视频,并保持主体一致性。支持文生视频、图生视频、参考生视频等多种生成模式,3步即可完成创意视频创作。


