Seedance 2.5 是字节跳动 Seed 团队发布的新一代音视频生成模型,单段视频生成时长提升至 30 秒并支持两次视频延长,延续多模态音视频联合生成架构并强化参考与编辑能力,提供白模控制、绿幕编辑等进阶能力以适配专业视频创作流程,将陆续在即梦 AI、豆包专业版上线,火山方舟 API 也将接入。
Capability Timeline
音频生成
AI 生成音效、环境声或配乐等音频内容的能力
相关工具
20Wan3.0(万相3.0)是阿里云推出的视频生成模型,目前处于公开测试阶段,主打“简单输入、智能创作”。它支持原生30秒长度的视频生成与真实感级别渲染,并通过 Omni-Reference 能力在文本、图像、音频、视频之外,进一步接受文档、表格、幻灯片、网页等参考输入来驱动视频创作。
MiniMax H3 是 MiniMax 发布的通用全模态生成模型,可对文本、图像、视频、声音组成的多模态上下文进行统一理解,并输出具备原生双声道音视频,最高支持 15 秒 2K 分辨率。模型通过 /v2/video_generation 接口以多模态 content[] 结构调用,支持 t2va 文生视频、i2va 图生视频、首尾帧生视频及多模态参考四种模式。MiniMax 宣布将在未来数日内依法开放模型权重。
FLUX 3 是 Black Forest Labs 发布的多模态基础模型,基于 Self-Flow 方法在单一架构中联合学习图像、视频与音频,同一组权重即可输出图像、视频、带原生音频的视频以及机器人动作预测。FLUX 3 Video 可单次生成长达 20 秒、带原生音频的视频。模型提供 API、Playground 在线试用与开放权重部署,支持按需付费与商业授权,面向内容创作与物理 AI 场景。
Grok Imagine 是 SpaceXAI(xAI)推出的 AI 图像与视频生成工具,作为 Grok 套件的创意子产品独立于 grok.com/imagine 提供。用户可使用其生成或编辑图像、将图像动画化为视频,并可借助 Imagine Agent Mode 快速迭代创意流程;2026-07-31 上线的模板大更新带来了现成预设以及照片编辑、风格重绘、智能调整尺寸、背景移除、头像制作、表情符号生成器、周边产品制作器等大量新创意工具,面向内容创作者与营销人员。
Runway 是基于自研 Real-World Intelligence 模型构建的云端 AI 创意平台,在同一工作区内提供视频、图像与音频的生成和编辑能力,聚合 Gen-4.5、Seedance、Nano Banana Pro、Lyria 3、Text to Speech 等大量模型。支持改光影、换风格、增删画面元素等指令式视频编辑,并可搭建节点式自定义 Workflows 串联多模型、多模态与中间步骤,面向个人与各规模团队。
Adobe Firefly 是 Adobe 的一站式 AI 创意工作室,可通过文本提示生成并编辑图像、视频、音频与矢量图,并集成 Google、ElevenLabs、Kling AI、Luma AI、OpenAI、Runway 等第三方模型。2026年8月音频工具全面开放:生成免版税音乐、配音、场景音效,输出可商业使用;AI Assistant 提供每日免费生成并新增支持多模态输入的 Gemini Omni Flash 模型。
ComfyUI是一款面向视觉专业人员的AI创作引擎,通过强大的模块化节点图界面,让用户无需编写代码即可实验和创建复杂的Stable Diffusion工作流。它原生支持SDXL、Flux、Qwen Image等多种图像模型,可生成图像、视频、3D模型和音频等内容。ComfyUI支持Omnigen 2、Flux Kontext等图像编辑模型,具备Inpainting、ControlNet、Upscale Models等功能,可对图片进行局部修改、扩图和超分辨率放大等操作。其智能内存管理可在低至1GB显存的GPU上自动运行大模型,并提供异步队列系统仅重新执行工作流中变化的部分。ComfyUI可在Windows、Linux和macOS上本地运行,也提供官方云端版本,并能通过API端点无缝集成到生产流程中
CosyVoice 是基于通义自研 Qwen-Audio 音频大模型的 AI 语音平台,包含语音记录 CosyFlow、音频创作 CosyCreative 与语音智能体 CosyAgent。CosyFlow 提供实时高质量语音转文本、自动过滤口语填充词、方言识别与口述成稿;CosyCreative 支持从想法生成播客与有声书、音色复刻、多角色多语言配音及多轨音频编辑。
Luma Agents 是 Luma AI 推出的创意工作智能体,可围绕视频、图像、音频和文本进行研究、生成与精修,并在整个过程中保持品牌一致性。由 Uni-1 品牌智能模型和 Ray 3.2 视频模型驱动,支持像导演拍摄一样控制每一帧、跨镜头保持连续性,并可从任意图像中提取图层,替换产品、重设背景风格、重写标题,改一个元素而保留其余内容。
MAGI-2-preview 是 Sand.ai 开源的音视频统一生成模型,总参数 114B,每个 token 仅激活约 6B 参数,基于自研 MagiMoE 架构并在模型结构、训练系统与数据三方面协同设计,探索视频生成的高效 Scaling 路径。它可直接生成带声音的视频内容,支持对白、歌唱与情绪变化,并让口型、表情、眼神与肢体动作自然配合,代码与权重在 GitHub 与 Hugging Face 公开。
MiniMax Design 是稀宇科技推出的新一代 AI 原生创作平台(Harness),以 Agent 全流程协助创作,串联文本、图像与音视频模型,把多模态模型能力变成真实可用生产力。主 Agent 理解创意目标后自动拆解任务并调用多个专属智能体并行执行,画布节点自动连线,支持升级、编辑与导出,并可通过专属 Skill 与专业插件沉淀经验。适用于短剧、电商批量出图出视频、品牌 TVC 与投放素材等商业内容制作场景。
minimax-h3-mlx 是 PipeNetwork 开源的 Python 项目,把 MiniMax-H3 全模态生成模型从零重写为 MLX 实现,使 33B 视频+音频联合扩散管线可在 Apple Silicon 设备本地运行。项目包含 33B 扩散 Transformer、Qwen3-VL-32B 冻结条件编码器以及视频与音频两套 VAE,可同步生成带立体声音轨的视频片段,并通过 AdaLN 预计算在推理时减少 13B 参数。
Google 旗下 AI 笔记与研究工具 NotebookLM 更名为 Gemini Notebook,为每个笔记本配备安全云端计算机,可原生编写并执行代码完成基于数据源的复杂数据分析,内置超过100项软件技能,升级至 Gemini 3.5,增强长文档分析、网络研究和多步骤推理能力。
Qwen-MM-Plugins 是通义千问推出的原生多模态插件集合,把图像、视频、文档与 3D 模型的读取理解、OCR、目标定位、分割、语音识别、视觉对话与联网搜索打包为 skill 加 MCP 服务器,并提供长视频图记忆、视频剪辑与图像/视频/音频生成、Blender 三维建模、FreeCAD 参数化 CAD 及教学讲解视频生成等能力,可安装到 Claude Code、Codex、Qwen Code、Gemini CLI 等智能体框架。
Runware 是 AI 推理服务平台,通过单一 API 端点调用 40 万以上图像、视频、音频、3D 与大语言模型,切换模型只需修改字符串。平台自建 Sonic Inference Engine 硬件与推理引擎,请求经路由、优化后执行,支持按秒计费的 GPU 算力,并可通过 MCP 客户端接入 Claude Code、Cursor 等开发环境。
可灵AI是快手推出的AI创意生产力平台,提供视频生成、图像生成、AI音效、创意特效等一站式生成能力。视频3.0系列模型原生支持多模态指令深度解析与跨任务融合,实现视觉主体与听觉音色的双重绑定,带来高自由度高一致性的创作体验。支持通过开放API接入第三方应用与无代码平台,开发者可批量生成视觉素材,并可通过Agent Market获取一键换装、商品成片等开箱即用Agent。
音潮是以自研音乐大模型为核心的全自研AI音乐创作平台,提供歌曲生成、歌词生成、歌曲仿写与扩写等能力。V4.0升级大幅提升指令理解与情绪语义解读,实现全球十种主流语种创作全覆盖,并向C端开放纯音乐生成。同步推出音潮API Platform,面向企业、开发者提供按次计费的标准化音乐生成接口,兼容中台与AI Agent自动化音乐生产。
HelixWorld 1.0是Noiz AI联合港科大、清华、CMU、Google DeepMind等机构发布的实时可交互音视频世界模型。输入一张图片和提示词即可持续生成可漫游的3D世界,用户前进、转身时画面与空间声场同步更新。它以音视频生成基座LTX2.3为起点,将视觉与音频放入同一套原生Transformer联合生成,支持24 FPS实时画面与48kHz双声道音频输出,声场跟随视角转动。模型权重、推理代码与技术报告将在未来几周完全开源(Apache 2.0),API目前处于内测阶段。
VoxCPM 是 OpenBMB(面壁智能)开源的无分词器语音合成模型,支持 30 种语言直接输入文本合成语音,可仅凭自然语言描述设计全新音色,也能用一段短参考音频克隆音色并控制情绪、语速与风格;原生输出 48kHz 高质量音频,并支持实时流式推理,权重与代码以 Apache 2.0 许可发布,允许商用。






