功能图谱

Capability Timeline

图像编辑

对图片进行局部修改、扩图、风格调整或商品图处理。

11 个工具11 条动态

相关工具

11

小米380亿参数具身智能世界基础模型

Xiaomi-Robotics-U0是小米推出的380亿参数多模态自回归世界基础模型,专为具身智能设计。在单一框架内统一文生图、图像编辑、多视角具身场景生成、具身迁移和具身视频生成五项任务,支持跨多种机器人形态的高质量多视角场景生成,并实现结构化可控的具身迁移编辑,同时保持多视角一致性与交互动态。

具身导航世界模型视频生成图像编辑图像生成
近7天 2 动态

谷歌基于 Veo 等生成模型的 AI 视频创作工作室

Google Flow 是 Google Labs 推出的 AI 创意工作室,基于谷歌先进的生成模型,集成 Veo 3.1 视频生成、Nano Banana 图像生成与编辑以及 Gemini Omni 对话式视频编辑能力,可从任意输入参考创建和编辑视频,并内置智能创意 Agent 陪伴从构思到执行的全流程。目前已上线 iOS TestFlight Beta 版。

视频处理视频生成图像编辑图像生成智能体
近7天 1 动态

AI 原生创意套件,支持图像/视频/语音生成与 AE 插件集成

Higgsfield AI 是一个 AI 原生创意套件,支持用户通过文本提示或参考图生成图像、视频和语音内容,并可编辑和放大媒体。平台内置 AI 智能体可自动化创意工作流,支持网页和移动端。近期发布了 After Effects MCP/插件,由 Fable 5 驱动,允许用户在 AE 项目内直接调用 Claude,自动构建合成、设置关键帧、编写表达式并运行 ExtendScript 重复工作,所有生成内容均为可编辑的 AE 场景。

视频生成图像编辑图像生成语音合成智能体
近7天 1 动态

全球 AI 视频生成平台,提供实时世界模型与游戏引擎

PixVerse 是全球 AI 视频生成平台,提供文生视频、图生视频、视频编辑、口型同步、音频生成等能力。旗舰模型 V6 支持电影级镜头控制与角色表演。2026 年 1 月发布 R1 实时世界模型,将视频转变为可交互的连续流,并推出 PixVerse Game Engine 将实时世界模型应用于游戏创作,玩家可用自然语言交互,世界实时响应。平台还提供 API、智能体、营销中心、画布等企业级工作流工具。

世界模型视频处理视频生成图像编辑音乐生成
近7天 1 动态

阿里通义千问图像生成模型,擅长复杂文字渲染与精准图像编辑

Qwen-Image 是阿里通义千问团队推出的 20B MMDiT 图像基础模型,在复杂文字渲染与精准图像编辑上表现突出,支持中英文高保真文字生成、多行排版和段落级语义,覆盖图像生成与编辑任务,多项公开基准领先,可通过 Qwen Chat 和开源权重使用。最新 Qwen-Image-3.0 支持最长 4500 token 提示词,单次生成可读十像素文字、数学公式及十二种语言的复杂排版与信息图网格。

图像编辑图像生成
近7天 1 动态8,143 Stars

面向视觉专业人员的模块化节点图AI创作引擎,精细控制图像生成与编辑流程

ComfyUI是一款面向视觉专业人员的AI创作引擎,通过强大的模块化节点图界面,让用户无需编写代码即可实验和创建复杂的Stable Diffusion工作流。它原生支持SDXL、Flux、Qwen Image等多种图像模型,可生成图像、视频、3D模型和音频等内容。ComfyUI支持Omnigen 2、Flux Kontext等图像编辑模型,具备Inpainting、ControlNet、Upscale Models等功能,可对图片进行局部修改、扩图和超分辨率放大等操作。其智能内存管理可在低至1GB显存的GPU上自动运行大模型,并提供异步队列系统仅重新执行工作流中变化的部分。ComfyUI可在Windows、Linux和macOS上本地运行,也提供官方云端版本,并能通过API端点无缝集成到生产流程中

图像编辑图像分割图像生成图像增强UI 生成
近7天 0 动态121,693 Stars

字节跳动开源的3B统一多模态模型,支持图像与视频的理解、生成与编辑

Lance 是字节跳动发布的一款 3B 活跃参数的原生统一多模态模型,在单一框架内同时支持图像与视频的理解、生成和编辑。它能够根据文字生成图片、对图片进行局部修改与风格调整、识别并分析用户上传图片中的视觉信息,还支持文生视频、图生视频、视频编辑与视频理解等任务。模型从零开始训练,采用分阶段多任务策略,仅需最多 128 张 A100 GPU 即可获得有竞争力的性能,适用于程序员集成调用、内容创作素材生成及科研探索等场景

图像编辑图像理解图像生成
近7天 0 动态1,282 Stars

极速高效图像生成与编辑模型,支持低延迟创作与低成本批量输出

Nano Banana 2 Lite 是一款专注于高速图像生成与编辑的 AI 模型。它能够以极低的延迟快速生成和修改视觉内容,支持大规模低成本批量输出,并在生成过程中精准保持角色一致性。该工具专为创作者、企业和开发者设计,可通过 Google AI Studio 或 API 调用,满足从快速原型迭代到实时应用内容填充的高效工作流需求

图像编辑图像生成
近7天 0 动态

多模型AI图像生成工具,支持精准局部重绘与智能参考控制,助力设计与电商高效创作

Seedream是一款多模型AI图像生成工具,可将文本提示快速转化为高清视觉图像。用户可通过打点画框交互与提示词标记实现精准局部编辑,结合色卡配色与商品换色功能高效制作电商素材。工具支持智能参考控制与接口接入,提供高质量画面重绘与细节增强,满足设计师、电商运营及内容创作者的视觉工作流需求

视频生成图像编辑图像生成图像增强
近7天 0 动态

统一多模态视觉生成模型,以单一架构覆盖目标检测、分割、深度预测与多视角3D重建等计算机视觉任务

SenseNova-Vision是一款将计算机视觉统一为多模态生成的开源模型。该工具通过自然语言指令和可选视觉提示来定义任务与输出格式,以原生文本、图像或混合形式响应,可完成目标检测、图像分割、深度预测、表面法线估计、OCR识别、关键点检测、推理分割、交互式分割及多视角3D重建等任务。模型无需任务专用预测头或架构分支,通过统一的多模态生成空间同时覆盖结构化视觉理解、密集几何预测与多视角视觉几何,并提供可解析输出以适配标准评测基准

目标检测图像编辑图像分割关键点检测
近7天 0 动态448 Stars