通义千问(Qwen)是阿里巴巴云开发的大语言模型系列,提供对话助手、代码生成、智能体工具调用、256K至100万token长文本理解、多语言翻译和创意写作等能力。模型涵盖Dense和MoE架构,支持思考与非思考模式切换,可通过Qwen Chat、API及多种推理框架使用。
Capability Timeline
图像编辑
对图片进行局部修改、扩图、风格调整或商品图处理。
相关工具
11Xiaomi-Robotics-U0是小米推出的380亿参数多模态自回归世界基础模型,专为具身智能设计。在单一框架内统一文生图、图像编辑、多视角具身场景生成、具身迁移和具身视频生成五项任务,支持跨多种机器人形态的高质量多视角场景生成,并实现结构化可控的具身迁移编辑,同时保持多视角一致性与交互动态。
Google Flow 是 Google Labs 推出的 AI 创意工作室,基于谷歌先进的生成模型,集成 Veo 3.1 视频生成、Nano Banana 图像生成与编辑以及 Gemini Omni 对话式视频编辑能力,可从任意输入参考创建和编辑视频,并内置智能创意 Agent 陪伴从构思到执行的全流程。目前已上线 iOS TestFlight Beta 版。
Higgsfield AI 是一个 AI 原生创意套件,支持用户通过文本提示或参考图生成图像、视频和语音内容,并可编辑和放大媒体。平台内置 AI 智能体可自动化创意工作流,支持网页和移动端。近期发布了 After Effects MCP/插件,由 Fable 5 驱动,允许用户在 AE 项目内直接调用 Claude,自动构建合成、设置关键帧、编写表达式并运行 ExtendScript 重复工作,所有生成内容均为可编辑的 AE 场景。
PixVerse 是全球 AI 视频生成平台,提供文生视频、图生视频、视频编辑、口型同步、音频生成等能力。旗舰模型 V6 支持电影级镜头控制与角色表演。2026 年 1 月发布 R1 实时世界模型,将视频转变为可交互的连续流,并推出 PixVerse Game Engine 将实时世界模型应用于游戏创作,玩家可用自然语言交互,世界实时响应。平台还提供 API、智能体、营销中心、画布等企业级工作流工具。
Qwen-Image 是阿里通义千问团队推出的 20B MMDiT 图像基础模型,在复杂文字渲染与精准图像编辑上表现突出,支持中英文高保真文字生成、多行排版和段落级语义,覆盖图像生成与编辑任务,多项公开基准领先,可通过 Qwen Chat 和开源权重使用。最新 Qwen-Image-3.0 支持最长 4500 token 提示词,单次生成可读十像素文字、数学公式及十二种语言的复杂排版与信息图网格。
ComfyUI是一款面向视觉专业人员的AI创作引擎,通过强大的模块化节点图界面,让用户无需编写代码即可实验和创建复杂的Stable Diffusion工作流。它原生支持SDXL、Flux、Qwen Image等多种图像模型,可生成图像、视频、3D模型和音频等内容。ComfyUI支持Omnigen 2、Flux Kontext等图像编辑模型,具备Inpainting、ControlNet、Upscale Models等功能,可对图片进行局部修改、扩图和超分辨率放大等操作。其智能内存管理可在低至1GB显存的GPU上自动运行大模型,并提供异步队列系统仅重新执行工作流中变化的部分。ComfyUI可在Windows、Linux和macOS上本地运行,也提供官方云端版本,并能通过API端点无缝集成到生产流程中
Lance 是字节跳动发布的一款 3B 活跃参数的原生统一多模态模型,在单一框架内同时支持图像与视频的理解、生成和编辑。它能够根据文字生成图片、对图片进行局部修改与风格调整、识别并分析用户上传图片中的视觉信息,还支持文生视频、图生视频、视频编辑与视频理解等任务。模型从零开始训练,采用分阶段多任务策略,仅需最多 128 张 A100 GPU 即可获得有竞争力的性能,适用于程序员集成调用、内容创作素材生成及科研探索等场景
Nano Banana 2 Lite 是一款专注于高速图像生成与编辑的 AI 模型。它能够以极低的延迟快速生成和修改视觉内容,支持大规模低成本批量输出,并在生成过程中精准保持角色一致性。该工具专为创作者、企业和开发者设计,可通过 Google AI Studio 或 API 调用,满足从快速原型迭代到实时应用内容填充的高效工作流需求
Seedream是一款多模型AI图像生成工具,可将文本提示快速转化为高清视觉图像。用户可通过打点画框交互与提示词标记实现精准局部编辑,结合色卡配色与商品换色功能高效制作电商素材。工具支持智能参考控制与接口接入,提供高质量画面重绘与细节增强,满足设计师、电商运营及内容创作者的视觉工作流需求
SenseNova-Vision是一款将计算机视觉统一为多模态生成的开源模型。该工具通过自然语言指令和可选视觉提示来定义任务与输出格式,以原生文本、图像或混合形式响应,可完成目标检测、图像分割、深度预测、表面法线估计、OCR识别、关键点检测、推理分割、交互式分割及多视角3D重建等任务。模型无需任务专用预测头或架构分支,通过统一的多模态生成空间同时覆盖结构化视觉理解、密集几何预测与多视角视觉几何,并提供可解析输出以适配标准评测基准



