功能图谱

Capability Timeline

图像生成

根据文字、参考图或结构生成图片素材。

24 个工具33 条动态

相关工具

24

面向开发者的统一大模型接口,提供多供应商接入、智能路由与边缘加速,实现高效低成本的AI推理调用

OpenRouter是面向开发者的大语言模型统一接口平台。它通过单一API密钥即可接入七十余家供应商的四百多款主流模型,开箱兼容OpenAI SDK。平台提供模型路由与数据策略可视化面板,支持在单一供应商宕机时自动降级切换以保障服务高可用。依托边缘网络部署,OpenRouter在保障极低推理延迟的同时优化调用成本。用户按需购买额度即可灵活使用,无需绑定长期订阅

代码生成对话助手图像生成智能体
近7天 3 动态

小米380亿参数具身智能世界基础模型

Xiaomi-Robotics-U0是小米推出的380亿参数多模态自回归世界基础模型,专为具身智能设计。在单一框架内统一文生图、图像编辑、多视角具身场景生成、具身迁移和具身视频生成五项任务,支持跨多种机器人形态的高质量多视角场景生成,并实现结构化可控的具身迁移编辑,同时保持多视角一致性与交互动态。

具身导航世界模型视频生成图像编辑图像生成
近7天 2 动态

苹果全平台 AI 系统,集成 Siri、图像生成与隐私保护

Apple Intelligence 是苹果全平台 AI 系统,深度集成于 iOS、iPadOS、macOS 和 visionOS。提供 Genmoji 表情生成、Siri 智能助手、图像理解与描述、HomeKit 视频摘要、无障碍辅助、Workout Buddy 运动指导等能力。采用设备端处理与 Private Cloud Compute 保护隐私,通过 Foundation Models 框架向第三方应用开放 AI 能力。

对话助手图像理解图像生成文件分析隐私防护
近7天 1 动态

谷歌出品的快速安全浏览器,内置 Gemini AI 浏览助手与 AI Mode 搜索

Google Chrome 是谷歌推出的网页浏览器,主打快速、安全与个性化体验。浏览器深度集成 Gemini,可直接在当前标签页中理解网页内容、基于打开的标签页和浏览历史完成任务,并通过 auto browse 自动执行购物、预订、研究等繁琐操作。内置 AI Mode 提供强大的 AI 搜索,支持对话式追问与多任务并排视图;还可借助 Nano Banana 图像模型将网页可视化为信息图或编辑网页图片。Skills 功能允许保存并复用常用提示词,跨页面重复调用。

对话助手联网搜索图像生成智能体
近7天 1 动态

谷歌基于 Veo 等生成模型的 AI 视频创作工作室

Google Flow 是 Google Labs 推出的 AI 创意工作室,基于谷歌先进的生成模型,集成 Veo 3.1 视频生成、Nano Banana 图像生成与编辑以及 Gemini Omni 对话式视频编辑能力,可从任意输入参考创建和编辑视频,并内置智能创意 Agent 陪伴从构思到执行的全流程。目前已上线 iOS TestFlight Beta 版。

视频处理视频生成图像编辑图像生成智能体
近7天 1 动态
GO

Google 搜索中的视觉搜索与图像生成功能

Google Images 是 Google 搜索引擎中的视觉搜索功能模块,提供从网络搜索图片、以图搜图、Google Lens 实时识别等功能。25周年更新中推出可浏览图片主页,展示动态沉浸式图片画廊并按用户兴趣智能定制;同时将图像生成直接引入 AI Overviews,基于 Nano Banana 模型将文本提示词转化为高质量定制图像。

联网搜索图像理解图像生成
近7天 1 动态

AI 广告混编工具,从竞品爆款广告生成你的品牌广告

Goose Ads Remixer 是 Gooseworks 推出的 AI 广告创意工具,能分析竞品中表现最好的广告素材,学习其中的钩子、优惠、文案结构和布局模式,然后用品牌的真实 Logo、产品图片和信息快速生成新的图片或视频广告。用户可浏览数百个经过验证的广告模板,上传品牌素材即可在几分钟内获得品牌化的静态或视频广告,无需使用终端。前 10 条广告免费,付费套餐从 $29/月起,信用积分可用于静态广告、视频广告和 100+ 数据 API。

图像生成文案生成
近7天 1 动态

AI 原生创意套件,支持图像/视频/语音生成与 AE 插件集成

Higgsfield AI 是一个 AI 原生创意套件,支持用户通过文本提示或参考图生成图像、视频和语音内容,并可编辑和放大媒体。平台内置 AI 智能体可自动化创意工作流,支持网页和移动端。近期发布了 After Effects MCP/插件,由 Fable 5 驱动,允许用户在 AE 项目内直接调用 Claude,自动构建合成、设置关键帧、编写表达式并运行 ExtendScript 重复工作,所有生成内容均为可编辑的 AE 场景。

视频生成图像编辑图像生成语音合成智能体
近7天 1 动态

阿里通义千问图像生成模型,擅长复杂文字渲染与精准图像编辑

Qwen-Image 是阿里通义千问团队推出的 20B MMDiT 图像基础模型,在复杂文字渲染与精准图像编辑上表现突出,支持中英文高保真文字生成、多行排版和段落级语义,覆盖图像生成与编辑任务,多项公开基准领先,可通过 Qwen Chat 和开源权重使用。最新 Qwen-Image-3.0 支持最长 4500 token 提示词,单次生成可读十像素文字、数学公式及十二种语言的复杂排版与信息图网格。

图像编辑图像生成
近7天 1 动态8,143 Stars

苹果AI驱动的智能助手,深度集成于全平台操作系统

Siri是苹果的智能语音助手,在iOS 27中升级为AI驱动的新版本。它能访问用户设备上的邮件、照片和信息,感知屏幕内容,回答世界知识问题,并集成Spotlight搜索。新版Siri基于Apple Intelligence的Foundation Models在设备端运行,结合Private Cloud Compute保障隐私数据不被存储,支持iPhone、iPad、Mac、Apple Watch、AirPods、Apple TV和Vision Pro等全平台,并首次提供独立应用入口。

对话助手图像理解图像生成文件分析隐私防护
近7天 1 动态

浏览器端 AI 创作工作台,集成视频、图像与音频生成

VideoAny 是一个浏览器端 AI 创作工作室,将视频、图像和音频生成整合在同一工作台中,界面提供巴西葡萄牙语版本。支持文生视频、图生视频、视频转视频、视频换脸、口型同步以及提示词驱动的图像生成与编辑,用户可在同一账户内比较 Seedance、Kling、Sora 等多个模型、选择格式与生成设置并管理生成资产,新账户可先用赠送额度体验。

视频处理视频换脸视频生成图像生成
近7天 1 动态

商汤旗舰图片创作模型,8K原生输出专业设计品质

日日新 SenseNova U1 Pro 是商汤科技发布的旗舰版图片创作模型,通过内生的图文交错思维链创作出内容准确、设计精美、生产可用的图片素材。模型支持最高 8K 原生分辨率输出,强化图文信息整合与细节控制,在极高信息密度下仍能维持版式与内容表达,文字渲染出错率极低,面向印刷、展览级专业交付场景,正式版将同步推出 API 服务。

图像生成
近7天 1 动态

面向视觉专业人员的模块化节点图AI创作引擎,精细控制图像生成与编辑流程

ComfyUI是一款面向视觉专业人员的AI创作引擎,通过强大的模块化节点图界面,让用户无需编写代码即可实验和创建复杂的Stable Diffusion工作流。它原生支持SDXL、Flux、Qwen Image等多种图像模型,可生成图像、视频、3D模型和音频等内容。ComfyUI支持Omnigen 2、Flux Kontext等图像编辑模型,具备Inpainting、ControlNet、Upscale Models等功能,可对图片进行局部修改、扩图和超分辨率放大等操作。其智能内存管理可在低至1GB显存的GPU上自动运行大模型,并提供异步队列系统仅重新执行工作流中变化的部分。ComfyUI可在Windows、Linux和macOS上本地运行,也提供官方云端版本,并能通过API端点无缝集成到生产流程中

图像编辑图像分割图像生成图像增强UI 生成
近7天 0 动态121,693 Stars

字节跳动开源的3B统一多模态模型,支持图像与视频的理解、生成与编辑

Lance 是字节跳动发布的一款 3B 活跃参数的原生统一多模态模型,在单一框架内同时支持图像与视频的理解、生成和编辑。它能够根据文字生成图片、对图片进行局部修改与风格调整、识别并分析用户上传图片中的视觉信息,还支持文生视频、图生视频、视频编辑与视频理解等任务。模型从零开始训练,采用分阶段多任务策略,仅需最多 128 张 A100 GPU 即可获得有竞争力的性能,适用于程序员集成调用、内容创作素材生成及科研探索等场景

图像编辑图像理解图像生成
近7天 0 动态1,282 Stars

通过自然语言调用多智能体的智能体画布,提供创意视觉、视频、3D与原型的一站式设计服务

Miora是一款一站式设计服务平台。该工具作为智能体画布,支持用户通过自然语言描述直接调用多智能体,自动执行并交付复杂的全链路任务。平台内置创意视觉、视频、3D与原型等设计模块,通过自然语言交互驱动智能体协同工作,覆盖多种资产的生成与处理流程

图像生成UI 生成
近7天 0 动态

极速高效图像生成与编辑模型,支持低延迟创作与低成本批量输出

Nano Banana 2 Lite 是一款专注于高速图像生成与编辑的 AI 模型。它能够以极低的延迟快速生成和修改视觉内容,支持大规模低成本批量输出,并在生成过程中精准保持角色一致性。该工具专为创作者、企业和开发者设计,可通过 Google AI Studio 或 API 调用,满足从快速原型迭代到实时应用内容填充的高效工作流需求

图像编辑图像生成
近7天 0 动态

Runway 推出的智能创意 Agent,从一句话到成品视频全流程协作

Runway Agent 是 Runway 推出的智能创意助手,通过对话式交互帮助用户从单一创意出发,完成视频、图像等多模态内容的生成与编辑。支持在单界面内将视频片段、音频和图片整合到时间线,直接产出完整视频。可上传 PDF 分析广告表现数据,自动提出策略建议并生成创意素材。面向营销人员、内容创作者和影视制作团队,提供端到端创意工作流。

对话助手视频处理视频生成图像生成文件分析
近7天 0 动态

多模型AI图像生成工具,支持精准局部重绘与智能参考控制,助力设计与电商高效创作

Seedream是一款多模型AI图像生成工具,可将文本提示快速转化为高清视觉图像。用户可通过打点画框交互与提示词标记实现精准局部编辑,结合色卡配色与商品换色功能高效制作电商素材。工具支持智能参考控制与接口接入,提供高质量画面重绘与细节增强,满足设计师、电商运营及内容创作者的视觉工作流需求

视频生成图像编辑图像生成图像增强
近7天 0 动态