ChatGPT是一款人工智能交互平台,能够根据用户保存的聊天记录提供量身定制的回答。该平台支持创建图像、上传文件以及语音对话,并提供深度研究功能。用户登录后可获得个性化服务,其对话内容可能会被审阅并用于改进模型性能
Capability Timeline
图像生成
根据文字、参考图或结构生成图片素材。
相关工具
24OpenRouter是面向开发者的大语言模型统一接口平台。它通过单一API密钥即可接入七十余家供应商的四百多款主流模型,开箱兼容OpenAI SDK。平台提供模型路由与数据策略可视化面板,支持在单一供应商宕机时自动降级切换以保障服务高可用。依托边缘网络部署,OpenRouter在保障极低推理延迟的同时优化调用成本。用户按需购买额度即可灵活使用,无需绑定长期订阅
通义千问(Qwen)是阿里巴巴云开发的大语言模型系列,提供对话助手、代码生成、智能体工具调用、256K至100万token长文本理解、多语言翻译和创意写作等能力。模型涵盖Dense和MoE架构,支持思考与非思考模式切换,可通过Qwen Chat、API及多种推理框架使用。
Xiaomi-Robotics-U0是小米推出的380亿参数多模态自回归世界基础模型,专为具身智能设计。在单一框架内统一文生图、图像编辑、多视角具身场景生成、具身迁移和具身视频生成五项任务,支持跨多种机器人形态的高质量多视角场景生成,并实现结构化可控的具身迁移编辑,同时保持多视角一致性与交互动态。
Apple Intelligence 是苹果全平台 AI 系统,深度集成于 iOS、iPadOS、macOS 和 visionOS。提供 Genmoji 表情生成、Siri 智能助手、图像理解与描述、HomeKit 视频摘要、无障碍辅助、Workout Buddy 运动指导等能力。采用设备端处理与 Private Cloud Compute 保护隐私,通过 Foundation Models 框架向第三方应用开放 AI 能力。
DeepFake(deepfakeai.pro)是一个在线一体化 AI 创作工作室,将 AI 换脸视频、图片生成、图生视频/文生视频、对口型、AI 头像与 AI 音乐生成整合在同一工作流中,并强调基于同意的合规创作与安全控制,适合内容创作者快速完成从参考图到视频、图像、音频的完整创意项目。
Google Chrome 是谷歌推出的网页浏览器,主打快速、安全与个性化体验。浏览器深度集成 Gemini,可直接在当前标签页中理解网页内容、基于打开的标签页和浏览历史完成任务,并通过 auto browse 自动执行购物、预订、研究等繁琐操作。内置 AI Mode 提供强大的 AI 搜索,支持对话式追问与多任务并排视图;还可借助 Nano Banana 图像模型将网页可视化为信息图或编辑网页图片。Skills 功能允许保存并复用常用提示词,跨页面重复调用。
Google Flow 是 Google Labs 推出的 AI 创意工作室,基于谷歌先进的生成模型,集成 Veo 3.1 视频生成、Nano Banana 图像生成与编辑以及 Gemini Omni 对话式视频编辑能力,可从任意输入参考创建和编辑视频,并内置智能创意 Agent 陪伴从构思到执行的全流程。目前已上线 iOS TestFlight Beta 版。
Google 搜索中的视觉搜索与图像生成功能
Google Images 是 Google 搜索引擎中的视觉搜索功能模块,提供从网络搜索图片、以图搜图、Google Lens 实时识别等功能。25周年更新中推出可浏览图片主页,展示动态沉浸式图片画廊并按用户兴趣智能定制;同时将图像生成直接引入 AI Overviews,基于 Nano Banana 模型将文本提示词转化为高质量定制图像。
Goose Ads Remixer 是 Gooseworks 推出的 AI 广告创意工具,能分析竞品中表现最好的广告素材,学习其中的钩子、优惠、文案结构和布局模式,然后用品牌的真实 Logo、产品图片和信息快速生成新的图片或视频广告。用户可浏览数百个经过验证的广告模板,上传品牌素材即可在几分钟内获得品牌化的静态或视频广告,无需使用终端。前 10 条广告免费,付费套餐从 $29/月起,信用积分可用于静态广告、视频广告和 100+ 数据 API。
Grok 是由 xAI 构建的 AI 助手,支持聊天对话、图像创建、代码编写,并能从网络和 X 平台获取实时信息回答用户问题。订阅用户可通过 Grok Heavy 等套餐获得 X Premium+ 等增值权益。
Higgsfield AI 是一个 AI 原生创意套件,支持用户通过文本提示或参考图生成图像、视频和语音内容,并可编辑和放大媒体。平台内置 AI 智能体可自动化创意工作流,支持网页和移动端。近期发布了 After Effects MCP/插件,由 Fable 5 驱动,允许用户在 AE 项目内直接调用 Claude,自动构建合成、设置关键帧、编写表达式并运行 ExtendScript 重复工作,所有生成内容均为可编辑的 AE 场景。
Qwen-Image 是阿里通义千问团队推出的 20B MMDiT 图像基础模型,在复杂文字渲染与精准图像编辑上表现突出,支持中英文高保真文字生成、多行排版和段落级语义,覆盖图像生成与编辑任务,多项公开基准领先,可通过 Qwen Chat 和开源权重使用。最新 Qwen-Image-3.0 支持最长 4500 token 提示词,单次生成可读十像素文字、数学公式及十二种语言的复杂排版与信息图网格。
Siri是苹果的智能语音助手,在iOS 27中升级为AI驱动的新版本。它能访问用户设备上的邮件、照片和信息,感知屏幕内容,回答世界知识问题,并集成Spotlight搜索。新版Siri基于Apple Intelligence的Foundation Models在设备端运行,结合Private Cloud Compute保障隐私数据不被存储,支持iPhone、iPad、Mac、Apple Watch、AirPods、Apple TV和Vision Pro等全平台,并首次提供独立应用入口。
VideoAny 是一个浏览器端 AI 创作工作室,将视频、图像和音频生成整合在同一工作台中,界面提供巴西葡萄牙语版本。支持文生视频、图生视频、视频转视频、视频换脸、口型同步以及提示词驱动的图像生成与编辑,用户可在同一账户内比较 Seedance、Kling、Sora 等多个模型、选择格式与生成设置并管理生成资产,新账户可先用赠送额度体验。
日日新 SenseNova U1 Pro 是商汤科技发布的旗舰版图片创作模型,通过内生的图文交错思维链创作出内容准确、设计精美、生产可用的图片素材。模型支持最高 8K 原生分辨率输出,强化图文信息整合与细节控制,在极高信息密度下仍能维持版式与内容表达,文字渲染出错率极低,面向印刷、展览级专业交付场景,正式版将同步推出 API 服务。
阿里云百炼是全链路大模型服务平台,提供百余款千问系列及第三方大模型即开即用,内置Agent工具链支持MCP托管与智能体搭建,支持Vibe Coding编程开发、图像生成、视觉理解、视频生成等多元AI能力,覆盖从模型调用到应用部署的一站式AI落地流程。
ComfyUI是一款面向视觉专业人员的AI创作引擎,通过强大的模块化节点图界面,让用户无需编写代码即可实验和创建复杂的Stable Diffusion工作流。它原生支持SDXL、Flux、Qwen Image等多种图像模型,可生成图像、视频、3D模型和音频等内容。ComfyUI支持Omnigen 2、Flux Kontext等图像编辑模型,具备Inpainting、ControlNet、Upscale Models等功能,可对图片进行局部修改、扩图和超分辨率放大等操作。其智能内存管理可在低至1GB显存的GPU上自动运行大模型,并提供异步队列系统仅重新执行工作流中变化的部分。ComfyUI可在Windows、Linux和macOS上本地运行,也提供官方云端版本,并能通过API端点无缝集成到生产流程中
Lance 是字节跳动发布的一款 3B 活跃参数的原生统一多模态模型,在单一框架内同时支持图像与视频的理解、生成和编辑。它能够根据文字生成图片、对图片进行局部修改与风格调整、识别并分析用户上传图片中的视觉信息,还支持文生视频、图生视频、视频编辑与视频理解等任务。模型从零开始训练,采用分阶段多任务策略,仅需最多 128 张 A100 GPU 即可获得有竞争力的性能,适用于程序员集成调用、内容创作素材生成及科研探索等场景
Miora是一款一站式设计服务平台。该工具作为智能体画布,支持用户通过自然语言描述直接调用多智能体,自动执行并交付复杂的全链路任务。平台内置创意视觉、视频、3D与原型等设计模块,通过自然语言交互驱动智能体协同工作,覆盖多种资产的生成与处理流程
Nano Banana 2 Lite 是一款专注于高速图像生成与编辑的 AI 模型。它能够以极低的延迟快速生成和修改视觉内容,支持大规模低成本批量输出,并在生成过程中精准保持角色一致性。该工具专为创作者、企业和开发者设计,可通过 Google AI Studio 或 API 调用,满足从快速原型迭代到实时应用内容填充的高效工作流需求
Roblox 是一个全球性的3D虚拟世界平台,让用户可以创建、分享和体验由社区生成的沉浸式3D游戏与虚拟世界。平台近期推出AI驱动的Build功能,用户可通过文本提示生成包含游戏机制、环境、角色、视觉风格和音效的完整游戏,并支持移动端创作、编辑和分享。
Runway Agent 是 Runway 推出的智能创意助手,通过对话式交互帮助用户从单一创意出发,完成视频、图像等多模态内容的生成与编辑。支持在单界面内将视频片段、音频和图片整合到时间线,直接产出完整视频。可上传 PDF 分析广告表现数据,自动提出策略建议并生成创意素材。面向营销人员、内容创作者和影视制作团队,提供端到端创意工作流。
Seedream是一款多模型AI图像生成工具,可将文本提示快速转化为高清视觉图像。用户可通过打点画框交互与提示词标记实现精准局部编辑,结合色卡配色与商品换色功能高效制作电商素材。工具支持智能参考控制与接口接入,提供高质量画面重绘与细节增强,满足设计师、电商运营及内容创作者的视觉工作流需求




