功能图谱

Capability Timeline

图像理解

识别、描述和分析用户上传图片中的文字、对象、结构与视觉信息。

34 个工具49 条动态

相关工具

34

专为问题解决者打造的高级 AI 协作助手,高效赋能复杂工作流、深度代码开发与数据处理

Claude 是由 Anthropic 开发的 AI 助手,专为应对复杂挑战与高效工作协同而设计。它能够协助开发者完成代码编写、调试与逻辑优化,并提供深度的数据分析与可视化图表生成服务。用户可通过自然语言直接下达指令、上传复杂文档进行智能解析,或连接外部数据源。Claude 支持设定每日、每周或每月定时任务,自动产出格式化的报告、演示文稿或电子表格,实现从问题拆解到自动化交付的全流程协同

代码生成对话助手联网搜索屏幕演示数据分析
近7天 3 动态

首款可在手机运行的27B级开源多模态模型

Bonsai 27B 是 PrismML 发布的开源多模态模型,基于 Qwen3.6 27B。提供三元(5.9GB)和1-bit(3.9GB)两个变体,后者首次将27B级模型装入 iPhone 17 Pro。支持多步推理、结构化工具调用、视觉任务和智能体循环,262K上下文窗口,支持推测解码。三元变体保留全精度95%性能,1-bit保留90%,数学与编码能力几乎无损。Apache 2.0开源。

代码生成工具协议集成图像理解文件分析长文本处理
近7天 2 动态

专为智能体开发与复杂编程打造的高性能多模态AI模型,兼顾极速响应与深度推理能力

Gemini 3.5 Flash 是一款面向智能体与编程领域的前沿多模态AI模型。它能够在极速响应下提供媲美旗舰模型的智能水平,支持文本、音频、图像、代码和视频的深度融合理解。该模型擅长长周期任务的自主推理与多智能体协同调度,可在编码迭代中快速生成并优化界面,同时具备针对提示注入等网络威胁的主动拦截能力。凭借百万级长上下文支持与企业级安全标准,它为开发者构建高效自动化工作流提供核心支持

安全检测代码审查代码生成数据分析图像理解
近7天 2 动态

谷歌高效编码与多模态理解的主力模型,更省token更快更智能

Gemini 3.6 Flash 是 Google DeepMind 推出的高效主力模型,面向编码、知识工作与多模态任务,相比 3.5 Flash 输出 token 用量降低约 17%。模型支持跨文本、音频、图像、代码与视频的多模态理解,具备长周期深度推理与迭代编码能力,可通过多智能体编排执行代码迁移、财务数据分析等复杂任务,并已上线 Google AI Studio 与 Gemini API。

代码生成数据分析图像理解文件分析智能体
近7天 2 动态

苹果全平台 AI 系统,集成 Siri、图像生成与隐私保护

Apple Intelligence 是苹果全平台 AI 系统,深度集成于 iOS、iPadOS、macOS 和 visionOS。提供 Genmoji 表情生成、Siri 智能助手、图像理解与描述、HomeKit 视频摘要、无障碍辅助、Workout Buddy 运动指导等能力。采用设备端处理与 Private Cloud Compute 保护隐私,通过 Foundation Models 框架向第三方应用开放 AI 能力。

对话助手图像理解图像生成文件分析隐私防护
近7天 1 动态

面向高难度知识工作与编程任务的第五代智能模型,支持长周期自主规划与深度推理

Claude Fable 5是专为解决复杂编程与高难度知识工作打造的第五代人工智能模型。它能够处理持续数天的长周期异步任务,自动进行多阶段规划与自我验证。该模型支持深度解析文件与PDF中的图表及表格内容,可自主编写测试代码并校验输出结果,适用于金融、法律、数据分析及架构设计等领域的重度文档处理场景,团队可交付大型项目并直接审核最终成果

代码审查代码生成对话助手深度研究图像理解
近7天 1 动态

为 AI 代理提供设计参考引擎,搜索近万真实网站的设计灵感

Fudge MCP 是一款面向 AI 编码代理的设计参考引擎。它收录近 10,000 个真实生产网站的截图,支持按字体、颜色、组件、布局、页面类型和视觉相似度进行搜索。Fudge MCP 通过 MCP 在本地运行,搭配 Chrome 扩展保存和管理设计参考,帮助编码代理获取具体设计依据而非模糊形容词,从而生成更高质量的用户界面。

图像理解UI 生成
近7天 1 动态
GO

Google 搜索中的视觉搜索与图像生成功能

Google Images 是 Google 搜索引擎中的视觉搜索功能模块,提供从网络搜索图片、以图搜图、Google Lens 实时识别等功能。25周年更新中推出可浏览图片主页,展示动态沉浸式图片画廊并按用户兴趣智能定制;同时将图像生成直接引入 AI Overviews,基于 Nano Banana 模型将文本提示词转化为高质量定制图像。

联网搜索图像理解图像生成
近7天 1 动态

面壁智能开源的机器人端侧具身智能模型系列

MiniCPM-Robot 是面壁智能(OpenBMB)面向真实世界感知、决策与行动的开源具身智能模型系列。首批包含 1.5B 通用机器人操作 VLA 模型 MiniCPM-RobotManip,一套权重覆盖下游任务并支持流式上下文记忆;以及 0.9B 纯端侧具身目标跟踪方案 MiniCPM-RobotTrack,覆盖静态、动态与对抗目标。配套 PhyAI 推理框架在 NVIDIA H20 上将推理帧率从 10 Hz 提升至 37 Hz。

机器人操作具身导航目标跟踪图像理解
近7天 1 动态188 Stars

MiniMax 旗舰大模型,1M上下文、前沿编码与智能体能力

MiniMax M3 是 MiniMax 自研的前沿大语言模型,采用全新注意力架构 MSA(MiniMax Sparse Attention),支持最高 1M tokens 上下文窗口。模型具备编码、智能体、多模态理解等能力,可自主完成论文复现、CUDA 算子优化等长线程任务。M3 已在 HuggingFace 和 GitHub 开源,支持私有集群部署和微调,同时通过 API、Token Plan 订阅和 MiniMax Code 平台向开发者开放。

代码生成图像理解文件分析长文本处理智能体
近7天 1 动态
NA

在 Mac 上本地运行开放模型的免费开源桌面应用

Nativ 是一款 macOS 桌面应用,基于 MLX-VLM 针对 Apple Silicon(M1+)优化,让用户无需账户、订阅或云端即可在本地运行 Google、Cohere、Liquid AI 等开放模型。应用支持语言、视觉、视频、代码、音频等多模态交互,提供实时 tokens/秒、内存压力、首 token 延迟等性能指标,并内置本地端点,可对接 Codex、Claude Code、OpenCode 等编码智能体。项目以 MIT 许可完全开源。

代码补全对话助手视频处理图像理解语音合成
近7天 1 动态

英伟达开源物理AI世界基础模型平台

NVIDIA Cosmos 是一个开源的物理 AI 基础世界模型平台,包含 Cosmos 3 基础版及 Cosmos 3 Edge 等模型。它可作为视觉语言模型对复杂真实场景中的物体、交互和意图进行推理,支持质量检测、公共安全、交通监控、物流和自动驾驶等实时告警与密集描述。同时可加速机器人策略学习,作为世界动作模型骨干适配特定任务和领域行为;还可作为可控的物理世界模拟器预测多种方案并闭环评估结果;并支持从文本、图像、视频、环境声音和动作输入生成无限合理的合成视频数据,用于训练物理 AI。

具身导航模型训练学习目标检测世界模型视频生成
近7天 1 动态
NV

NVIDIA 的实时流分析工具包,用于 GPU 加速的视频与图像智能处理

NVIDIA DeepStream SDK 是一个基于 GStreamer 的开源实时流分析工具包,专为 AI 驱动的多传感器处理、视频、音频和图像理解而设计。它提供硬件加速解码/编码、TensorRT 推理、目标追踪和消息代理集成,支持 dGPU 和 Jetson 边缘设备部署。开发者可通过 Agent 技能用自然语言自动生成多摄像头视频分析管道,大幅缩短开发周期。

视频处理图像理解智能体自动化工作流
近7天 1 动态

基于互联网视频预训练的目标条件强化学习模型

Pantograph 推出的首个目标条件强化学习模型,通过互联网规模视频预训练学习目标导向行为。Pan-4B 拥有40亿参数,在约50万小时 Minecraft 视频上预训练,再经约2000小时承包商轨迹后训练。模型能根据目标图像指令在 Minecraft 中战斗、探索、建造和完成平台跳跃任务,并可泛化到未见过的环境。

强化学习训练世界模型图像理解游戏AI角色
近7天 1 动态

B站开源AI数字生命计划,主动式全模态AI伙伴驱动器

Project N.E.K.O.(猫娘计划)是哔哩哔哩在WAIC 2026展示的开源AI数字生命生态计划,核心产品为主动式、原生全模态AI伙伴驱动器N.E.K.O.。支持Live2D与VRM双引擎,用户可自由导入二次元角色、原创角色和虚拟主播模型;内置视觉多模态大模型可理解电脑屏幕内容并主动发起对话。采用前端UI、AgentAI大脑、Memory记忆系统分离式架构,核心数据可完全保留在本地。已在Steam上架抢鲜体验,GitHub Star数突破2K。

对话助手图像理解智能体AI记忆
近7天 1 动态

苹果AI驱动的智能助手,深度集成于全平台操作系统

Siri是苹果的智能语音助手,在iOS 27中升级为AI驱动的新版本。它能访问用户设备上的邮件、照片和信息,感知屏幕内容,回答世界知识问题,并集成Spotlight搜索。新版Siri基于Apple Intelligence的Foundation Models在设备端运行,结合Private Cloud Compute保障隐私数据不被存储,支持iPhone、iPad、Mac、Apple Watch、AirPods、Apple TV和Vision Pro等全平台,并首次提供独立应用入口。

对话助手图像理解图像生成文件分析隐私防护
近7天 1 动态

阿里千问全模态模型订阅套餐,一个 Key 畅用编程与智能体工具

Token Plan 是阿里千问 AI 平台推出的模型订阅套餐,提供个人版与团队版,用户在统一订阅体系下通过一个 API Key 调用文本、语音、图像等全模态模型能力,抢先体验 Qwen3.8-Max-Preview 等先进模型。套餐按 Credits 计量,兼容 OpenAI / Anthropic 协议的主流 Coding 与 Agent 工具,支持联网搜索、知识检索等工具能力,并可同时运行多个 Agent 并发任务。

代码生成联网搜索图像理解语音对话智能体
近7天 1 动态
TU

小鹏开源的高效视觉编码器,低成本训练 SOTA 级 ViT

TuringViT 是小鹏基础模型团队发布的高效视觉 Transformer 编码器,通过 Turing 线性注意力架构、VISTA-Curation 数据治理流水线与原生动态分辨率训练,仅用主流基线 10% 的图文数据即可达到 SOTA 级零样本性能,并在高分辨率输入下显著降低推理延迟。提供 18L 与 24L 两个规格,面向 VLM/VLA 下游场景,支撑智能驾驶、智能座舱与 IRON 人形机器人感知。

模型训练学习图像理解
近7天 1 动态