功能图谱

Capability Timeline

目标检测

识别图像中的目标并定位其位置或边界。

3 个工具3 条动态

相关工具

3

英伟达开源物理AI世界基础模型平台

NVIDIA Cosmos 是一个开源的物理 AI 基础世界模型平台,包含 Cosmos 3 基础版及 Cosmos 3 Edge 等模型。它可作为视觉语言模型对复杂真实场景中的物体、交互和意图进行推理,支持质量检测、公共安全、交通监控、物流和自动驾驶等实时告警与密集描述。同时可加速机器人策略学习,作为世界动作模型骨干适配特定任务和领域行为;还可作为可控的物理世界模拟器预测多种方案并闭环评估结果;并支持从文本、图像、视频、环境声音和动作输入生成无限合理的合成视频数据,用于训练物理 AI。

具身导航模型训练学习目标检测世界模型视频生成
近7天 1 动态

统一多模态视觉生成模型,以单一架构覆盖目标检测、分割、深度预测与多视角3D重建等计算机视觉任务

SenseNova-Vision是一款将计算机视觉统一为多模态生成的开源模型。该工具通过自然语言指令和可选视觉提示来定义任务与输出格式,以原生文本、图像或混合形式响应,可完成目标检测、图像分割、深度预测、表面法线估计、OCR识别、关键点检测、推理分割、交互式分割及多视角3D重建等任务。模型无需任务专用预测头或架构分支,通过统一的多模态生成空间同时覆盖结构化视觉理解、密集几何预测与多视角视觉几何,并提供可解析输出以适配标准评测基准

目标检测图像编辑图像分割关键点检测
近7天 0 动态448 Stars