SenseNova-Vision是一款将计算机视觉统一为多模态生成的开源模型。该工具通过自然语言指令和可选视觉提示来定义任务与输出格式,以原生文本、图像或混合形式响应,可完成目标检测、图像分割、深度预测、表面法线估计、OCR识别、关键点检测、推理分割、交互式分割及多视角3D重建等任务。模型无需任务专用预测头或架构分支,通过统一的多模态生成空间同时覆盖结构化视觉理解、密集几何预测与多视角视觉几何,并提供可解析输出以适配标准评测基准
目标检测图像编辑图像分割关键点检测
近7天 0 动态448 Stars
