功能图谱

Capability Timeline

视频理解

对已有视频内容进行分析、识别与问答,输出对画面与情节的理解结果

16 个工具164 条动态

相关工具

16

开源智能体工作流网关与路由器,统一托管、BYOK与本地模型访问。

Experiential 是一个面向智能体工作流的开源网关与路由器,通过一个 OpenAI 兼容 API 统一托管、BYOK 和本地模型。它支持按用户、智能体、用例及预算控制模型访问,并可将生产流量转化为针对质量、速度和成本优化的自定义路由器或模型。项目支持本地部署(pip install experiential)及托管平台,默认启用匿名聚合遥测。

访问控制策略工具协议集成可观测性追踪联网搜索模型路由
近7天 21 动态844 Stars
CH

ChatGPT是一款支持语音交互与深度研究的AI助手,可基于历史记录提供定制化回答

ChatGPT是一款人工智能交互平台,能够根据用户保存的聊天记录提供量身定制的回答。该平台支持创建图像、上传文件以及语音对话,并提供深度研究功能。用户登录后可获得个性化服务,其对话内容可能会被审阅并用于改进模型性能

安全检测办公协作代码生成对话助手访问控制策略
近7天 10 动态

MiniMax 通用全模态生成模型 H3

MiniMax H3 是 MiniMax 发布的通用全模态生成模型,可对文本、图像、视频、声音组成的多模态上下文进行统一理解,并输出具备原生双声道音视频,最高支持 15 秒 2K 分辨率。模型通过 /v2/video_generation 接口以多模态 content[] 结构调用,支持 t2va 文生视频、i2va 图生视频、首尾帧生视频及多模态参考四种模式。MiniMax 宣布将在未来数日内依法开放模型权重。

模型训练学习视频处理视频理解视频生成图像理解
近7天 3 动态

专为智能体开发与复杂编程打造的高性能多模态AI模型,兼顾极速响应与深度推理能力

Gemini 3.5 Flash 是一款面向智能体与编程领域的前沿多模态AI模型。它能够在极速响应下提供媲美旗舰模型的智能水平,支持文本、音频、图像、代码和视频的深度融合理解。该模型擅长长周期任务的自主推理与多智能体协同调度,可在编码迭代中快速生成并优化界面,同时具备针对提示注入等网络威胁的主动拦截能力。凭借百万级长上下文支持与企业级安全标准,它为开发者构建高效自动化工作流提供核心支持

安全检测代码审查代码生成联网搜索视频理解
近7天 2 动态

小红书首个全模态 MoE 开源大模型,支持图片/视频/音频理解与长上下文

dots3-note preview 是小红书 dots3 系列的首个开源权重模型,采用多模态 MoE 架构,总参数量 280B、激活参数 16B,支持最长 512K token 上下文。模型能理解文本、图像、视频和音频并输出文本,覆盖通用知识与指令遵循、数学与逻辑推理、工具调用与多步 Agent 工作流、代码生成、图像/文档/图表/音频/视频理解以及长上下文处理等任务,是 dots3 系列中延迟与成本最低的轻量成员。

代码生成复杂推理视频理解图像理解文件分析
近7天 1 动态

谷歌高效编码与多模态理解的主力模型,更省token更快更智能

Gemini 3.6 Flash 是 Google DeepMind 推出的高效主力模型,面向编码、知识工作与多模态任务,相比 3.5 Flash 输出 token 用量降低约 17%。模型支持跨文本、音频、图像、代码与视频的多模态理解,具备长周期深度推理与迭代编码能力,可通过多智能体编排执行代码迁移、财务数据分析等复杂任务,并已上线 Google AI Studio 与 Gemini API。

代码生成联网搜索视频理解数据分析图像理解
近7天 1 动态

谷歌发布的高性能编码与智能体工作主力多模态模型,兼顾深度推理与极速响应

Gemini 3.7 Flash 是 Google DeepMind于2026年8月发布的编码与智能体工作主力多模态模型,定位为大规模智能体任务处理的强算力旗舰。它针对软件工程、Web开发与知识工作任务优化性能,以严谨推理提升输出质量,在智能体执行中能稳定化解编程与真实世界问题,并支持文本、音频、图像、代码与视频的多模态理解。

代码生成复杂推理视频理解图像理解长文本处理
近7天 1 动态

威联通 NAS 专用 AI 语义搜索引擎

Qsirch 是威联通(QNAP)为其 NAS 打造的专用搜索应用,提供关键词搜索与 AI 语义搜索切换,并支持基于 RAG 的知识搜索。用户可用自然语言同时检索文档、图片、视频与音频,定位 PDF/DOCX 段落、图像内容、视频关键片段和音频转录中的具体时间点,还能对搜索结果生成 AI 摘要,AI 推理可在 NAS 本地执行。

企业搜索视频理解图像理解文件分析语音转录
近7天 1 动态

让任意智能体框架原生具备多模态能力的插件层

Qwen-MM-Plugins 是通义千问推出的原生多模态插件集合,把图像、视频、文档与 3D 模型的读取理解、OCR、目标定位、分割、语音识别、视觉对话与联网搜索打包为 skill 加 MCP 服务器,并提供长视频图记忆、视频剪辑与图像/视频/音频生成、Blender 三维建模、FreeCAD 参数化 CAD 及教学讲解视频生成等能力,可安装到 Claude Code、Codex、Qwen Code、Gemini CLI 等智能体框架。

工具协议集成视频处理视频理解视频生成图像分割
近7天 1 动态2,804 Stars

商汤轻量多模态智能体模型,长程任务端到端交付

SenseNova 6.8 Flash Lite 是商汤日日新推出的轻量级多模态智能体模型,可自主规划、持续执行数百步跨阶段长程任务,失败后自主回退并重新规划;主 Agent 能调度十余个专业子智能体并行完成信息检索、数据分析、数学计算、视觉理解与事实核验。模型原生理解文字、图片、图表、文档、视频、网页及应用界面,可制作原生 HTML 动态 PPT、操作浏览器与应用、处理本地文件、编写脚本并自动运行工作流,通过 SenseNova Token Plan 提供兼容 OpenAI SDK 的 API 调用。

浏览器操作代理模型推理服务视频理解数据分析图像理解
近7天 1 动态12 Stars

腾讯微信视觉团队开源的通用多模态嵌入模型,统一文本、图像与视频表征

WeMM-Embedding 是腾讯微信视觉团队开发的开源通用多模态嵌入(Embedding)模型家族,提供文本、图像、视频、视觉文档及交错多模态输入的统一向量表征,用于搜索与推荐等检索任务。提供 2B、4B、9B 三种规模,支持 Matryoshka 多维度截断(如 256 维仍保留近 99% 性能),可显著降低向量数据库的存储与检索成本。模型以 Apache 2.0 协议开源,已在视频号、公众号、朋友圈和电商等场景部署。

视频理解图像理解文本向量化
近7天 1 动态1,196 Stars

本地运行的 YouTube 视频转时间戳知识卡片工具,支持问答与 Obsidian 存档

Youtube Card Reader 是本地运行的开源工具,把任意 YouTube 视频或网页文章转成带时间戳的知识卡片组:每张卡片含标题、要点、转录原文行和当时屏幕画面,点击时间即可让播放器跳到对应时刻。内置转录瀑布流(字幕优先、Whisper 本地兜底)、读取屏幕、针对整段视频的问答面板、单卡片深入解释,并能把选中的卡片以 Markdown 存入 Obsidian。默认用 OpenCode Zen 免费模型,无需 API 密钥即可工作,也支持 Gemini、Claude、GPT、DeepSeek。

对话助手视频理解语音转录知识库
近7天 1 动态31 Stars

海信家庭智能伴侣级AIOS,面向电视、投影与全屋智能终端的系统级AI载体

海信JUOS是海信发布的行业首个家庭智能伴侣级AIOS,面向家庭全场景,原生适配电视、投影、智能家电等多终端。系统以超级小聚为系统级AI载体,搭载自研星海大模型与四大原生引擎,提供边看边问的视频问答、碎片线索搜片、息屏语音陪伴、千人千面的AI个性桌面,以及跨设备内容无缝流转和全屋智能联动等能力。升级覆盖海信U/E/A系列电视、激光电视及Vidda等近年主流终端,将从9月起向首批机型推送。

对话助手视频理解语音对话智能体
近7天 1 动态