Experiential 是一个面向智能体工作流的开源网关与路由器,通过一个 OpenAI 兼容 API 统一托管、BYOK 和本地模型。它支持按用户、智能体、用例及预算控制模型访问,并可将生产流量转化为针对质量、速度和成本优化的自定义路由器或模型。项目支持本地部署(pip install experiential)及托管平台,默认启用匿名聚合遥测。
Capability Timeline
视频理解
对已有视频内容进行分析、识别与问答,输出对画面与情节的理解结果
相关工具
16ChatGPT是一款人工智能交互平台,能够根据用户保存的聊天记录提供量身定制的回答。该平台支持创建图像、上传文件以及语音对话,并提供深度研究功能。用户登录后可获得个性化服务,其对话内容可能会被审阅并用于改进模型性能
Grok 是由 xAI 构建的 AI 助手,支持聊天对话、图像创建、代码编写,并能从网络和 X 平台获取实时信息回答用户问题。订阅用户可通过 Grok Heavy 等套餐获得 X Premium+ 等增值权益。
MiniMax H3 是 MiniMax 发布的通用全模态生成模型,可对文本、图像、视频、声音组成的多模态上下文进行统一理解,并输出具备原生双声道音视频,最高支持 15 秒 2K 分辨率。模型通过 /v2/video_generation 接口以多模态 content[] 结构调用,支持 t2va 文生视频、i2va 图生视频、首尾帧生视频及多模态参考四种模式。MiniMax 宣布将在未来数日内依法开放模型权重。
通义千问(Qwen)是阿里巴巴云开发的大语言模型系列,提供对话助手、代码生成、智能体工具调用、256K至100万token长文本理解、多语言翻译和创意写作等能力。模型涵盖Dense和MoE架构,支持思考与非思考模式切换,可通过Qwen Chat、API及多种推理框架使用。
Gemini 3.5 Flash 是一款面向智能体与编程领域的前沿多模态AI模型。它能够在极速响应下提供媲美旗舰模型的智能水平,支持文本、音频、图像、代码和视频的深度融合理解。该模型擅长长周期任务的自主推理与多智能体协同调度,可在编码迭代中快速生成并优化界面,同时具备针对提示注入等网络威胁的主动拦截能力。凭借百万级长上下文支持与企业级安全标准,它为开发者构建高效自动化工作流提供核心支持
MiniCPM是面壁智能(OpenBMB)自主研发的端侧大模型系列,包括文本基座模型MiniCPM5-1B、稀疏注意力模型MiniCPM-SALA等。专为端侧部署和资源受限场景设计,支持本地助手、编码代理、工具调用和长上下文推理。
dots3-note preview 是小红书 dots3 系列的首个开源权重模型,采用多模态 MoE 架构,总参数量 280B、激活参数 16B,支持最长 512K token 上下文。模型能理解文本、图像、视频和音频并输出文本,覆盖通用知识与指令遵循、数学与逻辑推理、工具调用与多步 Agent 工作流、代码生成、图像/文档/图表/音频/视频理解以及长上下文处理等任务,是 dots3 系列中延迟与成本最低的轻量成员。
Gemini 3.6 Flash 是 Google DeepMind 推出的高效主力模型,面向编码、知识工作与多模态任务,相比 3.5 Flash 输出 token 用量降低约 17%。模型支持跨文本、音频、图像、代码与视频的多模态理解,具备长周期深度推理与迭代编码能力,可通过多智能体编排执行代码迁移、财务数据分析等复杂任务,并已上线 Google AI Studio 与 Gemini API。
Gemini 3.7 Flash 是 Google DeepMind于2026年8月发布的编码与智能体工作主力多模态模型,定位为大规模智能体任务处理的强算力旗舰。它针对软件工程、Web开发与知识工作任务优化性能,以严谨推理提升输出质量,在智能体执行中能稳定化解编程与真实世界问题,并支持文本、音频、图像、代码与视频的多模态理解。
Qsirch 是威联通(QNAP)为其 NAS 打造的专用搜索应用,提供关键词搜索与 AI 语义搜索切换,并支持基于 RAG 的知识搜索。用户可用自然语言同时检索文档、图片、视频与音频,定位 PDF/DOCX 段落、图像内容、视频关键片段和音频转录中的具体时间点,还能对搜索结果生成 AI 摘要,AI 推理可在 NAS 本地执行。
Qwen-MM-Plugins 是通义千问推出的原生多模态插件集合,把图像、视频、文档与 3D 模型的读取理解、OCR、目标定位、分割、语音识别、视觉对话与联网搜索打包为 skill 加 MCP 服务器,并提供长视频图记忆、视频剪辑与图像/视频/音频生成、Blender 三维建模、FreeCAD 参数化 CAD 及教学讲解视频生成等能力,可安装到 Claude Code、Codex、Qwen Code、Gemini CLI 等智能体框架。
SenseNova 6.8 Flash Lite 是商汤日日新推出的轻量级多模态智能体模型,可自主规划、持续执行数百步跨阶段长程任务,失败后自主回退并重新规划;主 Agent 能调度十余个专业子智能体并行完成信息检索、数据分析、数学计算、视觉理解与事实核验。模型原生理解文字、图片、图表、文档、视频、网页及应用界面,可制作原生 HTML 动态 PPT、操作浏览器与应用、处理本地文件、编写脚本并自动运行工作流,通过 SenseNova Token Plan 提供兼容 OpenAI SDK 的 API 调用。
WeMM-Embedding 是腾讯微信视觉团队开发的开源通用多模态嵌入(Embedding)模型家族,提供文本、图像、视频、视觉文档及交错多模态输入的统一向量表征,用于搜索与推荐等检索任务。提供 2B、4B、9B 三种规模,支持 Matryoshka 多维度截断(如 256 维仍保留近 99% 性能),可显著降低向量数据库的存储与检索成本。模型以 Apache 2.0 协议开源,已在视频号、公众号、朋友圈和电商等场景部署。
Youtube Card Reader 是本地运行的开源工具,把任意 YouTube 视频或网页文章转成带时间戳的知识卡片组:每张卡片含标题、要点、转录原文行和当时屏幕画面,点击时间即可让播放器跳到对应时刻。内置转录瀑布流(字幕优先、Whisper 本地兜底)、读取屏幕、针对整段视频的问答面板、单卡片深入解释,并能把选中的卡片以 Markdown 存入 Obsidian。默认用 OpenCode Zen 免费模型,无需 API 密钥即可工作,也支持 Gemini、Claude、GPT、DeepSeek。
海信JUOS是海信发布的行业首个家庭智能伴侣级AIOS,面向家庭全场景,原生适配电视、投影、智能家电等多终端。系统以超级小聚为系统级AI载体,搭载自研星海大模型与四大原生引擎,提供边看边问的视频问答、碎片线索搜片、息屏语音陪伴、千人千面的AI个性桌面,以及跨设备内容无缝流转和全屋智能联动等能力。升级覆盖海信U/E/A系列电视、激光电视及Vidda等近年主流终端,将从9月起向首批机型推送。





