MOSS-VL

OpenMOSS 开源实时视频流多模态理解模型系列

MOSS-VL 是 OpenMOSS 团队推出的开源多模态视觉理解模型系列,基于 Cross-Attention 架构与 XRoPE 时空位置编码,三个 11B 参数模型均以 Apache-2.0 协议开源。MOSS-VL-Realtime 支持在持续视频流输入时同步感知与生成,可随时打断、实时回答并自主决定何时回复;MOSS-VL-Instruct 适用于离线长视频理解与深度对话;MOSS-VL-Base 提供预训练基座,支持 256K 上下文窗口

视频处理
访问官网
收录动态

1

最近更新

2026-07-14

评价样本

未收录

GitHub Stars

391

工具功能

这个工具能做什么、适合谁用,以及目前已识别的核心能力。

工具简介

MOSS-VL 是 OpenMOSS 团队推出的开源多模态视觉理解模型系列,基于 Cross-Attention 架构与 XRoPE 时空位置编码,三个 11B 参数模型均以 Apache-2.0 协议开源。MOSS-VL-Realtime 支持在持续视频流输入时同步感知与生成,可随时打断、实时回答并自主决定何时回复;MOSS-VL-Instruct 适用于离线长视频理解与深度对话;MOSS-VL-Base 提供预训练基座,支持 256K 上下文窗口

核心功能

1 项已整理
视频处理

价格信息

暂无可验证价格信息

暂无足够准确的价格信息。

基础信息

更新频率
近 7 天 1 条收录动态
最近更新
2026-07-14
覆盖行业
科研

更新日志

按时间记录功能更新、版本发布、新工具入库等重要变化。

  1. 2026-07-14开源

    OpenMOSS 开源 MOSS-VL-Realtime 实时视频流多模态模型,11B 参数,基于 Cross-Attention 架构与 XRoPE 时空位置编码,支持 256K 上下文,可在持续视频流输入时同步感知与生成,随时打断并自主决定回复时机,以 Apache-2.0 协议开源。同时发布 MOSS-VL-Instruct-0708 与 MOSS-VL-Base-0708。

MOSS-VL 常见问题

关于 MOSS-VL 的定位、核心功能、价格与最近更新。

MOSS-VL 是什么?

MOSS-VL 是 OpenMOSS 团队推出的开源多模态视觉理解模型系列,基于 Cross-Attention 架构与 XRoPE 时空位置编码,三个 11B 参数模型均以 Apache-2.0 协议开源。MOSS-VL-Realtime 支持在持续视频流输入时同步感知与生成,可随时打断、实时回答并自主决定何时回复;MOSS-VL-Instruct 适用于离线长视频理解与深度对话;MOSS-VL-Base 提供预训练基座,支持 256K 上下文窗口。

MOSS-VL 有哪些核心功能?

MOSS-VL 当前已核验的核心功能包括:视频处理。

MOSS-VL 如何收费?

AI Equal 当前没有收录 MOSS-VL 的可验证价格信息。

MOSS-VL 最近有什么更新?

2026-07-14:OpenMOSS 开源 MOSS-VL-Realtime 实时视频流多模态模型,11B 参数,基于 Cross-Attention 架构与 XRoPE 时空位置编码,支持 256K 上下文,可在持续视频流输入时同步感知与生成,随时打断并自主决定回复时机,以 Apache-2.0 协议开源。同时发布 MOSS-VL-Instruct-0708 与 MOSS-VL-Base-0708。