LFM2.5-VL-3B
可在端侧本地运行的视觉语言模型,支持 OCR 与工具调用
LFM2.5-VL-3B 是 Liquid AI 面向端侧部署的视觉语言模型,以 LFM2.5-2.6B 为语言骨干并搭配 SigLIP2 NaFlex 400M 视觉编码器,支持 32768 token 上下文与 16 种语言。可处理文本与图像输入,具备整页 OCR 带版面标注、自然语言指代的目标定位与检测、多图推理、屏幕 UI 理解与函数调用能力,并提供 GGUF、ONNX、MLX 量化版本用于 CPU、移动与 Apple Silicon 推理
1
2026-08-12
未收录
—
工具功能
这个工具能做什么、适合谁用,以及目前已识别的核心能力。
工具简介
LFM2.5-VL-3B 是 Liquid AI 面向端侧部署的视觉语言模型,以 LFM2.5-2.6B 为语言骨干并搭配 SigLIP2 NaFlex 400M 视觉编码器,支持 32768 token 上下文与 16 种语言。可处理文本与图像输入,具备整页 OCR 带版面标注、自然语言指代的目标定位与检测、多图推理、屏幕 UI 理解与函数调用能力,并提供 GGUF、ONNX、MLX 量化版本用于 CPU、移动与 Apple Silicon 推理
核心功能
价格信息
暂无可验证价格信息暂无足够准确的价格信息。
基础信息
- 更新频率
- 近 7 天 1 条收录动态
- 最近更新
- 2026-08-12
- 覆盖行业
更新日志
按时间记录功能更新、版本发布、新工具入库等重要变化。
- 2026-08-12新工具首发
Liquid AI 于 2026-08-12 发布端侧视觉语言模型 LFM2.5-VL-3B,以 LFM2.5-2.6B 为骨干搭配 SigLIP2 400M NaFlex 视觉编码器,新增函数调用能力(ToolSandbox 26.4→59.5、BFCL v4 20.5→32.5),指代定位 RefCOCO 从 57.1 提升到 87.9,多图推理 BLINK 50.2→61.5、MuirBench 34.9→58.3,ScreenSpot-v2 屏幕/UI 理解均分 80.7;首日支持 llama.cpp、MLX、vLLM、SGLang、ONNX,M5 Max 上 228 tok/s、约 3GB 内存,已上线 Hugging Face。
LFM2.5-VL-3B 常见问题
关于 LFM2.5-VL-3B 的定位、核心功能、价格与最近更新。
LFM2.5-VL-3B 是什么?
LFM2.5-VL-3B 是 Liquid AI 面向端侧部署的视觉语言模型,以 LFM2.5-2.6B 为语言骨干并搭配 SigLIP2 NaFlex 400M 视觉编码器,支持 32768 token 上下文与 16 种语言。可处理文本与图像输入,具备整页 OCR 带版面标注、自然语言指代的目标定位与检测、多图推理、屏幕 UI 理解与函数调用能力,并提供 GGUF、ONNX、MLX 量化版本用于 CPU、移动与 Apple Silicon 推理。
LFM2.5-VL-3B 有哪些核心功能?
LFM2.5-VL-3B 当前已核验的核心功能包括:OCR 文字识别、函数调用、图像理解、模型量化压缩、目标检测。
LFM2.5-VL-3B 如何收费?
AI Equal 当前没有收录 LFM2.5-VL-3B 的可验证价格信息。
LFM2.5-VL-3B 最近有什么更新?
2026-08-12:Liquid AI 于 2026-08-12 发布端侧视觉语言模型 LFM2.5-VL-3B,以 LFM2.5-2.6B 为骨干搭配 SigLIP2 400M NaFlex 视觉编码器,新增函数调用能力(ToolSandbox 26.4→59.5、BFCL v4 20.5→32.5),指代定位 RefCOCO 从 57.1 提升到 87.9,多图推理 BLINK 50.2→61.5、MuirBench 34.9→58.3,ScreenSpot-v2 屏幕/UI 理解均分 80.7;首日支持 llama.cpp、MLX、vLLM、SGLang、ONNX,M5 Max 上 228 tok/s、约 3GB 内存,已上线 Hugging Face。