LFM2.5-VL-3B

可在端侧本地运行的视觉语言模型,支持 OCR 与工具调用

LFM2.5-VL-3B 是 Liquid AI 面向端侧部署的视觉语言模型,以 LFM2.5-2.6B 为语言骨干并搭配 SigLIP2 NaFlex 400M 视觉编码器,支持 32768 token 上下文与 16 种语言。可处理文本与图像输入,具备整页 OCR 带版面标注、自然语言指代的目标定位与检测、多图推理、屏幕 UI 理解与函数调用能力,并提供 GGUF、ONNX、MLX 量化版本用于 CPU、移动与 Apple Silicon 推理

OCR 文字识别函数调用图像理解模型量化压缩目标检测
访问官网
收录动态

1

最近更新

2026-08-12

评价样本

未收录

社区规模

工具功能

这个工具能做什么、适合谁用,以及目前已识别的核心能力。

工具简介

LFM2.5-VL-3B 是 Liquid AI 面向端侧部署的视觉语言模型,以 LFM2.5-2.6B 为语言骨干并搭配 SigLIP2 NaFlex 400M 视觉编码器,支持 32768 token 上下文与 16 种语言。可处理文本与图像输入,具备整页 OCR 带版面标注、自然语言指代的目标定位与检测、多图推理、屏幕 UI 理解与函数调用能力,并提供 GGUF、ONNX、MLX 量化版本用于 CPU、移动与 Apple Silicon 推理

核心功能

5 项已整理
OCR 文字识别
函数调用
图像理解
模型量化压缩
目标检测

价格信息

暂无可验证价格信息

暂无足够准确的价格信息。

基础信息

更新频率
近 7 天 1 条收录动态
最近更新
2026-08-12
覆盖行业

更新日志

按时间记录功能更新、版本发布、新工具入库等重要变化。

  1. 2026-08-12新工具首发

    Liquid AI 于 2026-08-12 发布端侧视觉语言模型 LFM2.5-VL-3B,以 LFM2.5-2.6B 为骨干搭配 SigLIP2 400M NaFlex 视觉编码器,新增函数调用能力(ToolSandbox 26.4→59.5、BFCL v4 20.5→32.5),指代定位 RefCOCO 从 57.1 提升到 87.9,多图推理 BLINK 50.2→61.5、MuirBench 34.9→58.3,ScreenSpot-v2 屏幕/UI 理解均分 80.7;首日支持 llama.cpp、MLX、vLLM、SGLang、ONNX,M5 Max 上 228 tok/s、约 3GB 内存,已上线 Hugging Face。

LFM2.5-VL-3B 常见问题

关于 LFM2.5-VL-3B 的定位、核心功能、价格与最近更新。

LFM2.5-VL-3B 是什么?

LFM2.5-VL-3B 是 Liquid AI 面向端侧部署的视觉语言模型,以 LFM2.5-2.6B 为语言骨干并搭配 SigLIP2 NaFlex 400M 视觉编码器,支持 32768 token 上下文与 16 种语言。可处理文本与图像输入,具备整页 OCR 带版面标注、自然语言指代的目标定位与检测、多图推理、屏幕 UI 理解与函数调用能力,并提供 GGUF、ONNX、MLX 量化版本用于 CPU、移动与 Apple Silicon 推理。

LFM2.5-VL-3B 有哪些核心功能?

LFM2.5-VL-3B 当前已核验的核心功能包括:OCR 文字识别、函数调用、图像理解、模型量化压缩、目标检测。

LFM2.5-VL-3B 如何收费?

AI Equal 当前没有收录 LFM2.5-VL-3B 的可验证价格信息。

LFM2.5-VL-3B 最近有什么更新?

2026-08-12:Liquid AI 于 2026-08-12 发布端侧视觉语言模型 LFM2.5-VL-3B,以 LFM2.5-2.6B 为骨干搭配 SigLIP2 400M NaFlex 视觉编码器,新增函数调用能力(ToolSandbox 26.4→59.5、BFCL v4 20.5→32.5),指代定位 RefCOCO 从 57.1 提升到 87.9,多图推理 BLINK 50.2→61.5、MuirBench 34.9→58.3,ScreenSpot-v2 屏幕/UI 理解均分 80.7;首日支持 llama.cpp、MLX、vLLM、SGLang、ONNX,M5 Max 上 228 tok/s、约 3GB 内存,已上线 Hugging Face。