模型发布·Hugging Face Blog

LiquidAI 推出 LFM2.5-VL-3B,可在本地设备实现更快更强的视觉语言能力

LiquidAI 发布了 LFM2.5-VL-3B,一款可在用户自有硬件上运行的视觉-语言模型。它在屏幕/UI 理解、对象定位(grounding)、多图输入和函数调用四方面有明显改进,训练使用了约34T Token 和更多视觉数据,并扩展了词表以支持非拉丁文字。对开发者和产品方而言,该模型在CPU/GPU及移动端均有日常可用的推理速度,适合需要本地、实时视觉理解与工具调用的场景。

LiquidAI 推出 LFM2.5-VL-3B,定位为可在本地硬件上运行的“最强”视觉-语言模型。官方称该模型能理解文档与屏幕内容,进行对象 grounding,并能调用工具;它采用“直接回答而非推理”的模式以保持实时响应和在设备上运行的速度。模型在屏幕/UI 理解、grounding、跨多图推理和函数调用能力上相较此前版本有四项主要改进。

架构方面,LFM2.5-VL-3B 将 SigLIP2 400M NaFlex 视觉编码器与与 LFM2.5-2.6B 文本模型相同的预训练主干结合。预训练使用约34T token,并包含比以前多4倍的视觉数据,数据来自策划与合成的图像-字幕、OCR、grounding 和指令跟随集合。为支持非拉丁文字,词表从原先扩展到128K,通过在位扩展分词器实现而非从头重训。后训练分两阶段:监督微调(含来自更大教师模型的知识蒸馏和 Antidoom 训练)以及多奖励强化学习。

评测方面,团队在多项视觉与文本基准上测试了模型。视觉基准覆盖多语种视觉理解、指令跟随、视觉数学与科学推理、文档理解、对象检测、多图理解和屏幕理解。官方给出的表格显示 LFM2.5-VL-3B 在其规模类别上的真实图像任务中表现领先,并能较好地读取文档、图表与屏幕 UI 元素。文本基准上,指令跟随能力与工具使用能力均有提升;在工具使用上,其表现与 Gemma-4-E2B 和 Qwen3.5-2B 相当。

部署与推理性能方面,LFM2.5-VL-3B 在多种推理生态(如 llama.cpp、MLX、vLLM、SGLang、ONNX)当天支持即可运行。官方给出的速度指标包括:在 M5 Max 上解码 228 tokens/s,在 Ryzen AI Max+ 395 上为 116 tokens/s,内存占用约 3 GB;在 Galaxy S26 Ultra 上可达 20 tokens/s,可实现完全本地运行。GPU 上该模型在多帧输入下保持低延迟,并在高并发下达到约 11K tokens/s 的输出吞吐,团队称相当于比 4B 级更大模型快约 2 倍。文末还提供了在 transformers 中加载与运行模型的示例代码片段。

#HuggingFace#视觉#边缘算力

本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。