让 AI 在手机或电脑上看懂屏幕、找到“提交”按钮,通常要在能力和设备负担之间取舍。Liquid AI 发布的 LFM2.5-VL-3B,是一款约 31 亿参数的视觉语言模型——能同时理解图片和文字——重点面向算力、内存更有限的边缘设备,减少把数据传到云端处理的需要。
最具体的进步来自界面定位。按作者公布的测试,模型在 ScreenSpot-v2 Desktop 上得分 78.7,上一代同规模模型只有 6.0;在 RefCOCO-avg 上,Grounding——把文字描述对应到图中具体位置或物体——得分也从 57.1 升至 87.9。它还支持多图理解和函数调用,即根据画面选择并调用外部工具。
训练时,团队使用约 34 万亿 token,并把视觉数据量增至此前的四倍;但这些效果目前来自作者自测,真实设备上的速度、内存占用和可用性尚未披露。