Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.040 — 2026-08-13
NEWS 约 1 分钟

边缘视觉模型缩到30亿参数

Liquid AI把视觉语言模型压到约30亿参数,瞄准更快的端侧看图与界面操作。

IMAGE — Hugging Face Blog

让 AI 在手机或电脑上看懂屏幕、找到“提交”按钮,通常要在能力和设备负担之间取舍。Liquid AI 发布的 LFM2.5-VL-3B,是一款约 31 亿参数的视觉语言模型——能同时理解图片和文字——重点面向算力、内存更有限的边缘设备,减少把数据传到云端处理的需要。

最具体的进步来自界面定位。按作者公布的测试,模型在 ScreenSpot-v2 Desktop 上得分 78.7,上一代同规模模型只有 6.0;在 RefCOCO-avg 上,Grounding——把文字描述对应到图中具体位置或物体——得分也从 57.1 升至 87.9。它还支持多图理解和函数调用,即根据画面选择并调用外部工具。

训练时,团队使用约 34 万亿 token,并把视觉数据量增至此前的四倍;但这些效果目前来自作者自测,真实设备上的速度、内存占用和可用性尚未披露。


供稿材料 SOURCES — 1

← 返回 2026-08-13 · 科技板块