Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.052 — 2026-08-25
NEWS 约 1 分钟

450M视觉模型学会操作浏览器

4.5亿参数视觉模型用5万张截图微调,浏览器测试严格通过率升至44%。

IMAGE — r/LocalLLaMA 日榜

让 AI 替你操作浏览器,难点不只是“看见”网页,还要认出按钮和输入框,并按目标决定下一步。Reddit 发帖者用约 5 万张浏览器截图,微调 LFM2.5-VL-450M——一个能同时理解图片和文字、规模为 4.5 亿参数的视觉语言模型(VLM),把它训练成会点击、输入的 GUI Agent。

最值得看的是小模型的提升幅度:帖子标题称,模型在 100 个留出的浏览器截图测试案例中,成绩从 1/100 升到 44/100。这里采用“严格通过”口径,即一个案例的全部判定条件都满足才算通过,比只看某个动作是否正确更苛刻。换句话说,通用小模型未必天然会操作界面,但少量针对性训练仍可能释放很大空间。

不过,这只是发帖者在自建基准上的自报结果;案例也不一定等同于完整的多步骤浏览器任务,现有材料没有披露训练细节或外部基准成绩。


供稿材料 SOURCES — 1

← 返回 2026-08-25 · 开源板块