让 AI 替你操作浏览器,难点不只是“看见”网页,还要认出按钮和输入框,并按目标决定下一步。Reddit 发帖者用约 5 万张浏览器截图,微调 LFM2.5-VL-450M——一个能同时理解图片和文字、规模为 4.5 亿参数的视觉语言模型(VLM),把它训练成会点击、输入的 GUI Agent。
最值得看的是小模型的提升幅度:帖子标题称,模型在 100 个留出的浏览器截图测试案例中,成绩从 1/100 升到 44/100。这里采用“严格通过”口径,即一个案例的全部判定条件都满足才算通过,比只看某个动作是否正确更苛刻。换句话说,通用小模型未必天然会操作界面,但少量针对性训练仍可能释放很大空间。
不过,这只是发帖者在自建基准上的自报结果;案例也不一定等同于完整的多步骤浏览器任务,现有材料没有披露训练细节或外部基准成绩。