Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.020 — 2026-07-24
NEWS 约 6 分钟

Fara 1.5:微软把27B模型放进浏览器

Fara 1.5 用截图理解网页、用坐标执行操作,让 27B 模型向可部署的浏览器 Agent 靠近。

IMAGE — r/LocalLLaMA 日榜
Fara 1.5:微软把 27B 模型放进浏览器

你要订一家餐厅,通常得搜索店名、打开页面、挑日期,再填写信息。普通聊天机器人可以告诉你怎么做,却不会替你点完这些按钮。微软的 Fara1.5-27B 瞄准的正是这段距离:它观看浏览器画面,决定下一步该点哪里、输入什么,并把一连串网页操作接起来。

这里的“放进浏览器”需要说得准确些。现有材料只说明它是面向浏览器操作的 27B 模型,并不代表模型权重直接在浏览器里本地运行。本文信息均来自 Microsoft Research AI Frontiers 发布的 Hugging Face 模型卡,尚无独立信源交叉验证,材料也没有提供基准成绩或硬件需求。

它像用户一样看网页

Fara1.5-27B 是一款多模态 Computer-use Agent(CUA)。Computer-use Agent 指能观察电脑界面,并执行点击、输入、滚动等操作的 AI;多模态则表示模型可以处理文字、图像等不同形式的信息。在这里,关键输入是浏览器截图。

据微软模型卡,Fara 1.5 在感知页面时只看截图,不读取 DOM 或 accessibility tree。DOM——Document Object Model——是浏览器整理网页元素时使用的结构化树,其中记录了按钮、文本框等对象。很多浏览器 Agent 可以借助这份“元素清单”理解页面,Fara 1.5 则要直接从像素里辨认它们。

这更接近人使用网页的方式。比如看到“预订”按钮,人会根据画面判断按钮位置,再移动鼠标点击。Fara 1.5 也需要从截图中定位目标,并预测点击所需的像素坐标。它的内部推理和操作轨迹以文本保存;拿到最新截图和此前动作后,再预测下一步。

只看截图并不天然更好。它意味着模型可以面对没有开放内部结构的页面,但也失去了 DOM 提供的清晰标记。页面渲染模糊、按钮长得相似,都会让判断变难。

看懂之后,还要把动作说清楚

模型不会直接“伸手”操作浏览器,而是输出结构化工具调用——按规定格式写出动作名称和参数,把自然语言目标翻译成程序可以执行的指令。

模型卡列出的动作包括 click、type、scroll、visit URL 和 web search。点击时,它还要给出像素坐标。可以把这理解为一张交给浏览器执行器的操作单:点哪个位置、输入什么内容、滚动多少,或者访问哪个网址。

这种设计面向的是完整流程,而不只是单次问答。微软列出的主要用途包括填写表单、购物、预订旅行或餐厅、查找信息,以及处理账户流程;它也可以为其他 Agent 提供基于像素的动作定位。不过,“能够端到端完成任务”和“pixel-accurate”属于模型卡的产品表述。由于材料没有给出基准名称、分数或对照实验,目前无法据此判断它的实际成功率,更不能说它领先于其他模型。

27B 模型是怎么学会操作的?

Fara1.5-27B 从 Qwen3.5-27B 监督微调而来。监督微调可以简单理解为:先准备一批带有正确操作示范的数据,再让已有模型照着这些示范学习。

训练数据由微软的 FaraGen1.5 生成。按照模型卡的描述,这是一条多智能体流水线:多个 Agent 协作合成网页任务,实际执行解决任务的操作轨迹,再验证结果,最后才把通过检查的数据用于训练。

这一步值得关注,因为浏览器 Agent 学的不只是“按钮在哪里”,还包括操作顺序。订餐时如果尚未选日期就去确认,单次点击即使位置准确,整个任务仍可能失败。生成、执行和验证连成流水线,目的就是为这种多步过程准备训练示范。

Fara 1.5 还与 MagenticLite 协同设计。微软建议研究和生产部署都通过 MagenticLite 使用它。不过,模型卡没有进一步说明这套组合的资源开销,也没有证明 27B 权重能直接在普通用户的浏览器或个人设备上运行。因此,更稳妥的理解是:微软把一个 27B 模型做成了专门服务浏览器操作的组件,使 computer-use 从通用大模型能力进一步靠近可组织、可部署的产品形态。

为什么值得关注?

它展示了一条明确的产品路线:Agent 不必要求网站专门提供结构化接口,也可以像用户一样观察现有页面,再通过少量标准动作推进任务。截图负责感知,结构化调用负责执行,文本轨迹则保存此前做过什么。三者组合起来,才构成一个能够跨页面连续行动的浏览器 Agent。

27B 的规模也让这项工作值得留意。它不是材料中那种只被描述为云端通用大模型的抽象能力,而是一个用途被明确限定、动作接口被规定、部署搭档也被指定的模型。但“更接近可部署”不等于“已经可以放心上线”。微软自己划出的适用边界相当严格。

局限与未知

  • 训练数据只有英语,因此微软明确称它不适用于其他语言。材料没有披露跨语言页面上的表现。
  • 只看截图会受到页面内提示注入、欺骗性或低质量渲染,以及界面视觉歧义影响。多步任务还会累积错误:前面一次误点,可能让后续操作全部偏离;多轮任务在不同运行之间也存在不可忽略的差异。
  • 微软把法律、健康和金融建议等高风险领域,影响法律地位、住房、就业或信贷的资源分配,能够接触敏感账户或文件的非沙箱部署,以及未经额外测试与防护的商业或真实生产使用列为范围外场景。模型卡没有给出基准分数、上下文长度、硬件需求或同类模型对比,实际能力边界仍待更多材料验证。

供稿材料 SOURCES — 1

← 返回 2026-07-24 · 开源板块