Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.047 — 2026-08-20
NEWS 约 4 分钟

UI-Mate:27B模型接管桌面长任务

腾讯开放权重 GUI Agent:能看屏幕、操作键鼠,并把一次演示变成可调整的跨应用流程。

IMAGE — r/LocalLLaMA 日榜

你想让 AI 把网页里的数据整理到表格,再上传到另一个应用。真正麻烦的不是某一次点击,而是几十步操作中,窗口、内容和布局随时可能变化。普通宏脚本只会照着旧坐标重放,一处变化就可能卡住。腾讯发布的 UI-Mate-27B,瞄准的正是这类跨应用、跨操作系统的长程桌面任务。

它是一款开放权重的 GUI Agent——GUI 是图形用户界面,GUI Agent 则像人一样看屏幕,再决定点击、输入或滚动什么。需要先说明的是,目前材料实质上都来自腾讯项目自身的模型卡及关联页面,尚无独立结果可供交叉核验。

它怎样操作电脑?

据官方模型卡,UI-Mate-27B 有 270 亿参数,基础模型为 Qwen3.6-27B。它接收任务指令、实时截图、此前的交互记录,以及可选的演示上下文。然后输出推理、简短的动作说明和结构化工具调用。

所谓结构化动作,是指模型不只告诉你“点击保存”,而是生成执行器能够直接理解的动作类型、坐标或按键。其动作范围包括鼠标、键盘、滚动、等待、与用户交互,以及宣布任务完成;官方还称这些动作可以兼容 pyautogui。后者在这里可以简单理解为替模型落实键鼠操作的执行工具。

这要求模型同时处理文字和画面。此类能力通常称为多模态:它既要读懂人的指令,也要看懂当前截图,还要把判断变成下一步操作。每执行一步,界面可能发生变化,模型便依据新画面继续判断。

演示不是一盘录像

UI-Mate 提供两种模式。第一种是 general computer use:用户直接用自然语言交代任务,模型根据实时屏幕完成操作。第二种是 demonstration-guided computer use,也就是示范引导:用户先成功演示一次,模型从中提取可复用的流程,再把它用于新任务。

关键区别在于,它并非机械复刻演示时的点击坐标。官方称,当内容、布局或应用状态发生变化时,模型会继续观察当前界面并重新规划。可以把这理解为“学会办事步骤”,而不是“背下鼠标轨迹”。如果实际表现可靠,这种方式会比固定宏脚本更适合经常变化的软件界面。

模型的训练分为两步:先做 supervised fine-tuning,即用带有正确示范的数据教它基本操作;随后在可执行的 GUI 环境中进行 online reinforcement learning,也就是让模型实际操作界面,并根据结果继续调整策略。

为什么值得关注?

GUI Agent 的价值,在于它不要求每款软件都先提供专用接口。许多桌面工作天然横跨多个应用,而 UI-Mate 直接面向这种场景。示范引导也降低了一种潜在门槛:用户不必把流程完整写成程序,只需先做成功一次,系统便可能复用其中的操作思路。

“开放权重”同样值得注意。官方列出了 Apache-2.0 License,并提供 OpenAI-compatible 的服务端和客户端接口,还给出了 GitHub、Hugging Face、项目页及 arXiv 论文入口。这意味着开发者获得了进一步部署和实验的基础。不过,许可证具体覆盖哪些内容、接口兼容到什么程度,仍应以原始文件和实际测试为准。

局限与未知

  • 官方称模型在 Ubuntu 和 Windows 基准测试中具有较强表现,并能完成跨多个应用的长程任务,但现有材料没有给出基准名称、分数、对照模型、成功率或最长执行步数,暂时不能据此判断它是否领先。
  • “一次演示学习流程”和“长程执行”目前都是项目方概括。面对弹窗、权限确认、网络延迟或意外界面时是否稳定,材料没有说明。
  • 因此,“接管桌面长任务”更适合作为方向描述,而不是已经得到量化证明的能力边界。UI-Mate 展示的是一条重要路线:让视觉模型从看懂屏幕,进一步走向连续操作电脑;它离稳定处理任意桌面工作还有多远,仍要等待完整论文、测试细节和独立复现。

供稿材料 SOURCES — 1

← 返回 2026-08-20 · 开源板块