你让 AI 在手机上订好行程,再到电脑里整理文件,最后把结果上传。演示时,它可能点几下按钮就完成;真用起来,却会遇到弹窗、权限确认、网络波动和临时变化。任何一步点错,都可能让后面几十步一起跑偏。
Qwen-UI-Agent 想解决的正是这段从“会操作界面”到“能在真实设备上办事”的距离。GUI Agent——能看屏幕并点击、滑动、输入的 AI——并不新鲜。这份技术报告更值得看的地方,是它把真机环境、跨平台工作流、命令行操作和长任务训练放进了同一套系统。
需要先说明:本文所有能力与成绩均来自 Qwen-UI-Agent 技术报告,尚无独立复测。作者所称的“最先进”和“可与前沿模型竞争”,应视为报告方的自我评价。
真机不是换一块屏幕
模拟器适合训练:状态可以重置,任务容易重复,还能大批量运行。但真实手机更像一间每天都在变化的办公室。应用会更新,内容会变化;权限、验证码和弹窗可能突然打断操作;设备、账号和网络也会出故障。
为缩小这道差距,团队搭建了一个包含超过 100 台物理设备、覆盖 150 多个应用的移动端运行环境。调度系统持续检查设备、应用、账号、网络和显示状态,再把任务分配给可用设备。遇到环境故障,它可以改派任务;系统还用虚拟屏幕机制,让一台手机同时承载多个彼此隔离的应用会话。
这套环境也保留了人的控制权。缺少信息时,Agent 可以询问用户;涉及敏感数据或支付时,它要取得明确确认;碰到验证码等必须由人处理的环节,则把控制权交还用户,之后再从更新后的状态继续。
说白了,作者没有把真实世界的混乱当成评测噪声,而是把它当成系统本身必须处理的问题。
点按钮,也敲命令
只靠图形界面完成任务,有时很笨重。比如批量改文件名,用鼠标逐个操作会产生一长串点击;CLI——用文字命令控制计算机的命令行界面——更适合这类结构化工作。反过来,面对依赖视觉判断的应用界面,GUI 又更自然。
Qwen-UI-Agent 因此采用统一动作空间。它可以在同一条任务轨迹里交错执行点击、输入等 GUI 操作与 Bash 命令,还能调用 API、询问用户或结束任务。命令执行失败或超时不会直接终止流程,而会作为观察结果返回,让模型尝试诊断和恢复。
它还支持“批量动作”:如果几步操作之间不需要重新看屏幕,模型可以在一次决策中连续给出。报告称,在电脑任务中,CLI 和 GUI 点击是最主要的两类动作,超过 40% 的动作输出采用批量形式。这减少了反复截图、判断和调用模型的次数,也缩短了执行路径。
跨设备接力,而不是四个孤岛
Qwen-UI-Agent 覆盖手机、电脑、网页和 DeepSearch。DeepSearch 指的是借助搜索与网页读取工具,多轮查找并综合信息。关键不只是覆盖面,而是一个任务可以在这些环境之间继续推进,并保留上下文和当前状态。
例如,手机流程遇到需要核实的外部信息时,Agent 可以转入 DeepSearch,查找和验证资料,再回到原来的界面继续操作。轻量级 harness layer——连接模型、设备和用户状态的执行协调层——负责维持这条跨端工作流。
报告还展示了更主动的设想:手机收到航班取消通知后,Agent 识别受影响的行程,查找替代方案,结合用户日程提出计划,得到确认后再执行。这里的变化不只是“用户下令,AI 点击”,而是 AI 从设备信号中发现可能需要处理的事情。不过,主动发现需求也会把误判、隐私和授权问题推到更显眼的位置。
一百多步,靠什么不跑偏
长程任务——由许多相互依赖步骤组成的任务——最难的不是某一次点击,而是持续记住目标、核对中间状态,并在出错后回到正确路径。团队使用 online RL,也就是让模型在环境中实际执行,再根据结果继续训练。报告称,训练轨迹可以超过 100 个交互步骤,并由约 10,000 个并发模拟环境加速 rollout,即批量生成执行过程。
训练课程会优先选择“有时成功、有时失败”的任务:太简单的已经学会,太难的暂时缺少有效反馈,中间地带通常最适合继续提升。掌握一批任务后,系统再换入更难的任务。
数据生产也被做成一个循环。多个 Agent 生成任务和环境,分析执行失败,区分模型问题、环境问题与验证器问题,再为下一轮提出训练重点。人主要负责监督、系统设计和定向修改。它像一条会检查次品原因、再调整下一批原料的训练流水线,而不只是不断堆更多操作记录。
数字说明了什么
在作者构建的 MobileWorld-Real 真机基准上,Qwen-UI-Agent 对超过 100 个应用、400 多项任务取得 92.2% 成功率。报告称,这一成绩分别高出 Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol 和 Seed 2.1 Pro 6.0、7.5、6.8 和 3.5 个百分点。它在另一项真机基准 AndroidDaily 上达到 97.5%,在 MobileWorld 上为 82.1%。
电脑端的结果更能提醒我们不要只看一个百分数:它在 OSWorld-Verified 上达到 79.5%;在更难的 OSWorld-v2 上,二元成功率只有 13.9%,但 partial-progress score——任务没有完全完成时,对已推进部分计分——为 40.0%。后者不能与成功率直接比较,却说明复杂任务中“做到哪一步”也是重要尺度。
网页任务 WebArena 得分为 73.6%,界面定位基准 ScreenSpot-Pro 在 zoom-in 设置下为 81.5%。这些结果覆盖多类环境,支持了“一个模型处理多种数字任务”的方向;但它们使用不同指标,不能排成一张简单的高低榜。
为什么值得现在看
这份报告最重要的信号,不是某个基准又涨了几点,而是 GUI Agent 的竞争对象正在变化。过去更像考“能否看懂并点对界面”,现在开始考整套执行系统:有没有真实设备经验,能否跨平台保留状态,是否会选择 GUI、CLI 或 API,能否处理百步任务,以及什么时候必须把决定交还给人。
换句话说,可靠性不再只是模型参数里的能力。设备调度、环境恢复、结果验证、用户确认和训练数据循环,都成为产品能否工作的组成部分。Qwen-UI-Agent 提供了一条相当完整的工程路线,也让下一轮比较有了更具体的问题。
局限与未知
- 所有结果均为作者单方披露。材料没有提供独立复测,也不足以核查模型版本、提示词、额外工具权限、失败重试次数和统计显著性,因此与其他前沿模型的比较不能视为已经证明的公平对照。
- 报告同时使用物理设备、虚拟屏幕和大规模沙箱。除明确标为真机的评测外,各项成绩究竟来自物理设备、模拟器还是混合环境,不能仅凭摘要统一判断。
- 主动服务与长程执行展示了方向,但材料没有给出误触发率、真实用户长期使用结果或更完整的风险评估。Agent 越主动,授权边界和失败后的责任处理就越重要。