你对 AI 说:“打开下载文件夹,把今天的报表移到项目目录,再启动浏览器填写系统。”过去,它往往只能告诉你操作步骤;Windows-MCP 想做的,是让 Agent 真正替你点击、输入和切换窗口。这个开源项目单日新增 360 星,说明桌面自动化正在成为 Agent 工具链的新热点。
这里的 MCP(Model Context Protocol)是一套开放协议,让 AI 应用用统一方式发现和调用外部工具。MCP Server 则是模型与操作系统之间的“适配层”:它把鼠标、键盘、窗口和文件操作整理成 Agent 能调用的工具,再把操作结果交还给模型。本文数据与功能描述主要来自 CursorTouch 官方 GitHub 仓库,均属项目方单一信源。
AI 开始从“教你做”变成“替你做”
据项目方介绍,Windows-MCP 可以帮助 Agent 导航文件、打开和控制应用、操作图形界面,还能用于 QA 测试——也就是按流程检查软件功能是否正常。它提供键盘、鼠标操作以及窗口和 UI 状态捕获工具。
这类能力的价值,在于很多桌面软件没有方便的 API。API 是软件预留的结构化调用入口,通常更稳定;UI 自动化则像人一样操作界面,虽然更容易覆盖老软件和跨应用流程,却也更依赖窗口状态、控件位置与权限。
Windows-MCP 还提供浏览器 DOM Mode。DOM 可以理解为网页内容的结构清单;这一模式会尽量过滤浏览器自身的按钮和菜单,只保留网页内容,支持 Chrome、Edge 和 Firefox。Firefox 没有通过 UIA 暴露所需的 RootWebArea,因此项目改用 IAccessible2 作为后备方案。
项目方称,它不依赖传统计算机视觉或某个专门微调的模型,可以配合不同 LLM,视觉能力也不是必需项。其自报的连续操作典型延迟为 0.2—0.5 秒,但没有公布测试环境、样本量或统一基准,不能把这个数字视为稳定性能指标。
为什么它会突然走红?
首先,安装和分发路径已经比较完整。项目采用 MIT License,已经发布到 PyPI,也进入 MCP Registry;用户可通过 uvx windows-mcp 启动,还能将它设为每次登录时运行的用户级计划任务。项目方同时自述,Windows-MCP 在 Claude Desktop Extensions 中达到“2M+ Users”。这一数字没有统计口径、时间点或第三方证明,不宜理解为 200 万独立用户。
其次,它把 Agent 的竞争从聊天框推向桌面。模型是否会回答问题是一回事,能否可靠地跨文件管理器、浏览器和桌面应用完成一串动作,则是另一回事。Windows-MCP 的热度至少表明,开发者正在关注后一种能力:不是再给模型增加一段知识,而是给它一双能操作电脑的手。
但手越能干,权限问题越重要。据 GitHub Advisory Database 2026 年 5 月披露,Windows-MCP 的 SSE 和 HTTP 模式曾缺少身份验证,并暴露可执行命令的 PowerShell 工具;能连接相应端口的客户端,理论上可用当前 Windows 用户权限运行命令。该漏洞获评高危,CVSS 为 8.9,默认的本地 stdio 通信不受影响,项目已在 0.7.5 版修补。这个案例很直观:桌面 Agent 的能力越强,失守时能够触及的范围也越大。
局限与未知
- 项目声称支持 Windows 7 至 Windows 11,但当前又要求 Python 3.13+。材料没有证明全部依赖能在旧版 Windows 上正常安装,兼容性仍需实测。
- 非英文 Windows 默认建议禁用 App-Tool,说明不同语言环境下的完整能力并不等价。
- 首次安装可能耗时一两分钟并发生超时,项目方建议忽略后重启;实际任务效果也会受模型能力、系统负载、应用可访问性和权限设置影响。
Windows-MCP 的意义暂时不在于证明 Agent 已能稳定接管每台电脑,而在于把方向展示得很清楚:当统一工具协议遇上桌面自动化,AI 正从“给建议”继续向“执行操作”移动。接下来真正决定它能走多远的,不只是会不会点击,而是能否在权限清楚、过程可控、出错可恢复的前提下点击。