训练电脑操作Agent,很像同时让许多实习生在同一套软件里反复练习:每个人都要保留自己的登录、文件和操作记录,却未必需要各自复制一整套已经启动的软件。传统方案往往为每次尝试准备独立容器,平行训练越多,内存和初始化成本越重。CUA-Sandbox要解决的,正是这笔基础设施开销。
它把“运行时”与“可变状态”拆开:网站和桌面应用的已启动底座可以共享;每条 rollout——Agent从任务开始到结束的一整次尝试——则拥有独立的状态胶囊。重置或分支时,系统只处理状态,不必重建完整环境。作者在 WebArena、VisualWebArena 和 OSWorld 上测试后报告,相比 Docker,任务成功率相当或更好;rollout 吞吐量最高提升至 6.20 倍,单环境内存降至约九分之一,增量存储最多缩减 504 倍。这些效果目前来自论文作者的实验,但它抓住了一个很实在的瓶颈:强化学习需要成千上万次尝试,少复制一整套软件,规模化训练就可能便宜许多。