训练 Agent 像让人边写代码边记笔记:忙了几分钟,工具或 GPU 突然出错,不仅可能要从头再来,笔记还可能和电脑里的文件对不上。Belayer 要解决的正是这类故障。Agent 强化学习(RL)会让模型反复执行多轮任务,再按结果调整行为;其中一次完整尝试叫 rollout(轨迹采样)。轨迹越长,局部故障浪费的进度越多。作者实验中,轨迹中位时长为 460.8 秒;环境动作故障率仅 1%,rollout 时长也会增加 48.7%。
Belayer 最巧的一步,是趁模型生成下一次回复、暂时不操作环境时,为沙箱做完整检查点——保存文件系统和运行状态,并把它与同一时刻的模型上下文绑定。恢复时,两边从一致的位置继续,避免模型以为文件已经修改,沙箱却回到了更早状态。GPU worker(承担模型推理的工作进程)故障时,系统还会启用预初始化的备用进程,复用经检查仍健康的模型权重和 GPU 内存,再从已记录文本重建请求状态。作者报告,相比完整冷启动,worker 恢复最高加速 42 倍;环境故障恢复加速 1.5—3.5 倍。其保证不覆盖可写远程服务或宿主机挂载卷等沙箱外部状态。