Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.048 — 2026-08-21
PAPER H 1 约 1 分钟

长程Agent训练,也得先解决容错

Belayer为长程Agent训练补上容错:故障后保住计算进度,也让模型记忆与沙箱状态对得上。

训练 Agent 像让人边写代码边记笔记:忙了几分钟,工具或 GPU 突然出错,不仅可能要从头再来,笔记还可能和电脑里的文件对不上。Belayer 要解决的正是这类故障。Agent 强化学习(RL)会让模型反复执行多轮任务,再按结果调整行为;其中一次完整尝试叫 rollout(轨迹采样)。轨迹越长,局部故障浪费的进度越多。作者实验中,轨迹中位时长为 460.8 秒;环境动作故障率仅 1%,rollout 时长也会增加 48.7%。

Belayer 最巧的一步,是趁模型生成下一次回复、暂时不操作环境时,为沙箱做完整检查点——保存文件系统和运行状态,并把它与同一时刻的模型上下文绑定。恢复时,两边从一致的位置继续,避免模型以为文件已经修改,沙箱却回到了更早状态。GPU worker(承担模型推理的工作进程)故障时,系统还会启用预初始化的备用进程,复用经检查仍健康的模型权重和 GPU 内存,再从已记录文本重建请求状态。作者报告,相比完整冷启动,worker 恢复最高加速 42 倍;环境故障恢复加速 1.5—3.5 倍。其保证不覆盖可写远程服务或宿主机挂载卷等沙箱外部状态。


供稿材料 SOURCES — 1
01
Belayer: Efficient Fault Tolerance for LLM Agentic RL Training arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-21 · 学术板块