Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.089 — 2026-10-01
PAPER HF 27 约 7 分钟

QwenGyre:百万Token任务如何训练

QwenGyre让GPU边等超长Agent边训练,并把分叉轨迹压成可控样本。

你让一个 AI Agent 独自完成大型软件项目。它工作数小时,调用工具数百次,还会另开“分身”处理子任务。等它交卷后,训练系统才知道哪些做法有效。问题是:有的 Agent 早早完成,有的迟迟不结束,昂贵的 GPU 只能等最慢的那个;与此同时,整段工作记录可能接近百万 token,分支多到难以直接拿来训练。

QwenGyre 正是为这种场景设计的在线强化学习框架。在线强化学习(RL)是让模型实际执行任务,再根据结果调整行为。QwenGyre 主要改造两件事:怎样在执行与训练之间调配 GPU,以及怎样把庞杂的执行记录整理成训练材料。

这里先说清数字口径。论文把这类任务概括为单次执行持续数小时、包含数百次模型与环境交互,并在多次模型调用中累计处理约 100 万 token;这不是说单个请求装下了百万 token。论文披露的旗舰模型训练配置是每次 rollout 使用 700K tokens,而非严格的 1M。本文全部效果数字均来自作者论文,目前没有独立复现。

不再等最慢的那个

Rollout(轨迹采样)就是让当前 Agent 从头执行一次任务,并记录沿途的观察、行动与结果。常见训练框架有两种安排。

一种叫 Colocate:同一批 GPU 先集体执行 rollout,全部结束后再集体切到训练。只要还有少数慢任务没完成,其他 GPU 就得等待。另一种叫 Async:把 GPU 固定分成执行池和训练池。两边可以同时工作,但需求变化时不能互相借用资源。训练数据没凑齐时,训练池会空转;执行任务堆积时,训练池也帮不上忙。

QwenGyre 引入弹性调度器。它观察尚未完成的工作量,随着执行需求下降,逐个把 GPU 单元转去训练,而不是等待所有任务结束。正在运行的 Agent 不会因此被关闭:Agent 的工作区和工具状态留在 GPU 之外,模型请求会被改道到仍负责推理的 GPU。论文还描述了 KV Cache 迁移——KV Cache 是模型处理长上下文时保存的中间计算结果——用来减少改道后的重复计算。

训练也不必等所有可用 GPU 到齐。一个核心单元保存权威模型权重和优化器状态,后来空出的卫星单元可以在同一批训练进行期间加入。训练数据按小块流式发放,先加入或算得快的单元多领一些,让各单元尽量同时完成。

这套设计的关键不是单纯让训练更快,而是把三种寿命拆开:Agent 可以继续执行,GPU 可以转换角色,训练样本则按需生成。过去绑在一起的三件事,因此不必同时开始或结束。

一次执行,为什么会变成一棵树?

超长 Agent 并不总沿一条直线前进。上下文快满时,运行框架会压缩历史;主 Agent 可能把任务交给多个子 Agent;失败后还可能重试另一条路线。最终记录更像一棵不断分叉的树,而不是一篇从头写到尾的日记。

粗暴地把每条分支展开成完整样本,会反复复制共同的前半段。分支较多的执行还会在训练中获得不成比例的权重。更麻烦的是,历史经过压缩或改写后,若直接拼接记录,某个回答可能被放进它生成时从未见过的上下文。

QwenGyre 的 trajectory processor(轨迹处理器)会记录每次模型调用的准确输入、输出和生成概率,再按共同前缀重建轨迹树。每个回答保留其生成时真正看到的上下文。系统只把策略模型自己生成的 token 当作训练目标;系统提示、用户输入、工具结果和外部注入内容仅作为上下文。

到了训练阶段,它按角色优先级挑选数量受限的路径:主 Agent 推进任务的轨迹优先于其摘要轨迹,子 Agent 的路径排在后面。选中一条路径后,共享前缀会被遮蔽,避免同一段输出因出现在多个分支中而被重复训练。损失先在一次执行内部平均,再跨执行平均,也能防止“分支越多,训练权重越大”。

超时不一定等于白做

长时程信用分配,是指任务最终成功或失败后,判断漫长过程中的哪些步骤应记功或担责。任务越长,反馈越迟,这件事越难。

QwenGyre 没有声称彻底解决信用分配,但处理了一个实际问题:Agent 超时退出时,已经完成的工作可能仍有价值。系统会保存当时的成果,并用任务自身的评分规则评估部分进展。只要结果可评估,它就能获得有效分数。若评估器故障、始终拿不到有效结果,这段轨迹会被排除;“没有评分”和“有效的零分”不会混为一谈。

数字说明了什么?

论文在 NL2RepoBench、DeepSWE 和 TerminalBench 三类任务上比较了 QwenGyre、Colocate 与 Async,并称各方法使用相同 GPU 预算和相同的策略陈旧度约束。所谓策略陈旧度,是指采样时使用的模型版本与真正训练时的模型版本相差多远。

在报告的配置中,QwenGyre 在保持相近训练得分的同时,相比 Async 获得 1.38× 至 1.78× 的端到端加速,相比 Colocate 为 1.21× 至 1.85×。这里的 1.78× 和 1.85× 都是最佳结果,不能理解成所有任务上的稳定加速。

旗舰实验使用论文称为 Qwen 3.8 2.4T 的模型,在 NL2RepoBench 上以每次 rollout 700K tokens 训练。QwenGyre 用 75.42 小时完成 48 个训练步骤;Async 用时 134.55 小时,Colocate 用时 91.47 小时。模型成绩则从约 52.5%升至58.5%,增加6.0个百分点,不是相对提高6%。

这组结果值得关注,因为超长 Agent 的瓶颈已经不只是模型能否“想得久”,还包括训练系统能否承受数小时的执行尾部、不断变化的资源需求,以及分叉轨迹带来的数据膨胀。QwenGyre 给出的答案很务实:GPU 随任务进度换岗,轨迹按真实上下文重建,部分成果尽量评分,重复路径只训练一次。

局限与未知

  • 全部结果来自论文作者,尚无其他机构复现。最高加速比缺少完整硬件配置、各数据集细分结果和统计波动,不宜外推。
  • 材料没有解释“Qwen 3.8 2.4T”中 2.4T 的具体含义,也未交代 NL2RepoBench 指标的样本规模与显著性。
  • “48 steps”是论文所称训练步骤,不能自行等同于48次 rollout;论文也未证明系统已在严格的单次1M-token rollout配置上完成训练。

供稿材料 SOURCES — 1

← 返回 2026-10-01 · 学术板块