Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.049 — 2026-08-22
PAPER 约 8 分钟

Q学习重新接上世界模型

QWM让Q学习先在世界模型里预演,再用真实经验学习,兼顾样本效率与可信落地。

先在脑中预演,再让机器人动手

想象你在教机器人挂一件工具。它每试错一次,都可能耗费时间、磨损设备。最省事的办法,似乎是先让它在内部模拟器里练上许多遍。但模拟器并不完全可靠:预测一步只错一点,连续预测十几步后,结果可能已经偏得很远。机器人若把这些“想象经历”当成真事学习,反而会练出只在模拟器里有效的动作。

Perry Dong、Yueru Jia、Chelsea Finn 和 Dorsa Sadigh 提出的 QWM(Q-Learning With World Models),换了一种分工:世界模型负责在行动前预演,策略和价值函数仍只从真实环境转移中学习。世界模型——预测“采取动作后,环境会怎样变化”的内部模拟器——不再充当训练场,而更像决策前的沙盘。

这项工作值得现在看,因为它试图接通两条长期各有优势的路线:成熟、能重复利用历史经验的离策略 Q 学习,以及能提前预测后果的世界模型。论文还把目标指向机器人操作,以及 VLA(Vision-Language-Action,视觉—语言—动作模型)的强化学习微调。不过,目前证据全部来自这篇论文,效果与机制判断尚无独立信源复核。

Q学习缺的,是多看几步

Q 学习会估算一个 Q 值,也就是“在当前情形采取某个动作,长期能得到多少回报”。可以把它理解成给每个候选动作贴上一张未来价值标签。行动时,系统通常偏向标签更高的动作。

它还是离策略强化学习:训练不必只使用当前策略刚刚采集的数据,也能反复利用旧策略、其他策略或历史记录留下的经验。这一点很适合机器人,因为真实操作数据昂贵,已经采到的每条经验都值得多用几次。

但单看一个动作的 Q 值,仍可能看不清后果。论文举出的对比是,有些方法只从策略采样一个动作;IDQL 虽会采样多个候选动作,再挑 Q 值最高的一个,却仍主要比较眼前这一步。QWM则让世界模型把候选动作向未来展开,再依据预测到的后续局面做选择。

例如,机器人要把方形螺母套上插销。两个起手动作眼下都像是朝目标靠近,但其中一个会让夹爪在后续更容易对齐。QWM想利用短程预演,把这种差别提前暴露出来。

世界模型只当参谋,不当教练

传统模型式强化学习常把世界模型生成的想象轨迹直接拿来训练策略或价值函数。问题是复合偏差:模型每预测一步都有一点误差,连续展开后,小误差会像传话游戏一样累积。策略甚至可能学会利用模拟器的漏洞,却无法在真实环境复现。

QWM的关键克制,是不让想象轨迹直接进入策略和 Q 函数的训练。策略与价值函数只用真实环境中的状态、动作和结果更新。作者据此主张,QWM可避免把世界模型的累积误差写进训练目标,同时保留预测搜索带来的样本效率收益。

但“避免”不能理解成完全不受模型误差影响。QWM选择动作时仍会参考世界模型。如果预测错了,参谋依然可能给出坏建议;区别在于,这个错误不会被当成真实经历,直接训练进策略和价值函数。

它怎么挑动作?

每次真正行动前,QWM先建立一棵短程搜索树。树根是机器人当前看到的状态。策略提出若干候选动作,世界模型为每个动作预测可能出现的下一状态;系统再从这些预测状态继续提出动作、预测后果。

搜索不会无限展开。论文明确把它定位为短时程预测,而不是穷举完整计划。原因很直接:树越深,计算量增长越快,世界模型的误差也越容易累积。

QWM给搜索树中的每个“状态—动作”节点估值,而不是只看最末端。它结合两类信号:一类是 Q 函数对长期回报的直接估计,较少依赖想象深度;另一类沿着世界模型预测的后续状态递推,能利用预演信息,却更容易受模型误差影响。两者加权后,系统为最初的候选动作计算搜索价值,再选择最高价值动作,或按这些价值进行软选择。

完整搜索树很快会变得庞大。因此,QWM用 Q 函数给中间路径打分,只保留少量高价值分支继续展开。论文的消融实验称,保留较少的高价值分支已经能捕捉有用的候选未来;增加分支数并未带来明显稳定的收益。

搜索同时改变“怎么学”和“怎么做”

QWM在两个时点使用这套搜索。

第一处是在线采样,也就是机器人一边与环境互动、一边收集新经验时。更好的动作选择会改变进入经验回放池的数据:机器人更可能采到高价值的真实转移,后续的策略和 Q 函数也就能从更有用的经验中更新。

第二处是评估或实际执行时。即使底层策略没有变化,搜索也能在每一步重新比较候选未来,直接改善动作选择。

论文的消融结果显示,同时在在线采样和评估阶段搜索,学习效率最强、表现也最稳定;只用其中一处,效果都会下降。这说明QWM不只是给训练完成后的策略加一个规划器。它还通过改善采集到的真实数据,间接影响后续学习。

从低维状态走到视觉输入

作者把 QWM叠加在两种离策略 Q 学习算法上:EXPO 和 RLPD。前者用基础策略提出动作,再由轻量编辑策略修正;后者混合离线与在线回放数据,并进行较高频率的更新。论文报告,QWM在两种底层算法上都带来一致改善,说明其设计并不只依赖某一种 Q 学习实现。

实验覆盖 Robomimic 和 LIBERO 两组机器人操作基准。Robomimic任务包括抓起物体、把罐子放到目标位置、将方形螺母套上插销,以及需要多阶段组装的 Tool Hang。奖励是稀疏的:通常只有完成任务才得到回报。

在低维状态输入下,世界模型使用三层 MLP(多层感知机,一种基础神经网络)预测状态变化。输入包含机械臂末端姿态、夹爪状态、物体特征和七自由度动作。

在视觉任务中,作者把 Wan2.2-TI2V-5B 改造成动作条件视频世界模型:它不仅看画面和文本条件,也接收机器人动作,然后预测短时未来画面。LIBERO实验生成五帧视频片段,并取预测的下一帧继续搜索。

作者报告,QWM在 Robomimic 和 LIBERO 上相较所选模型自由与模型式基线,在样本效率和最终表现方面均更强;与 TD-MPC2、EfficientZero V2 的比较中,后两者在论文给定训练步数内只在 Lift 任务取得非零成功。视觉实验也优于 EXPO,部分任务学得更快、后期表现更好。不过受算力限制,视觉世界模型只用于在线数据采样,没有在评估时启用。因此,这部分并非完整 QWM 设置。

论文原文没有在所供材料中给出可核对的具体成功率、样本量、提升幅度或统计显著性检验,因而这些结果只能按作者的定性报告理解,不能据此宣称全面超越既有最佳方法。

为什么这条路线值得关注?

QWM真正有意思的地方,不是“又用了一个世界模型”,而是重新划分了模型与强化学习的权力:世界模型可以提出未来,但不能把想象直接写成事实;Q学习仍由真实交互校准,却在每次行动前获得更多前瞻信息。

这也可能影响 VLA 强化学习的训练路线。VLA模型根据视觉和语言指令生成机器人动作。论文认为,只要微调方法带有 Q 函数,QWM就可以作为决策时搜索层接在上面。若这一路线能扩展,昂贵的真实机器人经验或许能被更有效地采集和利用,同时减少策略直接从合成轨迹学习所承受的偏差风险。

局限与未知

  • 搜索带来不可忽视的计算开销。每个真实动作前都要采样候选动作、预测未来并给路径估值,在低延迟控制中可能难以承受。
  • 高质量世界模型本身昂贵且难训练。论文虽把模型误差隔离在训练目标之外,动作选择仍依赖预测质量;搜索太深或候选过多,都可能放大预测与价值估计误差。
  • 现有证据仅来自作者在 Robomimic 和 LIBERO 上的实验。材料未提供完整数值表与统计检验,也没有真实机器人部署结果,尚不足以判断它在更长任务、更复杂视觉场景和实际 VLA 系统中的收益边界。

供稿材料 SOURCES — 1
01
Q-Learning With World Models arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-22 · 学术板块