Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.054 — 2026-08-27
PAPER H 3 约 1 分钟

模仿学习失败后,机器人自己改进

给模仿学习配一名Q评审员,让机器人从失败中继续进步

机器人照着人类演示学会叠杯后,一旦抓歪了,往往不知道怎样补救。行为克隆(Behaviour Cloning)只学习“这种情况该做什么动作”,失败记录不能直接拿来模仿。Q-Planning 想解决的,正是示范数据成为能力上限的问题。

它没有重训昂贵的机器人策略,而是给冻结的行为克隆模型配上一个较小的离策略 Q 函数——像一名评审员,估计每个候选动作往后能带来多大好处。机器人每次从原模型生成多个动作方案,再按 Q 分数做加权选择。关键在于,Q 函数不负责模仿,因此既能学习成功示范,也能吸收部署中的失败轨迹;后续迭代只更新这名“评审员”,不改原策略。

作者称,经过十轮自我改进,方法提升了所有受测的 LIBERO 与双臂 RoboTwin 基准分数;在两项接触密集的真实双臂任务中,也能在无人追加示范、行为克隆模型保持冻结的情况下,靠五轮自身执行记录改进。论文给出的真正亮点不是让机器人随意试错,而是把失败变成可用的判断依据,同时避开直接强化学习微调大型模型的高成本与不稳定性。


供稿材料 SOURCES — 1

← 返回 2026-08-27 · 学术板块