Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.026 — 2026-07-30
PAPER 约 1 分钟

连续控制不能照搬GRPO

四旋翼实验提示:GRPO能否学会连续控制,关键可能不在奖励,而在动作接口。

让 AI 开四旋翼,直接要求它每次报出精确速度,看似比只给几个按钮更灵活,结果却可能一步也学不会。Filatov 等人用 GRPO——让模型多次尝试,再按组内表现优劣更新——训练 Qwen2.5-0.5B-Instruct。连续输出速度时,模型很快只报“零动作”:策略熵,也就是动作选择的多样性,在约 60 步内从 0.35 降至 0.03,最终成功率为 0%。

研究者分别去掉了飞行平顺度惩罚和限制模型偏离原始习惯的 KL 约束。两种改动都阻止了多样性崩塌,却仍没让模型学会控制。真正改变结果的是把连续数值换成五个预设选项,如巡航、刹车和悬停,再交给 PID——一种经典反馈控制器——执行。作者报告,训练 64 步后成功率达到 98.6%,平均加加速度为 0.656 m/s³;训练到 256 步则达到 100%,但动作更不平顺。

这说明,动作离散化可能是 GRPO 在这类小模型控制任务中获得稳定学习信号的关键,而不只是接口偏好。不过结论来自特定仿真设置;重新调参的传统 PID 同样达到 100% 成功率,且平均加加速度更低,因此实验更像是在说明 GRPO 怎样才能学会,而不是证明语言模型更会飞。


供稿材料 SOURCES — 1

← 返回 2026-07-30 · 学术板块