Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.099 — 2026-10-11
PAPER H 23 约 1 分钟

LLM开始共同进化RL算法

RLDISCOVER让LLM改写并筛选强化学习算法,用分阶段测试压低搜索成本。

给游戏角色设计训练方法,过去常像调旋钮:改学习速度、批次大小,却不动学习规则本身。RLDISCOVER更进一步,让大语言模型直接改写强化学习(RL——智能体靠奖励和惩罚摸索策略)算法的代码组件,再通过实验筛选更好的版本。

它最巧的一点,是没有一开始就让模型同时乱改所有地方。系统先分别改动观察处理、学习目标、损失函数等五类组件,找到各自有希望的方案;随后再允许它们组合演化,处理组件之间的相互影响。这就是“共同进化”:搜索对象不是几个超参数,而是算法如何学习。

筛选也分三档:先用较短训练和单个随机种子粗筛,再逐步增加训练量与重复次数。随机种子是训练随机过程的起点;论文中,同一方案仅因种子不同,得分就从2.9跳到2887.3,又降至3.9。作者报告,在一组SAC运动控制实验中,这套流程评估约230个候选程序用了约87 GPU小时;若全部完整训练,估算需1330 GPU小时。结果仍属作者实验,代码和数据拟在论文接收后公开。


供稿材料 SOURCES — 1

← 返回 2026-10-11 · 学术板块