Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.075 — 2026-09-17
PAPER HF 266 约 8 分钟

Dream-RSI:在进化世界里自我进化

Dream-RSI把探索历史变成低成本“梦境”,让Agent先复盘搜索策略,再回到真实任务继续发现。

你让一个团队在陌生城市里找最快路线。第一次,他们只能边走边试,难免钻进死胡同。第二次,如果只是把上次的游记塞给队员,帮助有限;更有效的做法,是把走过的路画成地图,让不同的行动方案先在地图上演练,再挑一个真正出发。

Dream-RSI做的事情很像后者。它面向的不是一次问答,而是需要成百上千次“提出方案—执行—评分—继续修改”的长期发现任务。此时,真正烧钱的往往不只是生成一个答案,而是决定下一步该沿哪条路线搜索。论文把过去的探索记录整理成可回放的模拟器,让Agent先在历史中低成本试验不同搜索策略,再把较好的策略部署到真实任务中。

这条路线被作者称为递归自我改进(Recursive Self-Improvement,RSI)——改进过程产生更强的改进方法,后者再推动下一轮改进。不过要先划清边界:Dream-RSI改进的是探索策略代码和编排方式,底层coding agent、评价器与模型参数都保持不变。本文数字与结论均来自论文作者报告,尚无独立复现材料可供交叉核验。

难题不是“会不会写”,而是“下一步试什么”

探索(exploration)指Agent主动尝试尚不确定、但可能更有价值的路线,而不是永远选择眼下最稳妥的方案。搜索空间小时,一套固定流程也许够用:同时开几条分支,每条不断修改当前最好方案。但任务变复杂后,固定策略可能反复把算力投向无效方向。

直接在线优化探索策略也很贵。评价一个候选程序,只要运行并打分;评价一种探索策略,却要看它经过许多轮选择后,最终能找到什么。这就是长程回报:某次决策是否正确,往往很久以后才看得出来。若每改一次策略,都要重新跑完整套真实实验,改进策略本身就会成为新的成本黑洞。

Dream-RSI因此增加了一个轻量级编排层。它不替coding agent写代码,而是决定从哪个已有方案继续、开多少并行分支,以及何时停止。换句话说,厨师没有换,变化的是负责安排“先试哪道菜、同时试几锅、何时收手”的领班。

把昨天走过的路,变成今天的模拟器

每次在线探索都会留下发现树。树根是初始工作区;每个节点记录一次生成与评估,包括继承自哪个方案、生成了什么、执行结果、诊断反馈、文件状态和得分。不同尝试由此形成多条分支。

论文最关键的转换,是不再把这些历史仅仅当作提示词或训练数据,而是把它们视为replay simulator——回放模拟器。候选策略可以在已记录的树上选择不同分支、改变访问顺序、调整并行组合,或者更早停止。因为节点结果已经保存,系统只需读取记录,不必再次调用coding agent,也不用重新执行昂贵评测。

作者把这个离线过程称为“dreaming”。它并不是凭空想象新结果,而是在已经发生过的历史范围内,重演“如果当时换一种搜索安排,会看到什么”。一次昂贵的在线探索,由此可以支持多次便宜的策略比较。这属于off-policy feedback——用其他策略产生的旧数据,评价当前候选策略。

离线评分同时考虑三件事:回放中找到的最好结果、代表多少次生成与评估的节点成本,以及是否有效利用并行批次。一个基于LLM的策略开发Agent阅读这些轨迹和分数,修改可执行的探索策略代码。系统随后从候选版本中选出历史平均回放分最高者,投入下一轮在线探索。

完整循环因此是:真实探索产生发现树;发现树进入模拟器池;候选策略在历史树上“做梦”;较优策略重新上线;新策略产生新的发现树,再扩充模拟器池。论文所谓“世界演化”,指的正是这个历史模拟器池持续增长,并不意味着环境会主动生成越来越难的新题。

它真的省下了多少试错?

论文在8项任务上测试了Dream-RSI,覆盖算法工程、数学优化和GPU kernel工程。主要受控基线是Recursive Fixed Exploration:两者使用相同的发现Agent、评价器、初始化和资源约束,第一轮采用同一套人工设计策略;区别是后续轮次中,基线保持策略不变,Dream-RSI会根据回放结果更新策略。

最完整的数字来自Lasso regularization path求解器。这个任务要为一组统计问题发现运行更快、同时保持数值正确的实现。搜索使用17个合成实例,最终在6个未参与搜索的数据集上检验泛化。

使用Gemini-3.1 Pro时,论文报告Dream-RSI把6个数据集的平均运行时间从固定探索的3587.1毫秒降至2931.0毫秒,同时把发现Agent调用量从550次降至317次。换成Gemini-3.7-Flash,平均运行时间从2516.7毫秒降至2350.6毫秒,调用量从3200次降至1879次。作者还报告,两套Dream-RSI产出的求解器在这6个数据集上都快于sklearn和glmnet;相较使用51,200次生成的SimpleTES,其调用量少了大约两个数量级。不过不同系统使用的模型与流程并不完全相同,这组跨系统比较不如受控基线直接。

数学优化实验包含Sum–Difference、Autocorrelation和Circle Packing三类任务。论文表格显示,Dream-RSI在Sum–Difference上由固定探索的1.144047提高到1.145427,在Autocorrelation上由1.456001提高到1.456375;Circle Packing两者同为2.635983。这里更像是“部分任务小幅改善、部分任务持平”,而不是全面跃升。

GPU kernel工程则测试VGG16、LayerNorm、ConvDiv和ConvMax,目标是在保持数值正确的前提下提高执行速度。原文声称,Dream-RSI在前两项以更少代数达到相近性能,在后两项于相近预算下获得更高性能;但供稿文本中的具体比例缺失,因此无法可靠给出幅度。

真正值得看的,是改进发生在哪一层

Dream-RSI最有意思的地方,不是又让一个模型多写了几版代码,而是把“怎样分配试错预算”本身变成了可修改对象。历史也不再只是供Agent阅读的笔记,而成为检验编排策略的实验场。这为长流程任务提供了一种现实折中:先用已经付过钱的数据筛掉部分差策略,再把在线计算留给更有希望的方案。

论文还报告了一个反直觉现象:把历史轨迹概括成高层方向,再直接写进提示词,会让固定探索和Dream-RSI都表现更差。作者据此推测,强烈的语义引导可能过早收窄搜索空间,妨碍多分支探索。相比告诉Agent“应该往哪里想”,回放模拟器更关注“怎样安排尝试”。

在ConvDiv案例中,策略也没有单向增加算力。随着性能提高,它先把评估尝试从110次降到50次;进展停滞后,又重新加大探索力度,并伴随进一步提升。这说明编排层学到的至少不是简单的“多试就好”,而是在节省与扩张之间切换。

局限与未知

  • 回放只能揭示历史树中已经记录的结果。它可以重新排列旧路线,却无法知道一条当时没走过的新分支会发生什么,因此模拟器并不是完整世界模型。
  • 离线选择保证的是:入选策略在固定历史上的平均回放分不低于当前策略。它不保证换到下一轮真实探索后仍然更好,也不等于获得通用的递归自我改进能力。
  • 目前证据来自作者论文。部分GPU实验数字在供稿文本中缺失,也没有独立复现或统计显著性材料。更准确的结论是:Dream-RSI展示了一种改进“探索编排层”的可行循环,而不是一个会重写自身能力的AI已经出现。

供稿材料 SOURCES — 1

← 返回 2026-09-17 · 学术板块