Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.056 — 2026-08-29
NEWS 2 信源 约 4 分钟

AI开始改造自己,十项测试全涨分

Anthropic让AI自动设计对齐训练,十项特定测试均涨分;这不是“自我觉醒”,却让递归改进首次变得可测。

IMAGE — TechCrunch · AI

你让一名助手替另一名助手纠正坏习惯。它先翻资料,提出训练办法,试半小时,再看效果:有用的留下,没用的丢掉。循环几轮后,十种坏习惯都减轻了,原本的办事能力也没有下降。Anthropic 新论文展示的,大致就是这样一套自动化流程。

值得注意的不是“AI突然学会改写自己”,而是一个长期停留在概念层面的问题,开始被拆成可重复测量的实验:AI能否参与改进另一套AI,并让改进后的系统继续承担优化工作。论文把这称为迈向递归自我改进的一步。不过,本文数据均来自 TechCrunch 对同一篇 Anthropic 论文的转述,目前没有材料显示已有独立复现。

它改的不是智力,而是行为边界

这项研究关注的是对齐——让AI的行为符合人类意图、规则和安全目标。研究团队给自动系统十项 benchmark,也就是采用固定任务和评分方法的测试集。每项测试针对一种特定的失准行为,并非数学、写作或编程等十类通用能力。

由 Anthropic fellow Chen Yueh-Han 牵头的系统名为 Automated Alignment Researcher,简称 AAR。它先检索已有文献,再提出一种训练方法,并用这种方法训练模型30分钟。随后,它根据测试表现决定去留:有效方案被保留,无效方案被淘汰,再进入下一轮迭代。

可以把它理解成一间高速运转的小型实验室。AAR不只是生成一个听起来合理的点子,还要把点子变成训练实验,并用结果筛选下一步方向。按照论文披露的数据,它在十项针对特定失准行为的测试上全部提高了成绩,同时没有降低 overall performance,也就是研究采用的整体表现指标。

但“整体表现没有下降”仍需谨慎理解。现有材料没有说明它具体包含哪些指标,也没有提供误差范围和统计显著性。因此,这句话能支持“实验中未观察到整体能力受损”,却不能外推为模型在所有场景都毫无代价。

六小时胜过人类,意味着什么?

论文给出了一个很抓眼球的比较:AAR找到的最佳方法,平均能在六小时内超过有经验的人类研究者提出的方法;由人类指导研究方向,也没有得到更强表现。成本对比同样悬殊:论文估算AAR的API推理费用约为每小时4美元,而人类研究者报酬为每小时150美元。

这组数字说明,至少在范围明确、评分清楚的对齐任务上,自动系统可以快速并行试错。机器的优势未必是每个想法都更聪明,而是它能持续搜索、训练、评分和淘汰,不必把大量时间耗在逐项执行上。

不过,这还不能推出“人类AI研究者即将被替代”。每小时4美元只计算API推理费用,未必涵盖测试设计、训练基础设施、监督、失败实验,以及人类此前生产文献和方法知识的成本。材料也没有交代参与比较的人类样本规模和评测是否采用盲法。论文的成本数字更适合看作特定实验流程的运行费,而非完整的人机经济账。

为什么这一步值得看

过去谈递归自我改进,容易一步跳到“AI全面升级AI”。这项工作的价值恰恰在于收窄问题:先选定可描述的失准行为,再让自动系统查资料、提方案、做训练,最后用固定测试决定是否保留。

这样一来,“AI改进AI”不再只是关于未来能力的争论,而成为一条可以检查的实验链。十项测试全部涨分,说明这套流程并非只对某一个精心挑选的问题有效;没有观察到整体表现下降,也回应了一个现实担忧:修正一种行为时,会不会把模型其他能力一并削弱。

但标题里的“改造自己”只能当作简写。AAR是在为模型设计对齐后训练方案,并不是模型直接修改自身权重,更不是已经实现了通用的递归自我改进。它展示的是一个早期、受约束的自动研究闭环。

局限与未知

  • 成绩取决于 benchmark 是否真的代表对齐目标。若系统利用评分漏洞,涨分可能只是更会考试,而非真实行为改善。
  • 建立和维护测试集、扩充文献库仍需要大量工作,这些成本没有包含在每小时4美元的对比中。
  • 现有材料未提供十项测试的具体内容、整体表现指标、误差范围及独立复现结果。论文证明的是一套流程在特定实验中的潜力,不是通用自我改进已经到来。

供稿材料 SOURCES — 2

← 返回 2026-08-29 · 科技板块