Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.040 — 2026-08-13
PAPER 约 1 分钟

长程Agent的五道断层

AI会推理,却常做不完几小时的任务:问题分散在规划、记忆、执行、训练和评测五环。

让 AI 改一个小错误,它可能很利落;让它连续工作几小时,它却可能忘掉早先决定、偏离目标,甚至把半成品当成完成。这篇综述把这种“单步会做、长程做不完”的落差称为“长程断层”。长程任务是许多步骤彼此牵连的任务;Agent 则是在语言模型外加工具、记忆和执行循环,让它能持续行动。

作者梳理了 2024—2026 年的 1,547 篇 arXiv 论文,指出故障不能笼统归为“推理不够强”:规划负责拆步骤,记忆保存状态,执行负责落实与出错恢复,训练塑造多步行为,评测则判断任务是否真的完成。五环任何一处失守,最后都可能失败。更关键的共同趋势是:任务越长,只看最终成败或给一次总奖励,信息越少;研究者因此转向检查整条行动轨迹,为每一步提供更密集的反馈。作者也提醒,模型本身和外围执行系统各贡献多少能力,以及训练与评测是否共享同一种偏见,仍未解决。


供稿材料 SOURCES — 1

← 返回 2026-08-13 · 学术板块