Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.044 — 2026-08-17
PAPER H 7 约 1 分钟

指令一多,模型会突然失守

多项要求单看都能做到,叠在一起却会突然失守;关键不是冲突,而是小失误不断相乘。

让 AI 写一封邮件:限字数、分三段、用指定语气、不能出现某些词,还得按固定字段返回。要求逐条看都不难,但叠到一起,模型可能不是慢慢变差,而是突然失守。这直接关系到 Agent 工作流和结构化输出——后者要求严格按 JSON、表格等格式交付,漏一个字段也可能让后续软件无法处理。

作者提出 Constraint Saturation Evaluation(CSE,一套逐步增加约束数量的程序化评测),用确定性规则检查答案,不让另一个语言模型充当裁判。评测覆盖 15 个模型、36 类约束,共执行 369,753 次检查。论文最值得注意的发现是:单条约束的通过率只会渐进下降,但“全部同时满足”的成功率会快速坍塌。一个在单项检查中通过率为 45% 的模型,面对八项约束时,全部完成的概率只有 5.7%。作者把这种跨过临界点后的骤降称为“相变”。

原因也比“要求彼此打架”更简单:论文称,各项失败近乎独立,小概率失误相乘后就变成整体崩溃。最强模型到七项约束时,整题成功率已低于 50%;15 个模型中有 12 个在三项或更少时便跌破这一线。预先规划没有推迟临界点,自我纠错和五次择优也只多撑一到两项。换句话说,调整指令排列未必管用,真正要补的是每一项要求的基础可靠性。上述效果均为论文作者报告。


供稿材料 SOURCES — 1

← 返回 2026-08-17 · 学术板块