Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.052 — 2026-08-25
NEWS 约 1 分钟

AI调试的盲点,往往是没看到信息

28组实验显示:AI调试怕的未必是难题,而是缺少关键上下文。

IMAGE — Towards Data Science

AI 修复杂程序,未必比修“小毛病”更容易翻车。就像让人修一台机器,却没告诉他接口原本该怎么接:推理再强,也可能把错误方案做得很像正确答案。Nhu Hoang 对 ky、immer 和 decimal.js 的三个真实缺陷进行了 28 次盲评——评判者不知道实验条件,以减少先入为主。结果显示,两个看似棘手的缺陷在 16 次尝试中全部修对;一个看似简单的 HTTP 客户端选项问题,却在 12 次尝试中全部失败。

更值得警惕的是,这 12 个错误补丁都通过了完整的 84 项重试测试,却会破坏用户数据。作者认为,关键差别不是程序复杂度,而是信息是否可见:前两个问题能从代码库和缺陷报告中推断答案,后一个则依赖未写明的 API 约定。Coding harness——把模型、代码库、工具、测试与反馈串起来的运行框架——若没有暴露这类上下文,AI 便可能在“测试全绿”时自信交出坏修复。一次实验中,评审代理甚至识别出数据风险,最后仍批准了补丁,说明增加流程也未必补得上判断缺口。以上结论来自作者对这 28 次实验的自述,样本仅覆盖三个缺陷。


供稿材料 SOURCES — 1

← 返回 2026-08-25 · 数据板块