你问公司 AI“现在还能不能退货”,它却翻出一份已经作废的旧政策。回答看着流畅,证据却找错了。这正是 RAG(先从资料库找相关段落,再交给大模型回答)上线前容易漏掉的问题:常规题目能通过,不代表真实世界里的脏文档和含糊查询也能应付。
据 Towards Data Science 介绍,Sara Nobrega 用 4 份短文档和一个按共同词语计分的简化检索器,搭了一套小型对抗测试。测试故意放入新旧政策并存、OCR 字符误识别、查询拼写错误和跨页破碎表格。最直观的一例是:新旧退货政策得分相同,检索器仅因列表顺序选中了旧版;加入更新时间后,系统才会优先返回新政策。
这套做法的价值不在规模,而在定位故障。文章建议分别检查“有没有找对文档”和“取回片段里是否仍保留答案证据”,从而区分排序失误与文档切分、抽取失误。说白了,先用少量故意刁难系统的题,把用户迟早会撞上的坑提前暴露出来。