让 AI 在一小摞文件里找答案,逐份翻看可能很聪明;文件堆成几十万份后,这种办法就未必划算。Wang 等人把检索增强生成(RAG——先找资料,再据此回答)的四条路线放到同一条规模轴上比较:按关键词匹配的 BM25、按语义相似度找内容的稠密检索、沿实体关系查找的图检索,以及让模型多步决定怎么查的 Agent 搜索。
实验固定 500 个问题、相关证据和干扰材料,只把语料从 1,144 份文档逐级扩至 511,959 份,共 28 档、约 450 倍。作者报告,File-System Agent 在最小规模领先,但在约 1,000 万语料 token(模型处理文字的基本单位)处被 BM25 反超;到 6.01 亿 token 时,BM25 的准确率优势接近 20 个百分点。Agent 在最小档的查询 token 消耗已是 39 倍,图检索还可能先撞上建库成本墙。
这项研究最实用的结论不是“老方法永远最好”,而是规模会改写胜负:语料越大,先对全库统一排序越重要。复杂推理更适合接在候选资料筛选之后,而不是代替检索本身;上述结果均为论文作者自述。