做搜索或 RAG(先找资料、再交给 AI 回答)时,模型答不好,未必是它不会,也可能是第一步就没找对文档。Abdullahi Dattijo 用一台 16GB MacBook,本地复现了三类常见检索基线:按关键词稀有度和匹配程度排序的 BM25;把文本变成数字向量、按语义距离找内容的稠密检索;以及用神经网络扩展和加权词语、但仍保留稀疏索引形式的 SPLADE。
他采用 Castorini 维护的 Foundations of Retrieval 练习路径及 Anserini、Pyserini 工具,在 MS MARCO 和较小的医疗数据集 NFCorpus 上运行。作者称,所有结果都对上了练习给出的预期分数;但过程遭遇内存耗尽、原生库崩溃,以及“有 API key 仍不够”的受限模型访问问题。价值正在这里:复现基线不只是跑出一个数字,还要确认环境、索引和评分流程没有悄悄改变实验含义。