在一份很长的财报里找答案,常见做法像是把全文剪成纸条,再挑出“措辞最像问题”的几张。问题在于,文字相似不等于真正相关。PageIndex提供了另一条路线:不用向量库——把文本转换成数字表示后按相似度搜索的系统——而是让大模型沿着文档结构寻找答案。
它先把文档整理成树状索引,类似一份可逐层展开的目录;检索时,模型先判断哪些章节可能相关,再继续缩小范围,定位到明确的页码和小节。整个过程不做传统的人工切块,选择路径也更容易追溯。换句话说,它想模仿专家查长文档:先看目录,再带着问题翻到相关章节,而不是在一堆碎片里找近似句子。
这值得关注,因为它把RAG——先从指定资料检索内容,再交给模型回答——的重点从“相似度”转向了“推理相关性”。项目作者称其在金融文档问答基准FinanceBench上达到98.7%准确率,但该数字来自项目方引用的博客,材料未提供独立核查或具体对照设置。