Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.023 — 2026-07-27
REPO 102 STARS 约 1 分钟

PageIndex绕开向量库做RAG

PageIndex把长文档先整理成目录树,再让模型逐层推理检索,尝试绕开向量库与切块。

IMAGE — GitHub Trending(Python·日榜)

在一份很长的财报里找答案,常见做法像是把全文剪成纸条,再挑出“措辞最像问题”的几张。问题在于,文字相似不等于真正相关。PageIndex提供了另一条路线:不用向量库——把文本转换成数字表示后按相似度搜索的系统——而是让大模型沿着文档结构寻找答案。

它先把文档整理成树状索引,类似一份可逐层展开的目录;检索时,模型先判断哪些章节可能相关,再继续缩小范围,定位到明确的页码和小节。整个过程不做传统的人工切块,选择路径也更容易追溯。换句话说,它想模仿专家查长文档:先看目录,再带着问题翻到相关章节,而不是在一堆碎片里找近似句子。

这值得关注,因为它把RAG——先从指定资料检索内容,再交给模型回答——的重点从“相似度”转向了“推理相关性”。项目作者称其在金融文档问答基准FinanceBench上达到98.7%准确率,但该数字来自项目方引用的博客,材料未提供独立核查或具体对照设置。


供稿材料 SOURCES — 1
01
VectifyAI/PageIndex GitHub Trending(Python·日榜) · REPO
原文 ↗

← 返回 2026-07-27 · 开源板块