Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.034 — 2026-08-07
NEWS 约 1 分钟

RAG恢复PDF目录:规则提名,模型把关

先用排版规则找标题,再让LLM剔除误报,为缺目录的PDF补回可控结构。

IMAGE — Towards Data Science

一份PDF没有目录,就像一本书撕掉了目录页:人还能从大号、粗体标题看出章节,检索系统却容易只捞到脱离上下文的零散句子。这项管线要补回的正是目录树——标题及其层级关系。它位于RAG入口;RAG是先检索文档材料,再让语言模型据此回答,因此目录结构会直接影响内容如何按完整章节切分和召回。

做法不是让大模型通读全文后猜结构,而是先用字体大小、粗细和位置等排版信号提名标题,再让LLM(大语言模型)只判断这些候选是真是假、处于哪一层。规则便宜、范围明确,却可能把图注或醒目正文认成标题;模型负责处理这类模糊处。作者展示的可运行案例把《Attention Is All You Need》论文处理成24个候选,其中21个是真标题,另外3个误报由LLM验证剔除。

这套方法还被放在一条“便宜方案优先”的级联流程末端:先尝试PDF自带目录、带链接或纯文本的目录页,都没有结果时,才启用正文排版恢复。它也能用于补深不完整目录或处理拼接文档,但材料未提供更广泛的准确率、成本与跨版式测试,实际稳定性仍待验证。


供稿材料 SOURCES — 1

← 返回 2026-08-07 · 数据板块