把一份夹着表格、公式和图片的 PDF 直接交给 AI,就像把一叠散页塞给助理:字或许读到了,顺序和关系却可能乱掉。Docling 做的正是前置整理。它先识别页面布局、阅读顺序、表格结构、公式和图片,再把内容交给 RAG——一种先从外部资料检索信息、再让模型组织答案的方法。
它的实用之处在于,不只处理 PDF,也覆盖 DOCX、PPTX、网页、图片、音频、视频和邮件等多种格式,并将它们转换为统一的 DoclingDocument 内部结构。这样,下游的检索、导出和生成式 AI 流程不用逐一适配每类文件。项目还支持 OCR(从扫描件或图片中识别文字)、本地运行,以及 LangChain、LlamaIndex 等工具集成。
Docling 当日新增 152 星,说明开发者对这道“资料入库前工序”的关注仍在升温。项目页面列出了广泛能力,但未提供本次热榜对应的统一效果评测;更稳妥的判断是,文档解析与清洗仍是 RAG 落地中绕不开的基础环节。