从PDF表格复制三个数字,粘进表格软件后却挤成一团;双栏论文抽出文字,左右栏还可能互相串行。问题不只是“读到字”,而是机器不知道哪些是标题、段落和表格,也不清楚正确的阅读顺序。扫描件还要先做OCR——把图片里的字形转成可搜索文字,但识字本身并不能恢复表格的行列关系。
据KDnuggets作者Shittu Olumide介绍,开源工具Docling的做法,是把PDF、DOCX、PPTX、Markdown、HTML等不同载体收束为统一的结构化表示。它像给下游约定一套共同语言:数据工程师可以围绕同一种结构编写切分、检索和导出逻辑,不必为每类文件反复定制解析器。这对RAG(先从资料库检索相关片段,再交给大模型回答)尤其关键,因为标题层级、表格或阅读顺序一旦在入口处损坏,后面的检索可能从一开始就拿错上下文。材料展示的是一套工程思路,未提供独立对比实验来说明其解析准确率。