扫描版合同里有表格、印章和错落的段落,普通 OCR 往往只能“抄字”,却说不清阅读顺序和版面关系。PaddleOCR 想把这一步做完整:它面向百余种语言,把 PDF 与图片解析成 JSON 或 Markdown 等结构化数据,让大模型能够继续检索和处理。对 RAG——先查外部资料、再据此回答——来说,这正是在清理最上游的数据入口。
项目目前用 PaddleOCR-VL-1.6 处理复杂文档。这是一款 0.9B 参数的视觉语言模型,即同时理解页面图像、文字与布局的模型。项目方称,它在 OmniDocBench v1.6 文档解析基准上达到 96.3% 准确率,并能识别文字、公式和表格;PP-StructureV3 还可给出表格单元格与文字坐标。多语言方面,PP-OCRv6 的单一模型覆盖 50 种语言,无需按语言切换模型。上述效果与“领先”判断均来自项目方公开说明,材料未提供独立复核结果。