把一页双栏报告交给普通 OCR,它也许能认出字,却未必知道标题属于哪段、脚注该接在哪里。NVIDIA Nemotron Parse 2.0做得更进一步:输入文档图片和任务提示后,一次输出文字、版面类别、边界框与阅读顺序,把页面还原成机器可读的结构。边界框是页面元素的位置坐标,阅读顺序则告诉系统多栏、图表和脚注应该怎样串起来。
这对 RAG 和文档 ETL 很关键。RAG(检索增强生成)要先从资料库找内容,解析结果会影响资料如何切分和检索;ETL 则负责从 PDF、扫描件等抽取、整理并写入数据库。相比 v1.2,新版扩充了约 2 万个词元的词表,以提高多语言处理效率;还新增图表类别,可识别图表区域,并把可见信息转成结构化文本。模型页面同时称,它加强了中日韩及印度文字、手写内容和复杂表格的处理,但未提供本文可独立核查的评测数字。