把PDF交给AI之前,往往得先把文字、段落和版面位置拆出来。否则双栏文章、标题与正文可能混在一起,后续搜索也更难找准内容。run-llama推出的开源工具LiteParse,正是为这一步而来:它以Rust为核心,在本机解析文档,不依赖云端服务或专有大模型,适合搭建RAG(先检索资料片段,再让模型据此回答)的摄取管线。
LiteParse用PDFium提取文字,并保留bounding box——标记文字在页面所占矩形区域的坐标。它可输出Markdown、JSON和纯文本,也能按需接入内置Tesseract或外部OCR(把图片中的字识别出来),并预先判断文档是否需要更重的处理。开发者可从Rust、Python、Node.js/TypeScript或浏览器调用。边界也很明确:项目方称,密集表格、多栏排版、图表、手写内容和扫描件仍更适合其云端LlamaParse;材料未提供速度或解析质量的量化测试。