把一摞PDF交给AI做知识库,第一道难题不是“会不会回答”,而是能否先把文字、段落和位置读对。LlamaIndex团队的LiteParse正是为此而来:它是一款开源、本地运行的文档解析工具,主打快速、轻量,不依赖云服务或专有大模型。解析结果可保留边界框——也就是文字在页面上的坐标,方便后续搜索和RAG(先从文档库检索资料,再让模型作答)理解内容顺序与位置。
LiteParse以Rust为核心,通过PDFium提取原生文字,并可按需调用内置Tesseract或外部服务做OCR——把扫描页里的字转成可搜索文本。它还能先低成本判断文档是否需要OCR或更重的解析,再决定继续、拒绝或转交;输出支持Markdown、JSON和纯文本,可从Rust、Python、Node.js/TypeScript及浏览器调用。定位也很明确:普通PDF尽量在本机快速处理,密集表格、多栏排版、图表、手写或扫描文档则建议交给云端LlamaParse。项目页面未给出速度基准,因此“高速”目前更多是产品定位,而非已有数字验证的结论。