处理一摞 PDF,最浪费的做法是每份都先做 OCR。OCR——把图片里的字识别成文本——适合扫描件,却比直接提取已有文字更耗时。Firecrawl 的开源 Rust 库 pdf-inspector 先给 PDF 分型:文本型、扫描型、图像型或混合型,再按页面决定是否转入 OCR。据项目方统计,约 54% 的 PDF 不需要 OCR;分类通过抽样检查内容流完成,约需 10—50 毫秒,并会给出置信度。
对文本型 PDF,它还能在本地提取文字及位置,整理多栏阅读顺序、标题和表格,再转成 Markdown;整个过程不调用 OCR。项目同时提供 Python、Node.js 和浏览器 WebAssembly 接口,后者可让解析直接在网页端运行。项目方在 200 份 PDF 上、关闭 OCR 后测试称,pdf-inspector 总分为 0.875,完整处理耗时 0.470 秒;测试使用 Apple M4 Pro,结果更新于 2026 年 7 月 31 日。这个库的价值不只是“解析更快”,而是先把文档送对窗口,避免为本可直接读取的 PDF 支付 OCR 的时间与服务成本;上述比例和性能仍来自项目方自测。