让 AI 读 PDF,最麻烦的不是完全读不出,而是漏掉表格或图形后仍自信作答。这篇案例接续本刊昨日介绍的“先便宜解析、失败再升级”:普通文字先交给 PyMuPDF,单页约 5 毫秒;只有流水线发现答案依据不足,才启用更重的工具。作者称,视觉语言模型——能同时理解页面图像和文字的模型——处理同一页可能慢到 10 秒,成本高出一万倍,因此不适合全量使用。
案例展示了两条升级路径:扁平表格由 Azure 文档解析服务重新恢复版面结构;普通解析器看不懂的图形,则交给视觉语言模型这道最后防线。流水线还会在生成阶段检查模型的自我评估与答案是否有材料支撑,并据此回头重解析。配套示例中,补入结构化上下文后,回答由错转对。不过作者也强调,模型自评既昂贵又不稳定,不能单独充当失败判据。