把 PDF、网页和扫描件交给搜索或 AI 之前,往往要先把其中的文字与结构“拆”出来。Xberg 正是做这一步的内容抽取框架:它把不同格式统一成下游程序较容易处理的内容。作者称,Xberg v1 是 Kreuzberg 的继任者,相当于原计划中的 Kreuzberg v5;目前可处理 101 种文档格式、367 种代码和数据格式,也覆盖音视频转写及静态或由 JavaScript 渲染的网页。
这次更新里,值得文档管线团队留意的是 PDF 路径。Xberg 会逐页判断页面是否像扫描件,只对需要的页面启用 OCR——即把图片里的字识别成文本;原生 PDF 则直接读取文字,避免把整份文件一律当图片处理。它还换用纯 Rust 的 PDF 后端,并加入版面识别和阅读顺序重建。作者称新版在性能、准确率和稳定性上有所提升,但供稿未附基准数据,暂时无法独立比较。