找一份带表格、扫描页或复杂排版的资料,先把图片转成文字,常会顺手丢掉版式线索。腾讯的 EVIE-Preview-4.5B 是一款视觉文档检索模型:它直接理解页面图像,为 RAG(先找资料、再让模型作答)完成前半段检索,提供了绕开 OCR(把图片文字转成文本)的新选择。
它最值得看的地方,是把一页文档保留成多组 128 维向量,而非压成一个宽向量。检索时,EVIE 再让查询与页面中的细粒度线索逐项匹配并汇总得分。这就是 ColBERT 式后交互,好比先分别整理问题和页面的多张索引卡,再逐张核对。模型页面称,这套表示比 2560 至 4096 维方案减少 8 至 32 倍的向量存储与索引成本;其 4.54B 参数模型在 ViDoRe V1+V2 基准上取得 85.93 nDCG@5,并在 ViDoRe V3 的八个公开领域中领先七个。上述效果均来自发布方自述,材料未提供独立复核结果。