你问企业聊天机器人“火灾损失保什么”,手滑打错几个字,它可能就找不到答案;扫描合同里的 O 被识别成 0,也会造成同样结果。RAG——先从文档库检索相关片段,再让语言模型回答——最怕问题与材料在检索阶段彼此错过,后面的模型再聪明也无从作答。
Kezhan Shi 把这类脏文本分成三种:普通手误、快速输入带来的漏重音与缩写等转写噪声,以及 OCR——把扫描图片转成文字——造成的形近字符替换、断词错误。它们表面都像“拼错了”,成因却不同。传统拼写检查常用 Levenshtein distance,即计算一个词要增删改多少字符才能变成词典里的词,擅长修正偶发手误;但 OCR 错误可能成批出现,转写噪声也未必对应标准词典。
文章的判断是:不能指望拼写检查一招通吃,剩余差异往往要由 embedding——把文字映射成可比较的语义表示——吸收。语义检索通常比逐字匹配耐小错,但作者未在所给材料中披露统一的效果数字;实际系统仍需按噪声来源分别处理查询与文档。