同一个家庭,今年和去年的住房估值不同,并不代表哪次填错了。但传统数据合并常把其中一个值当成噪声,结果可能连“这是同一家”也判断错。实体解析——在没有统一编号时,判断多条记录是否属于同一对象——因此不只是去重,还要容纳事实随时间或来源变化。
Kim、Kaplan 与 Koslovsky 提出的 CHOMPER,关键改动是放宽“命中”的定义:记录不必与隐藏的真实值完全相等,只要落在依据领域知识设定的局部范围内,也可视为合理真值,而非随机错误。比如两次调查中的教育状态确实发生变化,模型可以保留这种差异,同时继续判断两条记录是否属于同一个人。
这是一种贝叶斯实体解析方法——把记录归属和属性取值都表示为概率。它还能同时处理多类数据,并提供 MCMC(反复抽样来逼近概率结果)和面向大规模数据的变分推断两种计算方案。作者认为,这能避免高估数据失真率并改善匹配;具体收益仍取决于为各字段设定的合理变化范围。