两条姓名相近、地址不同的资料,到底是同一个人,还是碰巧相似?记录链接与去重系统会先做判断,但人工不可能逐对核查。新研究把这种“人工复核”改造成一次有计划的抽样调查:先按匹配分数、字段比较方式、记录歧义程度和人口群体细分候选对,再把有限名额分配给不同组,尤其关注最难判断的区域。
作者在一组含 5 万条记录、约 47.8 万个候选对的数据上测试。基准方案复核约 23%,预算受限方案只复核约 7%。后者的整体估计误差约翻倍,最大误差出现在中等分数区间——匹配、不匹配和含糊案例正好混在一起;但最高分区间的准确性和各分数区间的歧义分布大体保住了。代价是,对字段比较模式和性别的代表性有所下降。
关键在于“设计型推断”:系统记录每类样本被抽中的概率,再用权重推回总体,因此多查疑难记录也不必牺牲整体估计。论文把预算、精度、代表性与疑难覆盖之间的取舍摆到了明面上。以上结果来自作者在单一标注数据集上的实验。