做调查时,麻烦不只是“答卷少”,而是“缺了谁”:如果不愿回答的人与作答者系统性不同,直接统计就可能偏。常见补救是估计每类人的响应倾向——完成调查的概率——再让低概率但实际作答的人获得更高权重,代表相似的未答者。问题在于,用机器学习估计这个概率时,是否应该把训练和预测的数据隔开?
Alessandro La Rocca 的研究专门检验五折交叉拟合:把样本分成五组,每次用其中四组训练,再预测留出的一组,以减少同一批数据既训练又预测带来的过拟合。作者在固定总体、已知真值的蒙特卡洛模拟中设置了 90 种情形,每种重复 2,000 次,并改变样本量、响应率和响应机制;模型包括传统的 Logistic Regression,以及更灵活的 Random Forest 和 Gradient Boosting Machine。
这项工作的价值,在于没有预设“交叉拟合一定更好”,而是把它放进不同调查条件下比较。不过,现有供稿只披露了研究设计,未提供偏差、波动或最终优劣结果,因此目前还不能回答标题中的问题。