好比想研究一种罕见星系:手里真正相关的样本很少,旁边却放着海量普通星系数据。后者当然有用,但两类星系并不相同,不能直接混在一起。问题因此不是“数据够不够多”,而是其中多少信息真的能迁移过来。
Yen-Chi Chen 比较了两种借数据的方法。逆概率加权(IPW)会给辅助样本重新分配权重,让它更像目标人群;但权重是否准确,仍受微小目标样本限制。全似然(FL)则把两个来源的生成关系放进同一个模型,同时估计共享参数。论文的高斯模拟中,FL 对方差参数的均方误差接近 IPW 的百分之一;理论分析进一步指出,在参数满足特定“正交”关系时,部分参数的估计精度可以随海量辅助样本增长,而不再只由目标样本量决定。
这也划出了边界:并非所有参数都能获得同等收益。辅助数据再多,也不会自动消除两个人群之间的系统性差异;全似然依赖模型关系成立,模型设错仍可能把迁移偏差带进结论。