假设医院想判断某个基因是否与病情有关,却只有少量本院病例;院外倒有更多数据,但患者群体并不相同。直接混在一起,可能不仅帮不上忙,还会制造假阳性。CRT*瞄准的正是这个难题:怎样借用异质的外部数据,提高发现真实关系的机会,同时控制一类错误——其实没关系却判成有关系的误报。
它改造了条件随机化检验(CRT):固定结果和其他变量,反复为待检变量生成“替身”,看真实关联是否异常强。关键是替身必须像真的。CRT用平滑残差自助法配合迁移学习,从无标签数据中学习变量分布;再用数据驱动的权重融合内部与外部队列,避免把差异较大的数据硬凑在一起。在论文的一组实验中,CRT的一类错误率为 0.044,低于名义水平 0.05;作者还从理论上证明,它在高维条件下可保持渐近误报控制,并比不借外部数据的标准 CRT 获得更高功效。具体收益仍取决于不同数据源的差异程度。