从成千上万个候选指标里挑出少数“有用”的,试得越多,越容易把巧合当发现。Mehler、Koka 和 Muma 提出一种筛选办法:加入按设计与结果无关的“虚拟哑变量”,让它们和真实变量同场竞争;若空变量频繁胜出,就说明门槛太松。由此可校准假发现率(FDR)——所有入选变量中,错误发现所占比例的期望。
最巧的一步是,方法不必把庞大的虚拟变量矩阵完整存进内存。它只逐步生成筛选当下需要的投影信息,等某个虚拟变量真的入选,才还原完整向量。作者证明,这条“虚拟”筛选路径在分布上等同于显式加入全部哑变量,因此可在原有假设下继承FDR保证。新方法覆盖 Bernoulli、Poisson、多分类等广义线性模型(GLM),也覆盖处理删失生存时间的 Cox 回归;但保证依赖空变量之间相互独立、且与有效变量独立等假设。