想判断收入和消费是否存在某种弯曲、隐蔽的联系,常用办法是反复打乱两者的配对,看原结果有多罕见。问题在于,若要估算百万分之一量级的 P 值——结果纯属偶然的概率——就得打乱极多次,样本一大尤其昂贵。
Dominic Edelmann 的工作改走“谱近似”:从中心化距离矩阵的特征值出发,近似独立时统计量的零分布。最实用的一步是,不必算完两个矩阵的全部特征值;算法先用 Lanczos 方法找出较大的部分,再利用尚未计算部分的总量,为 P 值给出上下界。界限足够接近,或已经能确定检验是否通过,就提前停止。
论文还用收缩方法校准近似分布的前两个矩,让有限样本下的 P 值更准。作者的模拟显示,除昂贵的 Monte Carlo 方法外,这套检验的实际误报率会趋近设定水平,且中等样本下优于已有近似;但很小样本仍会出现问题。