数据足够多时,模型哪怕只进步一点点,也可能拿到很小的 p 值,看起来“非常显著”。但这只说明差异不像随机波动,不说明它大到值得采用。Longhai Li 的这篇预印本因此提出一种熵式 R²:用交叉熵——模型预测与真实数据分布之间的差距——衡量改进,再把结果压到 0 至 1,试图回答模型实际解释力增加了多少,而不只问“有没有增加”。
其中最值得注意的是预测版指标 R²_SVP。它在样本外评估模型,并按自由度修正“训练乐观偏差”——模型在参与训练的数据上往往显得格外优秀。作者沿 LASSO 的变量筛选路径测试该指标;LASSO 是一种会主动压低部分变量权重、借此筛选变量的方法。模拟中,配合数据拆分后,错误发现率从 80% 降至 6%,同时保留了全部真实信号的召回。这个结果仍来自作者自述,但它点出了评价模型时更实用的问题:检出的提升,究竟有多少是真正可解释、可泛化的提升。