一次公平审计发现,某个群体的通过率低了几个百分点,要不要立刻停用或重训模型?未必。小群体样本少时,差距可能只是随机波动;即使差距在统计上可信,也不代表影响大到值得马上改产品。问题不只是“有没有差距”,而是证据是否足以支持行动。
Fan 和 Wang 提出 Statistical Actionability(统计可行动性),在公平指标与部署干预之间加一层决策:同时考虑差距大小、统计可靠性、群体样本是否充足,以及具体场景下误判和干预的代价,再给出四种建议——修正模型、继续收集数据、持续监测,或暂不行动。关键是,它不会把同样大小的差距一律处理:证据扎实时可触发修正,样本不足时则先补数据。
作者称,在受控模拟中,这套方法相比“看到差距就干预”把平均决策成本降低了 19.2%,同时减少误报和漏掉偏差;校准后的规则在五种迁移环境中的四种里,与理想决策基准相差不超过 2%。不过这些结果主要来自模拟与基准审计,能否在真实部署中成立,还取决于各团队如何设定伤害成本和行动门槛。