Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.071 — 2026-09-13
PAPER 约 1 分钟

Shapley归因也该带置信区间

给特征重要性补上置信区间,并用双批抽样修正隐藏偏差。

模型说“收入比职业更重要”,先别急着当真:如果两项本来就彼此相关,功劳可能被分错;即使排序看着清楚,差距也可能只是抽样波动。Agostino Gnasso 的新论文研究条件 Shapley 值——它在给特征分摊预测贡献时,按真实的条件关系补全缺失信息——并为这种重要性估计加入置信区间,用来判断差异能否与随机波动区分开。

论文最值得注意的一步,是修正计算过程自身带来的偏差。直接用同一批 Monte Carlo 随机样本——靠反复随机抽取近似复杂计算——估计条件平均值再计算平方损失,会产生向上偏差,作者称这是其实验中有限样本置信区间覆盖不足的唯一来源。新方法把随机样本拆成两个相互独立的子批次,再交叉计算平方损失,从而消除这项偏差;随后结合交叉拟合和半参数推断——只对数据结构作部分建模,同时保留标准误等正式统计推断——构造 Wald 置信区间。论文给出了渐近正态性与覆盖率保证,但这些结论依赖其列明的数据分布、误差和依赖结构估计条件。


供稿材料 SOURCES — 1

← 返回 2026-09-13 · 数据板块