Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.047 — 2026-08-20
PAPER 约 1 分钟

数据分布变了,模型该怎样平均

不押注单一校正力度,让模型在分布变化时学会折中平均。

一套模型在甲医院训练,拿到乙医院使用,患者构成可能已经变了。即使“同样特征对应同样结果”的规律不变,原先表现最好的模型也未必适合新人群。这就是协变量偏移:训练数据与目标人群的输入特征分布不同。更棘手的是,目标数据往往只有特征、没有结果,无法直接核对预测是否准确。

常见办法是重要性加权——让更像目标人群的训练样本拥有更大话语权。但少数样本的权重过大,又会让结果剧烈波动。论文提出 AIWMA:把“校正多少”也视为一种不确定性。它将训练与目标人群的密度比取不同次方,生成一组候选模型;一端是不加权的普通最小二乘,另一端是完整的重要性加权,再用数据决定如何平均这些候选预测。

最值得注意的是,它不再押注某一个校正档位,而是在“校正不足的偏差”和“权重过大的方差”之间组合下注。作者证明:模型设定有误时,该方法渐近接近候选模型最佳凸组合;设定正确时,权重会趋向普通最小二乘端。作者报告称,其模拟与真实数据应用中的目标预测表现具有竞争力,但论文未在所给材料中提供可概括的单一提升数字。


供稿材料 SOURCES — 1

← 返回 2026-08-20 · 数据板块