Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.056 — 2026-08-29
PAPER H 26 约 1 分钟

缺失标签,也可能泄露信息

当“未标注”偏偏出现在难判断的样本上,缺失本身也成了分类线索。

想象医生更容易把拿不准的病例留空。此时,“没有诊断标签”并非随机遗漏,而是在暗示:这个病例可能靠近两类之间的分界线。Wang、Wu 与 McLachlan 研究的正是这种半监督分类——用少量有标签样本和大量无标签样本训练分类器——并提醒我们,常见方法若只利用无标签样本的特征,就可能漏掉一条现成线索。

论文最关键的一步,是把 Fisher 信息——数据对模型参数提供的精确信息——拆成两部分:部分标签原本提供的信息,以及“为何缺失”这一机制额外带来的信息。模型设定正确时,后者是非负的;换句话说,若标注是否缺失取决于分类器的不确定性,缺失指示本身也能帮助估计决策边界。作者还讨论了标签模型和缺失机制都可能设错时的稳健协方差分析。

边界也很重要:作者称,在相同标注预算下,这类机制可能优于随机留空或普通全标注基线,但信息量不能超过同时观察全部标签和缺失机制指示的“增强实验”。论文以 Gaussian mixture 和内镜诊断案例作说明;现有材料未给出具体提升数字。


供稿材料 SOURCES — 1

← 返回 2026-08-29 · 数据板块