Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.028 — 2026-08-01
PAPER 约 1 分钟

成分数据的缺失与删失统一建模

把缺失和检测限信息直接纳入 Dirichlet 似然,不必先填零或删整行。

一份预算表里,某项开支没填;一次汞检测中,某种成分只知道“低于检测限”。前者是缺失,后者是删失——仍保留一个范围信息,不能一律当成零。麻烦在于,这类成分数据描述“整体如何分配”,各项占比相加固定为一;经典 Dirichlet 分布虽能直接描述这种受约束的组成,通常却要求每一项都有确切数值。

Pillay 等人把缺失视为信息最少的一种删失,再用一套 EM 型算法——在未知数据与模型参数之间反复估计——把两者统一写进似然。方法直接在单纯形(所有非负且总和为一的组成所处的空间)上工作,同时估计 Dirichlet 参数并补全未知分量,不必先转换数据;按论文设定,每行只要有一个已观测分量即可参与拟合。

这项工作的价值,是让“没测到”和“只测到范围”贡献各自真正拥有的信息。作者在汞形态数据上报告,所得补值比对照方法更能保留已观察到的组成结构。不过方法针对随机粗化(CAR,即缺失或删失机制不依赖区间内的真实值);若未观测机制本身由真实值决定,就需要另行建模。


供稿材料 SOURCES — 1

← 返回 2026-08-01 · 数据板块