Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.097 — 2026-10-09
PAPER H 20 约 1 分钟

临床模型高分,可能只是数据泄漏

复现慢性肾病分类发现:高分经防泄漏后仍在,但并不等于临床可用。

模型考试拿到近乎满分,先别急着叫好:如果整理数据时让它提前看见了测试集,就像考前见过题。Yang 与 Zhao 复现一项慢性肾病分类研究,用含 400 条记录、24 个预测变量的 UCI 数据集,先封存 30% 样本,再让缺失值填补、编码、标准化和特征选择只从训练数据学习,避免“数据泄漏”。

在这套控制下,表现最好的流程仍取得 0.9869 的重复交叉验证准确率,在封存样本上为 0.9833。不过,重新把“挑选最佳流程”也纳入评估后,准确率降至 0.9845,比原先低 0.0095,说明选模型这一步本身也会带来乐观偏差。更值得警惕的是,只看哪些字段缺失,ROC 面积——衡量区分两类能力的指标——就达到 0.85 至 0.88。

作者因此认为,高分不只来自泄漏,也高度依赖贴近诊断的化验、尿检变量及缺失模式。这仍只是锁定的历史内部样本,不是临床验证;能否用于新患者,还要靠外部、前瞻性评估。


供稿材料 SOURCES — 1

← 返回 2026-10-09 · 数据板块