随访乳腺癌患者时,有些人只是观察期内没有复发,有些人则可能永远不会复发。两者在数据里看起来很像,却不是一回事:前者属于右删失——只知道复发时间晚于随访期;后者对应“治愈比例”。普通生存回归很难同时分清这两类人,并回答“较早、中等或较晚复发的人分别受哪些因素影响”。
Bo Han 等人在 JASA 论文中提出一套删失分位数回归方法。分位数回归不只看平均值,而是分别估计生存时间分布的不同位置。模型先用 logistic 模型描述一个人是否属于可能发生终点的“易感人群”,再对未治愈者建立线性分位数回归。最具体的一步,是把目标函数拆成三块:常规分位数回归的损失、重新分配删失记录权重的函数,以及处理未知治愈状态的另一组权重。这样仍能用较简单的最小化程序估计参数,并借助降维缓解变量增多带来的计算困难。作者还给出一致性和弱收敛等理论性质,并称模拟实验及乳腺癌研究展示了方法的实用性;供稿未披露具体效果数字。