假设一份招聘数据里,某项特征恰好把“录用”和“未录用”分得一人不差。看似模型找到了完美规律,麻烦却刚开始:在逻辑回归这类分类响应模型中,这会让部分系数不断趋向无穷,找不到有限的极大似然估计——也就是无法得到一组稳定、最能解释现有数据的参数。这种故障叫“完全分离”;只分开部分样本,则叫“准完全分离”。
Rusch、Sablica 与 Hornik 整理了不同软件中的诊断路径,并推出 R 包 divoRce。最实用的一点是,它不只报告“发生了分离”,还会区分分离类型,定位哪些变量和观测参与其中。工具覆盖二分类、无顺序及有顺序的多分类模型,并以计算几何和线性规划完成检查;既可使用常见的浮点数运算,也可改用精确的有理数运算和不同求解器。作者建议把这项检查纳入分类数据分析的常规流程。论文未提供统一的性能对比数字;惩罚似然或贝叶斯正则化虽能压住极端系数,却不能代替先查清数据为何被完美分开。