想象两类人的平均体温一样,但一类人的波动明显更大。只比较平均值,就看不出区别;真正有用的线索藏在分散程度里。Jing Zeng、Xin Zhang 与 Ning Hao 的这项研究,处理的正是这类高维分类问题。据 Taylor & Francis / JASA,论文的 accepted author version 于 2026 年 8 月 27 日上线。
它把稀疏充分降维推进到“二阶结构”:充分降维是把大量变量压成少数方向,同时保留预测结果所需的信息;二阶结构则关注方差、协方差和变量交互,而不只看均值。难点是变量一多,需要估计的关系会迅速膨胀。据 CFE-CMStatistics 2025 会议摘要,作者用二次凸优化,并把张量参数中成组关联的部分一起处理,从而减少参数量和计算负担。方法分两步:既选出低维子空间,也把无关变量的系数压到零。作者还给出了维数选择、变量选择和子空间估计的一致性与收敛理论。
作者用模拟与真实数据示例评估方法,并把稀疏投影接入 QDA——一种允许不同类别拥有不同协方差、因此能形成弯曲分类边界的方法。值得关注的不是又多一种降维工具,而是它开始处理“均值看起来没差,差别却藏在波动和交互里”的场景;不过现有材料未披露具体数据集与效果数字。