把一张信息繁杂的表格压缩成几个关键数字,就像用几句话概括一部长电影:既要省空间,也不能丢掉异常线索。PCA(主成分分析)用线性方向压缩数据;自编码器则让神经网络经过狭窄“瓶颈”再还原输入,理论上更擅长弯曲的非线性关系。值得注意的是,据 Towards Data Science 报道,一项刻意偏向后者的合成测试,结果仍是PCA略胜。
测试让两个正常特征遵循正弦关系,再加入单看每个数都正常、合起来却破坏关系的异常。PCA的F1——综合衡量漏报与误报的指标——为0.318,自编码器为0.302,Isolation Forest为0.091;正常与异常的重建误差大量重叠,说明三者都分得不算好。另一项较简单的实验中,PCA与自编码器则同为0.885。这里比较的是约700个训练样本上的默认8-3-8自编码器,并非其性能上限;实验也只用合成数据和一个随机种子。更稳妥的结论是:非线性表达能力不会自动变成实际收益,上复杂模型前,先认真跑好强基线。