比较网络模型,有点像让两名学生做题:一人只会基本解法,另一人套路更多,后者往往更容易碰巧答对。普通交叉验证——留出一部分数据当考题——因此可能偏爱更复杂的模型;网络中的关系还会因共享节点彼此关联,随意切分也容易泄漏答案。
Bokai Yang 等人的做法,是用边采样交叉验证:抽出一部分节点对或边作为验证对象,其余网络用于拟合,节点集合保持不变。最关键的一步,是在验证损失上再加模型复杂度惩罚,让复杂模型为额外自由度付出代价,从而缓解嵌套模型——简单模型可视为复杂模型特例——之间的过拟合选择。
据 arXiv 页面介绍,该框架比较了 stochastic block model(按群组描述连接规律)、degree-corrected SBM(进一步允许节点活跃度不同)和 graphon 等模型。作者还在相应假设下证明:样本增大时,选中真实模型的概率趋近于 1,并报告了模拟实验及 Political Books 网络评估。不过供稿未提供具体实验数字,实际改善幅度暂不宜展开判断。