想象你要在几张各有偏差的简化地图中,拼出一张更接近真实地形的地图。混合变分推断正是如此:真实的贝叶斯后验——看到数据后,各种答案及其可信程度——通常算不动,于是模型用多个简单分布共同逼近它。问题在于,每次样本来自哪个分量是一道离散选择,导致训练所需的梯度容易抖动,也更难计算。
Javier Burroni 与 Daniel Sheldon 在 JMLR 发表的研究,把多种基于重参数化的梯度估计器放进同一套记号体系。最值得注意的是,他们为单样本 post-stratified estimator(后分层估计器)给出更简洁的推导,并证明:相比简单随机抽样,它能降低梯度方差,也就是让优化器收到的调整方向更稳定。论文还扩展了若干方法的适用范围,并降低 implicit reparameterization(隐式重参数化)的计算复杂度。
据 JMLR 论文摘要页,分层估计器在可采用时表现稳定;只用一个样本的方法中,后分层估计器经常最好,而隐式重参数化的计算开销最高。摘要没有披露具体提升数字,因此目前更适合把这项工作看作一份方法选择与实现指南,而非已确定的性能跃升。