一张照片有数百万个像素,但真正决定画面变化的,可能只是物体、姿态和光照等少数因素。表面变量很多,不等于数据真的有那么多自由度。Peng Wang 等人的新工作试图解释:为什么扩散模型——从噪声中一步步还原样本的生成模型——面对高维图像时,未必遭遇“维数灾难”,也就是变量一多,训练数据需求便急剧膨胀。
据 JMLR,论文把数据表示为“低秩高斯混合”:若干团只沿少数方向变化的钟形分布。在这一理论设定和特定网络参数化下,训练扩散模型等价于经典的子空间聚类,也就是从样本中找出这些低维方向。由此推得,学会底层分布所需的样本量随内在维数线性增长,而非随环境维数——例如像素总数——指数增长。作者还报告了合成数据与真实图像上的泛化相变,并观察到所学方向与图像语义属性对应。不过,这一结论目前依赖上述可分析设定,不能直接视为所有扩散模型的普遍保证。