一张 AI 图片看起来像受过某件作品影响,不等于能证明它确实来自那件作品。MIT CSAIL 团队发现,生成模型吃进的数据越多,输出越难归到某一张训练图上。他们把这种现象称为“归属衰减”。这值得艺术界留意,因为版权争议关心的是具体作品的影响,而不只是“风格很像”。
团队训练了 24 组模型,数据集从 256 张扩至逾 16 万张。关键做法很直接:每次删掉一张图,再从头训练模型,观察输出是否改变。研究者认为,这比用算法近似估算单张图片的影响更严格。他们还设计了“扩散模型集成”——让多个模型分别学习不同的数据子集,以提高大规模删除实验的效率。
结果显示,数据规模扩大后,单张图片对输出的可辨认影响会减弱。换句话说,逐张移除素材,生成结果可能都没有明显变化。但训练数据归属只是影响度判断,并不自动等于完整的法律因果证明;这项研究更现实的提醒是,未来要证明某张生成图究竟受哪件原作影响,可能会越来越难。