研究进展·MIT News · AI
MIT研究:AI艺术无作者,数据规模扩大后输出无法溯源
MIT CSAIL团队发现,当训练数据集足够大时,从模型中移除任何单张图片、某位艺术家的全部作品或某人的所有照片,生成的图像都不会有明显变化。他们提出“归因衰减”现象,并用新方法精确验证了这一结论。这意味着大型AI模型的生成结果可能无法归因于任何特定训练数据。
MIT CSAIL的研究人员发现,在大型数据集上训练的AI图像生成模型中,单个训练样本与最终输出之间的关联会随数据规模扩大而消失。他们称这一现象为“归因衰减”:数据越多,任何特定训练示例对特定输出的影响就越小。
为验证这一假设,团队构建了名为“diffusion ensemble”的架构,由多个小型组件组成,每个组件在不同数据子集上训练。要模拟移除某图片的效果,只需关闭相关组件,无需重新训练。他们将此方法与24个传统扩散模型对比,图像质量相当,且数据量越大,集成方法表现越好。
实验覆盖从256张到超过16万张图片的训练集,来自CIFAR-10、CelebA、MetFaces和ArtBench等公开数据集。结果显示,训练集越大,单张图片能造成的最大影响越小,遵循逆幂律。该结论在多种测量方式下均成立。
论文主要作者Zheng Dai表示:“如果移除某条数据输出不变,那就不能说该数据影响了输出。”论文发表于《自然·通讯》。但该研究未讨论对版权诉讼和许可协议的直接影响。
原文出处
When AI art has no author: Study finds generated images often can’t be traced to training datanews.mit.edu
#可解释性#数据溯源#学术研究
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。