扩散模型(Diffusion Model)是近年更高保真合成的主流技术。它通过在前向过程中逐步向数据添加噪声、在反向过程中逐步去噪的方式,学习从噪声中重建出目标图像或视频。在深度伪造中,模型以驱动视频、音频轨道或文本提示为条件,迭代去噪生成目标输出。
相比早期以 GAN 为主的人脸替换,扩散模型被越来越多地用于全身视频生成、唇形同步配音、语音克隆等更复杂的伪造任务。它能够在保持时间连贯性的同时生成自然的动态效果与细腻的细节呈现。
扩散模型通常比早期 GAN 换脸产生更少的边界伪影和时间闪烁,这也是当前深度伪造视频更难被肉眼和算法识别的重要原因之一,直接推动了检测与水印等对抗手段成为研究热点。