系统首先从源视频和驱动视频中检测并提取人脸区域,进行对齐、裁剪和标准化处理,为后续的特征编码做准备。
通过编码器将源人脸压缩为紧凑的特征表示,提取身份相关的核心信息,去除姿态、光照等无关干扰。
将源人脸的特征表示送入目标(驱动)人脸的解码器,重建出兼具源人物身份与目标姿态表情的伪造人脸,实现身份迁移。
对生成的伪造区域进行边缘融合、色彩校正、光照一致性处理等后处理,使其与原视频自然衔接,最终合成完整的伪造视频。