转载自:AI论文热榜
还在担心AI换脸视频“一眼假”?表情僵硬、背景闪烁、身份漂移? 这些痛点,被这项黑科技一网打尽了!
作者信息:郭旭 (清华大学), 叶福龙, 李星辉 (字节跳动智能创作实验室) 等
各位AI领域的小伙伴们大家好!我是你们的老朋友,小编小A。今天给大家带来一篇重磅论文解读,它绝对会刷新你对“视频换脸”技术的认知!
想象一下,在电影制作中,想让已故的演员“重现”荧幕;在创意视频中,轻松实现“一人分饰多角”;甚至在教育领域,让历史人物“亲自”开口讲课……这些看似科幻的场景,都离不开一项核心技术——视频人脸替换(Video Face Swapping, VFS)。
然而,这项技术一直面临着巨大的挑战:
最近,来自清华大学和字节跳动智能创作实验室的研究团队,在预印本平台arXiv上发布了一项名为 “DreamID-V” 的研究。他们宣称,不仅成功攻克了上述难题,还首次将强大的扩散Transformer模型应用到了视频换脸中,效果堪称“降维打击”!
下面,就让小编带你一起深入这项“黑科技”的核心。
简单来说,VFS的目标是:将源人脸的身份,无缝“嫁接”到目标视频中的人脸上,同时还要完美保留目标视频原有的姿态、表情、光照、背景和动态信息。

VFS任务示意图 图:DreamID-V能够处理各种极端场景(如复杂表情、动画、大角度、遮挡、小脸)。
现有的图像换脸(IFS) 技术(比如DreamID)已经非常成熟,身份相似度和细节保留都做得很好。但问题来了——直接把IFS模型一帧一帧地用到视频上,会怎样?
答案是:惨不忍睹! 视频会充满闪烁、抖动,毫无连贯性可言。
而一些新兴的视频换脸方法,虽然考虑了时序一致性,但在身份相似度和属性保留上,又远远不如顶尖的IFS模型。
核心矛盾就在于:图像的“静态优势”和视频的“动态需求”之间,存在一道巨大的鸿沟。
DreamID-V团队正是看到了这一点,他们问自己:能不能把IFS的“超能力”借过来,用来赋能VFS呢?
答案是肯定的!他们提出了一套完整的框架,包含一个创新的数据流水线和一个定制的模型架构,成功架起了这座“桥梁”。
俗话说,巧妇难为无米之炊。高质量的训练数据是模型成功的关键。团队的核心思路是:利用IFS模型生成高质量的视频配对数据,来“教”VFS模型应该生成什么。
具体怎么操作呢?他们设计了一个精妙的“三步走”流水线:
第一步:训练一个“身份锚定视频合成器”(IVS) 这个模型有点像“视频预言家”。给它一段动作序列(姿态) 和视频的首尾两帧,它就能预测出中间完整的、符合动作逻辑的视频。这样,我们就有了一个能生成连贯视频的“引擎”。
第二步:构造“双向身份四元组”数据 这是整个流水线的灵魂!

SyncID-Pipe数据流水线 图:SyncID-Pipe工作流程。通过IFS生成关键帧,再通过IVS合成完整视频,构建出“真实-生成”配对数据。
这样一来,我们就得到了一组完美配对的数据:{源图像, 源视频, 目标图像, 合成视频}。其中既包含了“从源身份到目标视频”的生成数据,也包含了“从目标身份回看源视频”的真实数据。模型可以从这种明确的监督信号中高效学习。
第三步:数据增强与优化 为了让模型更鲁棒,团队还加了“Buff”:
有了高质量的数据,还需要一个强大的模型来“消化”它们。DreamID-V是首个基于扩散Transformer(DiT)的视频换脸框架。它的核心是一个叫做 “多模态感知条件注入(MC)” 的模块。
你可以把这个模块想象成一个智能调度中心。面对换脸任务中纷繁复杂的输入信息(身份图、目标视频、动作序列等),它不再是“一锅烩”,而是分门别类、区别对待:

DreamID-V模型架构 图:DreamID-V框架。核心是多模态感知条件注入(MC)模块,分别处理不同条件。
这种“分而治之”的策略,使得模型能够解耦并融合不同类型的条件信息,从而在换脸时既保持身份,又保留所有动态细节。
好马配好鞍,好模型还需要好的训练策略。团队设计了一套循序渐进的训练方案:
光说不练假把式。团队不仅提出了新方法,还建立了一个全面的新基准——IDBench-V,包含了200个涵盖各种挑战性场景(小脸、大角度、遮挡、复杂表情等)的视频-图像对。
在与当前最优的模型(如CanonSwap, DreamID, Face-Adapter等)对比中,DreamID-V在几乎所有关键指标上都取得了领先:

定量比较结果 表:DreamID-V在身份一致性、属性保留和视频质量上全面领先。

定性比较 图:DreamID-V在身份相似度、表情传递、遮挡处理等方面均表现优异。
从视觉效果上看,DreamID-V生成的人脸:
团队通过一系列消融实验,证明了他们提出的每个模块都是有效的:

消融实验 图:消融实验证明了各模块的有效性。IRL能显著提升困难帧(如侧脸)的身份相似度。
最让小编兴奋的是,DreamID-V的框架不仅仅能用于换脸!
通过将数据流水线中的IFS模型替换为通用的图像编辑模型(如Nano banana),DreamID-V可以轻松扩展到其他人物中心替换任务,例如:

可扩展性展示 图:DreamID-V框架可轻松扩展至换装、换发型、换配饰等任务。
这为未来的视频内容创作打开了无限的想象空间!
总结一下,DreamID-V这项工作的贡献巨大:
SyncID-Pipe数据流水线,将IFS的优势成功迁移到VFS;设计了首个基于DiT的VFS框架 DreamID-V,并引入了有效的训练策略。IDBench-V评测基准,推动领域发展。这项研究让我们看到,AI视频编辑正朝着更高保真、更可控、更易用的方向飞速发展。或许在不久的将来,影视级特效制作的门槛将大幅降低,每个人都能成为自己视频的“导演”。
论文标题:DreamID-V: Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer
论文链接:https://guoxu1233.github.io/DreamID-V/ (项目页包含Demo、代码和模型)