首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >ECCV 2026 | 字节&清华联合推出DreamID-V:最强“视频换脸术”

ECCV 2026 | 字节&清华联合推出DreamID-V:最强“视频换脸术”

作者头像
Amusi
发布2026-06-24 19:31:05
发布2026-06-24 19:31:05
2860
举报
文章被收录于专栏:CVerCVer

转载自:AI论文热榜

字节&清华联合推出DreamID-V:史上最强“视频换脸术”,连表情细节都完美复刻!

还在担心AI换脸视频“一眼假”?表情僵硬、背景闪烁、身份漂移? 这些痛点,被这项黑科技一网打尽了!

作者信息:郭旭 (清华大学), 叶福龙, 李星辉 (字节跳动智能创作实验室) 等

各位AI领域的小伙伴们大家好!我是你们的老朋友,小编小A。今天给大家带来一篇重磅论文解读,它绝对会刷新你对“视频换脸”技术的认知!

想象一下,在电影制作中,想让已故的演员“重现”荧幕;在创意视频中,轻松实现“一人分饰多角”;甚至在教育领域,让历史人物“亲自”开口讲课……这些看似科幻的场景,都离不开一项核心技术——视频人脸替换(Video Face Swapping, VFS)

然而,这项技术一直面临着巨大的挑战:

  • 静态照片换脸做得好,为什么视频换脸就“翻车”?
  • • 为啥换出来的视频,总感觉表情不自然脸在抽搐背景还忽明忽暗

最近,来自清华大学字节跳动智能创作实验室的研究团队,在预印本平台arXiv上发布了一项名为 “DreamID-V” 的研究。他们宣称,不仅成功攻克了上述难题,还首次将强大的扩散Transformer模型应用到了视频换脸中,效果堪称“降维打击”!

下面,就让小编带你一起深入这项“黑科技”的核心。

🚀 引言:视频换脸,到底难在哪?

简单来说,VFS的目标是:将源人脸的身份,无缝“嫁接”到目标视频中的人脸上,同时还要完美保留目标视频原有的姿态、表情、光照、背景和动态信息

VFS任务示意图 图:DreamID-V能够处理各种极端场景(如复杂表情、动画、大角度、遮挡、小脸)。

现有的图像换脸(IFS) 技术(比如DreamID)已经非常成熟,身份相似度和细节保留都做得很好。但问题来了——直接把IFS模型一帧一帧地用到视频上,会怎样?

答案是:惨不忍睹! 视频会充满闪烁、抖动,毫无连贯性可言。

而一些新兴的视频换脸方法,虽然考虑了时序一致性,但在身份相似度属性保留上,又远远不如顶尖的IFS模型。

核心矛盾就在于:图像的“静态优势”和视频的“动态需求”之间,存在一道巨大的鸿沟。

DreamID-V团队正是看到了这一点,他们问自己:能不能把IFS的“超能力”借过来,用来赋能VFS呢?

答案是肯定的!他们提出了一套完整的框架,包含一个创新的数据流水线和一个定制的模型架构,成功架起了这座“桥梁”。

🧠 核心技术揭秘

1. 数据魔法:SyncID-Pipe(同步身份流水线)

俗话说,巧妇难为无米之炊。高质量的训练数据是模型成功的关键。团队的核心思路是:利用IFS模型生成高质量的视频配对数据,来“教”VFS模型应该生成什么。

具体怎么操作呢?他们设计了一个精妙的“三步走”流水线:

第一步:训练一个“身份锚定视频合成器”(IVS) 这个模型有点像“视频预言家”。给它一段动作序列(姿态) 和视频的首尾两帧,它就能预测出中间完整的、符合动作逻辑的视频。这样,我们就有了一个能生成连贯视频的“引擎”。

第二步:构造“双向身份四元组”数据 这是整个流水线的灵魂!

  1. 1. 对一个源身份的视频(ID A),用顶尖的IFS模型(如DreamID)把目标身份(ID B)换到它的第一帧和最后一帧上,得到两张高质量的“参考帧”。
  2. 2. 把这两张“参考帧”和源视频的动作序列,一起喂给第一步训练好的IVS模型。
  3. 3. IVS会“脑补”出一个完整的、身份为B的合成视频

SyncID-Pipe数据流水线 图:SyncID-Pipe工作流程。通过IFS生成关键帧,再通过IVS合成完整视频,构建出“真实-生成”配对数据。

这样一来,我们就得到了一组完美配对的数据:{源图像, 源视频, 目标图像, 合成视频}。其中既包含了“从源身份到目标视频”的生成数据,也包含了“从目标身份回看源视频”的真实数据。模型可以从这种明确的监督信号中高效学习。

第三步:数据增强与优化 为了让模型更鲁棒,团队还加了“Buff”:

  • 表情适配:解耦身份和表情,避免身份信息“泄漏”到表情中。
  • 增强背景重组:处理动态背景,确保换脸后背景依然稳定、自然。

2. 模型架构:DreamID-V(基于扩散Transformer的框架)

有了高质量的数据,还需要一个强大的模型来“消化”它们。DreamID-V是首个基于扩散Transformer(DiT)的视频换脸框架。它的核心是一个叫做 “多模态感知条件注入(MC)” 的模块。

你可以把这个模块想象成一个智能调度中心。面对换脸任务中纷繁复杂的输入信息(身份图、目标视频、动作序列等),它不再是“一锅烩”,而是分门别类、区别对待

  • 时空上下文模块(处理背景、光照):像拼图一样,把目标视频和脸部遮罩直接与模型的隐变量在通道维度上拼接。确保空间和时间严格对齐。
  • 结构引导模块(处理姿态、动作):采用一种自适应姿态注意力机制,将动作序列信息“轻柔”地注入到模型中,精准控制动态属性。
  • 身份信息模块(注入新身份):将身份编码成特征,然后在Token维度上与模型特征拼接。这样,身份信息就能通过Transformer强大的注意力机制,与视频内容进行深度、全面的交互。

DreamID-V模型架构 图:DreamID-V框架。核心是多模态感知条件注入(MC)模块,分别处理不同条件。

这种“分而治之”的策略,使得模型能够解耦并融合不同类型的条件信息,从而在换脸时既保持身份,又保留所有动态细节。

3. 训练策略:从“合成”到“真实”的课程学习

好马配好鞍,好模型还需要好的训练策略。团队设计了一套循序渐进的训练方案:

  1. 1. 合成数据训练:先用IVS生成的合成视频进行训练。这能让模型快速上手,初步获得很高的身份相似度。
  2. 2. 真实数据增强训练:但合成视频不够真实。接着,用经过背景增强处理的真实配对数据进行微调。这一步能显著提升生成视频的真实感和背景保真度
  3. 3. 身份一致性强化学习(IRL):这是针对“最后一公里”问题的黑科技!他们发现,在复杂动作(如快速转头)中,身份一致性会下降。IRL机制能自动识别出视频中哪些帧的身份保持得不好,并在训练时给这些“困难帧”更高的权重,引导模型重点攻克这些难点,从而大幅减少身份闪烁。

📊 实验结果:全方位碾压!

光说不练假把式。团队不仅提出了新方法,还建立了一个全面的新基准——IDBench-V,包含了200个涵盖各种挑战性场景(小脸、大角度、遮挡、复杂表情等)的视频-图像对。

定量比较:指标说话

在与当前最优的模型(如CanonSwap, DreamID, Face-Adapter等)对比中,DreamID-V在几乎所有关键指标上都取得了领先

定量比较结果 表:DreamID-V在身份一致性、属性保留和视频质量上全面领先。

  • 身份一致性(ID Similarity):显著优于所有对比方法,甚至超过了顶尖的IFS模型DreamID。
  • 属性保留(Attribute Preservation):在表情、姿态、背景一致性等指标上表现最优或接近最优。
  • 视频质量(Video Quality):生成的视频更加平滑、真实。

定性比较:眼见为实

定性比较 图:DreamID-V在身份相似度、表情传递、遮挡处理等方面均表现优异。

从视觉效果上看,DreamID-V生成的人脸:

  • 身份相似度极高,一眼就能认出是谁。
  • 表情生动自然,连细微的肌肉变化都能捕捉。
  • 对遮挡鲁棒,即使戴着眼镜、帽子,换脸效果依然完美。
  • 背景高度一致,没有任何违和感。

消融实验:证明每一环都重要

团队通过一系列消融实验,证明了他们提出的每个模块都是有效的:

  • • 没有“双向四元组”数据,身份相似度大跌。
  • • 缺少“从合成到真实”的课程学习,要么真实感差,要么身份保真度低。
  • • 没有IRL强化学习,在复杂动作下的身份一致性会明显变差。

消融实验 图:消融实验证明了各模块的有效性。IRL能显著提升困难帧(如侧脸)的身份相似度。

🌟 惊喜不止于换脸:强大的可扩展性

最让小编兴奋的是,DreamID-V的框架不仅仅能用于换脸

通过将数据流水线中的IFS模型替换为通用的图像编辑模型(如Nano banana),DreamID-V可以轻松扩展到其他人物中心替换任务,例如:

  • 换装
  • 换发型
  • 换配饰(眼镜、耳机等)

可扩展性展示 图:DreamID-V框架可轻松扩展至换装、换发型、换配饰等任务。

这为未来的视频内容创作打开了无限的想象空间!

✅ 结论与展望

总结一下,DreamID-V这项工作的贡献巨大:

  1. 1. 技术革新:提出了创新的 SyncID-Pipe数据流水线,将IFS的优势成功迁移到VFS;设计了首个基于DiT的VFS框架 DreamID-V,并引入了有效的训练策略。
  2. 2. 建立基准:发布了全面的 IDBench-V评测基准,推动领域发展。
  3. 3. 效果卓越:在各项评测中大幅领先现有技术,实现了高保真身份替换与极致属性保留的平衡。
  4. 4. 潜力无限:框架具备强大的可扩展性,为更多视频编辑任务铺平了道路。

这项研究让我们看到,AI视频编辑正朝着更高保真、更可控、更易用的方向飞速发展。或许在不久的将来,影视级特效制作的门槛将大幅降低,每个人都能成为自己视频的“导演”。


论文标题:DreamID-V: Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer 论文链接https://guoxu1233.github.io/DreamID-V/ (项目页包含Demo、代码和模型)

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-06-20,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 字节&清华联合推出DreamID-V:史上最强“视频换脸术”,连表情细节都完美复刻!
    • 🚀 引言:视频换脸,到底难在哪?
    • 🧠 核心技术揭秘
      • 1. 数据魔法:SyncID-Pipe(同步身份流水线)
      • 2. 模型架构:DreamID-V(基于扩散Transformer的框架)
      • 3. 训练策略:从“合成”到“真实”的课程学习
    • 📊 实验结果:全方位碾压!
      • 定量比较:指标说话
      • 定性比较:眼见为实
      • 消融实验:证明每一环都重要
    • 🌟 惊喜不止于换脸:强大的可扩展性
    • ✅ 结论与展望
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档