☰
首页
/
DVFace论文算法详解教程
目录
DVFace论文算法详解教程
DVFace 论文算法详解教程
目录
第 0 章 论文定位与阅读指南
0.1 这篇论文在解决什么问题?
0.2 论文的三个贡献
0.3 论文涉及的全部算法/技术清单
第 1 章 应用场景:为什么需要视频人脸修复
1.1 视频人脸修复(VFR)的定义
1.2 典型应用场景
1.3 为什么"视频"比"单图"难?
1.4 本论文路线在整个领域中的位置
第 2 章 前置知识:图像退化模型
2.1 退化模型:高质量图像如何变成低质量图像
2.2 论文如何处理退化问题
2.3 图像修复的三条技术路线(理解论文定位的坐标系)
第 3 章 扩散模型原理:从 DDPM 到 Rectified Flow
3.1 直觉:扩散模型是什么
3.2 DDPM 正向扩散过程
3.3 DDPM 反向去噪过程与训练目标
3.4 潜空间扩散模型(LDM / Stable Diffusion)
3.5 VAE(变分自编码器)原理
3.6 Rectified Flow / Flow Matching(论文公式的理论根基)
3.6.1 动机:DDPM 的局限性
3.6.2 核心思想:在数据与噪声之间拉一条直线
3.6.3 为什么直线路径更适合"一步生成"?
3.7 论文公式 (1)(2) 的逐项解读
第 4 章 一步扩散技术:把 50 步压成 1 步
4.1 问题:多步采样的代价有多大
4.2 三条主流的一步化技术路线
路线一:一致性模型(Consistency Models)
路线二:对抗蒸馏(Adversarial Distillation)
路线三:轨迹蒸馏 / 分布匹配
4.3 一步扩散为什么难:修复任务的特殊挑战
4.4 一步扩散的数学本质
第 5 章 Transformer、DiT 与 Wan2.1
5.1 注意力机制(Attention)
5.2 Vision Transformer(ViT)
5.3 DiT(Diffusion Transformer)
5.4 视频 DiT 的时空处理
5.5 Wan2.1 详解(论文的预训练底座)
第 6 章 码本技术:VQ-VAE 与码本先验
6.1 向量量化(Vector Quantization, VQ)
6.2 码本在人脸修复中的经典应用
6.3 码本查找 Transformer(Codebook Lookup Transformer)
6.4 为什么需要"双"码本:空间与时间的互补性
第 7 章 DVFace 核心方法详解
7.1 整体框架:一步扩散修复管线
7.2 时空双码本(STDC)的构建细节
第一步:分路提取空间/时间潜变量
第二步:Transformer 精修 + 双码本量化
7.3 非对称时空融合(ASTF):两种先验的差异化注入
时间先验:全局 Scale & Shift 调制(公式 7)
空间先验:时间预精修的交叉注意力注入(公式 8)
7.4 零初始化(Zero-Init):从恒等映射起步
7.5 两阶段训练与损失函数全景
Stage-1a:码本学习损失(公式 9)
Stage-1b:LQ 对齐损失(公式 11)
Stage-2:一步扩散修复损失(公式 12~15)
第 8 章 光流与时序一致性技术
8.1 光流(Optical Flow)是什么
8.2 Backward Warping(反向变形)
8.3 论文的时序一致性损失(公式 15 详解)
第 9 章 评估指标大全
9.1 保真度指标(全参考,需要 GT)
PSNR(峰值信噪比)
SSIM(结构相似性)
9.2 感知指标
LPIPS(Learned Perceptual Image Patch Similarity)
DISTS(Deep Image Structure and Texture Similarity)
9.3 无参考图像质量指标(真实数据无 GT 时使用)
NIQE
MUSIQ(多尺度图像质量 Transformer)
MANIQA(多维注意力网络)
CLIP-IQA
LIQE(基于视觉-语言对应的盲 IQA)
9.4 视频整体质量指标
FVD(Fréchet Video Distance)
DOVER(视频质量评价器)
9.5 身份保持指标
AKD(Average Keypoint Distance,平均关键点距离)
9.6 时间一致性指标
E_warp(误差变形一致性,Blind Video Temporal Consistency 指标)
VIDD(Video Identity Flickering Degree? 实际为"视频帧间不一致度")
9.7 指标选择的工程智慧
第 10 章 对比方法解析
10.1 PGTFormer(解析图引导的时序一致性 Transformer, 2024)
10.2 KEEP(卡尔曼滤波启发的特征传播, ECCV 2024)
10.3 AverNet(全合一视频恢复, NeurIPS 2024)
10.4 BFVR(盲视频人脸恢复)
10.5 DicFace(Dirichlet 约束的变分码本学习, 2025)
10.6 SVFR(统一框架视频人脸恢复, CVPR 2025)
10.7 横向对比总结
第 11 章 实验设置与工程细节
11.1 数据集
11.2 退化模拟
11.3 训练配置
11.4 工程要点讨论
第 12 章 消融实验解读:每个设计为什么有效
12.1 双先验互补性(表 3)
12.2 融合模块设计(表 4)
12.3 先验类型对比(表 5)
12.4 消融之外的观察
附录 A 公式速查表
附录 B 术语表
结语:本论文的技术脉络一句话总结