SVFR:全能视频人脸修复框架,支持提升清晰度、色彩填充和缺失补全等图像修复任务

简介: SVFR 是一个通用视频人脸修复框架,支持人脸修复、着色和修复任务,基于 Stable Video Diffusion 技术,提供高质量的视频修复效果。

❤️ 如果你也关注 AI 的发展现状,且对 AI 应用开发非常感兴趣,我会每日分享大模型与 AI 领域的最新开源项目和应用,提供运行实例和实用教程,帮助你快速上手AI技术,欢迎关注我哦!

🥦 微信公众号|搜一搜:蚝油菜花 🥦


🚀 快速阅读

  1. 功能整合:SVFR 整合了视频人脸修复、着色和修复任务,提供统一的处理框架。
  2. 技术优势:基于 Stable Video Diffusion 的生成和运动先验,确保修复效果的时间连贯性。
  3. 应用场景:适用于影视后期制作、网络视频内容创作和数字档案修复等领域。

正文(附运行示例)

SVFR 是什么

SVFR

SVFR(Stable Video Face Restoration)是腾讯优图实验室与厦门大学联合推出的通用视频人脸修复框架。它整合了视频人脸修复(BFR)、着色和修复任务,基于 Stable Video Diffusion(SVD)的生成和运动先验,通过统一的人脸修复框架处理特定任务的信息。

SVFR 引入了可学习的任务嵌入以增强任务识别,同时采用统一潜在正则化(ULR)来鼓励不同子任务之间的共享特征表示学习。为了进一步提高修复质量和时间稳定性,SVFR 还引入了面部先验学习和自参考细化策略。

SVFR 的主要功能

  • 视频人脸修复(BFR):提升视频中人脸的细节和清晰度,使模糊或损坏的人脸画面变得更加清晰和自然。
  • 人脸着色:为黑白或色彩失真的视频人脸添加生动的色彩,增强视觉效果。
  • 人脸修复(Inpainting):修复视频中人脸的缺失部分,如遮挡或损坏的区域,恢复完整的人脸细节。

SVFR 的技术原理

  • 任务整合:SVFR 整合了视频人脸修复、着色和修复任务,通过一个统一的框架处理这些任务,实现协同增益。
  • 生成和运动先验:基于 Stable Video Diffusion 的生成和运动先验,增强修复效果,确保时间连贯性。
  • 任务嵌入:引入可学习的任务嵌入,增强模型对特定任务的识别能力。
  • 统一潜在正则化(ULR):采用 ULR 方法,鼓励不同子任务之间的特征共享,提升修复质量。
  • 面部先验学习:通过面部地标等结构先验,模型可以更自然地嵌入面部结构信息,避免面部结构异常和纹理失真。
  • 自引用细化:在推理阶段,通过参考之前生成的帧来优化当前帧的修复结果,增强时间稳定性。

如何运行 SVFR

1. 环境配置

首先,创建一个 conda 环境并安装依赖:

conda create -n svfr python=3.9 -y
conda activate svfr
pip install torch==2.2.2 torchvision==0.17.2 torchaudio==2.2.2
pip install -r requirements.txt

2. 下载模型

下载 Stable Video Diffusion 和 SVFR 的预训练模型:

conda install git-lfs
git lfs install
git clone https://huggingface.co/stabilityai/stable-video-diffusion-img2vid-xt models/stable-video-diffusion-img2vid-xt

手动下载 SVFR 的模型文件并放置在指定目录。

3. 运行推理

使用以下命令进行单任务或多任务推理:

python3 infer.py \
 --config config/infer.yaml \
 --task_ids 0 \
 --input_path ./assert/lq/lq1.mp4 \
 --output_dir ./results/

其中,task_ids 参数指定任务类型:

  • 0:视频人脸修复(BFR)
  • 1:人脸着色
  • 2:人脸修复(Inpainting)

资源


❤️ 如果你也关注 AI 的发展现状,且对 AI 应用开发非常感兴趣,我会每日分享大模型与 AI 领域的最新开源项目和应用,提供运行实例和实用教程,帮助你快速上手AI技术,欢迎关注我哦!

🥦 微信公众号|搜一搜:蚝油菜花 🥦

相关文章
|
人工智能 测试技术 开发者
最强开源背景去除模型​RMBG v1.4
RMBG v1.4是briaai公司最先进的背景去除模型,它可以将一系列类别和图像类型中有效地将前景与背景切分
2020 0
最强开源背景去除模型​RMBG v1.4
|
3月前
|
缓存 人工智能 自然语言处理
阿里云百炼通义千问Qwen3.6-Flash完整实操指南:轻量化旗舰功能特性、落地优势与分层优惠订阅方案详解
当前AI应用落地场景分化愈发明显,除复杂智能体、百万字长文档、全栈大型工程开发等高门槛业务外,大量企业存在高频轻量问答、实时客服对话、短文本批量生成、简单数据提取、前端实时交互等标准化轻量化需求。这类场景单日调用频次可达数万乃至数十万次,对接口响应延迟、单轮调用成本、并发承载能力有极高要求,若选用高规格旗舰模型会造成算力预算严重浪费,而普通基础轻量化模型又存在逻辑推理弱、工具调用不稳定、短文本输出质量差等短板。
869 4
|
机器学习/深度学习 编解码 人工智能
SeedVR:高效视频修复模型,支持任意长度和分辨率,生成真实感细节
SeedVR 是南洋理工大学和字节跳动联合推出的扩散变换器模型,能够高效修复低质量视频,支持任意长度和分辨率,生成真实感细节。
1272 16
SeedVR:高效视频修复模型,支持任意长度和分辨率,生成真实感细节
|
数据采集 编解码 缓存
通义万相Wan2.1视频模型开源!视频生成模型新标杆,支持中文字效+高质量视频生成
2025年1月,阿里通义万相Wan2.1模型登顶Vbench榜首第一,超越Sora、HunyuanVideo、Minimax、Luma、Gen3、Pika等国内外视频生成模型。而在今天,万相Wan2.1视频生成大模型正式开源!
8006 8
|
机器学习/深度学习 人工智能 并行计算
BEN2:一键快速抠图!自动移除图像和视频中的背景,支持在线使用
BEN2 是由 Prama LLC 开发的深度学习模型,专注于从图像和视频中快速移除背景并提取前景,支持高分辨率处理和GPU加速。
1582 10
BEN2:一键快速抠图!自动移除图像和视频中的背景,支持在线使用
|
人工智能 物联网
VideoPainter:开源视频修复神器!双分支架构一键修复,对象身份永久在线
VideoPainter 是由香港中文大学、腾讯ARC Lab等机构联合推出的视频修复和编辑框架,基于双分支架构和预训练扩散模型,支持任意长度视频的修复与编辑,具备背景保留、前景生成、文本指导编辑等功能,为视频处理领域带来新的突破。
1051 12
|
机器学习/深度学习 人工智能 算法
基于YOLOv10的无人机巡航小目标实时检测系统【训练和系统源码+Pyside6+数据集+包运行】
基于YOLOv10的无人机巡航小目标实时检测系统,通过7444张无人机场景训练图片,训练出能检测9类目标的模型,并开发了带GUI界面的系统,支持图片、视频和摄像头实时检测,具备背景和标题更换、模型选择、检测信息展示等功能。
2130 0
基于YOLOv10的无人机巡航小目标实时检测系统【训练和系统源码+Pyside6+数据集+包运行】
|
人工智能 运维 DataWorks
语雀+通义千问+DataWorks,让AI定期推送每周总结
DataWorks 数据开发提供强大的工作流及调度能力,且近期上线了数据推送节点,这篇文章简单利用 Shell + AI + 数据推送节点来完成每周工作内容总结。
2824 7
语雀+通义千问+DataWorks,让AI定期推送每周总结
|
机器学习/深度学习 数据采集 TensorFlow
使用Python实现深度学习模型:智能健康监测与预警
使用Python实现深度学习模型:智能健康监测与预警
1338 10

热门文章

最新文章