Edicho:多图像一致性编辑,支持即插即用无需训练,快速实现风格转换

简介: Edicho 是蚂蚁集团联合港科大等高校推出的多图像一致性编辑方法,基于扩散模型,支持即插即用,无需额外训练,适用于多种图像编辑任务。

❤️ 如果你也关注 AI 的发展现状,且对 AI 应用开发非常感兴趣,我会每日分享大模型与 AI 领域的最新开源项目和应用,提供运行实例和实用教程,帮助你快速上手AI技术,欢迎关注我哦!

🥦 微信公众号|搜一搜:蚝油菜花 🥦


🚀 快速阅读

  1. 功能:Edicho 支持多图像一致性编辑,适用于局部和全局编辑任务。
  2. 技术:基于扩散模型,结合显式图像对应关系和优化的去噪策略。
  3. 应用:广泛应用于电商、社交媒体、游戏开发及医学影像等领域。

正文(附运行示例)

Edicho 是什么

edicho

Edicho 是由香港科技大学、蚂蚁集团、斯坦福大学和香港中文大学联合推出的一种基于扩散模型的图像编辑方法。它能够在多图像之间实现一致性编辑,且无需额外训练即可应用。

Edicho 的核心技术在于利用显式图像对应关系来指导编辑过程。通过注意力操作模块(Corr-Attention)和分类器自由引导(CFG)去噪策略,Edicho 能够确保编辑结果在不同图像中保持高度一致性。

Edicho 的主要功能

  • 一致性图像编辑:在多图像间实现一致性编辑,包括局部编辑(如图像修复)和全局编辑(如图像风格转换),确保编辑结果在各种场景下保持高度协调。
  • 即插即用兼容性:作为推理时的算法,可与大多数基于扩散的编辑方法(如 ControlNet 和 BrushNet)无缝兼容,无需额外训练数据,直接应用于实际任务。
  • 广泛任务适用性:适用于图像编辑,还能扩展应用于个性化内容创作、3D重建及一致性纹理应用等更多领域,扩展了编辑工具的适用范围。

Edicho 的技术原理

  • 显式图像对应性引导:基于显式图像对应性引导编辑过程,避免传统隐式对应性方法的局限性。用预训练的对应性提取器(如 DIFT 和 Dust3R)从输入图像中提取稳健的对应性,然后将预计算的显式对应性注入到扩散模型的去噪过程中,确保编辑的一致性。
  • 注意力操作模块(Corr-Attention):增强注意力机制,基于图像之间的对应性引导特征传递。在自注意力模块中,根据显式对应性对查询特征进行变换,从源图像借用相关特征,形成新的查询矩阵,在去噪过程中实现编辑一致性。
  • 优化的分类器自由引导(CFG)去噪策略(Corr-CFG):结合预计算的对应性,在编辑过程中保持高质量和一致性。修改 CFG 的计算方式,在对应关系的引导下操控 CFG 框架中的无条件分支,融合无条件嵌入特征,进一步增强一致性效果,同时保留预训练模型强大的生成先验的完整性。

如何运行 Edicho

1. 安装依赖

首先,确保你已经安装了 Python 和必要的依赖库。可以通过以下命令安装:

pip install torch torchvision
pip install diffusers

2. 下载预训练模型

从 HuggingFace 下载预训练的扩散模型:

git clone https://github.com/EzioBy/edicho.git
cd edicho

3. 运行示例代码

以下是一个简单的示例代码,展示如何使用 Edicho 进行图像编辑:

import torch
from diffusers import StableDiffusionPipeline

# 加载预训练模型
pipe = StableDiffusionPipeline.from_pretrained("stabilityai/stable-diffusion-2-1")
pipe = pipe.to("cuda")

# 输入图像路径
image_paths = ["image1.jpg", "image2.jpg"]

# 进行一致性编辑
for image_path in image_paths:
    edited_image = pipe(image_path, guidance_scale=7.5).images[0]
    edited_image.save(f"edited_{image_path}")

资源


❤️ 如果你也关注 AI 的发展现状,且对 AI 应用开发非常感兴趣,我会每日分享大模型与 AI 领域的最新开源项目和应用,提供运行实例和实用教程,帮助你快速上手AI技术,欢迎关注我哦!

🥦 微信公众号|搜一搜:蚝油菜花 🥦

相关文章
阿里发布 Qwen-Image-2.0,实测复杂插画生成,手绘细节还原度很高!
阿里千问Qwen-Image-2.0刚发布即实测!我们用其生成视频封面,精准还原“手绘风格+颜色编码+精细布局”。提示词含标题、图标、配色与排版要求,效果惊艳。现可通过chat.qwen.ai免费体验!
|
监控 网络协议 安全
Socket网络编程中的常见应用场景与实例分析
Socket网络编程中的常见应用场景与实例分析
|
网络安全 虚拟化 Windows
同一个局域网主机中的一台主机连接另一台主机的虚拟机
同一个局域网主机中的一台主机连接另一台主机的虚拟机
|
传感器 机器学习/深度学习 编解码
卫星图像10个开源数据集资源汇总
卫星图像10个开源数据集资源汇总
1141 0
|
机器学习/深度学习 编解码 人工智能
使用《Deep Image Prior》来做图像复原
图像复原是指从退化的图像中恢复未知的真实图像。
1333 0
|
机器学习/深度学习 编解码 vr&ar
NeurIPS 2024最佳论文,扩散模型的创新替代:基于多尺度预测的视觉自回归架构
本文详细解读NeurIPS 2024最佳论文《视觉自回归建模:基于下一尺度预测的可扩展图像生成》。该研究提出VAR模型,通过多尺度token图和VAR Transformer结构,实现高效、高质量的图像生成,解决了传统自回归模型在二维结构信息、泛化能力和计算效率上的局限。实验表明,VAR在图像质量和速度上超越现有扩散模型,并展示出良好的扩展性和零样本泛化能力。未来研究将聚焦于文本引导生成和视频生成等方向。
1565 8
NeurIPS 2024最佳论文,扩散模型的创新替代:基于多尺度预测的视觉自回归架构
|
小程序 定位技术
货拉拉货运小程序开发:构建便捷可靠的货运平台
货拉拉货运小程序整合物流服务,用户可录入货物详情、使用地图定位跟踪运输状态;订单管理功能便于查看进度和费用;支持多种支付方式及支付记录查询;评价系统提升服务质量;客服支持确保用户疑问得到解答,打造移动物流新时代。
|
消息中间件 SQL Java
开源Flink迁移至实时计算Flink全托管版最佳实践
Flink全托管产品(Flink Serverless)是一款基于Apache Flink构建的全托管产品,为您提供全托管一站式的实时计算服务,具有免运费、高增值、低成本等特性。本方案介绍如何将自建开源Flink集群的流式任务(包含Datastream、Table/SQL、PyFlink任务)迁移至阿里云实时计算全托管版。
897 2
开源Flink迁移至实时计算Flink全托管版最佳实践
|
JavaScript Java 关系型数据库
在线考试|基于Springboot的在线考试管理系统设计与实现(源码+数据库+文档)
在线考试|基于Springboot的在线考试管理系统设计与实现(源码+数据库+文档)
903 0
|
物联网 智能硬件 小程序
IoT物联网平台的3种计费方式
评估平台资费,看这里就够啦!
13957 1
IoT物联网平台的3种计费方式

热门文章

最新文章