FLUX.1 Kontext 的全生态教程来啦!AIGC专区在线试玩!

简介: Flux.1 Kontext [dev] 开源模型大家都用上了吗?小编汇总了3个使用教程,打包送上!

Flux.1 Kontext [dev] 开源模型大家都用上了吗?

小编汇总了3个使用教程,打包送上!

全生态使用教程:

  • ModelScope AIGC专区
  • DiffSynth-Studio框架
  • ComfyUI的推理
  • ModelScope AIGC专区:Flux.1 Kontext [dev] 正式上线,免费的在线图像编辑,在线界面GUI微调训练

image.gif

  • DiffSynth-Studio框架:社区开发者快速支持了FLUX.1 Kontext 模型的原生训练与推理,最低支持6G显存

image.gif 编辑

  • ComfyUI的推理:fp8_scaled模型版本,运行显存仅需约22G,可用魔搭notebook的免费资源运行。

image.gif

📖快来学习吧~👇

01.Flux.1 Kontext介绍

FLUX.1 Kontext 是由 黑森林实验室(Black Forest Labs)开发的一款专业图像生成与编辑模型,专注于通过上下文感知技术实现精准的图像编辑。该模型支持文本和图像的混合输入,能够智能理解图像内容并执行对象修改、风格转换、背景替换等多种编辑任务,同时在多轮编辑中较好地保持主体一致性,解决了传统模型在这一领域的痛点⁠⁣ 。其核心采用流匹配(Flow Matching)架构,结合双流与单流混合设计,提升了语义关联的精度和生成速度。

FLUX.1 Kontext 模型能够理解现有图像并进行创作。使用 FLUX.1 Kontext,您可以通过简单的文本指令修改输入图像,实现灵活、即时的图像编辑,无需进行精细调整或复杂的编辑工作流程。FLUX.1 Kontext 套件的核心功能包括:

  • 角色一致性:在多个场景和环境中保留图像的独特元素,例如图片中的参考角色或对象。
  • 局部编辑:针对性地修改图像中的特定元素,而不影响其余元素。
  • 风格参考:根据文本提示,生成新颖的场景,同时保留参考图像的独特风格。
  • 交互速度:图像生成和编辑的延迟最小。

02.AIGC专区在线图像编辑与微调

Flux.1 Kontext [dev] 正式上线ModelScope AIGC专区,支持在线免费的图像编辑。同时还支持在线界面GUI交互的模型训练,可以基于Flux.1 Kontext [dev] 底模训练LoRA模型。

AIGC专区地址:https://www.modelscope.cn/aigc/imageGeneration

在线图像编辑

在ModelScope AIGC专区“图片生成”入口,切到快速生图Tab,玩法选择“FLUX Kontext",上传待编辑图片和提示词,可用魔搭的在线资源进行图片编辑。

image.gif 编辑

专业生图入口同样也支持“FLUX.1 Kontext Dev"。相比快速生图,专业生图入口提供更自由的参数控制。

image.gif 编辑

模型微调

在AIGC专区的“模型训练”入口,选择新上线的“MusePublic/FLUX.1-Kontext-Dev”作为底模,上传自己的图片训练集,即可开始在线训练。

image.gif

03.DiffSynth-Studio 推理与微调

安装

DiffSynth-Studio 的新版框架为 FLUX.1-Kontext-dev 提供了推理和训练支持。首先,通过以下命令 clone 并安装最新版的 DiffSynth-Studio:

git clone https://github.com/modelscope/DiffSynth-Studio.git  
cd DiffSynth-Studio
pip install -e .

image.gif

运行以下 Python 代码,即可下载模型并进行推理:

import torch
from diffsynth.pipelines.flux_image_new import FluxImagePipeline, ModelConfig
pipe = FluxImagePipeline.from_pretrained(
    torch_dtype=torch.bfloat16,
    device="cuda",
    model_configs=[
        ModelConfig(model_id="black-forest-labs/FLUX.1-Kontext-dev", origin_file_pattern="flux1-kontext-dev.safetensors"),
        ModelConfig(model_id="black-forest-labs/FLUX.1-dev", origin_file_pattern="text_encoder/model.safetensors"),
        ModelConfig(model_id="black-forest-labs/FLUX.1-dev", origin_file_pattern="text_encoder_2/"),
        ModelConfig(model_id="black-forest-labs/FLUX.1-dev", origin_file_pattern="ae.safetensors"),
    ],
)
# text-to-image
image = pipe(
  prompt="an orange cat is sitting on a seat, looking at the window.",
  seed=0
)
image.save("image.jpg")
# image-to-image
image = pipe(
    prompt="add sunglasses to the cat",
    kontext_images=image,
    embedded_guidance=2.5,
    seed=0
)
image.save("image_edit.jpg")

image.gif

这段代码可以生成一只橙猫猫,并给它戴上酷酷的眼镜!

image.gif

image.gif

显存管理

以上代码加载的完整版模型需要 40G 显存才能进行推理,DiffSynth-Studio 提供了显存管理的支持,只需在加载模型时 ModelConfig 中填入 offload_device="cpu"并调用 enable_vram_management即可根据 GPU 剩余的显存进行动态分配,最低可以在 6G 显存上运行。需要注意的是,显存越小,推理速度越慢,不过对模型精度没有任何影响。

pipe = FluxImagePipeline.from_pretrained(
    torch_dtype=torch.bfloat16,
    device="cuda",
    model_configs=[
        ModelConfig(model_id="black-forest-labs/FLUX.1-Kontext-dev", origin_file_pattern="flux1-kontext-dev.safetensors", offload_device="cpu"),
        ModelConfig(model_id="black-forest-labs/FLUX.1-dev", origin_file_pattern="text_encoder/model.safetensors", offload_device="cpu"),
        ModelConfig(model_id="black-forest-labs/FLUX.1-dev", origin_file_pattern="text_encoder_2/", offload_device="cpu"),
        ModelConfig(model_id="black-forest-labs/FLUX.1-dev", origin_file_pattern="ae.safetensors", offload_device="cpu"),
    ],
)
pipe.enable_vram_management()

image.gif

微调

此外,DiffSynth-Studio 也适配了 FLUX.1-Kontext-dev 的原生训练。由于这一模型需要额外输入一张图,我们需要按照如下格式构建数据集:

data/example_image_dataset/
├── metadata.csv
├── image1.jpg
└── image2.jpg

image.gif

并在 metadata.csv 中填写相应的信息:

image,prompt,kontext_images
1.jpg,"Make the dog turn its head around.",2.jpg

image.gif

我们准备了一个样例数据集,供大家参考,可通过以下命令下载:

modelscope download --dataset DiffSynth-Studio/example_image_dataset --local_dir ./data/example_image_dataset

image.gif

然后,运行以下命令就可以启动 LoRA 训练了:

accelerate launch examples/flux/model_training/train.py \
  --dataset_base_path data/example_image_dataset \
  --dataset_metadata_path data/example_image_dataset/metadata_kontext.csv \
  --data_file_keys "image,kontext_images" \
  --max_pixels 1048576 \
  --dataset_repeat 400 \
  --model_id_with_origin_paths "black-forest-labs/FLUX.1-Kontext-dev:flux1-kontext-dev.safetensors,black-forest-labs/FLUX.1-dev:text_encoder/model.safetensors,black-forest-labs/FLUX.1-dev:text_encoder_2/,black-forest-labs/FLUX.1-dev:ae.safetensors" \
  --learning_rate 1e-4 \
  --num_epochs 5 \
  --remove_prefix_in_ckpt "pipe.dit." \
  --output_path "./models/train/FLUX.1-Kontext-dev_lora" \
  --lora_base_model "dit" \
  --lora_target_modules "a_to_qkv,b_to_qkv,ff_a.0,ff_a.2,ff_b.0,ff_b.2,a_to_out,b_to_out,proj_out,norm.linear,norm1_a.linear,norm1_b.linear,to_qkv_mlp" \
  --lora_rank 32 \
  --align_to_opensource_format \
  --extra_inputs "kontext_images" \
  --use_gradient_checkpointing

image.gif

实际的显存需求与图像的分辨率有关,建议使用 80G 显存的 GPU。

更多详细信息,请参考:https://github.com/modelscope/DiffSynth-Studio/tree/main/examples/flux

04.ComfyUI工作流推理

ComfyUI官方提供了fp8_scaled版本的模型权重,运行显存仅需约22G,可使用魔搭notebook的免费资源运行。

  • 进入魔搭notebook,准备环境

魔搭notebook地址:https://modelscope.cn/my/mynotebook

# 克隆仓库
git clone https://github.com/comfyanonymous/ComfyUI.git
# 安装依赖
cd ComfyUI
pip install -r requirements.txt
# 下载模型
modelscope download --model Comfy-Org/Lumina_Image_2.0_Repackaged split_files/vae/ae.safetensors --local_dir ./models/vae
modelscope download --model comfyanonymous/flux_text_encoders clip_l.safetensors --local_dir ./models/text_encoders
modelscope download --model muse/t5xxl_fp16 t5xxl_fp16.safetensors --local_dir ./models/text_encoders
modelscope download --model Comfy-Org/flux1-kontext-dev_ComfyUI split_files/diffusion_models/flux1-dev-kontext_fp8_scaled.safetensors --local_dir ./models/diffusion_models

image.gif

  • 启动comfyui

运行以下命令启动ComfyUI服务,点击http://127.0.0.1:8188链接即可进入comfyui的界面

cd ComfyUI
python main.py

image.gif

下载并运行工作流

下载下面的“工作流图片”,拖入ComfyUI中加载对应的工作流。

工作流图片

输入图片

image.gif 编辑 image.gif 编辑

检查各模型是否正确加载,上传输入图片,点击“运行”即可运行工作流。

image.gif

这个工作流默认的prompt对输入图片左下角的粉色labubu小包包做一个擦除,并保持其他画面的一致性。

 

点击链接,即可跳转AIGC专区体验~

https://www.modelscope.cn/aigc/imageGeneration

目录
相关文章
|
5天前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
1576 112
|
12天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1942 8
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
6天前
|
人工智能 程序员 API
Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案
Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做
1002 3
|
6天前
|
编解码 人工智能 安全
2核4G/4核8G/8核16G阿里云服务器如何选择实例?经济型e、通用算力型u2i与计算型c9i选哪个?
本文介绍了阿里云2核4G、4核8G、8核16G三档主流配置下经济型e、通用算力型u2i和计算型c9i三种实例的最新活动价格与适用场景。同配置下三者价差显著,以2核4G为例,经济型e低至599.93元/年,计算型c9i则高达1742.08元/年。文章详细解析了各实例的性能定位:经济型e适合轻负载入门场景,u2i兼顾稳定算力与性价比,c9i凭借第9代至强处理器与芯片级安全能力支撑高性能业务。同时提示用户可叠加满减优惠券享受折上折,建议根据业务负载与预算综合决策。
529 112
|
18天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
2568 4
|
10天前
|
存储 人工智能 关系型数据库
阿里云AI产品与云产品最新组合套餐:Token Plan、AI coding及云服务器和建站等组合优惠价
阿里云推出全新“算力+模型+应用”一站式云与AI组合套餐活动,覆盖从个人开发者到中大型企业的全场景需求。核心亮点为分三档定价的Token Plan订阅服务,支持Qwen3.8-Max-Preview大模型调用,错峰时段最低可享0.2折优惠。活动同步推出AI Coding、智能体部署、云电脑托管、0代码建站等十余类场景化组合,搭配99元/年的普惠云服务器、88元/年的入门数据库等经典特惠产品,还为企业提供1V1定制化AI转型方案,大幅降低了不同用户群体拥抱AI的技术门槛与采购成本。
724 111
|
20天前
|
人工智能 JSON 安全
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
阿里云AI安全产品联动防御Fastjson攻击
2638 13
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
|
6天前
|
人工智能 JSON Shell
2026AI漫剧本地全开源方案(附各个软件模型链接),8G显卡也能流畅运行
这是一套完全本地化部署的AI漫剧生成技术链路:涵盖LLM剧本分镜生成、FLUX文生图(IP-Adapter人脸锁定)、StoryDiffusion时序连贯控制、LTX-2.3唇形同步视频生成,及ComfyUI全流程调度。零云端费用,仅耗硬件算力,单集2–4小时可产出竖屏短视频,适配抖音/B站分发。
|
7天前
Qoder 一周年 × Qwen3.8-Max 正式上线,多重好礼限时领
8月3日,Qwen3.8-Max 正式上线Qoder,迎来Qoder一周年。新老用户可领800次免费调用,下单再赠2000次;夜间(22:00–08:00)调用5折;邀请好友双方得积分与调用额度。
452 1

热门文章

最新文章