“一丹一世界”三等奖 | 绮影录 创作分享

简介: “一丹一世界”三等奖 | 绮影录 创作分享

  image.gif 编辑

 

大家好我是圆香芹,一位专注 A IGC图像领域的创作者,以下是一个简单的自我介绍:

image.gif 编辑

 

image.gif 编辑

 

非常荣幸,本次”绮影录”lora作品获得魔搭平台”一丹一世界风格lora大赛”三等奖!感谢魔搭平台与麦乐园的认可。作为非专业模型训练师,我由衷感谢魔搭社区与麦乐园降低了技术门槛,让我得以顺利进入这个领域。在此分享一些经验与心得。

 

1.对lora的看法

一直以来我们对lora模型的训练都望而却步,但其实我们把lora训练的流程拆解来看的话,无非就是三个步骤,素材、参数、测试最优选。

简单来说,训练LORA本质上是将你的审美偏好转化为数字编码的过程。你选择的训练图像质量越高,审美越独特,最终效果就越接近你心目中的理想状态。因此,数据收集与清洗阶段实际上决定了你模型的潜力上限。

 

2.见解

在参数调优方面,首要任务是评估基础大模型的固有优势。以麦橘超然为例,这个模型专门针对亚洲人脸进行了微调训练,着力改善胶皮质感,核心优势在于呈现真实质感。

在场景写实度上,原版 F lux DVE确实存在不足。基于这一认知,我在收集素材时将插画类与写实类素材混合使用。理由很简单:既然底层模型本身具有写实特性,它在写实表现上自然强于插画风格。利用这一特点,我们是否就能创造出一种介于真实与虚幻之间的独特质感呢?

训练绮影录时,我的目标就是打造超现实风格。我们都知道写实系大模型在超现实表现上通常较弱。那么,通过混合超现实插画与写实风格素材,再结合麦橘超然模型优秀的肢体表现能力,是否就能达到最佳的泛化效果?结果证明确实如此:最终的模型既能生成超现实插画,又能呈现写实质感的人像,同时显著减少了肢体畸变的问题。

 

3.参数与测试

魔搭平台的训练器已经相当友好。从我的测试经验来看,最关键的参数是学习率、rank d im和 A lpha。

对于类似绮影录这样的人像+风格类模型,学习率保持在5e-5最为理想。这个参数能够细腻地学习人像细节(如毛孔纹理),同时作为超现实风格模型,也能捕捉到整体画风。

更重要的是 rank d im和 A lpha的设置,我都选择了16。为什么这样配置?可以这样理解:rank d im就像一个立方体容器架构,数值越大,能容纳的细节就越多,反之越少。而容器越大,就越需要控制过拟合风险。Alpha则像一个水龙头开关,值越小,模型在生成图像时影响全局的权重就越小,反之越大。因此我选择了两者持平。

关于模型测试,找到最优选择可分几步进行。当训练出30个模型后,最佳选择通常不会是最后几个,因为模型训练质量并非线性提升。测试时应该使用不同权重配比进行多轮比较。重要的是,避免用训练集中的提示词测试,这没有太大意义,既然已经训练模型,直接测试泛化能力才更有价值。

绮影录展示图:

image.gif 编辑

 

再次感谢魔搭与麦乐员对我的认可,本次经验就分享到这里讲的不对的地方欢迎大伙锐评~

目录
相关文章
|
人工智能 自然语言处理 算法
"一丹一世界"一等奖 | 曙光_麦橘超然 创作分享
"一丹一世界"一等奖 | 曙光_麦橘超然 创作分享
449 4
|
人工智能 API C++
【AI绘画大比拼】通义万相VS文心一格:探索十种风格下的绘画生成差异!
近日,通义大模型家族的新成员——通义万相已在人工智能大会上亮相。其中,通义万相的强大的“文生图”功能,不禁让我想到了去年八月由百度依托飞桨、文心大模型的技术创新推出的“AI作画”首款产品——文心一格。 那么,在类似的Prompt下,两款产品的表现将会如何呢?今天就让我们就十种风格下二者生成图像的表现力,来看看这两款产品的差异。
|
人工智能 并行计算 测试技术
从商业海报到二次元插画多风格通吃!HiDream-I1:智象未来开源文生图模型,17亿参数秒出艺术大作
HiDream-I1是智象未来团队推出的开源图像生成模型,采用扩散模型技术和混合专家架构,在图像质量、提示词遵循能力等方面表现优异,支持多种风格生成。
1417 2
从商业海报到二次元插画多风格通吃!HiDream-I1:智象未来开源文生图模型,17亿参数秒出艺术大作
|
机器学习/深度学习 人工智能 编解码
快速生成商业级高清图!SimpleAR:复旦联合字节推出图像生成黑科技,5亿参数秒出高清大图
SimpleAR是复旦大学与字节Seed团队联合研发的自回归图像生成模型,仅用5亿参数即可生成1024×1024分辨率的高质量图像,在GenEval等基准测试中表现优异。
682 4
快速生成商业级高清图!SimpleAR:复旦联合字节推出图像生成黑科技,5亿参数秒出高清大图
|
编解码 物联网 API
"揭秘SD文生图的神秘面纱:从选择模型到生成图像,一键解锁你的创意图像世界,你敢来挑战吗?"
【10月更文挑战第14天】Stable Diffusion(SD)文生图功能让用户通过文字描述生成复杂图像。过程包括:选择合适的SD模型(如二次元、2.5D、写实等),编写精准的提示词(正向和反向提示词),设置参数(迭代步数、采样方法、分辨率等),并调用API生成图像。示例代码展示了如何使用Python实现这一过程。
937 4
|
Linux iOS开发 MacOS
Krita 5.2.10 (Linux, macOS, Windows) - 开源免费绘画软件
Krita 5.2.10 (Linux, macOS, Windows) - 开源免费绘画软件
711 0
Krita 5.2.10 (Linux, macOS, Windows) - 开源免费绘画软件
|
人工智能 计算机视觉
漫画师福音!开源AI神器让线稿着色快如闪电!MagicColor:港科大开源多实例线稿着色框架,一键生成动画级彩图
MagicColor是香港科技大学推出的多实例线稿着色框架,基于扩散模型和自监督训练策略,实现单次前向传播完成多实例精准着色,大幅提升动画制作和数字艺术创作效率。
1460 20
漫画师福音!开源AI神器让线稿着色快如闪电!MagicColor:港科大开源多实例线稿着色框架,一键生成动画级彩图
|
机器学习/深度学习 人工智能 编解码
EasyControl Ghibli:在线体验一键生成宫崎骏动画风,开源AI模型让你的照片秒变吉卜力
EasyControl Ghibli是基于扩散模型的AI工具,通过条件注入技术将普通照片转化为吉卜力动画风格,仅需100张训练样本即可精准还原标志性光影与色调特征。
1812 11
EasyControl Ghibli:在线体验一键生成宫崎骏动画风,开源AI模型让你的照片秒变吉卜力
|
人工智能 自然语言处理 物联网
"一丹一世界"二等奖 | TPSZ_二次元卡通梦幻插画风格-童梦拾光 创作分享
"一丹一世界"二等奖 | TPSZ_二次元卡通梦幻插画风格-童梦拾光 创作分享
546 7
|
人工智能 编解码
通义万相2.1:VBench榜单荣登第一!阿里通义万相最新视频生成模型,支持生成1080P长视频
万相2.1是阿里通义万相最新推出的视频生成模型,支持1080P无限长视频生成,具备复杂动作展现、物理规律还原、艺术风格转换等功能。
3645 27
通义万相2.1:VBench榜单荣登第一!阿里通义万相最新视频生成模型,支持生成1080P长视频

热门文章

最新文章