这个懂中文的AI高手,画出的高山明月太惊艳!中英双语AltDiffusion模型已开源

本文涉及的产品
交互式建模 PAI-DSW,每月250计算时 3个月
模型训练 PAI-DLC,5000CU*H 3个月
模型在线服务 PAI-EAS,A10/V100等 500元 1个月
简介: 这个懂中文的AI高手,画出的高山明月太惊艳!中英双语AltDiffusion模型已开源

【新智元导读】AIGC 如火如荼发展的当下,中文世界的创作者常有几大痛点:思考英文Prompts准确表达的绞尽脑汁,翻译软件词不达意的尴尬,精细构思的 Prompts 在画面生成中找不到一丝痕迹,亦或面对文化误解中的「中国风」哭笑不得……


日前,智源研究院大模型研究团队开源最新双语 AltDiffusion 模型,为中文世界带来专业级 AI 文图创作的强劲动力:

支持精细长中文 Prompts 高级创作;无需文化转译,从原汁原味中国话直达形神兼备中国画;且在绘画水平上达到低门槛中英对齐原版 Stable Diffusion 级震撼视效,可以说是讲中文的世界级 AI 绘画高手。

创新模型 AltCLIP 为这一工作的基石,为原 CLIP 模型补齐更强的跨语言三大能力。AltDiffusion 和 AltCLIP 模型均为多语言模型,中英双语为第一阶段工作,代码与模型已开源。

AltDiffusion

https://github.com/FlagAI-Open/FlagAI/tree/master/examples/AltDiffusion 

AltCLIP

https://github.com/FlagAI-Open/FlagAI/examples/AltCLIP 

HuggingFace space试玩地址:

https://huggingface.co/spaces/BAAI/bilingual_stable_diffusion

技术报告

https://arxiv.org/abs/2211.06679

专业级中文 AltDiffusion

——长Prompt精细绘画 + 原生中国风,满足中文AI创作高手的高需求

得益于以 AltCLIP 为基础的强大中英双语言对齐能力,AltDiffusion 达到近似于 Stable Diffusion 程度的视效水平,尤其具备更懂中国话、更善中国画的独特优势,非常值得专业级中文AI文图创作者期待。

1. 长Prompt生成,画面效果毫不逊色

Prompt长短是检验模型文图生成能力的分水岭,越长的Prompt,越考验语言理解、图文对齐和跨语言这三大能力。

在同样的中英文长 Prompt 输入调校下,AltDiffusion 在不少图片生成案例中表现力甚至更胜一筹:元素构成丰富精彩、细节描摹细腻精准。

左滑一览主流模型同主题创作效果

2. 更懂中国话,更善中国画

除中英文 Prompts 输入表现近似之外,AltDiffusion 还能补齐西方世界里中国画风的不足,利用中文图文对继续微调出中文特色的生成,例如国画风格生成模型,产出真正的「中国风」。

左滑饱览旖旎国风美▽

AltDiffusion 更懂中文,在中国文化语境中的意义描摹上指哪打哪,秒懂创作者意图。例如对「唐朝盛景」的描绘,避免出现因文化误解而产生的跑题情况。


尤其对原生于中国文化的概念,理解与表现更为精确,得以避免「日本风」与「中国风」混淆,令人啼笑皆非的状况。例如,与Stable Diffusion在中英文输入对应唐装人物风格的Prompts,差异一目了然:

左滑对比两种「中国风」▽

在特定风格的生成中,会原生以中文文化语境为身份主体,进行风格创作,例如对于下面带有「古建筑」的prompt,会默认生成中国古代建筑。在创作风格上更加贴合中文创作者身份。

3. 中英双语,生成效果对齐

AltDiffusion基于Stable Diffusion,通过将原来Stable Diffusion中的CLIP替换成AltCLIP,并且用中英文图文对对模型进行进一步的训练得到。得益于 AltCLIP 强大的语言对齐能力,AltDiffusion 的生成效果在英文上与 Stable Diffusion 很接近,在中英文双语的表现上也体现了一致性。

如「戴帽子小狗」的同义中英文Prompts输入AltDiffusion后,生成画面效果基本对齐,一致性极高:

在对「男孩」的画面增加描述词为「中国男孩」之后,在原小男孩形象基础上,精准调整成典型「中国」孩子,在语言控制生成中展现出极佳语言理解能力和精准的生成表达结果。


打通StableDiffusion原生态

——丰富生态工具与PromptsBook应用,可玩性极佳

特别值得一提的是 AltDiffusion 的生态打通能力:

所有支持Stable Diffusion的工具如Stable Diffusion WebUI,DreamBooth等都可应用在我们的中英双语 Diffusion 模型上,为中文AI创作提供了丰富选择:

1.  Stable Diffusion WebUI

一个优秀的文图生成、文图编辑的网页工具;当我们把北大夜景图霍格沃茨(prompt: Hogwarts)化,瞬间即可呈现梦幻的魔法世界;

左滑直通霍格沃茨

2. DreamBooth

通过少量样本对模型进行调试以生成特定的风格的工具;通过这一工具,在AltDiffusion上利用少量中文图片即可生成特定风格,比如「大闹天宫」风格。

3.  充分利用社区Stable Prompts Book

Prompts 对于生成模型非常重要,社区用户通过大量 prompts 尝试,积累出丰富的生成效果案例。这些宝贵的 prompts 经验,对于 AltDiffusion 用户几乎全都适用!

此外,还可以通过混合中英文方式去搭配一些神奇的风格和元素,或继续挖掘对AltDiffusion适用的中文Prompts。

4.  方便中文创作者微调

开源的AltDiffusion提供了中文生成模型的一个基础,大家可以在这个基础上用更多特定领域的中文数据进行模型微调,方便中文创作者表达。

以首个双语 AltCLIP 为基石

——全面增强跨语言三大能力,中英对齐、中文更优,极低门槛

语言理解,图文对齐,跨语言能力,是跨语言研究必备的三种能力。

AltDiffusion 的诸多专业级能力,源于 AltCLIP 以创新性换塔思路,在这三大能力上全面增强:与原 CLIP 中英文语言对齐能力大大提高,可以无缝接入 Stable Diffusion 等所有建立在原 CLIP 上的模型和生态工具;同时赋予其强悍的中文能力,在多项数据集取得中文更优效果。(详细解读请参考技术报告)

值得一提的是,这种对齐方法对训练多语言多模态表征模型的门槛大大降低,相对于重新去做中文或者英文的图文对预训练,只需约 1% 的计算资源与图文对数据。

在全面CLIP benchmark中取得了和英文原版一致效果在一些检索类数据集上如Flicker-30K上超过了原版

Flicker-30K上表现效果超过原版CLIP

中文ImageNet上zero-shot结果最优

参考资料:https://mp.weixin.qq.com/s/mQ0CcTlkrMalZhPSMg4K4Q

相关文章
|
1月前
|
机器学习/深度学习 人工智能 并行计算
"震撼!CLIP模型:OpenAI的跨模态奇迹,让图像与文字共舞,解锁AI理解新纪元!"
【10月更文挑战第14天】CLIP是由OpenAI在2021年推出的一种图像和文本联合表示学习模型,通过对比学习方法预训练,能有效理解图像与文本的关系。该模型由图像编码器和文本编码器组成,分别处理图像和文本数据,通过共享向量空间实现信息融合。CLIP利用大规模图像-文本对数据集进行训练,能够实现zero-shot图像分类、文本-图像检索等多种任务,展现出强大的跨模态理解能力。
85 2
|
1月前
|
机器学习/深度学习 人工智能 自然语言处理
当语言遇见智慧火花:GPT家族历代模型大起底,带你见证从平凡到卓越的AI进化奇迹!
【10月更文挑战第6天】随着自然语言处理技术的进步,GPT系列模型(Generative Pre-trained Transformers)成为该领域的明星。从GPT-1的开创性工作,到GPT-2在规模与性能上的突破,再到拥有1750亿参数的GPT-3及其无需微调即可执行多种NLP任务的能力,以及社区驱动的GPT-NeoX,这些模型不断进化。虽然它们展现出强大的语言理解和生成能力,但也存在如生成错误信息或偏见等问题。本文将对比分析各代GPT模型的特点,并通过示例代码展示其部分功能。
111 2
|
16天前
|
机器学习/深度学习 人工智能 算法
整合海量公共数据,谷歌开源AI统计学专家DataGemma
【10月更文挑战第28天】谷歌近期开源了DataGemma,一款AI统计学专家工具,旨在帮助用户轻松整合和利用海量公共数据。DataGemma不仅提供便捷的数据访问和处理功能,还具备强大的数据分析能力,支持描述性统计、回归分析和聚类分析等。其开源性质和广泛的数据来源使其成为AI研究和应用的重要工具,有助于加速研究进展和推动数据共享。
44 6
|
1月前
|
存储 人工智能 uml
介绍一款好用的开源画图神器-draw.io | AI应用开发
draw.io 是一款基于浏览器的开源绘图工具,无需安装即可使用,支持多种操作系统和设备。其简洁的界面、丰富的形状库、智能对齐功能和强大的云端协作能力,使其成为专业人士和创意爱好者的首选。无论是产品设计、流程图绘制还是思维导图构建,draw.io 都能满足你的多样化需求。【10月更文挑战第7天】
112 0
|
16天前
|
存储 人工智能 SEO
全开源免费AI网址导航网站源码
Aigotools 可以帮助用户快速创建和管理导航站点,内置站点管理和自动收录功能,同时提供国际化、SEO、多种图片存储方案。让用户可以快速部署上线自己的导航站。
35 1
|
23天前
|
人工智能
AI科学家太多,谁靠谱一试便知!普林斯顿新基准CORE-Bench:最强模型仅有21%准确率
【10月更文挑战第21天】普林斯顿大学研究人员提出了CORE-Bench,一个基于计算可重复性的AI代理基准,涵盖计算机科学、社会科学和医学领域的270个任务。该基准旨在评估AI代理在科学研究中的准确性,具有多样性、难度级别和现实相关性等特点,有助于推动AI代理的发展并提高计算可重复性。
41 4
|
1月前
|
人工智能 Java API
阿里云开源 AI 应用开发框架:Spring AI Alibaba
近期,阿里云重磅发布了首款面向 Java 开发者的开源 AI 应用开发框架:Spring AI Alibaba(项目 Github 仓库地址:alibaba/spring-ai-alibaba),Spring AI Alibaba 项目基于 Spring AI 构建,是阿里云通义系列模型及服务在 Java AI 应用开发领域的最佳实践,提供高层次的 AI API 抽象与云原生基础设施集成方案,帮助开发者快速构建 AI 应用。本文将详细介绍 Spring AI Alibaba 的核心特性,并通过「智能机票助手」的示例直观的展示 Spring AI Alibaba 开发 AI 应用的便利性。示例源
|
1月前
|
人工智能 自然语言处理
从迷茫到精通:揭秘模型微调如何助你轻松驾驭AI新热点,解锁预训练模型的无限潜能!
【10月更文挑战第13天】本文通过简单的问题解答形式,结合示例代码,详细介绍了模型微调的全流程。从选择预训练模型、准备新任务数据集、设置微调参数,到进行微调训练和评估调优,帮助读者全面理解模型微调的技术细节和应用场景。
69 6
|
1月前
|
人工智能 Java API
阿里云开源 AI 应用开发框架:Spring AI Alibaba
阿里云开源 Spring AI Alibaba,旨在帮助 Java 开发者快速构建 AI 应用,共同构建物理新世界。
|
1月前
|
人工智能 自然语言处理 安全
【通义】AI视界|Adobe推出文生视频AI模型,迎战OpenAI和Meta
本文精选了过去24小时内的重要科技新闻,包括微软人工智能副总裁跳槽至OpenAI、Adobe推出文本生成视频的AI模型、Meta取消高端头显转而开发超轻量设备、谷歌与核能公司合作为数据中心供电,以及英伟达股价创下新高,市值接近3.4万亿美元。这些动态展示了科技行业的快速发展和激烈竞争。点击链接或扫描二维码获取更多资讯。

热门文章

最新文章