业界首个支持9种语言的文图生成模型!智源AltDiffusion开源技术解读

本文涉及的产品
模型在线服务 PAI-EAS,A10/V100等 500元 1个月
模型训练 PAI-DLC,5000CU*H 3个月
图像搜索,7款服务类型 1个月
简介: 业界首个支持9种语言的文图生成模型!智源AltDiffusion开源技术解读


AIGC(AI-Generated Content 人工智能生成内容)是当前 AI 领域最热门的话题之一,受到学界、业界的广泛关注。尤其是伴随着 OpenAI DALL·E 2 的推出到 Stable Diffusion 的开源,文图生成也从之前的研究探索发展到了具有商业化落地潜力的新兴技术。最近一段时间,随着文本生成图像跨模态应用的不断涌现,AIGC 更是火爆出圈,广受关注。


然而,中文和其他语言的文图生成发展滞后于英语世界,大部分团队主要是基于翻译 API + 英文 Stable Diffusion 模型进行开发。在这个背景下,来自智源研究院的研究者通过搭建多语言文图表征模型 AltCLIP,提出了首个支持 9 种语言(英文、中文、日语、法语、韩语、西班牙语、俄语、意大利语、阿拉伯语)的文图生成模型 AltDiffusion。


该研究的主要贡献是搭建了一个多语言文图生成模型的基石,使得更多使用不同语言的创作者可以通过 AltDiffusion 模型进行创作。在 AltDiffusion 中可以观测到一些十分有意思的现象:不同的语言背后蕴含了不同的文化背景,这一点也在 AltDiffusion 生成的图片中有一定程度的反映。


为了方面大家更好的了解这一研究,在最新一期的线上分享中,机器之心邀请到了智源人工智能研究院自然语言和多模态研究负责人及 FlagAI 飞智开源项目负责人伍昱 (Ledell Wu) 为我们介绍关于多语言文图生成模型 AltDiffusion 和多语言多模态表征模型 AltCLIP。




分享主题:AltDiffusion: A multilingual text-to-image generation model


分享摘要:本次分享将介绍多语言文图生成模型 AltDiffusion 和多语言多模态表征模型 AltCLIP。AltCLIP 通过创新换塔和语言对齐等方式,搭建了一个支持多种语言的文图表征模型。AltDiffusion 使用 AltCLIP 作为文本表征,基于 Stable Diffusion 训练了支持 9 种语言的文图生成模型,为目前业界首个支持多种语言的文图生成模型。


嘉宾简介:伍昱(Ledell Wu),智源人工智能研究院自然语言和多模态研究负责人及 FlagAI 飞智开源项目负责人。Facebook AI Research(FAIR)初期成员之一,主导了 StarSpace、PyTorch-BigGraph 和 BLINK 等多个深度学习研究项目和相应工程落地。热爱研究,热爱技术,崇尚极客。

相关文章
|
6月前
|
人工智能 自然语言处理 机器人
Jina AI 发布中英和英德双语 8K 向量模型,魔搭社区开源最佳实践!
在 Jina Embeddings 英语向量模型突破百万下载后,今天,Jina AI正式开源了两款双语向量模型:中英双语(Chinese-English)和英德双语(English-German)向量模型,这也是全球首次推出支持 8K 双语文本的开源向量模型。
|
6月前
|
物联网 机器人 Swift
|
3月前
|
机器学习/深度学习 人工智能 自然语言处理
FunAudioLLM与知名模型对比
FunAudioLLM与知名模型对比
|
2月前
|
机器学习/深度学习 人工智能 自然语言处理
社区供稿 | 元象发布255B大规模MoE开源大模型,落地应用登顶港台榜
元象XVERSE发布 中国最大MoE开源模型:XVERSE-MoE-A36B,加速AI应用低成本部署,将国产开源提升至国际领先水平。
社区供稿 | 元象发布255B大规模MoE开源大模型,落地应用登顶港台榜
|
5月前
|
人工智能 自然语言处理 API
人工智能大模型之开源大语言模型汇总(国内外开源项目模型汇总)
人工智能大模型之开源大语言模型汇总(国内外开源项目模型汇总)
人工智能大模型之开源大语言模型汇总(国内外开源项目模型汇总)
|
4月前
|
编解码 文字识别 计算机视觉
寒武纪1号诞生:谢赛宁Yann LeCun团队发布最强开源多模态LLM
【7月更文挑战第10天】【寒武纪1号】- 谢赛宁、Yann LeCun团队发布开源多模态LLM,含8B至34B规模模型,创新空间视觉聚合器(SVA)提升视觉-语言集成,建立新基准CV-Bench及大规模训练数据集Cambrian-7M。在多模态任务中表现出色,尤其在高分辨率图像处理上,但面临高分辨率信息处理和部分视觉任务评估的局限。[链接](https://arxiv.org/pdf/2406.16860)
96 1
|
5月前
|
人工智能 自然语言处理 测试技术
巨擘之舞:探索AI大模型的发展历程与特性比较
巨擘之舞:探索AI大模型的发展历程与特性比较
|
6月前
|
编解码 人工智能 物联网
CogVLM2: 智谱开源新一代多模态大模型!
智谱·AI推出了新一代 CogVLM2 系列模型,并开源了使用 Meta-Llama-3-8B-Instruct 构建的两个模型。 与上一代CogVLM开源模型相比,CogVLM2系列开源模型有了很多改进...
|
6月前
|
数据采集 人工智能 自然语言处理
中科院国产多语言大模型-YAYI2开源!家族AI应用场景全覆盖!
中科院国产多语言大模型-YAYI2开源!家族AI应用场景全覆盖!
|
6月前
|
人工智能 Apache
社区供稿 | 140B参数、可商用!OpenBuddy 发布首个开源千亿中文 MoE 模型的早期预览版
我们很自豪地于今天发布OpenBuddy最新一代千亿MoE大模型的早期预览版本:OpenBuddy-Mixtral-22Bx8-preview0-65k。此次发布的早期预览版对应约50%的训练进度。