Infinity:字节跳动开源高分辨率图像生成模型,生成 1024x1024 的图像仅需 0.8 秒

简介: Infinity 是字节跳动推出的高分辨率图像生成模型,通过位级自回归建模和无限词汇量标记器,显著提升了图像生成的细节和质量。

❤️ 如果你也关注 AI 的发展现状,且对 AI 应用开发非常感兴趣,我会每日跟你分享最新的 AI 资讯和开源应用,也会不定期分享自己的想法和开源实例,欢迎关注我哦!

🥦 微信公众号|搜一搜:蚝油菜花 🥦

原文链接:https://mp.weixin.qq.com/s/j8b8rTEp9IV9XiCfQooThw


🚀 快速阅读

  1. 功能:Infinity 能够根据文本描述生成高分辨率、逼真的图像。
  2. 技术:采用位级自回归建模和无限词汇量标记器,提升图像生成质量。
  3. 性能:生成 1024×1024 的高质量图像仅需 0.8 秒,比 SD3-Medium 快 2.6 倍。

正文(附运行示例)

Infinity 是什么

公众号: 蚝油菜花 - Infinity

Infinity 是字节跳动推出的基于位级自回归建模的视觉生成模型,能够根据语言指令生成高分辨率、逼真的图像。该模型通过无限词汇量的标记器、分类器和位自纠正机制,显著提升了图像生成的细节和质量。

Infinity 在生成 1024×1024 的高质量图像时,仅需 0.8 秒,比 SD3-Medium 快 2.6 倍,且具有更快的推理速度。它为自回归文本到图像生成模型设定了新的性能标准。

Infinity 的主要功能

  • 文本到图像合成:用户输入文本描述,系统将生成相应的图像内容。
  • 空间推理:在生成图像时考虑空间关系,确保图像的空间布局合理。
  • 文本渲染:在图像中渲染文本,根据用户的指令调整字体、样式、颜色等。
  • 多风格和长宽比适应:生成不同风格和长宽比的图像,适应多样化的视觉效果需求。

Infinity 的技术原理

  • 位视觉自回归建模:基于位级别的预测框架重新定义视觉自回归模型,用无限词汇量的标记器和分类器。
  • 无限词汇量标记器:将标记器的词汇量扩展到无穷大,减少量化误差,提高细节重建能力。
  • 位自纠正机制:在训练过程中随机翻转某些位模拟预测错误,并重新量化残差特征,让系统具备自我纠正的能力。
  • 变换器(Transformer)扩展:扩展变换器的大小增强模型的生成能力。
  • 量化连续特征:将连续的特征量化为索引标签,通过位标签(量化特征)提供稳定的监督信号。

如何运行 Infinity

Infinity 提供了多种运行方式,包括通过 HuggingFace 模型库和 GitHub 仓库进行本地部署。以下是一个简单的运行示例:

from transformers import AutoModelForCausalLM, AutoTokenizer

# 加载模型和分词器
model = AutoModelForCausalLM.from_pretrained("FoundationVision/Infinity")
tokenizer = AutoTokenizer.from_pretrained("FoundationVision/Infinity")

# 输入文本描述
prompt = "A beautiful sunset over the mountains"

# 生成图像
output = model.generate(tokenizer(prompt, return_tensors="pt").input_ids)

# 保存生成的图像
output.save("generated_image.png")

资源


❤️ 如果你也关注 AI 的发展现状,且对 AI 应用开发非常感兴趣,我会每日跟你分享最新的 AI 资讯和开源应用,也会不定期分享自己的想法和开源实例,欢迎关注我哦!

🥦 微信公众号|搜一搜:蚝油菜花 🥦

相关文章
|
存储 JavaScript 前端开发
盘点主流 Flutter 状态管理库2024
状态管理是每个应用不可缺少的,本文将会盘点下主流的状态管理包。
934 2
盘点主流 Flutter 状态管理库2024
|
8月前
|
机器学习/深度学习 自然语言处理 搜索推荐
蚂蚁百灵全模态 Ming-flash-omni-2.0 开源!视觉百科+可控语音生成+全能型图像编辑,打破全模态“博而不精”
2月11日,蚂蚁百灵团队开源全模态大模型Ming-flash-omni-2.0(基于Ling-2.0 MoE架构),在视觉理解、语音交互与图像编辑三大领域实现代际跃迁,达开源领先水平。支持多模态统一生成与深度编辑,模型权重与代码已开放。
1296 4
 蚂蚁百灵全模态 Ming-flash-omni-2.0 开源!视觉百科+可控语音生成+全能型图像编辑,打破全模态“博而不精”
|
人工智能 编解码 物联网
设计师集体破防!UNO:字节跳动创新AI图像生成框架,多个参考主体同框生成,位置/材质/光影完美对齐
UNO是字节跳动开发的AI图像生成框架,通过渐进式跨模态对齐和通用旋转位置嵌入技术,解决了多主体场景下的生成一致性问题。该框架支持单主体特征保持与多主体组合生成,在虚拟试穿、产品设计等领域展现强大泛化能力。
1109 4
设计师集体破防!UNO:字节跳动创新AI图像生成框架,多个参考主体同框生成,位置/材质/光影完美对齐
|
机器学习/深度学习 人工智能 计算机视觉
AI图像质感还原堪比专业摄影!Miracle F1:美图WHEE全新AI图像生成模型,支持超写实与多风格生成
美图WHEE推出的Miracle F1采用扩散模型技术,通过精准语义理解和多风格生成能力,可产出具有真实光影质感的专业级图像作品。
780 5
AI图像质感还原堪比专业摄影!Miracle F1:美图WHEE全新AI图像生成模型,支持超写实与多风格生成
|
8月前
|
人工智能 安全 机器人
AI智能体的开发费用
AI智能体开发已分级定价:轻量级5–15万(单场景MVP),中级20–60万(多步工作流),企业级100万+(多Agent协同+合规部署)。成本聚焦架构编排、工具集成、提示工程与安全评估,另含Token消耗、算力及数据治理等隐性支出。建议先做PoC验证效果。
IntelliJ IDEA 自定义控制台输出多颜色格式功能 --- 安装Grep Console插件
IntelliJ IDEA 自定义控制台输出多颜色格式功能 --- 安装Grep Console插件
4725 0
|
编解码 人工智能 测试技术
CogView4:智谱开源中文文生图新标杆,中文海报+任意分辨率一键生成
CogView4 是智谱推出的开源文生图模型,支持中英双语输入和任意分辨率图像生成,特别优化了中文文字生成能力,适合广告、创意设计等场景。
1052 1
CogView4:智谱开源中文文生图新标杆,中文海报+任意分辨率一键生成
|
11月前
|
人工智能 运维 供应链
20个低代码开发平台多维度对比:解锁企业应用开发新动能
Gartner 报告指出,到 2024 年,低代码应用开发将占应用开发总数的 65%以上,将有 3/4 的大型企业会使用至少 4 个低代码平台进行 IT 应用开发。同时,市场研究机构的数据显示,在传统开发模式下,超过 70% 的企业项目存在开发周期延长的问题,平均延长时间达到原计划的 30%;约 80% 的企业表示在招募专业开发人才时面临困难;而面对个性化需求,近 90% 的企业认为传统开发响应速度慢,无法及时满足业务变化需求。这些数据充分表明,当前企业在应用开发上面临问题具有普遍性和严重性,低代码开发平台的兴起势在必行 ,其有望成为解决这些难题、推动企业数字化转型的关键力量。
1173 0
|
人工智能 计算机视觉
漫画师福音!开源AI神器让线稿着色快如闪电!MagicColor:港科大开源多实例线稿着色框架,一键生成动画级彩图
MagicColor是香港科技大学推出的多实例线稿着色框架,基于扩散模型和自监督训练策略,实现单次前向传播完成多实例精准着色,大幅提升动画制作和数字艺术创作效率。
1531 20
漫画师福音!开源AI神器让线稿着色快如闪电!MagicColor:港科大开源多实例线稿着色框架,一键生成动画级彩图
|
机器学习/深度学习 编解码 人工智能
InvSR:开源图像超分辨率生成模型,提升分辨率,修复老旧照片为超清图像
InvSR 是一个创新的图像超分辨率模型,基于扩散模型的逆过程恢复高分辨率图像。它通过深度噪声预测器和灵活的采样机制,能够高效地提升图像分辨率,适用于老旧照片修复、视频监控、医疗成像等多个领域。
3539 9
InvSR:开源图像超分辨率生成模型,提升分辨率,修复老旧照片为超清图像

热门文章

最新文章