达摩院视觉 AI 技术应用探索(三)|学习笔记

简介: 快速学习达摩院视觉 AI 技术应用探索(三)

开发者学堂课程【视觉 AI 应用开发教程 达摩院视觉 AI 技术应用探索(三)】学习笔记,与课程紧密联系,让用户快速学习知识。

课程地址:https://developer.aliyun.com/learning/course/289/detail/3410


达摩院视觉 AI 技术应用探索(三)


六、视觉迁移

1.视觉迁移—风格纹理变换

现有算法效果的缺点:

·要么风格化不足

•要么重要细节缺失和畸变

■如何充分风格化的同时保持重要细节不被损失或畸变?

·采用大感受野范围的特征进行匹配交换,导致原图细节缺失·采用小感受野范围的特征进行匹配交换,导致风格程度不足■实现方案:自适应多笔触布局(AttentionConsistency)

■图像区域重要度分析:Self Attention(自注意力 Ck 机制)

Self Attention GAN——感知远距离区域的特征相关性特征层计算,1x1卷积,降低计算开销

■多笔触融合

·强注意力区域采用精细粒度笔触,保证细节

弱注意力区域采用粗粒度笔触,充分风格化

image.png

2、视觉迁移——颜色拓展

image.png

视觉迁移一颜色拓展

■传统方案问题——效果差,效率低

·颜色不协调、单一

·受限:不支持位图,主视觉不突出,固定色卡,强交互

现有方案优势:

支持任意图作为参考色进行拓展:提取配色关系,学习参考配色与目标色间的对照关系,转换为二分图匹配问题,利用 Hungarian 算法求解最小分配代价

·计算两个颜色在色彩空间的距离,构建开销矩阵

·求解使得总颜色距离最小的映射,作为色卡的对应关系

√位图拓色效果优秀:通过约束空间一致性,对变换权重进行优化,解决颜色越阶跳变现象

√基于语义信息拓色尽可能保留了原稿主视觉信息:训练分类卷积神经网络(Inception),避免强语义元素不合理拓色(Precision:95%,Recall:83%,毫秒级响应)

绘定目标色系——绘定参考图——自动模式

算法指标:

高时效性:7层的1920*500图像,7种拓色,仅需1.8秒

高合理性:支持全自动配色/元素分拣过滤,效果更稳更好

高拓展性:支持单图、结构化图输入,可参照图片、色卡、智能配色进行拓展输出

 

七、视觉制造

1.实体设计制造

·效率低:多次打样,多次沟通(服装设计平均30天)

.协同差:设计、营销、生成脱节、倒置

.定制难:无法实现柔性生产

image.png

2、视觉制造的核心逻辑

image.png

数字商品:{试点计算 一致性计算 视觉迁移(纹理、材质等) 模型匹配 材质匹配 模型生成}→{实时渲染 离线渲染}

可以渲染到一个具体的图像和模式,去用于商业途径。

1. 视觉制造——包装设计

智能设计的优势:

几何生成          

材质工艺

智能设计

阵列布局  

2D3D 融合

视觉效果逼真、一键出图

·模型通用、尺寸自适应

.多种展示方式,实时修改和定制

匹配包装刀版图,直接对接供应链

几何生成:自适应纹理的几何生成:覆盖目前大部分常见包装类型。

image.png

自动布局:显著性检测,商品自旋转,布局变换矩阵计算,摄像机试点计算

2D3D 融合:集合一致性计算,3D 朝向设计,HDR 光照估计和融合渲染

image.png

4.视觉制造——三维几何自动生成

image.png

5.视觉制造——多样性拓展

image.png

6. 视觉制造——视觉迁移及融合

三维服饰检索:根据图像以及结构化找到匹配的三维模型

image.png

 

八、视觉公共云平台

1.视觉 API 开放平台一定位

解决方案 上层产品 能力组件 原子能力

本平台较关注能力组件和原子能力

image.png

例一:视觉智能开放平台——官网:vision.aliyun.com,里面有大概100中 API 能力

image.png

例二:视觉智能平台——能力布局

image.png

2.视觉智能开放平台的特点:

聚集达摩院及阿里巴巴经济体图像、视频、3D 视觉等领域的科学家和工程师沉淀的视觉 API 能力,打造全球领先的视觉智能技术商业化服务平台,让天下没有难用的视觉智能技术。

拥有阿里巴巴经济体海量场景和最佳案例中锤炼出来的视觉技术,为用户提供具备实战价值且有核心竞争力的视觉AI能力。

提供阿里巴巴经济体全方位视觉能力的输出,荟聚规模化、多样化、细粒度、场景化的视觉 AI 能力,为开发者和用户提供一站式能力选择。

依托阿里云智能坚实的基础设施服务,提供普惠易用的 AI 能力,采用通用且标准化的接口方式,让用户可以快速接入并使用视觉 API,省心省力。

image.png

相关文章
|
1天前
|
机器学习/深度学习 人工智能 自然语言处理
转载:【AI系统】AI的领域、场景与行业应用
本文概述了AI的历史、现状及发展趋势,探讨了AI在计算机视觉、自然语言处理、语音识别等领域的应用,以及在金融、医疗、教育、互联网等行业中的实践案例。随着技术进步,AI模型正从单一走向多样化,从小规模到大规模分布式训练,企业级AI系统设计面临更多挑战,同时也带来了新的研究与工程实践机遇。文中强调了AI基础设施的重要性,并鼓励读者深入了解AI系统的设计原则与研究方法,共同推动AI技术的发展。
转载:【AI系统】AI的领域、场景与行业应用
|
1天前
|
人工智能 缓存 异构计算
云原生AI加速生成式人工智能应用的部署构建
本文探讨了云原生技术背景下,尤其是Kubernetes和容器技术的发展,对模型推理服务带来的挑战与优化策略。文中详细介绍了Knative的弹性扩展机制,包括HPA和CronHPA,以及针对传统弹性扩展“滞后”问题提出的AHPA(高级弹性预测)。此外,文章重点介绍了Fluid项目,它通过分布式缓存优化了模型加载的I/O操作,显著缩短了推理服务的冷启动时间,特别是在处理大规模并发请求时表现出色。通过实际案例,展示了Fluid在vLLM和Qwen模型推理中的应用效果,证明了其在提高模型推理效率和响应速度方面的优势。
云原生AI加速生成式人工智能应用的部署构建
|
1天前
|
机器学习/深度学习 人工智能 物联网
AI赋能大学计划·大模型技术与应用实战学生训练营——电子科技大学站圆满结营
12月05日,由中国软件行业校园招聘与实习公共服务平台携手阿里魔搭社区共同举办的AI赋能大学计划·大模型技术与产业趋势高校行AIGC项目实战营·电子科技大学站圆满结营。
AI赋能大学计划·大模型技术与应用实战学生训练营——电子科技大学站圆满结营
|
6天前
|
机器学习/深度学习 人工智能 JSON
【实战干货】AI大模型工程应用于车联网场景的实战总结
本文介绍了图像生成技术在AIGC领域的发展历程、关键技术和当前趋势,以及这些技术如何应用于新能源汽车行业的车联网服务中。
|
2天前
|
人工智能 Kubernetes 安全
赋能加速AI应用交付,F5 BIG-IP Next for Kubernetes方案解读
赋能加速AI应用交付,F5 BIG-IP Next for Kubernetes方案解读
31 13
|
2天前
|
机器学习/深度学习 人工智能 边缘计算
24/7全时守护:AI视频监控技术的深度实现与应用分享
本文深入解析了AI视频监控系统在车间安全领域的技术实现与应用,涵盖多源数据接入、边缘计算、深度学习驱动的智能分析及高效预警机制,通过具体案例展示了系统的实时性、高精度和易部署特性,为工业安全管理提供了新路径。
|
6天前
|
机器学习/深度学习 人工智能 自然语言处理
AI技术在自然语言处理中的应用
随着人工智能技术的不断发展,自然语言处理(NLP)已经成为了一个重要的应用领域。本文将介绍一些常见的NLP任务和算法,并通过代码示例来展示如何实现这些任务。我们将讨论文本分类、情感分析、命名实体识别等常见任务,并使用Python和相关库来实现这些任务。最后,我们将探讨NLP在未来的发展趋势和挑战。
|
7天前
|
人工智能 运维 自然语言处理
智能化运维:AI在IT运维领域的深度应用与实践####
本文探讨了人工智能(AI)技术在IT运维领域的深度融合与实践应用,通过分析AI驱动的自动化监控、故障预测与诊断、容量规划及智能决策支持等关键方面,揭示了AI如何赋能IT运维,提升效率、降低成本并增强系统稳定性。文章旨在为读者提供一个关于AI在现代IT运维中应用的全面视角,展示其实际价值与未来发展趋势。 ####
61 4
|
6天前
|
机器学习/深度学习 人工智能 安全
AI技术在医疗领域的应用与挑战
本文将探讨AI技术在医疗领域的应用及其带来的挑战。我们将介绍AI技术如何改变医疗行业的面貌,包括提高诊断准确性、个性化治疗方案和预测疾病风险等方面。同时,我们也将讨论AI技术在医疗领域面临的挑战,如数据隐私和安全问题、缺乏标准化和监管框架以及医生和患者对AI技术的接受程度等。最后,我们将通过一个代码示例来展示如何使用AI技术进行疾病预测。
17 2
|
7天前
|
机器学习/深度学习 人工智能 搜索推荐
AI技术在医疗领域的应用与前景
本文探讨了人工智能(AI)技术在医疗领域的应用,包括疾病诊断、治疗方案制定、药物研发等方面。通过对现有研究成果的梳理,分析了AI技术在提高医疗服务效率、降低医疗成本、改善患者体验等方面的潜力。同时,也指出了AI技术在医疗领域面临的挑战,如数据隐私保护、伦理道德问题等,并展望了未来的发展趋势。
29 2