达摩院视觉 AI 技术应用探索(三)|学习笔记

简介: 快速学习达摩院视觉 AI 技术应用探索(三)

开发者学堂课程【视觉 AI 应用开发教程 达摩院视觉 AI 技术应用探索(三)】学习笔记,与课程紧密联系,让用户快速学习知识。

课程地址:https://developer.aliyun.com/learning/course/289/detail/3410


达摩院视觉 AI 技术应用探索(三)


六、视觉迁移

1.视觉迁移—风格纹理变换

现有算法效果的缺点:

·要么风格化不足

•要么重要细节缺失和畸变

■如何充分风格化的同时保持重要细节不被损失或畸变?

·采用大感受野范围的特征进行匹配交换,导致原图细节缺失·采用小感受野范围的特征进行匹配交换,导致风格程度不足■实现方案:自适应多笔触布局(AttentionConsistency)

■图像区域重要度分析:Self Attention(自注意力 Ck 机制)

Self Attention GAN——感知远距离区域的特征相关性特征层计算,1x1卷积,降低计算开销

■多笔触融合

·强注意力区域采用精细粒度笔触,保证细节

弱注意力区域采用粗粒度笔触,充分风格化

image.png

2、视觉迁移——颜色拓展

image.png

视觉迁移一颜色拓展

■传统方案问题——效果差,效率低

·颜色不协调、单一

·受限:不支持位图,主视觉不突出,固定色卡,强交互

现有方案优势:

支持任意图作为参考色进行拓展:提取配色关系,学习参考配色与目标色间的对照关系,转换为二分图匹配问题,利用 Hungarian 算法求解最小分配代价

·计算两个颜色在色彩空间的距离,构建开销矩阵

·求解使得总颜色距离最小的映射,作为色卡的对应关系

√位图拓色效果优秀:通过约束空间一致性,对变换权重进行优化,解决颜色越阶跳变现象

√基于语义信息拓色尽可能保留了原稿主视觉信息:训练分类卷积神经网络(Inception),避免强语义元素不合理拓色(Precision:95%,Recall:83%,毫秒级响应)

绘定目标色系——绘定参考图——自动模式

算法指标:

高时效性:7层的1920*500图像,7种拓色,仅需1.8秒

高合理性:支持全自动配色/元素分拣过滤,效果更稳更好

高拓展性:支持单图、结构化图输入,可参照图片、色卡、智能配色进行拓展输出

 

七、视觉制造

1.实体设计制造

·效率低:多次打样,多次沟通(服装设计平均30天)

.协同差:设计、营销、生成脱节、倒置

.定制难:无法实现柔性生产

image.png

2、视觉制造的核心逻辑

image.png

数字商品:{试点计算 一致性计算 视觉迁移(纹理、材质等) 模型匹配 材质匹配 模型生成}→{实时渲染 离线渲染}

可以渲染到一个具体的图像和模式,去用于商业途径。

1. 视觉制造——包装设计

智能设计的优势:

几何生成          

材质工艺

智能设计

阵列布局  

2D3D 融合

视觉效果逼真、一键出图

·模型通用、尺寸自适应

.多种展示方式,实时修改和定制

匹配包装刀版图,直接对接供应链

几何生成:自适应纹理的几何生成:覆盖目前大部分常见包装类型。

image.png

自动布局:显著性检测,商品自旋转,布局变换矩阵计算,摄像机试点计算

2D3D 融合:集合一致性计算,3D 朝向设计,HDR 光照估计和融合渲染

image.png

4.视觉制造——三维几何自动生成

image.png

5.视觉制造——多样性拓展

image.png

6. 视觉制造——视觉迁移及融合

三维服饰检索:根据图像以及结构化找到匹配的三维模型

image.png

 

八、视觉公共云平台

1.视觉 API 开放平台一定位

解决方案 上层产品 能力组件 原子能力

本平台较关注能力组件和原子能力

image.png

例一:视觉智能开放平台——官网:vision.aliyun.com,里面有大概100中 API 能力

image.png

例二:视觉智能平台——能力布局

image.png

2.视觉智能开放平台的特点:

聚集达摩院及阿里巴巴经济体图像、视频、3D 视觉等领域的科学家和工程师沉淀的视觉 API 能力,打造全球领先的视觉智能技术商业化服务平台,让天下没有难用的视觉智能技术。

拥有阿里巴巴经济体海量场景和最佳案例中锤炼出来的视觉技术,为用户提供具备实战价值且有核心竞争力的视觉AI能力。

提供阿里巴巴经济体全方位视觉能力的输出,荟聚规模化、多样化、细粒度、场景化的视觉 AI 能力,为开发者和用户提供一站式能力选择。

依托阿里云智能坚实的基础设施服务,提供普惠易用的 AI 能力,采用通用且标准化的接口方式,让用户可以快速接入并使用视觉 API,省心省力。

image.png

相关文章
|
20天前
|
数据采集 人工智能 分布式计算
ODPS在AI时代的发展战略与技术演进分析报告
ODPS(现MaxCompute)历经十五年发展,从分布式计算平台演进为AI时代的数据基础设施,以超大规模处理、多模态融合与Data+AI协同为核心竞争力,支撑大模型训练与实时分析等前沿场景,助力企业实现数据驱动与智能化转型。
98 4
|
18天前
|
设计模式 人工智能 API
​​混合检索技术:如何提升AI智能体50%的响应效率?​
本文深入解析检索增强智能体技术,探讨其三大集成模式(工具模式、预检索模式与混合模式),结合实战代码讲解RAG组件链构建、上下文压缩、混合检索等关键技术,并提供多步检索工作流与知识库自更新机制设计,助力高效智能体系统开发。
103 0
|
21天前
|
人工智能 自然语言处理 机器人
智能体平台哪家值得选?盘点国内外12家AI Agent平台技术特色
智能体平台正引领人机协作新潮流,将“智能”交给机器,让“平台”服务于人。2024年被Gartner定义为“AgenticAI元年”,预示未来企业交互将由智能体主导。面对百余平台,可从三条赛道入手:通用大模型、RPA升级派与垂直场景定制。不同需求对应不同方案,选对平台,才能让AI真正助力工作。
|
2月前
|
存储 关系型数据库 数据库
附部署代码|云数据库RDS 全托管 Supabase服务:小白轻松搞定开发AI应用
本文通过一个 Agentic RAG 应用的完整构建流程,展示了如何借助 RDS Supabase 快速搭建具备知识处理与智能决策能力的 AI 应用,展示从数据准备到应用部署的全流程,相较于传统开发模式效率大幅提升。
附部署代码|云数据库RDS 全托管 Supabase服务:小白轻松搞定开发AI应用
|
人工智能 缓存 NoSQL
【深度】企业 AI 落地实践(四):如何构建端到端的 AI 应用观测体系
本文探讨了AI应用在实际落地过程中面临的三大核心问题:如何高效使用AI模型、控制成本以及保障输出质量。文章详细分析了AI应用的典型架构,并提出通过全栈可观测体系实现从用户端到模型推理层的端到端监控与诊断。结合阿里云的实践经验,介绍了基于OpenTelemetry的Trace全链路追踪、关键性能指标(如TTFT、TPOT)采集、模型质量评估与MCP工具调用观测等技术手段,帮助企业在生产环境中实现AI应用的稳定、高效运行。同时,针对Dify等低代码平台的应用部署与优化提供了具体建议,助力企业构建可扩展、可观测的AI应用体系。
|
1月前
|
机器学习/深度学习 人工智能 PyTorch
GPT为定制AI应用工程师转型第一周学习计划
本计划帮助开发者快速入门AI领域,首周涵盖AI基础理论、Python编程及PyTorch实战。前两天学习机器学习、深度学习与Transformer核心概念,掌握LLM工作原理。第三至四天快速掌握Python语法与Jupyter使用,完成基础编程任务。第五至七天学习PyTorch,动手训练MNIST手写识别模型,理解Tensor操作与神经网络构建。
103 0
|
2月前
|
人工智能 监控 数据可视化
BISHENG下一代企业AI应用的“全能型“LLM软件
杭州奥零数据科技有限公司成立于2023年,专注于数据中台业务,维护开源项目AllData并提供商业版解决方案。AllData提供数据集成、存储、开发、治理及BI展示等一站式服务,支持AI大模型应用,助力企业高效利用数据价值。

热门文章

最新文章