阿里视觉AI训练营-day01

简介: 从视觉生产技术的定义和分类、精细理解、视觉生产等方面讲解

视觉生产技术

一.定义和分类:

1.1.定义:通过一个/一系列视觉过程,产出新的视觉表达。
产出:人或机器能够感知的图像视频,而不是标签或特征;
要求:新的,和输入不一样的

在这里插入图片描述

1.2.分类:

在这里插入图片描述

1.3.通用基础框架

在这里插入图片描述

1.4.五个关键维度
  • 满足视觉/美学表现
  • 合乎语义/内容逻辑
  • 保证结果的丰富性
  • 提供用户预期的抓手【可控】
  • 带来用户/商业价值【可用】
    在这里插入图片描述

二.精细理解

2.1.分割抠图
  • 识别:知道是什么?
    在这里插入图片描述
  • 检测:识别 + 知道在哪儿
    在这里插入图片描述
  • 分割:识别 + 检测 + 知道每一个像素是什么
    在这里插入图片描述
2.2.分割抠图---难点
  • 复杂背景
  • 发丝精扣
  • 透明材质
  • 遮挡
  • 边缘反色
  • 多尺度/目标

数据严重不足,标注成本高

在这里插入图片描述

2.3.分割抠图--解题思路

在这里插入图片描述

  1. 复杂问题拆解:粗mask设计 + 精准matting
  2. 丰富数据样本:设计图像mask统一模型
2.4.分割抠图--模型框架

在这里插入图片描述

2.5.分割抠图--人像抠图

在这里插入图片描述

2.6.分割抠图--物体抠图拓展

在这里插入图片描述

2.7.分割抠图——场景抠图

在这里插入图片描述

三.视觉生成

3.1视觉生成--框架流程

在这里插入图片描述

3.2.视觉生成--电商设计
  • 照图生图
    在这里插入图片描述
  • 个性化设计
    在这里插入图片描述
3.3.视觉生成--鹿班场景智能美工
  • IN:营销场景+原始素材
  • OUT:营销图片
  • 调用方式:API
    在这里插入图片描述

##### 3.4.视觉生成--AlibabaWood
一键生成短视频:AlibabaWood
在这里插入图片描述

3.5.视觉生成--框架流程

在这里插入图片描述

四.视觉编辑--移花接木

4.1.视频植入
  • 目前大部分广告都是与内容无关的,对用户不太友好,视频植入手段可将广告植入到视频中,提升用户体验
    在这里插入图片描述

在这里插入图片描述

4.2.视觉编辑——植入位检测与定位

在这里插入图片描述

4.3.视觉编辑——动态检测分割
  • 单独分割
  • 遮挡关系等
    在这里插入图片描述

##### 4.4.视觉编辑——视频内容擦除
在这里插入图片描述
##### 4.5.视觉编辑——文字擦除
在这里插入图片描述
##### 4.6.视觉编辑——图像尺寸变化
在这里插入图片描述
## 五.视觉增强——修旧如新
##### 5.1.视觉增强——视频增强
在这里插入图片描述

5.2.视觉增强——人脸修复增强

在这里插入图片描述

5.3.视觉增强——风格迁移

在这里插入图片描述

5.4.视觉增强——颜色拓展

在这里插入图片描述

六.智能开放平台

在这里插入图片描述在这里插入图片描述在这里插入图片描述

目录
相关文章
|
11天前
|
机器学习/深度学习 人工智能 物联网
AI赋能大学计划·大模型技术与应用实战学生训练营——湖南大学站圆满结营
12月14日,由中国软件行业校园招聘与实习公共服务平台携手魔搭社区共同举办的AI赋能大学计划·大模型技术与产业趋势高校行AIGC项目实战营·湖南大学站圆满结营。
AI赋能大学计划·大模型技术与应用实战学生训练营——湖南大学站圆满结营
|
2天前
|
人工智能 UED
VersaGen:生成式 AI 代理,基于 Stable Diffusion 生成图像,专注于控制一至多个视觉主体等生成细节
VersaGen 是一款生成式 AI 代理,专注于文本到图像合成中的视觉控制能力,支持多种视觉控制类型,并通过优化策略提升图像生成质量和用户体验。
20 8
VersaGen:生成式 AI 代理,基于 Stable Diffusion 生成图像,专注于控制一至多个视觉主体等生成细节
|
4天前
|
人工智能 开发框架 算法
Qwen-Agent:阿里通义开源 AI Agent 应用开发框架,支持构建多智能体,具备自动记忆上下文等能力
Qwen-Agent 是阿里通义开源的一个基于 Qwen 模型的 Agent 应用开发框架,支持指令遵循、工具使用、规划和记忆能力,适用于构建复杂的智能代理应用。
60 10
Qwen-Agent:阿里通义开源 AI Agent 应用开发框架,支持构建多智能体,具备自动记忆上下文等能力
|
14天前
|
存储 人工智能 安全
从AI换脸到篡改图像,合合信息如何提升视觉内容安全?
从AI换脸到篡改图像,合合信息如何提升视觉内容安全?
从AI换脸到篡改图像,合合信息如何提升视觉内容安全?
|
8天前
|
人工智能 API 数据库
Browser Use:开源 AI 浏览器助手,自动完成网页交互任务,支持多标签页管理、视觉识别和内容提取等功能
Browser Use 是一款专为大语言模型设计的智能浏览器工具,支持多标签页管理、视觉识别、内容提取等功能,并能记录和重复执行特定动作,适用于多种应用场景。
135 0
Browser Use:开源 AI 浏览器助手,自动完成网页交互任务,支持多标签页管理、视觉识别和内容提取等功能
|
11天前
|
机器学习/深度学习 人工智能 安全
合合信息亮相CSIG AI可信论坛,全面拆解视觉内容安全的“终极防线”!
合合信息在CSIG AI可信论坛上,全面拆解了视觉内容安全的“终极防线”。面对AI伪造泛滥的问题,如Deepfake换脸、PS篡改等,合合信息展示了其前沿技术,包括通用PS检测系统和AIGC与换脸检测系统,有效应对视觉内容安全挑战。公司在国际赛事中屡获殊荣,并联合多方发布《文本图像篡改检测系统技术要求》,推动行业标准化发展。通过技术创新,合合信息为金融、政企等领域提供可靠保障,守护社会信任,引领视觉内容安全新方向。
30 0
|
3月前
|
消息中间件 人工智能 Cloud Native
|
3月前
|
机器学习/深度学习 人工智能 算法
使用 NVIDIA TAO Toolkit 5.0 体验最新的视觉 AI 模型开发工作流程
NVIDIA TAO Toolkit 5.0 提供低代码框架,支持从新手到专家级别的用户快速开发视觉AI模型。新版本引入了开源架构、基于Transformer的预训练模型、AI辅助数据标注等功能,显著提升了模型开发效率和精度。TAO Toolkit 5.0 还支持多平台部署,包括GPU、CPU、MCU等,简化了模型训练和优化流程,适用于广泛的AI应用场景。
75 0
使用 NVIDIA TAO Toolkit 5.0 体验最新的视觉 AI 模型开发工作流程
|
3月前
|
人工智能 编解码 文字识别
阿里国际AI开源Ovis1.6,多项得分超GPT-4o-mini!
阿里国际AI团队提出了一种名为Ovis (Open VISion)的新型多模态大模型的架构。
|
2月前
|
机器学习/深度学习 人工智能 算法
AI赋能大学计划·大模型技术与应用实战学生训练营——吉林大学站圆满结营
10月30日,由中国软件行业校园招聘与实习公共服务平台携手魔搭社区共同举办的AI赋能大学计划·大模型技术与产业趋势高校行AIGC项目实战营·吉林大学站圆满结营。