AI角 | AI challenger零样本学习算法大赛报名开启,数据集开放

简介:

0cac51eefed6a3dfc6ba02818b8e758875c55492

大数据文摘作品

去年,AI Challenger(以下简称AIC)全球挑战赛吸引了来自65个国家近万团队参赛。

今年的AIC预热赛零样本学习(zero-shot learning)竞赛即日起开始。

零样本学习竞赛同样发布大规模图像属性数据集,包含78017张图片、230个类别、359种属性。

与目前主流的用于zero-shot learning的数据集相比,图片量更大、属性更丰富、类别与ImageNet重合度更低。

经典零样本学习方法介绍

创新工场AI工程院运营副总裁吴卓浩表示,因为在很多情况下人们难以获得足够的有标注的数据来训练识别或预测模型。

受人类学习能力的启发,零样本学习(zero-shot learning)希望借助辅助知识(如属性、词向量、文本描述等),在没有任何训练样本的情况下学会从未见过的新概念。

这具有重要的研究意义和广泛的应用场景,被认为是实现大规模物体识别的一个重要方式。

最经典的零样本学习方法是Lampert 提出的直接属性预测模型(DAP)。

如下图所示,模型中属性训练是在传统特征提取的基础上的进行的,首先使用颜色直方图、局部自相似直方图、SIFT和PHOG等6种方法来提取样本图像的底层特征,这几种特征包含了图像的颜色、形状和纹理等方面,所以通过这种特征提取方法得到的特征可以良好的表达图像中的信息。这几种图像特征不仅适用与线性分类器,而且在非线性分类器中也能达到良好的表现。

c6447566c2d75d01b4856cc05d49ff6cd74a9ac0

在DAP方法中,通过上述的特征提取方法得到样本的图像特征后,将特征用于属性分类器的训练,然后将训练得出的模型用于属性的预测,最后采用贝叶斯方法推算测试样本的类别。近年来深度特征的使用大幅提高了零样本识别的准确率。

最具挑战的AI识别方法

零样本学习是当前最具挑战的AI识别方法之一。简单来说就是识别从未见过的数据类别,即训练的分类器不仅仅能够识别出训练集中已有的数据类别,还可以对于来自未见过的类别的数据进行区分。

这是一个很有用的功能,使得计算机能够具有知识迁移的能力,并无需任何训练数据,很符合现实生活中海量类别的存在形式。

传统的“零样本学习”方法首先是让智能体(Agent)对类别进行语义理解。将类别标签利用辅助知识(如属性)嵌入到语义空间中,再利用训练集中的数据学习这种从图像到语义的映射关系。

此后,即使遇到新的类别,只要提供了该类别的语义知识,模型即可识别该类别,这就是零样本学习。

例如识别一张斑马的图片,但在训练时没有训练过斑马的图片。那么我们可以通过比较这张斑马图片中包含的属性和各个类别的属性定义,进而在属性空间中找到与该测试图片相近标签,即为该图片的标签。

而零样本学习的意义也显而易见:在传统图像识别任务中,训练阶段和测试阶段的类别是相同的,但每次为了识别新类别的样本需要在训练集中加入这种类别的数据。

一些类别的样本收集代价大,即使收集到足够的训练样本,也需要对整个模型进行重新训练。这都会加大识别系统的成本,零样本学习方法便能很好的解决这个问题。

将来未知语言也能翻译

早期的零样本学习研究可以追溯到2008 年,Larochelle 等人针对字符分类问题提出了零样本学习(zero shot learning)方法,并且识别准确率达到了60%。

2009年Lampert 等人提出了Animals with Attributes数据集和经典的基于属性学习的算法,才真正打开零样本学习的关注度。

北大硕士赵波表示,在一些场景下,如细粒度物体识别、任意语言之间的翻译等,难以获得足够的有标注的数据来训练识别或预测模型。

因此,零样本学习具有重要的研究意义和广泛的应用场景。受人类学习能力的启发,零样本学习希望借助辅助知识(如属性、词向量、文本描述等)学习从未见过的新概念。目前零样本学习被认为是实现大规模物体识别的一个重要方式。

应用场景

未知物体识别

例如,模型在“马”、“牛”等类别上训练过,因此模型能够准确地识别“马”、“牛”的图片。当模型遇到“象”这个新类别,由于从未见过,模型无法作出判断。

传统解决方案是收集大量“象”的图片,与原数据集一起重新训练。这种解决方案的代价高、速度慢。然而,人类能够从描述性知识中快速学习一个新概念。

例如,一个儿童即使没有见过“象”,当提供他文本描述“象是一种的大型食草类动物,有长鼻和长牙”。儿童能够根据描述快速学会“象”这一新类别,并能在第一次见到“象”时识别出来。

零样本学习与之类似,在没有任何训练样本的情况下,借助辅助知识(如属性、词向量、文本描述等)学习一些从未见过的新概念(类别)。

未知语言翻译

ccc8c411578b98c5cd3e47ac219f35341bba8b63

比如说要进行三种语言之间的翻译,按照传统的方法需要分别训练六个网络,在日语和韩语之间没有那么多样本的情况下,训练英语→特征空间→日语,韩语→特征空间→英语这两个网络,那么就可以自动学会韩语→特征空间→日语这个翻译过程。

未知类别图像合成

近年来,对抗网络GAN被用于图像合成,取得了以假乱真的效果。但传统图像合成仅能合成见过的类别的图像。零样本图像合成希望模型能够合成从未见过的类别的图像。目前已有一些算法通过条件GAN网络实现了零样本图像合成。

图像哈希

传统图像哈希算法利用一些训练样本来学习针对某些类别的哈希算法。但这些学习到的哈希算法无法用于新类别。零样本图像哈希,希望在已知类别上学到哈希算法能够运用到新的未知类别上。一些基于属性的零样本哈希算法已经被提出。

竞赛奖励

冠军:30,000人民币,颁发获奖证书

亚军:10,000人民币,颁发获奖证书

季军:3,000人民币,颁发获奖证书

双周冠军:3,000人民币

双周亚军:2,000人民币

双周季军:1,000人民币

以上提及金额为税前金额,详细规则请参考《竞赛选手报名协议》

注:数据集下载地址:https://challenger.ai/datasets

报名方式

(1) 报名时间:即日起至4月23日。竞赛报名以及组队队员变更截止时间为4月23日23:59:59。

(2) 参赛队伍可1-3人组队参赛,确保报名信息准确有效。每名选手在大赛平台只能拥有一个账号,否则会被取消参赛资格及激励。

(3) 实名认证:为保证大赛公平性,所有选手必须完成个人信息实名认证。认证过程在个人中心的实名认证区域完成。

(4) 报名方式:登入AI Challenger官网,完成个人信息注册,即可报名参赛。

(5) 参赛队员必须遵守并签署《竞赛选手报名协议》。


原文发布时间为:2018-03-23
本文作者:大数据文摘
本文来自云栖社区合作伙伴“ 大数据文摘”,了解相关信息可以关注“ 大数据文摘”微信公众号
相关实践学习
简单用户画像分析
本场景主要介绍基于海量日志数据进行简单用户画像分析为背景,如何通过使用DataWorks完成数据采集 、加工数据、配置数据质量监控和数据可视化展现等任务。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
24天前
|
机器学习/深度学习 人工智能 监控
AI算法分析,智慧城管AI智能识别系统源码
AI视频分析技术应用于智慧城管系统,通过监控摄像头实时识别违法行为,如违规摆摊、垃圾、违章停车等,实现非现场执法和预警。算法平台检测街面秩序(出店、游商、机动车、占道)和市容环境(垃圾、晾晒、垃圾桶、路面不洁、漂浮物、乱堆物料),助力及时处理问题,提升城市管理效率。
AI算法分析,智慧城管AI智能识别系统源码
|
1月前
|
机器学习/深度学习 算法 数据库
KNN和SVM实现对LFW人像图像数据集的分类应用
KNN和SVM实现对LFW人像图像数据集的分类应用
33 0
|
22天前
|
XML 机器学习/深度学习 算法
目标检测算法训练数据准备——Penn-Fudan数据集预处理实例说明(附代码)
目标检测算法训练数据准备——Penn-Fudan数据集预处理实例说明(附代码)
28 1
|
28天前
|
Rust Dart 算法
55.3k star!开源算法教程,附带动画图解,学习算法不再苦恼!
55.3k star!开源算法教程,附带动画图解,学习算法不再苦恼!
|
28天前
|
人工智能 自动驾驶 安全
破壁人AI百度:科技公司反内卷的典型样本
破壁人AI百度:科技公司反内卷的典型样本
14 0
|
28天前
|
人工智能 自动驾驶 安全
破壁人AI百度:科技公司反内卷的典型样本
简介: 互联网整个行业都在陷入被动且尴尬的局面。去年开始流行的“内卷”一词,恰如其分的描述了互联网的现状,比如抖音开始做外卖,微信强推视频号,一直硝烟弥漫的电商市场,更是激战在社区团购上。内卷背后也有人感慨,互联网到了尽头。支撑这一论述的是,移动互联网的人口红利已经消失,几款国民型APP用户增长都固定在了10亿这个级别,只能依靠自然人口的增长和迁移。
破壁人AI百度:科技公司反内卷的典型样本
|
28天前
|
人工智能 自动驾驶 安全
破壁人AI百度:科技公司反内卷的典型样本
破壁人AI百度:科技公司反内卷的典型样本
15 0
|
29天前
|
算法 C++ 计算机视觉
Opencv(C++)学习系列---Laplacian拉普拉斯边缘检测算法
Opencv(C++)学习系列---Laplacian拉普拉斯边缘检测算法
|
29天前
|
算法 C++ 计算机视觉
Opencv(C++)学习系列---Canny边缘检测算法
Opencv(C++)学习系列---Canny边缘检测算法
|
29天前
|
人工智能 自动驾驶 安全
破壁人AI百度:科技公司反内卷的典型样本
互联网整个行业都在陷入被动且尴尬的局面。去年开始流行的“内卷”一词,恰如其分的描述了互联网的现状,比如抖音开始做外卖,微信强推视频号,一直硝烟弥漫的电商市场,更是激战在社区团购上。内卷背后也有人感慨,互联网到了尽头。支撑这一论述的是,移动互联网的人口红利已经消失,几款国民型APP用户增长都固定在了10亿这个级别,只能依靠自然人口的增长和迁移。
21 0