如何进行 AI 资产管理之 ModelHub 公共模型仓库查看|学习笔记

本文涉及的产品
NLP自然语言处理_高级版,每接口累计50万次
NLP自然语言处理_基础版,每接口每天50万次
NLP 自学习平台,3个模型定制额度 1个月
简介: 快速学习如何进行 AI 资产管理之 ModelHub 公共模型仓库查看。

开发者学堂课程【PAL 平台学习路线:机器学习入门到应用:如何进行 AI 资产管理之 ModelHub 公共模型仓库查看】学习笔记,与课程紧密联系,让用户快速学习知识。

课程地址:https://developer.aliyun.com/learning/course/855/detail/14247


如何进行 AI 资产管理之 ModelHub 公共模型仓库查看

 

内容介绍:

一、视频智能处理类模型

二、图像智能处理类模型

三、语音智能处理类模型

四、自然语言处理类(NLP)模型

五、人脸模型

六、商品模型

七、多模态智能处理类模型

 

目前 ModelHub 常见类型主要包括:视频智能处理类模型、图像智能处理类模型、语音智能处理类模型、自然语言处理类(NLP)模型、人脸模型、商品模型、多模态智能处理类模型。

 

一、视频智能处理类模型

主要包括三个细分模型:通用视频分类、视频锦集生成、视频超分。首先是通用视频分类,输入一段完整的视频,给出该视频的分类的详情。其次是视频锦集生成,我们可以选取影片中的精彩集锦,随后选取时长为5秒的视频片段。之后是视频超分,通过对低分辨率的视频进行超分,从而得到高分辨率的视频。视频分类的效果。视频分类是基于UCF101数据集训练的视频分类模型,它的输入格式是输入视频的 url 输入视频的长度,得到的输出格式是征信格式的kv 对,其包含了输出的类别。

image.png

 

二、图像智能处理类模型

以通用图像分类模型为例。首先点击模型管理及优化下的 ModelHub 进行功能的体验。通用图像分类模型基于image net 数据集训练的图像分类模型,能够识别常见物体的类别,不是输入格式是 json 格式的字符串包含的image 字段对应的 vaul 是图片内容的 base64 编码,输出的数据为 json 格式字符串,包含字段包括类别 ID、名称、所有类别的概率、请求的唯一标识等一些信息。

image.png

 

三、语音智能处理类模型

在 ModelHub 中,它已经提供好训练好的语音智能处理类模型,用户可以直接部署该模型。语音智能识别asr 是人工智能、语言学及生物学等学科如何发展的重要技术,即给定人类语言的音频输入,它自动将音频转写为文本。语音智能处理类模型主要包括:通用中文语音识别模型(极速版)、通用中文语音识别模型(Transformer版)、电商直播中文语音识别模型(极速版)、电商直播中文语音识别模型(Transformer版)、中文语音向量化模型、英文语音向量化模型、中文说话人语音属性分类模型、中文语音检测模型、背景音乐检测模型。

通用中文语音识别模型(极速版)PAI 提供端到端的wiftolather 语音识别模型,能够自动识别带有中文语音的音频或视频中的文字,即能够实现通用场景下的中文语音识别。此处的输入格式是一个 json 格式的字符串,包含url 和play daration 字段。输出格式是一个 json 格式的 kv 对,其中k 表示的是输入语音数据的起始时间初,value 表示的是输入 asr 转写内容。该模型支持输出的中文字表约为4000个常见汉字。

image.png

 

四、自然语言处理类(NLP)模型

自然语言处理时是人工智能和语言学领域的分支学科,能够挖掘自然语言文本蕴含的信息和知识。常见的自然语言处理应用包括了文本分类、文本匹配、文本生成、序列标注以及特征提取。自然语言处理(NLP)类模型包括:新闻分类模型、文本内容反垃圾模型、通用情感分析模型、英文情感分析模型、电商评论情感分析模型、通用情绪检测模型、通用文本匹配模型、金融文本匹配模型、通用回答匹配模型、新闻标题生成模型、中文基础NER 模型、BERT 文本向量化模型、BERT 英文文本向量化模型。在此重点介绍一下新闻分类模型。

PAI 提供了 bert 分类模型进行新闻文本分类,能够将新闻的文本内容分类为教育、三农及娱乐的标签。该模型的输入为单距,输入格式是 json 格式的字符串,包括了 ID first sequence,即 sequence length 等字段。输出格式是json 格式的字符串,包含了输入文本的 ID 和对应标签的结果。

image.png

 

五、人脸模型

人脸模型主要包含人脸相似度比对模型、人脸属性模型、人脸增强模型以及人脸检索模型。在此重点介绍一下人脸相似度比对模型。

人脸相似度比对模型采用res net50,输入格式是json 格式字符串,包含了 emage a 字段和 emage b 字段,对应的value 就是图片内容的base64 编码。如果图像包含超过了一张人脸,则会返回错误。输出格式包含了cemilirity、request id 、uccess、everycold 以及every message。

 image.png


六、商品模型

商品模型包含了商品比对模型、商品检测模型与商品检索模型。

商品比对模型采用了 restnet50 集成先进图像度量技术,支持鞋类、包包、裙类商品的相似度比对。

 

七、多模态智能处理类模型

多模态智能处理类模型包括图片文本匹配模型、视频文本匹配模型、文到图检索。

图片文本匹配模型是基于电商场景训练的图片文本多模态匹配模型。输入数据为 JSON 格式字符串,包含图片的ur1 字段和对应的文本。输出格式也为 JSON 格式字符串,包含多模态特征及图文匹配得分。

相关文章
|
2月前
|
机器学习/深度学习 人工智能 并行计算
"震撼!CLIP模型:OpenAI的跨模态奇迹,让图像与文字共舞,解锁AI理解新纪元!"
【10月更文挑战第14天】CLIP是由OpenAI在2021年推出的一种图像和文本联合表示学习模型,通过对比学习方法预训练,能有效理解图像与文本的关系。该模型由图像编码器和文本编码器组成,分别处理图像和文本数据,通过共享向量空间实现信息融合。CLIP利用大规模图像-文本对数据集进行训练,能够实现zero-shot图像分类、文本-图像检索等多种任务,展现出强大的跨模态理解能力。
116 2
|
2月前
|
机器学习/深度学习 人工智能 自然语言处理
当语言遇见智慧火花:GPT家族历代模型大起底,带你见证从平凡到卓越的AI进化奇迹!
【10月更文挑战第6天】随着自然语言处理技术的进步,GPT系列模型(Generative Pre-trained Transformers)成为该领域的明星。从GPT-1的开创性工作,到GPT-2在规模与性能上的突破,再到拥有1750亿参数的GPT-3及其无需微调即可执行多种NLP任务的能力,以及社区驱动的GPT-NeoX,这些模型不断进化。虽然它们展现出强大的语言理解和生成能力,但也存在如生成错误信息或偏见等问题。本文将对比分析各代GPT模型的特点,并通过示例代码展示其部分功能。
122 2
|
3月前
|
人工智能 测试技术 API
AI计算机视觉笔记二十 九:yolov10竹签模型,自动数竹签
本文介绍了如何在AutoDL平台上搭建YOLOv10环境并进行竹签检测与计数。首先从官网下载YOLOv10源码并创建虚拟环境,安装依赖库。接着通过官方模型测试环境是否正常工作。然后下载自定义数据集并配置`mycoco128.yaml`文件,使用`yolo detect train`命令或Python代码进行训练。最后,通过命令行或API调用测试训练结果,并展示竹签计数功能。如需转载,请注明原文出处。
|
3天前
|
机器学习/深度学习 人工智能 语音技术
Fugatto:英伟达推出的多功能AI音频生成模型
Fugatto是由英伟达推出的多功能AI音频生成模型,能够根据文本提示生成音频或视频,并修改现有音频文件。该模型基于增强型的Transformer模型,支持复杂的组合指令,具有强大的音频生成与转换能力,广泛应用于音乐创作、声音设计、语音合成等领域。
39 1
Fugatto:英伟达推出的多功能AI音频生成模型
|
3月前
|
机器学习/深度学习 人工智能 UED
OpenAI o1模型:AI通用复杂推理的新篇章
OpenAI发布了其最新的AI模型——o1,这款模型以其独特的复杂推理能力和全新的训练方式,引起了业界的广泛关注。今天,我们就来深入剖析o1模型的特点、背后的原理,以及一些有趣的八卦信息。
340 73
|
1月前
|
人工智能
AI科学家太多,谁靠谱一试便知!普林斯顿新基准CORE-Bench:最强模型仅有21%准确率
【10月更文挑战第21天】普林斯顿大学研究人员提出了CORE-Bench,一个基于计算可重复性的AI代理基准,涵盖计算机科学、社会科学和医学领域的270个任务。该基准旨在评估AI代理在科学研究中的准确性,具有多样性、难度级别和现实相关性等特点,有助于推动AI代理的发展并提高计算可重复性。
47 4
|
2月前
|
人工智能 自然语言处理
从迷茫到精通:揭秘模型微调如何助你轻松驾驭AI新热点,解锁预训练模型的无限潜能!
【10月更文挑战第13天】本文通过简单的问题解答形式,结合示例代码,详细介绍了模型微调的全流程。从选择预训练模型、准备新任务数据集、设置微调参数,到进行微调训练和评估调优,帮助读者全面理解模型微调的技术细节和应用场景。
74 6
|
2月前
|
人工智能 自然语言处理 安全
【通义】AI视界|Adobe推出文生视频AI模型,迎战OpenAI和Meta
本文精选了过去24小时内的重要科技新闻,包括微软人工智能副总裁跳槽至OpenAI、Adobe推出文本生成视频的AI模型、Meta取消高端头显转而开发超轻量设备、谷歌与核能公司合作为数据中心供电,以及英伟达股价创下新高,市值接近3.4万亿美元。这些动态展示了科技行业的快速发展和激烈竞争。点击链接或扫描二维码获取更多资讯。
|
2月前
|
机器学习/深度学习 人工智能 TensorFlow
解锁AI潜力:让开源模型在私有环境绽放——手把手教你搭建专属智能服务,保障数据安全与性能优化的秘密攻略
【10月更文挑战第8天】本文介绍了如何将开源的机器学习模型(如TensorFlow下的MobileNet)进行私有化部署,包括环境准备、模型获取与转换、启动TensorFlow Serving服务及验证部署效果等步骤,适用于希望保护用户数据并优化服务性能的企业。
60 4
|
2月前
|
机器学习/深度学习 人工智能 自然语言处理
揭开模型微调Fine-Tuning的神秘面纱:如何在预训练基础上巧妙调整,解锁定制AI解决方案的秘密武器
【10月更文挑战第8天】模型微调是在预训练模型基础上,利用特定领域数据进一步训练,以优化模型在特定任务上的表现。此方法广泛应用于自然语言处理和计算机视觉等领域,通过调整预训练模型的部分或全部参数,结合适当的正则化手段,有效提升模型性能。例如,使用Hugging Face的Transformers库对BERT模型进行微调,以改善文本匹配任务的准确率。
60 1