阿里云视频技术专家柿蒂:视频AI in传媒九大业务场景解析

简介: 人工智能视觉计算和视频融合在一起能摩擦出怎样的火花呢?柿蒂提到,如同下图所示,人工智能视觉计算可以支持直播、短视频、新闻、体育、影视等多种业务场景,可以实现目标检测识别识、片段侦测、事件识别、鉴黄涉恐、OCR等多种应用层面的功能。

近日,BIRTV 视觉人工智能峰会在北京国际饭店隆重举办。阿里云视频技术专家柿蒂受邀参加,围绕人工智能这一主题,在视觉计算与传媒领域的应用进行深度分享。

image
阿里云视频技术专家 柿蒂

人工智能在视频领域的应用

阿里云拥有强大的云计算能力与大数据计算引擎,因此,人工智能也就拥有了飞速发展的沃土。那人工智能视觉计算和视频融合在一起,又能摩擦出怎样的火花呢?柿蒂提到,如同下图所示,人工智能视觉计算可以支持直播、短视频、新闻、体育、影视等多种业务场景,可以实现目标检测识别识、片段侦测、事件识别、鉴黄涉恐、OCR等多种应用层面的功能。

image

从技术角度来讲,基于业界领先的人工智能技术,阿里云可对视频的内容、文字、语音、人脸、物体进行多维度分析理解,帮助视频类、资讯类等客户实现视频分类和打标签、视频指纹、相似性计算、视频安全审核、视频质量计算、自动生成封面图、视频切片化等能力。从而帮助客户提升用户留存和体验,同时提高数据处理能力,降低人工审核成本。

人工智能在视频领域的应用至少包括以下四个大方面:

1、 视频内容分析: 行业领先,基于阿里领先的人工智能技术,对视频进行语音、文字、人脸、物体、场景多维度分析,输出视频泛标签,提升搜索推荐效果。
2、 视频封面选图: 通过对视频内容的理解,并结合画面美学,选出最优的关键帧或关键片段作为视频封面图。
3、 视频指纹: 提取视频中的音频、图像及时序特征,生成视频指纹,通过视频指纹的比对,实现重复视频查找、视频片段的源视频查找等业务功能。可应用于视频去重、侵权视频过滤、原创视频保护等领域。
4、 视频内容审核: 基于深度学习技术和海量数据,智能识别色情、暴恐、广告、涉政等视频或图片,极大节省人工审计成本,降低违规风险。

传媒九大业务场景深入解读

传媒,是人工智能视觉计算的典型应用领域,下面,柿蒂选取了传媒的九大热门业务场景,分享了在每一个业务场景中的视觉计算是如何应用的。

image

业务场景一:自动内容审核

采用基于深度学习的图像分类方法,利用高召回+高精度的级联结构,同时采用人脸识别、OCR、ASR等技术,对音视频中的违禁内容进行审核。
侧重:UGC视频侧重鉴黄、涉暴等;PGC及台内存量视频侧重涉政。

image

业务场景二:视频摘要-自动关键帧

通过对视频进行结构化分析,对关键帧、视频镜头进行筛选和排序,选择最优的关键帧、关键片段来作为视频的展示。并采用关键帧提取+MMR优化+美学评分等方法,选择视频,用以形成视频摘要,方便用户浏览。
效果:人工评测原始与封面关键帧算法(仅评测可对比出优劣之分的数据):算法优,占比超过70%

image

业务场景三:自动拆条

多模态:视频特征、ASR、OCR、人脸、Motion等
可以应用在:

  • 新闻消息类节目的条目拆分(可播前进行,无须文稿)
  • 体育赛事的自动场记
  • 综艺类节目的曲目裁剪及精彩段落生成
  • PGC直播的快速集锦
  • 节目内容热点发现

业务场景四:语音处理

  • 语音转文本:新闻资讯/会议/影视剧制作
  • 语音对齐:将已有的口播稿按稿件句子自动识别时码,与稿件文本对齐
  • 实时字幕:直播或存量视频中,将语音内容转成文本并做实时字幕处理
  • 语音检索:检索节目或素材的语音内容
  • 新闻热线电话/客服:智能质检、智能问答
  • 自动拆条、视频、内容审核等:与视频相结合
  • 知名主持人、明星语音合成:增加互动体验

image

业务场景五:OCR

利用视频结构化分析和图片识别等技术关键点,进行OCR识别处理。
可以应用在:

  • 视频文本摘要的参考:新闻类视频
  • 台词提取及时码对齐:电影电视剧(可结合语音处理)
  • 演职员表

业务场景六:视频去重/检测/关联

利用视频指纹技术,判断两个视频是否是通过任意变换获取的同源视频,以及同源相似度。可以应用在:

  • UGC、PGC视频的去重
  • 广告检测
  • 短视频搜索
  • 基于视频内容的关联

image

业务场景七:视频分类、视频标签

视频分类是通过内容理解的方法对视频进行类目和标签预测;视频标签则是通过对视频中多模态信息进行分析,自动为视频进行标签标注,并利用图像分类技术、视频tagging技术、OCR、ASR、人脸识别、目标检测、行为识别等多模态技术分析,对视频进行自动标签化。

image

业务场景八:目标检测

  • 直播互动:主播手势交互、取代人工,由机器自动生成事件发生的时间点及事件类别
  • 物体动态锚点跟踪:支持用户对视频内容中的物体进行标记并跟踪。
  • 边看边买:在视频中匹配和搜索同款/相似/相关商品,为视频电商的边看边买提供自动选品技术,同时利用用户在淘宝、天猫的用户行为进行边看边买商品的个性化推荐。

image

业务场景九:体育分析

  • 视频打标:取代人工,由机器自动生成事件发生的时间点及事件类别
  • 集锦生成:根据打标信息自动生成比赛场景、球员集锦
  • 比赛转播:自动完成镜头切换、远近景切换,球员特写
  • 球员数据信息获取:跟踪球员轨迹、获取球员在全场比赛中的位置,跑动数据

在分享的最后,柿蒂将所有阿里云AI+视频的能力做了整体展示,他也表示,在未来,阿里云持续探究AI+视频技术,并且将更多优秀的能力开放给行业。

image

目录
相关文章
|
3天前
|
JSON 分布式计算 数据处理
加速数据处理与AI开发的利器:阿里云MaxFrame实验评测
随着数据量的爆炸式增长,传统数据分析方法逐渐显现出局限性。Python作为数据科学领域的主流语言,因其简洁易用和丰富的库支持备受青睐。阿里云推出的MaxFrame是一个专为Python开发者设计的分布式计算框架,旨在充分利用MaxCompute的强大能力,提供高效、灵活且易于使用的工具,应对大规模数据处理需求。MaxFrame不仅继承了Pandas等流行数据处理库的友好接口,还通过集成先进的分布式计算技术,显著提升了数据处理的速度和效率。
|
8天前
|
机器学习/深度学习 人工智能 自然语言处理
AI技术深度解析:从基础到应用的全面介绍
人工智能(AI)技术的迅猛发展,正在深刻改变着我们的生活和工作方式。从自然语言处理(NLP)到机器学习,从神经网络到大型语言模型(LLM),AI技术的每一次进步都带来了前所未有的机遇和挑战。本文将从背景、历史、业务场景、Python代码示例、流程图以及如何上手等多个方面,对AI技术中的关键组件进行深度解析,为读者呈现一个全面而深入的AI技术世界。
61 10
|
15天前
|
人工智能 Java Serverless
阿里云函数计算助力AI大模型快速部署
随着人工智能技术的快速发展,AI大模型已经成为企业数字化转型的重要工具。然而,对于许多业务人员、开发者以及企业来说,探索和利用AI大模型仍然面临诸多挑战。业务人员可能缺乏编程技能,难以快速上手AI模型;开发者可能受限于GPU资源,无法高效构建和部署AI应用;企业则希望简化技术门槛,以更低的成本和更高的效率利用AI大模型。
73 12
|
5天前
|
机器学习/深度学习 人工智能 运维
阿里云技术公开课直播预告:基于阿里云 Elasticsearch 构建 AI 搜索和可观测 Chatbot
阿里云技术公开课预告:Elastic和阿里云搜索技术专家将深入解读阿里云Elasticsearch Enterprise版的AI功能及其在实际应用。
阿里云技术公开课直播预告:基于阿里云 Elasticsearch 构建 AI 搜索和可观测 Chatbot
|
4天前
|
人工智能 大数据 测试技术
自主和开放并举 探索下一代阿里云AI基础设施固件创新
12月13日,固件产业技术创新联盟产业峰会在杭州举行,阿里云主导的开源固件测试平台发布和PCIe Switch固件技术亮相,成为会议焦点。
|
10天前
|
人工智能 自然语言处理 前端开发
OpenAI 12天发布会全解析 | AI大咖说
OpenAI近日宣布将在12个工作日内每天进行一场直播,展示一系列新产品和样品。首日推出GPT-o1正式版,性能大幅提升;次日展示Reinforcement Fine-Tuning技术,提高模型决策质量;第三天推出Sora,实现高质量视频生成;第四天加强Canvas,提升多模态创作效率;第五天发布ChatGPT扩展功能,增强灵活性;第六天推出ChatGPT Vision,实现多模态互动;第七天推出ChatGPT Projects,优化项目管理。这些新技术正改变我们的生活和工作方式。
714 9
|
13天前
|
人工智能 Cloud Native 调度
阿里云容器服务在AI智算场景的创新与实践
本文源自张凯在2024云栖大会的演讲,介绍了阿里云容器服务在AI智算领域的创新与实践。从2018年推出首个开源GPU容器共享调度方案至今,阿里云容器服务不断推进云原生AI的发展,包括增强GPU可观测性、实现多集群跨地域统一调度、优化大模型推理引擎部署、提供灵活的弹性伸缩策略等,旨在为客户提供高效、低成本的云原生AI解决方案。
|
15天前
|
机器学习/深度学习 人工智能 自然语言处理
秒级响应 + 99.9%准确率:法律行业文本比对技术解析
本工具基于先进AI技术,采用自然语言处理和语义匹配算法,支持PDF、Word等格式,实现法律文本的智能化比对。具备高精度语义匹配、多格式兼容、高性能架构及智能化标注与可视化等特点,有效解决文本复杂性和法规更新难题,提升法律行业工作效率。
|
12天前
|
数据采集 存储 JavaScript
网页爬虫技术全解析:从基础到实战
在信息爆炸的时代,网页爬虫作为数据采集的重要工具,已成为数据科学家、研究人员和开发者不可或缺的技术。本文全面解析网页爬虫的基础概念、工作原理、技术栈与工具,以及实战案例,探讨其合法性与道德问题,分享爬虫设计与实现的详细步骤,介绍优化与维护的方法,应对反爬虫机制、动态内容加载等挑战,旨在帮助读者深入理解并合理运用网页爬虫技术。
|
1月前
|
监控 Java 应用服务中间件
高级java面试---spring.factories文件的解析源码API机制
【11月更文挑战第20天】Spring Boot是一个用于快速构建基于Spring框架的应用程序的开源框架。它通过自动配置、起步依赖和内嵌服务器等特性,极大地简化了Spring应用的开发和部署过程。本文将深入探讨Spring Boot的背景历史、业务场景、功能点以及底层原理,并通过Java代码手写模拟Spring Boot的启动过程,特别是spring.factories文件的解析源码API机制。
76 2

推荐镜像

更多