如何基于大数据及AI平台实现业务系统实时化?

本文涉及的产品
实时计算 Flink 版,5000CU*H 3个月
简介: 后疫情时代的新社会模式及经济形态必将催生出新的商业模式,在线业务及相关应用场景的流量呈现井喷式发展,常规的离线系统及离线机器学习平台已无法满足业务发展要求。

作者:高旸(吾与),阿里巴巴高级技术专家

1. 前言

随着互联网“人口红利”的“消耗殆尽”,基于“T+1”或者离线计算的机器学习平台及推荐系统转化率与效果日趋“平淡”。后疫情时代的新社会模式及经济形态必将催生出新的商业模式,在线业务及相关应用场景的流量呈现井喷式发展,常规的离线系统及离线机器学习平台已无法满足业务发展要求。人口红利吃尽之后,基于大数据及AI平台的业务系统在时间维度上的思考将变得至关重要,通过业务系统实时化向时间要价值已经成为主流趋势。基于流式计算引擎的在线机器学习平台将越来越被重视, 通过增量模型的准实时或实时推荐系统更能“因时而异” 充分捕捉目标用户瞬息万变的需求,从而进行精准推荐和变现。实时推荐系统也从最早的电商场景, 扩展到社交场景, 在线教育场景, 游戏场景及更广阔的在线场景。

本文介绍重点介绍基于阿里云大数据及AI产品家族的实时计算Flink及PAI Alink机器学习算法平台,以及该产品组合在实时推荐场景(适用于电商、游戏及在线教育解决方案)、实时评分卡场景(适用于金融、安全及营销风控解决方案)以及异常检测场景(适用于工业领域及其他产业互联网领域)的场景应用。

2. 实时计算引擎及机器学习算法平台介绍

2.1 阿里云实时计算Flink

阿里云实时计算Flink作为Apache Flink创始团队的商业化产品,从极致(较传统微批模式)的实时数据处理维度,为企业大数据处理及业务实时化提供了可能。商业化的统一开发及管控平台,成熟、准标准化的SQL及元数据管理能力,让业务人员及数据分析师大幅度提升开发效率, SQL配合UDF基本可以解决80%+的业务场景。企业级的State Backend – Gemini大幅度提升IO效率,整体执行引擎较开源3倍以上的性能提升。

VVP.png

基于阿里云Kubernetes的全新Serverless全托管云上实时计算Flink服务,使用全新的硬多租技术方案,基于VPC提供网络层隔离,阿里云安全容器提供计算层隔离,基于弹性云盘提供存储级隔离,通过用户级Master及超级Master实现极致资源弹性下的多租户隔离。基于负载的细粒度弹性伸缩, 充分提高资源使用率, 降低整体TCO。新一代的Serverless实时计算Flink产品为在线机器学习算法平台提供了坚实(“时“)的基础。

2.png

2.2 阿里云PAI Alink机器学习算法平台

3.png

与SparkML算法相比,Alink算法更全面,性能更优异,场景更丰富(同时支持流批),本地化更出色(支持中文分词)是快速搭建在线机器学习系统的不二之选。

4.png

3. 基于实时计算Flink-机器学习场景介绍:

3.1实时推荐场景:

从根据用户点击和浏览的内容实时推送的电商场景,到社交媒体根据用户阅读的内容实时“喂送“的实时推荐系统,再到游戏推送平台根据用户行为实时推送的游戏系统,实时推荐系统俨然已经成为了在线业务系统的核心。

5.png

阿里云PAI Alink算法平台提供: 召回(例如:ALS、FM、Deep Walk等),特征编码(OneHot、MultiHot及GBDT等) ,排序(LR及FFM等)以及Online算法(OnlineFM及Ftrl)流式和批式的算法能力全流程构建能力。配合阿里云实时计算Flink海量样本实时拼接能力,能够快速端到端实现离在线一体化的推荐系统。

6.png

通过特征工程批式训练初始化模型,通过实时样本拼接配合流式算法(OnlineFM及Ftrl) 生成增量的模型,最终提供统一模型的整体结果预测,更实时更动态的提升推荐效果。

7.png

3.2 评分卡场景介绍:

阿里云实时计算Flink及PAI Alink产品组合可以帮助客户快速搭建实时金融风控解决方案。评分卡在金融场景有广泛的应用,能否构建准确的评分卡模型关系到能否安全的开展支付、贷款、保险、理财、信用等业务,评分卡常被用于信用评估领域,比如信用卡风险评估,贷款发放;评分卡也会用来作为分数评估,比如客户质量打分,信用分。涉及金融的场景都需要:可追溯、可审计及可解释,如下的评分卡模型就具备很好的可解释性。例如:用户年龄27岁,性别男,婚姻状况已婚,学历本科,月收入10000。根据如下评分卡,该用户的评分为:评分 = 223(基准分) + 8(年龄) + 4(性别评分)+ 8(婚姻状况)+ 8(学历评分)+ 13(月收入评分)= 264分。

8.png

阿里云实时计算Flink及PAI Alink产品组合提供最先进的评分卡解决方案, 分箱将每个特征按照需求进行分箱训练;评分卡训练生成评分模型;样本稳定性通过PSI等指标衡量样本稳定性;模型评估,评估二分类模型效果。该解决方案支持多特征维度模型训练,支持大规模样本建模。

9.png

3.3 异常检测场景

异常检测及时序分析是一个较为常见并且应用广泛的场景,在工业界的应用尤甚。利用阿里云实时计算Flink及PAI Alink产品组合可以帮助客户快速搭建异常检测解决方案。实时计算Flink强大的性能与Alink丰富的算法库机相结合,可以帮助数据分析和应用开发人员实现数据处理、特征工程、模型训练、预测等多个环节端到端的处理。在异常检测场景下,Alink支持时间序列异常检测、异常集检测两个核心场景。

在时间序列异常检测中,Alink具备种类齐全、批流一体、性能优异、并行计算、使用方便等优势。针对不同的使用场景,分为基于时序预测和时序分解两种类型:

  • 时序预测算法适合流式数据,即时响应
  • 时序分解算法适合全量数据,能够从全量数据中挖掘有效信息。

Alink也提供了时序预测和时序分解算法,用户可以单独使用。

10.png

异常集检测是风控场景的核心诉求之一。Alink 异常集检测中具备如下优势:

  • 巨型图支持 - 支持上亿边的图数据
  • 在线更新 - 随时加上异常种子均可局部异常检测
  • 快速运算 - 只对局部图进行运算,节约计算资源

在盗用、欺诈、作弊、商户、借贷套现等各风险域都有异常集检测的需求存在。基于GraphRAD,Alink实现了半监督的异常集检测,RiskCommunityDetector。算法输入连接关系以及已知的黑点,即可对全图进行分析,捕获其它黑用户,降低业务运行过程中的风险,为业务安全保驾护航,避免可能发生的重大损失。

11.png

4. 后记

通过上文的介绍,想必大家已经对阿里云实时计算Flink及PAI产品组合跃跃欲试了,可以快速开通全托管实时计算Flink 体验最新的Serverless产品服务。实时计算Flink触达直通车:https://www.aliyun.com/product/bigdata/sc

12.png

通过开通阿里云E-MapReduce Dataflow集群,快速搭建基于阿里云实时计算Flink的PAI Alink算法平台。PAI Alink触达直通车:https://www.aliyun.com/product/emapreduce

13.png

实时计算 Flink 版产品交流群

实时计算交流群.jpg

阿里云实时计算Flink - 解决方案:
https://developer.aliyun.com/article/765097
阿里云实时计算Flink - 场景案例:
https://ververica.cn/corporate-practice
阿里云实时计算Flink - 产品详情页:
https://www.aliyun.com/product/bigdata/product/sc

相关实践学习
简单用户画像分析
本场景主要介绍基于海量日志数据进行简单用户画像分析为背景,如何通过使用DataWorks完成数据采集 、加工数据、配置数据质量监控和数据可视化展现等任务。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
3小时前
|
存储 移动开发 Linux
Linux系统之部署h5ai目录列表程序
【5月更文挑战第3天】Linux系统之部署h5ai目录列表程序
23 1
|
3小时前
|
人工智能 分布式计算 Cloud Native
大数据&AI产品月刊【2024年4月】
大数据&AI产品技术月刊【2024年4月】,涵盖本月技术速递、产品和功能发布、市场和客户应用实践等内容,帮助您快速了解阿里云大数据&AI方面最新动态。
|
3小时前
|
分布式计算 Hadoop Java
大数据实战平台环境搭建(下)
大数据实战平台环境搭建(下)
8 0
|
3小时前
|
分布式计算 Hadoop Java
大数据实战平台环境搭建(上)
大数据实战平台环境搭建(上)
11 1
|
3小时前
|
存储 机器学习/深度学习 人工智能
新一代数据库技术:融合AI的智能数据管理系统
传统数据库管理系统在数据存储和查询方面已经取得了巨大的成就,但随着数据量的不断增长和应用场景的多样化,传统数据库已经难以满足日益增长的需求。本文将介绍一种新一代数据库技术,即融合了人工智能技术的智能数据管理系统。通过结合AI的强大能力,这种系统能够实现更高效的数据管理、更智能的数据分析和更精准的数据预测,为用户带来全新的数据管理体验。
|
3小时前
|
机器学习/深度学习 人工智能 算法
构建高效AI系统:深度学习优化技术解析
【5月更文挑战第12天】 随着人工智能技术的飞速发展,深度学习已成为推动创新的核心动力。本文将深入探讨在构建高效AI系统中,如何通过优化算法、调整网络结构及使用新型硬件资源等手段显著提升模型性能。我们将剖析先进的优化策略,如自适应学习率调整、梯度累积技巧以及正则化方法,并讨论其对模型训练稳定性和效率的影响。文中不仅提供理论分析,还结合实例说明如何在实际项目中应用这些优化技术。
|
3小时前
|
机器学习/深度学习 人工智能 自然语言处理
构建未来:AI在持续学习系统中的创新应用
【5月更文挑战第11天】 随着人工智能(AI)技术的飞速发展,其在教育领域的应用日益增多。特别是在持续学习系统(Lifelong Learning Systems, LLS)中,AI技术正开启着个性化和适应性教学的新篇章。本文聚焦于AI在LLS中的创新应用,探讨了机器学习、自然语言处理和认知建模等关键技术如何共同作用于构建智能化的学习环境。文章旨在分析当前AI技术在持续学习领域的最新进展,并展望其对未来教育模式的影响。
|
3小时前
|
机器学习/深度学习 人工智能 算法
构建未来:AI驱动的自适应网络安全防御系统
【5月更文挑战第11天】在数字时代的风口浪尖,网络安全问题日益凸显。传统的安全防御手段在应对不断进化的网络威胁时显得力不从心。本文提出了一个基于人工智能技术的自适应网络安全防御系统框架,旨在通过实时分析、学习和预测网络行为,自动调整防御策略以抵御未知攻击。系统采用先进的机器学习算法和大数据分析技术,能够在保持高效性能的同时,最小化误报率。文章详细阐述了系统的设计理念、关键技术组件以及预期效果,为网络安全的未来发展方向提供新思路。
|
3小时前
|
机器学习/深度学习 人工智能 自动驾驶
构建未来:AI在持续学习系统中的创新应用
【5月更文挑战第11天】 在人工智能的迅猛发展浪潮中,一个不断进化的分支便是AI在持续学习系统中的应用。本文旨在探讨AI技术如何革新持续学习系统,并分析其在不同领域的创新实践。文章首先界定了持续学习系统的概念,随后深入解析了深度学习、强化学习以及转移学习等关键技术在其中的作用。通过案例分析,展示了这些技术如何在医疗诊断、自动驾驶及个性化教育中发挥至关重要的角色。最终,讨论了面临的挑战与未来的发展趋势,为读者提供了一个关于AI在持续学习领域未来可能展开的蓝图。
6 1
|
3小时前
|
机器学习/深度学习 人工智能 大数据
AI时代Python金融大数据分析实战:ChatGPT让金融大数据分析插上翅膀
AI时代Python金融大数据分析实战:ChatGPT让金融大数据分析插上翅膀