持续定义SaaS模式云数据仓库+AI

本文涉及的产品
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介: 本文由阿里云计算平台事业部 MaxCompute 产品经理孟硕为大家带来《持续定义SaaS模式云数据仓库+AI》的相关分享。

一、Why:概述与价值
(一)人工智能的发展历史
人工智能是很早就出现的一个概念,起源于上个世纪50年代,之后由于种种原因人工智能经历了几十年的漫长的消沉的过程,直到最近几年人工智能才火热起来。人工智能的发展其实有三次黄金时期:第一次是人工智能概念提出的时候,学者们以为AI技术能改变世界,但是实际上并没有;第二次是上个世纪80年代左右,此时已经提出了神经网络等模拟人脑思考的算法,但是也并没有得到很快的发展;第三次可以认为是从2010年左右开始的,与前两次不一样的是这次我们有大数据为生产资料,以强大的算力、云计算为基础设施,包括IOT和5g技术的发展,有应用场景驱动,比如说搜索就是一个应用人工智能算法的众多场景之一,所以这次是人工智能发展真正的黄金时期。
image.png
(二)为什么需要MaxCompute+AI
Garter在数据分析领域的是大趋势预测如下:
image.png
从中可以看出,Garter认为在未来数据与分析的边界逐渐模糊,并且预测在2022年,40%的机器学习工作将在非以机器学习为主要目的的平台上(如数据仓库)完成。因此,可以说MaxCompute+AI是大势所趋。

因为数据仓库承载的是整个企业的数据资产,尤其是MaxCompute,它是一个从TB到EB级,能够弹性扩展大量存储能力的数据平台,所以数据仓库内置机器学习的优势非常明显:

1.无需移动数据(数据量大),降低基础设施成本、人工成本、减少数据安全风险;
2.数据访问速度快(让算法找数据);
3.可扩展性强;
4.纯 SQL ML / Python 更易用。

而且数据仓库内置机器学习是各角色均收益的一种集成:对于商务人士来说,新想法可以快速得到快速试验,ROI得到提升;对于数据科学家和数据分析师来说,大部分工作通过SQL/Python实现,易用高效,且模型开发和生产环境可以无缝对接;对于数据库管理员(DBA)来说,数据管理更加简单,安全性更高。

(三)MaxCompute现有的AI能力
MaxCompute的产品特性在之前的讲座中已经具体讲过了,这里不再赘述,其中MaxCompute集成AI的能力主要有:

  • 1.提供SQLML,可以直接使用标准SQL训练机器学习模型,并对数据进行预测分析;
  • 2.Mars:使用python科学计算、机器学习三方库;
  • 3.可以用用户熟悉的Spark-ML开展智能分析;
  • 4.与PAI无缝集成,提供强大的机器学习处理能力。

上述的集成AI能力中,SQLML和Mars是MaxCompute的两个原生AI扩展能力,本文我们重点介绍这两个能力。

image.png

为什么选择SQL和Python这两种语言呢?主要是因为SQL和Python是当前数据处理和机器学习领域中最火的两种语言。下面两张图是SQL查询语言的发展及现状以及Python的发展。

image.png

image.png

对于数据处理语言来讲,关系型数据库,也就是以SQL为基础的关系型数据库,包括类似的数据库目前仍然占据了数据处理引擎的前几名,有着稳健的生态;而Python已经逐渐称为数据分析领域和数据科学领域的主流语言,其有着强大的机器学习生态。因此选择这两种语言作为MaxCompute的AI集成,既是大势所趋,又能减轻使用者的学习成本和迁移成本。

二、What:能力与应用
我们将该项目的名字叫Mars,其最早是意味着Matrix和array,当然现在已经不再局限于这两者,数据维度可以达到非常高的程度;第二是意味着我们向着比登月更高的目标出发,不断的挑战自己。
那么我们为什么要做Mars呢?其主要原因有:

  • 1.为大规模科学计算设计的:传统的大数据引擎编程接口对科学计算不太友好,框架设计也不是为科学计算模型考虑的;
  • 2.传统科学计算大多基于单机,而大规模科学计算需要用到超算,并非普通人所能寄予的能力;
  • 3.传统SQL模型科学计算的处理能力不足,做一些简单的科学计算,比如矩阵转置等等,效率也是非常低;
  • 4.目前R和Python基本上基于单机,其分布式扩展能力比较弱。

目前,Mars是唯一的商业化的大规模科学计算引擎,关于Mars的更多信息大家可以到阿里云官网查找。Mars的基本思路如下图所示,主要是将Python中的主流科学计算和机器学习的库做相应的分布式化处理。

image.png

三、How:最佳实践
下面是一个简单的SQLML的Demo介绍。
首先,我们在DataWorks中新建一个工作流,会发现工作流中有很多组件,我们先建一个临时查询,如下图所示:
image.png

然后新建一张表,其中保存的是关于蘑菇的一些属性,根据这些属性数据,我们可以对其进行分类。
表建立好之后,我们可以将数据导入,因为该数据集比较小,所以我们从本地上传csv文件,将列与表中的字段对应即可:
image.png

之后,我们需要对特征进行onehot编码,其结果如下图所示:
image.png

然后,我们将数据分成训练集和测试集,并且分别将训练集和测试集导入一张单独的表中,之后就可以创建模型了,这里我们用的是逻辑回归,一个常用的二分类算法:

image.png

运行模型,很便捷地就可以得到训练结果:
image.png

通过上面的Demo,我们很容易的就完成了一次机器学习的训练过程,其过程类似与使用SQL中的UDF,简便、高效。上面Demo介绍的是SQLML,如果想使用Mars也非常简单,我们只需要拖拽PyODPS3组件即可,如下图所示。
image.png

目前,Mars已经可以试用,SQLML马上就会和大家见面,欢迎大家进行试用。

相关实践学习
基于MaxCompute的热门话题分析
Apsara Clouder大数据专项技能认证配套课程:基于MaxCompute的热门话题分析
相关文章
|
1月前
|
人工智能 JSON 前端开发
Agentic AI崛起:九大核心技术定义未来人机交互模式​
本文系统梳理AI智能体架构设计的九大核心技术,涵盖智能体基础、多智能体协作、知识增强、模型优化、工具调用、协议标准化及人机交互等关键领域,助力构建高效、智能、协同的AI应用体系。建议点赞收藏,持续关注AI架构前沿技术。
499 1
|
4月前
|
机器学习/深度学习 人工智能 自然语言处理
AI进化论:从识别模式到创造世界的“数字大脑”
AI进化论:从识别模式到创造世界的“数字大脑”
180 63
|
1月前
|
人工智能 JSON 算法
向量嵌入的天花板与AI检索的模式更迭
本文提出突破传统“单向量嵌入+ANN”检索范式,构建多结构协同的下一代AI检索框架。通过多通道嵌入、组合键兜底、知识图推理、程序化计划与生成-校验闭环,实现高可信、可解释、可验证的智能检索,应对复杂任务中的信息漏检与推理难题,推动RAG迈向结构化、可编程的认知系统。
115 12
|
1月前
|
人工智能 算法 数据挖掘
AI Agent工作流实用手册:5种常见模式的实现与应用,助力生产环境稳定性
本文介绍了五种AI Agent结构化工作流模式,帮助解决传统提示词方式在生产环境中输出不稳定、质量不可控的问题。通过串行链式处理、智能路由、并行处理、编排器-工作器架构和评估器-优化器循环,可提升任务执行效率、资源利用和输出质量,适用于复杂、高要求的AI应用。
308 0
AI Agent工作流实用手册:5种常见模式的实现与应用,助力生产环境稳定性
|
1月前
|
人工智能 安全 数据库
构建可扩展的 AI 应用:LangChain 与 MCP 服务的集成模式
本文以LangChain和文件系统服务器为例,详细介绍了MCP的配置、工具创建及调用流程,展现了其“即插即用”的模块化优势,为构建复杂AI应用提供了强大支持。
|
3月前
|
存储 人工智能 前端开发
AI数字人口播直播模式系统开发布局逻辑
AI数字人口播直播系统结合先进AI技术,实现数字人自动化直播,适用于品牌推广与内容创作。系统涵盖形象设计、技术架构、直播流程优化及合规性布局,为新媒体提供高效、智能的直播解决方案。
|
11天前
|
消息中间件 人工智能 安全
云原生进化论:加速构建 AI 应用
本文将和大家分享过去一年在支持企业构建 AI 应用过程的一些实践和思考。
176 14
|
21天前
|
人工智能 安全 中间件
阿里云 AI 中间件重磅发布,打通 AI 应用落地“最后一公里”
9 月 26 日,2025 云栖大会 AI 中间件:AI 时代的中间件技术演进与创新实践论坛上,阿里云智能集团资深技术专家林清山发表主题演讲《未来已来:下一代 AI 中间件重磅发布,解锁 AI 应用架构新范式》,重磅发布阿里云 AI 中间件,提供面向分布式多 Agent 架构的基座,包括:AgentScope-Java(兼容 Spring AI Alibaba 生态),AI MQ(基于Apache RocketMQ 的 AI 能力升级),AI 网关 Higress,AI 注册与配置中心 Nacos,以及覆盖模型与算力的 AI 可观测体系。
390 22
|
10天前
|
人工智能 算法 Java
Java与AI驱动区块链:构建智能合约与去中心化AI应用
区块链技术和人工智能的融合正在开创去中心化智能应用的新纪元。本文深入探讨如何使用Java构建AI驱动的区块链应用,涵盖智能合约开发、去中心化AI模型训练与推理、数据隐私保护以及通证经济激励等核心主题。我们将完整展示从区块链基础集成、智能合约编写、AI模型上链到去中心化应用(DApp)开发的全流程,为构建下一代可信、透明的智能去中心化系统提供完整技术方案。
107 3