DataWorks

简介: DataWorks

DataWorks介绍

DataWorks(数据工厂,原大数据库开发套件)是阿里云数加重要的PaaS平台产品,它提供全面托管的工作流服务,一站式开发管理界面,帮助企业专注于数据价值的挖掘和探索。
它是一套基于MaxCompute(原ODPS)的DW解决方案,他集成了阿里多年的DW实施经验,提供数据集成、处理、分析和管理功能,并为代码开发、调试、发布、运维、监控和管理提供了一个高效、安全的离线数据开发环境。

全面托管的调度

强大的调度能力,千万级别的任务调度;
支持按照时间、依赖关系的任务触发机制;
支持每日任务按照DAG关系准确、准时运行;
支持分钟、小时、天、周和月多种调度周期配置;
完全托管的服务,无需关心调度服务器资源问题;
租户之间提供隔离,保证不同租户之间的任务不会互相影响。

支持多种任务类型

支持数据同步、SHELL、MaxCompute SQL、MaxCompute MR等多种任务类型,通过任务之间的相互依赖完成复杂的数据分析处理。

可视化开发

提供可视化的代码开发、工作流设计器页面,无需搭配任何开发工具,简单的拖拽和开发就可以完成复杂的数据分析任务。
只要有浏览器、有网络,便可随时随地进行开发工作。

监控告警

运维中心提供可视化的任务监控管理工具,支持以DAG图的形式展示任务运行时的全局情况;
可方便地配置短信、邮件报警,任务发生错误可及时通知相关人员,保证业务正常运行。

DataWorks产品特点

基于MaxCompute:一套基于Max Compute(原ODPS)的数据开发、数据管理工具。
清晰可见的血缘:基于统一的元数据服务提供数据资源管理视图、可视化的数据血缘分析、清晰展现数据表的输入与输出,方便追溯其处理过程。
一站式数据开发:提供数据同步、数据加工、一键发布、调度引擎等一站式大数据开发服务。
可视化开发界面:面向数据开发者、数据运维人员,项目管理者提供了可视化的开发界面。

产品优势

1、专业
解决数据同步、开发与运维问题。全面提升大数据加工的效率,降低成本。
2、易用
屏蔽云端复杂性,轻松完成云端数据同步。灵活撰写数据处理代码,极简任务管理。
3、大数据处理能力
与MaxCompute(原ODPS)完美融合,释放其处理能力。实现数据价值的深度挖掘与业务的数据化运营。

DataWorks基本概念

组织与项目空间

组织

组织是大数据平台特有概念,一个公司开通大数据平台服务就创建一个组织,一个组织内创建多个项目空间。组织之间互相隔离,一个账号只能所属一个组织。元数据按组织隔离,只能查看本组织下的表元数据。

项目空间(project)

项目空间时数据开发中最基本的组织对象,类似于传统数据库的database。数据开发的项目空间,是进行多组织隔离和访问控制的主要边界,也是用户管理表(table)、资源(resource)、自定义函数(UDF)、作业(job)、节点(node)、工作流(workflow)、权限等的基本单元。

任务(task)

任务是指定义对数据执行的操作。每个任务使用0或0个以上的数据表(数据集)作为输入,生成一个或多个数据表(数据集)作为输出。
如:
使用数据同步节点任务,将数据从RDS复制到MaxCompute。
使用MaxCompute SQL节点任务运行MaxCompute SQL来进行数据的转换。
使用工作流任务,通过内部几个不同的SQL内部节点完成一系列的数据转换。

工作流(WorkFlow)

工作流是一个DAG图(有向无环图),其描述了作业中多个节点之间的逻辑(依赖关系)和规则(运行越是)。

节点(Node)

节点属于工作流的字对象,也称为任务,是数据开发数据处理和分析过程的最基本单元,每个任务对应DAG图中的一个节点,其可以是一个SQL Query、命令和MapReduce程序。

依赖关系(Dependency)

依赖关系是描述两个或多个节点/工作流之间的语义连接关系,其中上游节点/工作流的运行状态可以影响下游节点/工作流的运行状态,反正则不成立。

实例(Instance)

在调度系统中的任务经过调度系统、手动触发运行后会生成一个实例,实例代表了某个任务在某时某刻执行的一个快照,实例中会有任务的运行时间、运行状态、运行日志等信息。

资源(Resource)

资源是数据开发的特有概念,用户可以上传本地自定义的JAR或文件作为资源,在节点运行时调用,如,在数据开发中运行MapReduce程序,需要将MapReduce生成的JAR包上传到平台后,通过节点调用所上传的资源来运行此MapReduce程序。

函数(Function)

MaxCompute提供了Java的编程接口来开发用户自定义函数。在大数据平台数据开发套件中指出Java UDF。
说明:资源与函数都是MaxCompute的概念,在DataWorks中,可以通过界面管理资源、函数。如果通过MaxCompute的其他方式进行资源、函数管理,则无法在DataWorks中进行相关的查询。

DataWorks功能框架

DataWorks是底层基于MaxCompute(原ODPS)的集成开发环境,包括数据开发、数据管理、数据分析、数据挖掘和管理控制台。其中数据分析和数据挖掘属于阿里云大数据开发平台高级组件。

大数据开发平台功能模块

组织管理

管理dataworks的项目空间。
管理dataworks的调度资源。
管理组织成员、权限、角色等

项目管理

配置项目属性,包括基本属性、数据源、计算引擎以及流程控制。
管理项目成员

数据开发

开发任务、脚本、配置调度
管理资源、函数等。

数据管理

找数据、权限管理
数据表管理

运维中心

任务管理,包括查看、编辑、运行
任务的运维和监控,包括运行日志、调度和恢复以及监控报警

DataWorks角色隔离

组织管理员

指组织的管理者,可新建计算引擎、新建项目空间、新建调度资源、添加组织成员、为组织成员赋予项目管理员角色、配置数据类目等。即阿里云云账号的角色,此角色不能赋予其他账号。

项目管理员

指项目空间的管理者,可对该项目空间的基本属性、数据源、当前项目空间计算引擎配置和项目成员等进行管理,并为项目成员赋予项目管理员、开发、运维、部署、访客角色。对应maxcompute的数据权限为project/table/fuction/resource/instance/job/volume/offlinemodel/package的所有权限,对应maxcompute的role_project_admin角色

开发

开发角色的用户能够创建工作流、脚本文件、资源和UDF,新建/删除表,同时可以创建发布包,但不能执行发布操作。maxcompute的数据权限为project/fuction/resource/instance/job/volume/offlinemodel/package/table的所有权限,对应maxcompute的role_project_dev角色

运维

运维角色的用户由项目管理员分配运维权限;拥有发布及线上运维的操作权限,没有数据开发的操作权限。maxcompute的数据权限为project/fuction/resource/instance/job/offlinemodel的所有权限,拥有volume/package的read权限和table的read/describe权限。maxcompute角色为role_project_pe.

部署

部署角色与运维角色相似,但是它没有线上运维的操作权限。默认无maxcompute的数据权限,对应maxcompute的role_project_deploy角色

访客

访客角色的用户只具备查看权限,没有权限进行编辑工作流和代码等操作。默认无maxcompute数据权限,maxcompute的角色为role_project_guest.

安全员

安全管理员仅在数据保护伞中用到,用于敏感规则配置,数据风险审计等。默认无maxcompute数据权限,maxcompute的角色role_project_security.

相关实践学习
基于Hologres轻量实时的高性能OLAP分析
本教程基于GitHub Archive公开数据集,通过DataWorks将GitHub中的项⽬、行为等20多种事件类型数据实时采集至Hologres进行分析,同时使用DataV内置模板,快速搭建实时可视化数据大屏,从开发者、项⽬、编程语⾔等多个维度了解GitHub实时数据变化情况。
目录
相关文章
|
7月前
|
存储 人工智能 缓存
阿里云服务器计算型、通用型、内存型主要实例规格技术架构、性能亮点、适用场景解析与选型指南
阿里云服务器ECS的计算型、通用型、内存型实例,独享云服务器资源,在高负载下可避免资源争夺。计算型实例采用高性能处理器架构,适用于AI训练、科学计算等场景,有c9a、c9i等实例类型。通用型实例适合Web应用、数据分析等场景,内存型实例则专为内存密集型应用设计,如大型数据库、实时数据分析。选型时,需考虑应用场景、成本预算,可用阿里云性能测试PTS工具验证,确保实例持续支撑业务增长。
|
8月前
|
存储 分布式计算 DataWorks
云原生数据湖:基于DataWorks+MaxCompute构建企业级数据分析平台
在数据驱动时代,企业面临规模、类型与敏捷性的三重挑战。传统数仓难以为继,云原生数据湖成为破局关键。依托阿里云DataWorks与MaxCompute,构建集数据集成、计算、治理、服务于一体的一站式平台,实现从原始数据到智能决策的高效转化。存储与计算分离、统一元数据管理、全链路治理与API化服务,助力企业降本增效,释放数据资产价值,打造面向未来的数据基石。(238字)
|
7月前
|
云安全 安全 Cloud Native
阿里云智能云原生应用保护平台CNAPP(原安全中心)详解:费用价格、功能优势及问题解答FAQ
阿里云全新升级智能云原生应用保护平台(CNAPP),融合CWPP、CSPM、CIEM、CTDR四大能力,提供覆盖“事前-事中-事后”的全链路安全防护。支持多云纳管、自动威胁响应与合规检查,助力企业实现安全左移、风险可视、响应自动化。
|
5月前
|
人工智能 Linux API
零成本无限用免费大模型保姆级教程!OpenClaw极速部署(阿里云/Win11/Mac/Linux)+FreeRide Skill+FAQ
2026年,AI工具的普及让更多人感受到智能协作的便利,但“Token焦虑”始终困扰着用户——MiniMax M2.5、Kimi K2.5、智谱GLM-5等强模型API费用高昂,简单的日常对话就能快速耗尽包月额度;OpenRouter免费模型池虽香,却存在随机抽盲盒、高峰期限速卡顿等问题,严重影响使用体验。尤其是OpenClaw(昵称“小龙虾”)用户,作为开源AI代理框架的深度使用者,频繁切换模型、等待限速解除的操作,大幅降低了自动化协作效率。
6212 5
|
7月前
|
弹性计算 人工智能 小程序
阿里云服务器多少钱一年?2026年最新曝光,包括轻量、ECS和GPU云服务器价格清单
阿里云2026年服务器价格揭晓:轻量应用服务器低至¥38/年,ECS云服务器新购续费同价,GPU服务器支持大模型训练。涵盖个人建站、企业应用与AI计算,三类机型全解析,助你选型不花冤枉钱。
811 3
|
人工智能 PyTorch 区块链
当AI遇上区块链,会不会搞出一个“去中心化大脑”?
当AI遇上区块链,会不会搞出一个“去中心化大脑”?
393 9
|
存储 安全 数据库
阿里云服务器计算型、通用型、内存型主要实例规格特点、适用场景及最新价格参考
在阿里云服务器的实例规格中,有共享型也有企业型,一般用户选择较多的企业级实例规格有计算型、通用型、内存型,每一种实例规格又有多个实例规格族可选,不同的云服务器实例规格在架构、计算、存储、网络、安全等方面有着不同,因此,其适用场景也有所不同。本文来详细介绍一下阿里云服务器计算型、通用型、内存型主要实例计算、存储等性能及其适用场景,以供参考。
阿里云服务器计算型、通用型、内存型主要实例规格特点、适用场景及最新价格参考
|
Prometheus 监控 数据可视化
Grafana 插件生态系统:扩展你的监控能力
【8月更文第29天】Grafana 是一个流行的开源平台,用于创建和共享统计数据的仪表板和可视化。除了内置的支持,Grafana 还有一个强大的插件生态系统,允许用户通过安装插件来扩展其功能。本文将介绍一些 Grafana 社区提供的插件,并探讨它们如何增强仪表盘的功能性。
1478 3
|
物联网 程序员 语音技术
STM32智能小车(循迹、跟随、避障、测速、蓝牙、wife、4g、语音识别)总结-3
STM32智能小车(循迹、跟随、避障、测速、蓝牙、wife、4g、语音识别)总结
STM32智能小车(循迹、跟随、避障、测速、蓝牙、wife、4g、语音识别)总结-3
|
Linux Android开发 Windows
ADB和Fastboot最新版的谷歌官方下载链接
ADB和Fastboot for Windows https://dl.google.com/android/repository/platform-tools-latest-windows.zip ADB和Fastboot for Mac https://dl.
9715 0

热门文章

最新文章