开发者社区 > 大数据与机器学习 > 大数据开发治理DataWorks > 正文

DataWorks数据加工配置EMR Hive节点是什么?

DataWorks数据加工配置EMR Hive节点是什么?

展开
收起
cuicuicuic 2023-09-10 14:06:58 33 0
1 条回答
写回答
取消 提交回答
  • 配置ods_log_info_d节点。双击ods_log_info_d节点,进入节点配置页面。在节点编辑页面,编写如下语句。说明 如果您的工作空间绑定多个EMR引擎,需要选择EMR引擎。如果仅绑定一个EMR引擎,则无需选择。--创建ODS层表CREATE TABLE IF NOT EXISTS ods_log_info_d (ip STRING COMMENT 'ip地址',uid STRING COMMENT '用户ID',time STRING COMMENT '时间yyyymmddhh:mi:ss',status STRING COMMENT '服务器返回状态码',bytes STRING COMMENT '返回给客户端的字节数',region STRING COMMENT '地域,根据ip得到',method STRING COMMENT 'http请求类型',url STRING COMMENT 'url',protocol STRING COMMENT 'http协议版本号',referer STRING COMMENT '来源url',device STRING COMMENT '终端类型 ',identity STRING COMMENT '访问类型 crawler feed user unknown')PARTITIONED BY (dt STRING);create function getregion as 'org.alidata.emr.udf.Ip2Region'using jar 'oss://dw-emr-demo/ip2region/ip2region-emr.jar';ALTER TABLE ods_log_info_d ADD IF NOT EXISTS PARTITION (dt=unknown);set hive.vectorized.execution.enabled = false;INSERT OVERWRITE TABLE ods_log_info_d PARTITION (dt=unknown)SELECT ip, uid, tm, status, bytes, getregion(ip) AS region --使用自定义UDF通过ip得到地域。, regexp_extract(request,
    https://help.aliyun.com/document_detail/146698.html,此回答整理自钉群“DataWorks交流群(答疑@机器人)”

    2023-09-10 19:48:10
    赞同 展开评论 打赏

DataWorks基于MaxCompute/Hologres/EMR/CDP等大数据引擎,为数据仓库/数据湖/湖仓一体等解决方案提供统一的全链路大数据开发治理平台。

相关产品

  • 大数据开发治理平台 DataWorks
  • 相关电子书

    更多
    DataWorks数据集成实时同步最佳实践(含内测邀请)-2020飞天大数据平台实战应用第一季 立即下载
    DataWorks调度任务迁移最佳实践-2020飞天大数据平台实战应用第一季 立即下载
    DataWorks商业化资源组省钱秘籍-2020飞天大数据平台实战应用第一季 立即下载

    相关实验场景

    更多