用集群脚本功能安装大象医生优化你的大数据作业

本文涉及的产品
EMR Serverless Spark 免费试用,1000 CU*H 有效期3个月
EMR Serverless StarRocks,5000CU*H 48000GB*H
简介:

dr-elephant是linkedin开源的大数据作业诊断优化工具,可以读取作业的日志信息,给出可视化的问题诊断和优化建议。

本文介绍如何在emr集群上安装大象医生,并提供一个优化hive参数的完整示例。大象诊断的详情文档可以看官方文档,后续本博客也会发表一些使用经验。
注意:目前大象医生还不支持spark2,社区正在开发,敬请期待。

安装大象医生

集群脚本功能介绍

参照 集群脚本功能介绍

准备脚本

下载 脚本,放在您的oss合适的目录里。

运行脚本

本文用的示例集群是EMR3.4.2版本,3节点,4核16GB的默认配置。

  1. 集群列表页面点击对应集群的管理按钮
  2. 左侧菜单单击集群脚本,进入该集群的集群脚本执行界面
  3. 单击右上角创建并执行,进入创建界面。
  4. 选择刚才的脚本,设置名字,节点请只选择master节点,ha集群选择集群详情中第一个master节点,点击确认,完成添加并执行操作。
  5. 集群脚本列表可以看到新创建的集群脚本,点击刷新可以更新集群脚本的状态。
  6. 等待集群脚本完成
  7. 安装完成后,可以在master节点的/root/dr-elephant-2.0.13/logs/application.log看到Listening for HTTP on /0.0.0.0:8098说明启动成功,按照文档用端口动态转发功能打开UI,服务端口是8098。
    本示例用

ssh -i /path/id_rsa -N -L 8158:ip:8098 root@ip,
本地浏览器打开http://localhost:8158/,可以看到:
image

运行作业并优化

运行示例程序

使用交互式工作台的的hivedemo,依次运行,直到下面的语句运行结束。
image

查看运行诊断

等待几分钟,可以在大象诊断的UI上看到刚才hive作业的诊断
image
有个reducer Memory的颜色不是绿色,点击查看,可以看到是分配的reduce内存多,而实际用的少
image
点击explain,可以看到解释和优化建议
image

优化作业

根据优化建议,我们调整一下作业内容,set mapreduce.reduce.memory.mb=600;,新建一张表,
image
等待几分钟,可以看到这次诊断没有
相应提示了。
image
image

相关实践学习
基于MaxCompute的热门话题分析
Apsara Clouder大数据专项技能认证配套课程:基于MaxCompute的热门话题分析
目录
相关文章
|
2月前
|
存储 分布式计算 大数据
MaxCompute聚簇优化推荐功能发布,单日节省2PB Shuffle、7000+CU!
MaxCompute全新推出了聚簇优化推荐功能。该功能基于 31 天历史运行数据,每日自动输出全局最优 Hash Cluster Key,对于10 GB以上的大型Shuffle场景,这一功能将直接带来显著的成本优化。
140 3
|
2月前
|
数据采集 搜索推荐 Java
Java 大视界 -- Java 大数据在智能教育虚拟学习环境构建与用户体验优化中的应用(221)
本文探讨 Java 大数据在智能教育虚拟学习环境中的应用,涵盖多源数据采集、个性化推荐、实时互动优化等核心技术,结合实际案例分析其在提升学习体验与教学质量中的成效,并展望未来发展方向与技术挑战。
|
16天前
|
存储 SQL 分布式计算
MaxCompute 聚簇优化推荐原理
基于历史查询智能推荐Clustered表,显著降低计算成本,提升数仓性能。
120 4
MaxCompute 聚簇优化推荐原理
|
14天前
|
存储 并行计算 算法
【动态多目标优化算法】基于自适应启动策略的混合交叉动态约束多目标优化算法(MC-DCMOEA)求解CEC2023研究(Matlab代码实现)
【动态多目标优化算法】基于自适应启动策略的混合交叉动态约束多目标优化算法(MC-DCMOEA)求解CEC2023研究(Matlab代码实现)
|
24天前
|
大数据 数据挖掘 定位技术
买房不是拍脑袋:大数据教你优化房地产投资策略
买房不是拍脑袋:大数据教你优化房地产投资策略
79 2
|
2月前
|
存储 人工智能 算法
Java 大视界 -- Java 大数据在智能医疗影像数据压缩与传输优化中的技术应用(227)
本文探讨 Java 大数据在智能医疗影像压缩与传输中的关键技术应用,分析其如何解决医疗影像数据存储、传输与压缩三大难题,并结合实际案例展示技术落地效果。
|
2月前
|
机器学习/深度学习 算法 Java
Java 大视界 -- Java 大数据机器学习模型在生物信息学基因功能预测中的优化与应用(223)
本文探讨了Java大数据与机器学习模型在生物信息学中基因功能预测的优化与应用。通过高效的数据处理能力和智能算法,提升基因功能预测的准确性与效率,助力医学与农业发展。
|
2月前
|
机器学习/深度学习 算法 Java
Java 大视界 -- Java 大数据在智能物流运输车辆智能调度与路径优化中的技术实现(218)
本文深入探讨了Java大数据技术在智能物流运输中车辆调度与路径优化的应用。通过遗传算法实现车辆资源的智能调度,结合实时路况数据和强化学习算法进行动态路径优化,有效提升了物流效率与客户满意度。以京东物流和顺丰速运的实际案例为支撑,展示了Java大数据在解决行业痛点问题中的强大能力,为物流行业的智能化转型提供了切实可行的技术方案。
|
2月前
|
机器学习/深度学习 数据采集 搜索推荐
你以为是“说走就走”?其实是“算好才走”:大数据是怎么悄悄优化旅游体验的?
你以为是“说走就走”?其实是“算好才走”:大数据是怎么悄悄优化旅游体验的?
58 0
|
3月前
|
机器学习/深度学习 分布式计算 Java
Java 大视界 -- Java 大数据机器学习模型在遥感图像土地利用分类中的优化与应用(199)
本文探讨了Java大数据与机器学习模型在遥感图像土地利用分类中的优化与应用。面对传统方法效率低、精度差的问题,结合Hadoop、Spark与深度学习框架,实现了高效、精准的分类。通过实际案例展示了Java在数据处理、模型融合与参数调优中的强大能力,推动遥感图像分类迈向新高度。