关于GPfdist数据入库性能问题-问答-阿里云开发者社区-阿里云

开发者社区> 问答> 正文
阿里云
为了无法计算的价值
打开APP
阿里云APP内打开

关于GPfdist数据入库性能问题

2016-01-24 17:56:48 4255 1

@digoal
德哥,目前我用四台服务器做了个gp集群,1 master,3 segment,3 mirror。其中master独立一台,另外三台分别对应1primary、1mirror。
服务器配置:
DELL C1600主板
CPU:X5650*2(主频:2.66Ghz,十二核二十四线程)
内存:服务器专用RRD3 REG ECC 32G
硬盘:希捷 2T 7200转 64M STAT3机械硬盘。
千兆交换机。
额外安排一台服务器做gpfdist服务器,进行数据入库。
表结构如下:
screenshot
数据基本是这个样子
screenshot

数据文件1小时一个,文件大小从100MB至2GB不等,单个文件行数在100万条至2000万条不等。
数据表按天分区,入库前子表不创建索引,入库语句是insert child_table select * from external_table。每次入库创建新的外部表指定唯一外部文件。
目前入库速度基本维持在10MB/s,数据行数10w/s,日表(子表)数据越多,数据文件越大,速度回越慢(怀疑与数据重分布有关)。
观察磁盘io、网络带宽、cpu都有相当大的空闲。内存倒是基本都被占用了,不过top显示的进程内存使用量并不大。
尝试多加一台服务器做gpfdist导入其它数据表数据,入库速度没有明显提升,反而会拖慢老的入库进程。
瓶颈应该在集群这一侧,我尝试修改过一些参数,但是gp得好多参数都不建议修改,不清楚gp的机制是什么样的,我应该从哪方面入手进行优化?
拜谢。

取消 提交回答
全部回答(1)
  • 德哥
    2019-07-17 18:26:19

    用perf top跟踪一下。

    0 0
相关问答

0

回答

由金融服务中的智能机器人技术引发的种种思考

2018-07-29 01:05:26 906浏览量 回答数 0

3

回答

关于磁盘挂载问题,求大家帮忙

2016-11-06 22:59:55 2383浏览量 回答数 3

1

回答

关于开启PHP多进程与它们之间的通信问题

2016-06-17 17:39:08 1710浏览量 回答数 1

1

回答

关于数据库数据同步问题

2016-06-06 11:19:31 1412浏览量 回答数 1

1

回答

关于安卓数据库的 问题

2016-03-25 10:04:58 1466浏览量 回答数 1

2

回答

mysql 事务回滚原理及疑问

2016-03-09 17:16:02 7055浏览量 回答数 2

1

回答

关于PHP操作JSON数据的问题!

2016-03-08 06:34:19 2300浏览量 回答数 1

1

回答

php和mysql数据库问题

2016-03-05 16:34:34 1959浏览量 回答数 1

1

回答

mysql数据库主从模式下的几点疑问

2015-08-26 20:23:05 8108浏览量 回答数 1

1

回答

关于RDS数据库的性能

2014-10-28 23:29:00 8175浏览量 回答数 1
+关注
postgres_up
一枚PGer
文章
问答
问答排行榜
最热
最新
相关电子书
更多
数据进入MaxCompute的N种方式
立即下载
MaxCompute2.0外表对接异构存储源和支持非结构化数据介绍
立即下载
数据无边界:非结构化数据在MaxCompute上的处理
立即下载