我在大数据开发套件上用group by。我对一张表A做group by成表B,结果表B比原来表A的行数要少了,但是物理存储量表B却是表A的10倍,请问这个什么原因? 问题现状详见附件,期待您的答复,谢谢-问答-阿里云开发者社区-阿里云

开发者社区> 问答> 正文

我在大数据开发套件上用group by。我对一张表A做group by成表B,结果表B比原来表A的行数要少了,但是物理存储量表B却是表A的10倍,请问这个什么原因? 问题现状详见附件,期待您的答复,谢谢

祁同伟 2017-06-09 15:34:01 1498

我在大数据开发套件上用group by。我对一张表A做group by成表B,结果表B比原来表A的行数要少了,但是物理存储量表B却是表A的10倍,请问这个什么原因? 问题现状详见附件,期待您的答复,谢谢

存储 大数据
分享到
取消 提交回答
全部回答(1)
  • 琴瑟
    2019-07-17 21:16:38
    已采纳

    数据在maxcompute上是列式存储,并有压缩的,如果数据的同一列的前后的数据的内容是相似的,压缩比会比较高。您的数据我看到是用
    odps.sql.groupby.skewindata=true打开后,用group by写入的,那数据是比较散开的,
    您如果希望对数据有个比较好的压缩比,可以用SQL写入的时候做局部的排序
    https://help.aliyun.com/document_detail/27989.html

    2 0
大数据
使用钉钉扫一扫加入圈子
+ 订阅

大数据计算实践乐园,近距离学习前沿技术

推荐文章
相似问题
推荐课程