MaxCompute产品使用合集之读取OSS数据出现重复的情况是什么导致的-阿里云开发者社区

MaxCompute产品使用合集之读取OSS数据出现重复的情况是什么导致的

2024-06-10 185

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

本文涉及的产品

云原生大数据计算服务MaxCompute，500CU*H 100GB 3个月

简介： MaxCompute作为一款全面的大数据处理平台，广泛应用于各类大数据分析、数据挖掘、BI及机器学习场景。掌握其核心功能、熟练操作流程、遵循最佳实践，可以帮助用户高效、安全地管理和利用海量数据。以下是一个关于MaxCompute产品使用的合集，涵盖了其核心功能、应用场景、操作流程以及最佳实践等内容。

问题一：大数据计算MaxCompute我读oss 数据按分区。数据翻倍是什么情况啊？

大数据计算MaxCompute我读oss 数据按分区。数据翻倍是什么情况啊？就是数据明显是重复了一模一样的2条

有个问题我的oss数据是5分钟更新一次和这个有关系吗？

参考答案：

比如你说哪条数据多了，我看oss上也是csv文件，可以直接本地打开看下，这条数据是不是本身就是这样的。

因为oss外表的数据本身不存储在MaxCompute上，MaxCompute只是做了映射读出来，我理解不应该出现多数据的情况

有，源端数据是变化的，读出来的也不一样。

关于本问题的更多回答可点击进行查看：

https://developer.aliyun.com/ask/574927

问题二：大数据计算MaxCompute支持生成临时表吗？

大数据计算MaxCompute支持生成临时表吗？

参考答案：

MaxCompute没有临时表的概念，在建表的时候加上生命周期就行。

生命周期操作：https://help.aliyun.com/zh/maxcompute/user-guide/lifecycle-management-operations?spm=a2c4g.11186623.0.i6To ，

关于本问题的更多回答可点击进行查看：

https://developer.aliyun.com/ask/574926

问题三：帮我看下大数据计算MaxCompute这个问题我把数据拉出来看是122？

帮我看下大数据计算MaxCompute这个问题我把数据拉出来看是122

https://logview.aliyun.com/logview/?h=http://service.cn.maxcompute.aliyun-inc.com/api&p=report_daily&i=20231129012703937giub0e0hq6k&token=WTlxMUlZdlhNQW5NdTNoUXNoeFVtNVNpb1k0PSxPRFBTX09CTzozMDg1NDM5MSwxNzAzODEzMjI0LHsiU3RhdGVtZW50IjpbeyJBY3Rpb24iOlsib2RwczpSZWFkIl0sIkVmZmVjdCI6IkFsbG93IiwiUmVzb3VyY2UiOlsiYWNzOm9kcHM6Kjpwcm9qZWN0cy9yZXBvcnRfZGFpbHkvaW5zdGFuY2VzLzIwMjMxMTI5MDEyNzAzOTM3Z2l1YjBlMGhxNmsiXX1dLCJWZXJzaW9uIjoiMSJ9![c274f60792b561af94a4bf71054d0f04.png](https://ucc.alicdn.com/pic/developer-ecology/wyvq5mjsckydw_3020a28ca40b44a4a8b6025c1bca40f6.png)

参考答案：

报错显示按照分隔符,来分，只有一列数据。目前ddl里是规定了122列。

关于本问题的更多回答可点击进行查看：

https://developer.aliyun.com/ask/574925

问题四：大数据计算MaxCompute这是刚才运行的，这期间没有什么任务？

大数据计算MaxCompute这是刚才运行的，这期间没有什么任务？Log view:http://logview.odps.aliyun.com/logview/?h=http://service.cn.maxcompute.aliyun-inc.com/api&p=paiwo_smart&i=20231128085220862gel75l071wk5&token=YVNBOW4xNUU1NFZldHh6b1MyalJnWFk2aE1vPSxPRFBTX09CTzpwNF8yNTUxMDA4MzA0NjI1NTE5OTcsMTcwMzc1MzU0MSx7IlN0YXRlbWVudCI6W3siQWN0aW9uIjpbIm9kcHM6UmVhZCJdLCJFZmZlY3QiOiJBbGxvdyIsIlJlc291cmNlIjpbImFjczpvZHBzOio6cHJvamVjdHMvcGFpd29fc21hcnQvaW5zdGFuY2VzLzIwMjMxMTI4MDg1MjIwODYyZ2VsNzVsMDcxd2s1Il19XSwiVmVyc2lvbiI6IjEifQ==

参考答案：

这个SQL取消掉吧，数据膨胀了，目前还在持续膨胀。对应这个阶段

需要检查下

https://help.aliyun.com/zh/maxcompute/use-cases/diagnostic-cases-of-logview?spm=a2c4g.11186623.0.i21#section-1zn-y7c-7qv

看log view一直打印膨胀的阶段是StreamLineWrite52，可以看下这个阶段逻辑，按照文档排查一下

关于本问题的更多回答可点击进行查看：

https://developer.aliyun.com/ask/574924

问题五：请问下，大数据计算MaxCompute内部表的数据是存储再OSS上的吗？

请问下，

1、大数据计算MaxCompute内部表的数据是存储再OSS上的吗？这些OSS是你们托管的，用户是无法直接访问的？

2、我如果要把表的所有数据copy到另一个区域有什么快速的办法吗？能通过直接copy 文件就可以了吗？我们有几十个表想直接弄过去另一个region

参考答案：

maxcompute内部表的数据是存储MaxCompute底层存储里的，用户侧除了查表做处理，没办法直接访问到底层存储目录；
把表的所有数据copy到另一个区域，是指跨region进行MaxCompute数据直接的迁移吗？如果是mc->mc可以通过mma
有俩方式，可以评估下用哪个
直接使用insert overwrite语法写入（当前操作账号需要有A、B两个region下数据的权限，不需要搭建迁移环境）
用mma进行跨region迁移（任务中配置操作账号需要有A、B两个region下数据的权限，需要搭建一个简单的迁移环境，需要走申请打开底层的copy task开关）
文档可以参考下这里：https://help.aliyun.com/zh/maxcompute/user-guide/maxcompute-data-migration?spm=a2c4g.11186623.0.0.358b27d7UcQVAB ，

关于本问题的更多回答可点击进行查看：

https://developer.aliyun.com/ask/574923

MaxCompute产品使用合集之读取OSS数据出现重复的情况是什么导致的