大家好
我正在做一个根据气象数据进行天气预测的项目,计划使用了open-meteo提供的气温数据。
这套数据包含了过去86年,全球各个地区(按经纬度划分)的云量,太阳辐射,2米气温,地表温度,海表温度,地表气压,以及风力风速等数据。
这套数据存储于amazon s3的us-east-1服务器。
昨晚我进行了一次测试,在pai-dsw的jupyter里,编写程序,下载了2026年1月1日的全部数据,大概10g左右,我把他们转成了jsonl格式,上传到了魔搭的dataset里,顺利完成了。
结果今天我还想继续用dsw下载,却发现下不了了。
主要问题包括:
我的问题:
请问这套dataset之前有别人做过么?我希望抓取这些数据后,用parquet,按列存储这些信息,以便随时可以方便的取出某一天的某一项数据。如果有人做过这个dataset我就不做了。但是我在魔搭上搜索 open meteo,没有结果
我遭遇的网络问题,是啥导致的?是阿里云那边发现流量太大,一晚上跑了10g,把到s3的网络给限流了?还是美国人那边不希望我们拿他们的数据,把阿里云的服务器给限流了?
先说结论:别硬刚S3直连,国内连AWS us-east-1就是玄学。昨晚能下是因为运气好,今天报错Network is unreachable大概率是阿里云出向流量被风控了,或者AWS那边检测到异常高频请求暂时封了IP。一夜跑10G确实容易触发阈值。
关于数据集:魔搭上搜不到很正常,这数据量太大,没人会存全量JSONL。你想用Parquet按列存思路是对的,但别一次性拉10G。
建议方案:
换策略:别全量爬。写个脚本,只下载你预测需要的特定经纬度、特定时间段的数据,按需切片。
解决网络:在DSW里配个代理试试,或者检查是否开了公网访问权限。如果不行,考虑用Open-Meteo的API接口小批量获取,比S3稳定。
存储优化:生成Parquet时按(year, month, lat, lon)分区,这样查询快且文件小,以后也好复用。
别纠结“别人做没做”,这种海量气象数据通常是项目定制化的,自己分段处理最靠谱。
ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!欢迎加入技术交流群:微信公众号:魔搭ModelScope社区,钉钉答疑群:44837352