基于阿里云平台的大数据教学案例 —— 北京购房推荐指南

简介: 通过数据集结合阿里云相关产品进行多维度分析,给出一定的结论,并有数据支撑

一、实验题目

北京购房推荐指南

二、实验目的

通过数据集进行多维度分析,给出一定的结论,并有数据支撑

三、实验难点

分析维度与机器学习

四、实验过程(截图)
数据集介绍
URL,ID,经度,纬度,小区ID,交易时间,上市天数,关注人数,总价,每平米价格,面积,寝室,客厅,厨房,浴室,楼层,建筑类型,建楼时间,装修情况,建筑结构,梯户比,是否有电梯,是否满五年,是否临近地铁,地区,小区平均房价
1、在MaxCompute平台上建立数据表
image.png
2、导入数据
image.png

3、建立维度表以便使用QuickBI展示:
数据预处理:
image.png

建维度表:
image.png
image.png
image.png

4、为机器学习PAI测试SQL语句
image.png

5、QuickBI可视化展示
image.png
左上为观察数据集中,满5年的房屋数量,60%以上的数据为5年以上的房屋
右上为每个地区对房价的关注人数,可见朝阳地区对房价的关注人数最多(关注程度最高)
左下为地区对应房价的维度分析,可见西城和东城房价普遍偏高,房山房价偏低
右下为地区对应面积的维度分析,可见昌平/顺义的建房面积普遍较大
image.png
最上的表格表示了寝室数量和房价的对应关系(寝室数量越多房价越高)
左下展示了建筑类型和房价的对应关系,平方(四合院)平均房价最高,板楼平均房价最低
右下展示了住房面积和建筑类型的对应关系,板塔结合的类型住房面积最大。
image.png
上方表格显示了建筑结构和价格的对比,结果显示,砖木价格最贵,混合最便宜
左下展示了装修情况和面积的对比毛坯房面积最大,简装修面积最小
右下展示了建楼时间与面积的对应关系,可见1944年平均建楼面积最大,之后一直呈现下降趋势

6、机器学习PAI
image.png
预测通过给价钱分级,大于等于100,小于等于350的记为-1,大于等于350,小于等于750的记为0,其余的记为1使用逻辑回归算法,进行预测,本部分进行预测的是根据Livingroom的数量/装修情况/建楼时间//建筑面积/上市时间和关注人数预测这个房子的价格分级。

混淆矩阵
image.png
准确率/精确率
image.png
本部分使用了朴素贝叶斯/随机森林等算法模型,评分不是很理想,最终决定使用逻辑回归算法进行建模。

推荐结论:

若想找专业人士询问关于房子的相关问题,建议找朝阳人;
如果不在意地点的情况下,房山为房价最低的地区
如果对建筑面积有所需求,喜欢住面积大的房子,可以去昌平/顺义买房
板楼的住房面积位于第二大,同时板楼也是房价最低的楼型。
混合材料建筑价格最低,砖木建筑价格最高,可根据自身情况选择建筑材料。

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
目录
相关文章
|
18天前
|
存储 弹性计算 监控
【阿里云云原生专栏】成本优化策略:在阿里云云原生平台上实现资源高效利用
【5月更文挑战第29天】本文探讨了在阿里云云原生平台上实现资源高效利用和成本优化的策略。通过资源监控与评估,利用CloudMonitor和Prometheus等工具分析CPU、内存等使用情况,识别浪费。实施弹性伸缩策略,利用自动伸缩规则根据业务负载动态调整资源。借助容器化管理和Kubernetes编排提高资源利用率,优化存储选择如OSS、NAS,以及网络配置如VPC和CDN。示例展示了如何使用Kubernetes的HorizontalPodAutoscaler进行弹性伸缩,降低成本。
63 4
|
18天前
|
边缘计算 Cloud Native 数据管理
【阿里云云原生专栏】云原生背景下的AIoT布局:阿里云Link平台解析
【5月更文挑战第29天】阿里云Link平台,作为阿里云在AIoT领域的核心战略,借助云原生技术,为开发者打造一站式物联网服务平台。平台支持多协议设备接入与标准化管理,提供高效数据存储、分析及可视化,集成边缘计算实现低延时智能分析。通过实例代码展示,平台简化设备接入,助力智能家居等领域的创新应用,赋能开发者构建智能生态系统。
67 3
|
5天前
|
机器学习/深度学习 人工智能 分布式计算
人工智能平台PAI产品使用合集之如何在odps上启动独立的任务
阿里云人工智能平台PAI是一个功能强大、易于使用的AI开发平台,旨在降低AI开发门槛,加速创新,助力企业和开发者高效构建、部署和管理人工智能应用。其中包含了一系列相互协同的产品与服务,共同构成一个完整的人工智能开发与应用生态系统。以下是对PAI产品使用合集的概述,涵盖数据处理、模型开发、训练加速、模型部署及管理等多个环节。
人工智能平台PAI产品使用合集之如何在odps上启动独立的任务
|
5天前
|
机器学习/深度学习 人工智能 分布式计算
人工智能平台PAI产品使用合集之在maxcompute上跑模型,如何在本地进行推理
阿里云人工智能平台PAI是一个功能强大、易于使用的AI开发平台,旨在降低AI开发门槛,加速创新,助力企业和开发者高效构建、部署和管理人工智能应用。其中包含了一系列相互协同的产品与服务,共同构成一个完整的人工智能开发与应用生态系统。以下是对PAI产品使用合集的概述,涵盖数据处理、模型开发、训练加速、模型部署及管理等多个环节。
人工智能平台PAI产品使用合集之在maxcompute上跑模型,如何在本地进行推理
|
5天前
|
机器学习/深度学习 人工智能 分布式计算
人工智能平台PAI操作报错合集之在ODPS的xxx_dev项目空间调用easyrec训练,需要访问yyy项目空间的OSS,出现报错,是什么导致的
阿里云人工智能平台PAI (Platform for Artificial Intelligence) 是阿里云推出的一套全面、易用的机器学习和深度学习平台,旨在帮助企业、开发者和数据科学家快速构建、训练、部署和管理人工智能模型。在使用阿里云人工智能平台PAI进行操作时,可能会遇到各种类型的错误。以下列举了一些常见的报错情况及其可能的原因和解决方法。
|
6天前
|
SQL 分布式计算 DataWorks
DataWorks产品使用合集之如何将CSV文件从阿里云OSS同步到ODPS表,并且使用列作为表分区
DataWorks作为一站式的数据开发与治理平台,提供了从数据采集、清洗、开发、调度、服务化、质量监控到安全管理的全套解决方案,帮助企业构建高效、规范、安全的大数据处理体系。以下是对DataWorks产品使用合集的概述,涵盖数据处理的各个环节。
DataWorks产品使用合集之如何将CSV文件从阿里云OSS同步到ODPS表,并且使用列作为表分区
|
11天前
|
弹性计算 Ubuntu Linux
为什么要学习去使用云服务器,外网 IP能干什么,MAC使用Termius连接阿里云服务器。保姆级教学
为什么要学习去使用云服务器,外网 IP能干什么,MAC使用Termius连接阿里云服务器。保姆级教学
|
13天前
|
边缘计算 安全 人工智能
|
19天前
|
OLAP 数据处理 Apache
众安保险 CDP 平台:借助阿里云数据库 SelectDB 版内核 Apache Doris 打破数据孤岛,人群圈选提速4倍
众安保险在CDP(Customer Data Platform,客户数据平台)建设中,通过引入阿里云数据库SelectDB版内核Apache Doris,成功打破了数据孤岛,并显著提升了人群圈选的速度
184 1
|
18天前
|
存储 固态存储 安全
阿里云4核CPU云服务器价格参考,最新收费标准和活动价格
阿里云4核CPU云服务器多少钱?阿里云服务器核数是指虚拟出来的CPU处理器的核心数量,准确来讲应该是vCPU。CPU核心数的大小代表了云服务器的运算能力,CPU越高,云服务器的性能越好。阿里云服务器1核CPU就是一个超线程,2核CPU2个超线程,4核CPU4个超线程,这样云服务器可以同时处理多个任务,计算性能更强。如果网站流程较小,少量图片展示的企业网站,建议选择2核及以上CPU;如果网站流量较大,动态页面比较多,有视频等,建议选择4核、8核以上CPU。
阿里云4核CPU云服务器价格参考,最新收费标准和活动价格

热门文章

最新文章