Pandas、Matplotlib、Pyecharts数据分析实践

简介: 上篇中,我们对比了各种方式下的爬虫效率,并得到了安居客平台杭州的二手房数据3000条。今天,以此3000条数据为对象,我们尝试应用Pandas、Matplotlib和Pyecharts3个数据分析及可视化库进行练手实践。

00   分析目标  


  1. 对数据进行去重、筛选空值行,对部分字段进行清洗处理
  2. 多维度刻画杭州在售二手房信息,包括房源售价、主打标签、建筑年份、户型、楼层、行政区划等分布情况,给出在售房源标题的词云
  3. 分析不同区划、不同建筑年份、不同标签房源的数量和均价情况


注:所有数据处理和分析都应用pandas进行,可视化部分除3张复合图表由Matplotlib制作外,其余均应用Pyecharts完成。


 01   数据处理  


1.用pandas读取MySQL数据库中的3000条信息,并完成去重


db = pymysql.connect(host="localhost",user="root",password="123456",db="ajkhzesf")
sql_select = 'select title, houseType, area, floor, buildYear, adrres, tags, broker, totalPrice, price from hzesfmultire'
df = pd.read_sql(sql_select, db)
df = df.drop_duplicates()


640.png


2.对总价和均价两个字段进行处理并变换为浮点型


df['totalPrice'] = df['totalPrice'].str.replace('万','').astype(float)
df['price'] = df['price'].str.replace('元/m²','').astype(float)


640.png


3.通过小区/地址字段信息提取房源所在行政区划


regions = ['上城区','下城区','拱墅区','滨江区','江干区','西湖区','萧山区','余杭区','临安市','富阳区','建德市','淳安县','桐庐县']
df['region'] = ""
for region in regions:
   df.region[df['adrres'].str.contains(region[:2])] = region
df['region']


640.png


后续做图需要,这里临安仍以”临安市”存在


02   多维度刻画二手房市场  


1.   房源售价


640.png


总价200万、单价2.3万,对于杭州这样的大都市来说,也算是刚需友好了。


2.   主打标签


640.png


同新房市场一样,房源的售卖标签还是主要围绕品质、配套、出行和宜居几个方面来宣传。


3.   建筑年份


640.png

“满五”、“满二”政策下,2014年注定成为二手房市场存量最大的建筑年份。


4.   户型/楼层


640.png


640.png

如果分别用一个词来概括二手房市场的户型和楼层特点,那么我选择“刚需”和“中庸”。


5.   行政区划


640.png


在二手房市场上,余杭的存量(2000+)以大比分完爆其他所有区划。


6.   在售房源标题词云


640.jpg

  • 精装、地铁、三房、户型,是最大卖点
  • 朝南、楼层、品质、车位,具有别样吸引力
  • 81/85/86/88/89/92,主打刚需市场


7.  最后给出中介经手的二手房数量信息


640.png

同时负责联络管理近40个房源信息,也是蛮拼的。


   03   二手房均价情况  


1.   不同区划均价


640.png



毫无疑问,6大主城区均价要更高一筹,萧山余杭作为杭州发展潜力股也有着较高的房价水平。外围区划则相对逊色不少。


2.   不同年份均价


640.png

如前所述,二手房市场数量最大的是2014年,因为刚好符合满五的低税政策; 2017年以后的房子因为意味着较高的计税,所以在售房源很少,而且因为房龄短均价高,整体市场偏小。


均价方面,总体而言年份越早的房子均价越低,但2010年——2013年例外,具体查询结果如下,2011年在售房源数量及较少,而又夹杂一些主城区的豪宅;而2013年的低均价,则很大程度上是由于在售房源偏远城区的较多,本身房价较低。所以,小样本数据的局限性造成均价曲线上的严重失衡。


640.png

在售的2013年低房价Top10


640.png

在售的2011年高房价Top10


3.   不同标签均价统计了5个最有代表性的标签,并分别对包含该标签不包含该标签的样本进行了统计(图中的每对标签数据,左侧为包含该标签的结果,右侧则为不包含该标签),共得到10组数据。


640.png

对比来看,

  • 数量方面,包含这些优势的房源数量均为少数,无一例外的要少于相应不包含该标签的房源数量,尤其是在“繁华地段”和“南北通透”这两个属性上,差距尤为明显,印证了优质房源的稀缺性;
  • 均价方面,对比结果则略显戏剧性:在五个象征着优质房源的标签中,只有“近地铁”和“南北通透”意味着更高的均价,而其他则还看不出这样的特点,甚至跟大众印象还有很大出入。当然,再次不排除这是由小样本造成的。



目录
相关文章
|
1月前
|
数据挖掘 C语言 索引
数据分析-pandas(三)
在这里,我们将讨论pandas数据结构中常见的许多基本功能
18 0
|
7天前
|
数据可视化 数据挖掘 Python
Python中数据分析工具Matplotlib
【4月更文挑战第14天】Matplotlib是Python的数据可视化库,能生成多种图表,如折线图、柱状图等。以下是一个绘制简单折线图的代码示例: ```python import matplotlib.pyplot as plt x = [1, 2, 3, 4, 5] y = [2, 4, 6, 8, 10] plt.figure() plt.plot(x, y) plt.title('简单折线图') plt.xlabel('X轴') plt.ylabel('Y轴') plt.show() ```
12 1
|
7天前
|
数据采集 SQL 数据可视化
Python数据分析工具Pandas
【4月更文挑战第14天】Pandas是Python的数据分析库,提供Series和DataFrame数据结构,用于高效处理标记数据。它支持从多种数据源加载数据,包括CSV、Excel和SQL。功能包括数据清洗(处理缺失值、异常值)、数据操作(切片、过滤、分组)、时间序列分析及与Matplotlib等库集成进行数据可视化。其高性能底层基于NumPy,适合大型数据集处理。通过加载数据、清洗、分析和可视化,Pandas简化了数据分析流程。广泛的学习资源使其成为数据分析初学者的理想选择。
13 1
|
7天前
|
数据采集 数据可视化 数据挖掘
Seaborn在数据分析中的应用:案例分析与实践
【4月更文挑战第17天】本文介绍了Seaborn在数据分析中的应用,它是一个基于Python的可视化库,简化了复杂数据的图表创建。通过一个销售数据分析的案例,展示了数据加载、描述性统计、相关性分析、多变量分析及高级可视化步骤。实践技巧包括数据清洗、图表选择、颜色使用、注释标签和交互性。Seaborn助力高效数据探索和理解,提升分析效率。注意,实际使用需根据数据集和目标调整,并参考最新文档。
|
8天前
|
供应链 搜索推荐 数据挖掘
Pandas实战案例:电商数据分析的实践与挑战
【4月更文挑战第16天】本文通过一个电商数据分析案例展示了Pandas在处理销售数据、用户行为分析及商品销售趋势预测中的应用。在数据准备与清洗阶段,Pandas用于处理缺失值、重复值。接着,通过用户购买行为和商品销售趋势分析,构建用户画像并预测销售趋势。实践中遇到的大数据量和数据多样性挑战,通过分布式计算和数据标准化解决。未来将继续深入研究Pandas与其他先进技术的结合,提升决策支持能力。
|
8天前
|
存储 数据可视化 数据挖掘
实战案例:Pandas在金融数据分析中的应用
【4月更文挑战第16天】本文通过实例展示了Pandas在金融数据分析中的应用。案例中,一家投资机构使用Pandas加载、清洗股票历史价格数据,删除无关列并重命名,将日期设为索引。接着,数据被可视化以观察价格走势,进行基本统计分析了解价格分布,以及计算移动平均线来平滑波动。Pandas的便捷功能在金融数据分析中体现出高效率和实用性。
|
16天前
|
数据采集 数据挖掘 数据处理
Pandas库在数据分析中的作用
【4月更文挑战第9天】Pandas,一个基于NumPy的数据分析Python库,以强大的数据处理和便捷的接口闻名。它包含两个核心数据结构:Series(一维标签数组)和DataFrame(二维表格)。Pandas支持数据导入/导出(如CSV、Excel),数据清洗(处理缺失值和重复值),描述性统计分析,分组聚合,以及与Matplotlib等库集成实现数据可视化。通过多索引和层次化索引,Pandas能灵活处理复杂数据集,是数据科学领域的关键工具。本文旨在帮助读者理解并运用Pandas进行高效数据分析。
|
1月前
|
数据可视化 数据挖掘 Python
Python中的数据可视化工具Matplotlib简介与实践
在本文中,我们将介绍Python中常用的数据可视化工具Matplotlib,包括其基本概念、常用功能以及实际应用。通过学习Matplotlib,读者可以更好地理解和运用数据可视化技术,提升数据分析与展示的能力。
|
1月前
|
数据可视化 数据挖掘 API
Python数据分析中的数据可视化:Matplotlib与Seaborn的比较
在Python数据分析领域,数据可视化是至关重要的一环。本文将深入探讨两大流行的数据可视化库Matplotlib与Seaborn的异同,帮助读者更好地选择适合自身需求的工具。
|
1月前
|
SQL 数据挖掘 数据库管理
数据分析-pandas(二)
DataFrame是一个二维标记数据结构,其中包含可能不同类型的列。您可以将其视为电子表格或SQL表,或者Series对象的字典。它通常是最常用的pandas对象。与Series一样,DataFrame接受许多不同类型的输入: 一维ndarray,列表,字典,或字典的Series
27 0