技巧 | 一个相见恨晚的python数据分析库,一键生成超详细数据分析报告

简介: 技巧 | 一个相见恨晚的python数据分析库,一键生成超详细数据分析报告

本期导读

大家好,我是欧K。

今天给大家安利一个python数据分析库【pandas_profiling】。

不用不知道,一用吓一跳,赶快来看看吧。


我们在进行数据分析,尤其是探索性分析时,往往需要根据数据的总体概况建立相关模型进行分析,pandas_profiling这个库可以一键生成数据分析报告,我们可以快速查看所有数据的分布以及各参数之间的相关性信息,给后期分析带来了极大的便利。


1. pandas_profiling安装

pip install pandas-profiling

注意:‘-’在中间,而非下划线。


2. pandas_profiling使用

以波士顿房价预测为例(经典数据集:鸢尾花分类数据集、波士顿房价预测数据集、泰坦尼克号生存分析数据集):2.1 数据分析一般流程

  • 需求分析
  • 获取数据
  • 数据预处理
  • 划分数据集(特征值抽取)
  • 特征工程
  • 建模
  • 模型评估与优化


2.2 pandas分析数据概况

导入数据集“boston.csv” ,使用data.head()查看前五行数据:

使用data.describe()查看整个数据集概况:

数据包括:

  • 数据集行数
  • 列平均值
  • 列标准差
  • 最小值、最大值
  • 分位数


2.3 pandas_profiling分析数据概况

一行语句即可data.profile_report():

一共包括6项数据:

  • Overview:数据概况
  • Variables:各变量分布情况
  • Interactions:变量间相关性
  • Correlations:相关性热力图
  • Missing values:缺失值
  • Sample:数据集部分示例


部分信息如下:

Overview

Variables

Interactions

Correlations

Missing values

Sample


2.4 导出html文件

执行语句profile.to_file():

html文件链接: https://pan.baidu.com/s/1rcolHhlFbhLKtPiiMK0m4g 提取码: b252

总 结

pandas_profiling作为pandas功能的扩展,可以快速生成详细的数据分析报告,非常适合处理数据探索分析的前期准备工作,对不太熟悉数据分析(尤其是特征抽取)的小伙伴是一个非常好用的工具。

END


以上就是本期为大家整理的全部内容了,赶快练习起来吧,喜欢的朋友可以点赞、点在看也可以分享到朋友圈让更多人知道哦


相关文章
|
3天前
|
监控 搜索推荐 UED
用Python的pynput库追踪每一次点击和滚动
使用Python的`pynput`库可监听鼠标活动,包括点击和滚动事件。安装`pynput`后,通过`mouse.Listener`捕获鼠标事件。示例代码展示如何记录点击位置、滚动方向,并创建日志文件。通过类封装,可控制记录器的启停,并实现特定模式下的响应,如快速三连击左键自动打开网站。动手实践,将理论转化为实用工具。
|
3天前
|
XML 数据格式 Python
Python模块导入包括:`import math`导入标准库
【6月更文挑战第23天】Python模块导入包括:`import math`导入标准库,`from math import sqrt`导入单个函数,`import numpy as np`给模块取别名,`from random import *`导入所有(不推荐),`import xml.etree.ElementTree as ET`导入子模块,`import_module('pandas')`按需导入,和使用相对路径如`from .module import func`处理项目结构。记得调整`sys.path`以包含自定义模块路径。
15 4
|
1天前
|
机器学习/深度学习 自然语言处理 数据挖掘
使用Python和大模型进行数据分析和文本生成
Python语言以其简洁和强大的特性,成为了数据科学、机器学习和人工智能开发的首选语言之一。随着大模型(Large Language Models, LLMs)如GPT-4的崛起,我们能够利用这些模型实现诸多复杂任务,从文本生成到智能对话、数据分析等等。在这篇文章中,我将介绍如何用Python连接和使用大模型,并通过示例展示如何在实际项目中应用这些技术。
|
4天前
|
数据采集 机器学习/深度学习 数据可视化
利用Python和Pandas库构建高效的数据分析流程
在数据驱动的时代,数据分析已成为企业决策的关键环节。本文介绍如何利用Python编程语言及其强大的数据分析库Pandas,构建一套高效且可扩展的数据分析流程。与常规的数据分析流程不同,本文不仅涵盖数据加载、清洗、转换等基础步骤,还强调数据可视化、模型探索与评估等高级分析技巧,并通过实际案例展示如何在Python中实现这些步骤,为数据分析师提供一套完整的数据分析解决方案。
|
5天前
|
开发框架 Python
Python的`pygame`库用于2D游戏开发,涵盖图形、音频和输入处理。
【6月更文挑战第21天】Python的`pygame`库用于2D游戏开发,涵盖图形、音频和输入处理。要开始,先通过`pip install pygame`安装。基本流程包括:初始化窗口、处理事件循环、添加游戏元素(如玩家和敌人)、响应用户输入、更新游戏状态及结束条件。随着项目发展,可逐步增加复杂性。
13 1
|
5天前
|
机器学习/深度学习 数据采集 数据可视化
使用Python进行数据分析涉及数据收集
【6月更文挑战第21天】使用Python进行数据分析涉及数据收集(如数据库、文件、API),数据清洗(处理缺失值、异常值和重复项),数据探索(统计摘要、可视化和相关性分析),特征工程(创建新特征和编码),模型构建(选择算法、训练与调整),模型评估(计算指标、可视化效果),结果解释(报告和可视化),以及部署与维护。此过程因项目需求而异,可能需迭代。常用库有`pandas`、`requests`、`BeautifulSoup`、`Matplotlib`等。
14 1
|
22小时前
|
前端开发 JavaScript PHP
顶级Python库(附代码)大分享
顶级Python库(附代码)大分享
|
1天前
|
Python
python之数值计算、math库、随机数
python之数值计算、math库、随机数
5 0
|
7天前
|
数据采集 数据可视化 数据挖掘
Python数据分析入门指南
Python数据分析涉及环境搭建(推荐Anaconda,含pandas和matplotlib库)。使用`pandas`读取CSV数据,如`data = pd.read_csv('data.csv')`。数据清洗包括检查缺失值(`data.isnull().sum()`)和处理异常值。然后进行数据处理,如创建新列、选择特定列及分组。利用`matplotlib`进行数据可视化,绘制直方图和散点图,以`plt.hist()`和`plt.scatter()`展示数据。
|
7月前
|
数据可视化 数据挖掘 Python
【Python】数据分析:matplotlib折线图
【Python】数据分析:matplotlib折线图
73 0

热门文章

最新文章