dataframe学习知识总结

简介: pandas DataFrame是Python中用于处理二维表格数据的重要数据结构,支持多种类型数据,提供丰富功能。可通过字典、列表或文件创建DataFrame,使用`.info()`、`.describe()`、`.head()`和`.tail()`查看数据信息。选择和过滤数据可按列名、行索引或条件进行。修改包括更新元素、列及添加/删除列。利用`.groupby()`和聚合函数进行分组分析,使用`.sort_values()`和`.rank()`排序,通过`.concat()`和`.merge()`合并数据。

DataFrame是Python中pandas库的一个重要数据结构,它是一个二维表格型数据结构,可以存储多种DataFrame是Python中pandas库的一个重要数据结构,它是一个二维表格型数据结构,可以存储多种类型的数据,并且具有很多实用的功能。以下是一些关于DataFrame的学习知识总结:

  1. 创建DataFrame:

    • 使用字典创建:pd.DataFrame(data),其中data是一个字典,键是列名,值是列中的数据。
    • 使用列表创建:pd.DataFrame(data, columns=columns),其中data是一个列表,columns是一个包含列名的列表。
    • 从文件中读取:pd.read_csv('file.csv')、pd.read_excel('file.xlsx')等。
  2. 查看DataFrame信息:

    • df.info():显示DataFrame的基本属性和索引信息。
    • df.describe():显示DataFrame的描述性统计信息。
    • df.head():显示DataFrame的前5行数据。
    • df.tail():显示DataFrame的后5行数据。
  3. 选择和过滤数据:

    • 通过列名选择:df['column_name']。
    • 通过行索引选择:df.loc[row_index]。
    • 通过条件过滤:df[df['column_name'] > value]。
  4. 修改DataFrame:

    • 修改单个元素:df.loc[row_index, 'column_name'] = new_value。
    • 修改一列:df['column_name'] = new_values。
    • 添加新列:df['new_column_name'] = new_values。
    • 删除列:df.drop('column_name', axis=1, inplace=True)。
  5. 分组和聚合:

    • 使用groupby()函数对数据进行分组:df.groupby('column_name')。
    • 使用聚合函数(如sum、mean、max等)对分组后的数据进行计算:df.groupby('column_name').agg({'column1': 'sum', 'column2': 'mean'})。
  6. 排序和排名:

    • 对整个DataFrame进行排序:df.sort_values(by='column_name', ascending=True)。
    • 对某一列进行排序:df['column_name'].sort_values()。
    • 对某一列进行排名:df['column_name'].rank()。
  7. 合并和连接:

    • 使用concat()函数将多个DataFrame按行或列方向进行合并:pd.concat([df1, df2], axis=0)。
    • 使用merge()函数将两个DataFrame按照某个共同的列进行连接:pd.merge(df1, df2, on='common_column')。
  8. 缺失值处理:

    • 查看缺失值:df.isnull().sum()。
    • 填充缺失值:df['column_name'].fillna(value)。
    • 删除含有缺失值的行或列:df.dropna()、df.dropna(axis=1)、df.dropna(axis=0)。
目录
相关文章
dataframe获取指定列
dataframe获取指定列
1686 0
DataFrame(13):DataFrame的排序与排名问题(一)
DataFrame(13):DataFrame的排序与排名问题(一)
DataFrame(13):DataFrame的排序与排名问题(一)
|
存储 数据挖掘 数据处理
Pandas 数据筛选:条件过滤
Pandas 是 Python 最常用的数据分析库之一,提供了强大的数据结构和工具。本文从基础到高级,介绍如何使用 Pandas 进行条件过滤,包括单一条件、多个条件过滤、常见问题及解决方案,以及动态和复杂条件过滤的高级用法。希望本文能帮助你更好地利用 Pandas 处理数据。
1606 78
|
数据挖掘 数据处理 数据库
Pandas数据聚合:groupby与agg
Pandas库中的`groupby`和`agg`方法是数据分析中不可或缺的工具,用于数据分组与聚合计算。本文从基础概念、常见问题及解决方案等方面详细介绍这两个方法的使用技巧,涵盖单列聚合、多列聚合及自定义聚合函数等内容,并通过代码案例进行说明,帮助读者高效处理数据。
2161 32
|
缓存 自然语言处理 算法
大模型意图识别工程化实践
本文重点介绍大模型意图识别能力在智能电视核心链路中的落地过程和思考,对比了基础模型、RAG 、以及7b模型微调三种方案的优缺点。
6226 122
|
Python
Python 中如何循环某一特定列的所有行数据
Python 中如何循环某一特定列的所有行数据
383 2
|
机器学习/深度学习 运维 算法
K-Means(K-均值)聚类算法理论和实战
K-Means(K-均值)聚类算法理论和实战
1464 1
pandas list\dict 转换为DataFrame
pandas list\dict 转换为DataFrame
pandas list\dict 转换为DataFrame
|
索引 Python
如何在 Pandas 数据框中添加新列?
【8月更文挑战第30天】
1531 4

热门文章

最新文章