dataframe学习知识总结

简介: dataframe学习知识总结

DataFrame是Python中pandas库的一个重要数据结构,它是一个二维表格型数据结构,可以存储多种DataFrame是Python中pandas库的一个重要数据结构,它是一个二维表格型数据结构,可以存储多种类型的数据,并且具有很多实用的功能。以下是一些关于DataFrame的学习知识总结:

  1. 创建DataFrame:

    • 使用字典创建:pd.DataFrame(data),其中data是一个字典,键是列名,值是列中的数据。
    • 使用列表创建:pd.DataFrame(data, columns=columns),其中data是一个列表,columns是一个包含列名的列表。
    • 从文件中读取:pd.read_csv('file.csv')、pd.read_excel('file.xlsx')等。
  2. 查看DataFrame信息:

    • df.info():显示DataFrame的基本属性和索引信息。
    • df.describe():显示DataFrame的描述性统计信息。
    • df.head():显示DataFrame的前5行数据。
    • df.tail():显示DataFrame的后5行数据。
  3. 选择和过滤数据:

    • 通过列名选择:df['column_name']。
    • 通过行索引选择:df.loc[row_index]。
    • 通过条件过滤:df[df['column_name'] > value]。
  4. 修改DataFrame:

    • 修改单个元素:df.loc[row_index, 'column_name'] = new_value。
    • 修改一列:df['column_name'] = new_values。
    • 添加新列:df['new_column_name'] = new_values。
    • 删除列:df.drop('column_name', axis=1, inplace=True)。
  5. 分组和聚合:

    • 使用groupby()函数对数据进行分组:df.groupby('column_name')。
    • 使用聚合函数(如sum、mean、max等)对分组后的数据进行计算:df.groupby('column_name').agg({'column1': 'sum', 'column2': 'mean'})。
  6. 排序和排名:

    • 对整个DataFrame进行排序:df.sort_values(by='column_name', ascending=True)。
    • 对某一列进行排序:df['column_name'].sort_values()。
    • 对某一列进行排名:df['column_name'].rank()。
  7. 合并和连接:

    • 使用concat()函数将多个DataFrame按行或列方向进行合并:pd.concat([df1, df2], axis=0)。
    • 使用merge()函数将两个DataFrame按照某个共同的列进行连接:pd.merge(df1, df2, on='common_column')。
  8. 缺失值处理:

    • 查看缺失值:df.isnull().sum()。
    • 填充缺失值:df['column_name'].fillna(value)。
    • 删除含有缺失值的行或列:df.dropna()、df.dropna(axis=1)、df.dropna(axis=0)。
相关文章
|
Python
dataframe添加一新列
dataframe添加一新列
2930 2
|
6月前
|
人工智能 自然语言处理 安全
2026年阿里云OpenClaw秒级部署全流程解析
OpenClaw(原Clawdbot/Moltbot)是2026年主流开源本地AI智能体,支持自然语言驱动文件处理、日程管理、邮件整理与跨平台自动化。依托ClawHub超1700个Skills插件,真正“能动手”。阿里云提供一键部署、成本低、安全私有、网络优化的全栈支持,零门槛打造专属AI员工。
664 3
|
索引 Python
Pandas学习笔记之Dataframe
Pandas学习笔记之Dataframe
2600 2
|
数据采集 数据处理 索引
DataFrame
【10月更文挑战第13天】
1406 2
|
Linux Python Windows
Matplotlib 中设置自定义中文字体的正确姿势
【11月更文挑战第16天】Matplotlib 默认不支持中文字体显示,需手动配置。方法包括:1) 修改全局字体设置,适用于整个脚本;2) 局部设置特定元素的字体;3) 使用系统字体名称,但可能因系统而异。通过这些方法可以有效解决中文乱码问题,确保图表中文本的正确显示。
1949 3
|
SQL 监控 索引
如何在 SQL Server 中使用 `PATINDEX` 函数
【8月更文挑战第8天】
1509 9
|
机器学习/深度学习 算法 数据挖掘
Python机器学习10大经典算法的讲解和示例
为了展示10个经典的机器学习算法的最简例子,我将为每个算法编写一个小的示例代码。这些算法将包括线性回归、逻辑回归、K-最近邻(KNN)、支持向量机(SVM)、决策树、随机森林、朴素贝叶斯、K-均值聚类、主成分分析(PCA)、和梯度提升(Gradient Boosting)。我将使用常见的机器学习库,如 scikit-learn,numpy 和 pandas 来实现这些算法。
|
存储 索引 Python
dataframe学习知识总结
pandas DataFrame是Python中用于处理二维表格数据的重要数据结构,支持多种类型数据,提供丰富功能。可通过字典、列表或文件创建DataFrame,使用`.info()`、`.describe()`、`.head()`和`.tail()`查看数据信息。选择和过滤数据可按列名、行索引或条件进行。修改包括更新元素、列及添加/删除列。利用`.groupby()`和聚合函数进行分组分析,使用`.sort_values()`和`.rank()`排序,通过`.concat()`和`.merge()`合并数据。
560 3
|
数据采集 数据挖掘 数据处理
DataFrame 的缺失值处理:填充、删除与插值
【5月更文挑战第19天】DataFrame数据处理中,面对缺失值问题,常用方法包括填充(如固定值、平均值)和删除。插值是一种有效手段,如线性插值适合时间序列数据。根据数据特性和分析目标,可组合使用多种方法,如先填充再插值。灵活应用这些策略能提升数据质量和分析准确性,为决策提供可靠支持。
1019 2
|
Python
使用Python pandas的sort_values()方法可按一个或多个列对DataFrame排序
【5月更文挑战第2天】使用Python pandas的sort_values()方法可按一个或多个列对DataFrame排序。示例代码展示了如何按'Name'和'Age'列排序 DataFrame。先按'Name'排序,再按'Age'排序。sort_values()的by参数接受列名列表,ascending参数控制排序顺序(默认升序),inplace参数决定是否直接修改原DataFrame。
2080 1

热门文章

最新文章