Python应用专题 | 16: pandas中2个nan值为何不同

本文涉及的产品
实时计算 Flink 版,5000CU*H 3个月
检索分析服务 Elasticsearch 版,2核4GB开发者规格 1个月
大数据开发治理平台 DataWorks,不限时长
简介: 主要介绍 pandas中2个nan值为何不同?

更多、更及时内容欢迎留意微信公众号小窗幽记机器学习

背景

判断两个 nan 值是否相等。

import numpy as np
a=np.nan
b=np.nan
if a == b:
    print("Same")
else:
    print("Not Same")
if a is b:
    print("Same")
else:
    print("Not Same")

解析

  1. numpy.nan是一个numpy.float64的非空对象。
    所以不能直接用bool表达式去判断numpy.nan,其结果都是True。一切依赖于布尔表达式的判断方式都不行,比如if语句。对于pandas中空值的判断,只能通过pandas或者numpy的函数或者is表达式去判断,不能用python的内置函数any或all判断。
    pd.isnull(a)  # True
    pd.isna(a)  # True
    np.isnan(a)
    
  2. pandas中空值的判断可以用is表达式判断,但是不能用==表达式。因为is是用于判断对象的引用是否相同,而==用于判断对象的是否相同。当is表达式,返回True,表示这两个引用指向同一个内存对象,即内存地址一样,一般同一个对象的不同引用的值也应该是相等的,所以一般is表达式为True,那么==表达式也为True。但是对于numpy.nan对象并非如此,用is表达式判断两个numpy.nan是相同的,即is表达式为True,但==表达式为False。这说明虽然不同numpy.nan变量引用指向的是同一个内存地址,但是其具有自己的值属性,值是不一样的,所以不能用==来判断。

测试代码:

    import numpy as np
    import pandas as pd
    a = np.nan
    b = np.nan
    print("type(nan)=", type(a))
    # print(a.__float__)
    # print(b.__float__)
    print("nan用布尔表达式进行值判断:")
    if a:
        print("True")
    else:
        print("False")
    print("用is np.nan 进行值判断:")
    if a is np.nan:
        print("True")
    else:
        print("False")
    print("用pd.isnull,pd.isna,np.isnan进行值判断:")
    if pd.isnull(a) and pd.isna(a) and np.isnan(a):
        print("True")
    print("用 == 判断两个nan是否相等:")
    if a == b:
        print("Same")
    else:
        print("Not Same")
    # print(a, "\t", b)
    print("用 is 判断两个nan是否相等:")
    if a is b:
        print("Same")
    else:
        print("Not Same")
    print("c=a赋值操作得到:")
    c = a# 象的引用,其实与 np.nan 一样
    if c == a:
        print("Same")
    else:
        print("Not Same")
    print("c=a.copy()浅拷贝得到:")
    import copy
    d = copy.copy(a)#浅拷贝
    if d == a:
        print("Same")
    else:
        print("Not Same")

    print("e=copy.deepcopy(a)深拷贝得到:")
    e = copy.deepcopy(a)
    if e == a:
        print("Same")
    else:
        print("Not Same")
    # 进一步查看成员元素的值
    print(dir(a))
    print("dir(a) len=", len(dir(a)))
    diff_count = 0
    for i in dir(a):
        # print(getattr(a,i))
        if getattr(a,i) == getattr(b,i):#试试is
            continue
        else:
            diff_count = diff_count + 1
            # print(i)
    print("diff_count=", diff_count)

运行结果:

type(nan)= <class 'float'>
nan用布尔表达式进行值判断:
True
用is np.nan 进行值判断:
True
用pd.isnull,pd.isna,np.isnan进行值判断:
True
用 == 判断两个nan是否相等:
Not Same
用 is 判断两个nan是否相等:
Same
c=a赋值操作得到:
Not Same
c=a.copy()浅拷贝得到:
Not Same
e=copy.deepcopy(a)深拷贝得到:
Not Same
['__abs__', '__add__', '__bool__', '__class__', '__delattr__', '__dir__', '__divmod__', '__doc__', '__eq__', '__float__', '__floordiv__', '__format__', '__ge__', '__getattribute__', '__getformat__', '__getnewargs__', '__gt__', '__hash__', '__init__', '__init_subclass__', '__int__', '__le__', '__lt__', '__mod__', '__mul__', '__ne__', '__neg__', '__new__', '__pos__', '__pow__', '__radd__', '__rdivmod__', '__reduce__', '__reduce_ex__', '__repr__', '__rfloordiv__', '__rmod__', '__rmul__', '__round__', '__rpow__', '__rsub__', '__rtruediv__', '__setattr__', '__setformat__', '__sizeof__', '__str__', '__sub__', '__subclasshook__', '__truediv__', '__trunc__', 'as_integer_ratio', 'conjugate', 'fromhex', 'hex', 'imag', 'is_integer', 'real']
dir(a) len= 57
diff_count= 36

【更多、更及时内容欢迎留意微信公众号小窗幽记机器学习

相关文章
|
6天前
|
机器学习/深度学习 人工智能 算法
机械视觉:原理、应用及Python代码示例
机械视觉:原理、应用及Python代码示例
|
7天前
|
数据挖掘 数据处理 索引
python常用pandas函数nlargest / nsmallest及其手动实现
python常用pandas函数nlargest / nsmallest及其手动实现
24 0
|
9天前
|
数据处理 Python
如何使用Python的Pandas库进行数据排序和排名
【4月更文挑战第22天】Pandas Python库提供数据排序和排名功能。使用`sort_values()`按列进行升序或降序排序,如`df.sort_values(by=&#39;A&#39;, ascending=False)`。`rank()`函数用于计算排名,如`df[&#39;A&#39;].rank(ascending=False)`。多列操作可传入列名列表,如`df.sort_values(by=[&#39;A&#39;, &#39;B&#39;], ascending=[True, False])`和分别对&#39;A&#39;、&#39;B&#39;列排名。
23 2
|
10天前
|
索引 Python
如何使用Python的Pandas库进行数据合并和拼接?
Pandas的`merge()`函数用于数据合并,如示例所示,根据&#39;key&#39;列对两个DataFrame执行内连接。`concat()`函数用于数据拼接,沿轴0(行)拼接两个DataFrame,并忽略原索引。
32 2
|
6天前
|
机器学习/深度学习 人工智能 自动驾驶
人工智能:原理、应用与Python代码实现
人工智能:原理、应用与Python代码实现
|
6天前
|
机器学习/深度学习 人工智能 自然语言处理
人工智能:原理、应用与Python代码示例
人工智能:原理、应用与Python代码示例
|
1天前
|
机器学习/深度学习 数据采集 数据可视化
Python在数据分析领域的应用研究
Python在数据分析领域的应用研究
4 0
|
1天前
|
数据采集 Web App开发 数据可视化
Python爬虫技术与数据可视化:Numpy、pandas、Matplotlib的黄金组合
Python爬虫技术与数据可视化:Numpy、pandas、Matplotlib的黄金组合
|
6天前
|
机器学习/深度学习 监控 算法
机械视觉:原理、应用与Python实现
机械视觉:原理、应用与Python实现
|
6天前
|
安全 前端开发 JavaScript
在Python Web开发过程中:Web框架相关,如何在Web应用中防止CSRF攻击?
在Python Web开发中防范CSRF攻击的关键措施包括:验证HTTP Referer字段、使用CSRF token、自定义HTTP头验证、利用Web框架的防护机制(如Django的`{% csrf_token %}`)、Ajax请求时添加token、设置安全会话cookie及教育用户提高安全意识。定期进行安全审计和测试以应对新威胁。组合运用这些方法能有效提升应用安全性。
14 0