【人工智能】机器学习之使用Python生成ID3决策树及使用sklearn的决策树算法对葡萄酒数据集进行分类

简介: 决策树的思想:给定一个集合,其中的每个样本由若干属性表示,决策树通过贪心的策略不断挑选最优的属性。常见的决策树算法有ID3,C4.5,CART算法等。

❤❤❤ID3算法

✅✅决策树的思想:

给定一个集合,其中的每个样本由若干属性表示,决策树通过贪心的策略不断挑选最优的属性。
常见的决策树算法有ID3,C4.5,CART算法等。

💤💤💤ID3算法:

        baseEntropy = self.calcShannonEnt(dataset) # 基础熵
        num = len(dataset) # 样本总数
        
        #子集中的概率
        subDataSet = self.splitDataSet(dataset, i, val)
        prob = len(subDataSet) / float(num) 
        
        # 条件熵
        newEntropy += prob * self.calcShannonEnt(subDataSet)
        
        # 信息增益
        infoGain = baseEntropy - newEntropy

💯1.先写绘图树方法,函数。

import matplotlib.pyplot as plt

decisionNode = dict(boxstyle="sawtooth", fc="0.8")
leafNode = dict(boxstyle="round4", fc="0.8")
arrow_args = dict(arrowstyle="<-")

def plotNode(nodeTxt, centerPt, parentPt, nodeType):
    createPlot.ax1.annotate(nodeTxt, xy=parentPt, xycoords='axes fraction', \
                            xytext=centerPt, textcoords='axes fraction', \
                            va="center", ha="center", bbox=nodeType, arrowprops=arrow_args)

def getNumLeafs(myTree):
    numLeafs = 0
    firstStr = list(myTree.keys())[0]
    secondDict = myTree[firstStr]
    for key in secondDict.keys():
        if type(secondDict[key]).__name__ == 'dict':
            numLeafs += getNumLeafs(secondDict[key])
        else:
            numLeafs += 1
    return numLeafs

def getTreeDepth(myTree):
    maxDepth = 0
    firstStr = list(myTree.keys())[0]
    secondDict = myTree[firstStr]
    for key in secondDict.keys():
        if type(secondDict[key]).__name__ == 'dict':
            thisDepth = getTreeDepth(secondDict[key]) + 1
        else:
            thisDepth = 1
        if thisDepth > maxDepth:
            maxDepth = thisDepth
    return maxDepth

def plotMidText(cntrPt, parentPt, txtString):
    xMid = (parentPt[0] - cntrPt[0]) / 2.0 + cntrPt[0]
    yMid = (parentPt[1] - cntrPt[1]) / 2.0 + cntrPt[1]
    createPlot.ax1.text(xMid, yMid, txtString)

def plotTree(myTree, parentPt, nodeTxt):
    numLeafs = getNumLeafs(myTree)
    depth = getTreeDepth(myTree)
    firstStr = list(myTree.keys())[0]
    cntrPt = (plotTree.xOff + (1.0 + float(numLeafs)) / 2.0 / plotTree.totalw, plotTree.yOff)
    plotMidText(cntrPt, parentPt, nodeTxt)
    plotNode(firstStr, cntrPt, parentPt, decisionNode)
    secondDict = myTree[firstStr]
    plotTree.yOff = plotTree.yOff - 1.0 / plotTree.totalD
    for key in secondDict.keys():
        if type(secondDict[key]).__name__ == 'dict':
            plotTree(secondDict[key], cntrPt, str(key))
        else:
            plotTree.xOff = plotTree.xOff + 1.0 / plotTree.totalw
            plotNode(secondDict[key], (plotTree.xOff, plotTree.yOff), cntrPt, leafNode)
            plotMidText((plotTree.xOff, plotTree.yOff), cntrPt, str(key))
    plotTree.yOff = plotTree.yOff + 1.0 / plotTree.totalD

def createPlot(inTree):
    fig = plt.figure(1, facecolor='white')
    fig.clf()
    axprops = dict(xticks=[], yticks=[])
    createPlot.ax1 = plt.subplot(111, frameon=False, **axprops)
    plotTree.totalw = float(getNumLeafs(inTree))
    plotTree.totalD = float(getTreeDepth(inTree))
    plotTree.xOff = -0.5 / plotTree.totalw
    plotTree.yOff = 1.0
    plotTree(inTree, (0.5, 1.0), '')
    plt.show()

💯2.ID3决策树类

class ID3Tree(object):
    def __init__(self):
        self.tree = {}  # ID3 Tree
        self.dataSet = []  # 数据集
        self.labels = []  # 标签集

    def getDataSet(self, dataset, labels):
        self.dataSet = dataset
        self.labels = labels

    def train(self):
        # labels = copy.deepcopy(self.labels)
        labels = self.labels[:]
        self.tree = self.buildTree(self.dataSet, labels)

    def buildTree(self, dataSet, labels):
        classList = [ds[-1] for ds in dataSet]  # 提取样本的类别
        if classList.count(classList[0]) == len(classList):  # 单一类别
            return classList[0]
        if len(dataSet[0]) == 1:  # 没有属性需要划分了
            return self.classify(classList)

        bestFeat = self.findBestSplit(dataSet)  # 选取最大增益的属性序号
        bestFeatLabel = labels[bestFeat]
        tree = {bestFeatLabel: {}}  # 构造一个新的树结点
        del (labels[bestFeat])  # 从总属性列表中去除最大增益属性

        featValues = [ds[bestFeat] for ds in dataSet]  # 抽取最大增益属性的取值列表
        uniqueFeatValues = set(featValues)  # 选取最大增益属性的数值类别

        for value in uniqueFeatValues:  # 对于每一个属性类别
            subLabels = labels[:]
            subDataSet = self.splitDataSet(dataSet, bestFeat, value)  # 分裂结点
            subTree = self.buildTree(subDataSet, subLabels)  # 递归构造子树
            tree[bestFeatLabel][value] = subTree
        return tree

    # 计算出现次数最多的类别标签
    def classify(self, classList):
        items = dict([(classList.count(i), i) for i in classList])
        return items[max(items.keys())]

    # 计算最优特征
    def findBestSplit(self, dataset):
        numFeatures = len(dataset[0]) - 1
        baseEntropy = self.calcShannonEnt(dataset) # 基础熵
        num = len(dataset) # 样本总数
        bestInfoGain = 0.0
        bestFeat = -1  # 初始化最优特征向量轴
        # 遍历数据集各列,寻找最优特征轴
        for i in range(numFeatures):
            featValues = [ds[i] for ds in dataset]
            uniqueFeatValues = set(featValues)
            newEntropy = 0.0
            # 按列和唯一值,计算信息熵
            for val in uniqueFeatValues:
                subDataSet = self.splitDataSet(dataset, i, val)
                prob = len(subDataSet) / float(num) # 子集中的概率
                newEntropy += prob * self.calcShannonEnt(subDataSet)
            infoGain = baseEntropy - newEntropy # 信息增益
            if infoGain > bestInfoGain: # 挑选最大值
                bestInfoGain = baseEntropy - newEntropy
                bestFeat = i
        return bestFeat

    # 从dataset数据集的feat特征中,选取值为value的数据
    def splitDataSet(self, dataset, feat, values):
        retDataSet = []
        for featVec in dataset:
            if featVec[feat] == values:
                reducedFeatVec = featVec[:feat]
                reducedFeatVec.extend(featVec[feat + 1:])
                retDataSet.append(reducedFeatVec)
        return retDataSet

    # 计算dataSet的信息熵
    def calcShannonEnt(self, dataSet):
        num = len(dataSet)  # 样本集总数
        classList = [c[-1] for c in dataSet]  # 抽取分类信息
        labelCounts = {}
        for cs in set(classList):  # 对每个分类进行计数
            labelCounts[cs] = classList.count(cs)

        shannonEnt = 0.0
        for key in labelCounts:
            prob = labelCounts[key] / float(num)
            shannonEnt -= prob * log2(prob)
        return shannonEnt

    # 预测。对输入对象进行ID3分类
    def predict(self, tree, newObject):
        #    判断输入值是否为“dict”
        while type(tree).__name__ == 'dict':
            key = list(tree.keys())[0]
            tree = tree[key][newObject[key]]
        return tree

💲💲💲给出数据集,标签集:

dataSet = [[1, 1, 1, 1,1, 1, 'Yes'],
               [2, 1, 2, 1,1, 1, 'Yes'],
               [2, 1, 1, 1,1, 1, 'Yes'],
               [1, 1, 2, 1,1, 1, 'Yes'],
               [3, 1, 1, 1,1, 1, 'Yes'],
               [1,2, 1, 1,2, 2, 'Yes'],
               [2, 2, 1, 2,2, 2, 'Yes'],
               [2, 2, 1, 1,2, 1, 'Yes'],
               [2, 2, 2, 2,2, 1, 'No'],
               [1,3, 3, 1,3, 2, 'No'],
               [3, 3, 3, 3,3, 1, 'No'],
               [3, 1, 1, 3,3, 2, 'No'],
               [1, 2, 1, 2,1, 1, 'No'],
               [3,2, 2, 2,1, 1, 'No'],
               [2, 2, 1, 1,2, 2, 'No'],
               [3, 1, 1, 3,3, 1, 'No'],
               [1, 1, 2, 2,2, 1, 'No'],]

    #'色泽', '根蒂', '敲声', '纹理','脐部', '触感'
    features = ['seze', 'gendi', 'qiaosheng', 'wenli','qibu', 'chugan'] 

💞💞完整代码

from math import log2
import treePlotter

class ID3Tree(object):
    def __init__(self):
        self.tree = {}  # ID3 Tree
        self.dataSet = []  # 数据集
        self.labels = []  # 标签集

    def getDataSet(self, dataset, labels):
        self.dataSet = dataset
        self.labels = labels

    def train(self):
        # labels = copy.deepcopy(self.labels)
        labels = self.labels[:]
        self.tree = self.buildTree(self.dataSet, labels)

    def buildTree(self, dataSet, labels):
        classList = [ds[-1] for ds in dataSet]  # 提取样本的类别
        if classList.count(classList[0]) == len(classList):  # 单一类别
            return classList[0]
        if len(dataSet[0]) == 1:  # 没有属性需要划分了
            return self.classify(classList)

        bestFeat = self.findBestSplit(dataSet)  # 选取最大增益的属性序号
        bestFeatLabel = labels[bestFeat]
        tree = {bestFeatLabel: {}}  # 构造一个新的树结点
        del (labels[bestFeat])  # 从总属性列表中去除最大增益属性

        featValues = [ds[bestFeat] for ds in dataSet]  # 抽取最大增益属性的取值列表
        uniqueFeatValues = set(featValues)  # 选取最大增益属性的数值类别

        for value in uniqueFeatValues:  # 对于每一个属性类别
            subLabels = labels[:]
            subDataSet = self.splitDataSet(dataSet, bestFeat, value)  # 分裂结点
            subTree = self.buildTree(subDataSet, subLabels)  # 递归构造子树
            tree[bestFeatLabel][value] = subTree
        return tree

    # 计算出现次数最多的类别标签
    def classify(self, classList):
        items = dict([(classList.count(i), i) for i in classList])
        return items[max(items.keys())]

    # 计算最优特征
    def findBestSplit(self, dataset):
        numFeatures = len(dataset[0]) - 1
        baseEntropy = self.calcShannonEnt(dataset) # 基础熵
        num = len(dataset) # 样本总数
        bestInfoGain = 0.0
        bestFeat = -1  # 初始化最优特征向量轴
        # 遍历数据集各列,寻找最优特征轴
        for i in range(numFeatures):
            featValues = [ds[i] for ds in dataset]
            uniqueFeatValues = set(featValues)
            newEntropy = 0.0
            # 按列和唯一值,计算信息熵
            for val in uniqueFeatValues:
                subDataSet = self.splitDataSet(dataset, i, val)
                prob = len(subDataSet) / float(num) # 子集中的概率
                newEntropy += prob * self.calcShannonEnt(subDataSet)
            infoGain = baseEntropy - newEntropy # 信息增益
            if infoGain > bestInfoGain: # 挑选最大值
                bestInfoGain = baseEntropy - newEntropy
                bestFeat = i
        return bestFeat

    # 从dataset数据集的feat特征中,选取值为value的数据
    def splitDataSet(self, dataset, feat, values):
        retDataSet = []
        for featVec in dataset:
            if featVec[feat] == values:
                reducedFeatVec = featVec[:feat]
                reducedFeatVec.extend(featVec[feat + 1:])
                retDataSet.append(reducedFeatVec)
        return retDataSet

    # 计算dataSet的信息熵
    def calcShannonEnt(self, dataSet):
        num = len(dataSet)  # 样本集总数
        classList = [c[-1] for c in dataSet]  # 抽取分类信息
        labelCounts = {}
        for cs in set(classList):  # 对每个分类进行计数
            labelCounts[cs] = classList.count(cs)

        shannonEnt = 0.0
        for key in labelCounts:
            prob = labelCounts[key] / float(num)
            shannonEnt -= prob * log2(prob)
        return shannonEnt

    # 预测。对输入对象进行ID3分类
    def predict(self, tree, newObject):
        #    判断输入值是否为“dict”
        while type(tree).__name__ == 'dict':
            key = list(tree.keys())[0]
            tree = tree[key][newObject[key]]
        return tree

if __name__ == '__main__':
    def createDataSet():
        dataSet = [[1, 1, 1, 1,1, 1, 'Yes'],
                   [2, 1, 2, 1,1, 1, 'Yes'],
                   [2, 1, 1, 1,1, 1, 'Yes'],
                   [1, 1, 2, 1,1, 1, 'Yes'],
                   [3, 1, 1, 1,1, 1, 'Yes'],
                   [1,2, 1, 1,2, 2, 'Yes'],
                   [2, 2, 1, 2,2, 2, 'Yes'],
                   [2, 2, 1, 1,2, 1, 'Yes'],
                   [2, 2, 2, 2,2, 1, 'No'],
                   [1,3, 3, 1,3, 2, 'No'],
                   [3, 3, 3, 3,3, 1, 'No'],
                   [3, 1, 1, 3,3, 2, 'No'],
                   [1, 2, 1, 2,1, 1, 'No'],
                   [3,2, 2, 2,1, 1, 'No'],
                   [2, 2, 1, 1,2, 2, 'No'],
                   [3, 1, 1, 3,3, 1, 'No'],
                   [1, 1, 2, 2,2, 1, 'No'],]

        #'色泽', '根蒂', '敲声', '纹理','脐部', '触感'
        features = ['seze', 'gendi', 'qiaosheng', 'wenli','qibu', 'chugan'] 
        
        return dataSet, features

    id3 = ID3Tree()  # 创建一个ID3决策树
    ds, labels = createDataSet()
    id3.getDataSet(ds, labels)
    id3.train()  # 训练ID3决策树
    print(id3.tree)  # 输出ID3决策树
    print(id3.predict(id3.tree,{'seze':2,'gendi':2,'qiaosheng':1,'wenli':1,'qibu':1,'chugan':1}))
    treePlotter.createPlot(id3.tree)

💥💥生成决策树:

在这里插入图片描述

💌💌💌ID3算法实例

💨💨1.使用sklearn的决策树算法对葡萄酒数据集进行分类,要求:

(1)划分训练集和测试集(测试集占20%)

(2)对测试集的预测类别标签和真实标签进行对比

(3)输出分类的准确率

(4)调整参数比较不同算法(ID3, CART)的分类效果。

🕳🕳2. 利用给定ID3算法,画出下列训练集的决策树。

在这里插入图片描述

🍇🍇🍇1.葡萄酒分类

🚲🚲🚲(1)划分训练集和测试集(测试集占20%)

test_size等于几就是测试集占比
x_train, x_test, y_train, y_test = train_test_split(

   X, Y, test_size=0.2, random_state=0)

🚓🚓(2)对测试集的预测类别标签和真实标签进行对比

预测类别标签
y_predict = clf.predict(x_test)
对比
pd.concat([pd.DataFrame(x_test), pd.DataFrame(y_test), pd.DataFrame(y_predict)], axis=1)

🛹🛹(3)输出分类的准确率

clf.fit(x_train, y_train)
score = clf.score(x_test, y_test)

🏍🛵🏍(4)调整参数比较不同算法(ID3, CART)的分类效果。

采用ID3算法进行计算
clf = tree.DecisionTreeClassifier(criterion="entropy")
采用CART算法进行计算
clf = tree.DecisionTreeClassifier(criterion="gini")

🚀🚀🚀完整代码:

# 导入相关库
from sklearn.model_selection import train_test_split
from sklearn import tree
from sklearn.datasets import load_wine
import pandas as pd
# 导入数据集
wine = load_wine()
X = wine.data
Y = wine.target
features_name = wine.feature_names
print(features_name)
print(pd.concat([pd.DataFrame(X), pd.DataFrame(Y)], axis=1))
# 打印数据
# 划分数据集,数据集划分为测试集占20%;
x_train, x_test, y_train, y_test = train_test_split(
        X, Y, test_size=0.2, random_state=0)

# 采用ID3算法进行计算
clf = tree.DecisionTreeClassifier(criterion="entropy")
# 采用CART算法进行计算
# clf = tree.DecisionTreeClassifier(criterion="gini")
# 获取模型
clf.fit(x_train, y_train)
score = clf.score(x_test, y_test)
y_predict = clf.predict(x_test)
print('准确率为:', score)
# 对测试集的预测类别标签和真实标签进行对比
print(pd.concat([pd.DataFrame(x_test), pd.DataFrame(y_test), pd.DataFrame(y_predict)], axis=1))

🚀🚀🚀结果:

在这里插入图片描述

🛰🛰🌌2.只需修改数据集,标签集即可

🚩🚩部分代码:

if __name__ == '__main__':
    def createDataSet():
        dataSet = [[1, 1, 1, 1, 'No'],
                   [1, 1, 1, 2,  'No'],
                   [2, 1, 1, 1,  'Yes'],
                   [3, 2, 1, 1,  'Yes'],
                   [3, 3, 2, 1,  'Yes'],
                   [3, 3, 2, 2,  'No'],
                   [2, 3, 2, 2,  'Yes'],
                   [1, 2, 1, 1,  'No'],
                   [1, 3, 2, 1,  'Yes'],
                   [3, 2, 2, 1,  'Yes'],
                   [1, 2, 2, 2,  'Yes'],
                   [2, 2, 1, 2,  'Yes'],
                   [2, 1, 2, 1,  'Yes'],
                   [3, 2, 1, 2,  'No'], ]
        features = ['outlook', 'temp', 'humidity', 'windy']

        return dataSet, features


    id3 = ID3Tree()  # 创建一个ID3决策树
    ds, labels = createDataSet()
    id3.getDataSet(ds, labels)
    id3.train()  # 训练ID3决策树
    print(id3.tree)  # 输出ID3决策树
    print(id3.predict(id3.tree, {'outlook': 2, 'temp': 2, 'humidity': 1, 'windy': 1}))
    treePlotter.createPlot(id3.tree)

🍽🍽🌼🌼结果:

在这里插入图片描述
在这里插入图片描述

目录
相关文章
|
8月前
|
机器学习/深度学习 人工智能 运维
阿里云PAI人工智能平台介绍、优势及收费标准,手动整理
阿里云人工智能平台PAI是面向开发者和企业的机器学习与深度学习工程平台,提供数据标注、模型构建、训练、部署及推理优化等全链路服务。内置140+优化算法,支持PyTorch、TensorFlow等多种框架,具备高性能训练与推理能力,适用于自动驾驶、金融风控、智能推荐、智慧医疗等多个行业场景。PAI提供零代码开发、可视化建模、大模型一键部署等功能,助力企业快速构建AI应用。支持多种购买方式,如按量付费、预付费等,满足不同业务需求。
|
11月前
|
机器学习/深度学习 算法 数据挖掘
PyTabKit:比sklearn更强大的表格数据机器学习框架
PyTabKit是一个专为表格数据设计的新兴机器学习框架,集成了RealMLP等先进深度学习技术与优化的GBDT超参数配置。相比传统Scikit-Learn,PyTabKit通过元级调优的默认参数设置,在无需复杂超参调整的情况下,显著提升中大型数据集的性能表现。其简化API设计、高效训练速度和多模型集成能力,使其成为企业决策与竞赛建模的理想工具。
415 12
PyTabKit:比sklearn更强大的表格数据机器学习框架
|
机器学习/深度学习 传感器 人工智能
人工智能与机器学习:改变未来的力量####
【10月更文挑战第21天】 在本文中,我们将深入探讨人工智能(AI)和机器学习(ML)的基本概念、发展历程及其在未来可能带来的革命性变化。通过分析当前最前沿的技术和应用案例,揭示AI和ML如何正在重塑各行各业,并展望它们在未来十年的潜在影响。 ####
357 27
|
机器学习/深度学习 人工智能 算法
人工智能浪潮下的编程实践:构建你的第一个机器学习模型
在人工智能的巨浪中,每个人都有机会成为弄潮儿。本文将带你一探究竟,从零基础开始,用最易懂的语言和步骤,教你如何构建属于自己的第一个机器学习模型。不需要复杂的数学公式,也不必担心编程难题,只需跟随我们的步伐,一起探索这个充满魔力的AI世界。
314 12
|
机器学习/深度学习 人工智能 算法
探索人工智能与机器学习的融合之路
在本文中,我们将探讨人工智能(AI)与机器学习(ML)之间的紧密联系以及它们如何共同推动技术革新。我们将深入分析这两种技术的基本概念、发展历程和当前的应用趋势,同时讨论它们面临的挑战和未来的发展方向。通过具体案例研究,我们旨在揭示AI与ML结合的强大潜力,以及这种结合如何为各行各业带来革命性的变化。
329 11
|
12月前
|
机器学习/深度学习 存储 人工智能
AI职场突围战:夸克应用+生成式人工智能认证,驱动“打工人”核心竞争力!
在AI浪潮推动下,生成式人工智能(GAI)成为职场必备工具。文中对比了夸克、豆包、DeepSeek和元宝四大AI应用,夸克以“超级入口”定位脱颖而出。同时,GAI认证为职场人士提供系统学习平台,与夸克结合助力职业发展。文章还探讨了职场人士如何通过加强学习、关注技术趋势及培养合规意识,在AI时代把握机遇。
|
11月前
|
机器学习/深度学习 人工智能 自然语言处理
人工智能应用领域有哪些
本文全面探讨了人工智能(AI)的应用领域和技术核心,涵盖医疗、交通、金融、教育、制造、零售等多个行业,并分析了AI技术的局限性及规避策略。同时,介绍了生成式人工智能认证项目的意义与展望。尽管AI发展面临数据依赖和算法可解释性等问题,但通过优化策略和经验验证,可推动其健康发展。未来,AI将在更多领域发挥重要作用,助力社会进步。
|
机器学习/深度学习 人工智能 运维
人工智能在事件管理中的应用
人工智能在事件管理中的应用
371 21
|
机器学习/深度学习 人工智能 搜索推荐
探索人工智能在现代医疗中的革新应用
本文深入探讨了人工智能(AI)技术在医疗领域的最新进展,重点分析了AI如何通过提高诊断准确性、个性化治疗方案的制定以及优化患者管理流程来革新现代医疗。文章还讨论了AI技术面临的挑战和未来发展趋势,为读者提供了一个全面了解AI在医疗领域应用的视角。
303 11
|
机器学习/深度学习 人工智能 自然语言处理
人工智能在医疗诊断中的应用与前景####
本文深入探讨了人工智能(AI)技术在医疗诊断领域的应用现状、面临的挑战及未来发展趋势。通过分析AI如何辅助医生进行疾病诊断,提高诊断效率和准确性,以及其在个性化医疗中的潜力,文章揭示了AI技术对医疗行业变革的推动作用。同时,也指出了数据隐私、算法偏见等伦理问题,并展望了AI与人类医生协同工作的前景。 ####
961 0

推荐镜像

更多