决策树CART回归树—

决策树模型

选择最好的特征和特征的值进行数据集划分
根据上面获得的结果创建决策树
根据测试数据进行剪枝（默认没有数据的树分支被剪掉）
对输入进行预测

模型树

import numpy as np

def loadDataSet(fileName):      #general function to parse tab -delimited floats

    dataMat = []                #assume last column is target value

    with open(fileName) as fr:

        for line in fr.readlines():

            curLine = line.strip().split('\t')

            # fltLine = map(float, curLine) #map all elements to float()

            fltLine = [float(i) for i in curLine]

            dataMat.append(fltLine)

        # dataMat = [map(float,line.strip().split('\t')) for line in fr.readlines()]

    return np.mat(dataMat)

# dataSet为矩阵，feature 为特征索引，value为值

def binSplitDataSet(dataSet, feature, value):

    mat0 = dataSet[np.nonzero(dataSet[:,feature] > value)[0],:]

    mat1 = dataSet[np.nonzero(dataSet[:,feature] <= value)[0],:]

    return np.mat(mat0),np.mat(mat1)

def regLeaf(dataSet):#returns the value used for each leaf

    return np.mean(dataSet[:,-1])

def regErr(dataSet): # 输出的平方误差和

    return np.var(dataSet[:,-1]) * np.shape(dataSet)[0]

# ops[0]误差下降值，小于此值不再切分

# ops[1] 切分的最小样本数，小于此值不再切分

def chooseBestSplit(dataSet, leafType=regLeaf, errType=regErr, ops=(1,4)):

    tolS = ops[0]; tolN = ops[1]

    #if all the target variables are the same value: quit and return value

    # print(set(dataSet[:,-1].T.tolist()[0]))

    if len(set(dataSet[:,-1].T.tolist()[0])) == 1: #exit cond 1

    # if len(set(dataSet[:, -1])) == 1:  # exit cond 1

        return None, leafType(dataSet) # 返回None,输出值

    m,n = np.shape(dataSet)

    #the choice of the best feature is driven by Reduction in RSS error from mean

    S = errType(dataSet)

    bestS = np.inf; bestIndex = 0; bestValue = 0

    for featIndex in range(n-1):

        for splitVal in set(dataSet[:,featIndex].T.tolist()[0]):

            mat0, mat1 = binSplitDataSet(dataSet, featIndex, splitVal)

            if (np.shape(mat0)[0] < tolN) or (np.shape(mat1)[0] < tolN):

                continue  # 结束本次循环，小于最小切分样本数，不再切分

            newS = errType(mat0) + errType(mat1)

            if newS < bestS:

                bestIndex = featIndex

                bestValue = splitVal

                bestS = newS

    #if the decrease (S-bestS) is less than a threshold don't do the split

    if (S - bestS) < tolS:  # 切分前的和切分后的误差小于给定值，不再切分

        return None, leafType(dataSet) #exit cond 2

    # mat0, mat1 = binSplitDataSet(dataSet, bestIndex, bestValue) # ?按照最优特征和值切分

    # if (np.shape(mat0)[0] < tolN) or (np.shape(mat1)[0] < tolN):  #exit cond 3

    #     return None, leafType(dataSet)

    return bestIndex,bestValue#returns the best feature to split on

                              #and the value used for that split

def createTree(dataSet, leafType=regLeaf, errType=regErr, ops=(1,4)):#assume dataSet is NumPy Mat so we can array filtering

    feat, val = chooseBestSplit(dataSet, leafType, errType, ops)#choose the best split

    if feat == None: return val #if the splitting hit a stop condition return val

    retTree = {}

    retTree['spInd'] = feat

    retTree['spVal'] = val

    lSet, rSet = binSplitDataSet(dataSet, feat, val)

    retTree['left'] = createTree(lSet, leafType, errType, ops)

    retTree['right'] = createTree(rSet, leafType, errType, ops)

    return retTree

def isTree(obj):

    return (type(obj).__name__ == 'dict')

def getMean(tree):

    if isTree(tree['right']): tree['right'] = getMean(tree['right'])

    if isTree(tree['left']): tree['left'] = getMean(tree['left'])

    return (tree['left'] + tree['right']) / 2.0

def prune(tree, testData):

    if np.shape(testData)[0] == 0: return getMean(

        tree)  # if we have no test data collapse the tree

    if (isTree(tree['right']) or isTree(

            tree['left'])):  # if the branches are not trees try to prune them

        lSet, rSet = binSplitDataSet(testData, tree['spInd'], tree['spVal'])

    if isTree(tree['left']): tree['left'] = prune(tree['left'], lSet)

    if isTree(tree['right']): tree['right'] = prune(tree['right'], rSet)

    # if they are now both leafs, see if we can merge them

    if not isTree(tree['left']) and not isTree(tree['right']):

        lSet, rSet = binSplitDataSet(testData, tree['spInd'], tree['spVal'])

        errorNoMerge = sum(np.power(lSet[:, -1] - tree['left'], 2)) + \

                       sum(np.power(rSet[:, -1] - tree['right'], 2))

        treeMean = (tree['left'] + tree['right']) / 2.0

        errorMerge = sum(np.power(testData[:, -1] - treeMean, 2))

        if errorMerge < errorNoMerge:

            print("merging")

            return treeMean

        else:

            return tree

    else:

        return tree

# 模型树代码--未测试

def linearSolve(dataSet):   #helper function used in two places

    m,n = np.shape(dataSet)

    X = np.mat(np.ones((m,n))); Y = np.mat(np.ones((m,1)))#create a copy of

    # data with 1

    # in 0th postion

    X[:,1:n] = dataSet[:,0:n-1]; Y = dataSet[:,-1]#and strip out Y

    xTx = X.T*X

    if np.linalg.det(xTx) == 0.0:

        raise NameError('This matrix is singular, cannot do inverse,\n\

        try increasing the second value of ops')

    ws = xTx.I * (X.T * Y)

    return ws,X,Y

def regTreeEval(model, inDat):

    return float(model)

def modelTreeEval(model, inDat):

    n = np.shape(inDat)[1]

    X = np.mat(np.ones((1, n + 1)))

    X[:, 1:n + 1] = inDat

    return float(X * model)

def treeForeCast(tree, inData, modelEval=regTreeEval):

    if not isTree(tree): return modelEval(tree, inData)

    if inData[tree['spInd']] > tree['spVal']:

        if isTree(tree['left']):

            return treeForeCast(tree['left'], inData, modelEval)

        else:

            return modelEval(tree['left'], inData)

    else:

        if isTree(tree['right']):

            return treeForeCast(tree['right'], inData, modelEval)

        else:

            return modelEval(tree['right'], inData)

def createForeCast(tree, testData, modelEval=regTreeEval):

    m = len(testData)

    yHat = np.mat(np.zeros((m, 1)))

    for i in range(m):

        yHat[i, 0] = treeForeCast(tree, np.mat(testData[i]), modelEval)

    return yHat

if __name__ == '__main__':

    # mat0, mat1 = binSplitDataSet(np.mat(np.eye(4)),1,0.5)  # 二分测试

    dataMat = loadDataSet('ex00.txt')  # 构建数测试

    myTree = createTree(dataMat)

    print(myTree)

    dataMat2 = loadDataSet('ex0.txt')

    myTree2 = createTree(dataMat2)

    print(myTree2)

    dataMat31 = loadDataSet('ex2.txt')  # 剪枝测试

    dataMat32 = loadDataSet('ex2test.txt')

    myTree31 = createTree(dataMat31)

    retTree = prune(myTree31, dataMat32)

    print(myTree31)

    print(retTree)

决策树CART回归树——算法实现的更多相关文章

机器学习实战---决策树CART回归树实现
机器学习实战---决策树CART简介及分类树实现一:对比分类树 CART回归树和CART分类树的建立算法大部分是类似的,所以这里我们只讨论CART回归树和CART分类树的建立算法不同的地方.首先,我 ...
大白话5分钟带你走进人工智能-第二十六节决策树系列之Cart回归树及其参数(5)
第二十六节决策树系列之Cart回归树及其参数(5) 上一节我们讲了不同的决策树对应的计算纯度的计算方法, ...
CART回归树
决策树算法原理(ID3,C4.5) 决策树算法原理(CART分类树) 决策树的剪枝 CART回归树模型表达式: 其中,数据空间被划分为R1~Rm单元,每个单元有一个固定的输出值Cm.这样可以计算模型输 ...
分类回归树（CART）
概要本部分介绍 CART,是一种非常重要的机器学习算法. 基本原理 CART 全称为 Classification And Regression Trees,即分类回归树.顾名思义,该算法既 ...
决策树--CART树详解
1.CART简介 CART是一棵二叉树,每一次分裂会产生两个子节点.CART树分为分类树和回归树. 分类树主要针对目标标量为分类变量,比如预测一个动物是否是哺乳动物. 回归树针对目标变量为连续值的情况 ...
决策树分类回归，ID3，c4.5，CART，及其Python代码
决策树模型内部节点表示一个特征或者属性,叶子结点表示一个类.决策树工作时,从根节点开始,对实例的每个特征进行测试,根据测试结果,将实例分配到其子节点中,这时的每一个子节点对应着特征的一个取值,如此递 ...
CART（分类回归树）
1.简单介绍线性回归方法可以有效的拟合所有样本点(局部加权线性回归除外).当数据拥有众多特征并且特征之间关系十分复杂时,构建全局模型的想法一个是困难一个是笨拙.此外,实际中很多问题为非线性的,例如常 ...
【机器学习】迭代决策树GBRT（渐进梯度回归树）
一.决策树模型组合单决策树C4.5由于功能太简单,并且非常容易出现过拟合的现象,于是引申出了许多变种决策树,就是将单决策树进行模型组合,形成多决策树,比较典型的就是迭代决策树GBRT和随机森林RF. ...
回归树（Regression Tree）
目录回归树理论解释算法流程 ID3 和 C4.5 能不能用来回归? 回归树示例 References 说到决策树(Decision tree),我们很自然会想到用其做分类,每个叶子代表有限类别中 ...

随机推荐

鸿蒙轻内核M核源码分析：LibC实现之Musl LibC
摘要:本文学习了LiteOS-M内核Musl LibC的实现,特别是文件系统和内存分配释放部分. 本文分享自华为云社区<鸿蒙轻内核M核源码分析系列十九 Musl LibC>,作者:zhus ...
二进制方式搭建Kubernetes高可用集群
转:https://jiangxl.blog.csdn.net/article/details/120428703 详细:https://developer.aliyun.com/article/78 ...
解决matplotlib中文不显示问题
在导入库时添加如下几行代码 from pylab import mpl mpl.rcParams['font.sans-serif'] = ['FangSong'] # 指定默认字体 mpl.rcPa ...
Lesson6——Pandas Pandas描述性统计
1 简介描述统计学(descriptive statistics)是一门统计学领域的学科,主要研究如何取得反映客观现象的数据,并以图表形式对所搜集的数据进行处理和显示,最终对数据的规律.特征做出综合 ...
[论文][半监督语义分割]Adversarial Learning for Semi-Supervised Semantic Segmentation
Adversarial Learning for Semi-Supervised Semantic Segmentation 论文原文摘要创新点:我们提出了一种使用对抗网络进行半监督语义分割的方法 ...
Sleep_Yield_Join
名称解释 Sleep:意思就是睡眠,当前线程暂停一段时间让给别的线程去运行;Sleep是怎么复活的?由你的睡眠时间而定,等睡眠到规定的时间自动复活. Yield:就是当前线程正在执行的时候停止下来进入 ...
IntelliJ IDEA 学习笔记 - 修改编码
感谢原文作者:codeke 原文链接:https://blog.csdn.net/cgl125167016/article/details/78666432 仓库:https://github.com ...
通过json动态创建控制器
通过字符串来创建控制器如果通过字符串来创建控制器不可以直接通过类型来获取对应的类因为Swift有命名空间,类前需要加上命名空间的名称获取命名空间的名称 let executable = NSB ...
Mysql Json函数之更新（四）
修改JSON值的函数本节中的函数将修改JSON值并返回结果. JSON_APPEND(json_doc, path, val[, path, val] ...) 将值附加到JSON文档中指定数组的末 ...
json解析出现：java.lang.ClassCastException: net.sf.ezmorph.bean.MorphDynaBean cannot be cast to XXX
感谢大佬:https://blog.csdn.net/one_ink/article/details/99817676 一.出错原因当我们利用json解析中的toBean方法时,如果它的属性里面包含 ...

决策树CART回归树——算法实现

决策树CART回归树——算法实现的更多相关文章

随机推荐

热门专题