scikit-learn决策树的python实现以及作图

decsion tree（决策树）

其中每个内部结点表示在一个属性上的测试，每个分支代表一个属性的输出，而每个树叶结点代表类或类的分布。树的最顶层是根节点

连续变量要离散化

机器学习中分类方法的一个重要算法

信息熵：

一个信息的信息量大小和它的不确定性有直接的关系，要搞清楚一件非常非常不确定的事情，或者是我么你一无所知的事情，需要了解大量新==》新的度量就等于不确定性的多少

变量的不确定性越大，熵也就越大

ID3

通过信息熵来选择每个节点的判断依据。

infomation gain最大则为当前节点的依据。

决策树的优点缺点

优点：直观，便于理解，小规模数据集有效

缺点：处理连续变量不好类别较多时，错误增加比较快，可规模性一般

决策树程序

安装anaconda python环境

anaconda环境包含了机器学习的基本所有库
安装graphviz

转化dot文件到pdf
生成决策树图

进入到cmd中allEectronicInformationGainorc.dot所在文件夹

dot -Tpdf allEectronicInformationGainorc.dot -o outpu.pdf

program

#!/usr/bin/env python

# -*- coding: utf-8 -*-

import csv

import os

from sklearn import preprocessing

from sklearn.feature_extraction import DictVectorizer

from sklearn import tree

dataDir = os.path.dirname(__file__)

#载入数据并分割

allElectroncsData = open(dataDir+"/data/red.csv","r")

reader = csv.reader(allElectroncsData)

num =0

headers = []

for row in reader:

    headers = row

    if num == 0:

        break

print(headers)

featureList = []

labelList = []

for row in reader:

    labelList.append(row[-1])

    rowDict={}

    for i in range(1 , len(row)-1):

        rowDict[headers[i]] = row[i]

    featureList.append(rowDict)

print(labelList)

for feature in featureList:

    print(feature)

#vectordic，向量化

vec = DictVectorizer()

dummyX = vec.fit_transform(featureList).toarray()

print(dummyX)

print(vec.get_feature_names())

#vectorize calss labels

lb = preprocessing.LabelBinarizer()

dummyY = lb.fit_transform(labelList)

print("dummyY:"+str(dummyY))

#using decision tree for classfication

clf = tree.DecisionTreeClassifier(criterion='entropy')##度量标准为entropy信息熵

clf = clf.fit(dummyX,dummyY)

print("clf"+str(clf))

#viuslize model，可视化

# with open("allEectronicInformationGainorc.dot", 'w') as f:

#     f = tree.export_graphviz(clf, feature_names=vec.get_feature_names(), out_file=f)

#

# with open("hello.dot", "w") as f1:

#     f1 = tree.export_graphviz(clf, feature_names=vec.get_feature_names(), out_file=f1)

#predic 预测

oneRowX = dummyX[0,:]

print("oneRowX:"+str(oneRowX))

newRowX = oneRowX

newRowX[0] =1

newRowX[2] =0

print("newRowX: "+str(newRowX))

predictedY = clf.predict(newRowX)

print("predictY: "+str(predictedY))

scikit-learn决策树的python实现以及作图的更多相关文章

Scikit Learn: 在python中机器学习
转自:http://my.oschina.net/u/175377/blog/84420#OSC_h2_23 Scikit Learn: 在python中机器学习 Warning 警告:有些没能理解的 ...
scikit learn 模块调参 pipeline+girdsearch 数据举例：文档分类（python代码）
scikit learn 模块调参 pipeline+girdsearch 数据举例:文档分类数据集 fetch_20newsgroups #-*- coding: UTF-8 -*- import ...
Scikit Learn
Scikit Learn Scikit-Learn简称sklearn,基于 Python 语言的,简单高效的数据挖掘和数据分析工具,建立在 NumPy,SciPy 和 matplotlib 上.
(原创)（三）机器学习笔记之Scikit Learn的线性回归模型初探
一.Scikit Learn中使用estimator三部曲 1. 构造estimator 2. 训练模型:fit 3. 利用模型进行预测:predict 二.模型评价模型训练好后,度量模型拟合效果的 ...
(原创)（四）机器学习笔记之Scikit Learn的Logistic回归初探
目录 5.3 使用LogisticRegressionCV进行正则化的 Logistic Regression 参数调优一.Scikit Learn中有关logistics回归函数的介绍 1. 交叉 ...
用python的turtle作图（二）动画吃豆人
本文是用python的turtle作图的第二篇,通过这个例子可以了解动画的原理,用python自带的turtle库制作一些小动画. 1.问题描述在上一篇"用python的turtle作图( ...
Python第三方库（模块）"scikit learn"以及其他库的安装
scikit-learn是一个用于机器学习的 Python 模块. 其主页:http://scikit-learn.org/stable/. GitHub地址: https://github.com/ ...
Query意图分析：记一次完整的机器学习过程（scikit learn library学习笔记）
所谓学习问题,是指观察由n个样本组成的集合,并根据这些数据来预测未知数据的性质. 学习任务(一个二分类问题): 区分一个普通的互联网检索Query是否具有某个垂直领域的意图.假设现在有一个O2O领域的 ...
决策树及其python实现
剪枝由于悲观错误剪枝 PEP (Pessimistic Error Pruning).代价-复杂度剪枝 CCP (Cost-Complexity Pruning).基于错误剪枝 EBP (Error ...

随机推荐

python学习之老男孩python全栈第九期_day016作业
1. 请利用filter()过滤出1~100中平方根是整数的数,即结果应该是: [1, 4, 9, 16, 25, 36, 49, 64, 81, 100] import math def func( ...
asp.ne如何使用javascript去验证客户端信息，如果验证成功则送往服务器端处理，否则在客户端提示用户（不返回到服务器端处理）
一.问题在网站一般都有很多地方需要用户去填写一些信息,然后用户点击提交,将信息送往后台储存到数据库中.在这一个过程我以前做法直接在button的click事件中来判断用户输入的数据是否完整和合法,虽 ...
Yii 时间戳格式化显示的问题
这个控件是CJuiDatePicker控件的扩展,支持时分秒. 下载地址:http://www.yiiframework.com/extension/timepicker/ 这个控件用在view里的_ ...
css/jq--弹窗写法介绍，jq插件介绍
//html文件 <!DOCTYPE html> <html lang="en"> <head> <meta charset=" ...
oracle 删除表的几种方法及回收站
1.删除表结构和表数据 drop table 表名 [purge] purge表示不放入回收站 2.删除表数据 delete from 表名 [where ...] 特点:高水位线不降:记录日志,速 ...
node环境和浏览器的区别
一.全局环境下this的指向在node中this指向global而在浏览器中this指向window,这就是为什么underscore中一上来就定义了一 root: 1 var root = typ ...
Jenkins操作，实现增删改查
Jenkins的版本是:Jenkins2.138.1 实现的操作接口: using System; using System.Collections.Generic; namespace iHRPub ...
避免重复插入数据sql server
insert into TN_JOBS(JAVA_ID,SERVER_IP,SERVER_PORT,JOB_CODE,JOB_NAME,JOB_START_TIME,JOB_MSG,JOB_STATU ...
REST Framework 的用户认证组件
用户认证流程: 我们要知道这个流程是怎么走的? 认证之后做的什么? 怎么认证?这三个条件认证流程:就是使用BaseAuthentication这个模块来做认证,判断你登陆成功传递过来的随机字符串是否 ...
ZT CSDN 如何以最快的速度计算出一个二进制数中1的个数？ [
一道算法面试题:如何以最快的速度计算出一个二进制数中1的个数? [问题点数:10分,结帖人weicai_chen] 收藏 weicai_chen weicai_chen 等级: 结帖率:95.12% ...

scikit-learn决策树的python实现以及作图

decsion tree（决策树）

ID3

决策树的优点缺点

决策树程序

scikit-learn决策树的python实现以及作图的更多相关文章

随机推荐

热门专题