python_机器学习_监督学习模型

决策树模型练习：https://www.kaggle.com/c/GiveMeSomeCredit/overview

1. 监督学习--分类

机器学习肿分类和预测算法的评估：

　　a. 准确率

　　b.速度

　　c. 强壮行

　　d.可规模性

　　e. 可解释性

2. 什么是决策树/判定树（decision tree）？

https://scikit-learn.org/stable/modules/tree.html

3. 熵（entropy）概念：

变量的不确定越大，熵也就越大。

4. 决策树归纳算法（ID3）

5. 其他算法及优缺点

6. 决策树的应用

生成后的决策树

逻辑代码：

整理好的代码 --》

python3.6.3

Successfully installed joblib-0.13.2 numpy-1.16.4 scikit-learn-0.21.2 scipy-1.3.0

# -*- coding:utf-8 -*-

from sklearn.feature_extraction import DictVectorizer

import csv

from sklearn import preprocessing

from sklearn import tree  # 要求是数值型的值

from sklearn.externals.six import StringIO

import pandas as pd

"""

注意： 决策树要求要数值型的值，不能是字符串类型的值

例如： no， yes这样的值是不允许的

需要转换成矩阵

====================================

age            income    student

youth        high    no

youth        high    no

middle_aged    high    no

senior        medium    no

senior        low    yes

====================================

比如上面这种数据：

youth    middle_aged        senior         high    medium    low    ......

1        0                0            1        0        0

1        0                0            1        0        0

.....

"""

fileName = r"C:\Users\Administrator\Desktop\data.xlsx"

data = pd.read_excel(fileName)

# 删除id序列

del data["RID"]

# headers

headers = data.columns.values

# print(headers)

# ["RID", 'age'.....]

# 样本量

# print(len(data))

# dict格式化单个样本

# print(dict(data.ix[1]))

# 单个样本最后一个数据

# print(data.ix[1][-1])

featureList = []

labelList = []

for row in range(len(data)):

    rowData = data.ix[row]

    labelList.append(rowData[-1])

    featureList.append(dict(rowData))

# print(featureList)

# [

#    {"credit_rating": "fair", "age": "youth"},

#    .... #作用，方便转换成矩阵。将数据转换成对象

# ]

# print(labelList)

# ['no', 'no', 'yes', 'yes', 'yes', 'no', 'yes', 'no', 'yes', 'yes', 'yes', 'yes', 'yes', 'no']

# =========<格式化数据，转换成decision tree需要的格式模型>============

vec = DictVectorizer()

dummyX = vec.fit_transform(featureList).toarray()

print("dummyX:" + str(dummyX))  # 转换成矩阵的数据了二维

print(vec.get_feature_names())

print("labelList: " + str(labelList))

lb = preprocessing.LabelBinarizer()

dummyY = lb.fit_transform(labelList)

print("dummyY: " + str(dummyY))

# ===========《决策树建模分析》=============

clf = tree.DecisionTreeClassifier(criterion="entropy")

clf = clf.fit(dummyX, dummyY)

print("clf: ", str(clf))

# # 存储决策树信息

# # Graphviz 将dot转换成pdf的命令： dot -T pdf iris.dot -o output.pdf

# # 可以查看decision tree 的形状了（看pdf的值）

# with open(r"C:\Users\Administrator\Desktop\code\mechine_learning\allElectronicInformationGainOri.dot", "w") as f:

#     f = tree.export_graphviz(clf, feature_names = vec.get_feature_names(), out_file = f)

# # 下面的代码属于预测的代码

# # 属于转化后的矩阵数值，其实就是进行复制修改

oneRowX = dummyX[2, :]

print("oneRowX: " + str(oneRowX))

newRowX = oneRowX

# newRowX[0] = 1

# newRowX[2] = 1

print("newRowX: ", str(newRowX))

predictedY = clf.predict([newRowX])

# 预测 class_buys_labels的值

print("predictedY: " + str(predictedY))

但这段代码不是特别通用，而且有bug，需要修改，但基本逻辑是正确的

# -*- coding:utf-8 -*-

from sklearn.feature_extraction import DictVectorizer

import csv

from sklearn import preprocessing

from sklearn import tree  # 要求是数值型的值

from sklearn.externals.six import StringIO

"""

注意： 决策树要求要数值型的值，不能是字符串类型的值

例如： no， yes这样的值是不允许的

需要转换成矩阵

====================================

age            income    student

youth        high    no

youth        high    no

middle_aged    high    no

senior        medium    no

senior        low    yes

====================================

比如上面这种数据：

youth    middle_aged        senior         high    medium    low    ......

1        0                0            1        0        0

1        0                0            1        0        0

.....

"""

allElectronicsData = open(r"C:\Users\Administrator\Desktop\data.xlsx", 'r')

reader = csv.reader(allElectronicsData)

print(reader)

headers = next(reader)

print(headers)

# ["RID", 'age'.....]

featureList = []

labelList = []

for row in reader:

    labelList.append(row[len(row) - 1])

    rowDict = {}

    for i in range(1, len(row) - 1):

        rowDict[headers[i]] = row[i]

    featureList.append(rowDict)

print(featureList)

# [

#    {"credit_rating": "fair", "age": "youth"},

#    .... #作用，方便转换成矩阵。将数据转换成对象

# ]

vec = DictVectorizer()

dummyX = vec.fit_transform(featureList).toarray()

print("dummyX:" + str(dummyX))  # 转换成矩阵的数据了二维

print(vec.get_feature_names())

print("labelList: " + str(labelList))

lb = preprocessing.LabelBinarizer()

dummyY = lb.fit_transform(labelList)

print("dummyY: " + str(dummyY))

clf = tree.DecisionTreeClassifier(criterion="entropy")

clf = clf.fit(dummyX, dummyY)

print("clf: ", str(clf))

# 存储决策树信息

# Graphviz 将dot转换成pdf的命令： dot -T pdf iris.dot -o output.pdf

# 可以查看decision tree 的形状了（看pdf的值）

with open(r"C:\Users\Administrator\Desktop\code\mechine_learning\allElectronicInformationGainOri.dot", "w") as f:

    f = tree.export_graphviz(clf, feature_names = vec.get_feature_names(), out_file = f)

# 下面的代码属于预测的代码

# 属于转化后的矩阵数值，其实就是进行复制修改

oneRowX = dummyX[0, :]

print("oneRowX: " + str(oneRowX))

newRowX = oneRowX

newRowX[0] = 1

newRowX[2] = 0

print("newRowX: ", str(newRowX))

predictedY = clf.predicted(newRowX)

# 预测 class_buys_labels的值

predicted("predictedY: " + str(predictedY))

if __name__ == '__main__':

    main()

python_机器学习_监督学习模型_决策树的更多相关文章

[并发并行]_[线程模型]_[Pthread线程使用模型之三客户端/服务端模型(Client/Server]
Pthread线程使用模型之三客户端/服务端模型(Client/Server) 场景 1.在客户端/服务端模型时,客户端向服务端请求一些数据集的操作. 服务端执行执行操作独立的(多进程或跨网络)– ...
[并发并行]_[线程模型]_[Pthread线程使用模型之二工作组work crew]
Pthread线程使用模型之二工作组(Work crew) 场景 1.一些耗时的任务,比如分析多个类型的数据, 是独立的任务, 并不像 pipeline那样有序的依赖关系, 这时候pipeline就显 ...
[并发并行]_[线程模型]_[Pthread线程使用模型之一管道Pipeline]
场景 1.经常在Windows, MacOSX 开发C多线程程序的时候, 经常需要和线程打交道, 如果开发人员的数量不多时, 同时掌握Win32和pthread线程并不是容易的事情, 而且使用Win ...
Java_太阳系_行星模型_小游戏练习_详细注释
//实现MyFrame--实现绘制窗口,和实现重写重画窗口线程类 package cn.xiaocangtian.Test; import java.awt.Frame; import java.a ...
网络_OSI模型_数据包传输
2017年1月12日, 星期四网络_OSI模型_数据包传输 1. 网络_源主机_局域网_交换机_路由器_目标主机 2. OSI7七层_TCP/IP精简 OSI 7层: 应用层 ...
（转）看穿机器学习（W-GAN模型）的黑箱
本文转自:http://www.360doc.com/content/17/0212/11/35919193_628410589.shtml# 看穿机器学习(W-GAN模型)的黑箱 201 ...
Spark机器学习6·聚类模型(spark-shell)
K-均值(K-mean)聚类目的:最小化所有类簇中的方差之和类簇内方差和(WCSS,within cluster sum of squared errors) fuzzy K-means 层次聚类 ...
spark机器学习从0到1决策树(六）
一.概念决策树及其集合是分类和回归的机器学习任务的流行方法. 决策树被广泛使用,因为它们易于解释,处理分类特征,扩展到多类分类设置,不需要特征缩放,并且能够捕获非线性和特征交互. 诸如随机森林和 ...
Python 机器学习实战 —— 监督学习（上）
前言近年来AI人工智能成为社会发展趋势,在IT行业引起一波热潮,有关机器学习.深度学习.神经网络等文章多不胜数.从智能家居.自动驾驶.无人机.智能机器人到人造卫星.安防军备,无论是国家级军事设备还是 ...

随机推荐

STM32HAL快速上手
STM32HAL快速上手资料下载如果在下面的网站中没有账户,建议用edu邮箱创建账户. STMicroeletronic 意法半导体官网首页 - STMicroelectronics 意法半导体 ...
ts开发环境搭建
ts为typescript的缩写,是javascript的超集. npm源改为国内由于 Node 的官方模块仓库网速太慢,模块仓库需要切换到阿里的源. npm config set registry ...
平方，立方，n次方，上标/下标
选种你需要的上标,如2,右键设置单元格格式:选择上标,确定即可: 最终效果:
JMeter配置数据库连接
在平时接口的测试中,很多时候是需要直接连接数据库,查询对应数据信息的. 我将其中一些内容整理出来,方便以后调阅. 1.首先是配置数据库的连接,也就是JDBC Connection Configurat ...
C++ int 和string互相转化
1.int转换成string );//"-12" );//"12" +);//"1" 2.string转换成int );//"-1 ...
SecureCRT自动断开连接的解决方法
方法一: 在普通用户下,输入重启sshd服务的命令:service sshd restart 这时会提示:管理系统服务或单元需要身份验证.解决的方法:先要切换为root用户,接着重启sshd服务:se ...
CF1207G Indie Album
题目链接 problem 有\(n\)个字符串,对于第\(i\)个字符串通过以下两种方式中的一个给出. \(1\; c\),该字符串只含一个字符\(c\). \(2\ x\ c\),该字符串为第\(x ...
【2019.8.7 慈溪模拟赛 T2】环上随机点（ran）（自然算法）
简单声明我是蒟蒻不会推式子... 所以我用的是乱搞做法... 大自然的选择这里我用的乱搞做法被闪指导赐名为"自然算法",对于这种输入信息很少的概率题一般都很适用. 比如此题,对 ...
Paper | Noise2Noise: Learning Image Restoration without Clean Data
目录故事背景算法原理点估计神经网络算法与点估计的关系核心思想回头品味实验高斯其他生成噪声发表在2018 ICML. 摘要 We apply basic statistical re ...
小明工具箱<Excel 插件><VSTO 插件>
当前版本:1.0.42.7118(更新日期:2019年6月28日) 下载地址:点击下载功能和简介: 本程序为 Excel 2010 版本以上的插件,含以下功能: 拆分工作簿:将一个或多个工作簿中的每 ...

python_机器学习_监督学习模型_决策树