ID3很不错的讲解（matlab程序实现）

1）决策树之ID3

决策树算法是分类算法的一种，基础是ID3算法，C4.5、C5.0都是对ID3的改进。ID3算法的基本思想是，选择信息增益最大的属性作为当前的分类属性。

看Tom M. Mitchell老师的《Machine Learing》第三章中的例子：

我们先解释一下这张表，表中有14条实例数据，就是我们的训练数据，其中 Outlook,Temperature,Humidity ,Wind 称作条件属性，PlayTennis 称作是决策属性(标签)。

每一个属性都有各自的值记做：Value(Outlook)={Sunny,OverCast,Rain}，Value(Temperature)={Hot,Mild,Cool}，Value(Humidity)={High,Normal}，Value(Wind)={Strong,Weak}，Value(PlayTennis)={NO,Yes}。

第一个重要的概念：Entropy。

我们数一下 决策属性PlayTennis，一共有两个类别：Yes，No。Yes的实例数是 9，No的实例数是 5。计算决策属性的Entropy(熵)：，计算结果为：0.940286。

这里的决策属性S的值只有两个值（Yes,No），当然可以有多个值(s1,s2,s3,...,sk)，这些决策属性的值的概率分别为：p1,p2,p3,...,pk所以决策属性的Entroy的计算公式：

第二个重要的概念：information gain（信息增益）

我们只拿Outlook条件属性举例，其他的属性一样：

Value(Outlook)={Sunny,OverCast,Rain}：Outlook是sunny的实例数为5（其中Yes的个数为2，No的个数为3），占总的实例数为5/14，那么针对sunny的Entropy：

Entropy（Sunny）=，计算结果为：0.97095。

Outlook是OverCast的实例数为4（其中Yes的个数为4，No的个数为0），占总的实例数为4/14，那么针对Overcast的Entropy：

，计算结果为：0。

Outlook是Rain的实例数为5（其中Yes的个数为3,No的个数为2），占总的实例数为5/14，那么针对Rain的Entropy，

，计算结果为：0.97095。

那么最后针对Outlook条件属性的information gain为：

，计算结果为：0.24675。

所以针对某一条件属性的information gain为：

那么其他三个条件属性Temperature、Humidity、Wind的信息增益为：

我们看到Outlook的信息增益是最大的，所以作为决策树的一个根节点。即：

然后，从Outlook下面出来三个树枝，最左边的Sunny，我们从Outlook是Sunny的实例数据中，找到信息增益最大的那一个，依次类推。
（注释：http://blog.csdn.net/mmc2015/article/details/42525655；而下面程序本人写的）

clc;

clear all;

close all;

%% 导入数据

%data = [1,1,1;1,1,1;1,0,0;0,1,0;0,1,0];

data = [0,2,0,0,0;

    0,2,0,1,0;

    1,2,0,0,1;

    2,1,0,0,1;

    2,0,1,0,1;

    2,0,1,1,0;

    1,0,1,1,1;

    0,1,0,0,0;

    0,0,1,0,1;

    2,1,1,0,1;

    0,1,1,1,1;

    1,1,0,1,1;

    1,2,1,0,1;

    2,1,0,1,0];

% data = {'sunny','hot','high','week','no';

%              'sunny','hot','high','strong','no';

%              'overcast','hot','high','week','yes';

%              'rain','midd','high','week','yes';

%              'rain','cool','nomal','week','yes';

%              'rain','cool','nomal','strong','no';

%              'overcast','cool','nomal','strong','yes';

%              'sunny','midd','high','week','no';

%              'sunny','cool','nomal','week','yes';

%              'rain','midd','nomal','week','yes';

%              'sunny','midd','nomal','strong','yes';

%              'overcast','midd','high','strong','yes';

%              'overcast','hot','nomal','week','yes';

%              'rain','midd','high','strong','no'};

%sunuy-0,overcast-1,rain-2;--hot-2,midd-1,cool-2---high-0,nomal-1--week-0,strong-1,no-0,yes-1

%% 生成决策树

make_tree(data);

function  make_tree(train_data)

%input                 train_data          训练数据

%output               

[m,n] = size(train_data);

disp('original data');

disp(train_data);

class_list = train_data(:,n);

class_first = 1;

for i = 2:m

   if train_data(i,n) ==  class_list(1,:)

%    if strcmp(train_data(i,n),class_list(1,:))

        class_first = class_first + 1;

    end

end

%% 退出程序条件

if class_first == m || n == 1

    disp('final data');

    disp(train_data);

    return;

end

%% 建立决策树

bestfeat = choose_bestfeat(train_data);

disp(['bestfeature:',num2str(bestfeat)]);

featvalue = unique(train_data(:,bestfeat));

featvalue_num = length(featvalue);

for i = 1:featvalue_num

    make_tree(splitData(train_data,bestfeat,featvalue(i,:)));

    disp('--------------------------------------------');

end

end

function [best_feature] = choose_bestfeat(data)

%input                 data                        输入数据

%output               bestfeature             选择特征值

[m,n] = size(data);

feature_num = n - 1;

baseentropy = calc_entropy(data);

best_gain = 0;

best_feature = 0;

%% 挑选最佳特征位

for j =1:feature_num

    feature_temp = unique(data(:,j));

    num_f = length(feature_temp);

    new_entropy = 0;

    for i = 1:num_f

        subSet = splitData(data, j, feature_temp(i,:));

        [m_s,n_s] = size(subSet);

        prob = m_s./m;

        new_entropy = new_entropy + prob * calc_entropy(subSet);

    end

    inf_gain = baseentropy - new_entropy;

    if inf_gain > best_gain

        best_gain = inf_gain;

        best_feature = j;

    end

end

end

function [entropy] = calc_entropy(train_data)

%input                 train_data          训练数据

%output               entropy             熵值

[m,n] = size(train_data);

%% 得到类的项并统计每个类的个数

label_value = train_data(:,n);

label = unique(label_value);

label_number = zeros(length(label),2);

label_number(:,1) = label';

for i = 1:length(label)

    label_number(i,2) = sum(label_value == label(i));

end

%% 计算熵值

label_number (:,2) = label_number(:,2) ./ m;

entropy = 0;

entropy = sum(-label_number(:,2).*log2 (label_number(:,2)));

end

function [subSet] = splitData(data, j, value)

%input                 data              训练数据

%input                  j                   对应第j个属性

%input                 value             第j个属性对应的特征值

%output               sunset              熵值

subSet = data;

subSet(:,j) = [];

k = 0;

for i = 1:size(data,1)

    if data(i,j) ~= value

        subSet(i-k,:) =[];

        k = k + 1;

    end

end

end

function [subSet] = splitData(data, j, value)

%input                 data              训练数据

%input                  j                   对应第j个属性

%input                 value             第j个属性对应的特征值

%output               sunset              熵值

subSet = data;

subSet(:,j) = [];

k = 0;

for i = 1:size(data,1)

    if data(i,j) ~= value

        subSet(i-k,:) =[];

        k = k + 1;

    end

end

end

ID3很不错的讲解（matlab程序实现）的更多相关文章

SQL注入原理讲解，很不错！
SQL注入原理讲解,很不错! 原文地址:http://www.cnblogs.com/rush/archive/2011/12/31/2309203.html 1.1.1 摘要日前,国内最大的程序员 ...
很幽默的讲解六种Socket IO模型
很幽默的讲解六种Socket IO模型本文简单介绍了当前Windows支持的各种Socket I/O模型,如果你发现其中存在什么错误请务必赐教. 一:select模型二:WSAAsyncSelect ...
很幽默的讲解六种Socket IO模型 Delphi版本（自己Select查看，WM_SOCKET消息通知，WSAEventSelect自动收取，Overlapped I/O 事件通知模型，Overlapped I/O 完成例程模型，IOCP模型机器人）
很幽默的讲解六种Socket IO模型(转)本文简单介绍了当前Windows支持的各种Socket I/O模型,如果你发现其中存在什么错误请务必赐教. 一:select模型二:WSAAsyncSel ...
mean shift聚类算法的MATLAB程序
mean shift聚类算法的MATLAB程序凯鲁嘎吉 - 博客园 http://www.cnblogs.com/kailugaji/ 1. mean shift 简介 mean shift, 写的 ...
【matlab】MATLAB程序调试方法和过程
3.8 MATLAB程序的调试和优化在MATLAB的程序调试过程中,不仅要求程序能够满足设计者的设计需求,而且还要求程序调试能够优化程序的性能,这样使得程序调试有时比程序设计更为复杂.MATLAB ...
一个很不错的bash脚本编写教程
转自 http://blog.chinaunix.net/uid-20328094-id-95121.html 一个很不错的bash脚本编写教程,至少没接触过BASH的也能看懂! 建立一个脚本 Lin ...
不断摸索发现用 andy 模拟器很不错，感觉跟真机差不多
嗯,今天也遇到了模拟的问题.那个慢啊,好几分钟才能开机,加载程序总共差不多十几分钟.当时想如果真做android开发必须换电脑啊.后来不断摸索发现用 andy 模拟器很不错,感觉跟真机差不多. 还是真 ...
GMM算法的matlab程序
GMM算法的matlab程序在“GMM算法的matlab程序(初步)”这篇文章中已经用matlab程序对iris数据库进行简单的实现,下面的程序最终的目的是求准确度. 作者:凯鲁嘎吉 - 博客园 h ...
GMM算法的matlab程序（初步）
GMM算法的matlab程序在https://www.cnblogs.com/kailugaji/p/9648508.html文章中已经介绍了GMM算法,现在用matlab程序实现它. 作者:凯鲁嘎 ...

随机推荐

再也不用担心问RecycleView了——面试真题详解
关于RecycleView,之前我写过一篇比较基础的文章,主要说的是缓存和优化等问题.但是有读者反映问题不够实际和深入.于是,我又去淘了一些关于RecycleView的面试真题,大家一起看看吧,这次的 ...
MarkDown使用之LaTeX表示数学公式
对于文本排版格式,对于\(Microsoft\,Word\)来说,功能尽全,可调的参数十分多,人们可能会将不少的时间放在具体的文字大小.实现样式.而\(markdown\)语法能够让人们通过符号去替代 ...
idea2020安装破解教程
申明:本教程 IntelliJ IDEA 破解补丁.激活码均收集于网络,请勿商用,仅供个人学习使用不花钱的方式 IDEA 2020.2 激活到 2089 年 idea官网下载安装包:https:/ ...
解决linux挖矿病毒（kdevtmpfsi，sysupdate, networkservice）
突然发现公司测试服务器CPU过高,是这两个sysupdate, networkservice进程,很明显是被挖矿了,记录下来以供参考. 病毒会把一些文件给加i锁或a锁,导致无法修改数据,所以某些操作需 ...
C#中的WinForm问题——使用滚动条时页面闪烁及重影问题
当使用鼠标进行滚动查看页面时,由于页面会频繁刷新,如果页面中控件较多会导致页面出现闪烁.重影等问题,如下图所示: 在网上搜索过该问题,大部分都说使用双缓冲可以解决此类问题,即通过设置DoubleBuf ...
SSM之Spring框架--->>墨盒案例
分析: 程序中包括打印机(Printer).墨盒(Ink).和纸张(Paper).三类组件首先创建一个新项目文件Spring_Box 我们来定义墨盒和纸张的接口类墨盒接口Ink.java文件内容如 ...
CSP2020复赛游记
CSP2020复赛游记由于本蒟蒻侥幸通过PJ和TG的分数线并且侥幸的拿了一等,所以侥幸的来参加复赛 11.04~11.05 期中考,挂 11.06 对答案,炸 11.07 开始了第一次CSP复赛坐 ...
第3.2节 Python列表简介
鉴于Python中列表(list)的强大功能,本节及后面至少有一节都是介绍列表相关的知识,本节先介绍基本的列表知识. 一. 列表的定义列表是一种可以修改的序列,它有点类似于c语言中的数组,在Pyth ...
PyQt（Python+Qt）学习随笔：QMainWindow的takeCentralWidget对QDockWidget作用案例图解
专栏:Python基础教程目录专栏:使用PyQt开发图形界面Python应用专栏:PyQt入门学习老猿Python博文目录 QMainWindow的takeCentralWidget方法作用是将 ...
PyCharm中怎么将非当前工程文件的目录的文件加到当前工程中
在PyCharm已经建立工程文件的情况下,如果要将一个其他目录的文件导入到已有的工程中,唯一的方法如下: 通过File->Settings->Project->Project Str ...

ID3很不错的讲解（matlab程序实现）

ID3很不错的讲解（matlab程序实现）的更多相关文章

随机推荐

热门专题