决策树ID3算法的java实现(基本试用所有的ID3)

已知：流感训练数据集，预定义两个类别；

求：用ID3算法建立流感的属性描述决策树

流感训练数据集

No.	头痛	肌肉痛	体温	患流感
1	是(1)	是(1)	正常(0)	否(0)
2	是(1)	是(1)	高(1)	是(1)
3	是(1)	是(1)	很高(2)	是(1)
4	否(0)	是(1)	正常(0)	否(0)
5	否(0)	否(0)	高(1)	否(0)
6	否(0)	是(1)	很高(2)	是(1)
7	是(1)	否(0)	高(1)	是(1)

原理分析：

在决策树的每一个非叶子结点划分之前，先计算每一个属性所带来的信息增益，选择最大信息增益的属性来划分，因为信息增益越大，区分样本的能力就越强，越具有代表性其中。

信息熵计算：

信息增益：

计算的结果（草稿上的字丑别喷）：

--------------------------------------------------------------------------------------------------------------------------------------------

*************************************************************************************************************

************************实现*********************************************

package ID3Tree;

import java.util.Comparator;;

@SuppressWarnings("rawtypes")

public class Comparisons implements Comparator

{

    public int compare(Object a, Object b) throws ClassCastException{

        String str1 = (String)a;

        String str2 = (String)b;

        return str1.compareTo(str2);

    }

}

package ID3Tree;

public class Entropy {

    //信息熵

    public static double getEntropy(int x, int total)

    {

        if (x == 0)

        {

            return 0;

        }

        double x_pi = getShang(x,total);

        return -(x_pi*Logs(x_pi));

    }

    public static double Logs(double y)

    {

        return Math.log(y) / Math.log(2);

    }

    public static double getShang(int x, int total)

    {

        return x * Double.parseDouble("1.0") / total;

    }

}

package ID3Tree;

public class TreeNode {

    //父节点

    TreeNode parent;

    //指向父节点的属性

    String parentAttribute;

    String nodeName;

    String[] attributes;

    TreeNode[] childNodes;

}

package ID3Tree;

import java.util.*;

public class UtilID3 {

    TreeNode root;

    private boolean[] flag;

    //训练集

    private Object[] trainArrays;

    //节点索引

    private int nodeIndex;

    public static void main(String[] args)

    {

        //初始化训练集数组

        Object[] arrays = new Object[]{

                new String[]{"是","是","正常","否"},

                new String[]{"是","是","高","是"},

                new String[]{"是","是","很高","是"},

                new String[]{"否","是","正常","否"},

                new String[]{"否","否","高","否"},

                new String[]{"否","是","很高","是"},

                new String[]{"是","否","高","是"}};

        UtilID3 ID3Tree = new UtilID3();

        ID3Tree.create(arrays, 3);

    }

    //创建

    public void create(Object[] arrays, int index)

    {

        this.trainArrays = arrays;

        initial(arrays, index);

        createDTree(arrays);

        printDTree(root);

    }

    //初始化

    public void initial(Object[] dataArray, int index)

    {

        this.nodeIndex = index;

        //数据初始化

        this.flag = new boolean[((String[])dataArray[0]).length];

        for (int i = 0; i<this.flag.length; i++)

        {

            if (i == index)

            {

                this.flag[i] = true;

            }

            else

            {

                this.flag[i] = false;

            }

        }

    }

    //创建决策树

    public void createDTree(Object[] arrays)

    {

        Object[] ob = getMaxGain(arrays);

        if (this.root == null)

        {

            this.root = new TreeNode();

            root.parent = null;

            root.parentAttribute = null;

            root.attributes = getAttributes(((Integer)ob[1]).intValue());

            root.nodeName = getNodeName(((Integer)ob[1]).intValue());

            root.childNodes = new TreeNode[root.attributes.length];

            insert(arrays, root);

        }

    }

    //插入决策树

    public void insert(Object[] arrays, TreeNode parentNode)

    {

        String[] attributes = parentNode.attributes;

        for (int i = 0; i < attributes.length; i++)

        {

            Object[] Arrays = pickUpAndCreateArray(arrays, attributes[i],getNodeIndex(parentNode.nodeName));

            Object[] info = getMaxGain(Arrays);

            double gain = ((Double)info[0]).doubleValue();

            if (gain != 0)

            {

                int index = ((Integer)info[1]).intValue();

                TreeNode currentNode = new TreeNode();

                currentNode.parent = parentNode;

                currentNode.parentAttribute = attributes[i];

                currentNode.attributes = getAttributes(index);

                currentNode.nodeName = getNodeName(index);

                currentNode.childNodes = new TreeNode[currentNode.attributes.length];

                parentNode.childNodes[i] = currentNode;

                insert(Arrays, currentNode);

            }

            else

            {

                TreeNode leafNode = new TreeNode();

                leafNode.parent = parentNode;

                leafNode.parentAttribute = attributes[i];

                leafNode.attributes = new String[0];

                leafNode.nodeName = getLeafNodeName(Arrays);

                leafNode.childNodes = new TreeNode[0];

                parentNode.childNodes[i] = leafNode;

            }

        }

    }

    //输出

    public void printDTree(TreeNode node)

    {

        System.out.println(node.nodeName);

        TreeNode[] childs = node.childNodes;

        for (int i = 0; i < childs.length; i++)

        {

            if (childs[i] != null)

            {

                System.out.println("如果："+childs[i].parentAttribute);

                printDTree(childs[i]);

            }

        }

    }

    //剪取数组

    public Object[] pickUpAndCreateArray(Object[] arrays, String attribute, int index)

    {

        List<String[]> list = new ArrayList<String[]>();

        for (int i = 0; i < arrays.length; i++)

        {

            String[] strs = (String[])arrays[i];

            if (strs[index].equals(attribute))

            {

                list.add(strs);

            }

        }

        return list.toArray();

    }

    //取得节点名

    public String getNodeName(int index)

    {

        String[] strs = new String[]{"头痛","肌肉痛","体温","患流感"};

        for (int i = 0; i < strs.length; i++)

        {

            if (i == index)

            {

                return strs[i];

            }

        }

        return null;

    }

    //取得叶子节点名

    public String getLeafNodeName(Object[] arrays)

    {

        if (arrays != null && arrays.length > 0)

        {

            String[] strs = (String[])arrays[0];

            return strs[nodeIndex];

        }

        return null;

    }

    //取得节点索引

    public int getNodeIndex(String name)

    {

        String[] strs = new String[]{"头痛","肌肉痛","体温","患流感"};

        for (int i = 0; i < strs.length; i++)

        {

            if (name.equals(strs[i]))

            {

                return i;

            }

        }

        return -1;

    }

    //得到最大信息增益

    public Object[] getMaxGain(Object[] arrays)

    {

        Object[] result = new Object[2];

        double gain = 0;

        int index = -1;

        for (int i = 0; i<this.flag.length; i++)

        {

            if (!this.flag[i])

            {

                double value = gain(arrays, i);

                if (gain < value)

                {

                    gain = value;

                    index = i;

                }

            }

        }

        result[0] = gain;

        result[1] = index;

        if (index != -1)

        {

            this.flag[index] = true;

        }

        return result;

    }

    //取得属性数组

    public String[] getAttributes(int index)

    {

        @SuppressWarnings("unchecked")

        TreeSet<String> set = new TreeSet<String>(new Comparisons());

        for (int i = 0; i<this.trainArrays.length; i++)

        {

            String[] strs = (String[])this.trainArrays[i];

            set.add(strs[index]);

        }

        String[] result = new String[set.size()];

        return set.toArray(result);

    }

    //计算信息增益

    public double gain(Object[] arrays, int index)

    {

        String[] playBalls = getAttributes(this.nodeIndex);

        int[] counts = new int[playBalls.length];

        for (int i = 0; i<counts.length; i++)

        {

            counts[i] = 0;

        }

        for (int i = 0; i<arrays.length; i++)

        {

            String[] strs = (String[])arrays[i];

            for (int j = 0; j<playBalls.length; j++)

            {

                if (strs[this.nodeIndex].equals(playBalls[j]))

                {

                    counts[j]++;

                }

            }

        }

        double entropyS = 0;

        for (int i = 0;i <counts.length; i++)

        {

            entropyS = entropyS + Entropy.getEntropy(counts[i], arrays.length);

        }

        String[] attributes = getAttributes(index);

        double total = 0;

        for (int i = 0; i<attributes.length; i++)

        {

            total = total + entropy(arrays, index, attributes[i], arrays.length);

        }

        return entropyS - total;

    }

    public double entropy(Object[] arrays, int index, String attribute, int totals)

    {

        String[] playBalls = getAttributes(this.nodeIndex);

        int[] counts = new int[playBalls.length];

        for (int i = 0; i < counts.length; i++)

        {

            counts[i] = 0;

        }

        for (int i = 0; i < arrays.length; i++)

        {

            String[] strs = (String[])arrays[i];

            if (strs[index].equals(attribute))

            {

                for (int k = 0; k<playBalls.length; k++)

                {

                    if (strs[this.nodeIndex].equals(playBalls[k]))

                    {

                        counts[k]++;

                    }

                }

            }

        }

        int total = 0;

        double entropy = 0;

        for (int i = 0; i < counts.length; i++)

        {

            total = total +counts[i];

        }

        for (int i = 0; i < counts.length; i++)

        {

            entropy = entropy + Entropy.getEntropy(counts[i], total);

        }

        return Entropy.getShang(total, totals)*entropy;

    }

}

决策树ID3算法的java实现(基本试用所有的ID3)的更多相关文章

决策树ID3算法的java实现(基本适用所有的ID3)
已知:流感训练数据集,预定义两个类别: 求:用ID3算法建立流感的属性描述决策树流感训练数据集 No. 头痛肌肉痛体温患流感 1 是(1) 是(1) 正常(0) 否(0) 2 是(1) 是(1 ...
决策树ID3算法的java实现
决策树的分类过程和人的决策过程比较相似,就是先挑“权重”最大的那个考虑,然后再往下细分.比如你去看医生,症状是流鼻涕,咳嗽等,那么医生就会根据你的流鼻涕这个权重最大的症状先认为你是感冒,接着再根据你咳 ...
ID3算法（Java实现）
数据存储文件:buycomputer.properties #数据个数 datanum=14 #属性及属性值 nodeAndAttribute=年龄:青/中/老,收入:高/中/低,学生:是/否,信誉: ...
ID3算法（2）
今天,我来讲解的是决策树.对于决策树来说,主要有两种算法:ID3算法和C4.5算法.C4.5算法是对ID3算法的改进.今天主要先讲ID3算法,之后会讲C4.5算法和随机森林等. Contents ...
ID3算法Java实现
ID3算法java实现 1 ID3算法概述 1.1 信息熵熵是无序性(或不确定性)的度量指标.假如事件A的全概率划分是(A1,A2,...,An),每部分发生的概率是(p1,p2,...,pn).那 ...
数据挖掘之决策树ID3算法（C#实现）
决策树是一种非常经典的分类器,它的作用原理有点类似于我们玩的猜谜游戏.比如猜一个动物: 问:这个动物是陆生动物吗? 答:是的. 问:这个动物有鳃吗? 答:没有. 这样的两个问题顺序就有些颠倒,因为一般 ...
决策树 -- ID3算法小结
ID3算法(Iterative Dichotomiser 3 迭代二叉树3代),是一个由Ross Quinlan发明的用于决策树的算法:简单理论是越是小型的决策树越优于大的决策树. 算法归 ...
决策树-预测隐形眼镜类型（ID3算法，C4.5算法，CART算法，GINI指数,剪枝，随机森林）
1. 1.问题的引入 2.一个实例 3.基本概念 4.ID3 5.C4.5 6.CART 7.随机森林 2. 我们应该设计什么的算法,使得计算机对贷款申请人员的申请信息自动进行分类,以决定能否贷款? ...
决策树笔记：使用ID3算法
决策树笔记:使用ID3算法决策树笔记:使用ID3算法机器学习先说一个偶然的想法:同样的一堆节点构成的二叉树,平衡树和非平衡树的区别,可以认为是"是否按照重要度逐渐降低"的顺序 ...

随机推荐

关于font-family
在设置页面字体的时候,你会发现在 font-family 属性中会设置好多个字体,想看懂它们都是什么字体吗?不好意思,我不是搞设计的,我也不知道.那么,现在写的东西,只是对于一个前端人员来说,要了解的 ...
[干货来袭]MSSQL Server on Linux预览版安装教程(先帮大家踩坑)
前言昨天晚上微软爸爸开了全国开发者大会,会上的内容,我就不多说了,园子里面很多.. 我们唐总裁在今年曾今透漏过SQL Server love Linux,果不其然,这次开发者大会上就推出了MSSQL ...
一行代码实现java list去重
1.不带类型写法: 1 List listWithoutDup = new ArrayList(new HashSet(listWithDup)); 2.带类型写法(以String类型为例):1)Ja ...
SSH框架和Redis的整合(2)
5. 添加功能的实现新建一个Action:RClasAction,实现向Redis添加课程数据,并同步到MySQL. package com.school.action; import java.u ...
【SAP业务模式】之ICS（五）：定价配置
本篇博文讲述ICS业务中的定价配置. 1.定义销售订单类型目录:SPRO-销售与分销-销售-销售凭证-销售凭证抬头-定义销售凭证类型事务代码:VOV8 2.定义销售订单类型目录:SPRO-销售与 ...
docker4dotnet #1 – 前世今生 & 世界你好
作为一名.NET Developer,这几年看着docker的流行实在是有些眼馋.可惜的是,Docker是基于Linux环境的,眼瞧着那些 java, python, node.js, go 甚至连p ...
分享一个MySQL分库分表备份脚本（原）
分享一个MySQL分库备份脚本(原) 开发思路: 1.路径:规定备份到什么位置,把路径(先判断是否存在,不存在创建一个目录)先定义好,我的路径:/mysql/backup,每个备份用压缩提升效率,带上 ...
曲演杂坛--蛋疼的ROW_NUMBER函数
使用ROW_NUMBER来分页几乎是家喻户晓的东东了,而且这东西简单易用,简直就是程序员居家必备之杀器,然而ROW_NUMBER也不是一招吃遍天下鲜的无敌BUG般存在,最近就遇到几个小问题,拿出来供大 ...
使用Metrics监控应用程序的性能
在编写应用程序的时候,通常会记录日志以便事后分析,在很多情况下是产生了问题之后,再去查看日志,是一种事后的静态分析.在很多时候,我们可能需要了解整个系统在当前,或者某一时刻运行的情况,比如当前系统中对 ...
一缕阳光：DDD（领域驱动设计）应对具体业务场景，如何聚焦 Domain Model（领域模型）？
写在前面阅读目录: 问题根源是什么? <领域驱动设计-软件核心复杂性应对之道>分层概念 Repository(仓储)职责所在? Domain Model(领域模型)重新设计 Domain ...