<数据挖掘导论>读书笔记3--分类

1.分类的基本概念

分类任务就是通过学习得到一个目标函数f，把每个属性集x映射到一个预先定义的类标号y

目标函数也称为分类模型。

2. 解决分类问题的一般方法：

决策树分类法

基于规则的分类法

神经网络

支持向量机

朴素贝叶斯分类法

3.决策树归纳

通常采用贪心策略，在选择划分数据的属性时，采用一系列局部最优决策来构造决策树，hunt算法就是一种这样的算法。

Hunt算法是许多决策树算法的基础，包括ID3,C4.5，CART等

决策树归纳的设计问题

如何分裂训练记录？选择最佳划分的度量，增益是一种可以用来确定划分效果的标准。信息增益--信息熵的差

如何停止分裂过程

4.模型的过分拟合

分类模型的误差大致分为两种：训练误差和泛化误差。

训练误差也称为再代入误差或表现误差，是在训练记录上误分类样本比例

泛化误差是模型在未知记录上的期望误差

模型拟合不足：当决策树很少时，训练和检验误差都很大。出现拟合不足的原因是模型尚未学习到数据的真实结构，因此模型在训练集和检验集上的性能都很差。

模型过分拟合：随着决策树中节点数的增加，模型的训练误差和检验误差都随之降低，然而，一旦树的规模变的很大，即使训练误差还在继续降低，但是检验误差开始增大。

造成模型过分拟合的因素

噪声导致的过分拟合

缺乏代表性样本导致的过分拟合

泛化误差估计

使用再代入估计

结合模型复杂度：欧卡姆剃刀

估计统计上界

使用确认集

5.评估分类器的性能

保持方法

随机二次抽样

交叉验证

自助法bootstrap

6.比较分类器的方法

估计准确度的置信区间

比较两个模型的性能

比较两种分类法的性能

<数据挖掘导论>读书笔记3--分类的更多相关文章

<数据挖掘导论>读书笔记4--其他分类技术
1.基于规则的分类器 2.最近邻分类器 3.贝叶斯分类器 4.人工神经网络 5.支持向量机 6.组合方法 7.不平衡类问题 8.多类问题
<数据挖掘导论>读书笔记7 Apriori算法
Apriori算法是一种最有影响的挖掘布尔关联规则频繁项集的算法.其核心是基于两阶段频集思想的递推算法.该关联规则在分类上属于单维.单层.布尔关联规则.在这里,所有支持度大于最小支持度的项集称为频繁项 ...
<数据挖掘导论>读书笔记2
1.频率和众数 frequency(vi)=具有属性值vi的对象数/m 分类属性的众数mode是具有最高频率的值. 2.百分位数 3.位置度量:均值和中位数 4.散布度量:极差和方差绝对平均偏差 A ...
<数据挖掘导论>读书笔记1
数据预处理: 1.聚集:将两个或者多个对象合并成单个对象. 2.抽样:一种选择数据对象子集进行分析的常用方法.抽象方法:简单随机抽样和渐进抽样 3.维度约:我觉得翻译的不好,英文明细是降维.降维技术 ...
<数据挖掘导论>读书笔记11异常检测
异常检测的目标是发现与大部分其他对象不同的对象.通常,异常对象被称作离群点(Outlier). 异常检测也称偏差检测(Deviation detection),因为异常对象的属性值明显偏离期望的或者常 ...
<数据挖掘导论>读书笔记10聚类分析续
基于原型的聚类模糊c均值使用模糊逻辑和模糊集合论的概念,提出一种聚类方案,它很像K均值,但是不需要硬性地将对象分派到一个簇中.模糊c均值算法有时也称为FCM 混合模型聚类采取这样的访谈,簇集合可以用 ...
<数据挖掘导论>读书笔记9聚类分析
1. 聚类分析仅根据在数据中发现的描述对象及其关系的信息,将数据对象分组. 其目标是组内的对象相互之间是相似的或者相关的,而不同组中的对象是不同的或者不相关的. 2.聚类分析的重要技术 K均值:K均值 ...
<数据挖掘导论>读书笔记8FP树
1FP树
<数据挖掘导论>读书笔记6关联分析的高级概念
处理联系属性: 基于离散化的方法基于统计学的方法非离散化方法处理概念分层定义在一个特定领域的各种实体或者概念的多层组织.概念分层可以用有向无环图DAG来标示. 序列模式可选计数方案 COBJ ...

随机推荐

HBase介绍 (1)---数据模型
http://blog.csdn.net/heyutao007/article/details/5766896 BigTable是什么?Google的Paper对其作了充分的说明.字面上看就是一张大表 ...
启动类加注解@MapperScan spring boot mybatis 启动错误
Description: Field userDao in com.gcy.springsecuritydemo.service.user.UserService required a bean of ...
ES6—— 变量的结构赋值
变量的结构赋值.基本概念: 本质上就是一中匹配模式,只要等号两边的模式相同,那么左边的变量就可以被赋予对应的值: 1.数组的结构赋值. 2.对象的结构赋值. 3.基本类型的结构赋值. let [a,b ...
【Selenium专题】WebDriver启动Chrome浏览器（一）
selenium操作chrome浏览器需要有ChromeDriver驱动来协助.一.什么是ChromeDriver?ChromeDriver是Chromium team开发维护的,它是实现WebDri ...
【Apache系列】Windows下作为应用程序运行Apache
步骤一 Cmd打开命令行窗口,切换到apache安装目录下 cd C:\MAS\TRSMAS\win31\apache\bin 步骤二安装apache服务器 installed Apache se ...
[ActionScript 3.0] 绘制扇形方法
/** * 绘制扇形 * @param mc 承载扇形的对象 * @param x 圆心角x * @param y 圆心角y * @param r 半径 * @param angle 绘制角度 * @ ...
Nginx+Apache动静分离
Nginx的静态处理能力很强,但是动态处理能力不足,因此,在企业中常用动静分离技术.动静分离技术其实是采用代理的方式,在server{}段中加入带正则匹配的location来指定匹配项针对PHP的动 ...
UITableView定制左滑效果
UITableViewRowAction类 object defines a single action to present when the user swipes horizontally in ...
重载<<运算符第二个参数必须加上const
如题,在重载<<时不停的报错,说找不到匹配的函数,仔细观察和书上的样例对比后发现,我的第二个参数缺少了一个const,抱着试一试的心态,因为平时也没注意const这个东西,也不经常用,试了 ...
c语言-猜生日算法
#include<stdio.h>int main(){ int a1[6]={1,3,5,7,9,11}; int a2[6]={2,3,6,7,10,11}; int a3[6]={4 ...

<数据挖掘导论>读书笔记3--分类

<数据挖掘导论>读书笔记3--分类的更多相关文章

随机推荐

热门专题