更新、更全的《机器学习》的更新网站，更有python、go、数据结构与算法、爬虫、人工智能教学等着你：https://www.cnblogs.com/nickchen121/p/11686958.html

AdaBoost算法代码(鸢尾花分类)

一、导入模块

import numpy as np

import matplotlib.pyplot as plt

from matplotlib.colors import ListedColormap

from matplotlib.font_manager import FontProperties

from sklearn.datasets import load_iris

from sklearn.tree import DecisionTreeClassifier

from sklearn.ensemble import AdaBoostClassifier

%matplotlib inline

font = FontProperties(fname='/Library/Fonts/Heiti.ttc')

二、导入数据

X = iris_data.data[:, [2, 3]]

y = iris_data.target

label_list = ['山鸢尾', '杂色鸢尾', '维吉尼亚鸢尾']

三、构造决策边界

def plot_decision_regions(X, y, classifier=None):

    marker_list = ['o', 'x', 's']

    color_list = ['r', 'b', 'g']

    cmap = ListedColormap(color_list[:len(np.unique(y))])

    x1_min, x1_max = X[:, 0].min()-1, X[:, 0].max()+1

    x2_min, x2_max = X[:, 1].min()-1, X[:, 1].max()+1

    t1 = np.linspace(x1_min, x1_max, 666)

    t2 = np.linspace(x2_min, x2_max, 666)

    x1, x2 = np.meshgrid(t1, t2)

    y_hat = classifier.predict(np.array([x1.ravel(), x2.ravel()]).T)

    y_hat = y_hat.reshape(x1.shape)

    plt.contourf(x1, x2, y_hat, alpha=0.2, cmap=cmap)

    plt.xlim(x1_min, x1_max)

    plt.ylim(x2_min, x2_max)

    for ind, clas in enumerate(np.unique(y)):

        plt.scatter(X[y == clas, 0], X[y == clas, 1], alpha=0.8, s=50,

                    c=color_list[ind], marker=marker_list[ind], label=label_list[clas])

四、训练模型

4.1 训练模型(n_e=10, l_r=0.8)

adbt = AdaBoostClassifier(DecisionTreeClassifier(max_depth=2, min_samples_split=20, min_samples_leaf=5),

                          algorithm="SAMME", n_estimators=10, learning_rate=0.8)

adbt.fit(X, y)

AdaBoostClassifier(algorithm='SAMME',

          base_estimator=DecisionTreeClassifier(class_weight=None, criterion='gini', max_depth=2,

            max_features=None, max_leaf_nodes=None,

            min_impurity_decrease=0.0, min_impurity_split=None,

            min_samples_leaf=5, min_samples_split=20,

            min_weight_fraction_leaf=0.0, presort=False, random_state=None,

            splitter='best'),

          learning_rate=0.8, n_estimators=10, random_state=None)

4.2 可视化

plot_decision_regions(X, y, classifier=adbt)

plt.xlabel('花瓣长度（cm）', fontproperties=font)

plt.ylabel('花瓣宽度（cm）', fontproperties=font)

plt.title('AdaBoost算法代码(鸢尾花分类, n_e=10, l_r=0.8)',

          fontproperties=font, fontsize=20)

plt.legend(prop=font)

plt.show()

print("Score:{}".format(adbt.score(X, y)))

Score:0.9866666666666667

4.3 训练模型(n_estimators=300, learning_rate=0.8)

adbt = AdaBoostClassifier(DecisionTreeClassifier(max_depth=2, min_samples_split=20, min_samples_leaf=5),

                          algorithm="SAMME", n_estimators=300, learning_rate=0.8)

adbt.fit(X, y)

print("Score:{}".format(adbt.score(X, y)))

Score:0.9933333333333333

由于样本太少，可能效果不明显，但是对比上一个模型可以发现，相同步长的情况下，如果弱学习个数越多，拟合效果越好，但如果过多则可能过拟合。

4.4 训练模型(n_estimators=300, learning_rate=0.5)

adbt = AdaBoostClassifier(DecisionTreeClassifier(max_depth=2, min_samples_split=20, min_samples_leaf=5),

                          algorithm="SAMME", n_estimators=300, learning_rate=0.001)

adbt.fit(X, y)

print("Score:{}".format(adbt.score(X, y)))

Score:0.9533333333333334

相同迭代次数的情况下，对比上一个模型可以发现，如果步长越大，则模型效果越好。

4.5 训练模型(n_estimators=600, learning_rate=0.7)

adbt = AdaBoostClassifier(DecisionTreeClassifier(max_depth=2, min_samples_split=20, min_samples_leaf=5),

                          algorithm="SAMME", n_estimators=600, learning_rate=0.8)

adbt.fit(X, y)

print("Score:{}".format(adbt.score(X, y)))

Score:0.9933333333333333

对比第二个模型，可以发现即使增加迭代次数，算法准确率也没有提高，所以n_estimators=300的时候其实算法就已经收敛了。

04-04 AdaBoost算法代码(鸢尾花分类)的更多相关文章

[Python]基于K-Nearest Neighbors[K-NN]算法的鸢尾花分类问题解决方案
看了原理,总觉得需要用具体问题实现一下机器学习算法的模型,才算学习深刻.而写此博文的目的是,网上关于K-NN解决此问题的博文很多,但大都是调用Python高级库实现,尤其不利于初级学习者本人对模型的理 ...
Spark ML下实现的多分类adaboost+naivebayes算法在文本分类上的应用
1. Naive Bayes算法朴素贝叶斯算法算是生成模型中一个最经典的分类算法之一了,常用的有Bernoulli和Multinomial两种.在文本分类上经常会用到这两种方法.在词袋模型中,对于一 ...
AdaBoost 算法-分析波士顿房价数据集
公号:码农充电站pro 主页:https://codeshellme.github.io 在机器学习算法中,有一种算法叫做集成算法,AdaBoost 算法是集成算法的一种.我们先来看下什么是集成算法. ...
SIGAI机器学习第二十集 AdaBoost算法1
讲授Boosting算法的原理,AdaBoost算法的基本概念,训练算法,与随机森林的比较,训练误差分析,广义加法模型,指数损失函数,训练算法的推导,弱分类器的选择,样本权重削减,实际应用 AdaBo ...
集成学习值Adaboost算法原理和代码小结(转载)
在集成学习原理小结中,我们讲到了集成学习按照个体学习器之间是否存在依赖关系可以分为两类: 第一个是个体学习器之间存在强依赖关系: 另一类是个体学习器之间不存在强依赖关系. 前者的代表算法就是提升(bo ...
【图像处理】Haar Adaboost 检测自定义目标（视频车辆检测算法代码）
阅读须知本博客涉及到的资源: 正样本:http://download.csdn.net/detail/zhuangxiaobin/7326197 负样本:http://download.csdn.n ...
Adaboost算法及其代码实现
. . Adaboost算法及其代码实现算法概述 AdaBoost(adaptive boosting),即自适应提升算法. Boosting 是一类算法的总称,这类算法的特点是通过训练若干弱分类器 ...
【AdaBoost算法】积分图代码实现
一.积分图介绍定义:图像左上方的像素点值的和: 在Adaboost算法中可用于加速计算Haar或MB-LBP特征值,如下图: 二.代码实现 #include <opencv/highgui.h ...
02-19 k近邻算法(鸢尾花分类)
[TOC] 更新.更全的<机器学习>的更新网站,更有python.go.数据结构与算法.爬虫.人工智能教学等着你:https://www.cnblogs.com/nickchen121/ ...

随机推荐

webpack多页应用架构系列（一）：一步一步解决架构痛点
这系列文章讲什么? 前些时间,写过一个项目,前后端分离,没有借助任何框架,项目页面特别的多,页面都是html直接写的,许多公共html,写了好多处,有一个地方需要改就得改好多地方,js也是随意写,每个 ...
【Offer】[41] 【数据流中的中位数】
题目描述思路分析测试用例 Java代码代码链接题目描述如何得到一个数据流中的中位数?如果从数据流中读出奇数个数值,那么中位数就是所有数值排序之后位于中间的数值.如果从数据流中读出偶数个数值, ...
Tomcat服务器学习和使用
一.Tomcat服务器端口的配置 Tomcat的所有配置都放在conf文件夹之中,里面的server.xml文件是配置的核心文件. 如果想修改Tomcat服务器的启动端口,则可以在server.xml ...
洛谷 P1101单词方阵
我已经,是这个世界上,最幸福的女孩了 ——<末日时 ...
[系列] go-gin-api 路由中间件 - Jaeger 链路追踪（五）
概述首先同步下项目概况: 上篇文章分享了,路由中间件 - 捕获异常,这篇文章咱们分享:路由中间件 - Jaeger 链路追踪. 啥是链路追踪? 我理解链路追踪其实是为微服务架构提供服务的,当一个请求 ...
PythonI/O进阶学习笔记_5.python的set和dict
前言: 我一直觉得对我来说学习知识很忌讳不系统.本篇内容与上一篇自定义序列类是有联系的. 上一篇比较通范的了解了序列类的一些协议和特性,并且有些list的内容.这篇更加具体到set和dict这两个序 ...
Lottie在手，动画我有：ios/Android/Web三端复杂帧动画解决方案
为什么需要Lottie 在相对复杂的移动端应用中,我们可能会需要使用到复杂的帧动画.例如: 刚进入APP时候可能会看到的入场小动画,带来愉悦的视觉享受许多Icon的互动变化比较复杂多变的时候,研 ...
java.io.IOException: 设备上没有空间
解决: 逐层目录查找最大文件夹du -h --max-depth=1 确定最大目录为log目录,删除log目录下的所有日志文件rm -f *
JVM学习（虚拟机栈、堆、方法区）自我看法
堆(Heap): 此内存区域唯一目的就是存放对象实例,几乎所有的对象实例都在这里分配.这一点在java虚拟机规范中的描述是:所有的对象实例以及数组都要在堆上分配. 虚拟机栈(Stack): 虚拟机栈主 ...
selenium WebDriver 截取网站的验证码
在做爬虫项目的时候,有时候会遇到验证码的问题,由于某些网站的验证码是动态生成的,即使是同一个链接,在不同的时间访问可能产生不同的验证码, 一刚开始的思路就是打开这个验证码的链接,然后通过java代码 ...

04-04 AdaBoost算法代码(鸢尾花分类)