XGBboost 特征评分的计算原理

　　xgboost是基于GBDT原理进行改进的算法，效率高，并且可以进行并行化运算，而且可以在训练的过程中给出各个特征的评分，从而表明每个特征对模型训练的重要性，

调用的源码就不准备详述，本文主要侧重的是计算的原理，函数get_fscore源码如下，源码来自安装包：xgboost/python-package/xgboost/core.py

　　通过下面的源码可以看出，特征评分可以看成是被用来分离决策树的次数。

def get_fscore(self, fmap=''):

        """Get feature importance of each feature.

        Parameters

        ----------

        fmap: str (optional)

           The name of feature map file

        """

        return self.get_score(fmap, importance_type='weight')

    def get_score(self, fmap='', importance_type='weight'):

        """Get feature importance of each feature.

        Importance type can be defined as:

            'weight' - the number of times a feature is used to split the data across all trees.

            'gain' - the average gain of the feature when it is used in trees

            'cover' - the average coverage of the feature when it is used in trees

        Parameters

        ----------

        fmap: str (optional)

           The name of feature map file

        """

        if importance_type not in ['weight', 'gain', 'cover']:

            msg = "importance_type mismatch, got '{}', expected 'weight', 'gain', or 'cover'"

            raise ValueError(msg.format(importance_type))

        # if it's weight, then omap stores the number of missing values

        if importance_type == 'weight':

            # do a simpler tree dump to save time

            trees = self.get_dump(fmap, with_stats=False)

            fmap = {}

            for tree in trees:

                for line in tree.split('\n'):

                    # look for the opening square bracket

                    arr = line.split('[')

                    # if no opening bracket (leaf node), ignore this line

                    if len(arr) == 1:

                        continue

                    # extract feature name from string between []

                    fid = arr[1].split(']')[0].split('<')[0]

                    if fid not in fmap:

                        # if the feature hasn't been seen yet

                        fmap[fid] = 1

                    else:

                        fmap[fid] += 1

            return fmap

        else:

            trees = self.get_dump(fmap, with_stats=True)

            importance_type += '='

            fmap = {}

            gmap = {}

            for tree in trees:

                for line in tree.split('\n'):

                    # look for the opening square bracket

                    arr = line.split('[')

                    # if no opening bracket (leaf node), ignore this line

                    if len(arr) == 1:

                        continue

                    # look for the closing bracket, extract only info within that bracket

                    fid = arr[1].split(']')

                    # extract gain or cover from string after closing bracket

                    g = float(fid[1].split(importance_type)[1].split(',')[0])

                    # extract feature name from string before closing bracket

                    fid = fid[0].split('<')[0]

                    if fid not in fmap:

                        # if the feature hasn't been seen yet

                        fmap[fid] = 1

                        gmap[fid] = g

                    else:

                        fmap[fid] += 1

                        gmap[fid] += g

            # calculate average value (gain/cover) for each feature

            for fid in gmap:

                gmap[fid] = gmap[fid] / fmap[fid]

            return gmap

XGBboost 特征评分的计算原理的更多相关文章

【原创】xgboost 特征评分的计算原理
xgboost是基于GBDT原理进行改进的算法,效率高,并且可以进行并行化运算: 而且可以在训练的过程中给出各个特征的评分,从而表明每个特征对模型训练的重要性, 调用的源码就不准备详述,本文主要侧重的 ...
Security:蠕虫的行为特征描述和工作原理分析
________________________ 参考: 百度文库---蠕虫的行为特征描述和工作原理分析 http://wenku.baidu.com/link?url=ygP1SaVE4t4-5fi ...
OpenGL中摄像机矩阵的计算原理
熟悉OpenGL|ES的朋友,可能会经常设置摄像机的view矩阵,iOS中相对较好,已经封装了方向,只需要设置摄像机位置,目标点位置以及UP向量即可.下面先介绍下摄像机view矩阵的计算原理.此处假设 ...
005-hive概述，计算原理及模型
计算原理及模型优化的根本思想: 尽早尽量过滤数据,减少每个阶段的数据量减少job数解决数据倾斜问题 Hive概述名称 hive系统架构 metastore derbymysql ...
（原创）sklearn中 F1-micro 与 F1-macro区别和计算原理
最近在使用sklearn做分类时候,用到metrics中的评价函数,其中有一个非常重要的评价函数是F1值,(关于这个值的原理自行google或者百度) 在sklearn中的计算F1的函数为 f1_sc ...
基于IG的特征评分方法
本文简单介绍了熵.信息增益的概念,以及如何使用信息增益对监督学习的训练样本进行评估,评估每个字段的信息量. 1.熵的介绍在信息论里面,熵是对不确定性的测量.通俗来讲,熵就是衡量随机变量随 ...
全基因组关联分析（GWAS）的计算原理
前言关于全基因组关联分析(GWAS)原理的资料,网上有很多. 这也是我写了这么多GWAS的软件教程,却从来没有写过GWAS计算原理的原因. 恰巧之前微博上某位小可爱提问能否写一下GWAS的计算原理. ...
前端移动端的rem适配计算原理
rem是什么? rem(font size of the root element)是指相对于根元素的字体大小的单位.简单的说它就是一个相对单位.看到rem大家一定会想起em单位,em(font si ...
mapreducer计算原理
mapreducer计算原理

随机推荐

bilibili用户信息全栈爬取
idea 右键无java class选项
项目中新建module之后,要在该目录下新增java Class文件,右键——>New发现无Java Class选项. File –Project Structure或者ctrl+alt+shi ...
redis编译报告错误 jemalloc/jemalloc.h：没有那个文件或目录解决.
问题原因:没找到jemalloc头文件. 百度谷歌半天没找到有效的下载地址. github中有到github下载.jemalloc https://github.com/jemalloc/jemal ...
001_Go hello world
一.go获取程序参数及指针地址示例 package main import ( "fmt" "os" ) func main() { fmt.Println(o ...
ASP.NET Core 搭配 Nginx 的真实IP问题
一.前言 Nginx(Engine X)是一个高性能HTTP和反向代理服务,是由俄罗斯人伊戈尔·赛索耶夫为访问量第二的Rambler.ru站点(俄文:Рамблер)开发的,第一个公开版本0.1.0发 ...
【续】5年后，我们为什么要从 Entity Framework 转到 Dapper 工具？
前言上一篇文章收获了 140 多条评论,这是我们始料未及的. 向来有争议的话题都是公说公的理,婆说婆的理,Entity Framework的爱好者对此可以说是嗤之以鼻,不屑一顾,而Dapper爱好者 ...
jeecg入门操作—字典配置
一.字典入口系统管理->数据字典二.录入字典填写字典相关信息三 .添加字典内容填写字典某条记录内容再录入几条录入之后的字典内容四.使用字典 1.编辑用户表单,添加用户等级字段 ...
HSSFWorkbook 导出excel java
public String exportExcelList(){ //创建webbook,对应一个excel文件 HSSFWorkbook wb = new HSSFWorkbook(); //在we ...
java基础-03基本语法
关键词常用关键字53个(含2个保留字): 1.保留关键字(2个) const --常量常数:用于修改字段或局部变量的声明. goto--转到指定跳转到标签,找到标签后,程序将处理从下一行开始的命 ...
安装Cnario提示.Net 3.5安装错误, 检查Windows系统更新提示无法检查到更新, 安装.Net 3.5提示"Windows无法完成请求的更改, 错误代码:0x800F081F"
症状: Windows检查系统更新时提示无法完成, 尝试安装.Net 3.5等组件时都无法完成, 错误代码: 0x800F081F 原因: 可能时设置了禁止Windows自动更新, 需要重新打开解决 ...

XGBboost 特征评分的计算原理

XGBboost 特征评分的计算原理的更多相关文章

随机推荐

热门专题