1.理解朴素贝叶斯

1）基本概念

依据概率原则进行分类。如天气预测概率。
朴素贝叶斯（Naive Bayes, NB）适合场景：为估计一个结果的概率，从众多属性中提取的信息应该被同时考虑。
很多算法忽略了弱影响的特征（若有大量弱影响的特征，它们组合在一起的影响可能会很大），但NB算法利用了所有可以获得的证据来修正预测。
贝叶斯方法的基本概念：事件，试验，概率，联合概率，独立事件，相关事件（建立预测模型的基础），条件概率，先验概率，似然概率，边际似然概率，后验概率，频率表
条件概率公式（事件B已经发生的条件下，事件A发生的概率）：
后验概率（如商业垃圾邮件过滤器：判断viagra是垃圾邮件spam的概率）：

2）朴素贝叶斯算法

NB优点：简单快速有效；能处理噪音及缺失值数据；训练集不限大小；容易获得估计概率值。
NB缺点：依赖同样重要和独立的特征（错误假设）；应用在大量数值特征的数据集中不理想；概率估计值比预测的类更不可靠。
“朴素”的含义：基于这样一个假设：数据集的所有特征都具有相同的重要性和独立性，但在大多数实际应用中，假设不成立。
朴素贝叶斯算法具通用性和准确性，在分类学习任务中很强大。

①朴素贝叶斯分类

假设有4个单词的100封邮件的似然表来训练朴素贝叶斯算法（如下表)，收到新邮件时（包含了单词viagra和unsubscribe，但不包含money和groceries），通过计算后验概率来判断它是否为垃圾邮件。

原始的基于贝叶斯定理的后验概率：

将4个单词事件视为独立事件（类条件独立），可简化公式：

计算垃圾邮件总似然为：

计算非垃圾邮件总似然为：

是垃圾邮件的概率为：

②拉普拉斯估计

对于类中一个或多个水平，如果一个时间从没有发生过，那它出现的概率为0，从而导致后验概率值也为0（抵消或否决了所有其他的证据）。

比如，这次的新邮件中包含了前述的4个单词，则计算垃圾邮件的似然：

该邮件是垃圾邮件的概率为：

拉普拉斯估计就是给频率表中每个计数加上一个很小的数（一般设为1），保证每一类中每个特征发生的概率是非零的。

拉普拉斯估计后的垃圾邮件似然：

③数值型特征值离散化

前面的频率表要求特征必须为分类变量，如果是数值变量，需要将数值离散化（分段），如根据时间寻找分割点。如果没有明显的分割点，也可利用分位数进行分段。

但将数值特征离散化总是会导致信息量的减少，因为特征的原始粒度减少为几个数目较少的类别。分段太少会导致重要趋势被掩盖，分段太多会导致频率表中的计数值很小，因此需要平衡分段数。

2.朴素贝斯分类应用

示例：基于贝叶斯算法的手机垃圾短信过滤。

1）收集数据

数据下载sms_spam.csv：

链接: https://pan.baidu.com/s/1fAufKXCSufwd8It_DHXyWQ 提取码: vgyj

2）探索和准备数据

## Example: Filtering spam SMS messages ----

## Step 2: Exploring and preparing the data ---- 

# read the sms data into the sms data frame

sms_raw <- read.csv("sms_spam.csv", stringsAsFactors = FALSE)

# examine the structure of the sms data

str(sms_raw)

# convert spam/ham to factor.

sms_raw$type <- factor(sms_raw$type)

# examine the type variable more carefully

str(sms_raw$type)

table(sms_raw$type)

处理和分析文本数据

文本挖掘包tm创建语料库（文本集合），inspect函数查看语料库内容，tm_map函数转换tm语料库（如去数字，变小写等），stopwords函数去除填充词（如to/and/or/but等）。

清理完后标记分解单词形成的组，并创建稀疏矩阵。再进行训练集和测试集划分，并利用词云进行可视化文本数据。最后为高频词创建指示特征。

PS：运行过程中tm包的tolower参数一直报错，未解决，因此本示例最终没有用此参数。



# build a corpus using the text mining (tm) package

library(tm)

sms_corpus <- VCorpus(VectorSource(sms_raw$text))

# examine the sms corpus

print(sms_corpus)

inspect(sms_corpus[1:2])

as.character(sms_corpus[[1]])

lapply(sms_corpus[1:2], as.character)

# clean up the corpus using tm_map()

# sms_corpus_clean <- tm_map(sms_corpus, content_transformer(tolower)) #Error

sms_corpus_clean <- sms_corpus

# show the difference between sms_corpus and corpus_clean

as.character(sms_corpus[[1]])

as.character(sms_corpus_clean[[1]])

sms_corpus_clean <- tm_map(sms_corpus_clean, removeNumbers) # remove numbers

sms_corpus_clean <- tm_map(sms_corpus_clean, removeWords, stopwords()) # remove stop words

sms_corpus_clean <- tm_map(sms_corpus_clean, removePunctuation) # remove punctuation

# tip: create a custom function to replace (rather than remove) punctuation

removePunctuation("hello...world")

replacePunctuation <- function(x) { gsub("[[:punct:]]+", " ", x) }

replacePunctuation("hello...world")

# illustration of word stemming

library(SnowballC)

wordStem(c("learn", "learned", "learning", "learns"))

sms_corpus_clean <- tm_map(sms_corpus_clean, stemDocument)

sms_corpus_clean <- tm_map(sms_corpus_clean, stripWhitespace) # eliminate unneeded whitespace

# examine the final clean corpus

lapply(sms_corpus[1:3], as.character)

lapply(sms_corpus_clean[1:3], as.character)

# create a document-term sparse matrix

sms_dtm <- DocumentTermMatrix(sms_corpus_clean)

# alternative solution: create a document-term sparse matrix directly from the SMS corpus

sms_dtm2 <- DocumentTermMatrix(sms_corpus, control = list(

  # tolower = TRUE,  #注释掉也报错

  removeNumbers = TRUE,

  stopwords = TRUE,

  removePunctuation = TRUE,

  stemming = TRUE

))

# alternative solution: using custom stop words function ensures identical result

sms_dtm3 <- DocumentTermMatrix(sms_corpus, control = list(

  # tolower = TRUE, #注释掉也报错

  removeNumbers = TRUE,

  stopwords = function(x) { removeWords(x, stopwords()) },

  removePunctuation = TRUE,

  stemming = TRUE

))

# compare the result

sms_dtm

sms_dtm2

sms_dtm3

# creating training and test datasets

sms_dtm_train <- sms_dtm[1:4169, ]

sms_dtm_test  <- sms_dtm[4170:5558, ]

# also save the labels

sms_train_labels <- sms_raw[1:4169, ]$type

sms_test_labels  <- sms_raw[4170:5558, ]$type

# check that the proportion of spam is similar

prop.table(table(sms_train_labels))

prop.table(table(sms_test_labels))

# word cloud visualization

library(wordcloud)

wordcloud(sms_corpus_clean, min.freq = 50, random.order = FALSE)

# subset the training data into spam and ham groups

spam <- subset(sms_raw, type == "spam")

ham  <- subset(sms_raw, type == "ham")

wordcloud(spam$text, max.words = 40, scale = c(3, 0.5))

wordcloud(ham$text, max.words = 40, scale = c(3, 0.5))

sms_dtm_freq_train <- removeSparseTerms(sms_dtm_train, 0.999)

sms_dtm_freq_train

# indicator features for frequent words

findFreqTerms(sms_dtm_train, 5)

# save frequently-appearing terms to a character vector

sms_freq_words <- findFreqTerms(sms_dtm_train, 5)

str(sms_freq_words)

# create DTMs with only the frequent terms

sms_dtm_freq_train <- sms_dtm_train[ , sms_freq_words]

sms_dtm_freq_test <- sms_dtm_test[ , sms_freq_words]

# convert counts to a factor

convert_counts <- function(x) {

  x <- ifelse(x > 0, "Yes", "No")

}

# apply() convert_counts() to columns of train/test data

sms_train <- apply(sms_dtm_freq_train, MARGIN = 2, convert_counts)

sms_test  <- apply(sms_dtm_freq_test, MARGIN = 2, convert_counts)

得到的sms_train和sms_test的单词稀疏矩阵如下表所示：

3）训练模型

上例已经将原始短信转换为可以用一个统计模型代表的形式，因此用NB算法根据单词的存在与否来估计一条给定的短信是垃圾短信的概率。

使用e1071::naiveBays()或klaR::NaiveBayes()函数。

## Step 3: Training a model on the data ----

library(e1071)

sms_classifier <- naiveBayes(sms_train, sms_train_labels)

4）评估模型性能

基于测试集中的未知短信来检验分类器的预测值。比较预测值和真实值，仍然通过混淆矩阵来计算。

## Step 4: Evaluating model performance ----

sms_test_pred <- predict(sms_classifier, sms_test)

library(gmodels)

CrossTable(sms_test_pred, sms_test_labels,

           prop.chisq = FALSE, prop.t = FALSE, prop.r = FALSE,

           dnn = c('predicted', 'actual'))

没怎么处理效果也比较好，所以NB是文本分类的一种标准算法。同样地，假阴性问题带来的代价较大（把正常短信过滤掉了），进一步提升模型性能试试。

5）提升模型性能

上面训练时，没有设置拉普拉斯估计，此处设为1，性能有所提升。

## Step 5: Improving model performance ----

sms_classifier2 <- naiveBayes(sms_train,

                          sms_train_labels,

                          laplace = 1) #拉普拉斯估计值

sms_test_pred2 <- predict(sms_classifier2, sms_test)

CrossTable(sms_test_pred2, sms_test_labels,

           prop.chisq = FALSE, prop.t = FALSE, prop.r = FALSE,

           dnn = c('predicted', 'actual'))

【机器学习与R语言】3-概率学习朴素贝叶斯（NB）的更多相关文章

R语言︱贝叶斯网络语言实现及与朴素贝叶斯区别（笔记）
每每以为攀得众山小,可.每每又切实来到起点,大牛们,缓缓脚步来俺笔记葩分享一下吧,please~ --------------------------- 一.贝叶斯网络与朴素贝叶斯的区别朴素贝叶斯的 ...
【机器学习速成宝典】模型篇05朴素贝叶斯【Naive Bayes】（Python版）
目录先验概率与后验概率条件概率公式.全概率公式.贝叶斯公式什么是朴素贝叶斯(Naive Bayes) 拉普拉斯平滑(Laplace Smoothing) 应用:遇到连续变量怎么办?(多项式分布, ...
Stanford大学机器学习公开课（六）：朴素贝叶斯多项式模型、神经网络、SVM初步
(一)朴素贝叶斯多项式事件模型在上篇笔记中,那个最基本的NB模型被称为多元伯努利事件模型(Multivariate Bernoulli Event Model,以下简称 NB-MBEM).该模型有多 ...
机器学习Matlab打击垃圾邮件的分类————朴素贝叶斯模型
该系列来自于我<人工智能>课程回顾总结,以及实验的一部分进行了总结学习机垃圾分类是有监督的学习分类最经典的案例,本文首先回顾了概率论的基本知识.则以及朴素贝叶斯模型的思想.最后给出了垃圾 ...
机器学习Sklearn系列：（四）朴素贝叶斯
3--朴素贝叶斯原理朴素贝叶斯本质上就是通过贝叶斯公式来对得到类别概率,但区别于通常的贝叶斯公式,朴素贝叶斯有一个默认条件,就是特征之间条件独立. 条件概率公式: \[P(B|A) = \frac ...
【Spark机器学习速成宝典】模型篇04朴素贝叶斯【Naive Bayes】（Python版）
目录朴素贝叶斯原理朴素贝叶斯代码(Spark Python) 朴素贝叶斯原理详见博文:http://www.cnblogs.com/itmorn/p/7905975.html 返回目录朴素贝叶 ...
机器学习之朴素贝叶斯&贝叶斯网络
贝叶斯决决策论在所有相关概率都理想的情况下,贝叶斯决策论考虑基于这些概率和误判损失来选择最优标记,基本思想如下: (1)已知先验概率和类条件概率密度(似然) (2)利用贝叶斯转化为后验概 ...
100天搞定机器学习|Day15 朴素贝叶斯
Day15,开始学习朴素贝叶斯,先了解一下贝爷,以示敬意. 托马斯·贝叶斯 (Thomas Bayes),英国神学家.数学家.数理统计学家和哲学家,1702年出生于英国伦敦,做过神甫:1742年成为英 ...
吴裕雄--天生自然python机器学习：朴素贝叶斯算法
分类器有时会产生错误结果,这时可以要求分类器给出一个最优的类别猜测结果,同时给出这个猜测的概率估计值. 概率论是许多机器学习算法的基础在计算特征值取某个值的概率时涉及了一些概率知识,在那里我们先 ...

随机推荐

普通用户在命令终端使用Python脚本连入校园网
普通用户在命令终端使用Python脚本连入校园网想要连入校园网的步骤: 浏览器输入对应的IP地址,输入账号密码连网: 下载对应软件,输入账号密码连网: 而面对没有界面的服务器,而你又没有root权限 ...
Scrum Meeting 0529
零.说明日期:2021-5-29 任务:简要汇报七日内已完成任务,计划后两日完成任务一.进度情况组员负责七日内已完成的任务后两日计划完成的任务困难 qsy PM&前端完成后端管 ...
BUAA_2020_软件工程_软件案例分析作业
项目内容这个作业属于那个课程班级博客这个作业的要求在哪里作业要求我在这个课程的目标是学习掌握软件工程的相关知识这个作业在哪个具体方面帮我实现目标通过对具体软件案例的分析学习软件工程 ...
BUAA 2020 软件工程结对项目作业
Author: 17373051 郭骏 3.28添加:4.计算模块接口的设计与实现过程部分,PairCore实现的细节项目内容这个作业属于哪个课程 2020春季计算机学院软件工程(罗杰任健) ...
『学了就忘』Linux基础 — 11、通过setup工具配置Linux系统IP地址
目录 1.setup命令介绍 2.使用setup命令配置IP (1)执行setup命令 (2)进入图形化配置界面 (3)选择配置IP还是DNS (4)选择要配置的网卡 (5)进入IP地址配置页面 (6 ...
直播预告｜App 首页如何动态化更新？来看蚂蚁技术专家详解「支付宝」全新卡片技术栈
立即前往直播间预约观看从icon到card,一场内容前置化的变革从 Windows 时代开始,应用程序图标就成为了用户(流量)的主入口,一直持续到移动端时代. 图标即入口的方式,虽然足够方便但却不 ...
Git基本教程
git的发展 Git 两周开发 Linus开发,主要是为了管理大量人员维护代码 Git分布式版本控制系统基本命令 history:查看之前用过的命令 vimtutor git配置查看配置 git ...
用 python 解决线性代数中的矩阵运算
用 python 解决线性代数中的矩阵运算矩阵叉乘矩阵求逆矩阵转置假定AX=B,求解未知矩阵X 矩阵的行列式值|matrix| 未完待续..... import sys from PyQt5. ...
在同级路径下，SpringBoot两种类型的配置文件(.properties/.yml)同时存在时，配置优先级如何处理？
两类配置文件如果同时存在,若 key 相同则 properties 优先级高,若key不同则合并加载:
PTA7-2 愿天下有情人都是失散多年的兄妹
呵呵.大家都知道五服以内不得通婚,即两个人最近的共同祖先如果在五代以内(即本人.父母.祖父母.曾祖父母.高祖父母)则不可通婚.本题就请你帮助一对有情人判断一下,他们究竟是否可以成婚? 输入格式: 输入 ...

【机器学习与R语言】3-概率学习朴素贝叶斯（NB）