R语言实战（九）主成分和因子分析

本文对应《R语言实战》第14章：主成分和因子分析

主成分分析（PCA）是一种数据降维技巧，它能将大量相关变量转化为一组很少的不相关变量，这些无关变量成为主成分。

探索性因子分析（EFA）是一系列用来发现一组变量的潜在结构的方法。通过寻找一组更小的、潜在的或隐藏的结构来解释已观测到的、显式的变量间的关系。

这两种方法都需要大样本来支撑稳定的结果，但是多大是足够的也是一个复杂的问题。目前，数据分析师常使用经验法则：因子分析需要5~10倍于变量数的样本数。另外有研究表明，所需样本量依赖于因子数目、与各因子相关联的变量数，以及因子对变量方差的解释程度。

基础安装包里有princomp()函数可以做主成分分析，factanal()函数可以做因子分析。

另外有psych包，提供以下函数：

函数	描述
principal()	含多种可选的方差旋转方法的主成分分析
fa()	可用主轴、最小残差、加权最小平方或最大似然法估计的因子分析
fa.parallel()	含平行分析的碎石图
factor.plot()	绘制因子分析或主成分分析的结果
fa.diagram()	绘制因子分析或主成分的载荷矩阵
scree()	因子分析和主成分分析的碎石图

主要步骤：

　　1. 数据预处理

　　　　需要确保数据中没有缺失值

　　2. 选择因子模型

　　　　判断是PCA（数据降维）还是EFA（发现潜在结构）更符合你的研究目标。如果选择EFA方法，还需要选择一种估计因子模型的方法（如最大似然估计）

　　3. 判断要选择的主成分/因子数目

　　4. 选择主成分/因子

　　5. 旋转主成分/因子

　　6. 解释结果

　　7. 计算主成分或因子得分

=========================================================================

主成分分析：

PCA的目标是用一组较少的不相关变量代替大量相关变量，同时尽可能保留初始变量的信息，这些推导所得的变量成为主成分，它们是观测变量的线性组合。各主成分互相正交。

判断主成分的个数准则：

根据先验经验和理论知识判断主成分数
根据要解释变量方差的积累值的阈值来判断需要的主成分数
通过检查变量间k*k的相关系数矩阵来判断保留的主成分数

最常见的是基于特征值的方法。每个主成分都与相关系数矩阵的特征值相关联，第一主成分与最大的特征值相关联，第二主成分与第二大的特征值相关联，依次类推。Kaiser-Harris准则建议保留特征值大于1的主成分，因为特征值小于1的成分所解释的方差比包含在单个变量中的方差更少。Cattell碎石检验则绘制了特征值与主成分数的图形。这类图形可以清晰地展示图形弯曲状况，在图形变化最大处之上的主成分都可以保留。最后，还可以进行模拟，依据与初始矩阵相同大小的随机数据矩阵来判断要提取的特征值。若基于真实数据的某个特征值大于一组随机数据矩阵相应的平均特征值，那么该主成分可以保留。这种方法称为平行分析。

#展示基于观测特征值的碎石检验（线段与x符号组成）、根据100个随机数据矩阵推导出来的特征值均值（虚线），以及大于1的特征值准则（y=1的水平线）

library(psych)

fa.parallel(USJudgeRatings[, -1], fa = “PC”, n.iter = 100, show.legend = FALSE,

main = “Scree plot with parallel analysis”)

提取主成分：

principal(r, nfactors = , rotate = , scores = )

其中r是相关系数矩阵或原始数据矩阵；

nfactors设定主成分数（默认为1）；

rotate指定旋转的方法（默认为最大方差旋转，varimax）；

scores设定是否需要计算主成分得分（默认不需要）。

输出解释：

PC1（或PC2…）栏包含了成分载荷，指观测变量与主成分的相关系数。可用来解释主成分的含义，是一个可用来进行一般性评价的维度。

h2栏指成分公因子方差：主成分对每个变量的方差解释度；

u2栏指成分唯一性（1-h2）：方差无法被主成分解释的比例；

SS loadings行包含了与主成分相关联的特征值，指的是与特定主成分相关联的标准化后的方差值。

Proportion Var行表示的是每个主成分对整个数据集的解释程度。

主成分旋转：

当提取了多个成分时，对它们进行旋转可使结果更具解释性。

旋转是一系列将成分载荷变得更容易解释的数学方法，它们尽可能地对成分去噪。

旋转方法有两种：使选择的成分保持不相关（正交旋转）；让它们变得相关（斜交旋转）。

最流行的正交旋转是方差极大旋转，它试图对载荷阵的列进行去噪，使得每个成分只是由一组有限的变量来解释（即载荷阵每列只有少数几个很大的载荷，其他都是很小的载荷）。（具体例子参见书305页）

由于最终目标是用一组较少的变量替换一组较多的相关变量，因此还需要获取每个观测在成分上的得分。

获取主成分得分的方法：

第一种情况是，只有一个主成分，此时设置score = TRUE即可得到主成分得分；

第二种情况是，基于相关系数矩阵的主成分分析，虽然原始数据不可用，但是可以得到用来计算主成分得分的系数。为了简化计算，通常将接近0的系数直接看作是0。

=========================================================================

探索性因子分析：

目标是通过发掘隐藏在数据下的一组较少的、更为基本的无法观测的变量，来解释一组可观测变量的相关性。这些虚拟的、无法观测的变量称作因子。（每个因子被认为可以解释多个观测变量间共有的方差，因此准确来说，它们应该称作公共因子）

同样的，需要判断需提取的公共因子数：

值得注意的是，当三种原则摇摆不定时，高估因子数通常比低估因子数的结果好。另外，Kaiser-Harris准则的特征值数大于0而不是1（图中的水平线）。

提取公共因子：

fa(r, nfactors = , n.obs = , rotate = , scores = , fm = )

r是相关系数矩阵或者原始数据矩阵；

nfactors设定提取的因子数（默认为1）；

n.obs是观测数（输入相关系数矩阵时需要填写）；

rotate设定旋转的方法（默认互变异数最小法）；

scores设定是否计算因子得分（默认不计算）；

fm设定因子化方法（默认极小残差法）。

提取公共因子的方法有很多，包括最大似然法（ml）、主轴迭代法（pa）、加权最小二乘法（wls）、广义加权最小二乘法（gls）和最小残差法（minres）。最大似然法有良好的统计性质，但是有时最大似然法不会收敛，此时采用主轴迭代法会有好效果。

因子旋转：

正交与斜交旋转，具体例子参考书310页。

两者不同之处：对于正交旋转，因子分析的重点在于因子结构矩阵（变量与因子的相关系数），而对于斜交旋转，因子分析会考虑三个矩阵：因子结构矩阵、因子模式矩阵和因子关联矩阵。

因子模式矩阵即标准化的回归系数矩阵，它列出了因子预测变量的权重。因子关联矩阵即因子相关系数矩阵。

因子结构矩阵（即因子载荷矩阵）一般不会列出来，但是可以计算得到，公式为F = P * Phi，其中F是因子载荷阵，P为因子模式矩阵，Phi为因子关联矩阵。（例子可以参考311页）

因子得分：

相比PCA，EFA并不那么关注计算因子得分。在fa()函数中添加score = TRUE即可得到因子得分。另外还可以得到得分系数（标准化的回归权重），它在返回对象的weights元素中。

其他与EFA相关的包：

FactoMineR: 提供PCA和FEA方法，潜变量模型，并有更多参数选项；

FAiR: 使用遗传算法估计因子分析模型，增强了模型参数的估计能力，能够处理不等式的约束条件；

GPArotation: 提供多种因子旋转方法；

nFactors: 提供了用来判断因子数目的许多复杂方法。

其他潜变量模型：

CFA（验证性因子分析）是结构方程模型（SEM）中的一种方法。SEM不仅可以假定潜在因子的数目以及组成，还能假定因子间的影响方式。可以将SEM看做是验证性因子分析（对变量）和回归分析（对因子）的组合，它的结果输出包含统计检验和拟合度的指标。具体实现方式有sem包，openMx包，lavaan包。

ltm包可以用来拟合测验和问卷中各项目的潜变量模型。

潜类别模型（潜在的因子被认为是类别型而非连续型）可通过FlexMix, lcmm, randomLCA, poLC包进行拟合。lcda包可做潜类别判别分析，lsa包可做潜在语义分析。

ca包提供了可做简单和多重对应分析的函数。

另外MDS（多维标度法）可以用来发现解释相似性和可测对象间距离的潜在维度。基础安装的cmdscale()函数可以实现经典MDS，MASS包里的isoMDS()函数可以做非线性MDS。

小结：

R语言实战（九）主成分和因子分析的更多相关文章

R in action读书笔记（19）第十四章主成分和因子分析
第十四章:主成分和因子分析本章内容主成分分析探索性因子分析其他潜变量模型主成分分析(PCA)是一种数据降维技巧,它能将大量相关变量转化为一组很少的不相关变量,这些无关变量称为主成分.探索性因 ...
R 语言实战-Part 4 笔记
R 语言实战(第二版) part 4 高级方法 -------------第13章广义线性模型------------------ #前面分析了线性模型中的回归和方差分析,前提都是假设因变量服从正态 ...
R语言实战
教材目录第一部分入门第一章 R语言介绍第二章创建数据集第三章图形初阶第四章基本数据管理第五章高级数据管理第二部分基本方法第六章基本图形第七章基本统计方法第三部分中 ...
R 语言实战-Part 3 笔记
R 语言实战(第二版) part 3 中级方法 -------------第8章回归------------------ #概念:用一个或多个自变量(预测变量)来预测因变量(响应变量)的方法 #最常 ...
R语言实战（一）介绍、数据集与图形初阶
本文对应<R语言实战>前3章,因为里面大部分内容已经比较熟悉,所以在这里只是起一个索引的作用. 第1章 R语言介绍获取帮助函数 help(), ? 查看函数帮助 exampl ...
R语言实战（四）回归
本文对应<R语言实战>第8章:回归回归是一个广义的概念,通指那些用一个或多个预测变量(也称自变量或解释变量)来预测响应变量(也称因变量.效标变量或结果变量)的方法.通常,回归分析可以用来 ...
R语言实战（五）方差分析与功效分析
本文对应<R语言实战>第9章:方差分析:第10章:功效分析 ================================================================ ...
R语言实战（七）图形进阶
本文对应<R语言实战>第11章:中级绘图:第16章:高级图形进阶基础图形一章,侧重展示单类别型或连续型变量的分布情况:中级绘图一章,侧重展示双变量间关系(二元关系)和多变量间关系(多元关 ...
R 语言实战-Part 5-1笔记
R 语言实战(第二版) part 5-1 技能拓展 ----------第19章使用ggplot2进行高级绘图------------------------- #R的四种图形系统: #①base: ...

随机推荐

PHP7 学习笔记（二）PHP5.9 升级到PHP7 遇到的一些坑的记录（php-fpm 图解）
apache_event_php-fpm 示意图: nginx-php-fpm示意图: Worker-Master-Server TCP-Nginx_PHP Nginx-FastCGI 1.使用$_G ...
Java并发编程原理与实战二十一：线程通信wait&notify&join
wait和notify wait和notify可以实现线程之间的通信,当一个线程执行不满足条件时可以调用wait方法将线程置为等待状态,当另一个线程执行到等待线程可以执行的条件时,调用notify可以 ...
Elasticsearch技术解析与实战（五）Document解析
1.手动指定document id 一般来说,是从某些其他的系统中,导入一些数据到es时,会采取这种方式,就是使用系统中已有数据的唯一标识,作为es中document的id. PUT /index/t ...
Angular5基本入门
基本环境安装首先,确定安装了nodejs与npm,angular 5要求node版本在6.9.x以上.npm版本在 3.x.x以上: 1.安装@angular/cli npm install -g ...
Docker 启动Centos
docker run -d -e "container=docker" --privileged=true -v /sys/fs/cgroup:/sys/fs/cgroup --n ...
python作业堡垒机(第十三周)
作业需求: 1. 所有的用户操作日志要保留在数据库中 2. 每个用户登录堡垒机后,只需要选择具体要访问的设置,就连接上了,不需要再输入目标机器的访问密码 3. 允许用户对不同的目标设备有不同的访问权限 ...
[转]Linux 线程分离状态
线程的分离与结合在任何一个时间点上,线程是可结合的(joinable),或者是分离的(detached).一个可结合的线程能够被其他线程收回其资源和杀死:在被其他线程回收之前,它的存储器资源(如栈) ...
MySQL参数设置
InnoDB配置从MySQL 5.5版本开始,InnoDB就是默认的存储引擎并且它比任何其它存储引擎的使用要多得多.那也是为什么它需要小心配置的原因. 1 innodb_file_per_table ...
Qt软件打包发布（QT5.4.1(msvc2013_64_opengl)，Win7 64bit）
环境:QT5.4.1(msvc2013_64_opengl),Win7 64bit 编译方式 Qt开发的程序发布的时候经常采用两种方式:1)静态编译,可生成单一的可执行文件:2)动态编译,需同时附上需 ...
前端程序员必知的30个Chrome扩展-[转载]
谷歌Chrome浏览器是网络上可用的最好浏览器之一,并且自2011年11月超越了Firefox浏览器之后,已经成为了互联网上占主导地位的浏览器.今天,HTML5中国与大家分享一些实用的谷歌Chrome ...

R语言实战（九）主成分和因子分析

R语言实战（九）主成分和因子分析的更多相关文章

随机推荐

热门专题