R语言实战(九)主成分和因子分析
本文对应《R语言实战》第14章:主成分和因子分析
主成分分析(PCA)是一种数据降维技巧,它能将大量相关变量转化为一组很少的不相关变量,这些无关变量成为主成分。
探索性因子分析(EFA)是一系列用来发现一组变量的潜在结构的方法。通过寻找一组更小的、潜在的或隐藏的结构来解释已观测到的、显式的变量间的关系。
这两种方法都需要大样本来支撑稳定的结果,但是多大是足够的也是一个复杂的问题。目前,数据分析师常使用经验法则:因子分析需要5~10倍于变量数的样本数。另外有研究表明,所需样本量依赖于因子数目、与各因子相关联的变量数,以及因子对变量方差的解释程度。
基础安装包里有princomp()函数可以做主成分分析,factanal()函数可以做因子分析。
另外有psych包,提供以下函数:
|
函数 |
描述 |
|
principal() |
含多种可选的方差旋转方法的主成分分析 |
|
fa() |
可用主轴、最小残差、加权最小平方或最大似然法估计的因子分析 |
|
fa.parallel() |
含平行分析的碎石图 |
|
factor.plot() |
绘制因子分析或主成分分析的结果 |
|
fa.diagram() |
绘制因子分析或主成分的载荷矩阵 |
|
scree() |
因子分析和主成分分析的碎石图 |
主要步骤:
1. 数据预处理
需要确保数据中没有缺失值
2. 选择因子模型
判断是PCA(数据降维)还是EFA(发现潜在结构)更符合你的研究目标。如果选择EFA方法,还需要选择一种估计因子模型的方法(如最大似然估计)
3. 判断要选择的主成分/因子数目
4. 选择主成分/因子
5. 旋转主成分/因子
6. 解释结果
7. 计算主成分或因子得分
=========================================================================
主成分分析:
PCA的目标是用一组较少的不相关变量代替大量相关变量,同时尽可能保留初始变量的信息,这些推导所得的变量成为主成分,它们是观测变量的线性组合。各主成分互相正交。
判断主成分的个数准则:
- 根据先验经验和理论知识判断主成分数
- 根据要解释变量方差的积累值的阈值来判断需要的主成分数
- 通过检查变量间k*k的相关系数矩阵来判断保留的主成分数
最常见的是基于特征值的方法。每个主成分都与相关系数矩阵的特征值相关联,第一主成分与最大的特征值相关联,第二主成分与第二大的特征值相关联,依次类推。Kaiser-Harris准则建议保留特征值大于1的主成分,因为特征值小于1的成分所解释的方差比包含在单个变量中的方差更少。Cattell碎石检验则绘制了特征值与主成分数的图形。这类图形可以清晰地展示图形弯曲状况,在图形变化最大处之上的主成分都可以保留。最后,还可以进行模拟,依据与初始矩阵相同大小的随机数据矩阵来判断要提取的特征值。若基于真实数据的某个特征值大于一组随机数据矩阵相应的平均特征值,那么该主成分可以保留。这种方法称为平行分析。
#展示基于观测特征值的碎石检验(线段与x符号组成)、根据100个随机数据矩阵推导出来的特征值均值(虚线),以及大于1的特征值准则(y=1的水平线)
library(psych)
fa.parallel(USJudgeRatings[, -1], fa = “PC”, n.iter = 100, show.legend = FALSE,
main = “Scree plot with parallel analysis”)
提取主成分:
principal(r, nfactors = , rotate = , scores = )
其中r是相关系数矩阵或原始数据矩阵;
nfactors设定主成分数(默认为1);
rotate指定旋转的方法(默认为最大方差旋转,varimax);
scores设定是否需要计算主成分得分(默认不需要)。
输出解释:
PC1(或PC2…)栏包含了成分载荷,指观测变量与主成分的相关系数。可用来解释主成分的含义,是一个可用来进行一般性评价的维度。
h2栏指成分公因子方差:主成分对每个变量的方差解释度;
u2栏指成分唯一性(1-h2):方差无法被主成分解释的比例;
SS loadings行包含了与主成分相关联的特征值,指的是与特定主成分相关联的标准化后的方差值。
Proportion Var行表示的是每个主成分对整个数据集的解释程度。
主成分旋转:
当提取了多个成分时,对它们进行旋转可使结果更具解释性。
旋转是一系列将成分载荷变得更容易解释的数学方法,它们尽可能地对成分去噪。
旋转方法有两种:使选择的成分保持不相关(正交旋转);让它们变得相关(斜交旋转)。
最流行的正交旋转是方差极大旋转,它试图对载荷阵的列进行去噪,使得每个成分只是由一组有限的变量来解释(即载荷阵每列只有少数几个很大的载荷,其他都是很小的载荷)。(具体例子参见书305页)
由于最终目标是用一组较少的变量替换一组较多的相关变量,因此还需要获取每个观测在成分上的得分。
获取主成分得分的方法:
第一种情况是,只有一个主成分,此时设置score = TRUE即可得到主成分得分;
第二种情况是,基于相关系数矩阵的主成分分析,虽然原始数据不可用,但是可以得到用来计算主成分得分的系数。为了简化计算,通常将接近0的系数直接看作是0。
=========================================================================
探索性因子分析:
目标是通过发掘隐藏在数据下的一组较少的、更为基本的无法观测的变量,来解释一组可观测变量的相关性。这些虚拟的、无法观测的变量称作因子。(每个因子被认为可以解释多个观测变量间共有的方差,因此准确来说,它们应该称作公共因子)
同样的,需要判断需提取的公共因子数:
值得注意的是,当三种原则摇摆不定时,高估因子数通常比低估因子数的结果好。另外,Kaiser-Harris准则的特征值数大于0而不是1(图中的水平线)。
提取公共因子:
fa(r, nfactors = , n.obs = , rotate = , scores = , fm = )
r是相关系数矩阵或者原始数据矩阵;
nfactors设定提取的因子数(默认为1);
n.obs是观测数(输入相关系数矩阵时需要填写);
rotate设定旋转的方法(默认互变异数最小法);
scores设定是否计算因子得分(默认不计算);
fm设定因子化方法(默认极小残差法)。
提取公共因子的方法有很多,包括最大似然法(ml)、主轴迭代法(pa)、加权最小二乘法(wls)、广义加权最小二乘法(gls)和最小残差法(minres)。最大似然法有良好的统计性质,但是有时最大似然法不会收敛,此时采用主轴迭代法会有好效果。
因子旋转:
正交与斜交旋转,具体例子参考书310页。
两者不同之处:对于正交旋转,因子分析的重点在于因子结构矩阵(变量与因子的相关系数),而对于斜交旋转,因子分析会考虑三个矩阵:因子结构矩阵、因子模式矩阵和因子关联矩阵。
因子模式矩阵即标准化的回归系数矩阵,它列出了因子预测变量的权重。因子关联矩阵即因子相关系数矩阵。
因子结构矩阵(即因子载荷矩阵)一般不会列出来,但是可以计算得到,公式为F = P * Phi,其中F是因子载荷阵,P为因子模式矩阵,Phi为因子关联矩阵。(例子可以参考311页)
因子得分:
相比PCA,EFA并不那么关注计算因子得分。在fa()函数中添加score = TRUE即可得到因子得分。另外还可以得到得分系数(标准化的回归权重),它在返回对象的weights元素中。
其他与EFA相关的包:
FactoMineR: 提供PCA和FEA方法,潜变量模型,并有更多参数选项;
FAiR: 使用遗传算法估计因子分析模型,增强了模型参数的估计能力,能够处理不等式的约束条件;
GPArotation: 提供多种因子旋转方法;
nFactors: 提供了用来判断因子数目的许多复杂方法。
其他潜变量模型:
CFA(验证性因子分析)是结构方程模型(SEM)中的一种方法。SEM不仅可以假定潜在因子的数目以及组成,还能假定因子间的影响方式。可以将SEM看做是验证性因子分析(对变量)和回归分析(对因子)的组合,它的结果输出包含统计检验和拟合度的指标。具体实现方式有sem包,openMx包,lavaan包。
ltm包可以用来拟合测验和问卷中各项目的潜变量模型。
潜类别模型(潜在的因子被认为是类别型而非连续型)可通过FlexMix, lcmm, randomLCA, poLC包进行拟合。lcda包可做潜类别判别分析,lsa包可做潜在语义分析。
ca包提供了可做简单和多重对应分析的函数。
另外MDS(多维标度法)可以用来发现解释相似性和可测对象间距离的潜在维度。基础安装的cmdscale()函数可以实现经典MDS,MASS包里的isoMDS()函数可以做非线性MDS。
小结:

R语言实战(九)主成分和因子分析的更多相关文章
- R in action读书笔记(19)第十四章 主成分和因子分析
第十四章:主成分和因子分析 本章内容 主成分分析 探索性因子分析 其他潜变量模型 主成分分析(PCA)是一种数据降维技巧,它能将大量相关变量转化为一组很少的不相关变量,这些无关变量称为主成分.探索性因 ...
- R 语言实战-Part 4 笔记
R 语言实战(第二版) part 4 高级方法 -------------第13章 广义线性模型------------------ #前面分析了线性模型中的回归和方差分析,前提都是假设因变量服从正态 ...
- R语言实战
教材目录 第一部分 入门 第一章 R语言介绍 第二章 创建数据集 第三章 图形初阶 第四章 基本数据管理 第五章 高级数据管理 第二部分 基本方法 第六章 基本图形 第七章 基本统计方法 第三部分 中 ...
- R 语言实战-Part 3 笔记
R 语言实战(第二版) part 3 中级方法 -------------第8章 回归------------------ #概念:用一个或多个自变量(预测变量)来预测因变量(响应变量)的方法 #最常 ...
- R语言实战(一)介绍、数据集与图形初阶
本文对应<R语言实战>前3章,因为里面大部分内容已经比较熟悉,所以在这里只是起一个索引的作用. 第1章 R语言介绍 获取帮助函数 help(), ? 查看函数帮助 exampl ...
- R语言实战(四)回归
本文对应<R语言实战>第8章:回归 回归是一个广义的概念,通指那些用一个或多个预测变量(也称自变量或解释变量)来预测响应变量(也称因变量.效标变量或结果变量)的方法.通常,回归分析可以用来 ...
- R语言实战(五)方差分析与功效分析
本文对应<R语言实战>第9章:方差分析:第10章:功效分析 ================================================================ ...
- R语言实战(七)图形进阶
本文对应<R语言实战>第11章:中级绘图:第16章:高级图形进阶 基础图形一章,侧重展示单类别型或连续型变量的分布情况:中级绘图一章,侧重展示双变量间关系(二元关系)和多变量间关系(多元关 ...
- R 语言实战-Part 5-1笔记
R 语言实战(第二版) part 5-1 技能拓展 ----------第19章 使用ggplot2进行高级绘图------------------------- #R的四种图形系统: #①base: ...
随机推荐
- presto架构和原理
Presto 是 Facebook 推出的一个基于Java开发的大数据分布式 SQL 查询引擎,可对从数 G 到数 P 的大数据进行交互式的查询,查询的速度达到商业数据仓库的级别,据称该引擎的性能是 ...
- asp.net菜鸟到中级程序员的飞跃 --30本好书点评
如果你是一个菜鸟或者自认为初学者那么本文非常适合你:不能说这30本书就是最佳组合,但是可以说这个组合不差:本人曾博览群书,很多书重复,很多书讲的不适用,这些书都是目前书店可以买到的:达到中级程序员以后 ...
- 20155226 2016-2017-2 《Java程序设计》第5周学习总结
20155226 2016-2017-2 <Java程序设计>第5周学习总结 教材学习内容总结 语法与继承构架 我们之前接触到的C通常都是将程序流程和错误处理混在一起,在编写程序的时候必须 ...
- Linux的基础优化
归结成口诀: 一清.一精.一增.两优.四设.七其他 一清: 定时清理日志 一精: 精简开机启动服务 一增: 增大文件描述符 两优: linux内核参数的优化.yum源优化 四设:设置系统的字符集.设置 ...
- 工具_HBuilder工具使用技巧
https://www.cnblogs.com/xiaohouzai/p/7696152.html
- HTTP请求方法 之 HEAD
HTTP请求方法并不是只有GET和POST,只是最常用的.据RFC2616标准(现行的HTTP/1.1)得知,通常有以下8种方法:OPTIONS.GET.HEAD.POST.PUT.DELETE.TR ...
- imperva 默认策略添加例外
创建违规访问 检查违规的告警类型 假如客户的这个目录下真的有这个文件,而且客户非常明确这是一个正常且安全的东西怎么办?我该如何的将它添加到例外? 添加例外的步骤: 再次构造违规的请求: 默认策略添加例 ...
- 【Linux技术】ubuntu常用命令【转】
转自:http://www.cnblogs.com/lcw/p/3159462.html 查看软件xxx安装内容:dpkg -L xxx查找软件库中的软件:apt-cache search 正则表达式 ...
- 十分钟搞懂快速傅里叶变换(FFT)
己学习的笔记,欢迎大家指正.
- Python之 Lambda表达式
标签(空格分隔): Python进阶 Lambda是一种匿名函数,当我们需要重复调用某一函数,又不想写那么多代码时可以使用lambda表达式来代替. lambda的通用格式: lambda argum ...