GWAS分析基本流程及分析思路

数据预处理（DNA genotyping、Quality control、Imputation）

QC的工作可以做PLINK上完成Imputation的工作用IMPUTE2完成

2. 表型数据统计分析

逻辑回归（表型数据为二元）
线性回归（表型数据为连续性变量）
表型数据正态分析（如果不是正态分布，需转换处理为正态分布）
表型数据均值、中值、最大值、最小值
影响因子对表型的影响分析

3.画曼哈顿图（GWAS）和QQ plot图

(一)、准备plink文件
（1）、准备PED文件

PED文件有六列，六列内容如下：Family IDIndividual IDPaternal IDMaternal IDSex (1=male; 2=female; other=unknown)PhenotypePED文件是空格（空格或制表符）分隔的文件。
（2）、准备MAP文件

MAP文件有四列，四列内容如下：chromosome (1-22, X, Y or 0 if unplaced)rs# or snp identifierGenetic distance (morgans)Base-pair position (bp units)
（3）、生成bed、fam、bim、文件
在plink中输入命令：plink --file mydata --out mydata --make-bedplink指的是plink软件，如果软件安装在某个指定的路径的话，前面还要加上路径，比如安装在路径为/your/pathway/的文件夹下，则命令应该为“/your/pathway/plink --file mydata --out mydata --make-bed”mydata指的是1和2生成的PED和MAP文件名，不需要写.ped和.map后缀
（二）、准备表型文件（Alternate phenotype files）

一般表型文件为txt格式，表型文件有三列，分别为：Family IDIndividual IDPhenotype假如有多种表型，第一列和第二列还是Family ID、Individual ID，第三列及以后的每列都是表型，例如以下：Family IDIndividual IDPhenotype APhenotype BPhenotype CPhenotype DPhenotype E……
（三）、准备协变量文件（Covariate files）

协变量文件同表型文件类似，第一列和第二列是Family ID、Individual ID，第三列及以后的每列都是协变量Family IDIndividual IDCovariate ACovariate BCovariate CCovariate DCovariate E……
（四）、plink进行表型和基因型以及协变量的关联分析

命令如下：plink --bfile mydata --linear --pheno pheno.txt --mpheno 1 --covar covar.txt --covar-number 1,2,3 --out mydata –noweb生成的文件为mydata.assoc.linear注：“mydata”mydata文件不需要后缀，“--mpheno 1”指的是表型文件的第三列（即第一个表型）“--covar-number 1,2,3”指的是协变量文件的第三列、第四列、第五列（即第一个、第二个、第三个协变量）“--linear”指的是用的连续型线性回归，如果表型为二项式（即0、1）类型，则用“--logistic”
（五）、画曼哈顿图(GWAS)图

安装R语言的CpGassoc包，其中的manhattan()，即可画曼哈顿图
（六）、画QQ plot图

R语言中的 qqnorm() 和 qqplot() 包提供了QQ plot的画法，具体自行搜索用法；

4. GWAS进阶分析

群体分层分析，Population Stratification

如果研究的群体是混合群体，遗传异质性高，存在群体分层现象，易造成实验的误差或者检测出假阳性位点。因此检测群体分层对效应值的影响是非常必要的。
不同群体重复验证分析，Replication
Regional association plots

用LocusZoom(http://csg.sph.umich.edu/locuszoom/)画出来的
相似条件分析，Approximate conditional analysis

相似条件分析的目的是，去掉lead SNPs后，再跑一次GWAS关联分析，以此找到更多有强关联的信号。
连锁不平衡得分评估表型间遗传相关性，Linkage-disequilibrium score regression

遗传相关性 genetic correlation，这是指在杂种群体表型间的相关性中，由基因型所产生的相关性。遗传相关是仅由遗传原因引起的相关。
基因富集分析，Gene setenrichment analysis

从文献，GTEX、 GEUVADIS等据数据找到与 Lead SNPs 关系很大的基因、变异等，以及与 Lead SNPs 连锁不平衡分析r2大于0.8的SNP，则这些SNP的基因可以作为候选基因。汇总了所有的候选基因后，在GOTERM、KEGG、Panther等数据库分析这些候选基因的富集分析。
层次聚类分析，Hierarchicalclustering

层次聚类分析的作用是更进一步看出研究的表型相关的 lead SNPs与其他表型的相关性；
蛋白质-蛋白质互作网络分析，Protein–proteininteraction network analyses

蛋白质互作网络的目的是看哪些蛋白共同调控了表型
Point ofcontact analyses

Point of contact analyses的作用是哪些位点导致了表型间有相关性

参考文献：
Horikoshi, Momoko, et al. "Genome-wide associations for birth weight and correlations with adult disease." Nature 538.7624 (2016): 248.
Okbay A, Beauchamp J P, Fontana M A, et al. Genome-wide association study identifies 74 loci associated with educational attainment[J]. Nature, 2016, 533(7604): 539.

GWAS分析基本流程及分析思路的更多相关文章

Ecshop的购物流程代码分析详细说明
Ecshop的购物流程代码分析详细说明 (2012-07-30 10:41:12) 转载▼ 标签: 购物车结算中心商品价格 ecshop ecshop购物流程杂谈分类: ECSHOP研究院同 ...
Raid1源代码分析--写流程
正确写流程的总体步骤是,raid1接收上层的写bio,申请一个r1_bio结构,将其中的所有bios[]指向该bio.假设盘阵中有N块盘.然后克隆N份上层的bio结构,并分别将每个bios[]指向克隆 ...
通过官方API结合源码，如何分析程序流程
通过官方API结合源码,如何分析程序流程通过官方API找到我们关注的API的某个方法,然后把整个流程执行起来,然后在idea中,把我们关注的方法打上断点,然后通过Step Out,从内向外一层一层分析 ...
Openfire注册流程代码分析
Openfire注册流程代码分析一.客户端/服务端注册用户流程经过主机连接消息确认后,客户端共发送俩条XML完成注册过程.服务器返回两条XML. 注:IQ消息节点用于处理用户的注册.好友.分组.获 ...
Linux Kernel文件系统写I/O流程代码分析（二）bdi_writeback
Linux Kernel文件系统写I/O流程代码分析(二)bdi_writeback 上一篇# Linux Kernel文件系统写I/O流程代码分析(一),我们看到Buffered IO,写操作写入到 ...
Linux Kernel文件系统写I/O流程代码分析（一）
Linux Kernel文件系统写I/O流程代码分析(一) 在Linux VFS机制简析(二)这篇博客上介绍了struct address_space_operations里底层文件系统需要实现的操作 ...
Flink 源码解析 —— Standalone Session Cluster 启动流程深度分析之 Job Manager 启动
Job Manager 启动 https://t.zsxq.com/AurR3rN 博客 1.Flink 从0到1学习 -- Apache Flink 介绍 2.Flink 从0到1学习 -- Mac ...
Flink 源码解析 —— Standalone Session Cluster 启动流程深度分析之 Task Manager 启动
Task Manager 启动 https://t.zsxq.com/qjEUFau 博客 1.Flink 从0到1学习 -- Apache Flink 介绍 2.Flink 从0到1学习 -- Ma ...
Okhttp3源码解析(3)-Call分析(整体流程)
### 前言前面我们讲了 [Okhttp的基本用法](https://www.jianshu.com/p/8e404d9c160f) [Okhttp3源码解析(1)-OkHttpClient分析]( ...

随机推荐

Docker 创建 Jira Core(Jira SoftWare) 7.12.3 中文版
目录目录 1.介绍 1.1.什么是 JIRA Core? 1.2.什么是 JIRA SoftWare 2.JIRA 的官网在哪里? 3.如何下载安装? 4.对 JIRA 进行配置 4.1.JIRA ...
06-Nodejs介绍
06-Nodejs介绍打开Nodejs英文网:https://nodejs.org/en/ 中文网:http://nodejs.cn/ 我们会发现这样一句话: 翻译成中文如下: Node.js 是一 ...
Delphi连接MySql（待测试验证，使用mysql.pas未通过）
要在一个Delphi程序中调用Mysql数据库,查到有个资料如下,待验证,验证后会给出结果.暂时做个标记已经验证,验证日期:2018.6.18 验证结果:不可行验证工具:XE7,mysql5.5. ...
navicat 将自增长字段重置（重新从1开始）的方法
先说明,此语句会将你的表中数据全部删除. 很简单,运行如下sql语句: TRUNCATE TABLE 表名;
spring boot 中使用 jpa以及jpa介绍
1.什么是jpa呢?JPA顾名思义就是Java Persistence API的意思,是JDK 5.0注解或XML描述对象-关系表的映射关系,并将运行期的实体对象持久化到数据库中.12.jpa具有什么 ...
PowerDesigner导出SQL，注释为空时以name代替
版本操作步骤打开Edit Current DBMS 选中Script->Objects->Column->Add 将Value中的内容全部替换为如下 %20:COLUMN% [% ...
Django--用户认证组件auth（登录用-依赖session，其他用）
一.用户认证组件auth介绍二.auth_user表添加用户信息三.auth使用示例四.auth封装的认证装饰器一.用户认证组件auth介绍解决的问题: 之前是把is_login=True放 ...
爬虫系列---scrapy post请求、框架组件和下载中间件+boss直聘爬取
一 Post 请求在爬虫文件中重写父类的start_requests(self)方法父类方法源码(Request): def start_requests(self): for url in se ...
RPC是什么？
初学微服务,一点会问RPC是什么,通常网上的资料会说,是一种协议,然后说得很复杂,一堆概念,拜托,我只是想知道RPC是什么,而不是怎么实现怎么做. RPC就是想实现函数调用模式的网络化,A服务(微 ...
监控glusterfs
监控集群状态 [4ajr@elk1 scripts]$ cat glusterfs_peer_status.sh #!/bin/bash peer_status=`sudo gluster peer ...

GWAS分析基本流程及分析思路

GWAS分析基本流程及分析思路的更多相关文章

随机推荐

热门专题