DEPICT实现基因优化（gene prioritization）、gene set富集分析（geneset enrichment）、组织富集分析（tissue enrichment）

橙子牛奶糖 2024-10-31 21:55:02 原文

全基因组关联分析除了找到显著的关联位点，我们还可以做基因优化、geneset富集分析、组织富集分析，下面具体讲一讲怎么利用GWAS的summary数据做这个分析。

summary数据就是关联分析的结果文件

1 软件安装前请确保需要满足的系统环境

1.1 支持Mac OS X 或者 UNIX，不支持windows系统

1.2 Java SE 6（或者更高），没有安装Java请自行安装

1.3 需要PIP

怎么确定系统有没有安装PIP呢，输入命令which pip,如果没有路径弹出，说明没有PIP，需要安装

1.4 需要Python依赖包

pip install intervaltree

或者

conda install -c conda-forge intervaltree

1.5 需要Pandas包（0.15.2或者以上版本）

pip install pandas

1.6 PLINK(1.9 版本)

1.7 python(2.7 版本)

2 下载、安装

wget http://www.broadinstitute.org/mpg/depict/depict_download/bundles/DEPICT_v1_rel194.tar.gz

tar -zxvf DEPICT_v1_rel194.tar.gz

3 测试depict能否运行

cd DEPICT

./src/python/depict.py ./example/ldl_teslovich_nature2010.cfg

如果这一步没有报错，说明环境配置没有问题，可以开始分析自己的数据啦

4 准备一份新的cfg文件

拷贝yourtrait.cfg文件

cp ldl_teslovich_nature2010.cfg yourtrait.cfg

编辑yourtrait.cfg文件

vi yourtrait.cfg

vi进去后，yourtrait.cfg文件有几处需要修改

4.1 修改summary文件，这个summary文件即为你想分析的表型关联分析文件，在这里，假定叫做yourtrait.glm.linear，注意前面要加上绝对路径

gwas_summary_statistics_file: /your/path/to/summary/file/yourtrait.glm.linear

4.2 修改输出文件名，文件名按你喜欢修改，这里依旧假定命名为yourtrait

label_for_output_files: yourtrait

4.3 修改P值名称，如果yourtrait.glm.linear的P值用P表示的话

pvalue_col_name: P

4.4 修改染色体名称，如果yourtrait.glm.linear的染色体用Chr表示的话

chr_col_name: Chr

4.4 修改位置名称，如果yourtrait.glm.linear的位置用Pos表示的话

pos_col_name: Pos

4.5 添加PLINK软件的绝对路径，PLINK在你系统的哪个位置就写上哪里

plink_executable: /your/path/to/plink/plink

4.6 添加plink格式的genotype数据

genotype_data_plink_prefix: /your/path/to/genotype/yourtrait_genotype

修改好以上数据后，保存退出文件:wq

5 跑数据

./src/python/depict.py yourtrait.cfg

6 生成文件

生成的文件分别为loci.txt，geneprioritization.txt, genesetenrichment.txt , tissueenrichment.txt,其中，geneprioritization.txt, genesetenrichment.txt , tissueenrichment.txt即为我们感兴趣的基因优化，geneset富集分析，组织富集分析

7 画图

Rscript ./DEPICT/src/python/tissue_plot.R ./DEPICT/example/ldl_teslovich_nature2010_tissueenrichment.txt ldl_teslovich

DEPICT实现基因优化（gene prioritization）、gene set富集分析（geneset enrichment）、组织富集分析（tissue enrichment）的更多相关文章

简述项目中优化sql的方法,从哪些方面,sql语句性能如何分析?
查询速度慢的原因很多,常见如下几种 : .没有索引或者没有用到索引(这是查询慢最常见的问题,是程序设计的缺陷) .I/O吞吐量小,形成了瓶颈效应. .没有创建计算列导致查询不优化. .内存不足 .网络 ...
Android布局优化之ViewStub、include、merge使用与源码分析
在开发中UI布局是我们都会遇到的问题,随着UI越来越多,布局的重复性.复杂度也会随之增长.Android官方给了几个优化的方法,但是网络上的资料基本上都是对官方资料的翻译,这些资料都特别的简单,经常会 ...
全基因组关联分析学习资料（GWAS tutorial）
前言很多人问我有没有关于全基因组关联分析(GWAS)原理的书籍或者文章推荐. 其实我个人觉得,做这个分析,先从跑流程开始,再去看原理. 为什么这么说呢,因为对于初学者来说,跑流程就像一个大黑洞,学习 ...
variant变异 | Epigenome表观基因组 | Disease-susceptible gene 疾病易感基因
paper:cepip: context-dependent epigenomic weighting for prioritization of regulatory variants and di ...
GSEA - Gene set enrichment analysis 基因集富集 | ORA - Over-Representation Analysis 分析原理与应用
RNA-seq是利器,大部分做实验的老板手下都有大量转录组数据,所以RNA-seq的分析需求应该是很大的(大部分的生信从业人员应该都差不多要沾边吧). 普通的转录组套路并不多,差异表达基因.富集分析. ...
gene Ontology （基因本体论）
gene ontology为了查找某个研究领域的相关信息,生物学家往往要花费大量的时间,更糟糕的是,不同的生物学数据库可能会使用不同的术语,好比是一些方言一样,这让信息查找更加麻烦,尤其是使得机器查找 ...
Isotig & cDNA & gene structure & alternative splicing & gene loci & 表达谱
参考:高通量测序相关名词 Isotig 指在转录组de novo测序时,用454平台测序完成后组装出的结果,一个isotig可视为一个转录本. Isogroup 指转录组de novo测序中,用454 ...
无生物学重复RNA-seq分析 CORNAS: coverage-dependent RNA-Seq analysis of gene expression data without biological replicates
无生物学重复RNA-seq分析 CORNAS: coverage-dependent RNA-Seq analysis of gene expression data without biologic ...
动态规划(DP)，Human Gene Functions
题目链接:http://acm.zju.edu.cn/onlinejudge/showProblem.do?problemCode=1027 http://poj.org/problem?id=108 ...

随机推荐

Pure C static coding analysis tools
Cppcheck - A tool for static C/C++ code analysiscppcheck.sourceforge.netCppcheck is a static analysi ...
CentOS7卸载 OpenJDK 安装Sun的JDK8
Linux上一般会安装Open JDK,关于OpenJDK和JDK的区别:http://www.cnblogs.com/sxdcgaq8080/p/7487369.html 下面开始安装步骤: --- ...
[POJ2083] Fracal
Description A fractal is an object or quantity that displays self-similarity, in a somewhat technica ...
Python 通过lxml遍历html xpath
#coding:utf-8 ''' Created on 2017年10月9日 @author: li.liu ''' from selenium import webdriver from lxml ...
python开发笔记-类
类的基本概念: 问题空间:问题空间是问题解决者对一个问题所达到的全部认识状态,它是由问题解决者利用问题所包含的信息和已贮存的信息主动的地构成的. 初始状态:一开始时的不完全的信息或令人不满意的状况: ...
OKR的两个基本原则
<启示录>作者,前易贝高级副总裁,硅谷产品集团创始人马蒂·卡根在<OKR工作法>的序言中提到了目标管理法的两个原则: 不要告诉下属具体怎么做,要告诉他们你要什么,他们就会给你满 ...
Python爬虫 | Beautifulsoup解析html页面
引入大多数情况下的需求,我们都会指定去使用聚焦爬虫,也就是爬取页面中指定部分的数据值,而不是整个页面的数据.因此,在聚焦爬虫中使用数据解析.所以,我们的数据爬取的流程为: 指定url 基于reque ...
WinDbg常用命令系列---单步执行p*
p (Step) p命令执行单个指令或源代码行,并可选地显示所有寄存器和标志的结果值.当子例程调用或中断发生时,它们被视为单个步骤. 用户模式: [~Thread] p[r] [= StartAddr ...
PHP 之循环创建文件夹
/** * 循环创建文件夹 * @param string $dir 需要创建的文件夹路径 * @param integer $mode 文件夹权限 * @return bool 返回创建是否成功 * ...
vuejs cli3 env配置文件实践指南
env文件配置四个环境名字分别 VUE_APP_ENV=dev 只支持:VUE_APP_ 开头,比如设置其它变量 VUE_APP_NAME=stark package.json 配置方式 &quo ...