admixture 群体结构分析

tructure是与PCA、进化树相似的方法，就是利用分子标记的基因型信息对一组样本进行分类，分子标记可以是SNP、indel、SSR。相比于PCA，进化树，群体结构分析可明确各个群之间是否存在交流及交流程度

1 软件安装

conda install -c bioconda admixture

admixture

****                   ADMIXTURE Version 1.3.0                  ****

****                    Copyright 2008-2015                     ****

****           David Alexander, Suyash Shringarpure,            ****

****                John  Novembre, Ken Lange                   ****

****                                                            ****

****                 Please cite our paper!                     ****

****   Information at www.genetics.ucla.edu/software/admixture  ****

Usage: admixture <input file> <K>

See --help or manual for more advanced usage.

2 简单使用

第一步：将VCF变为plink格式

## vcftools

vcftools --gzvcf SNP.vcf.gz --plink --out test

## 没有压缩，则为--vcf

## 或者plink 直接转

plink --vcf SNP.vcf.gz--recode --out test--const-fid --allow-extra-chr

 # --vcf vcf 或者vcf.gz

 # --recode 输出格式ped（默认bed）

 # --out 输入前缀

 # --const-fid  添加群体信息familyID sampleID）(将family设置为0)；

 # --allow-extra-chr 允许非标准染色体编号

$\color{red}{**}$plink转化，map文件，SNP那列为点,vcftools 则不是，但是ref为0

# 如果用vcftools转换, 重新添加染色体

paste <(cut -f2 Test.map |awk -F ":" '{print $1}') <(cut -f2-4 Apple.map)  >map

## 如果用plink 转换, 重新添加SNP编号

awk '{x+=1}{print $1"\tSNP"x"\t"$3"\t"$4}' Test.map >map

#重命名

mv map Test.map

因为plink本身是针对人类进行开发的，所以在运行时，加上--allow-extr-chr。此外对于vcf中的sampleID（familyID_sampleID）, plink 默认为下划线分隔（也可以通过参数--id-delim进行修改），分别作为family ID和sampleID。但是一般我们的样本并不是那样命名的，所以可以添加--double-id参数，将familyID和sampleID命名为相同，或者--const-fid,将familyID命名为0，表明-9

第二步 plink进行过滤，得到bed文件

plink --allow-extra-chr --noweb -file test --geno 0.05 --maf 0.05 --hwe 0.0001 --make-bed --out test1

# --noweb 不显示网页

第三步：寻找合适的K值

for i in {1..7};do admixture --cv test1.bed $i |tee log${i}.out;done

## 根据CV error 确定K值

grep -h 'CV'  log*.out

CV error (K=1): 0.22317

CV error (K=2): 0.15018

CV error (K=3): 0.12804

CV error (K=4): 0.12109

CV error (K=5): 0.12656

当k=4时，cv error 最小，选择4

此外，

如果SNP数据集非常大，则可以随机选择SNP进行K值选择分析，比如随机选取20000个SNP进行分析，每个K值跑20次，确定最终的k值，然后分析

当利用plink转的格式中，在运行上述命令是出现以下报错

Invalid chromosome code!  Use integers

将*.bim中的第一列改为数值就可以了

第四步：多线程

admixture test1.bed 4 -j 5

## j， 线程数

第五步：作图

ta1 = read.table("test1.4.Q")

head(ta1)

barplot(t(as.matrix(ta1)),col = rainbow(3),

        xlab = "Individual",

        ylab = "Ancestry",

        border = NA)

根据LD进行筛选SNP

首先筛选合格的LD位点

## 对vcf进行

plink --vcf SNP.vcf.gz --indep-pairwise 100 50 0.2 -out Test-id-maf0.05-LD --allow-extra-chr

## 或者对bed进行操作也可以

plink --bfile  test1 --indep-pairwise 100 50 0.2

## --indep-pairwise 100 50 0.2； 100Kb窗口，50步长，0.2LD强度

然后进行提取

plink  --bfile test1 --extract plink.prune.in --make-bed --out test2

然后在进行和上述一样的分析即可

欢迎扫码交流

参考

--Admixture使用说明文档cookbook

admixture 群体结构分析的更多相关文章

重测序（RADseq）做群体遗传分析套路
实验材料构建的群体,或自然群体,如各地方品种. RAD文库构建提取DNA后,构建文库,简要步骤如下: ① 限制性内切酶TaqI酶切: ② 连接P1接头: ③ DNA随机打断片断化: ④ 目的片段回 ...
【GWAS文献】基于GWAS与群体进化分析挖掘大豆相关基因
Resequencing 302 wild and cultivated accessions identifies genes related to domestication and improv ...
【转】群体研究套路：开心果denovo+重测序+转录组+群体进化+选择位点
转自公众号Eric生信小班.学习群体遗传套路中科院昆明动物园吴东东研究团队联合国外研究团队2019年在Genome Biology发表题为Whole genomes and transcriptom ...
群体结构图形三剑客——PCA图
重测序便宜了,群体的测序和分析也多了起来.群体结构分析,是重测序最常见的分析内容.群体结构分析应用十分广泛,首先其本身是群体进化关系分析里面最基础的分析内容,其次在进行GWAS分析的时候,本身也需要使 ...
【豆科基因组】大豆(Soybean, Glycine max)泛基因组2020Cell
目录一.前沿概述二.主要结果重测序.组装与注释泛基因组 SV特征 PAV与古多倍化,WGD事件基因SV与基因融合 SV与大豆驯化 SV影响基因表达及其与性状关联一.前沿概述 Pan-Gen ...
【豆科基因组】大豆(Soybean, Glycine max)经典文章梳理2010-2020
目录 2010年1月:大豆基因组首次发表(Nature) 2010年12月:31个大豆基因组重测序(Nature Genetics) 2014年10月:野生大豆泛基因组(Nature Biotechn ...
【豆科基因组】大豆适应性位点GWAS分析 [转载]
目录材料与方法结果分析本文利用99085个高质量SNP 通过STRUCTURE,PCA和neighbour-joining tree的群体结构分析将地方品种分为三个亚群,这些亚群表现出地理上的遗 ...
【豆科基因组】利马豆/洋扁豆Lima bean(Phaseolus lunatus L.)基因组2021NC
目录一.来源二.结果扁豆的染色体水平高质量组装扁豆相关农艺性状的QTL定位直系/旁系同源的演化和物种形成事件与农艺性状相关基因的直系同源物群体结构分析揭示扁豆遗传簇豆荚发育过程中的基因 ...
SNP 过滤（二）
本文转载于https://www.jianshu.com/p/e6d5dd774c6e SNP位点过滤 SNP过滤有两种情况,一种是仅根据位点质量信息(测序深度,回帖质量等)对SNP进行粗过滤.如果使 ...

随机推荐

Coursera Deep Learning笔记序列模型（三）Sequence models & Attention mechanism(序列模型和注意力机制)
参考 1. 基础模型(Basic Model) Sequence to sequence模型(Seq2Seq) 从机器翻译到语音识别方面都有着广泛的应用. 举例: 该机器翻译问题,可以使用" ...
实用小工具：screen
实用小工具:screen 首先,吹爆screen screen,实现了不间断的会话服务,通过SSH连接至远程服务器,当使用了screen开启的会话,不会因为你断开SSH而中断在远程服务器上运行的命令. ...
Prometheus基于文件的服务发现
Prometheus基于文件的服务发现一.基于文件的服务发现 1.prometheus.yml 配置文件的写法 2.file_sd 目录下的文件 3.配置结果二.注意事项三.参考链接一.基于文 ...
震惊，hzoi的分差竟然折磨大，活到爆！
众所周知,hzoi的分差非常"大",那么究竟有多大呢?最近,一位外国小哥开发出了hzoi的分差竟然折磨大,活到爆!的方法,这究竟是怎么一回事呢?快和小编一起来看看吧- 竟然1分就可 ...
字符串与模式匹配算法（六）：Needleman–Wunsch算法
一.Needleman-Wunsch 算法尼德曼-翁施算法(英语:Needleman-Wunsch Algorithm)是基于生物信息学的知识来匹配蛋白序列或者DNA序列的算法.这是将动态算法应用于 ...
Asp.Net mvc4 +Spring
添加相应的引用对象.(以下全部) 修改mvc的Global.asax文件内容需要将控制器中原来需要new出来的对象改成属性成员添加这个属性的注入对象再去修改spring对web.config的一 ...
Get_init_color_map
#!/bin/bash./simulate_screencap.sh./analysis_screencap.py
IM服务器：开发一个高并发的IM服务器难在哪
IM服务器要实现的最基本功能就是消息的转发.--好像是一句废话! 这就意味着IM服务器要为每个登录用户创建一个与该用户信息相关的内存上下文,为方便描述我们在这里称之为:user_context.use ...
Web实时通信，SignalR真香，不用愁了
前言对于B/S模式的项目,基础的场景都是客户端发起请求,服务端返回响应结果就结束了一次连接:但在很多实际应用场景中,这种简单的请求和响应模式就显得很吃力,比如消息通知.监控看板信息自动刷新等实时通信 ...
Redis网络库源码分析(3)之ae.c
一.aeCreateEventLoop & aeCreateFileEvent 上一篇文章中,我们已经将服务器启动,只是其中有些细节我们跳过了,比如aeCreateEventLoop函数到底做 ...