NCBI SRA数据预处理
SRA数据的的处理流程大概如下
一、SRA数据下载、
NCBI 上存储的数据现在大都存储为SRA格式。
下载以后就是以SRA为后缀名。
这里可以通过三种方式下载SRA格式的数据。
1.通过http方式,2.通过ftp方式,3.通过Aspera
Aspera可以在NCBI网站上下载。
参阅:http://www.ncbi.nlm.nih.gov/books/NBK47540/
二、SRA格式转换成FASTQ格式
./fastq-dump -A SRR058977 ~/project/yanzi/data/GEO/SRA/SRR058977.sra
fastq-dump可以在ncbi官方网站下载,这里面包含一系列的转换工具;
参阅:http://www.ncbi.nlm.nih.gov/books/NBK56560/
http://eutils.ncbi.nih.gov/Traces/sra/?view=software
转换成FASTQ,SFF,lllumina native,AB SOLiD native等格式;
另,转换FASTQ以后要转换成FASTA 命令如下:
awk '{if(FNR%4==1) print ">",$0; else if(FNR%4==2) print $0;}' a.fastq >a.fasta
————————----------------------------------------------------------------
以上部分为预处理部分:
当然我做的方向是比对方向,就可以用fasta做比对工作了。
………………………………………………………………………………………………………………………………………………………………………………………………
后面还可以做其他反面的研究:
3.去接头(此步要注意是否有接头,一般RNA-SEQ数据应该是没有接头的)
4.用tophat寻找可变剪切
tophat -r 42 -G genome.fa -o PF genomeIndex SRR058977.fastq
5.用cufflinks找不同组织中的差异
cuffdiff genomeAnnotation.gff ../BF/accept.bam ./accept.bam
来源:http://blog.sciencenet.cn/blog-565558-626137.html
…………………………………………………………………………………………………………………………………………………………
可能会用到的修改目录权限的linux命令
Linux改变分区权限(简单好用版)
原理:
1.在Linux和Unix世界里,一切都是以文件的形式存在的。文件夹是文件,文件是文件,设备也是文件。
2.分区在挂载后,会在 /media/ 下以文件夹的形式显现
3.chmod用于修改权限 而chmod ugo+rwx 用于给所有的用户和用户组添加所有的权限
步骤:
1.假设需要修改权限的分区名为x
2.挂载x
3.赋权
代码:
sudo chmod ugo+rwx /media/x
NCBI SRA数据预处理的更多相关文章
- NCBI SRA数据如何进行md5校验?
下了一些sra数据库中的公共数据,因为pretech和aspera不稳定,稍微大点的文件经常传断,部分文件我只能通过本地下载再上传. 那么问题来了,sra没有md5校验,我怎么知道我数据的完整性,尤其 ...
- NCBI下载sra数据(新)
今天要上NCBI下载sra数据发现没有下载的链接,网上查发现都是老的方法,NCBI页面已经变更,于是看了NCBI的help,并且记录下来新版的sra数据下载方法,要用NCBI的工具SRA Tool ...
- NCBI下载SRA数据
从NCBI下载数据本来是一件很简单的事情,但是今天碰到几个坑: 1.paper里没有提供SRA数据号.也没有提供路径: 2.不知道文件在ftp的地址,不能直接用wget下载 所以通过在NCBI官网,直 ...
- 用R包来下载sra数据
1)介绍 我们用SRAdb library来对SRA数据进行处理. SRAdb 可以更方便更快的接入 metadata associated with submission, 包括study, sa ...
- NCBI SRA数据库使用详解
转:https://shengxin.ren/article/16 https://www.cnblogs.com/lmt921108/p/7442699.html 批量下载SRA http://ww ...
- <二代測序> 下载 NCBI sra 文件
本文近期更新地址: http://blog.csdn.net/tanzuozhev/article/details/51077222 随着測序技术的不断提高.二代測序数据成指数增长. NCBI提供了S ...
- NCBI SRA数据库
简介 SRA数据库是美国国立卫生研究院(NIH)的高通量测序数据的主要归档,是国际核苷酸序列数据库协作(INSDC)的一部分,其中包括NCBI序列读取存档(SRA),欧洲生物信息学研究所(EBI)和D ...
- 借助 SIMD 数据布局模板和数据预处理提高 SIMD 在动画中的使用效率
原文链接 简介 为发挥 SIMD1 的最大作用,除了对其进行矢量化处理2外,我们还需作出其他努力.可以尝试为循环添加 #pragma omp simd3,查看编译器是否成功进行矢量化,如果性能有所提升 ...
- R语言进行数据预处理wranging
R语言进行数据预处理wranging li_volleyball 2016年3月22日 data wrangling with R packages:tidyr dplyr Ground rules ...
随机推荐
- functools.wraps 带参数的装饰器 多个装饰器装饰同一个函数
装饰器开发原则 : 开放封闭原则装饰器的作用 :在不改变原函数的调用方式的情况下,在函数的前后添加功能装饰器的本质 : 闭包函数 def wrapper(func): def inner(*args, ...
- 【BZOJ 1449】 1449: [JSOI2009]球队收益 (最小费用流)
1449: [JSOI2009]球队收益 Time Limit: 5 Sec Memory Limit: 64 MBSubmit: 841 Solved: 483 Description Inpu ...
- CUDA学习笔记3:CUFFT(CUDA提供了封装好的CUFFT库)的使用例子
一.FFT介绍 傅里叶变换是数字信号处理领域一个很重要的数学变换,它用来实现将信号从时域到频域的变换,在物理学.数论.组合数学.信号处理.概率.统计.密码学.声学.光学等领域有广泛的应用.离散傅里叶变 ...
- CodeForces 1063B. Labyrinth 性质
给定$n *m$的格子 询问从$(r, c)$开始最多向左走$x$步,向右走$y$步 询问有多少个格子可以从$(r, c)$到达 有障碍物,$n, m \leqslant 2 * 10^3$ 对于一个 ...
- python开发_python代码风格(coding style)
我们要做python开发,我想python中的代码风格我们有必要了解一下 这样对我们自己和他们所编写的代码都有好处的. 下面是8点重要代码风格注意事项: ONE : Use 4-space inden ...
- Ruby入门(1)——windows下Ruby开发环境搭建
1.获得和安装Ruby1.1 获取Ruby 1) 从 http://www.ruby-lang.org/en/downloads/ 下载Source Code或者RubyInstaller ...
- object-c的http post请求之 ASIFormDataRequest使用
ASIHTTPRequest类库中的ASIFormDataRequest是实现HTTP协议中的处理POST表单的很好的类库.使用起来非常简单. 在说明之前先需要了解HTTP请求的Get和Post方法. ...
- mysql localhost登录和tcp/ip登录 strace
http://blog.itpub.net/15480802/viewspace-1755100/
- 在w7下的wamp中配置memcache
php版本是5.4.16 ,我的电脑是w7 64位的. 一. memcache和memcached的区别 在自己的新程序中打算全面应用memcached技术,这个很容易理解这是memcached是内 ...
- Fiddler2 中文手册
原文:http://blog.sina.com.cn/s/blog_66a13b8f0100vgfi.html 最近一阵研究 Fiddler2 的使用来着,一开始看起来有点找不着北,索性就根据官网资料 ...