NPInter数据集的奇葩标号的出坑秘籍
这篇恐怕是有始以来命名最无奈标题了。需要写一下攻略。
业内人士都熟知NPInter,但是该数据库一直以来访问受限。不过终于能访问得到数据集。
但是蛋疼的是2.0的数据库id的命名方法实在奇葩,想了很多办法都难以攻破瓶颈。于是想到用3.0的数据库ID联查一下ncIdentifier。
终于ncIdentifier被验证可行,但是问题又来了:noncode数据库里找不到其中的一些序列。
先得读读核酸研究,搞明白命名方法。https://www.ncbi.nlm.nih.gov/pmc/articles/PMC3965073/
先后尝试用12个数据库中的8个,终于LNCipedia算是良心库,http://www.oebiotech.com/Article/lncrnabtsj.html
12个数据库的相关文章:
www.360doc.com/content/17/0310/11/19913717_635515733.shtml
经过十动然拒,不过最终结果虽然称不上喜大普奔,但是回想起郁闷地想办法找序列,还算是细思恐极的过程。
此外,找到序列还是有遗留工作,得把序列从网上爬取下来存成fasta。
***
补充一下,中科院这种格式的ID还有一个数据库可查NPInter的序列,是印度加尔各答珀色研究所搞的。 bicresources.jcbose.ac.in/cgi-bin/lncrbase
追评一下这个数据库,有坑。比如n410143,查到的序列号是另外一种格式,需要再对照图寻找
**
最新探坑进展:ipedia和jcbose库里都没有的,比如n381557得用联查法,得到noncode序列ID格式从Noncode数据库里找
**
今天终于收集完了所有RNA数据。
总结:
第一步,先根据2.0已有的github数据提取所有目标序列;
第二步,抽取出未查找到的ID表;
第三步,到印度的数据库去进行查找 http://bicresources.jcbose.ac.in/zhumur/lncrbase;
第四步,到noncode在线查找第三步仍未找到的序列;
第五步,到NPInter下载2.0和3.0两个库,对第四步仍未查找到的序列,通过联查法获取3.0的noncode格式ID,到NPInter在线查找,找到对应RPI号,再跳转到noncode对应RNA转录序列的列表,选取序列
第六步,使用根特大学的数据库进行补充验证(可选)
*******
没想到两周之后遇到新的坑:superfamily的某些id得再uniprot里面猜。探坑结束再发。找了一些资源
GDB、GenBank、SWISS-PROT、PIR等可查询蛋白质的其它信息;
PDB主要应用于蛋白质结构预测和结构同源性比较。NRL-3D数据库则是PDB数据库中所有蛋白质序列的信息。http://www.rcsb.org/pdb/
******
最近又看到两个数据库:http://www.cuilab.cn/lncrnadisease
http://rtools.cbrc.jp/LncRRIsearch/help.cgi
下面还有篇科普文:http://www.sohu.com/a/144748065_786581
以及使用基因通路和其他几何方法的方法
http://blog.sciencenet.cn/blog-430956-917432.html
NPInter数据集的奇葩标号的出坑秘籍的更多相关文章
- 华为CloudIDE免费公测,带你出坑带你飞
你的代码仓库上线了吗?是不是有时候遇到这样的问题? 只想浏览一下代码,却发现线上浏览效果不佳,高亮显示什么的都没有.而在桌面端浏览要需要先同步代码,再用桌面端的IDE打开.尤其是使用git的时候,先要 ...
- python函数中把列表(list)当参数时的"入坑"与"出坑"
在Python函数中,传递的参数如果默认有一个为 列表(list),那么就要注意了,此处有坑!! 入坑 def f(x,li=[]): for i in range(x): li.append(i*i ...
- 反爬虫:利用ASP.NET MVC的Filter和缓存(入坑出坑) C#中缓存的使用 C#操作redis WPF 控件库——可拖动选项卡的TabControl 【Bootstrap系列】详解Bootstrap-table AutoFac event 和delegate的分别 常见的异步方式async 和 await C# Task用法 c#源码的执行过程
反爬虫:利用ASP.NET MVC的Filter和缓存(入坑出坑) 背景介绍: 为了平衡社区成员的贡献和索取,一起帮引入了帮帮币.当用户积分(帮帮点)达到一定数额之后,就会“掉落”一定数量的“帮帮 ...
- Filezilla配置FTP中的坑以及出坑办法
做本科生助教,老板让配置一个FTP传资料交作业,找了一台Windows服务器捣鼓,开始按网上教程自己配置特别麻烦,何西西说用Filezilla比较方便,就去Filezilla官网下载了Filezill ...
- React爬坑秘籍(一)——提升渲染性能
React爬坑秘籍(一)--提升渲染性能 ##前言 来到腾讯实习后,有幸八月份开始了腾讯办公助手PC端的开发.因为办公助手主推的是移动端,所以导师也是大胆的让我们实习生来技术选型并开发,他来做code ...
- Android项目开发遇到的问题(64K的错误)的解决之路,从入坑到出坑
自己一个android项目,一直以来进展还算顺利,没有遇到什么严重性的问题,今天准备给同事手机上安装一下玩玩,谁知丢人丢大,无法build apk!报错!my god,我开发没问题啊,我手机连上usb ...
- 反爬虫:利用ASP.NET MVC的Filter和缓存(入坑出坑)
背景介绍: 为了平衡社区成员的贡献和索取,一起帮引入了帮帮币.当用户积分(帮帮点)达到一定数额之后,就会“掉落”一定数量的“帮帮币”.为了增加趣味性,帮帮币“掉落”之后所有用户都可以“捡取”,谁先捡到 ...
- springboot踩坑出坑记
4月15到4月17我都在把毕设从eclipse重构到IDEA中,springboot最让我头疼的是它的版本问题,因为每一个版本对应的依赖包都有可能出错,这里分享一下如何成功移植用eclipse写的sp ...
- indexDB出坑指南
对于入了前端坑的同学,indexDB绝对是需要深入学习的. 本文针对indexDB的难点问题(事务和数据库升级)做了详细的讲解,而对于indexDB的特点和使用方法只简要的介绍了一下.如果你有一些使用 ...
随机推荐
- Redis学习笔记(十二) 高级命令:服务器管理命令
原文链接:http://doc.redisfans.com/server/index.html save 执行一个同步操作,将redis实例的所有数据以rdb的形式保存到硬盘,一般来说,生产环境很少执 ...
- 探讨:crond 引发大量sendmail进程的解决办法
某服务器账号comm无法登录,说是资源消耗完毕.于是用另一个账号登陆到服务器,检查common账号到底启动了哪些dd引起资源耗尽:ps -u common发现有个 sendmail的启动特别多例如:c ...
- C# WebAPI小记
新建WebAPI项目 新建一个Model 安装Entity Framework 添加连接字符串 去Web.config 中 <configuration> 节点中最下面添加 在Word中编 ...
- Centos7 minimal 系列之Redis共享sessionid(七)
这一章节的内容就当看看,只是个人理解,我想应该是有误的. 一.SessionId sessionid是一个会话的key,浏览器第一次访问服务器会在服务器端生成一个session,有一个sessioni ...
- Centos7 minimal 系列之Redis集群搭建(六)
一.redis安装 借鉴上篇博客:http://www.cnblogs.com/WJ--NET/p/8176071.html 二.集群搭建 2.1.创建文件夹 mkdir redis_cluster ...
- vue入门--简单路由配置
在初始化vue init webpack <工程名>时,有一步是询问是否安装vue-router,选择yes,如果没有安装的话,后面需要自己安装.然后在目录中可以看到有个文件夹叫route ...
- CheckBox的Attributes
在看老同事写的代码的时候,发现了这样的一段代码:之前自己没有遇到过,记录下吧. 大致是这样的 foreach (GridViewRow grv in GridView1.Rows) { CheckBo ...
- python模拟登陆知乎
---恢复内容开始--- 在完成前面的阶段的任务之后,我们现在已经能够尝试着去模拟登录一些网站了.在这里我们模拟登录一下知乎做一下实验.笔者在这里总共用了三天多的时间,下面给大家分享一下笔者是怎么一步 ...
- udev的规则文件
转载于:https://linux.cn/article-9365-1.html 介绍 在 GNU/Linux 系统中,虽然设备的底层支持是在内核层面处理的,但是,它们相关的事件管理是在用户空间中通过 ...
- css——导航栏
导航栏一般用无序列表制作 但出来的导航栏有黑点,还有一些边距 去除黑点我们可以用:list-style-type: none;/*去掉ul前面的点*/ 因为有些标签之间会有默认的边距,所以可以先将边踞 ...