Fast and accurate bacterial species identification in urine specimens using LC-MS/MS mass spectrometry and machine learning (解读人:闫克强)
文献名:Fast and accurate bacterial species identification in urine specimens using LC-MS/MS mass spectrometry and machine learning(利用质谱技术和机器学习模型在尿液样本中快速准确地进行菌种鉴定)
doi: 10.1074/mcp.TIR119.001559
期刊名:Mol Cell Proteomics
作者:Florence Roux-Dalvai
通讯作者:Arnaud Droit
单位:
- 拉瓦尔大学
- 赛默飞世尔科技有限公司
一、 概述:
本研究主要目的是利用现有的技术对临床尿液样本中的特定细菌进行快速准确的鉴定。研究采用了新的策略来找到每个细菌对应的LC-MC/MC肽段标签。首先是通过DIA的方法得到每种细菌的特征肽段,利用机器学习分类预测,挑选出每个物种特有的肽段标签。然后,采用靶向蛋白质组的方法,利用这些标签肽段对未知样本进行菌种的鉴定。利用这种方法,可以在4小时内对尿路感染的15种致病菌进行快速准确的鉴定。
二、 研究背景:
在临床上,准确地鉴定致病菌对患者的治疗和用药具有非常重要的指导意义,针对致病菌采取合适的治疗方案可以防止抗生素的滥用。因此,如何快速地鉴定致病菌至关重要。基因型的方法,例如16S和宏基因组测序,可以用于对复杂样本的致病菌鉴定。16S测序一般可以在24小时内完成快速鉴定。但由于16S基因序列在物种间的保守性高,导致该方法的鉴别分辨率较低,只能局限在属的水平。宏基因组测序虽然可以做到菌株水平的区分,但它需要较高的预算和时间成本,不适合于临床的快速鉴定。质谱技术可以在较短的时间内对单菌进行鉴定,目前也已经应用到临床研究中。但是细菌的质谱鉴定存在以下几个问题:1)需要对细菌进行分离纯化培养;2)由于样本量少,低丰度的细菌可能难以鉴定到;3)目前的鉴定方法无法给出致病菌的定量信息。针对这些问题,临床质谱细菌鉴定技术做了一些改进。本研究采用Nano LC-MS/MS方法,结合DIA采集模式以及机器学习模型,对尿液样本中的致病菌进行鉴定,确定每种菌特异的标志肽段。然后利用这些标志肽段在组成未知的尿液样本中进行靶向蛋白质组学鉴定致病菌。通过这种方法,共建立了15种尿道感染致病菌的肽段标志物。这15种致病菌覆盖了84%以上的尿道感染病例,是最常见的几种致病菌。利用这些标志物,可以在4小时之内实现对尿液样本的快速鉴定,根据肽段标志物的种类和丰度判断其致病菌的类型。
三、 实验设计:
本研究主要分两个阶段,训练阶段和鉴定阶段。在训练阶段,首先是对15种菌进行DDA鉴定,得到每种菌的谱图库,然后对包含该菌的尿液进行DIA分析,利用构建好的谱图库来匹配DIA结果。DIA样本中包括15种菌的尿液样本,每种菌存在两种浓度差异,9个高浓度重复和3个低浓度重复,共180个样本。此外还存在10个空白对照。通过肽段强度信息以及二级谱图信息等对肽段进行进一步过滤,最终得到4319条候选肽段。然后将这些肽段合并,采用机器学习分类模型,利用这些肽段作为feature来区分不同致病菌数据集,最终筛选出82条具有区分度的肽段。第二部分是致病菌的鉴定。将82条肽段的母离子与子离子信息收集构建离子对,用于对未知样本的靶向蛋白质组学分析。通过对目标肽段的鉴定和定量结果模式来判断未知样本中存在哪种致病菌。

四、研究成果:
热图展示了82个肽段标志物在15种细菌中的分布情况。每种菌均有6个生物重复。可以看出,不同菌株存在不同的肽段标志物强度信息。因此,通过这些肽段以及其强度信息,可以在复杂样本中准确的鉴定出某个致病菌株的存在与否。


图a展示了对于4种常见的致病菌,结合肽段标志物的PRM预测结果。结果表明,在不同的浓度下,利用已有的肽段标志物都能很好地鉴定出4种目标菌株。可以看出,即使致病菌浓度在临床的检测线以下,每个菌株仍能被鉴定出来。图b表明,每个菌株的肽段标志物的丰度是与该菌丰度呈显著正相关的,可以结合肽段标志物的定量信息来判断致病菌浓度。图c说明4个生物样本之间致病菌丰度是显著相关的,生物重复性高。
五、文章亮点:
本文结合了DIA与机器学习的方法来寻找致病菌的标志肽段,实现了对复杂样本中特定物种的快速鉴定。其方法的巧妙结合为今后的研究提供了更加丰富的科研思路。而且具有很好的应用前景,推进了临床质谱的应用价值。
阅读人:闫克强
Fast and accurate bacterial species identification in urine specimens using LC-MS/MS mass spectrometry and machine learning (解读人:闫克强)的更多相关文章
- DART: a fast and accurate RNA-seq mapper with a partitioning strategy DART:使用分区策略的快速准确的RNA-seq映射器
DART: a fast and accurate RNA-seq mapper with a partitioning strategyDART:使用分区策略的快速准确的RNA-seq映射器 Abs ...
- Fauce:Fast and Accurate Deep Ensembles with Uncertainty for Cardinality Estimation 论文解读(VLDB 2021)
Fauce:Fast and Accurate Deep Ensembles with Uncertainty for Cardinality Estimation 论文解读(VLDB 2021) 本 ...
- Fast and Accurate Traffic Matrix Measurement Using Adaptive Cardinality Counting
paper-CaiPan.pdf http://conferences.sigcomm.org/sigcomm/2005/paper-CaiPan.pdf
- Journal of Proteome Research | SAAVpedia: identification, functional annotation, and retrieval of single amino acid variants for proteogenomic interpretation | SAAV的识别、功能注释和检索 | (解读人:徐洪凯)
文献名:SAAVpedia: identification, functional annotation, and retrieval of single amino acid variants fo ...
- Mol Cell Proteomics. | Identification of salivary biomarkers for oral cancer detection with untargeted and targeted quantitative proteomics approaches (解读人:卜繁宇)
文献名:Identification of salivary biomarkers for oral cancer detection with untargeted and targeted qua ...
- 解读人:董鑫,Disease Development Is Accompanied by Changes in Bacterial Protein Abundance and Functions in a Refined Model of Dextran Sulfate Sodium (DSS)-Induced Colitis
文章中文名:在葡聚糖硫酸钠(DSS)诱导下的结肠炎模型伴随着细菌蛋白质丰度和功能的改变 单位: 1 Helmholtz-Centre for Environmental Research - UFZ, ...
- 解读人:林山云,Proteomic Identification of Protein Glutathionylation in Cardiomyocytes(心肌细胞蛋白质谷胱甘肽修饰的蛋白质组鉴定)
发表时间:(2019年4月) IF:3.950 单位:韦恩州立大学化学系 物种:小鼠心肌细胞 技术:谷胱甘肽修饰蛋白组学 一. 概述: 本研究采用化学选择性蛋白组学方法,鉴定出过氧化物诱导HL-1小鼠 ...
- FAST特征点检测&&KeyPoint类
FAST特征点检测算法由E.Rosten和T.Drummond在2006年在其论文"Machine Learning for High-speed Corner Detection" ...
- 5 Ways AI is Transforming the Finance Industry
https://marutitech.com/ways-ai-transforming-finance/ As global technology has evolved over the years ...
随机推荐
- 关于安装了Vue-devtools插件但在浏览器控制台不显示的解决方案
Google浏览器中开发调试的时候,右上角出现vue的图标,但是在开发者工具中没有出现vue调试(已在扩展程序中安装 Vue Devtools) 控制台却没有. 错误原因: 没显示调试工具的原因是用了 ...
- SSM框架三分钟搞定分页查询
使用的国产第三方jar pagehelper 里面的基本属性值 //当前页 private int pageNum; //每页的数量 private int pageSize; //当前页的数量 ...
- LeetCode43(字符串相乘)
题目: 给定两个以字符串形式表示的非负整数 num1 和 num2,返回 num1 和 num2 的乘积,它们的乘积也表示为字符串形式. 示例 1: 输入: num1 = "2", ...
- elasicsearch数据自动清理脚本
elasticsearch随着保存的数据越来越多,磁盘占用越来越大,有必要进行定期自动清理. 直接上脚本 cat es-index-clear.sh #/bin/bash #查看索引信息 #curl ...
- hiho一下:Beautiful String
hiho一下:Beautiful String 记不清这是 hiho一下第几周的题目了,题目不难,不过对于练习编程,训练思维很有帮助.况且当时笔者处于学习算法的早期, 所以也希望刚接触算法的同学能多去 ...
- ElasticSearch系列四 CURD
1: ES 类似JPA操作 1.1 编写实体类 1.2 编写映射文件 xxx.json 1.3编写repository继承 ElasticSearchrepository 1.4 编写admin 的C ...
- PxCook+photoshop实现傻瓜式切图(推荐小白使用)
确定需求 刚入门前端的小伙伴经过一个阶段的学习,已经准备小试牛刀了.但看到设计师给出的psd图,又头疼了,天啊撸,怎么办,我不会切图啊.今天我就带领小白学习傻瓜式切图.包学包会.( ̄▽ ̄)" ...
- LeetCode:两数之和、三数之和、四数之和
LeetCode:两数之和.三数之和.四数之和 多数之和问题,利用哈希集合减少时间复杂度以及多指针收缩窗口的巧妙解法 No.1 两数之和 给定一个整数数组 nums 和一个目标值 target,请你在 ...
- Levenshtein Distance(编辑距离)算法与使用场景
前提 已经很久没深入研究过算法相关的东西,毕竟日常少用,就算死记硬背也是没有实施场景导致容易淡忘.最近在做一个脱敏数据和明文数据匹配的需求的时候,用到了一个算法叫Levenshtein Distanc ...
- 获取的ajax方法return的返回值的问题解析
今天刚上班就偶遇关于获取Ajax方法return的返回值的问题,这里小记一下. 在使用jquery中,如果获取不到ajax返回值,原因有二: 一.ajax未使用同步 ajax未使用同步,导致数据未加载 ...