PICRUSt [ 1 ] es un paquete de software bioinformático . El nombre es una abreviatura de Investigación filogenética de comunidades mediante la reconstrucción de estados no observados.
La herramienta se utiliza en el campo del análisis metagenómico , donde permite inferir el perfil funcional de una comunidad microbiana a partir del análisis de genes marcadores en una o más muestras. En esencia, PICRUSt toma una tabla de unidades taxonómicas operativas (OTU) proporcionada por el usuario, que representa las secuencias de genes marcadores (generalmente un clúster 16S ) junto con su abundancia relativa en cada una de las muestras. El resultado de PICRUSt es una matriz de recuento de genes funcionales por muestra, que indica el recuento de cada gen funcional en cada una de las muestras analizadas. La capacidad de PICRUSt para estimar el perfil de genes funcionales de una muestra determinada se basa en un conjunto de genomas secuenciados conocidos . Esto también podría considerarse una alternativa automatizada a la investigación manual de las familias de genes que probablemente estén presentes en organismos cuyas secuencias se encuentran en una biblioteca de amplicones de ARN ribosómico 16S . La siguiente descripción corresponde a la versión original de PICRUSt, pero actualmente se está desarrollando una actualización importante de esta herramienta. [ 2 ]
Algoritmo de predicción del genoma
En una fase inicial de preprocesamiento, PICRUSt construye intervalos de confianza y predicciones puntuales para el número de copias de cada familia de genes en cada cepa bacteriana y arqueal en un árbol de referencia, utilizando organismos con genomas secuenciados como referencia. Más específicamente, para cada familia de genes, PICRUSt mapea los números de copias de genes conocidos (de genomas completos secuenciados) en un árbol de referencia de la vida. Estos números de copias de familias de genes se tratan como rasgos continuos , y se construye un modelo evolutivo bajo el supuesto de movimiento browniano . Estos modelos evolutivos pueden construirse con máxima verosimilitud , máxima verosimilitud relajada o parsimonia de Wagner. Este modelo evolutivo se utiliza luego para predecir tanto una estimación puntual como un intervalo de confianza para el número de copias de microorganismos sin genomas secuenciados. Este paso de "predicción de genoma" produce una tabla grande de tipos bacterianos (específicamente unidades taxonómicas operativas u OTU) frente a números de copias de familias de genes. Esta tabla se distribuye a los usuarios finales. Es importante destacar que este método de predicción no es lo mismo que el método del vecino más cercano (es decir, simplemente buscar el genoma secuenciado más próximo), y se ha demostrado que ofrece una mejora pequeña pero significativa en la precisión con respecto a esa estrategia. Sin embargo, la predicción del vecino más cercano está disponible como opción en PICRUSt.
Cabe destacar que, si bien esta funcionalidad se utiliza normalmente para predecir el número de copias de genes en bacterias, en principio podría utilizarse para predecir cualquier otro rasgo continuo a partir de datos de rasgos de diversos organismos y una filogenia de referencia .
Langille et al. [ 1 ] probaron la precisión de este paso de predicción del genoma utilizando validación cruzada de exclusión de un elemento en el conjunto de entrada de genomas secuenciados. Pruebas adicionales examinaron la sensibilidad a errores en la inferencia filogenética , la falta de datos genómicos y la precisión de los intervalos de confianza en el contenido genético.
Un paso similar permite predecir el número de copias de los genes del ARNr 16S .
Algoritmo de predicción de metagenoma
Al aplicar PICRUSt a una biblioteca de genes de ARNr 16S , PICRUSt compara las unidades taxonómicas operativas de referencia con las tablas y recupera un número de copias de ARNr 16S predicho y un número de copias de genes para cada familia de genes. La abundancia de cada OTU se divide por su número de copias predicho (si una bacteria tiene múltiples copias de 16S, su abundancia aparente en los datos de ARNr 16S se verá inflada) y luego se multiplica por el número de copias de la familia de genes. Esto proporciona una predicción de la contribución de cada OTU al contenido genético total de la muestra (el metagenoma ). Finalmente, estas contribuciones individuales se suman para producir una estimación de los genes presentes en el metagenoma .
Langille et al., 2013 [ 1 ] probaron la precisión de este paso de predicción del genoma utilizando conjuntos de datos previamente informados en los que la misma muestra biológica fue sometida a amplificación del gen ARNr 16S y metagenómica de escopeta . En estos casos, los resultados de la metagenómica de escopeta se tomaron como una representación de la comunidad "verdadera", y las bibliotecas de amplicones del gen ARNr 16S se alimentaron a PICRUSt para intentar predecir esos datos. Los conjuntos de datos de prueba incluyeron muestras de microbioma humano del Proyecto Microbioma Humano , muestras de suelo, diversas muestras de mamíferos y muestras de tapetes microbianos de Guerrero Negro.
Índice de taxones secuenciados más cercano
Dado que PICRUSt, y la genómica comparativa evolutiva en general, dependen de genomas secuenciados, las muestras biológicas de entornos bien estudiados (muchos genomas secuenciados) se predecirán mejor que las de entornos poco estudiados. Para evaluar cuántos genomas están disponibles, PICRUSt permite opcionalmente a los usuarios calcular un Índice de Taxón Secuenciado Más Cercano (NSTI) para sus muestras. Este índice refleja la distancia filogenética promedio entre cada secuencia del gen ARNr 16S en su muestra y una secuencia del gen ARNr 16S de un genoma completamente secuenciado . En general, cuanto menor sea la puntuación NSTI, más precisas se espera que sean las predicciones de PICRUSt. Por ejemplo, [ 1 ] demostró que PICRUSt fue mucho más preciso en muestras de suelo diversas y muestras del Proyecto Microbioma Humano que en muestras de tapetes microbianos de Guerrero Negro , que contenían muchas bacterias sin parientes secuenciados.
Herramientas relacionadas
Okuda et al., 2012 [ 3 ] publicaron un método similar que utilizaba un enfoque de k-vecinos más cercanos acotado para predecir metagenomas virtuales. Validaron su enfoque utilizando secuencias del gen ARNr 16S extraídas de metagenomas de secuenciación masiva y compararon las predicciones de su método con el metagenoma completo.
CopyRighter, [ 4 ] al igual que PICRUSt, utiliza modelos evolutivos y predicción de rasgos filogenéticos para estimar el número de copias de la secuencia del gen ARNr 16S para cada tipo de bacteria y arquea en una muestra, y luego utiliza estas estimaciones para corregir las estimaciones de la composición de la comunidad.
PanFP [ 5 ] presentó un método similar, pero basado en predicciones genómicas para cada grupo taxonómico. Las pruebas comparativas mostraron un rendimiento muy similar al de PICRUSt al compararlos con los mismos conjuntos de datos. Una ventaja es que se pueden usar todas las OTU, no solo las de una tabla filogenética de referencia. Una desventaja es que no se construyen intervalos de confianza ni modelos evolutivos.
PAPRICA [ 6 ] es una herramienta de predicción de metagenomas basada en la colocación de secuencias de genes de ARNr 16S de entrada en un árbol filogenético conocido basado en correspondientes genomas de referencia. El principal resultado de la predicción corresponde a los números de la Comisión de Enzimas .
Piphillin [ 7 ] es una herramienta desarrollada por la empresa Second Genome que genera predicciones de metagenoma basadas en la agrupación por proximidad de secuencias del gen ARNr 16S de entrada con secuencias del gen ARNr 16S de genomas de referencia. Existe un portal web para ejecutar esta herramienta en el sitio web de Second Genome. Esta herramienta se encuentra en continuo desarrollo y validación, como se resume en una publicación de 2020. [ 8 ]
Tax4Fun [ 9 ] es una herramienta similar que vincula los genes del ARN ribosómico 16S de todos los organismos KEGG con las secuencias del gen del ARNr 16S presentes en la base de datos SILVA . Originalmente, esta herramienta se limitaba a las secuencias del gen del ARNr 16S de la base de datos SILVA. Sin embargo, la versión más reciente, Tax4Fun2, puede utilizarse con OTU o variantes de secuencias de amplicones de cualquier pipeline de agrupamiento.
Referencias
- 1 2 3 4 Langille, Morgan GI; Zaneveld, Jesse; Caporaso, J Gregory; McDonald, Daniel; Knights, Dan; Reyes, Joshua A; Clemente, Jose C; Burkepile, Deron E; Vega Thurber, Rebecca L; Knight, Rob; Beiko, Robert G; Huttenhower, Curtis (2013). "Perfilado funcional predictivo de comunidades microbianas utilizando secuencias de genes marcadores de ARNr 16S" ( PDF) . Nature Biotechnology . 31 (9): 814– 821. doi : 10.1038/nbt.2676 . ISSN 1087-0156 . PMC 3819121. PMID 23975157 .
- ↑ Douglas, Gavin; Maffei, Vince; Zaneveld, Jesse; Yurgel, Svetlana; Brown, James; Taylor, Christopher; Huttenhower, Curtis; Langille, Morgan (2020). "PICRUSt2: Un enfoque mejorado y personalizable para la inferencia de metagenomas". bioRxiv 10.1101/672295 .
- ^ Okuda, Shujiro; Tsuchiya, Yuki; Kiriyama, Chiho; Itoh, Masumi; Morisaki, Hisao (2012). "Okuda y otros, 2012" . Comunicaciones de la naturaleza . 3 : 1203. doi : 10.1038/ncomms2203 . PMID 23149747 .
- ↑ Angly, Florent E; Dennis, Paul G; Skarshewski, Adam; Vanwonterghem, Inka; Hugenholtz, Philip; Tyson, Gene W (2014). " CopyRighter: una herramienta rápida para mejorar la precisión de los perfiles de comunidades microbianas mediante la corrección del número de copias de genes específicos de linaje" . Microbiome . 2 11. doi : 10.1186/2049-2618-2-11 . PMC 4021573. PMID 24708850 .
- ↑ Jun, Se-Ran; Robeson, Michael S.; Hauser, Loren J.; Schadt, Christopher W.; Gorin, Andrey A. (2015). " PanFP: perfiles funcionales basados en pangenomas para comunidades microbianas" . BMC Research Notes . 8 479. doi : 10.1186/s13104-015-1462-8 . PMC 4584126. PMID 26409790 .
- ↑ Bowman, Jeff; Ducklow, Hugh (2015). "Las comunidades microbianas pueden describirse mediante la estructura metabólica: un marco general y su aplicación a una comunidad microbiana estratificada por profundidad y estacionalmente variable de la costa de la península Antártica Occidental" . PLOS ONE . 10 (8) e0135868. Bibcode : 2015PLoSO..1035868B . doi : 10.1371/journal.pone.0135868 . PMC 4540456. PMID 26285202 .
- ↑ Iwai, Shoko; Weinmaier, Thomas; Schmidt, Brian; Albertson, Donna; Poloso, Neil; Dabbagh, Karim; DeSantis, Todd (2016). "Piphillin: Predicción mejorada del contenido metagenómico mediante inferencia directa a partir de microbiomas humanos" . PLOS ONE . 11 (11) e0166104. Bibcode : 2016PLoSO..1166104I . doi : 10.1371/journal.pone.0166104 . PMC 5098786. PMID 27820856 .
- ↑ Narayan, Nicole; Weinmaier, Thomas; Laserna-Mendieta, Emilio; Claesson, Marcus; Shanahan, Fergus; Dabbagh, Karim; Iwai, Shoko; DeSantis, Todd (2020). "Piphillin predice la composición y dinámica metagenómica a partir de secuencias de ADNr 16S corregidas por DADA2" . BMC Genomics . 21 (1): 56. doi : 10.1186/s12864-019-6427-1 . PMC 6967091. PMID 31952477 .
- ↑ Aßhauer, Kathrin; Wemheuer, Bernd; Daniel, Rolf; Meinicke, Peter (2015). "Tax4Fun: predicción de perfiles funcionales a partir de datos metagenómicos de ARNr 16S" . Bioinformatics . 31 ( 17): 2882–2884 . doi : 10.1093/bioinformatics/btv287 . PMC 4547618. PMID 25957349 .
- Metagenómica
- Software de bioinformática
- Microbiología ambiental