Articulo de referencia

minería de genomas

La minería de genomas está asociada con las investigaciones bioinformáticas. La minería genómica describe la explotación de información genómica para el descubrimiento de rutas ...

La minería de genomas está asociada con las investigaciones bioinformáticas.

La minería genómica describe la explotación de información genómica para el descubrimiento de rutas biosintéticas de productos naturales y sus posibles interacciones. [ 1 ] Depende de tecnología computacional y herramientas bioinformáticas . El proceso de minería se basa en una enorme cantidad de datos (representados por secuencias de ADN y anotaciones) accesibles en bases de datos genómicas . Al aplicar algoritmos de minería de datos , estos pueden utilizarse para generar nuevos conocimientos en diversas áreas de la química medicinal , [ 2 ] [ 3 ] como el descubrimiento de nuevos productos naturales . [ 4 ]

Historia

A mediados y finales de la década de 1980, los investigadores se centraron cada vez más en los estudios genéticos con el avance de las tecnologías de secuenciación . [ 5 ] La base de datos GenBank se estableció en 1982 para la recopilación, gestión, almacenamiento y distribución de datos de secuencias de ADN debido a la creciente disponibilidad de secuencias de ADN. Con el creciente número de datos genéticos, las empresas biotecnológicas han podido utilizar la secuencia de ADN humano para desarrollar fármacos de proteínas y anticuerpos mediante la minería del genoma desde 1992. [ 6 ] A finales de la década de 1990, muchas empresas, como Amgen , Immunec y Genentech, pudieron desarrollar fármacos que avanzaron a la etapa clínica mediante la adopción de la minería del genoma. [ 7 ] Desde que se completó el Proyecto Genoma Humano a principios de la década de 2000, los investigadores han estado secuenciando los genomas de muchos microorganismos . [ 8 ] Posteriormente, muchos de estos genomas se han estudiado cuidadosamente para identificar nuevos genes y vías biosintéticas. [ 9 ]

Algoritmos

A medida que se acumulaban grandes cantidades de datos de secuencias genómicas en bases de datos públicas, los algoritmos genéticos se volvieron importantes para descifrar la enorme colección de datos genómicos. Se utilizan comúnmente para generar soluciones de alta calidad a problemas de optimización y búsqueda, basándose en operadores bioinspirados como la mutación, el cruce y la selección. [ 10 ] Los siguientes son algoritmos genéticos de uso común:

  • AntiSMASH (Antibiotics and Secondary Metabolite Analysis Shell) [ 11 ] aborda los flujos de trabajo del genoma de metabolitos secundarios. [ 12 ]
  • BiGSCAPE [ 13 ] Análisis de redes a gran escala y clasificación de clústeres de genes biosintéticos.
  • PRISM (Prediction Informatics for Secondary Metabolites) [ 14 ] es un enfoque combinatorio para la predicción de la estructura química de péptidos no ribosomales codificados genéticamente y policétidos de tipo I y II. [ 15 ]
  • El método SIM (similitud de secuencia basada en estadísticas), como FASTA o PSI-BLAST , infiere homología ortóloga. [ 16 ]
  • BLAST (herramienta básica de búsqueda de alineación local) es un método para la comparación rápida de secuencias. [ 17 ]

Aplicaciones

La minería genómica se aplica al descubrimiento de productos naturales al facilitar la caracterización de nuevas moléculas y vías biosintéticas. [ 4 ] [ 18 ]

Descubrimiento de productos naturales

La producción de productos naturales está regulada por los clústeres de genes biosintéticos (BGC) codificados en el microorganismo. [ 19 ] Mediante la minería del genoma, se pueden predecir los BGC que producen el producto natural objetivo. [ 20 ] Algunas enzimas importantes responsables de la formación de productos naturales son las policétido sintasas (PKS), las péptido sintasas no ribosomales (NRPS), los péptidos modificados ribosomal y postraduccionalmente (RiPPs) y los terpenoides , entre muchos otros. [ 21 ] Al buscar enzimas, los investigadores pueden determinar las clases que codifican los BGC y comparar los clústeres de genes objetivo con clústeres de genes conocidos. [ 22 ] Para verificar la relación entre los BGC y los productos naturales, los BGC objetivo pueden expresarse en un huésped adecuado mediante clonación molecular . [ 23 ]

Bases de datos y herramientas

Se han acumulado datos genéticos en bases de datos. Los investigadores pueden utilizar algoritmos para descifrar los datos accesibles desde las bases de datos para el descubrimiento de nuevos procesos, objetivos y productos. [ 10 ] A continuación se presentan bases de datos y herramientas:

  • La base de datos GenBank proporciona conjuntos de datos genómicos para su análisis. [ 24 ]
  • Navegador del genoma de UCSC
  • AntiSMASH-DB [ 11 ] [ 25 ] permite comparar las secuencias de BGC recién secuenciados con las de aquellos previamente predichos y caracterizados experimentalmente. [ 26 ]
  • BIG-FAM [ 27 ] es una base de datos de familias de clústeres de genes biosintéticos. [ 28 ]
  • DoBISCUIT [ 29 ] es una base de datos de grupos de genes biosintéticos de metabolitos secundarios. [ 30 ]
  • MIBiG (Información mínima sobre la especificación de un clúster de genes biosintéticos) [ 31 ] proporciona un estándar para anotaciones y metadatos sobre clústeres de genes biosintéticos y sus productos moleculares. [ 32 ]
  • El árbol interactivo de la vida (iTOL) [ 33 ] es una herramienta basada en la web para la visualización, manipulación y anotación de árboles filogenéticos. [ 34 ]

Referencias

  1. Albarano L, Esposito R, Ruocco N, Costantini M (abril de 2020). "La minería del genoma como nuevo desafío en el descubrimiento de productos naturales" . Marine Drugs . 18 (4): 199. doi : 10.3390/md18040199 . PMC 7230286. PMID 32283638 .  
  2. Hannigan GD, Prihoda D, Palicka A, Soukup J, Klempir O, Rampula L, et al. (octubre de 2019). "Una estrategia de minería de genoma de aprendizaje profundo para la predicción de clústeres de genes biosintéticos" . Nucleic Acids Research . 47 (18): e110. doi : 10.1093/nar/gkz654 . PMC 6765103. PMID 31400112 .   
  3. Lee N, Hwang S, Kim J, Cho S, Palsson B, Cho BK (2020-01-01). "Mini revisión: Enfoques de minería genómica para la identificación de grupos de genes biosintéticos de metabolitos secundarios en Streptomyces " . Computational and Structural Biotechnology Journal . 18 : 1548–1556 . doi : 10.1016/j.csbj.2020.06.024 . PMC 7327026. PMID 32637051 .  
  4. 1 2 Challis GL (mayo de 2008). "Exploración genómica para el descubrimiento de nuevos productos naturales". Journal of Medicinal Chemistry . 51 (9): 2618– 2628. doi : 10.1021/jm700948z . PMID 18393407 . 
  5. Bains W, Smith GC (diciembre de 1988). "Un nuevo método para la determinación de la secuencia de ácidos nucleicos". Journal of Theoretical Biology . 135 (3): 303– 307. Bibcode : 1988JThBi.135..303B . doi : 10.1016/S0022-5193(88)80246-7 . PMID 3256722 . 
  6. Cook-Deegan R, Heaney C (2010-09-01). "Patentes en genómica y genética humana" . Annual Review of Genomics and Human Genetics . 11 (1): 383– 425. doi : 10.1146/annurev-genom- 082509-141811 . PMC 2935940. PMID 20590431 .  
  7. Ziemert N, Alanjary M, Weber T (agosto de 2016). "La evolución de la minería genómica en microbios: una revisión" . Natural Product Reports . 33 (8): 988–1005 . doi : 10.1039/C6NP00025H . PMID 27272205 . 
  8. Omura S, Ikeda H, Ishikawa J, Hanamoto A, Takahashi C, Shinose M, et al. (octubre de 2001). "Secuencia del genoma de un microorganismo industrial Streptomyces avermitilis: deducción de la capacidad de producir metabolitos secundarios" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 98 (21): 12215– 12220. Bibcode : 2001PNAS...9812215O . doi : 10.1073/pnas.211433198 . PMC 59794. PMID 11572948 .   
  9. Tang X, Li J, Millán-Aguiñaga N, Zhang JJ, O'Neill EC, Ugalde JA, et al. (diciembre de 2015). " Identificación de vías biosintéticas de antibióticos de ácido tiotetrónico mediante minería genómica dirigida a objetivos" . ACS Chemical Biology . 10 (12): 2841– 2849. doi : 10.1021/acschembio.5b00658 . PMC 4758359. PMID 26458099 .   
  10. 1 2 Brandon MC, Wallace DC, Baldi P (julio de 2009). " Estructuras de datos y algoritmos de compresión para datos de secuencias genómicas" . Bioinformatics . 25 (14): 1731– 1738. doi : 10.1093/bioinformatics/btp319 . PMC 2705231. PMID 19447783 .  
  11. 1 2 "AntiSMASH-DB" .
  12. Medema MH, Blin K, Cimermancic P, de Jager V, Zakrzewski P, Fischbach MA, et al. (julio de 2011). "antiSMASH: identificación, anotación y análisis rápidos de grupos de genes de biosíntesis de metabolitos secundarios en secuencias genómicas bacterianas y fúngicas" . Nucleic Acids Research . 39 (número especial de servidor web): W339– W346. doi : 10.1093 / nar/gkr466 . PMC 3125804. PMID 21672958 .   
  13. Navarro-Muñoz, Jorge C.; Selem-Mojica, Nelly; Mullowney, Michael W.; Kautsar, Satria A.; Tryon, James H.; Parkinson, Elizabeth I.; De Los Santos, Emmanuel LC; Yeong, Marley; Cruz-Morales, Pablo; Abubucker, Sahar; Roeters, Arne; Lokhorst, Wouter; Fernandez-Guerra, Antonio; Cappelini, Luciana Teresa Dias; Goering, Anthony W. (enero de 2020). "Un marco computacional para explorar la diversidad biosintética a gran escala" . Nature Chemical Biology . 16 (1): 60– 68. doi : 10.1038 / s41589-019-0400-9 . ISSN 1552-4469 . PMC 6917865. PMID 31768033 .   
  14. "PRISM" . Adapsyn Bioscience.
  15. Skinnider MA, Johnston CW, Gunabalasingam M, Merwin NJ, Kieliszek AM, MacLellan RJ, et al. (noviembre de 2020). "Predicción integral de la estructura y actividad biológica de metabolitos secundarios a partir de secuencias de genomas microbianos" . Nature Communications . 11 (1): 6058. Bibcode : 2020NatCo..11.6058S . doi : 10.1038/ s41467-020-19986-1 . PMC 7699628. PMID 33247171 .   
  16. King RD, Wise PH, Clare A (mayo de 2004). "Confirmación de predicciones de la función de las proteínas basadas en minería de datos" . Bioinformatics . 20 (7): 1110– 1118. doi : 10.1093/bioinformatics/bth047 . PMID 14764546 . 
  17. Altschul SF, Gish W, Miller W, Myers EW, Lipman DJ (octubre de 1990). "Herramienta básica de búsqueda de alineación local". Journal of Molecular Biology . 215 (3): 403– 410. doi : 10.1016/S0022-2836(05)80360-2 . PMID 2231712 . 
  18. Medema MH, de Rond T, Moore BS (septiembre de 2021). "Explorando genomas para esclarecer la química especializada de la vida" . Nature Reviews. Genetics . 22 (9): 553– 571. doi : 10.1038/s41576-021-00363-7 . PMC 8364890. PMID 34083778 .  
  19. Rutledge PJ, Challis GL (agosto de 2015). "Descubrimiento de productos naturales microbianos mediante la activación de grupos de genes biosintéticos silenciosos". Nature Reviews. Microbiology . 13 (8): 509– 523. doi : 10.1038/nrmicro3496 . PMID 26119570. S2CID 6474118 .  
  20. Belknap KC, Park CJ, Barth BM, Andam CP (febrero de 2020). "Exploración genómica de grupos de genes biosintéticos y quimioterapéuticos en bacterias Streptomyces" . Scientific Reports . 10 (1): 2003. Bibcode : 2020NatSR..10.2003B . doi : 10.1038/s41598-020-58904-9 . PMC 7005152. PMID 32029878 .  
  21. Hoffmeister D, Keller NP (abril de 2007). "Productos naturales de hongos filamentosos: enzimas, genes y su regulación". Natural Product Reports . 24 (2): 393– 416. doi : 10.1039/B603084J . PMID 17390002 . 
  22. Micallef ML, D'Agostino PM, Sharma D, Viswanathan R, Moffitt MC (septiembre de 2015). "Búsqueda de clústeres de genes biosintéticos de productos naturales en el genoma de cianobacterias de la subsección V" . BMC Genomics . 16 (1): 669. doi : 10.1186/s12864-015-1855-z . PMC 4558948 . PMID 26335778 .  
  23. Gomez-Escribano JP, Bibb MJ (febrero de 2014). "Expresión heteróloga de grupos de genes biosintéticos de productos naturales en Streptomyces coelicolor: de la minería del genoma a la manipulación de las vías biosintéticas". Journal of Industrial Microbiology & Biotechnology . 41 (2): 425– 431. doi : 10.1007/s10295-013-1348-5 . PMID 24096958 . S2CID 15215660 .  
  24. ^ Sayers EW, Cavanaugh M, Clark K, Pruitt KD, Schoch CL, Sherry ST, Karsch-Mizrachi I (enero de 2021). "GenBank" . Investigación de ácidos nucleicos . 49 (D1): D92– D96. doi : 10.1093/nar/gkaa1023 . PMC 7778897 . PMID 33196830 .  
  25. "IMG-ABC" .
  26. ^ Palaniappan K, Chen IA, Chu K, Ratner A, Seshadri R, Kyrpides NC, et al. (Enero de 2020). "IMG-ABC v.5.0: una actualización de la base de conocimientos IMG/Atlas of Biosynthetic Gene Clusters" . Investigación de ácidos nucleicos . 48 (D1): D422– D430. doi : 10.1093/nar/gkz932 . PMC 7145673 . PMID 31665416 .   
  27. "FAMILIA GRANDE" .
  28. Kautsar SA, Blin K, Shaw S, Weber T, Medema MH (enero de 2021). "BiG-FAM: la base de datos de familias de clústeres de genes biosintéticos" . Nucleic Acids Research . 49 (D1): D490– D497. doi : 10.1093 / nar/gkaa812 . PMC 7778980. PMID 33010170 .  
  29. "DoBISCUIT" .
  30. Ichikawa N, Sasagawa M, Yamamoto M, Komaki H, Yoshida Y, Yamazaki S, Fujita N (enero de 2013). "DoBISCUIT: una base de datos de clústeres de genes biosintéticos de metabolitos secundarios" . Nucleic Acids Research . 41 (número especial de bases de datos): D408– D414. doi : 10.1093/nar/ gks1177 . PMC 3531092. PMID 23185043 .  
  31. "MIBiG" .
  32. Kautsar SA, Blin K, Shaw S, Navarro-Muñoz JC, Terlouw BR, van der Hooft JJ, et al. (enero de 2020). "MIBiG 2.0: un repositorio para grupos de genes biosintéticos de función conocida" . Nucleic Acids Research . 48 (D1): D454– D458. doi : 10.1093/nar/gkz882 . PMC 7145714. PMID 31612915 .   
  33. "iTOL" .
  34. Letunic I, Bork P (julio de 2016). "Árbol interactivo de la vida (iTOL) v3: una herramienta en línea para la visualización y anotación de árboles filogenéticos y otros" . Nucleic Acids Research . 44 (W1): W242– W245. doi : 10.1093/nar/gkw290 . PMC 4987883. PMID 27095192 .