Articulo de referencia

Ensamblaje del genoma vegetal

El ensamblaje del genoma de una planta representa la secuencia genómica completa de una especie vegetal , la cual se ensambla en cromosomas y otros orgánulos utilizando fragment...

El ensamblaje del genoma de una planta representa la secuencia genómica completa de una especie vegetal , la cual se ensambla en cromosomas y otros orgánulos utilizando fragmentos de ADN (ácido desoxirribonucleico) obtenidos a partir de diferentes tipos de tecnología de secuenciación .

Estructura

El genoma de las plantas puede variar en su estructura y complejidad desde genomas pequeños como las algas verdes (15 Mbp) [ 1 ] hasta genomas muy grandes y complejos que suelen tener una ploidía mucho mayor , mayores tasas de heterocigosidad y elementos repetitivos que las especies de otros reinos [ 2 ] . Uno de los ensamblajes de genomas de plantas más complejos disponibles es el del pino taeda (22 Gbp) [ 3 ] . Debido a su complejidad, las secuencias del genoma de las plantas no se pueden volver a ensamblar en cromosomas utilizando solo lecturas cortas proporcionadas por las tecnologías de secuenciación de próxima generación (NGS) [ 4 ] [ 5 ] y, por lo tanto, la mayoría de los ensamblajes de genomas de plantas disponibles que utilizaron solo NGS están altamente fragmentados, contienen grandes cantidades de contigs y las regiones del genoma no están completas. Las secuencias altamente repetitivas, a menudo mayores de 10 kbp, son el principal desafío en las plantas. [ 6 ] [ 7 ] La mayoría de las secuencias cromosómicas son producidas por la actividad de elementos genéticos móviles (EGM) en los genomas de las plantas. [ 8 ] Los EGM se dividen en dos clases: clase I o retrotransposones , y clase II o transposones de ADN . En las plantas, los retrotransposones de repetición terminal larga (LTR) son predominantes y constituyen del 15% [ 9 ] al 90% del genoma. [ 10 ] La poliploidía es otro desafío en el ensamblaje de un genoma vegetal, y se estima que ≈80% de las plantas son poliploides. [ 11 ]

Ensamblajes

El primer ensamblaje completo del genoma vegetal , el de Arabidopsis thaliana , se completó en 2000, [ 12 ] siendo el tercer genoma eucariota multicelular publicado después de C. elegans [ 13 ] y D. melanogaster . [ 14 ] Arabidopsis, a diferencia de otros genomas vegetales (por ejemplo, Malus ), posee características ventajosas, como un genoma nuclear pequeño (135 Mbp) y un corto tiempo de generación (8 semanas de semilla a semilla). El genoma tiene cinco cromosomas que reflejan aproximadamente el 4% del tamaño del genoma humano . El genoma fue secuenciado y anotado por la Iniciativa del Genoma de Arabidopsis (AGI).

La iniciativa para secuenciar el genoma del arroz ( Oryza sativa ) [ 15 ] comenzó en septiembre de 1997, cuando científicos de diversas naciones acordaron una colaboración internacional para secuenciar el genoma del arroz, formando el "Proyecto Internacional de Secuenciación del Genoma del Arroz" (IRGSP). Con un tamaño estimado de entre 400 y 430 Mb, aproximadamente cuatro veces mayor que el de A. thaliana , el arroz posee el genoma más pequeño entre los principales cereales. [ 15 ]

Entre 2000 y 2008 se publicaron un total de 10 genomas de plantas, mientras que solo en 2012 se publicaron 13. Desde entonces, el número ha ido en constante aumento, y actualmente hay más de 400 genomas de plantas disponibles en la base de datos de genomas del NCBI, de los cuales 72 fueron reanotados [NCBI].

Bases de datos

EnsemblPlants [ 16 ] forma parte de la base de datos EnsemblGenome y contiene recursos para un número reducido de especies de plantas secuenciadas (45, octubre de 2017). Principalmente proporciona secuencias genómicas, modelos genéticos, anotaciones funcionales y loci polimórficos. Para algunas especies de plantas, se proporciona información adicional, incluyendo estructura poblacional, genotipos individuales, ligamiento y datos fenotípicos.

Gramene [ 17 ] es un recurso de base de datos web en línea para genómica comparativa de plantas y análisis de vías metabólicas basado en la tecnología Ensembl.

La base de datos del genoma vegetal de Japón [ 18 ] (PGDBj) es un sitio web que contiene información relacionada con los genomas de plantas modelo y cultivos procedentes de diversas bases de datos. Consta de tres componentes principales: una base de datos de ortólogos, una base de datos de marcadores de ADN y mapas de ligamiento, y una base de datos de recursos vegetales, donde se integran múltiples recursos vegetales recopilados por diferentes institutos. Su objetivo es "proporcionar una plataforma que permita realizar búsquedas comparativas de diferentes recursos" (pgdbj.jp).

PlantsDB [ 19 ] es un recurso para analizar y almacenar información genética y genómica de varias plantas, y ofrece herramientas para consultar estos datos y realizar análisis comparativos con la ayuda de herramientas propias.

PLAZA [ ​​20 ] [ 21 ] es otro recurso en línea para genómica comparativa que integra datos de secuencias de plantas y métodos genómicos comparativos, y realiza análisis evolutivos dentro del linaje de plantas verdes ( Viridiplantae ).

El Recurso de Información sobre Arabidopsis (TAIR) [ 22 ] mantiene una base de datos web de la " planta superior modelo Arabidopsis thaliana".

Estrategias de ensamblaje

En general, para la secuenciación y el ensamblaje de genomas grandes y complejos como los de las plantas, se utilizan diferentes estrategias, en función de las tecnologías disponibles en el momento en que se inició el proyecto.

Sanger clon por clon

Las estrategias de secuenciación clon por clon se basan en la construcción de un mapa para cada cromosoma antes de la secuenciación y dependen de bibliotecas creadas a partir de clones de gran tamaño. El tipo más común de clon de gran tamaño es el cromosoma artificial bacteriano (BAC).

Con BAC, el genoma se divide primero en fragmentos más pequeños, registrando su ubicación. Estos fragmentos de ADN se insertan en clones BAC, que a su vez se multiplican insertándolos en células bacterianas de rápido crecimiento. Estos fragmentos se subdividen en piezas más pequeñas superpuestas que se colocan en un vector y se secuencian. Posteriormente, estas piezas pequeñas se ensamblan en contigs mediante su superposición. Finalmente, utilizando el mapa del primer paso, los contigs se recombinan para formar los cromosomas.

El primer ensamblaje completo del genoma vegetal (y también el primer genoma vegetal publicado) que utilizó este tipo de técnica fue el de Arabidopsis thaliana, en 2000. [ 12 ] Se combinaron diferentes bibliotecas de inserción grande como BAC, cromosomas artificiales P1 (PAC), cromosomas artificiales de levadura (YAC) y cromosomas artificiales competentes para transformación (TAC) para ensamblar el genoma. A partir de clones con huella dactilar de fragmentos de restricción , mediante la comparación de los patrones y la hibridación o la reacción en cadena de la polimerasa (PCR) se construyeron los mapas físicos . Los mapas físicos se integraron junto con los mapas genéticos para identificar las posiciones y orientaciones de los contigs . Las secuencias terminales de 47.788 clones BAC se utilizaron para extender los contigs de los BAC anclados y para seleccionar una ruta de mosaico mínima. Se seleccionaron y secuenciaron un total de 1.569 clones encontrados en la ruta de mosaico mínima. Los productos de PCR directa se utilizaron para clonar los huecos restantes, y los YAC permitieron la caracterización de las secuencias de telómeros . Las regiones secuenciadas resultantes fueron de 115,4 Mb de los 125 Mb del tamaño previsto del genoma y un total de 25.498 genes codificadores de proteínas.

Para secuenciar y ensamblar el genoma de Oryza sativa ( japonica ), [ 15 ] se utilizó la misma estrategia. Para Oryza sativa se seleccionaron y ensamblaron un total de 3401 clones mapeados en una ruta de mosaico mínima del mapa físico.

Uno de los cultivos más importantes del mundo, el maíz ( Zea mays ), es el último proyecto de genoma vegetal basado principalmente en la estrategia Sanger BAC-by-BAC. [ 23 ] El tamaño del genoma del maíz, 2,3 Gb y 10 cromosomas, [ 23 ] es significativamente mayor que el del arroz y Arabidopsis. [ 23 ] Para ensamblar el genoma del maíz se derivó un conjunto de 16.848 clones BAC mínimamente superpuestos.

Se seleccionaron y secuenciaron combinaciones de mapas físicos y genéticos. El ensamblaje en maíz se realizó además con datos de información externa. Los datos se obtuvieron a partir de ADNc y secuencias de bibliotecas con ADN metil-filtrado (bibliotecas que utilizan el conocimiento de que las bases en secuencias génicas tienden a estar menos metiladas que las de regiones no génicas) y técnicas de alto C0 t.

La estrategia de clonación de Sanger presenta la ventaja de trabajar en unidades pequeñas, lo que reduce la complejidad y los requisitos computacionales, además de minimizar los problemas asociados con el ensamblaje incorrecto de ADN altamente repetitivo. Por lo tanto, es una solución atractiva para el ensamblaje de genomas de plantas y otros genomas eucariotas complejos. Las principales desventajas de este método son los costos y los recursos necesarios. El costo de los primeros ensamblajes de genomas de plantas se estimó entre 70 millones de dólares [ 24 ] y 200 millones de dólares por ensamblaje. [ 25 ]

Secuenciación genómica completa de Sanger (WGS)

En la tecnología de secuenciación WGS, no existe un orden específico para los fragmentos que se secuencian. El ADN se fragmenta aleatoriamente y los fragmentos clonados se secuencian y ensamblan mediante métodos computacionales. Esta tecnología reduce el costo y el tiempo asociados con la construcción de los mapas y depende de recursos computacionales.

Se secuenciaron y ensamblaron con la estrategia WGS de Sanger un número considerable de genomas de plantas importantes como la vid ( Vitis Vinifer ), [ 26 ] la papaya ( Carica papaya ), [ 27 ] y el álamo ( Populus trichocarpa ) [ 28 ] .

El borrador del genoma de la vid [ 26 ] es el cuarto genoma publicado para una planta con flores y el primero de un cultivo frutal. Las secuencias del genoma se obtuvieron de diferentes tipos de bibliotecas, como plásmidos, fosmidos y BACs. Todos los datos se generaron mediante secuenciación de extremos apareados de insertos clonados utilizando la tecnología Sanger en secuenciadores ABI3730x1. Para ensamblar las lecturas, se utilizó Arachne, 2002, [ 29 ] un software diseñado para analizar lecturas obtenidas de ambos extremos de clones de plásmidos . En total se produjeron 6,2 millones de lecturas de etiquetas de extremos apareados. El software produjo 20.784 contigs que se combinaron en 3.830 supercontigs, con un valor N50 de 64 kb. Los supercontigs tenían un tamaño total de 498 Mb.

El anclaje de los supercontigs a lo largo del genoma se realizó primero uniendo supercontigs mediante secuencias de extremos BAC emparejadas. Los ultracontigs resultantes y los supercontigs restantes se alinearon a lo largo del mapa genético del genoma. Mejoras posteriores de esta estrategia permitieron la secuenciación de Brachypodium distachyon , [ 30 ] Sorghum bicolor [ 31 ] y soja . [ 32 ]

Secuenciación de próxima generación

Debido a su coste relativamente bajo en comparación con los métodos anteriores, la mayoría de los genomas de plantas recientes se secuenciaron y ensamblaron utilizando datos de la tecnología NGS (secuenciación de próxima generación). En general, los datos NGS se utilizan en combinación con la tecnología de secuenciación Sanger o lecturas largas obtenidas de la secuenciación de tercera generación . El genoma del pepino ( Cucumis sativus ) [ 33 ] fue uno de los genomas de plantas que utilizó lecturas Illumina NGS en combinación con secuencias Sanger. Se generaron pares de bases de alta calidad con una cobertura genómica de 72,2x, de los cuales 3,9x fueron proporcionados por Sanger y las lecturas GA de Illumina proporcionaron una cobertura de 68,3x. A partir de esto, se produjeron dos ensamblajes basados ​​en la tecnología de secuenciación. Los contigs resultantes se compararon entre ellos, lo que dio como resultado una longitud total del genoma ensamblado de 243,5 Mb. El resultado es aproximadamente un 30% menor que el tamaño del genoma estimado por citometría de flujo de núcleos aislados teñidos con yoduro de propidio (367 Mb). Se construyó un mapa genético para anclar el genoma ensamblado. El 72,8% de las secuencias ensambladas se anclaron con éxito en los siete cromosomas. Otro genoma vegetal que combinó NGS con secuenciación Sanger fue el genoma de Theobroma cacao , 2010, [ 34 ] un cultivo de árbol frutal tropical de importancia económica y la principal fuente de cacao. El genoma fue secuenciado en un consorcio, "The International Cocoa Genome Sequencing consortium (ICGS)" y produjo un total de 17,6 millones de lecturas de extremo único 454, 8,8 millones de lecturas de extremo apareado 454, 398,0 millones de lecturas de extremo apareado Illumina y alrededor de 88.000 lecturas Sanger BAC. Primero, utilizando el software de ensamblaje de genomas Newbler, se produjo un ensamblaje con 25.912 contigs y 4.792 andamios a partir de las lecturas obtenidas de los datos brutos de Roche/454 y Sanger. Esto tuvo una longitud total de 326,9 Mb, que representa el 76% del tamaño estimado del genoma. Las lecturas de Illumina se utilizaron para complementar el ensamblaje 454 , alineando las lecturas cortas en el ensamblaje del genoma del cacao utilizando el software SOAP. Se utilizó una estrategia similar que combinó lecturas NGS y secuenciación Sanger para otras especies de plantas importantes como el primer genoma de manzana publicado ( Malus domestica ), [ 35 ] algodón ( Gossypium Raimond ), [ 36 ] genoma borrador de naranja dulce ( Citrus sinensis ) [ 37 ] y el genoma del tomate domesticado ( Solanum lycopersicum ) [ 38 ].

Tercera generación

Con la aparición de la secuenciación de tercera generación (TGS), se han empezado a abordar algunas de las limitaciones de los métodos anteriores de secuenciación y ensamblaje de genomas de plantas. Esta tecnología se caracteriza por la secuenciación paralela de moléculas individuales de ADN, que da como resultado secuencias de hasta 54 kbp de longitud ( PacBio RS 2). [ 39 ] En general, las lecturas largas de TGS tienen tasas de error relativamente altas (≈10% en promedio) [ 40 ] y, por lo tanto, se requiere la secuenciación repetida de los mismos fragmentos de ADN. El precio de dicha tecnología sigue siendo bastante alto y, por lo tanto, generalmente se utiliza en combinación con lecturas cortas de NGS. Uno de los primeros genomas de plantas que utilizó lecturas largas de TGS, Pacific Biosciences en combinación con lecturas cortas de NGS fue el genoma de la espinaca [ 41 ] con un tamaño de genoma estimado en 989 Mb. Para ello, se generó una cobertura de 60× del genoma, con un 20% de las lecturas mayores de 20 kb. Los datos se ensamblaron utilizando el proceso de ensamblaje jerárquico del genoma (HGAP) de PacBio, [ 42 ] y mostraron que los ensamblajes de lecturas largas revelaron una mejora de 63 veces en el tamaño de los contigs en comparación con un ensamblaje solo de Illumina. Otro genoma de planta que se publicó recientemente que utilizó lecturas largas en combinación con lecturas cortas es el ensamblaje mejorado del genoma de la manzana. [ 43 ] En este proyecto se utilizó un enfoque híbrido, combinando diferentes tipos de datos de tecnologías de secuenciación. Las secuencias utilizadas provenían de: PacBio RS II, lecturas de extremos emparejados (PE) de Illumina y lecturas de pares de extremos (MP) de Illumina. Como primer paso se realizó un ensamblaje a partir de lecturas de extremos emparejados de Illumina utilizando un software de ensamblaje de novo bien conocido SOAPdevo. [ 44 ] Luego, utilizando una canalización de ensamblaje híbrido DBG2OLC. [ 45 ] los contigs obtenidos en el primer paso y las lecturas largas de PacBio se combinaron. El ensamblaje se refinó posteriormente con la ayuda de lecturas de extremos emparejados de Illumina, mapeándolas a los contigs mediante BWA-MEM. [ 46 ] Al mapear las lecturas de pares de extremos en los contigs corregidos, se formó el andamiaje del ensamblaje. Además, se utilizó un análisis de mapeo óptico de BioNano [ 47 ] con una longitud total de 649,7 Mb, en el proceso de ensamblaje híbrido junto con los andamios obtenidos en el paso anterior. Los andamios resultantes se anclaron a un mapa genético construido a partir de 15.417 polimorfismos de un solo nucleótido.Marcadores (SNP). Para comprender mejor el número y la diversidad de genes identificados, se utilizó ARN-seq. El genoma resultante tiene una dimensión de 643,2 Mb, acercándose más al tamaño estimado del genoma que el ensamblaje publicado anteriormente [ 35 ] y un número menor de genes codificadores de proteínas.

El uso de lecturas largas en el ensamblaje del genoma vegetal se ha vuelto más popular, ya que reduce el número de andamios y aumenta la calidad del genoma al mejorar el ensamblaje y la cobertura en regiones que no están claramente definidas por el ensamblaje NGS.

Referencias

  1. Moreau H, Verhelst B, Couloux A, Derelle E, Rombauts S, Grimsley N, et  al. (agosto de 2012). "Las funcionalidades genéticas y la estructura del genoma en Bathycoccus prasinos reflejan especializaciones celulares en la base del linaje verde" . Genome Biology . 13 (8) R74. Bibcode : 2012GenBi..13..R74M . doi : 10.1186 / gb-2012-13-8-r74 . PMC 3491373. PMID 22925495 .  
  2. Gregory TR (enero de 2005). "El enigma del valor C en plantas y animales: una revisión de paralelismos y un llamamiento a la colaboración" . Annals of Botany . 95 (1): 133– 146. doi : 10.1093/aob/mci009 . PMC 4246714. PMID 15596463 .  
  3. Zimin A, Stevens KA, Crepeau MW, Holtz-Morris A, Koriabine M, Marçais G, et al. (marzo de 2014). " Secuenciación y ensamblaje del genoma de pino taeda de 22 GB" . Genetics . 196 (3): 875– 890. Bibcode : 2014Genet.196..875Z . doi : 10.1534/genetics.113.159715 . PMC 3948813. PMID 24653210 .   
  4. Deschamps S, Campbell MA (2010-04-01). "Utilización de plataformas de secuenciación de próxima generación en genómica vegetal y descubrimiento de variantes genéticas". Molecular Breeding . 25 (4): 553– 570. Bibcode : 2010MBree..25..553D . doi : 10.1007/s11032-009-9357-9 . S2CID 29239452 . 
  5. Shendure J, Ji H (octubre de 2008). "Secuenciación de ADN de próxima generación". Nature Biotechnology . 26 (10): 1135– 1145. doi : 10.1038/nbt1486 . ​​PMID 18846087. S2CID 6384349 .  
  6. Treangen TJ, Salzberg SL (noviembre de 2011). " ADN repetitivo y secuenciación de próxima generación: desafíos y soluciones computacionales" . Nature Reviews. Genetics . 13 (1): 36– 46. doi : 10.1038/nrg3117 . PMC 3324860. PMID 22124482 .  
  7. Harrison GE, Heslop-Harrison JS (febrero de 1995). "Secuencias repetitivas de ADN centromérico en el género Brassica". Theoretical and Applied Genetics . 90 (2): 157– 165. doi : 10.1007/BF00222197 . PMID 24173886. S2CID 20591213 .  
  8. ^ Lanciano S, Carpentier MC, Llauro C, Jobet E, Robakowska-Hyzorek D, Lasserre E, et al. (febrero de 2017). "La secuenciación del mobiloma circular extracromosómico revela actividad de retrotransposón en plantas" . PLOS Genética . 13 (2) e1006630. doi : 10.1371/journal.pgen.1006630 . PMC 5338827 . PMID 28212378 .   
  9. Michael TP, VanBuren R (abril de 2015). "Progreso, desafíos y el futuro de los genomas de cultivos". Current Opinion in Plant Biology . 24 : 71–81 . Bibcode : 2015COPB...24...71M . doi : 10.1016/j.pbi.2015.02.002 . PMID 25703261 . 
  10. Flavell RB, Gale MD, O'dell M, Murphy G, Moore G, Lucas H (1993). «Organización molecular de genes y repeticiones en los grandes genomas de cereales e implicaciones para el aislamiento de genes mediante el rastreo cromosómico». Chromosomes Today . Dordrecht: Springer. pp. 199–213 . doi : 10.1007/978-94-011-1510-0_16 . ISBN  978-94-010-4660-2.
  11. Meyers LA, Levin DA (junio de 2006). "Sobre la abundancia de poliploides en plantas con flores". Evolution; International Journal of Organic Evolution . 60 (6): 1198– 1206. Bibcode : 2006Evolu..60.1198M . doi : 10.1554/ 05-629.1 . PMID 16892970. S2CID 198156503 .  
  12. 1 2 La Iniciativa del Genoma de Arabidopsis (diciembre de 2000). "Análisis de la secuencia del genoma de la planta con flores Arabidopsis thaliana" . Nature . 408 (6814): 796– 815. Bibcode : 2000Natur.408..796T . doi : 10.1038/35048692 . PMID 11130711 . 
  13. El Consorcio de Secuenciación de C. elegans (diciembre de 1998). "Secuencia del genoma del nematodo C. elegans: una plataforma para investigar la biología". Science . 282 (5396): 2012– 2018. Bibcode : 1998Sci...282.2012. . doi : 10.1126/science.282.5396.2012 . JSTOR 2897605 . PMID 9851916 .  
  14. ^ Adams MD, Celniker SE, Holt RA, Evans CA, Gocayne JD, Amanatides PG, et al. (Marzo de 2000). "La secuencia del genoma de Drosophila melanogaster". Ciencia . 287 (5461): 2185– 2195. Bibcode : 2000Sci...287.2185. . CiteSeerX 10.1.1.549.8639 . doi : 10.1126/ciencia.287.5461.2185 . PMID 10731132 .   
  15. 1 2 3 Goff SA, Ricke D, Lan TH, Presting G, Wang R, Dunn M, et al. (abril de 2002). "Una secuencia preliminar del genoma del arroz (Oryza sativa L. ssp. japonica)". Science . 296 (5565): 92– 100. Bibcode : 2002Sci...296...92G . doi : 10.1126/science.1068275 . PMID 11935018 . S2CID 2960202 .   
  16. Bolser D, Staines DM, Pritchard E, Kersey P (2016). "Ensembl Plants: Integrating Tools for Visualizing, Mining, and Analyzing Plant Genomics Data". Bioinformática vegetal . Métodos en biología molecular. Vol. 1374. Humana Press, Nueva York, NY. págs. 115–140 . doi : 10.1007/978-1-4939-3167-5_6 . ISBN   978-1-4939-3166-8. PMID 26519403 . 
  17. Gupta P, Naithani S, Tello-Ruiz MK, Chougule K, D'Eustachio P, Fabregat A, et al. (noviembre de 2016). " Base de datos Gramene: Navegando por los recursos de genómica comparativa de plantas" . Current Plant Biology . 7–8 : 10–15 . Bibcode : 2016CPBio...7...10G . doi : 10.1016 /j.cpb.2016.12.005 . PMC 5509230. PMID 28713666 .   
  18. ^ Nakaya A, Ichihara H, Asamizu E, Shirasawa S, Nakamura Y, Tabata S, Hirakawa H (2017). "Base de datos del genoma vegetal de Japón (PGDBJ)". Bases de datos de genómica vegetal . Métodos en biología molecular. vol. 1533. Nueva York, Nueva York: Humana Press. págs. 45 a 77. doi : 10.1007/978-1-4939-6658-5_3 . ISBN   978-1-4939-6656-1. PMID 27987164 . 
  19. Spannagl M, Nussbaumer T, Bader K, Gundlach H, Mayer KF (2017). "Marco de la base de datos PGSB/MIPS PlantsDB para la integración y el análisis de datos del genoma vegetal". Bases de datos de genómica vegetal . Métodos en biología molecular. Vol. 1533. Nueva York, NY: Humana Press. págs. 33–44 . doi : 10.1007/978-1-4939-6658-5_2 . ISBN   978-1-4939-6656-1. PMID 27987163 . 
  20. Vandepoele K (2017). "Guía de la base de datos genómica comparativa de plantas PLAZA 3.0". Bases de datos de genómica vegetal . Métodos en biología molecular. Vol. 1533. Humana Press, Nueva York, NY. págs. 183–200 . doi : 10.1007/978-1-4939-6658-5_10 . ISBN   978-1-4939-6656-1. PMID 27987171 . 
  21. Van Bel M, Silvestri F, Weitz EM, Kreft L, Botzki A, Coppens F, Vandepoele K (enero de 2022). "PLAZA 5.0: ampliando el alcance y el poder de la genómica comparativa y funcional en plantas" . Nucleic Acids Research . 50 (D1): D1468– D1474. doi : 10.1093/nar/ gkab1024 . PMC 8728282. PMID 34747486 .  
  22. Reiser L, Berardini TZ, Li D, Muller R, Strait EM, Li Q, et al. (2016-01-01). " Financiamiento sostenible para la bioconservación: El Recurso de Información de Arabidopsis (TAIR) como estudio de caso de un modelo de financiamiento basado en suscripción" . Base de datos . 2016 baw018. doi : 10.1093/database/baw018 . PMC 4795935. PMID 26989150 .   
  23. 1 2 3 Schnable PS, Ware D, Fulton RS, Stein JC, Wei F, Pasternak S, et al. (noviembre de 2009). " El genoma del maíz B73: complejidad, diversidad y dinámica" . Science . 326 (5956): 1112– 1115. Bibcode : 2009Sci...326.1112S . doi : 10.1126/science.1178534 . PMID 19965430. S2CID 21433160 .   
  24. Feuillet C, Leach JE, Rogers J, Schnable PS, Eversole K (febrero de 2011). "Secuenciación del genoma de cultivos: lecciones y fundamentos". Trends in Plant Science . 16 (2): 77– 88. Bibcode : 2011TPS....16...77F . doi : 10.1016/j.tplants.2010.10.005 . PMID 21081278 . 
  25. Saegusa A (abril de 1999). "La oferta de una empresa estadounidense para secuenciar el genoma del arroz causa revuelo en Japón" . Nature . 398 (6728): 545. Bibcode : 1999Natur.398..545S . doi : 10.1038/19123 . PMID 10217128 . 
  26. 1 2 Jaillon O, Aury JM, Noel B, Policriti A, Clepet C, Casagrande A, et al. (septiembre de 2007). "La secuencia del genoma de la vid sugiere hexaploidización ancestral en los principales filos de angiospermas" . Nature . 449 (7161): 463– 467. Bibcode : 2007Natur.449..463J . doi : 10.1038/nature06148 . hdl : 11577/2430527 . PMID 17721507 .  
  27. Ming R, Hou S, Feng Y, Yu Q, Dionne-Laporte A, Saw JH, et al. (abril de 2008). " El borrador del genoma del árbol frutal tropical transgénico papaya (Carica papaya Linnaeus)" . Nature . 452 (7190): 991–996 . Bibcode : 2008Natur.452..991M . doi : 10.1038/nature06856 . PMC 2836516. PMID 18432245 .   
  28. Tuskan GA, Difazio S, Jansson S, Bohlmann J, Grigoriev I, Hellsten U, et al. (septiembre de 2006). "El genoma del álamo negro, Populus trichocarpa (Torr. & Gray)" . Science (manuscrito enviado). 313 (5793): 1596–1604 . Bibcode : 2006Sci...313.1596T . doi : 10.1126/science.1128691 . OSTI 901819. PMID 16973872. S2CID 7717980. Archivado del original el 29 de mayo de 2023. Recuperado el 19 de junio de 2023 .    
  29. Swan KA, Curtis DE, McKusick KB, Voinov AV, Mapa FA, Cancilla MR (julio de 2002). "Mapeo genético de alto rendimiento en Caenorhabditis elegans" . Genome Research . 12 (7): 1100– 1105. doi : 10.1101/gr.208902 . PMC 186621. PMID 12097347 .  
  30. La Iniciativa Internacional Brachypodium; et al. (febrero de 2010). "Secuenciación y análisis del genoma de la gramínea modelo Brachypodium distachyon" . Nature . 463 (7282): 763–768 . Bibcode : 2010Natur.463..763T . doi : 10.1038/nature08747 . PMID 20148030 .  
  31. Paterson AH, Bowers JE, Bruggmann R, Dubchak I, Grimwood J, Gundlach H, et al. (enero de 2009). "El genoma de Sorghum bicolor y la diversificación de las gramíneas" . Nature . 457 (7229): 551– 556. Bibcode : 2009Natur.457..551P . doi : 10.1038/nature07723 . PMID 19189423 .  
  32. ^ Schmutz J, Cannon SB, Schlueter J, Ma J, Mitros T, Nelson W, et al. (Enero de 2010). "Secuencia del genoma de la soja paleopoliploide" . Naturaleza . 463 (7278): 178– 183. Bibcode : 2010Natur.463..178S . doi : 10.1038/naturaleza08670 . PMID 20075913 . S2CID 4372224 .   
  33. Huang S, Li R, Zhang Z, Li L, Gu X, Fan W, et al. (diciembre de 2009). "El genoma del pepino, Cucumis sativus L" . Nature Genetics . 41 (12): 1275– 1281. doi : 10.1038/ng.475 . PMID 19881527 .  
  34. Argout X, Salse J, Aury JM, Guiltinan MJ, Droc G, Gouzy J, et al. (febrero de 2011). " El genoma de Theobroma cacao" . Nature Genetics . 43 (2): 101– 108. doi : 10.1038/ng.736 . PMID 21186351. S2CID 4685532 .   
  35. ^ Velasco R, Zharkikh A, Affourtit J, Dhingra A, Cestaro A, Kalyanaraman A, et al. (octubre de 2010). "El genoma de la manzana domesticada (Malus × domestica Borkh.)" . Genética de la Naturaleza . 42 (10): 833– 839. doi : 10.1038/ng.654 . PMID 20802477 .  
  36. Wang K, Wang Z, Li F, Ye W, Wang J, Song G, et al. (octubre de 2012). " El genoma preliminar de un algodón diploide Gossypium raimondii" . Nature Genetics . 44 (10): 1098–1103 . doi : 10.1038/ng.2371 . PMID 22922876. S2CID 38495587 .   
  37. Xu Q, Chen LL, Ruan X, Chen D, Zhu A, Chen C, et al. (enero de 2013). "El borrador del genoma de la naranja dulce (Citrus sinensis)" . Nature Genetics . 45 (1): 59– 66. doi : 10.1038/ng.2472 . PMID 23179022 .  
  38. Consorcio del Genoma del Tomate (mayo de 2012). "La secuencia del genoma del tomate proporciona información sobre la evolución de los frutos carnosos" . Nature . 485 ( 7400): 635– 641. Bibcode : 2012Natur.485..635T . doi : 10.1038/nature11119 . PMC 3378239. PMID 22660326 .  
  39. Bleidorn C (2015). "Secuenciación de tercera generación: tecnología y su impacto potencial en la investigación de la biodiversidad evolutiva". Systematics and Biodiversity . 14 (1): 1. Bibcode : 2016SyBio..14....1B . doi : 10.1080/14772000.2015.1099575 .
  40. Lee H, Gurtowski J, Yoo S, Nattestad M, Marcus S, Goodwin S, McCombie WR, Schatz M (2016-04-13). "Secuenciación de tercera generación y el futuro de la genómica". bioRxiv 10.1101/048603 . 
  41. van Deynze A (2015). "Uso de espinacas para comparar tecnologías para ensamblajes de genomas completos". Conferencia XXIII de Genómica Vegetal y Animal .
  42. Chin CS, Alexander DH, Marks P, Klammer AA, Drake J, Heiner C, et al. (junio de 2013). "Ensamblajes de genomas microbianos terminados no híbridos a partir de datos de secuenciación SMRT de lectura larga". Nature Methods . 10 (6): 563– 569. doi : 10.1038/nmeth.2474 . PMID 23644548. S2CID 205421576 .   
  43. Daccord N, Celton JM, Linsmith G, Becker C, Choisne N, Schijlen E, et al. (julio de 2017). "Ensamblaje de novo de alta calidad del genoma de la manzana y dinámica del metiloma del desarrollo temprano del fruto" . Nature Genetics . 49 (7): 1099– 1106. doi : 10.1038/ng.3886 . hdl : 10449/42064 . PMID 28581499. S2CID 24690391 .   
  44. Luo R, Liu B, Xie Y, Li Z, Huang W, Yuan J, et al. (diciembre de 2012). " SOAPdenovo2: un ensamblador de novo de lectura corta eficiente en memoria mejorado empíricamente" . GigaScience . 1 (1) 2047-217X-1-18: 18. doi : 10.1186/2047-217X-1-18 . PMC 3626529. PMID 23587118. S2CID 2681931 .    
  45. Ye C, Hill CM, Wu S, Ruan J, Ma ZS (agosto de 2016). "DBG2OLC: Ensamblaje eficiente de genomas grandes utilizando lecturas erróneas largas de las tecnologías de secuenciación de tercera generación" . Scientific Reports . 6 (1) 31900. Bibcode : 2016NatSR...631900Y . doi : 10.1038/srep31900 . PMC 5004134. PMID 27573208 .  
  46. Li H (2013). "Alineación de lecturas de secuencia, secuencias de clones y contigs de ensamblaje con BWA-MEM". arXiv : 1303.3997 [ q-bio.GN ].
  47. "Bionano: Transformando la forma en que el mundo ve el genoma" . bionanogenómica .