En bioinformática , el ensamblaje de secuencias se refiere a la alineación y fusión de fragmentos de una secuencia de ADN más larga para reconstruir la secuencia original. [ 1 ] Esto es necesario ya que la tecnología de secuenciación de ADN podría no ser capaz de "leer" genomas completos de una sola vez, sino que lee pequeños fragmentos de entre 20 y 30 000 bases, dependiendo de la tecnología utilizada. [ 1 ] Por lo general, los fragmentos cortos (lecturas) resultan de la secuenciación aleatoria de ADN genómico o de transcripciones genéticas ( EST ). [ 1 ]
El problema de reconstruir una secuencia de textos se puede comparar con tomar muchas copias de un libro, triturarlas con cuchillas diferentes y reconstruir el texto observando los fragmentos. Además de la evidente dificultad de esta tarea, existen otros problemas prácticos: el original puede contener muchos párrafos repetidos, y algunos fragmentos pueden modificarse durante la trituración, introduciendo errores tipográficos. También pueden añadirse extractos de otro libro, y algunos fragmentos pueden resultar completamente irreconocibles.
Tipos

Existen tres enfoques para recopilar datos de secuenciación:
- De novo: ensamblaje de lecturas de secuenciación para crear secuencias de longitud completa (a veces novedosas), sin utilizar una plantilla (véase ensambladores de secuencias de novo , ensamblaje de transcriptoma de novo ) [ 2 ]
- Mapeo/Alineación: ensamblaje de lecturas mediante su alineación con una plantilla (también conocida como referencia). El consenso ensamblado puede no ser idéntico a la plantilla.
- Ensamblaje guiado por referencia: agrupación de lecturas por similitud con la región más similar dentro de la referencia (mapeo por pasos). Las lecturas dentro de cada grupo se acortan para imitar la calidad de lecturas cortas. Un método típico para hacerlo es el enfoque de k-meros . El ensamblaje guiado por referencia es más útil con lecturas largas . [ 3 ]
El ensamblaje guiado por referencia combina las características de otros métodos. Este método se aplica a lecturas largas para imitar las ventajas de las lecturas cortas (por ejemplo, la calidad de la llamada). Su lógica consiste en agrupar las lecturas en ventanas más pequeñas dentro de la secuencia de referencia. A continuación, se reduce el tamaño de las lecturas de cada grupo mediante el método k-mer para seleccionar la secuencia contigua (contig) de mayor calidad y probabilidad. Posteriormente, los contigs se unen para crear un andamio. El consenso final se obtiene cerrando cualquier hueco en el andamio.
Ensamblajes
genoma
Los primeros ensambladores de secuencias comenzaron a aparecer a finales de la década de 1980 y principios de la de 1990 como variantes de programas de alineación de secuencias más simples para unir grandes cantidades de fragmentos generados por instrumentos de secuenciación automatizados llamados secuenciadores de ADN . [ 2 ] A medida que los organismos secuenciados crecieron en tamaño y complejidad (desde pequeños virus pasando por plásmidos hasta bacterias y finalmente eucariotas ), los programas de ensamblaje utilizados en estos proyectos genómicos necesitaron estrategias cada vez más sofisticadas para manejar:
- terabytes de datos de secuenciación que necesitan ser procesados en clústeres de computación ;
- secuencias idénticas y casi idénticas (conocidas como repeticiones ) que, en el peor de los casos, pueden aumentar la complejidad temporal y espacial de los algoritmos de forma cuadrática;
- Los errores de lectura de ADN en los fragmentos obtenidos con los instrumentos de secuenciación pueden dificultar el ensamblaje.
Ante el desafío de ensamblar los primeros genomas eucariotas de gran tamaño —el de la mosca de la fruta Drosophila melanogaster en 2000 y el genoma humano apenas un año después—, los científicos desarrollaron ensambladores como Celera Assembler [ 4 ] y Arachne [ 5 ] , capaces de manejar genomas de entre 130 millones (p. ej., la mosca de la fruta D. melanogaster ) y 3 mil millones (p. ej., el genoma humano) de pares de bases. Posteriormente, otros grupos, principalmente en los principales centros de secuenciación genómica, crearon ensambladores a gran escala, y se lanzó una iniciativa de código abierto conocida como AMOS [ 6 ] para reunir todas las innovaciones en tecnología de ensamblaje genómico bajo un marco de código abierto .

EST
El ensamblaje de etiquetas de secuencia expresada o EST fue una estrategia temprana, que data de mediados de la década de 1990 a mediados de la década de 2000, para ensamblar genes individuales en lugar de genomas completos. [ 7 ] El problema difiere del ensamblaje del genoma en varios aspectos. Las secuencias de entrada para el ensamblaje de EST son fragmentos del ARNm transcrito de una célula y representan solo un subconjunto del genoma completo. [ 7 ] Varios problemas algorítmicos difieren entre el ensamblaje del genoma y el de EST. Por ejemplo, los genomas a menudo tienen grandes cantidades de secuencias repetitivas, concentradas en las regiones intergénicas. Los genes transcritos contienen muchas menos repeticiones, lo que hace que el ensamblaje sea algo más fácil. Por otro lado, algunos genes se expresan (transcriben) en cantidades muy altas (por ejemplo, genes de mantenimiento ), lo que significa que, a diferencia de la secuenciación de escopeta del genoma completo, las lecturas no se muestrean uniformemente en todo el genoma.
El ensamblaje de EST se complica mucho más por características como el empalme alternativo (cis-) , el empalme trans , el polimorfismo de un solo nucleótido y la modificación postranscripcional . A partir de 2008, cuando se inventó la secuenciación de ARN (RNA-Seq) , la secuenciación de EST fue reemplazada por esta tecnología mucho más eficiente, descrita en el ensamblaje de transcriptoma de novo .
Ensamblaje de novo frente a ensamblaje de mapeo
En términos de complejidad y requisitos de tiempo, los ensamblajes de novo son órdenes de magnitud más lentos y requieren más memoria que los ensamblajes de mapeo. Esto se debe principalmente a que el algoritmo de ensamblaje necesita comparar cada lectura con todas las demás (una operación que tiene una complejidad temporal ingenua de O( n² )). Los ensambladores de genomas de novo actuales pueden usar diferentes tipos de algoritmos basados en grafos, como: [ 8 ]
- El enfoque de superposición/diseño/consenso (OLC), que era típico de los ensambladores de datos de Sanger y se basa en un gráfico de superposición;
- El enfoque de grafos de De Bruijn (DBG), que se aplica más ampliamente a las lecturas cortas de las plataformas Solexa y SOLiD. Se basa en grafos de k-meros, que funcionan bien con grandes cantidades de lecturas cortas;
- Enfoque voraz basado en grafos , que también puede utilizar uno de los enfoques OLC o DBG. Con los algoritmos voraces basados en grafos, los contigs, series de lecturas alineadas juntas , crecen mediante extensión voraz, tomando siempre la lectura que se encuentra siguiendo la superposición de mayor puntuación. [ 3 ]
En referencia a la comparación con los libros triturados en la introducción: mientras que para la creación de mapas se utiliza un libro muy similar como plantilla (quizás con los nombres de los personajes principales y algunas ubicaciones modificadas), la creación de nuevos libros supone un reto mucho mayor, ya que no se sabe de antemano si se convertirá en un libro de ciencia, una novela, un catálogo o incluso varios libros. Además, cada fragmento se compararía con todos los demás.
El manejo de repeticiones en el ensamblaje de novo requiere la construcción de un grafo que represente las repeticiones vecinas. Dicha información puede obtenerse leyendo un fragmento largo que cubra las repeticiones por completo o solo sus dos extremos . Por otro lado, en un ensamblaje de mapeo, las partes con múltiples coincidencias o sin coincidencias generalmente se dejan para que otra técnica de ensamblaje las examine. [ 3 ]
avances tecnológicos
La complejidad del ensamblaje de secuencias viene determinada por dos factores principales: el número de fragmentos y su longitud. Si bien un mayor número de fragmentos y su longitud permiten una mejor identificación de las superposiciones de secuencias, también plantean problemas, ya que los algoritmos subyacentes muestran una complejidad cuadrática o incluso exponencial con respecto al número y la longitud de los fragmentos. Por otro lado, si bien las secuencias más cortas se alinean más rápidamente, también complican la fase de diseño del ensamblaje, puesto que las lecturas más cortas son más difíciles de utilizar con repeticiones o repeticiones casi idénticas.
En los inicios de la secuenciación del ADN, los científicos solo podían obtener unas pocas secuencias cortas (de unas pocas docenas de bases) tras semanas de trabajo en los laboratorios. Por lo tanto, estas secuencias podían alinearse manualmente en cuestión de minutos.
En 1975, se inventó el método de terminación dideoxi (también conocido como secuenciación de Sanger ) y hasta poco después del año 2000, la tecnología se mejoró hasta un punto en el que las máquinas totalmente automatizadas podían generar secuencias en un modo altamente paralelizado las 24 horas del día. Grandes centros de genómica de todo el mundo albergaban granjas completas de estas máquinas de secuenciación, lo que a su vez llevó a la necesidad de que los ensambladores se optimizaran para secuencias de proyectos de secuenciación de escopeta de genoma completo donde las lecturas
- tienen aproximadamente entre 800 y 900 bases de longitud.
- contienen artefactos de secuenciación como vectores de secuenciación y clonación
- tienen tasas de error entre 0,5 y 10%
Con la tecnología Sanger, los proyectos bacterianos con entre 20 000 y 200 000 lecturas podían ensamblarse fácilmente en un solo ordenador. Los proyectos de mayor envergadura, como el genoma humano con aproximadamente 35 millones de lecturas, requerían grandes centros de computación y computación distribuida.
Para 2004/2005, la pirosecuenciación había alcanzado la viabilidad comercial gracias a 454 Life Sciences . [ 9 ] Este nuevo método de secuenciación generaba lecturas mucho más cortas que las de la secuenciación de Sanger: inicialmente de unas 100 bases, ahora de 400 a 500 bases. [ 9 ] Su rendimiento mucho mayor y su menor coste (en comparación con la secuenciación de Sanger) impulsaron la adopción de esta tecnología por parte de los centros genómicos, lo que a su vez impulsó el desarrollo de ensambladores de secuencias que pudieran manejar eficientemente los conjuntos de lecturas. La enorme cantidad de datos, junto con los patrones de error específicos de la tecnología en las lecturas, retrasó el desarrollo de los ensambladores; a principios de 2004, solo estaba disponible el ensamblador Newbler de 454. Publicada a mediados de 2007, la versión híbrida del ensamblador MIRA por Chevreux et al. [ 10 ] fue el primer ensamblador disponible gratuitamente que podía ensamblar lecturas de 454, así como mezclas de lecturas de 454 y lecturas de Sanger. El ensamblaje de secuencias de diferentes tecnologías de secuenciación se denominó posteriormente ensamblaje híbrido . [ 10 ]
Desde 2006, la tecnología Illumina (anteriormente Solexa) está disponible y puede generar alrededor de 100 millones de lecturas por ejecución en una sola máquina de secuenciación. Compárese esto con los 35 millones de lecturas del proyecto del genoma humano que necesitaron varios años para producirse en cientos de máquinas de secuenciación. [ 11 ] Illumina inicialmente estaba limitado a una longitud de solo 36 bases, lo que lo hacía menos adecuado para el ensamblaje de novo (como el ensamblaje de novo del transcriptoma ), pero las iteraciones más recientes de la tecnología lograron longitudes de lectura superiores a 100 bases desde ambos extremos de un clon de 3–400 bp. [ 11 ] Anunciado a finales de 2007, el ensamblador SHARCGS [ 12 ] por Dohm et al. fue el primer ensamblador publicado que se utilizó para un ensamblaje con lecturas Solexa. Rápidamente le siguieron varios otros.
Posteriormente, se lanzaron nuevas tecnologías como SOLiD de Applied Biosystems , Ion Torrent y SMRT , y continuaron surgiendo otras nuevas (por ejemplo, la secuenciación de nanoporos ). A pesar de las mayores tasas de error de estas tecnologías, son importantes para el ensamblaje porque su mayor longitud de lectura ayuda a abordar el problema de las repeticiones. [ 11 ] Es imposible ensamblar a través de una repetición perfecta que sea más larga que la longitud máxima de lectura; sin embargo, a medida que las lecturas se hacen más largas, la probabilidad de una repetición perfecta de ese tamaño disminuye. Esto otorga a las lecturas de secuenciación más largas una ventaja en el ensamblaje de repeticiones, incluso si tienen una precisión baja (≈85%). [ 11 ]
Control de calidad
La mayoría de los ensambladores de secuencias tienen algoritmos incorporados para el control de calidad, como Phred . [ 13 ] Sin embargo, tales medidas no evalúan la completitud del ensamblaje en términos de contenido genético. Algunas herramientas evalúan la calidad de un ensamblaje a posteriori.
Por ejemplo, BUSCO (Benchmarking Universal Single-Copy Orthologs) es una medida de la completitud de los genes en un genoma, conjunto de genes o transcriptoma , utilizando el hecho de que muchos genes están presentes solo como genes de copia única en la mayoría de los genomas. [ 14 ] Los conjuntos BUSCO iniciales representaban 3023 genes para vertebrados , 2675 para artrópodos , 843 para metazoos , 1438 para hongos y 429 para eucariotas . Esta tabla muestra un ejemplo para los genomas humano y de la mosca de la fruta: [ 14 ]
Algoritmos de ensamblaje
Los distintos organismos poseen una región específica de mayor complejidad dentro de su genoma. Por lo tanto, se requieren diferentes enfoques computacionales. Algunos de los algoritmos más utilizados son:
- Ensamblaje de gráficos
- Se basa en la teoría de grafos de la informática. El grafo de De Bruijn es un ejemplo de este enfoque y utiliza k-meros para ensamblar una secuencia contigua (contig) a partir de lecturas. [ 15 ]
- Ensamblaje de grafos voraz
- Este método evalúa cada lectura añadida al ensamblaje y selecciona la puntuación más alta posible de la región superpuesta.
- Dado un conjunto de fragmentos de secuencia, el objetivo es encontrar una secuencia más larga que contenga todos los fragmentos (véase la figura en Tipos de ensamblaje de secuencias ):
- Calcular alineamientos por pares de todos los fragmentos.
- Elige dos fragmentos con la mayor superposición.
- Combinar los fragmentos seleccionados.
- Repita los pasos 2 y 3 hasta que solo quede un fragmento.
- El resultado podría no ser la solución óptima al problema.
Pipeline bioinformático
En general, existen tres pasos para ensamblar las lecturas de secuenciación en un andamio:
- Preensamblaje: Este paso es esencial para garantizar la integridad del análisis posterior, como la detección de variantes o la secuencia final del andamiaje. Este paso consta de dos flujos de trabajo cronológicos:
- Control de calidad: Dependiendo del tipo de tecnología de secuenciación, pueden surgir diferentes errores que lleven a una llamada de base errónea . Por ejemplo, la secuenciación de "NAAAAAAAAAAAAN" y "NAAAAAAAAAAAN", que incluyen 12 adeninas, podría interpretarse erróneamente como 11 adeninas. La secuenciación de un segmento altamente repetitivo del ADN/ARN objetivo podría resultar en una llamada con una base menos o una base más. La calidad de lectura se mide normalmente mediante puntuaciones de calidad Phred , que son una puntuación codificada de la calidad de cada nucleótido dentro de la secuencia de lectura.
- Filtrado de lecturas: Las lecturas que no superaron la verificación de calidad deben eliminarse del archivo FASTQ para obtener los mejores contigs de ensamblaje.
- Ensamblaje: Durante este paso, se utiliza la alineación de lecturas con diferentes criterios para mapear cada lectura a la ubicación posible. La posición predicha de una lectura se basa en cuánto de su secuencia se alinea con otras lecturas o con una referencia. Se utilizan diferentes algoritmos de alineación para lecturas de diferentes tecnologías de secuenciación. Algunos de los enfoques comúnmente utilizados en el ensamblaje son el grafo de De Bruijn y la superposición. La longitud de lectura, la cobertura , la calidad y la técnica de secuenciación utilizada juegan un papel importante en la elección del mejor algoritmo de alineación en el caso de la secuenciación de próxima generación . [ 16 ] Por otro lado, los algoritmos que alinean lecturas de secuenciación de tercera generación requieren enfoques avanzados para tener en cuenta la alta tasa de error asociada con ellas.
- Postensamblaje: Esta etapa se centra en extraer información valiosa de la secuencia ensamblada. La genómica comparativa y el análisis de poblaciones son ejemplos de análisis postensamblaje.
Programas
Para obtener una lista de ensambladores de novo , consulte Ensambladores de secuencias de novo . Para obtener una lista de alineadores de mapeo, consulte Lista de software de alineación de secuencias § Alineación de secuencias de lectura corta .
Algunas de las herramientas comunes utilizadas en las diferentes etapas del ensamblaje se enumeran en la siguiente tabla:
Véase también
Referencias
- 1 2 3 Sohn JI, Nam JW (enero de 2018). "El presente y el futuro del ensamblaje de novo de genoma completo". Briefings in Bioinformatics . 19 (1): 23– 40. doi : 10.1093/bib/bbw096 . PMID 27742661 .
- 1 2 Baker M (27 de marzo de 2012). "Ensamblaje de genoma de novo: lo que todo biólogo debería saber" . Nature Methods . 9 (4): 333– 337. doi : 10.1038/nmeth.1935 . ISSN 1548-7105 .
- 1 2 3 Wolf B. "Ensamblaje de genoma de novo versus mapeo a un genoma de referencia" (PDF) . Universidad de Ciencias Aplicadas de Suiza Occidental . Recuperado el 6 de abril de 2019 .
- ↑ Myers EW, Sutton GG, Delcher AL, Dew IM, Fasulo DP, Flanigan MJ, et al. (marzo de 2000). "Un ensamblaje del genoma completo de Drosophila". Science . 287 (5461): 2196– 2204. Bibcode : 2000Sci...287.2196M . CiteSeerX 10.1.1.79.9822 . doi : 10.1126/science.287.5461.2196 . PMID 10731133 . S2CID 6049420 .
- ↑ Batzoglou S, Jaffe DB, Stanley K, Butler J, Gnerre S, Mauceli E, et al. (enero de 2002). "ARACHNE: un ensamblador de secuenciación de genoma completo" . Genome Research . 12 (1): 177– 189. doi : 10.1101/gr.208902 . PMC 155255. PMID 11779843 .
- ↑ "AMOS WIKI" . amos.sourceforge.net . Consultado el 2 de enero de 2023 .
- 1 2 Nagaraj SH, Gasser RB, Ranganathan S (enero de 2007). "Una guía para autoestopistas sobre el análisis de etiquetas de secuencias expresadas (EST)". Briefings in Bioinformatics . 8 (1): 6– 21. doi : 10.1093/bib/bbl015 . PMID 16772268 .
- ↑ Li Z, Chen Y, Mu D, Yuan J, Shi Y, Zhang H, et al. (enero de 2012). "Comparación de las dos clases principales de algoritmos de ensamblaje: overlap-layout-consensus y de-bruijn-graph". Briefings in Functional Genomics . 11 (1): 25– 37. doi : 10.1093/bfgp/elr035 . PMID 22184334 .
- 1 2 Harrington CT, Lin EI, Olson MT, Eshleman JR (septiembre de 2013). "Fundamentos de la pirosecuenciación". Archives of Pathology & Laboratory Medicine . 137 (9): 1296– 1303. doi : 10.5858/arpa.2012-0463-RA . PMID 23991743 .
- 1 2 "MIRA 2.9.8 para ensamblaje híbrido 454 y 454 / Sanger" . groups.google.com . Consultado el 2 de enero de 2023 .
- 1 2 3 4 Hu T, Chitnis N, Monos D, Dinh A (noviembre de 2021). "Tecnologías de secuenciación de próxima generación: una visión general". Inmunología humana . Secuenciación de próxima generación y su aplicación a la inmunología de laboratorio médico. 82 (11): 801– 811. doi : 10.1016/j.humimm.2021.02.012 . PMID 33745759 .
- ↑ Dohm JC, Lottaz C, Borodina T, Himmelbauer H (noviembre de 2007). "SHARCGS, un algoritmo de ensamblaje de lecturas cortas rápido y altamente preciso para la secuenciación genómica de novo" . Genome Research . 17 (11): 1697– 1706. doi : 10.1101/gr.6435207 . PMC 2045152. PMID 17908823 .
- ↑ Cock PJ, Fields CJ, Goto N, Heuer ML, Rice PM (abril de 2010). "El formato de archivo FASTQ de Sanger para secuencias con puntuaciones de calidad y las variantes FASTQ de Solexa/Illumina" . Nucleic Acids Research . 38 (6): 1767–1771 . doi : 10.1093/nar/ gkp1137 . PMC 2847217. PMID 20015970 .
- 1 2 Simão FA, Waterhouse RM, Ioannidis P, Kriventseva EV, Zdobnov EM (octubre de 2015). "BUSCO: evaluación de la completitud del ensamblaje y la anotación del genoma con ortólogos de copia única". Bioinformatics . 31 (19): 3210– 3212. doi : 10.1093/bioinformatics/btv351 . PMID 26059717 .
- ↑ Compeau PE, Pevzner PA, Tesler G (noviembre de 2011). "Cómo aplicar los grafos de De Bruijn al ensamblaje del genoma" . Nature Biotechnology . 29 (11): 987–991 . doi : 10.1038/nbt.2023 . PMC 5531759. PMID 22068540 .
- ↑ Ruffalo M, LaFramboise T, Koyutürk M (octubre de 2011). "Análisis comparativo de algoritmos para la alineación de lecturas de secuenciación de próxima generación" . Bioinformatics . 27 (20): 2790– 2796. doi : 10.1093/bioinformatics/btr477 . PMID 21856737 .
- ↑ Vasimuddin M, Misra S, Li H, Aluru S (mayo de 2019). "Aceleración eficiente de BWA-MEM con conciencia de la arquitectura para sistemas multinúcleo". 2019 IEEE International Parallel and Distributed Processing Symposium (IPDPS) . IEEE. págs. 314–324 . arXiv : 1907.12931 . doi : 10.1109/IPDPS.2019.00041 . ISBN 978-1-7281-1246-6.
- ↑ Jung Y, Han D (2022-03-07). "BWA-MEME: BWA-MEM emulado con un enfoque de aprendizaje automático" . Bioinformatics . 38 (9): 2404– 2413. doi : 10.1093/bioinformatics/btac137 . ISSN 1367-4803 . PMID 35253835 .
- Bioinformática
- métodos de secuenciación de ADN