Articulo de referencia

Contig

Las lecturas superpuestas de la secuenciación de extremos emparejados forman contigs; los contigs y los huecos de longitud conocida forman andamios . Un contig (del latín contig...

Las lecturas superpuestas de la secuenciación de extremos emparejados forman contigs; los contigs y los huecos de longitud conocida forman andamios .

Un contig (del latín contiguo ) es un conjunto de segmentos de ADN superpuestos que juntos representan una región de consenso del ADN . [ 1 ]

En los proyectos de secuenciación ascendente , un contig se refiere a datos de secuencia superpuestos ( lecturas ); [ 2 ] en los proyectos de secuenciación descendente , un contig se refiere a los clones superpuestos que forman un mapa físico del genoma que se utiliza para guiar la secuenciación y el ensamblaje . [ 3 ] Por lo tanto, los contigs pueden referirse tanto a secuencias de ADN superpuestas como a segmentos físicos superpuestos (fragmentos) contenidos en clones, según el contexto.

Definición original de contig

En 1980, Staden [ 4 ] escribió: Para facilitar la descripción de nuestros datos obtenidos mediante el método de secuenciación de escopeta, hemos inventado la palabra "contig". Un contig es un conjunto de lecturas de gel relacionadas entre sí por la superposición de sus secuencias. Todas las lecturas de gel pertenecen a un único contig, y cada contig contiene al menos una lectura de gel. Las lecturas de gel en un contig se pueden sumar para formar una secuencia consenso continua, cuya longitud es la del contig.

contigs de secuencia

Un contig de secuencia es una secuencia continua (no contigua) resultante del reensamblaje de los pequeños fragmentos de ADN generados por estrategias de secuenciación ascendente . Este significado de contig es consistente con la definición original de Rodger Staden (1979). [ 5 ] La estrategia de secuenciación de ADN ascendente implica cortar el ADN genómico en muchos fragmentos pequeños ("abajo"), secuenciar estos fragmentos, reensamblarlos en contigs y, finalmente, en todo el genoma ("arriba"). Debido a que la tecnología actual permite la secuenciación directa de solo fragmentos de ADN relativamente cortos (300–1000 nucleótidos), el ADN genómico debe fragmentarse en piezas pequeñas antes de la secuenciación. [ 6 ] En los proyectos de secuenciación ascendente, el ADN amplificado se corta aleatoriamente en fragmentos del tamaño apropiado para la secuenciación. Las lecturas de secuencia subsiguientes, que son los datos que contienen las secuencias de los pequeños fragmentos, se colocan en una base de datos. El software de ensamblaje [ 6 ] busca en esta base de datos pares de lecturas superpuestas. El ensamblaje de las lecturas de dicho par (que incluye, por supuesto, solo una copia de la secuencia idéntica) produce una lectura contigua más larga (contig) de ADN secuenciado. Al repetir este proceso muchas veces, primero con los pares de lecturas cortos iniciales y luego utilizando pares cada vez más largos que resultan del ensamblaje previo, se puede determinar la secuencia de ADN de un cromosoma completo.

Hoy en día, es común utilizar la tecnología de secuenciación de extremos emparejados, donde se secuencian ambos extremos de fragmentos de ADN más largos y de tamaño uniforme . En este caso, un contig sigue refiriéndose a cualquier segmento contiguo de datos de secuencia creado por la superposición de lecturas. Dado que los fragmentos tienen una longitud conocida, se conoce la distancia entre las lecturas de los dos extremos de cada fragmento. [ 7 ] Esto proporciona información adicional sobre la orientación de los contigs construidos a partir de estas lecturas y permite su ensamblaje en andamios en un proceso llamado andamiaje .

Los andamios consisten en contigs superpuestos separados por huecos de longitud conocida. Las nuevas restricciones impuestas a la orientación de los contigs permiten la ubicación de secuencias altamente repetidas en el genoma. Si una lectura de extremo tiene una secuencia repetitiva, siempre que su par complementario se encuentre dentro de un contig, se conoce su ubicación. [ 7 ] Los huecos restantes entre los contigs en los andamios se pueden secuenciar mediante diversos métodos, incluyendo la amplificación por PCR seguida de secuenciación (para huecos más pequeños) y métodos de clonación BAC seguidos de secuenciación para huecos más grandes. [ 2 ]

contigs BAC

El término contig también puede referirse a los clones superpuestos que forman un mapa físico de un cromosoma cuando se utiliza la estrategia de secuenciación jerárquica o de arriba hacia abajo . [ 1 ] En este método de secuenciación, se crea un mapa de baja resolución antes de la secuenciación para proporcionar un marco que guíe el ensamblaje posterior de las lecturas de secuencia del genoma. Este mapa identifica las posiciones relativas y la superposición de los clones utilizados para la secuenciación. Los conjuntos de clones superpuestos que forman un segmento contiguo de ADN se denominan contigs; el número mínimo de clones que forman un contig que cubre todo el cromosoma conforma la ruta de mosaico que se utiliza para la secuenciación. Una vez seleccionada una ruta de mosaico, sus BAC componentes se cortan en fragmentos más pequeños y se secuencian. Por lo tanto, los contigs proporcionan el marco para la secuenciación jerárquica. [ 3 ]

El ensamblaje de un mapa de contigs implica varios pasos. Primero, el ADN se corta en fragmentos más grandes (50–200 kb), que se clonan en BAC o PAC para formar una biblioteca de BAC . Dado que estos clones deberían cubrir todo el genoma/cromosoma, teóricamente es posible ensamblar un contig de BAC que cubra todo el cromosoma. [ 1 ] Sin embargo, la realidad no siempre es ideal. A menudo quedan huecos, y un andamio —compuesto por contigs y huecos— que cubre la región del mapa suele ser el primer resultado. [ 1 ] Los huecos entre contigs se pueden cerrar mediante varios métodos que se describen a continuación.

Construcción de contigs BAC

Los contigs BAC se construyen alineando regiones BAC con solapamiento conocido mediante diversos métodos. Una estrategia común es utilizar el mapeo de contenido de sitios etiquetados por secuencia (STS) para detectar sitios de ADN únicos en común entre BACs. El grado de solapamiento se estima aproximadamente por el número de marcadores STS en común entre dos clones, donde un mayor número de marcadores en común indica un mayor solapamiento. [ 2 ] Dado que esta estrategia solo proporciona una estimación muy aproximada del solapamiento, a menudo se utiliza el análisis de fragmentos de digestión por restricción , que proporciona una medición más precisa del solapamiento de clones. [ 2 ] En esta estrategia, los clones se tratan con una o dos enzimas de restricción y los fragmentos resultantes se separan mediante electroforesis en gel . Si se trata de dos clones, es probable que tengan sitios de restricción en común y, por lo tanto, compartan varios fragmentos. [ 3 ] Dado que se conoce el número de fragmentos en común y la longitud de estos fragmentos (la longitud se determina por comparación con un estándar de tamaño), el grado de solapamiento se puede deducir con un alto grado de precisión.

Espacios entre contigs

A menudo quedan huecos tras la construcción inicial de contigs BAC. Estos huecos se producen si la biblioteca de cromosomas artificiales bacterianos (BAC) analizada tiene una complejidad baja, es decir, no contiene un número elevado de STS o sitios de restricción, o si ciertas regiones eran menos estables en los huéspedes de clonación y, por lo tanto, estaban subrepresentadas en la biblioteca. [ 1 ] Si quedan huecos entre contigs tras el mapeo de marcadores STS y la huella de restricción, se puede utilizar la secuenciación de los extremos de los contigs para cerrarlos. Esta estrategia de secuenciación de extremos crea esencialmente un nuevo STS con el que analizar los demás contigs. Alternativamente, la secuencia del extremo de un contig se puede utilizar como cebador para realizar un recorrido de cebadores a través del hueco. [ 2 ]

Véase también

Referencias

  1. 1 2 3 4 5 Gregory, S. Ensamblaje de contigs . Enciclopedia de Ciencias de la Vida, 2005.
  2. 1 2 3 4 5 Gibson, Greg; Muse, Spencer V. (2009). Introducción a la ciencia del genoma (3.ª  ed.). Sinauer Associates. pág.  84. ISBN 978-0-878-93236-8.
  3. 1 2 3 Estimado/a, Mapeo del genoma PH . Enciclopedia de Ciencias de la Vida, 2005. doi : 10.1038/npg.els.0005353 .
  4. Staden, R (1980). " Un nuevo método informático para el almacenamiento y manipulación de datos de lectura de geles de ADN" . Nucleic Acids Research . 8 (16): 3673– 3694. doi : 10.1093/nar/8.16.3673 . PMC 324183. PMID 7433103 .  
  5. Staden R (1979). "Una estrategia de secuenciación de ADN empleando programas informáticos" . Nucleic Acids Research . 6 (7): 2601– 2610. doi : 10.1093/nar/6.7.2601 . PMC 327874. PMID 461197 .  
  6. 1 2 Dunham, I. Secuenciación del genoma . Enciclopedia de las ciencias de la vida, 2005.
  7. 1 2 Fullwood MJ, Wei C, Liu ET, et al. (2009). "Secuenciación de ADN de próxima generación de etiquetas de extremos emparejados (PET) para análisis de transcriptoma y genoma" . Genome Research . 19 (4): 521– 532. doi : 10.1101/gr.074906.107 . PMC 3807531. PMID 19339662 .   
  • Definición del término y perspectiva histórica
  • Paquete Staden de ensamblaje de secuencias: definiciones e información general