En bioinformática , un error de lectura de ADN ocurre cuando un ensamblador de secuencias cambia una base de ADN por otra diferente . Las lecturas del ensamblador de secuencias se pueden utilizar para crear un gráfico de De Bruijn , que se puede utilizar de varias maneras para encontrar errores .
Descripción general
En un grafo de De Bruijn , existe la posibilidad de que haya 4^k nodos diferentes para realizar ordenamientos de un genoma . La cantidad de nodos utilizados para crear el grafo se puede reducir considerando solo los k-meros que se encuentran dentro de la cadena de ADN de interés. Dada la secuencia 1, es posible determinar los nodos de tamaño 7, o 7-meros, que estarán en el grafo. Estos 7-meros luego crean el grafo que se muestra en la figura 1. [1]
El gráfico que se muestra en la figura 1 es una versión muy simple de cómo podría verse un gráfico. [2] Este gráfico se forma tomando los últimos 6 elementos del 7-mero y vinculándolos al nodo cuyos primeros 6 elementos son iguales. La figura 1 es la forma más simple que puede tener un gráfico de De Bruijn , ya que cada nodo tiene exactamente un camino de entrada y un camino de salida. La mayoría de las veces, los gráficos tendrán más de un borde dirigido a un nodo y/o más de un borde que salga de un nodo. Esto sucede debido a la forma en que se conectan los nodos. Los nodos están conectados por bordes que apuntan a los nodos si los últimos k-1 elementos del k -mero coinciden con los primeros k-1 elementos de cualquier nodo. Esto permite que se forme un gráfico de De Bruijn de múltiples bordes . Estos gráficos más complicados ocurren debido a errores de lectura o variaciones en las cadenas de ADN. Ambas causas dificultan la determinación de la estructura correcta del ADN y qué está causando las diferencias. Dado que la mayoría de las cadenas de ADN probablemente incluirán errores de lectura y variaciones, los científicos esperan utilizar un proceso de ensamblaje que pueda fusionar los nodos del gráfico cuando estén conectados de manera inequívoca después de que el gráfico se haya limpiado de vértices y aristas creados por los errores. [3]
Consejos y burbujas
Cuando se forma un gráfico a partir de datos secuenciados , los errores de lectura forman puntas y burbujas. Una punta es donde ocurrió un error durante el proceso de secuenciación y ha causado que el gráfico termine prematuramente e incluye k -meros correctos e incorrectos. Una burbuja también se forma cuando ocurre un error durante el proceso de lectura de la secuencia; sin embargo, donde sea que ocurra el error, hay un camino para que las lecturas de k -meros se vuelvan a conectar con el gráfico principal y continúen como si nada hubiera sucedido. Cuando hay puntas y burbujas presentes en un gráfico de De Bruijn formado a partir de los datos, pueden eliminarse solo si un error es lo que causó la aparición de la punta o la burbuja. Cuando los científicos usan un genoma de referencia , pueden decir rápida y fácilmente dónde se encuentran las puntas comparando el gráfico del genoma de referencia y el gráfico de la secuencia. Si no hay un genoma de referencia, las puntas se eliminan rastreando las ramas hacia atrás hasta que se encuentra un punto de ambigüedad. Luego, las puntas se eliminan solo si la rama que contiene la punta es más corta que una longitud de umbral establecida. [3] El proceso de eliminación de burbujas es un poco más complicado. Lo primero que hay que hacer es identificar el inicio de la burbuja. A partir de ahí, se sigue cada camino desde el inicio de la burbuja hasta el punto de reconexión. El punto de reconexión puede ser diferente para cada camino. Como puede haber caminos de distintas longitudes desde el nodo inicial, se elimina el camino que tenga una cobertura menor. [3]
Ejemplo

Dada una secuencia de cualquier longitud, el primer paso que se debe realizar es ingresar la secuencia en un programa de secuenciación, secuenciarla y devolver lecturas de pares de bases (pb) de una cierta longitud. Dado que no existe un programa de secuenciación que sea completamente preciso, siempre habrá algunas lecturas que contengan errores. El método de secuenciación más común es el método shotgun , que es el método que probablemente se use en la secuencia 2. Una vez que se decide un método, se debe especificar la longitud de las lecturas pb que se desea que devuelva. En el caso de la secuencia 2, devolvió lecturas de 7 pb con todos los errores cometidos durante el proceso marcados en rojo. [4]
Una vez que se obtienen las lecturas, se convierten en k -meros. Luego, los k -meros se registran en una tabla con la cantidad de veces que apareció cada k -mero en las lecturas. Para este ejemplo, cada lectura se convirtió en 4 -meros y, si había un error, se registró en rojo. Luego, se registraron los 4 -meros, con su frecuencia en la siguiente tabla.
Cada celda individual de la tabla formará entonces un nodo, lo que permitirá que se forme un gráfico de De Bruijn a partir de los k -meros dados. En la figura 2, se identifican los tramos lineales y luego se forma otro gráfico, la figura 3, donde los tramos lineales se han convertido en un solo nodo, de un tamaño de k -mero diferente, lo que permite un gráfico más conciso. En este gráfico simplificado, es fácil identificar varias puntas y burbujas, como se muestra en la figura 4. Estas burbujas y puntas se pueden eliminar, ya que podemos identificar que se formaron a partir de errores en las lecturas de bp, lo que nos da una estructura de gráfico que debería reflejar de manera precisa y completa la secuencia original. [4] Si sigue el gráfico de De Bruijn que se muestra en la figura 5, verá que la secuencia formada coincide de hecho con la secuencia de ADN dada en la secuencia 2.
Comparación de dos cadenas de ADN
Al comparar dos cadenas de ADN , se utilizan frecuentemente gráficos de Bruijn coloreados para identificar errores. Estos errores, a menudo polimorfismos , provocan la formación de burbujas similares a las mencionadas anteriormente. Actualmente, existen cuatro algoritmos principales que se utilizan para generalizar los datos y localizar burbujas. Los cuatro algoritmos amplían los gráficos de Bruijn al permitir que los nodos y los bordes del gráfico se coloreen según las muestras de las que se observaron [5].
Llamada de burbuja
El uso más simple de un gráfico de De Bruijn coloreado se conoce como algoritmo de llamada de burbujas. Este algoritmo busca y localiza burbujas en el genoma que difieren del original. Estas burbujas deben estar “limpias” o simplemente ser una divergencia del genoma de referencia, pero no pueden ser causadas por deleciones de bases de ADN. Este algoritmo puede tener altas tasas de falsos positivos , ya que existe una dificultad para separar las burbujas inducidas por repeticiones y variantes; sin embargo, a menudo hay un genoma de referencia para ayudar a mejorar la confiabilidad . El genoma de referencia también ayuda en la detección de variantes y es esencial para detectar sitios de variantes. [5] Recientemente, los científicos han descubierto una forma de utilizar el algoritmo de llamada de burbujas con la detección de variación del número de copias para permitir una oportunidad de detección imparcial de estas variaciones en el futuro [6] [7]
Divergencia de trayectoria
Cuando se observan variantes complejas, hay una probabilidad muy baja de que formen un contig limpio . Dado que este es el caso más a menudo, el algoritmo de divergencia de caminos es útil, especialmente cuando se considera dónde ocurren las eliminaciones y la variante es tan compleja que está restringida al alelo de referencia . Cuando se forma una burbuja, el algoritmo de divergencia de caminos se usa con mayor frecuencia y permite eliminar las burbujas detectadas en un procedimiento muy sistemático. El algoritmo primero ubica cada punto de divergencia. Luego, desde cada punto de divergencia , se rastrean las hebras que forman la burbuja para encontrar dónde se unen los dos caminos después de n nodos. Si los dos caminos se unen, entonces el camino con una cobertura menor se elimina y se almacena en un archivo. [3] [8]
Análisis de muestras múltiples
El uso de múltiples muestras mejora sustancialmente la potencia y la tasa de descubrimientos falsos en la detección de variantes. En los casos más simples, las muestras se combinan en un grupo de un solo color y los datos se analizan como se describió anteriormente. Sin embargo, al mantener colores separados para cada conjunto de muestras, se presenta información adicional sobre cómo se formaron las burbujas, ya sea por error o por repeticiones. [5] En 1997, el Departamento de Tecnología de Genzyme Genetics en Framingham , Massachusetts, desarrolló un nuevo enfoque que proporcionó un gran avance en el tratamiento de las burbujas utilizando el ensayo de diagnóstico específico de alelos multiplex (MASDA). Este programa combina el método de transferencia de puntos hacia adelante, la hibridación de sondas simultánea compleja y la detección directa de mutaciones para ayudar a resolver el doble problema del análisis de múltiples muestras. [9]
Genotipado
Los gráficos de Bruijn coloreados se pueden utilizar para genotipar cualquier muestra de ADN en un loci conocido , incluso cuando la cobertura es menos que suficiente para el ensamblaje de variantes. [5] El primer paso de este proceso es construir un gráfico del alelo de referencia , las variantes conocidas y los datos de la muestra. Luego, el algoritmo calcula la probabilidad de cada genotipo y tiene en cuenta la estructura del gráfico, tanto de la secuencia local como de todo el genoma. Esto luego se generaliza a múltiples tipos de alelos y ayuda a genotipar variantes complejas y compuestas. [5] Este algoritmo se utiliza con frecuencia, ya que no se forman burbujas con las que lidiar. Esto también ayuda directamente a encontrar los problemas más complicados en los genes de manera más directa que cualquiera de los tres algoritmos mencionados anteriormente. [10]
Referencias
- ^ Mecanismos de recombinación del ADN y reordenamientos del genoma: intersección entre la recombinación homóloga, la replicación del ADN y la reparación del ADN. Academic Press. 2018-03-06. ISBN 978-0-12-813980-6.
- ^ De Bruijn Gráfico de una secuencia pequeña . (2011). Recuperado el 7 de febrero de 2015 de Homolog.us — Bioinformática: http://www.homolog.us/Tutorials/index.php?p=2.1&s=1 Archivado el 30 de octubre de 2014 en Wayback Machine.
- ^ abcd Simpson, JT, Wong, K., Jackman, SD, Schein, JE, Jones, SJ y Birol, I. (2009). ABySS: un ensamblador paralelo para datos de secuencias de lectura corta. Genome research, 19 (6), 1117-1123
- ^ ab Flicek, P., y Birney, E. (2009). Sentido a partir de lecturas de secuencias: métodos de alineamiento y ensamblaje. Nature methods, 6 , S6-S12. Figura 3
- ^ abcde Iqbal, Z., Caccamo, M., Turner, I., Flicek, P. y McVean, G. (2012). Ensamblaje de novo y genotipado de variantes mediante gráficos de De Bruijn coloreados. Nature Genetics, 44 (2), 226-232
- ^ Nijkamp, JF, van den Broek, MA, Geertman, JMA, Reinders, MJ, Daran, JMG y de Ridder, D. (2012). Detección de novo de variación del número de copias por coensamblaje. Bioinformática, 28 (24), 3195-3202
- ^ Mesner, Larry D.; Valsakumar, Veena; Cieślik, Marcin; Pickin, Rebecca; Hamlin, Joyce L.; Bekiranov, Stefan (noviembre de 2013). "El análisis de secuenciación de burbujas del genoma humano revela distintos mecanismos mediados por la cromatina para regular los orígenes de activación temprana y tardía". Genome Research . 23 (11): 1774–1788. doi :10.1101/gr.155218.113. ISSN 1088-9051. PMC 3814878 . PMID 23861383.
- ^ "Divergencia de caminos: conocimiento en gestión de proyectos" . Consultado el 9 de octubre de 2020 .
- ^ Shuber, AP, Michalowsky, LA, Nass, GS, Skoletsky, J., Hire, LM, Kotsopoulos, SK, ... y Klinger, KW (1997). Análisis paralelo de alto rendimiento de cientos de muestras de pacientes para más de 100 mutaciones en múltiples genes de enfermedades. Genética molecular humana, 6 (3), 337-347
- ^ "Genotipado: una descripción general | Temas de ScienceDirect" www.sciencedirect.com . Consultado el 9 de octubre de 2020 .