El alineamiento estadístico rápido ( FSA ) es un programa de alineamiento de secuencias múltiples para alinear numerosas proteínas, ARN o secuencias largas de ADN genómico . Junto con MUSCLE y MAFFT , FSA es uno de los pocos programas de alineamiento de secuencias que puede alinear conjuntos de datos de cientos o miles de secuencias. FSA utiliza un criterio de optimización diferente que le permite identificar secuencias no homólogas con mayor fiabilidad que estos otros programas, aunque esta mayor precisión conlleva una menor velocidad.
Actualmente, FSA se está utilizando en múltiples proyectos, entre ellos la secuenciación de nuevos genomas de gusanos y el análisis de la unión de factores de transcripción in vivo en moscas.
Entrada/Salida
Este programa acepta secuencias en formato FASTA y genera alineaciones en formato FASTA o formato Stockholm .
Algoritmo
El algoritmo para la alineación de las secuencias de entrada tiene 4 componentes principales.
Modelo oculto de Markov de pares para generar probabilidades posteriores
El algoritmo comienza determinando primero las probabilidades posteriores de alineación.entre dos secuencias aleatorias cualesquiera del conjunto de secuencias que se están alineando. Las probabilidades posteriores para cada columna refuerzan la predicción de la probabilidad de alineación entre un par de secuencias y también filtran las columnas que pueden alinearse de forma poco fiable. Estas probabilidades también permiten predecir y estimar la homología entre cualquier par de secuencias. Se utiliza un modelo oculto de Markov de pares estándar de cinco estados (HMM de pares) para determinar estas probabilidades posteriores de alineación para cualquier par de secuencias de entrada. El modelo HMM de pares utiliza dos conjuntos de estados de eliminación (D) e inserción (I) para tener en cuenta la eliminación e inserción de símbolos entre dos secuencias alineadas, pero también puede tener tres estados sin una pérdida significativa de precisión.
Dado que el número de comparaciones por pares necesarias para determinar las distribuciones de probabilidad posterior de cualquier par de secuencias es computacionalmente costoso y cuadrático con respecto a la cantidad de secuencias que se alinean, se reduce mediante un enfoque aleatorio inspirado en la teoría de grafos aleatorios de Erdos-Renyi. Esto reduce significativamente los tiempos de ejecución de los conjuntos de datos y el costo computacional de realizar los alineamientos múltiples.
Probabilidades de fusión
Las probabilidades posteriores para cada columna en los pares de secuencias se ordenan utilizando una función de ponderación que emplea un algoritmo de ascenso más pronunciado.
Recocido de secuencias
La mayoría de los programas existentes que ejecutan algoritmos de alineación de secuencias múltiples se basan en la alineación progresiva, donde el proceso comienza con una "alineación nula", un estado en el que ninguna de las secuencias se ha alineado. El conjunto de secuencias se alinea mediante comparaciones por pares o mediante la alineación de pares de alineaciones parciales de subsecuencias. Este proceso puede causar problemas en la alineación, ya que la alineación de secuencias múltiples resultante puede depender, y de hecho dependerá, en gran medida de las secuencias alineadas inicialmente. No se realiza ninguna realineación de las secuencias previamente alineadas que pueda corregir la alineación de secuencias múltiples.
FSA utiliza la técnica de recocido de secuencias para superar este problema. Las probabilidades posteriores ordenadas se emplean con la técnica de recocido de secuencias para generar un alineamiento múltiple. Esta técnica encuentra el alineamiento entre dos secuencias que minimiza la distancia esperada a la secuencia real. En este caso, la distancia entre dos secuencias es el número de columnas en las que el carácter de una secuencia no es homólogo al carácter de la misma columna en la segunda secuencia.
La técnica de recocido de secuencias, al determinar una alineación con la distancia mínima esperada a la alineación verdadera, encuentra a su vez la alineación con la máxima precisión esperada. La precisión de una alineación depende de una alineación "verdadera" como referencia e indica la fracción de columnas donde las secuencias son homólogas. Esta precisión se utiliza como función objetivo, partiendo de las secuencias no alineadas (alineación nula), y alinea los caracteres en diferentes columnas según la precisión creciente de la alineación.
Ordenación de la alineación
FSA alinea múltiples secuencias basándose en la homología dentro de las columnas, en lugar de considerar únicamente inserciones, deleciones y sustituciones. Por lo tanto, FSA considera que dos alineamientos son equivalentes si, para cada posición de las secuencias en ambos alineamientos, se puede afirmar lo mismo sobre la homología. Por ejemplo, al considerar comparaciones por pares, si existe un hueco en una posición específica en dos alineamientos, se puede decir que las dos secuencias que se comparan no son homólogas en dicha posición. Esto puede dar lugar a alineamientos donde los eventos de apertura de huecos pueden diferir y aun así considerarse equivalentes. Por consiguiente, FSA elige generar el alineamiento con la menor cantidad de "aperturas de huecos".
Paralelización
Para gestionar conjuntos de datos excesivamente grandes, FSA puede dividir el trabajo de ejecutar todas las comparaciones por pares y alineaciones necesarias entre diferentes procesadores. Esto se logra mediante una estrategia de "fragmentación de tamaño fijo" que distribuye las comparaciones por pares a cada procesador disponible en bloques. De esta manera, cada procesador puede ejecutar el cálculo de probabilidad posterior sobre un bloque de comparaciones por pares antes de fusionar los datos recopilados en un único procesador para el recocido de secuencias.
Visualización
Los resultados del alineamiento de secuencias múltiples mediante FSA se pueden visualizar en la interfaz gráfica de usuario (GUI) de FSA. La GUI permite mostrar y etiquetar con colores diferentes indicadores de calidad del alineamiento en las columnas de caracteres. Las cinco medidas que se pueden observar y que se aproximan en el modelo FSA incluyen precisión, sensibilidad, certeza, especificidad y consistencia.
Comparaciones con otros programas
FSA se ha comparado con múltiples bases de datos de alineación para secuencias de proteínas (SABmark 1.65 y BAliBASE 3), ARN (BRAliBase 2.1 y Consanmix80) y ADN. Estas comparaciones se realizaron junto con otros programas de alineación populares como ClustalW, MAFFT, MUSCLE, T-Coffee, etc. En general, cuando se recibió el resumen y el artículo de investigación de FSA para su revisión, FSA superó a la mayoría de los programas de alineación en precisión y valores predictivos positivos, con sensibilidades a la par con los programas de mejor rendimiento como MAFFT y ProbConsRNA. También se realizaron comparaciones de tiempo de ejecución comparando los tiempos para alinear secuencias ribosomales 16S. MAFFT realizó la alineación más rápido que los otros programas de alineación, mientras que MUSCLE y FSA (usando un HMM de 3 estados y con el refinamiento iterativo deshabilitado) fueron los siguientes programas más rápidos.
Referencias
Bradley RK, Roberts A, Smoot M, Juvekar S, Do J, Dewey C, Holmes I, Pachter L (2009). " Alineación estadística rápida" . PLOS Computational Biology . 5 (5) e1000392. Bibcode : 2009PLSCB...5E0392B . doi : 10.1371/journal.pcbi.1000392 . PMC 2684580. PMID 19478997 .
Schwartz AS, Pachter L (2007) Alineamiento múltiple mediante recocido de secuencias. Bioinformatics 23: e24-9.
Eddy SR. Alineamiento múltiple mediante modelos ocultos de Markov. Proc Int Conf Intell Syst Mol Biol. 1995;3:114-20. PMID 7584426.
Enlaces externos
- Servidor web de la FSA
- Código fuente de FSA
- Bioinformática