MUSCLE ( Multiple Sequence Comparison by Log-Expectation ) es un software para el alineamiento múltiple de secuencias de proteínas y nucleótidos . Su licencia es de dominio público . El método fue publicado por Robert C. Edgar en dos artículos en 2004. El primero, publicado en Nucleic Acids Research , presentó el algoritmo de alineamiento de secuencias. [ 1 ] El segundo, publicado en BMC Bioinformatics , presentó más detalles técnicos. MUSCLE, hasta la versión 3, utiliza un método de refinamiento progresivo. [ 2 ] Desde la versión 5, utiliza un modelo oculto de Markov similar a ProbCons . [ 3 ]
Historia
Robert C. Edgar
Edgar se graduó en 1982 de University College London, Licenciado en Física, Doctor en Física de Partículas. [ 4 ] Tras su graduación, se dedicó al desarrollo de software y fundó su propia empresa, Parity Software, en 1988. [ 4 ] En 2001, comenzó a trabajar con algoritmos de codificación después de asistir a un seminario en la Universidad de California, Berkeley. [ 5 ] Desde 2001 hasta la actualidad, Edgar ha contribuido o ha sido el único creador de múltiples programas de software, incluidos MUSCLE y USEARCH. [ 4 ] Ha escrito un total de 96 artículos en el campo de la biología computacional desde 2002 hasta la actualidad, siendo su artículo más reciente Discovery and Validation of Alternatives to VSV-G for Pseudotyping of Lentiviral Vectors for In Vivo Delivery of Anti-Tumor Transgenes . Hasta abril de 2025, su trabajo ha sido citado más de 143.126 veces. [ 6 ] Los dos artículos originales publicados sobre MUSCLE han sido citados más de 58.979 veces en conjunto. El artículo “MUSCLE: alineación de secuencias múltiples con alta precisión y alto rendimiento” [ 1 ] ha recibido más de 49.052 citas, [ 6 ] mientras que “MUSCLE: un método de alineación de secuencias múltiples con complejidad espacial y de tiempo reducida” [ 2 ] ha sido citado más de 9.936 veces. [ 6 ]
Historia de las versiones musculares
Músculo5

Descripción general
A finales de 2021, Edgar lanzó Muscle5 (también conocido como Muscle v5), una versión actualizada del software MUSCLE. Introduce varias innovaciones destinadas a mejorar la precisión de la alineación y reducir el sesgo presente en otros algoritmos MSA . Las herramientas tradicionales como Clustal Omega , MAFFT y versiones anteriores de MUSCLE se basan en estrategias de alineación progresiva que producen una única alineación. Muscle5, en cambio, genera un conjunto de alineaciones de alta precisión perturbando un modelo oculto de Markov y permutando su árbol guía. En esencia, el algoritmo es una reimplementación paralela de ProbCons y está diseñado para escalar eficientemente a grandes conjuntos de datos. Muscle5 ha demostrado un rendimiento superior en pruebas comparativas en comparación con los principales métodos MSA en varios conjuntos de datos, incluidos BAliBASE, BRAliBASE y PREFAB. [ 3 ]
conjuntos
Una innovación clave en Muscle5 es el uso de conjuntos de alineación, que proporcionan métricas imparciales de confianza en las alineaciones. Cada MSA individual (réplica) en el conjunto utiliza parámetros fijos pero elegidos independientemente para el modelo oculto de Markov y el árbol guía, lo que permite promediar los resultados en un conjunto diverso de réplicas. Esto permite a los biólogos evaluar la sensibilidad de sus análisis posteriores a la incertidumbre de la alineación comparando los resultados en todo el conjunto. [ 3 ]
Antiguo algoritmo
El algoritmo MUSCLE (antes de la versión 5) se desarrolla en tres etapas: la etapa progresiva preliminar , la etapa progresiva mejorada y la etapa de refinamiento .
Etapa 1: Borrador progresivo
En esta primera etapa, el algoritmo genera un alineamiento múltiple, priorizando la velocidad sobre la precisión. Este paso comienza calculando la distancia k-mer para cada par de secuencias de entrada, creando así una matriz de distancias . UPGMA agrupa esta matriz para generar un árbol binario . A partir de este árbol, se construye un alineamiento progresivo, comenzando con la creación de perfiles para cada hoja. Para cada nodo, se realiza un alineamiento por pares de los dos perfiles hijos, asignando un nuevo perfil a dicho nodo. Este proceso continúa hasta obtener un alineamiento múltiple de todas las secuencias de entrada en la raíz del árbol.
Dadosecuencias de entrada ycomo la longitud promedio de la secuencia, la complejidad temporal de la etapa progresiva del borrador es
.
Aquí, el parEl cálculo de la distancia -mer se calcula comoy los pasos de alineación progresiva toman, dóndedenota la cota superior asintótica. La complejidad espacial esya que el algoritmo mantiene perfiles y alineaciones para cada secuencia a lo largo del árbol. [ 1 ]
Etapa 2: Mejora progresiva
Esta etapa se centra en obtener un árbol más óptimo calculando la distancia de Kimura para cada par de secuencias de entrada utilizando el alineamiento de secuencias múltiples obtenido en la primera etapa, y crea una segunda matriz de distancias. UPGMA agrupa esta matriz de distancias para obtener un segundo árbol binario. Se realiza un alineamiento progresivo para obtener un alineamiento de secuencias múltiples similar al de la primera etapa, pero se optimiza calculando únicamente los alineamientos en subárboles cuyo orden de ramificación ha cambiado con respecto al primer árbol binario, lo que resulta en un alineamiento más preciso.
En la segunda etapa se realizan alineamientos refinados recalculando un árbol más preciso mediante la distancia de Kimura. Por lo tanto, el análisis del algoritmo implica los subprocedimientos iniciales de cálculos de distancia por pares y alineación progresiva; sin embargo, se realizan optimizaciones en el cálculo limitando la realineación solo a aquellos subárboles con órdenes de ramificación alterados. La optimización se presenta de la siguiente manera:
,
donde la variabledenota el número de realineaciones de subárboles. De manera similar, la complejidad espacial es
,
ya que los perfiles y alineamientos de las secuencias de entrada se almacenan para el proceso de alineación progresiva. [ 1 ]
Etapa 3: Refinamiento
En esta etapa final, se selecciona una arista del segundo árbol, recorriendo las aristas en orden decreciente de distancia desde la raíz. La arista seleccionada se elimina, dividiendo el árbol en dos subárboles. A continuación, se calcula el perfil de la alineación múltiple para cada subárbol. Se genera una nueva alineación de secuencias múltiples realineando los perfiles de los subárboles. Si la puntuación SP mejora, se conserva la nueva alineación; de lo contrario, se descarta. El proceso de eliminación de una arista y alineación se repite hasta la convergencia o hasta alcanzar un límite definido por el usuario.
La complejidad temporal de la etapa de refinamiento se expresa como:. Aquí,denota el número de eliminaciones de aristas ydenota la longitud promedio de la secuencia, donde el realineamiento de los perfiles del subárbol sigue siendo el costo dominante por iteración. La complejidad espacial permanece igual que la dada en las etapas uno y dos:Dado que se produce el mismo proceso de refinamiento iterativo, la complejidad asintótica sigue siendo polinómica, ya que el término dominante crece linealmente con respecto al número de pasos de refinamiento.
En comparación, el algoritmo CLUSTALW incluye un paso de refinamiento iterativo optimizado de tal manera que se produce una realineación selectiva del árbol para maximizar la precisión de la alineación sin repetir todo el proceso. Sin embargo, la complejidad temporal y espacial no cambia para este paso de refinamiento iterativo optimizado. La complejidad temporal es, dóndees el número de pasos de refinamiento yes la longitud de alineación promedio. La complejidad espacial se da como, nuevamente, para perfiles de alineación y datos de secuencia para todossecuencias de entrada. [ 1 ] [ 2 ]
Diagrama de flujo del algoritmo
![]()
Complejidad y comparación
En las dos primeras etapas del algoritmo, la complejidad temporal es O( N²L + NL² ) , y la complejidad espacial es O( N² + NL + L² ) . La etapa de refinamiento añade a la complejidad temporal otro término, O( N³L ) . [ 1 ] MUSCLE se usa a menudo como reemplazo de Clustal , ya que suele (pero no siempre) proporcionar mejores alineamientos de secuencias . Dependiendo de las opciones elegidas, MUSCLE es significativamente más rápido que Clustal, sobre todo para alineamientos más grandes. [ 1 ] [ 2 ]
La mayoría de los programas modernos de alineación de secuencias múltiples son generalmente aceptados al presentar secuencias alineadas, pero existen algunas diferencias entre ellos. La principal diferencia radica en el método utilizado para alinear las secuencias. Por ejemplo, T-COFFEE y Clustal utilizan el método progresivo, mientras que MUSCLE y MAFFT emplean el método iterativo de alineación. [ 9 ] Estos dos métodos difieren en su capacidad para manejar secuencias de baja similitud, siendo el método iterativo el que proporciona resultados más precisos. Otra diferencia entre los métodos reside en sus necesidades computacionales.
Originalmente, MUSCLE tenía demandas de CPU intermedias en comparación con otros programas, pero definitivamente eran más altas que los métodos progresivos. [ 1 ] Las comparaciones con versiones modernas de programas MSA revelan que muchos son bastante similares en capacidades. Los alineamientos se evaluaron en función de su suma de pares (SP), que es la coincidencia correcta de dos nucleótidos/aminoácidos en dos secuencias, y sus columnas totales (TC), que es la columna de coincidencia dividida por el total de columnas. En estos casos, MUSCLE fue promedio en su capacidad para maximizar pares y columnas coincidentes, siendo ligeramente peor que ProbCons , T-Coffee, Probalign y MAFFT. [ 10 ] Fuera de las puntuaciones de alineación, MUSCLE fue menos exigente computacionalmente tanto en el tiempo de ejecución de la alineación como en la demanda de memoria.
Integración
MUSCLE cuenta con un amplio soporte en múltiples plataformas bioinformáticas. Está totalmente integrado en programas de software como CodonCode Aligner , Lasergene de DNASTAR, Geneious y MacVector , y también está disponible como complemento para Sequencher , MEGA , UGENE y AliView. Los usuarios también pueden acceder a MUSCLE como servicio web a través del Laboratorio Europeo de Biología Molecular (EMBL) - Instituto Europeo de Bioinformática (EBI) [ 11 ] o T-Coffee. Asimismo, los usuarios pueden descargar MUSCLE en sus dispositivos personales a través del sitio web oficial .
Véase también
Referencias
- 1 2 3 4 5 6 7 8 9 Edgar RC (2004). "MUSCLE: alineación de secuencias múltiples con alta precisión y alto rendimiento" . Nucleic Acids Research . 32 (5): 1792– 97. doi : 10.1093/nar/gkh340 . PMC 390337. PMID 15034147 .
- 1 2 3 4 Edgar RC (2004). "MUSCLE: un método de alineación de secuencias múltiples con complejidad de tiempo y espacio reducida" . BMC Bioinformatics . 5 (1) 113. doi : 10.1186/1471-2105-5-113 . PMC 517706. PMID 15318951 .
- 1 2 3 Edgar, Robert C. (2022). "Muscle5: Los conjuntos de alineación de alta precisión permiten evaluaciones imparciales de la homología de secuencias y la filogenia" . Nature Communications . 13 (6968) 6968: 1– 9. doi : 10.1038/s41467-022-34630-w . PMC 9664440 .
- 1 2 3 "Curriculum Vitae" . drive5.com . Consultado el 24 de abril de 2025 .
- ↑ Edgar, Robert (3 de septiembre de 2014). "Un caballero erudito desempleado" . Recuperado el 24 de abril de 2025 .
- 1 2 3 "Robert C. Edgar" . scholar.google.com . Consultado el 24 de abril de 2025 .
- ↑ Edgar, Robert C. (19 de agosto de 2004). "MUSCLE: un método de alineación de secuencias múltiples con complejidad espacial y de tiempo reducida" . BMC Bioinformatics . 5 (1) 113. doi : 10.1186/1471-2105-5-113 . ISSN 1471-2105 . PMC 517706. PMID 15318951 .
- ↑ "Guía del usuario de Muscle" . scholar.google.com . Consultado el 22 de abril de 2025 .
- ↑ Zhang, Chenyue (29 de noviembre de 2024). "La evolución histórica y la importancia del alineamiento de secuencias múltiples en la predicción de la estructura y función molecular" . Biomolecules . 14 ( 12): 1531. doi : 10.3390/biom14121531 . PMC 11673352. PMID 39766238 .
- 1 2 Pais, Fabiano (6 de marzo de 2014). "Evaluación de la eficiencia de los programas de alineación de secuencias múltiples" . Algorithms for Molecular Biology . 9 (4) 4. doi : 10.1186/1748-7188-9-4 . PMC 4015676. PMID 24602402 .
- 1 2 "MUSCLE < Alineamiento de secuencias múltiples < EMBL-EBI" . Archivado del original el 18 de enero de 2015. Recuperado el 1 de septiembre de 2014 .
- ↑ CodonCode Aligner: Software de alineación de secuencias para datos de ADN
- ↑ Geneious: Alineación múltiple mediante MUSCLE
- ↑ DNASTAR: Opciones de alineación muscular
- ↑ Alineaciones en MacVector
- ↑ Secuenciador: MUSCLE MSA
- ↑ MEGA Ayuda: Alineación MUSCULAR
- ↑ UGENE: MSA con músculo
- ↑ AliView: AliView: Acerca de
- ↑ T-Coffee: Tutorial
Enlaces externos
- Sitio web oficial
- Servidor web MUSCLE (EMBL-EBI)
- Software de filogenética