En biología, un modelo de sustitución , también llamado modelo de evolución de secuencias , es un modelo de Markov que describe cambios a lo largo del tiempo evolutivo. Estos modelos describen cambios evolutivos en macromoléculas, como secuencias de ADN o de proteínas , que pueden representarse como una secuencia de símbolos (por ejemplo, A, C, G y T en el caso del ADN o los 20 aminoácidos proteinogénicos "estándar" en el caso de las proteínas ). Los modelos de sustitución se utilizan para calcular la probabilidad de árboles filogenéticos a partir de datos de alineación de secuencias múltiples . Por lo tanto, los modelos de sustitución son fundamentales para la estimación de máxima verosimilitud de la filogenia, así como para la inferencia bayesiana en filogenia . Las estimaciones de distancias evolutivas (número de sustituciones que han ocurrido desde que un par de secuencias divergieron de un ancestro común) se calculan típicamente utilizando modelos de sustitución (las distancias evolutivas se utilizan como entrada para métodos de distancia como el de unión de vecinos ). Los modelos de sustitución también son fundamentales para los invariantes filogenéticos porque son necesarios para predecir las frecuencias de patrones de sitios dada una topología de árbol. Los modelos de sustitución también son necesarios para simular datos de secuencia para un grupo de organismos relacionados por un árbol específico.

Fundamentos teóricos
Las matemáticas de los modelos de sustitución
Los modelos de sitios finitos, estacionarios, neutros e independientes (que asumen una tasa de evolución constante ) tienen dos parámetros, π , un vector de equilibrio de frecuencias de bases (o caracteres) y una matriz de tasas, Q , que describe la tasa a la que las bases de un tipo cambian a bases de otro tipo; elementopara i ≠ j es la tasa a la que la base i pasa a la base j . Las diagonales de la matriz Q se eligen de modo que la suma de las filas sea cero:
El vector fila de equilibrio π debe ser anulado por la matriz de tasas Q :
La función de matriz de transición es una función de las longitudes de las ramas (en algunas unidades de tiempo, posiblemente en sustituciones) a una matriz de probabilidades condicionales. Se denota. La entrada en la i- ésima columna y la j- ésima fila,es la probabilidad, después del tiempo t , de que haya una base j en una posición dada, condicionada a que haya una base i en esa posición en el tiempo 0. Cuando el modelo es reversible en el tiempo, esto se puede realizar entre dos secuencias cualesquiera, incluso si una no es la antecesora de la otra, si se conoce la longitud total de la rama entre ellas.
Las propiedades asintóticas de P ij (t) son tales que P ij (0) = δ ij , donde δ ij es la función delta de Kronecker . Es decir, no hay cambio en la composición de bases entre una secuencia y sí misma. En el otro extremo,o, dicho de otro modo, a medida que el tiempo tiende a infinito, la probabilidad de encontrar la base j en una posición dado que originalmente había una base i en esa posición tiende a la probabilidad de equilibrio de que haya una base j en esa posición, independientemente de la base original. Además, se deduce quepara todo t .
La matriz de transición se puede calcular a partir de la matriz de tasas mediante la exponenciación de matrices :
donde Q n es la matriz Q multiplicada por sí misma suficientes veces para dar su enésima potencia .
Si Q es diagonalizable , la exponencial de la matriz se puede calcular directamente: sea Q = U −1 Λ U una diagonalización de Q , con
donde Λ es una matriz diagonal y dondeson los autovalores de Q , cada uno repetido según su multiplicidad. Entonces
donde la matriz diagonal e Λt viene dada por
Modelos reversibles en el tiempo y estacionarios
Muchos modelos de sustitución útiles son reversibles en el tiempo ; en términos matemáticos, al modelo no le importa qué secuencia es la antecesora y cuál es la descendiente, siempre y cuando todos los demás parámetros (como el número de sustituciones por sitio que se espera entre las dos secuencias) se mantengan constantes.
Al analizar datos biológicos reales, generalmente no se tiene acceso a las secuencias de las especies ancestrales, sino solo a las de las especies actuales. Sin embargo, cuando un modelo es reversible en el tiempo, la especie ancestral resulta irrelevante. En cambio, el árbol filogenético puede enraizarse utilizando cualquiera de las especies, reenraizarse posteriormente con base en nuevos conocimientos o dejarse sin enraizar. Esto se debe a que no existe una especie "especial"; todas las especies derivarán eventualmente unas de otras con la misma probabilidad.
Un modelo es reversible en el tiempo si y solo si satisface la propiedad (la notación se explica a continuación).
o, equivalentemente, la propiedad del balance detallado ,
para cada i , j y t .
La reversibilidad temporal no debe confundirse con la estacionariedad . Un modelo es estacionario si Q no cambia con el tiempo. El análisis que sigue parte del supuesto de un modelo estacionario.
Reversibilidad temporal generalizada
El modelo reversible en el tiempo generalizado (GTR) es el modelo reversible en el tiempo neutral, independiente y de sitios finitos más general posible. Fue descrito por primera vez en forma general por Simon Tavaré en 1986. [ 1 ] El modelo GTR se denomina a menudo modelo reversible en el tiempo general en las publicaciones; [ 2 ] también se le ha llamado modelo REV. [ 3 ]
Los parámetros GTR para nucleótidos consisten en un vector de frecuencia de base de equilibrio,, dando la frecuencia con la que cada base aparece en cada sitio, y la matriz de tasas
Debido a que el modelo debe ser reversible en el tiempo y debe aproximarse a las frecuencias de nucleótidos (bases) de equilibrio en tiempos largos, cada tasa debajo de la diagonal es igual a la tasa recíproca encima de la diagonal multiplicada por la relación de equilibrio de las dos bases. Por lo tanto, el GTR de nucleótidos requiere 6 parámetros de tasa de sustitución y 4 parámetros de frecuencia de base de equilibrio. Dado que los 4 parámetros de frecuencia deben sumar 1, solo hay 3 parámetros de frecuencia libres. El total de 9 parámetros libres a menudo se reduce aún más a 8 parámetros más, el número total de sustituciones por unidad de tiempo. Al medir el tiempo en sustituciones (=1) Solo quedan 8 parámetros libres.
En general, para calcular el número de parámetros, se cuenta el número de entradas por encima de la diagonal en la matriz, es decir, para n valores de rasgos por sitio.y luego sumar n-1 para las frecuencias de equilibrio y restar 1 porqueestá arreglado. Lo consigues
Por ejemplo, para una secuencia de aminoácidos (hay 20 aminoácidos "estándar" que componen las proteínas ), encontrarías que hay 208 parámetros. Sin embargo, al estudiar las regiones codificantes del genoma, es más común trabajar con un modelo de sustitución de codones (un codón son tres bases y codifica para un aminoácido en una proteína).codones, lo que resulta en 2078 parámetros libres. Sin embargo, las tasas de transición entre codones que difieren en más de una base a menudo se asumen como cero, lo que reduce el número de parámetros libres a soloparámetros. Otra práctica común es reducir el número de codones prohibiendo los codones de parada (o sin sentido ). Esta es una suposición biológicamente razonable porque incluir los codones de parada significaría que se está calculando la probabilidad de encontrar un codón con sentido.después de un tiempodado que el codón ancestral esimplicaría la posibilidad de pasar por un estado con un codón de parada prematuro.
Una forma alternativa (y comúnmente utilizada [ 2 ] [ 4 ] [ 5 ] [ 6 ] ) de escribir la matriz de tasa instantánea (La matriz) para el modelo de nucleótidos GTR es:
ElLa matriz está normalizada, por lo tanto.
Esta notación es más fácil de entender que la notación utilizada originalmente por Tavaré , porque todos los parámetros del modelo corresponden a parámetros de "intercambiabilidad" (a través de, que también se puede escribir utilizando la notación) o a frecuencias de nucleótidos de equilibrio. Tenga en cuenta que los nucleótidos en elLas matrices se han escrito en orden alfabético. En otras palabras, la matriz de probabilidad de transición para laLa matriz anterior sería:
Algunas publicaciones escriben los nucleótidos en un orden diferente (por ejemplo, algunos autores optan por agrupar dos purinas juntas y las dos pirimidinas juntas; véase también modelos de evolución del ADN ). Estas diferencias en la notación hacen que sea importante tener claro el orden de los estados al escribir elmatriz.
El valor de esta notación es que la tasa instantánea de cambio de nucleótidoal nucleótidosiempre se puede escribir como, dóndees la intercambiabilidad de los nucleótidosyy es la frecuencia de equilibrio de lanucleótido. La matriz mostrada arriba utiliza las letrasa través depara los parámetros de intercambiabilidad en aras de la legibilidad, pero esos parámetros también podrían escribirse de manera sistemática utilizando elnotación (por ejemplo,, y así sucesivamente).
Tenga en cuenta que el orden de los subíndices de nucleótidos para los parámetros de intercambiabilidad es irrelevante (por ejemplo,) pero los valores de la matriz de probabilidad de transición no lo son (es decir, es la probabilidad de observar A en la secuencia 1 y C en la secuencia 2 cuando la distancia evolutiva entre esas secuencias esmientras es la probabilidad de observar C en la secuencia 1 y A en la secuencia 2 a la misma distancia evolutiva).
Parámetros de intercambiabilidad elegidos arbitrariamente (por ejemplo,) normalmente se establece en un valor de 1 para aumentar la legibilidad de las estimaciones del parámetro de intercambiabilidad (ya que permite a los usuarios expresar esos valores en relación con el parámetro de intercambiabilidad elegido). La práctica de expresar los parámetros de intercambiabilidad en términos relativos no es problemática porqueLa matriz está normalizada. La normalización permite(tiempo) en la exponenciación de la matrizdebe expresarse en unidades de sustituciones esperadas por sitio (práctica estándar en filogenética molecular). Esto equivale a afirmar que se está estableciendo la tasa de mutación.a 1) y reduciendo el número de parámetros libres a ocho. Específicamente, hay cinco parámetros de intercambiabilidad libres (a través de, que se expresan en relación con el fijoen este ejemplo) y tres parámetros de frecuencia base de equilibrio (como se describió anteriormente, solo tresLos valores deben especificarse porquedebe sumar 1).
La notación alternativa también facilita la comprensión de los submodelos del modelo GTR, que simplemente corresponden a casos en los que los parámetros de intercambiabilidad y/o frecuencia base de equilibrio están restringidos a tomar valores iguales. Se han nombrado varios submodelos específicos, en gran medida basándose en sus publicaciones originales:
Hay 203 formas posibles en que los parámetros de intercambiabilidad pueden restringirse para formar submodelos de GTR, [ 14 ] que van desde los modelos JC69 [ 7 ] y F81 [ 8 ] (donde todos los parámetros de intercambiabilidad son iguales) hasta el modelo SYM [ 13 ] y el modelo GTR completo [ 1 ] (o REV [ 3 ] ) (donde todos los parámetros de intercambiabilidad son libres). Las frecuencias base de equilibrio se tratan típicamente de dos maneras diferentes: 1) todoslos valores están restringidos a ser iguales (es decir,); o 2) todosLos valores se tratan como parámetros libres. Aunque las frecuencias base de equilibrio pueden restringirse de otras maneras, la mayoría de las restricciones que vinculan algunos pero no todosLos valores no son realistas desde un punto de vista biológico. La posible excepción es imponer la simetría de la hebra [ 15 ] (es decir, restringirypero permitiendo).
La notación alternativa también facilita ver cómo se puede aplicar el modelo GTR a alfabetos biológicos con un espacio de estados mayor (por ejemplo, aminoácidos o codones ). Es posible escribir un conjunto de frecuencias de estados de equilibrio como,, ...y un conjunto de parámetros de intercambiabilidad () para cualquier alfabeto deestados del personaje. Estos valores se pueden usar luego para rellenar elmatriz estableciendo los elementos fuera de la diagonal como se muestra arriba (la notación general sería ), estableciendo los elementos diagonalesa la suma negativa de los elementos fuera de la diagonal en la misma fila y normalizando. Obviamente,para aminoácidos ypara codones (suponiendo el código genético estándar ). Sin embargo, la generalidad de esta notación es beneficiosa porque se pueden usar alfabetos reducidos para los aminoácidos. Por ejemplo, se puede usary codificar aminoácidos recodificando los aminoácidos utilizando las seis categorías propuestas por Margaret Dayhoff . Los alfabetos de aminoácidos reducidos se consideran una forma de reducir el impacto de la variación composicional y la saturación. [ 16 ]
Es importante destacar que los patrones evolutivos pueden variar entre regiones genómicas y, por lo tanto, diferentes regiones genómicas pueden ajustarse a diferentes modelos de sustitución. [ 17 ] De hecho, ignorar los patrones evolutivos heterogéneos a lo largo de las secuencias puede generar sesgos en la estimación de parámetros evolutivos, incluida la relación K a /K s . En este sentido, el uso de modelos de mezcla en marcos filogenéticos resulta conveniente para imitar mejor la evolución molecular observada en datos reales. [ 18 ]
El reloj molecular y las unidades de tiempo
Normalmente, la longitud de una rama de un árbol filogenético se expresa como el número esperado de sustituciones por sitio; si el modelo evolutivo indica que cada sitio dentro de una secuencia ancestral experimentará típicamente x sustituciones para cuando evolucione a la secuencia de un descendiente en particular, entonces se considera que el ancestro y el descendiente están separados por una longitud de rama x .
A veces, la longitud de una rama se mide en años geológicos. Por ejemplo, el registro fósil permite determinar el número de años entre una especie ancestral y una descendiente. Dado que algunas especies evolucionan a ritmos más rápidos que otras, estas dos medidas de longitud de rama no siempre son directamente proporcionales. El número esperado de sustituciones por sitio al año se suele indicar con la letra griega mu (μ).
Se dice que un modelo tiene un reloj molecular estricto si el número esperado de sustituciones por año μ es constante, independientemente de la evolución de la especie que se esté analizando. Una implicación importante de un reloj molecular estricto es que el número de sustituciones esperadas entre una especie ancestral y cualquiera de sus descendientes actuales debe ser independiente de la especie descendiente que se examine.
Cabe señalar que la suposición de un reloj molecular estricto suele ser poco realista, especialmente en largos periodos de evolución. Por ejemplo, aunque los roedores son genéticamente muy similares a los primates , han experimentado un número mucho mayor de sustituciones en el tiempo estimado desde la divergencia en algunas regiones del genoma . [ 19 ] Esto podría deberse a su menor tiempo de generación , [ 20 ] mayor tasa metabólica , mayor estructuración poblacional, mayor tasa de especiación o menor tamaño corporal . [ 21 ] [ 22 ] Al estudiar eventos antiguos como la explosión cámbrica bajo la suposición de un reloj molecular, a menudo se observa una escasa concordancia entre los datos cladísticos y filogenéticos. Se han realizado algunos trabajos sobre modelos que permiten una tasa de evolución variable. [ 23 ] [ 24 ]
Los modelos que pueden tener en cuenta la variabilidad de la tasa del reloj molecular entre diferentes linajes evolutivos en la filogenia se denominan "relajados", en contraposición a los "estrictos". En estos modelos, se puede suponer que la tasa está correlacionada o no entre ancestros y descendientes, y la variación de la tasa entre linajes puede provenir de diversas distribuciones, aunque generalmente se aplican las distribuciones exponencial y lognormal. Existe un caso especial, denominado "reloj molecular local", en el que una filogenia se divide en al menos dos particiones (conjuntos de linajes) y se aplica un reloj molecular estricto en cada una, pero con tasas diferentes.
Topologías de árboles filogenéticos y otros parámetros
Las topologías de los árboles filogenéticos suelen ser el parámetro de interés; [ 25 ] por lo tanto, las longitudes de las ramas y cualquier otro parámetro que describa el proceso de sustitución suelen considerarse parámetros de molestia . Sin embargo, los biólogos a veces se interesan en otros aspectos del modelo. Por ejemplo, las longitudes de las ramas, especialmente cuando estas se combinan con información del registro fósil y un modelo para estimar el marco temporal de la evolución. [ 26 ] Se han utilizado otros parámetros del modelo para obtener información sobre diversos aspectos del proceso de evolución. La relación K a /K s (también llamada ω en los modelos de sustitución de codones) es un parámetro de interés en muchos estudios. La relación K a /K s puede utilizarse para examinar la acción de la selección natural en las regiones codificantes de proteínas, [ 27 ] proporciona información sobre las tasas relativas de sustituciones de nucleótidos que cambian aminoácidos (sustituciones no sinónimas) con respecto a aquellas que no cambian el aminoácido codificado (sustituciones sinónimas).
Estacionariedad, reversibilidad y homogeneidad
Los modelos de sustitución utilizados en filogenética suelen asumir que el proceso evolutivo es estacionario , reversible y homogéneo en todas las ramas del árbol. [ 28 ] Estas suposiciones simplifican tanto el marco teórico como la implementación computacional de la inferencia filogenética basada en la verosimilitud.
- La estacionariedad implica que las probabilidades marginales (de equilibrio) de los nucleótidos o aminoácidos permanecen constantes a lo largo del tiempo. En un árbol filogenético, esto significa que se asume que la composición de bases es la misma en todos los linajes.
- La reversibilidad indica que el proceso de sustitución es simétrico en el tiempo. Formalmente, la probabilidad de estar en el estado i y cambiar al estado j es igual a la probabilidad de estar en el estado j y cambiar al estado i bajo la distribución estacionaria. Esta propiedad permite calcular la verosimilitud del árbol sin conocer la posición de la raíz.
- La homogeneidad significa que el proceso de sustitución (es decir, la matriz de tasas y la distribución estacionaria) es el mismo en todas las ramas del árbol.
Estas suposiciones permiten utilizar un único modelo de Markov en toda la filogenia y reducen considerablemente la complejidad de la estimación del árbol. La reversibilidad, en particular, se utiliza con frecuencia porque simplifica los cálculos de verosimilitud al eliminar la necesidad de inferir la raíz.
Clases de modelos
Modelos mecanicistas frente a modelos empíricos
Una diferencia principal en los modelos evolutivos es cuántos parámetros se estiman cada vez para el conjunto de datos en consideración y cuántos de ellos se estiman una sola vez en un conjunto de datos grande. Los modelos mecanicistas describen todas las sustituciones como una función de una serie de parámetros que se estiman para cada conjunto de datos analizado, preferiblemente utilizando la máxima verosimilitud . Esto tiene la ventaja de que el modelo se puede ajustar a las particularidades de un conjunto de datos específico (por ejemplo, diferentes sesgos de composición en el ADN). Pueden surgir problemas cuando se utilizan demasiados parámetros, particularmente si pueden compensarse entre sí (esto puede llevar a la no identificabilidad [ 29 ] ). Entonces, a menudo sucede que el conjunto de datos es demasiado pequeño para proporcionar suficiente información para estimar todos los parámetros con precisión.
Los modelos empíricos se crean estimando muchos parámetros (normalmente todas las entradas de la matriz de tasas, así como las frecuencias de los caracteres; véase el modelo GTR anterior) a partir de un gran conjunto de datos. Estos parámetros se fijan y se reutilizan para cada conjunto de datos. Esto tiene la ventaja de que dichos parámetros pueden estimarse con mayor precisión. Normalmente, no es posible estimar todas las entradas de la matriz de sustitución solo a partir del conjunto de datos actual. Como desventaja, los parámetros estimados a partir de los datos de entrenamiento podrían ser demasiado genéricos y, por lo tanto, tener un ajuste deficiente a cualquier conjunto de datos en particular. Una posible solución a este problema es estimar algunos parámetros a partir de los datos utilizando la máxima verosimilitud (u otro método). En los estudios de evolución de proteínas, las frecuencias de aminoácidos en equilibrio(utilizando los códigos IUPAC de una letra para los aminoácidos para indicar sus frecuencias de equilibrio) a menudo se estiman a partir de los datos [ 30 ] mientras se mantiene fija la matriz de intercambiabilidad. Más allá de la práctica común de estimar las frecuencias de aminoácidos a partir de los datos, existen métodos para estimar los parámetros de intercambiabilidad [ 31 ] o ajustar la matriz de intercambiabilidad.Se han propuesto otras formas de utilizar la matriz [ 32 ] para la evolución de proteínas.
Dado que la secuenciación genómica a gran escala sigue generando enormes cantidades de secuencias de ADN y proteínas, existe suficiente información disponible para crear modelos empíricos con cualquier número de parámetros, incluidos modelos de codones empíricos. [ 33 ] Debido a los problemas mencionados anteriormente, a menudo se combinan ambos enfoques: se estima la mayoría de los parámetros una vez con datos a gran escala, mientras que los pocos parámetros restantes se ajustan posteriormente al conjunto de datos en cuestión. Las siguientes secciones ofrecen una visión general de los diferentes enfoques adoptados para los modelos basados en ADN, proteínas o codones.
Por tipo de datos
modelos de sustitución de ADN
Los primeros modelos de evolución del ADN fueron propuestos por Jukes y Cantor [ 7 ] en 1969. El modelo Jukes-Cantor (JC o JC69) asume tasas de transición iguales, así como frecuencias de equilibrio iguales para todas las bases y es el submodelo más simple del modelo GTR. En 1980, Motoo Kimura introdujo un modelo con dos parámetros (K2P o K80 [ 9 ] ): uno para la transición y otro para la tasa de transversión . Un año después, Kimura introdujo un segundo modelo (K3ST, K3P o K81 [ 11 ] ) con tres tipos de sustitución: uno para la tasa de transición , uno para la tasa de transversiones que conservan las propiedades fuertes/débiles de los nucleótidos (y, designadopor Kimura [ 11 ] ), y una para la tasa de transversiones que conservan las propiedades amino/ceto de los nucleótidos (y, designadopor Kimura [ 11 ] ). En 1981, Joseph Felsenstein propuso un modelo de cuatro parámetros (F81 [ 8 ] ) en el que la tasa de sustitución corresponde a la frecuencia de equilibrio del nucleótido objetivo. Hasegawa, Kishino y Yano unificaron los dos últimos modelos en un modelo de cinco parámetros (HKY [ 10 ] ). Después de estos esfuerzos pioneros, muchos submodelos adicionales del modelo GTR se introdujeron en la literatura (y se generalizó su uso) en la década de 1990. [ 12 ] [ 13 ] Otros modelos que van más allá del modelo GTR de maneras específicas también fueron desarrollados y refinados por varios investigadores. [ 34 ] [ 35 ]
Casi todos los modelos de sustitución de ADN son mecanicistas (como se describió anteriormente). El reducido número de parámetros necesarios para su estimación permite calcularlos a partir de los datos. Esto también es necesario porque los patrones de evolución de la secuencia de ADN suelen diferir entre organismos y entre genes dentro de un mismo organismo. Esto último puede reflejar la optimización mediante la selección para fines específicos (por ejemplo, expresión rápida o estabilidad del ARN mensajero ) o bien, una variación neutra en los patrones de sustitución. Por lo tanto, dependiendo del organismo y del tipo de gen, probablemente sea necesario ajustar el modelo a estas circunstancias.
Modelos de sustitución de dos estados
Una forma alternativa de analizar datos de secuencias de ADN es recodificar los nucleótidos como purinas (R) y pirimidinas (Y); [ 36 ] [ 37 ] esta práctica se denomina a menudo codificación RY. [ 38 ] Las inserciones y deleciones en alineamientos de secuencias múltiples también pueden codificarse como datos binarios [ 39 ] y analizarse utilizando un modelo de dos estados. [ 40 ] [ 41 ]
El modelo de evolución de secuencias de dos estados más simple se llama modelo de Cavender-Farris o modelo de Cavender-Farris- Neyman (CFN); el nombre de este modelo refleja el hecho de que fue descrito independientemente en varias publicaciones diferentes. [ 42 ] [ 43 ] [ 44 ] El modelo CFN es idéntico al modelo de Jukes-Cantor adaptado a dos estados y se ha implementado como el modelo "JC2" en el popular paquete de software IQ-TREE (usar este modelo en IQ-TREE requiere codificar los datos como 0 y 1 en lugar de R e Y; el popular paquete de software PAUP* puede interpretar una matriz de datos que comprende solo R e Y como datos para ser analizados usando el modelo CFN). También es sencillo analizar datos binarios usando la transformación filogenética de Hadamard . [ 45 ]
El modelo alternativo de dos estados permite que los parámetros de frecuencia de equilibrio de R e Y (o 0 y 1) tomen valores distintos de 0,5 mediante la adición de un único parámetro libre; este modelo se denomina indistintamente CFu [ 36 ] o GTR2 (en IQ-TREE). Este problema no se presenta con demasiada frecuencia en secuencias de nucleótidos, pero puede ser muy importante para otros tipos de datos binarios, como la presencia o ausencia de una innovación morfológica. [ 46 ]
Modelos de sustitución de aminoácidos
Para muchos análisis, especialmente para distancias evolutivas más largas, la evolución se modela a nivel de aminoácidos. Dado que no todas las sustituciones de ADN alteran también el aminoácido codificado, se pierde información al observar los aminoácidos en lugar de las bases nucleotídicas. Sin embargo, varias ventajas justifican el uso de la información de aminoácidos: el ADN es mucho más propenso a mostrar sesgos composicionales que los aminoácidos, no todas las posiciones en el ADN evolucionan a la misma velocidad ( las mutaciones no sinónimas tienen menos probabilidades de fijarse en la población que las sinónimas ), pero probablemente lo más importante es que, debido a esas posiciones de rápida evolución y al tamaño limitado del alfabeto (solo cuatro estados posibles), el ADN sufre más sustituciones inversas, lo que dificulta la estimación precisa de distancias evolutivas más largas.
A diferencia de los modelos de ADN, los modelos de aminoácidos son tradicionalmente modelos empíricos. Fueron desarrollados en las décadas de 1960 y 1970 por Dayhoff y colaboradores, quienes estimaron las tasas de reemplazo a partir de alineamientos de proteínas con al menos un 85 % de identidad (inicialmente con datos muy limitados [ 47 ] y culminando finalmente en el modelo PAM de Dayhoff de 1978 [ 48 ] ). Esto minimizó las posibilidades de observar múltiples sustituciones en un sitio. A partir de la matriz de tasas estimadas, se derivó una serie de matrices de probabilidad de reemplazo, conocidas con nombres como PAM 250. Las matrices de log-odds basadas en el modelo PAM de Dayhoff se usaban comúnmente para evaluar la significancia de los resultados de búsqueda de homología, aunque las matrices BLOSUM [ 49 ] han reemplazado a las matrices de log-odds PAM en este contexto porque las matrices BLOSUM parecen ser más sensibles en una variedad de distancias evolutivas, a diferencia de las matrices de log-odds PAM . [ 50 ]
La matriz PAM de Dayhoff fue la fuente de los parámetros de intercambiabilidad utilizados en uno de los primeros análisis de filogenia de máxima verosimilitud que utilizó datos de proteínas [ 51 ] y el modelo PAM (o una versión mejorada del modelo PAM llamada DCMut [ 52 ] ) continúa utilizándose en filogenética. Sin embargo, el número limitado de alineamientos utilizados para generar el modelo PAM (que refleja la cantidad limitada de datos de secuencia disponibles en la década de 1970) casi con certeza infló la varianza de algunos parámetros de la matriz de tasas (alternativamente, las proteínas utilizadas para generar el modelo PAM podrían haber sido un conjunto no representativo). De todos modos, está claro que el modelo PAM rara vez se ajusta tan bien a la mayoría de los conjuntos de datos como los modelos empíricos más modernos (Keane et al. 2006 [ 53 ] probaron miles de proteínas de vertebrados , bacterias y arqueas y encontraron que el modelo PAM de Dayhoff tenía el mejor ajuste para como máximo <4% de las proteínas).
A partir de la década de 1990, la rápida expansión de las bases de datos de secuencias debido a la mejora de las tecnologías de secuenciación condujo a la estimación de muchas matrices empíricas nuevas (véase [ 54 ] para una lista completa). Los primeros esfuerzos utilizaron métodos similares a los empleados por Dayhoff, utilizando la comparación a gran escala de la base de datos de proteínas para generar una nueva matriz de logaritmos de probabilidades [ 55 ] y el modelo JTT (Jones-Taylor-Thornton). [ 56 ]
El rápido aumento de la capacidad de cálculo en el siglo XXI (que refleja factores como la ley de Moore ) hizo posible estimar parámetros para modelos empíricos utilizando máxima verosimilitud (p. ej., los modelos WAG [ 30 ] y LG [ 57 ] ) y otros métodos (p. ej., los modelos VT [ 58 ] y PMB [ 59 ] ). El paquete de software IQ-Tree permite a los usuarios inferir su propio modelo reversible en el tiempo utilizando QMaker, [ 60 ] o no reversible en el tiempo utilizando nQMaker. Estos métodos producen tanto un árbol como una matriz de mejor ajuste. [ 61 ] GTR también está disponible en IQ-Tree. La inferencia de modelos personalizados y GTR requiere una alineación relativamente grande debido a la gran cantidad de parámetros involucrados. Como consecuencia, actualmente hay disponible una gran cantidad de modelos de sustitución empíricos de evolución de proteínas (véase la base de datos [ 62 ] ). Estos modelos de sustitución se derivan de secuencias de proteínas de diferentes grupos taxonómicos y familias de proteínas, como proteínas nucleares , proteínas de cloroplastos , proteínas mitocondriales y proteínas virales , entre otras.
Un modelo empírico singular asume un conjunto constante de frecuencias de aminoácidos en todo el árbol evolutivo, lo cual a menudo no es el caso en árboles de gran extensión. [ 61 ] El modelo bayesiano CAT se introdujo en 2004. La versión de máxima verosimilitud con 10 a 60 perfiles empíricos (C10 a C60) se introdujo en 2008. Estos métodos están disponibles en PhyML y [ 63 ] IQ-TREE. [ 46 ] Un modelo más reciente de este tipo llamado UDM proporciona perfiles empíricos que se pueden importar a IQ-Q-TREE, Phylobayes y RevBayes. Un UDM puede tener miles de perfiles. [ 64 ]
La frecuencia media posterior del sitio (PMSF, 2018) es una aproximación computacionalmente más económica de los modelos de mezcla de perfil empírico. [ 65 ]
Modelos de codones
Los modelos de codones describen la evolución de las secuencias de ácidos nucleicos que codifican proteínas. El modelo de codones más simple, MG, estima un parámetro: la relación de mutaciones no sinónimas/sinónimas. El modelo GY, más complejo, también estima las relaciones de tasas de transición/transversión. Ambos son modelos mecanicistas. Pueden ampliarse mediante la adición de parámetros de tasa. [ 46 ]
Los modelos de codones empíricos describen directamente la probabilidad de que un codón de terminación (61 en el código estándar) sea reemplazado por otro, lo que los asemeja a las matrices de intercambiabilidad de aminoácidos. Por su construcción, están vinculados al código genético presente en los datos utilizados para su elaboración. [ 46 ] También pueden combinarse con un modelo mecanicista multiplicando las dos tasas estimadas, lo que permite incorporar la capacidad de adaptación a los datos procesados. [ 46 ]
El modelo de mecanismo no común (NCM) y la máxima parsimonia
En 1997, Tuffley y Steel [ 66 ] describieron un modelo que denominaron modelo sin mecanismo común (NCM). La topología del árbol de máxima verosimilitud para un conjunto de datos específico, dado el modelo NCM, es idéntica a la topología del árbol óptimo para los mismos datos, dado el criterio de máxima parsimonia . El modelo NCM asume que todos los datos (por ejemplo, nucleótidos homólogos, aminoácidos o caracteres morfológicos) están relacionados por un árbol filogenético común.Se introducen parámetros para cada carácter homólogo, dondees el número de secuencias. Esto puede verse como la estimación de un parámetro de tasa separado para cada par carácter × rama en el conjunto de datos (tenga en cuenta que el número de ramas en un árbol filogenético completamente resuelto es). Por lo tanto, el número de parámetros libres en el modelo NCM siempre excede el número de caracteres homólogos en la matriz de datos, y el modelo NCM ha sido criticado por estar sistemáticamente "sobreparametrizado". [ 67 ]
Aplicaciones
Datos de secuencia
La mayor parte del trabajo sobre modelos de sustitución se ha centrado en la evolución de secuencias de ADN/ ARN y proteínas . Los modelos de evolución de secuencias de ADN, donde el alfabeto corresponde a los cuatro nucleótidos (A, C, G y T), son probablemente los más fáciles de entender. Los modelos de ADN también se pueden usar para examinar la evolución de virus de ARN ; esto refleja el hecho de que el ARN también tiene un alfabeto de cuatro nucleótidos (A, C, G y U). Sin embargo, los modelos de sustitución se pueden usar para alfabetos de cualquier tamaño; el alfabeto son los 20 aminoácidos proteinogénicos para las proteínas y los codones de sentido (es decir, los 61 codones que codifican aminoácidos en el código genético estándar ) para secuencias de genes codificadores de proteínas alineadas. De hecho, se pueden desarrollar modelos de sustitución para cualquier carácter biológico que se pueda codificar usando un alfabeto específico (por ejemplo, secuencias de aminoácidos combinadas con información sobre la conformación de esos aminoácidos en estructuras proteicas tridimensionales [ 68 ] ).
La mayoría de los modelos de sustitución utilizados en la investigación evolutiva asumen independencia entre sitios (es decir, la probabilidad de observar cualquier patrón de sitio específico es idéntica independientemente de su posición en el alineamiento de secuencias). Esto simplifica los cálculos de probabilidad, ya que solo es necesario calcular la probabilidad de todos los patrones de sitio que aparecen en el alineamiento y luego usar esos valores para calcular la probabilidad general del alineamiento (por ejemplo, la probabilidad de tres patrones de sitio "GGGG" dado algún modelo de evolución de secuencias de ADN es simplemente la probabilidad de un solo patrón de sitio "GGGG" elevada a la tercera potencia). Esto significa que los modelos de sustitución pueden considerarse como si implicaran una distribución multinomial específica para las frecuencias de los patrones de sitio. Si consideramos un alineamiento múltiple de cuatro secuencias de ADN, hay 256 patrones de sitio posibles, por lo que hay 255 grados de libertad para las frecuencias de los patrones de sitio. Sin embargo, es posible especificar las frecuencias esperadas del patrón del sitio utilizando cinco grados de libertad si se utiliza el modelo de evolución del ADN de Jukes-Cantor, [ 7 ] que es un modelo de sustitución simple que permite calcular las frecuencias esperadas del patrón del sitio solo la topología del árbol y las longitudes de las ramas (dados cuatro taxones, un árbol bifurcado sin raíz tiene cinco longitudes de rama).
Los modelos de sustitución también permiten simular datos de secuencias mediante métodos de Monte Carlo . Los alineamientos de secuencias múltiples simulados pueden utilizarse para evaluar el rendimiento de los métodos filogenéticos [ 69 ] y generar la distribución nula para ciertas pruebas estadísticas en los campos de la evolución molecular y la filogenética molecular. Ejemplos de estas pruebas incluyen pruebas de ajuste de modelos [ 70 ] y la "prueba SOWH", que puede utilizarse para examinar topologías de árboles. [ 71 ] [ 72 ]
Datos morfológicos
El hecho de que los modelos de sustitución puedan usarse para analizar cualquier alfabeto biológico ha hecho posible desarrollar modelos de evolución para conjuntos de datos fenotípicos [ 73 ] (por ejemplo, rasgos morfológicos y de comportamiento). Normalmente, se usa "0" para indicar la ausencia de un rasgo y "1" para indicar la presencia de un rasgo, aunque también es posible puntuar caracteres usando múltiples estados. Usando este marco, podríamos codificar un conjunto de fenotipos como cadenas binarias (esto podría generalizarse a cadenas de k estados para caracteres con más de dos estados) antes de los análisis usando un modo apropiado. Esto puede ilustrarse usando un ejemplo "juguete": podemos usar un alfabeto binario para puntuar los siguientes rasgos fenotípicos "tiene plumas", "pone huevos", "tiene pelaje", "es de sangre caliente" y "capaz de vuelo propulsado". En este ejemplo simplificado, los colibríes tendrían la secuencia 11011 (la mayoría de las demás aves tendrían la misma cadena), los avestruces la secuencia 11010, el ganado (y la mayoría de los demás mamíferos terrestres ) la secuencia 00110, y los murciélagos la secuencia 00111. La probabilidad de un árbol filogenético se puede calcular utilizando esas secuencias binarias y un modelo de sustitución apropiado. La existencia de estos modelos morfológicos permite analizar matrices de datos con taxones fósiles, ya sea utilizando solo los datos morfológicos [ 74 ] o una combinación de datos morfológicos y moleculares [ 75 ] (considerando estos últimos como datos faltantes para los taxones fósiles).
Existe una similitud evidente entre el uso de datos moleculares o fenotípicos en el campo de la cladística y los análisis de caracteres morfológicos mediante un modelo de sustitución. Sin embargo, ha habido un debate acalorado [ a ] en la comunidad sistemática sobre si los análisis cladísticos deben considerarse "libres de modelos". El campo de la cladística (en su sentido más estricto) favorece el uso del criterio de máxima parsimonia (MP) para la inferencia filogenética. [ 76 ] Muchos cladistas rechazan la postura de que la máxima parsimonia se base en un modelo de sustitución y (en muchos casos) justifican su uso con la filosofía de Karl Popper . [ 77 ] Sin embargo, la existencia de modelos "equivalentes a la parsimonia" [ 78 ] (es decir, modelos de sustitución que generan el árbol de máxima parsimonia al utilizarse en los análisis) permite considerar la parsimonia como un modelo de sustitución. [ 25 ]
Incluso cuando se utiliza la máxima parsimonia para construir un árbol, los modelos de sustitución aún pueden desempeñar un papel en la verificación de la validez estadística del mismo. Un ejemplo es Sun et al. (2018), donde el consenso de regla de mayoría de los árboles MP se anota con probabilidades posteriores bayesianas bajo el modelo Mk. [ 79 ]
Notas
- ↑ Simon, Matt. "Una pelea entre nerds en Twitter revela una larga y extraña disputa científica" . Wired .Este artículo describe la controversia #ParsimonyGate, que ofrece un ejemplo concreto del debate sobre la naturaleza filosófica del criterio de máxima parsimonia. #ParsimonyGate fue la reacción en Twitter a un editorial de la revista Cladistics , publicada por la Sociedad Willi Hennig. El editorial afirma que el paradigma epistemológico de esta revista es la parsimonia y que existen razones filosóficas para preferirla a otros métodos de inferencia filogenética. Dado que otros métodos (como la máxima verosimilitud, la inferencia bayesiana, los invariantes filogenéticos y la mayoría de los métodos de distancia) de inferencia filogenética se basan en modelos, esta afirmación rechaza implícitamente la idea de que la parsimonia sea un modelo.
Referencias
- 1 2 3 Tavaré S. "Algunos problemas probabilísticos y estadísticos en el análisis de secuencias de ADN" (PDF) . Lecciones de matemáticas en las ciencias de la vida . 17 : 57–86 .
- 1 2 Yang Z (2006). Evolución molecular computacional . Oxford: Oxford University Press. ISBN 978-1-4294-5951-8OCLC 99664975
- 1 2 3 Yang Z (julio de 1994). "Estimación del patrón de sustitución de nucleótidos". Journal of Molecular Evolution . 39 (1): 105– 111. Bibcode : 1994JMolE..39..105Y . doi : 10.1007/BF00178256 . PMID 8064867. S2CID 15895455 .
- ↑ Swofford, DL, Olsen, GJ, Waddell, PJ y Hillis, DM (1996) Inferencia filogenética. En: Hillis, DM, Moritz, C. y Mable, BK, Eds., Sistemática molecular, 2.ª edición, Sinauer Associates, Sunderland (MA), 407-514. ISBN 0878932828ISBN 978-0878932825
- ↑ Felsenstein J (2004). Inferir filogenias . Sunderland, Massachusetts: Sinauer Associates. ISBN 0-87893-177-5OCLC 52127769
- ↑ Swofford DL, Bell CD (1997). "(Borrador) Manual PAUP*" . Consultado el 31 de diciembre de 2019 .
- 1 2 3 4 Jukes TH, Cantor CH (1969). "Evolución de las moléculas proteicas". En Munro HN (ed.). Metabolismo de las proteínas en mamíferos . Vol. 3. Elsevier. págs. 21–132 . doi : 10.1016/b978-1-4832-3211-9.50009-7 . ISBN 978-1-4832-3211-9.
- 1 2 3 Felsenstein J (noviembre de 1981). "Árboles evolutivos a partir de secuencias de ADN: un enfoque de máxima verosimilitud". Journal of Molecular Evolution . 17 (6): 368– 376. Bibcode : 1981JMolE..17..368F . doi : 10.1007/BF01734359 . PMID 7288891. S2CID 8024924 .
- 1 2 Kimura M (diciembre de 1980). "Un método simple para estimar las tasas evolutivas de sustituciones de bases a través de estudios comparativos de secuencias de nucleótidos". Journal of Molecular Evolution . 16 (2): 111– 120. Bibcode : 1980JMolE..16..111K . doi : 10.1007/BF01731581 . PMID 7463489 . S2CID 19528200 .
- 1 2 Hasegawa M, Kishino H, Yano T (octubre de 1985). "Datación de la separación entre humanos y simios mediante un reloj molecular de ADN mitocondrial". Journal of Molecular Evolution . 22 (2): 160– 174. Bibcode : 1985JMolE..22..160H . doi : 10.1007/BF02101694 . PMID 3934395. S2CID 25554168 .
- 1 2 3 4 Kimura M (enero de 1981). "Estimación de distancias evolutivas entre secuencias de nucleótidos homólogas" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 78 ( 1): 454– 458. Bibcode : 1981PNAS...78..454K . doi : 10.1073/pnas.78.1.454 . PMC 319072. PMID 6165991 .
- 1 2 Tamura K, Nei M (mayo de 1993). "Estimación del número de sustituciones de nucleótidos en la región de control del ADN mitocondrial en humanos y chimpancés" . Biología molecular y evolución . 10 (3): 512– 526. doi : 10.1093/oxfordjournals.molbev.a040023 . PMID 8336541 .
- 1 2 3 Zharkikh A (septiembre de 1994). "Estimación de distancias evolutivas entre secuencias de nucleótidos". Journal of Molecular Evolution . 39 (3): 315– 329. Bibcode : 1994JMolE..39..315Z . doi : 10.1007/BF00160155 . PMID 7932793. S2CID 33845318 .
- ↑ Huelsenbeck JP, Larget B, Alfaro ME (junio de 2004). "Selección de modelos filogenéticos bayesianos mediante Monte Carlo de cadena de Markov de salto reversible" . Biología molecular y evolución . 21 (6): 1123– 1133. doi : 10.1093/molbev/msh123 . PMID 15034130 .
- ↑ Yap VB, Pachter L (abril de 2004). "Identificación de puntos críticos evolutivos en los genomas de roedores" . Genome Research . 14 (4): 574– 579. doi : 10.1101/gr.1967904 . PMC 383301. PMID 15059998 .
- ↑ Susko E, Roger AJ (septiembre de 2007). "Sobre alfabetos de aminoácidos reducidos para inferencia filogenética" . Biología Molecular y Evolución . 24 (9): 2139– 2150. doi : 10.1093/molbev/msm144 . PMID 17652333 .
- ↑ Arbiza, Leonardo; Patricio, Mateus; Dopazo, Hernán; Posada, David (2011-01-01). "Heterogeneidad a nivel genómico del ajuste del modelo de sustitución de nucleótidos" . Genome Biology and Evolution . 3 : 896–908 . doi : 10.1093/gbe/evr080 . ISSN 1759-6653 . PMC 3175760. PMID 21824869 .
- ↑ Halpern, AL; Bruno, WJ (1998-07-01). "Distancias evolutivas para secuencias codificantes de proteínas: modelado de frecuencias de residuos específicas del sitio" . Biología molecular y evolución . 15 (7): 910– 917. doi : 10.1093/oxfordjournals.molbev.a025995 . ISSN 0737-4038 . PMID 9656490 .
- ↑ Gu X, Li WH (septiembre de 1992). "Tasas más altas de sustitución de aminoácidos en roedores que en humanos" . Molecular Phylogenetics and Evolution . 1 (3): 211– 214. Bibcode : 1992MolPE...1..211G . doi : 10.1016/1055-7903(92)90017-B . PMID 1342937 .
- ↑ Li WH, Ellsworth DL, Krushkal J, Chang BH, Hewett-Emmett D (febrero de 1996). "Tasas de sustitución de nucleótidos en primates y roedores y la hipótesis del efecto del tiempo de generación". Molecular Phylogenetics and Evolution . 5 (1): 182– 187. Bibcode : 1996MolPE...5..182L . doi : 10.1006/mpev.1996.0012 . PMID 8673286 .
- ↑ Martin AP, Palumbi SR (mayo de 1993). "Tamaño corporal, tasa metabólica, tiempo de generación y reloj molecular" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 90 (9): 4087– 4091. Bibcode : 1993PNAS...90.4087M . doi : 10.1073/pnas.90.9.4087 . PMC 46451. PMID 8483925 .
- ↑ Yang Z, Nielsen R (abril de 1998). "Variación de la tasa sinónima y no sinónima en genes nucleares de mamíferos". Journal of Molecular Evolution . 46 (4): 409– 418. Bibcode : 1998JMolE..46..409Y . CiteSeerX 10.1.1.19.7744 . doi : 10.1007/PL00006320 . PMID 9541535. S2CID 13917969 .
- ↑ Kishino H, Thorne JL, Bruno WJ (marzo de 2001). "Rendimiento de un método de estimación del tiempo de divergencia bajo un modelo probabilístico de evolución de la tasa" . Biología Molecular y Evolución . 18 (3): 352–361 . doi : 10.1093/oxfordjournals.molbev.a003811 . PMID 11230536 .
- ↑ Thorne JL, Kishino H, Painter IS (diciembre de 1998). "Estimación de la tasa de evolución de la tasa de evolución molecular" . Biología Molecular y Evolución . 15 (12): 1647– 1657. doi : 10.1093/oxfordjournals.molbev.a025892 . PMID 9866200 .
- 1 2 Steel M, Penny D (junio de 2000). "Parsimonia, verosimilitud y el papel de los modelos en la filogenética molecular" . Biología molecular y evolución . 17 (6): 839– 850. doi : 10.1093/oxfordjournals.molbev.a026364 . PMID 10833190 .
- ↑ Bromham L (mayo de 2019). "Seis cosas imposibles antes del desayuno: supuestos, modelos y creencias en la datación molecular". Trends in Ecology & Evolution . 34 (5): 474– 486. Bibcode : 2019TEcoE..34..474B . doi : 10.1016/j.tree.2019.01.017 . PMID 30904189. S2CID 85496215 .
- ↑ Yang Z, Bielawski JP (diciembre de 2000). " Métodos estadísticos para detectar la adaptación molecular" . Trends in Ecology & Evolution . 15 (12): 496– 503. doi : 10.1016/s0169-5347(00)01994-7 . PMC 7134603. PMID 11114436 .
- ^ Jermín, LS; Jayaswal, V.; Ababneh, F.; Robinson, J. (2008). "Evaluación del modelo filogenético". En Keith, J. (ed.). Bioinformática: datos, análisis de secuencias y evolución . Métodos en biología molecular. vol. 1. Totawa: Humana Press. págs. 65– 91. doi : 10.1007/978-1-60327-159-2_16 . ISBN 978-1-58829-707-5. PMID 18566772 .
- ↑ Ponciano JM, Burleigh JG, Braun EL, Taper ML (diciembre de 2012). "Evaluación de la identificabilidad de parámetros en modelos filogenéticos mediante clonación de datos" . Systematic Biology . 61 (6): 955– 972. doi : 10.1093/sysbio/sys055 . PMC 3478565. PMID 22649181 .
- 1 2 Whelan S, Goldman N (mayo de 2001). "Un modelo empírico general de evolución de proteínas derivado de múltiples familias de proteínas utilizando un enfoque de máxima verosimilitud" . Biología molecular y evolución . 18 (5): 691– 699. doi : 10.1093/oxfordjournals.molbev.a003851 . PMID 11319253 .
- ↑ Braun EL (julio de 2018). " Un modelo evolutivo motivado por las propiedades fisicoquímicas de los aminoácidos revela variación entre proteínas" . Bioinformatics . 34 (13): i350– i356. doi : 10.1093/bioinformatics/bty261 . PMC 6022633. PMID 29950007 .
- ↑ Goldman N, Whelan S (noviembre de 2002). "Un uso novedoso de las frecuencias de equilibrio en modelos de evolución de secuencias" . Biología Molecular y Evolución . 19 (11): 1821– 1831. doi : 10.1093/oxfordjournals.molbev.a004007 . PMID 12411592 .
- ↑ Kosiol C, Holmes I, Goldman N (julio de 2007). "Un modelo de codón empírico para la evolución de la secuencia de proteínas" . Biología molecular y evolución . 24 (7): 1464– 1479. doi : 10.1093/molbev/msm064 . PMID 17400572 .
- ↑ Tamura K (julio de 1992). "Estimación del número de sustituciones de nucleótidos cuando existen fuertes sesgos de transición-transversión y contenido de G+C" . Biología Molecular y Evolución . 9 (4): 678– 687. doi : 10.1093/oxfordjournals.molbev.a040752 . PMID 1630306 .
- ↑ Halpern AL, Bruno WJ (julio de 1998). "Distancias evolutivas para secuencias codificantes de proteínas: modelado de frecuencias de residuos específicas del sitio" . Biología molecular y evolución . 15 (7): 910–917 . doi : 10.1093/oxfordjournals.molbev.a025995 . PMID 9656490. S2CID 7332698 .
- 1 2 Braun EL, Kimball RT (agosto de 2002). Kjer K (ed.). "Examinando las divergencias aviares basales con secuencias mitocondriales: complejidad del modelo, muestreo de taxones y longitud de la secuencia" . Systematic Biology . 51 (4): 614– 625. doi : 10.1080/10635150290102294 . PMID 12228003 .
- ↑ Phillips MJ, Delsuc F, Penny D (julio de 2004). "Filogenia a escala genómica y detección de sesgos sistemáticos" . Biología molecular y evolución . 21 (7): 1455– 1458. doi : 10.1093/molbev/msh137 . PMID 15084674 .
- ↑ Ishikawa SA, Inagaki Y, Hashimoto T (enero de 2012). "Los modelos de codificación RY y no homogéneos pueden mejorar las inferencias de máxima verosimilitud a partir de datos de secuencias de nucleótidos con heterogeneidad composicional paralela" . Evolutionary Bioinformatics Online . 8 EBO.S9017: 357–371 . doi : 10.4137/EBO.S9017 . PMC 3394461. PMID 22798721 .
- ↑ Simmons MP, Ochoterena H (junio de 2000). "Las brechas como caracteres en los análisis filogenéticos basados en secuencias" . Systematic Biology . 49 (2): 369–381 . doi : 10.1093/sysbio/49.2.369 . PMID 12118412 .
- ↑ Yuri T, Kimball RT, Harshman J, Bowie RC, Braun MJ, Chojnowski JL, et al. (marzo de 2013). " Análisis de parsimonia y basados en modelos de inserciones/deleciones en genes nucleares aviares revelan señales filogenéticas congruentes e incongruentes" . Biology . 2 (1): 419– 444. doi : 10.3390/biology2010419 . PMC 4009869. PMID 24832669 .
- ↑ Houde P, Braun EL, Narula N, Minjares U, Mirarab S (2019-07-06). "Señal filogenética de inserciones/deleciones y la radiación neoaviana" . Diversity . 11 (7): 108. Bibcode : 2019Diver..11..108H . doi : 10.3390/d11070108 .
- ↑ Cavender JA (agosto de 1978). "Taxonomía con confianza". Mathematical Biosciences . 40 ( 3–4 ): 271–280 . doi : 10.1016/0025-5564(78)90089-5 .
- ↑ Farris JS (1973-09-01). "Un modelo de probabilidad para inferir árboles evolutivos" . Systematic Biology . 22 (3): 250– 256. doi : 10.1093/sysbio/22.3.250 . ISSN 1063-5157 .
- ↑ Neyman J (1971). Gupta SS, Yackel J (eds.). Estudios moleculares de la evolución: una fuente de nuevos problemas estadísticos . Nueva York, NY, EE. UU.: New York Academic Press. págs. 1–27 .
- ↑ Waddell PJ, Penny D, Moore T (agosto de 1997). "Conjugaciones de Hadamard y modelado de la evolución de secuencias con tasas desiguales entre sitios". Molecular Phylogenetics and Evolution . 8 (1): 33– 50. Bibcode : 1997MolPE...8...33W . doi : 10.1006/mpev.1997.0405 . PMID 9242594 .
- 1 2 3 4 5 "Modelos de sustitución :: Modelos de mezcla de proteínas" . iqtree-github.io .
- ↑ Dayhoff MO, Eck RV, Park CM (1969). "Un modelo de cambio evolutivo en proteínas" . En Dayhoff MO (ed.). Atlas de secuencia y estructura de proteínas . Vol. 4. pp. 75–84 .
- ↑ Dayhoff MO, Schwartz RM, Orcutt BC (1978). "Un modelo de cambio evolutivo en proteínas" (PDF) . En Dayhoff MO (ed.). Atlas de secuencia y estructura de proteínas . Vol. 5. págs. 345–352 .
- ↑ Henikoff S, Henikoff JG (noviembre de 1992). "Matrices de sustitución de aminoácidos a partir de bloques de proteínas" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 89 (22): 10915– 10919. Bibcode : 1992PNAS...8910915H . doi : 10.1073 / pnas.89.22.10915 . PMC 50453. PMID 1438297 .
- ↑ Altschul SF (marzo de 1993). " Un sistema de puntuación de alineación de proteínas sensible a todas las distancias evolutivas". Journal of Molecular Evolution . 36 (3): 290– 300. Bibcode : 1993JMolE..36..290A . doi : 10.1007/BF00160485 . PMID 8483166. S2CID 22532856 .
- ↑ Kishino H, Miyata T, Hasegawa M (agosto de 1990). "Inferencia de máxima verosimilitud de la filogenia de proteínas y el origen de los cloroplastos". Journal of Molecular Evolution . 31 (2): 151– 160. Bibcode : 1990JMolE..31..151K . doi : 10.1007/BF02109483 . S2CID 24650412 .
- ↑ Kosiol C, Goldman N (febrero de 2005). "Diferentes versiones de la matriz de tasas de Dayhoff" . Biología molecular y evolución . 22 (2): 193–199 . doi : 10.1093/molbev/msi005 . PMID 15483331 .
- ↑ Keane TM, Creevey CJ, Pentony MM, Naughton TJ, Mclnerney JO (marzo de 2006). "La evaluación de los métodos para la selección de matrices de aminoácidos y su uso en datos empíricos muestra que las suposiciones ad hoc para la elección de la matriz no están justificadas" . BMC Evolutionary Biology . 6 (1) 29. Bibcode : 2006BMCEE...6...29K . doi : 10.1186/1471-2148-6-29 . PMC 1435933. PMID 16563161 .
- ↑ Bigot T, Guglielmini J, Criscuolo A (agosto de 2019). "Datos de simulación para la estimación de constantes numéricas para aproximar distancias evolutivas por pares entre secuencias de aminoácidos" . Data in Brief . 25 104212. Bibcode : 2019DIB....2504212B . doi : 10.1016/j.dib.2019.104212 . PMC 6699465. PMID 31440543 .
- ↑ Gonnet GH, Cohen MA, Benner SA (junio de 1992). "Coincidencia exhaustiva de toda la base de datos de secuencias de proteínas". Science . 256 (5062): 1443– 1445. Bibcode : 1992Sci...256.1443G . doi : 10.1126/science.1604319 . PMID 1604319 .
- ↑ Jones DT, Taylor WR, Thornton JM (junio de 1992). "Generación rápida de matrices de datos de mutación a partir de secuencias de proteínas". Computer Applications in the Biosciences . 8 (3): 275– 282. doi : 10.1093/bioinformatics/8.3.275 . PMID 1633570 .
- ↑ Le SQ, Gascuel O (julio de 2008). "Una matriz de reemplazo de aminoácidos general mejorada" . Biología molecular y evolución . 25 (7): 1307– 1320. doi : 10.1093/molbev/msn067 . PMID 18367465 .
- ↑ Müller T, Vingron M (diciembre de 2000). "Modelado del reemplazo de aminoácidos". Journal of Computational Biology . 7 (6): 761– 776. doi : 10.1089/10665270050514918 . PMID 11382360 .
- ↑ Veerassamy S, Smith A, Tillier ER (diciembre de 2003). "Un modelo de probabilidad de transición para sustituciones de aminoácidos a partir de bloques". Journal of Computational Biology . 10 (6): 997– 1010. doi : 10.1089/106652703322756195 . PMID 14980022 .
- ↑ Minh, Bui Quang; Dang, Cuong Cao; Vinh, Le Sy; Lanfear, Robert (11 de agosto de 2021). "QMaker: Método rápido y preciso para estimar modelos empíricos de evolución de proteínas" . Systematic Biology . 70 (5): 1046– 1060. doi : 10.1093/sysbio/syab010 . PMC 8357343. PMID 33616668 .
- 1 2 Dang, Cuong Cao; Minh, Bui Quang; McShea, Hanon; Masel, Joanna; James, Jennifer Eleanor; Vinh, Le Sy; Lanfear, Robert (9 de febrero de 2022). "nQMaker: Estimación de modelos de sustitución de aminoácidos irreversibles en el tiempo" . Systematic Biology . 71 (5): 1110– 1123. doi : 10.1093/sysbio/syac007 . PMC 9366462. PMID 35139203 .
- ↑ Iglesias-Rivas, Paula; Del Amparo, Roberto; Cabaleiro, Javier A; Arenas, Miguel (2025-01-18). "Modelos de sustitución empírica de la evolución de proteínas: base de datos, relaciones y consideraciones de modelado" . Database . 2025 baaf052 . doi : 10.1093/database/baaf052 . ISSN 1758-0463 . PMC 12462380. PMID 40996708 .
- ↑ " ATGC: CAT" . www.atgc-montpellier.fr
- ↑ Schrempf, Dominik; Lartillot, Nicolas; Szöllősi, Gergely (16 de diciembre de 2020). "Modelos de mezcla empíricos escalables que tienen en cuenta la heterogeneidad composicional entre sitios" . Biología molecular y evolución . 37 (12): 3616– 3631. doi : 10.1093/molbev/msaa145 . PMC 7743758. PMID 32877529 .
- ↑ Wang, Huai-Chun; Minh, Bui Quang; Susko, Edward; Roger, Andrew J (1 de marzo de 2018). "Modelado de la heterogeneidad de sitios con perfiles de frecuencia media de sitios posteriores acelera la estimación filogenómica precisa". Systematic Biology . 67 (2): 216– 235. doi : 10.1093/sysbio/syx068 . PMID 28950365 .
- ↑ Tuffley C, Steel M (mayo de 1997). "Vínculos entre máxima verosimilitud y máxima parsimonia bajo un modelo simple de sustitución de sitios". Bulletin of Mathematical Biology . 59 (3): 581– 607. doi : 10.1007/bf02459467 . PMID 9172826. S2CID 189885872 .
- ↑ Holder MT, Lewis PO, Swofford DL (julio de 2010). "El criterio de información de Akaike no elegirá el modelo sin mecanismo común" . Systematic Biology . 59 (4): 477– 485. doi : 10.1093/sysbio/syq028 . hdl : 1808/9209 . PMID 20547783.
Un buen modelo para la inferencia filogenética debe ser lo suficientemente rico como para manejar las fuentes de ruido en los datos, pero la estimación de ML realizada utilizando modelos que están claramente sobreparametrizados puede llevar a conclusiones drásticamente erróneas. El modelo NCM ciertamente cae en el ámbito de ser demasiado rico en parámetros para servir como justificación del uso de la parsimonia basada en que sea un estimador de ML bajo un modelo general.
- ↑ Perron U, Kozlov AM, Stamatakis A, Goldman N, Moal IH (septiembre de 2019). Pupko T (ed.). "Modelado de restricciones estructurales en la evolución de proteínas a través de estados conformacionales de cadenas laterales" . Biología molecular y evolución . 36 (9): 2086–2103 . doi : 10.1093/molbev/ msz122 . PMC 6736381. PMID 31114882 .
- ↑ Huelsenbeck JP, Hillis DM (1993-09-01). "Éxito de los métodos filogenéticos en el caso de cuatro taxones" . Systematic Biology . 42 (3): 247– 264. doi : 10.1093/sysbio/42.3.247 . ISSN 1063-5157 .
- ↑ Goldman N (febrero de 1993). "Pruebas estadísticas de modelos de sustitución de ADN". Journal of Molecular Evolution . 36 (2): 182– 198. Bibcode : 1993JMolE..36..182G . doi : 10.1007/BF00166252 . PMID 7679448. S2CID 29354147 .
- ↑ Swofford DL Olsen GJ Waddell PJ Hillis DM 1996. "Inferencia filogenética." en Sistemática molecular (ed. Hillis DM Moritz C. Mable BK) 2.ª ed. Sunderland, MA: Sinauer. págs. 407–514. ISBN 978-0878932825
- ↑ Church SH, Ryan JF, Dunn CW (noviembre de 2015). " Automatización y evaluación de la prueba SOWH con SOWHAT" . Systematic Biology . 64 (6): 1048– 1058. doi : 10.1093/sysbio/syv055 . PMC 4604836. PMID 26231182 .
- ↑ Lewis PO (2001-11-01). "Un enfoque de probabilidad para estimar la filogenia a partir de datos de caracteres morfológicos discretos" . Systematic Biology . 50 (6): 913– 925. doi : 10.1080/106351501753462876 . PMID 12116640 .
- ↑ Lee MS, Cau A, Naish D, Dyke GJ (mayo de 2014). "Relojes morfológicos en paleontología y un origen del Cretácico medio de las Aves coronas" . Systematic Biology . 63 (3): 442– 449. doi : 10.1093/sysbio/syt110 . PMID 24449041 .
- ↑ Ronquist F, Klopfstein S, Vilhelmsen L, Schulmeister S, Murray DL, Rasnitsyn AP (diciembre de 2012). "Un enfoque de evidencia total para la datación con fósiles, aplicado a la radiación temprana de los himenópteros" . Systematic Biology . 61 (6): 973– 999. doi : 10.1093/sysbio/ sys058 . PMC 3478566. PMID 22723471 .
- ↑ Brower, A. V. Z. (2016). "¿Somos todos cladistas?" en Williams, D., Schmitt, M., & Wheeler, Q. (Eds.). El futuro de la sistemática filogenética: El legado de Willi Hennig (Serie de volúmenes especiales de la Asociación de Sistemática, Libro 86). Cambridge University Press. pp. 88-114 ISBN 978-1107117648
- ↑ Farris JS, Kluge AG, Carpenter JM (junio de 2001). Olmstead R (ed.). "Popper y probabilidad versus "Popper"" . Biología Sistemática . 50 (3): 438– 444. doi : 10.1080/10635150119150 . PMID 12116585 .
- ↑ Goldman, Nick (diciembre de 1990). "Inferencia de máxima verosimilitud de árboles filogenéticos, con especial referencia a un modelo de proceso de Poisson de sustitución de ADN y a análisis de parsimonia" . Systematic Zoology . 39 (4): 345–361 . doi : 10.2307/2992355 . JSTOR 2992355 .
- ↑ Sun, Haijing; Smith, Martin R.; Zeng, Han; Zhao, Fangchen; Li, Guoxiang; Zhu, Maoyan (26 de septiembre de 2018). "Los hiolitos con pedículos iluminan el origen del plan corporal de los braquiópodos" . Proceedings of the Royal Society B: Biological Sciences . 285 (1887) 20181780. doi : 10.1098/rspb.2018.1780 . PMC 6170810. PMID 30257914 . Página de datos complementarios relevantes
Enlaces externos
- Modelos empíricos de sustitución de aminoácidos
- Bioinformática
- Modelos estocásticos
- Filogenética computacional
- Genética estadística