Articulo de referencia

Filogenética computacional

La filogenética computacional , la inferencia filogenética o la inferencia filogenética se centra en algoritmos computacionales y de optimización , heurísticas y enfoques involu...

La filogenética computacional , la inferencia filogenética o la inferencia filogenética se centra en algoritmos computacionales y de optimización , heurísticas y enfoques involucrados en análisis filogenéticos . El objetivo es encontrar un árbol filogenético que represente la ascendencia evolutiva óptima entre un conjunto de genes , especies o taxones . La máxima verosimilitud , la parsimonia , el enfoque bayesiano y la evolución mínima son criterios de optimización típicos utilizados para evaluar qué tan bien la topología de un árbol filogenético describe los datos de secuencia. [ 1 ] [ 2 ] El Intercambio del Vecino Más Cercano (NNI), la Poda y Reinjerto de Subárboles (SPR) y la Bisección y Reconexión de Árboles (TBR), conocidos como reordenamientos de árboles , son algoritmos deterministas para buscar el árbol filogenético óptimo o el mejor. El espacio y el paisaje de búsqueda del árbol filogenético óptimo se conoce como espacio de búsqueda filogenética.

El criterio de optimización de máxima verosimilitud (también verosimilitud) es el proceso de encontrar la topología del árbol junto con las longitudes de sus ramas que proporciona la mayor probabilidad al observar los datos de secuencia, mientras que el criterio de optimización de parsimonia es el menor número de cambios evolutivos de estado necesarios para que un árbol filogenético explique los datos de secuencia. [ 1 ] [ 2 ]

La filogenética tradicional se basa en datos morfológicos obtenidos mediante la medición y cuantificación de las propiedades fenotípicas de organismos representativos, mientras que el campo más reciente de la filogenética molecular utiliza secuencias de nucleótidos que codifican genes o secuencias de aminoácidos que codifican proteínas como base para la clasificación.

Muchas formas de filogenética molecular están estrechamente relacionadas con la alineación de secuencias y la utilizan ampliamente para construir y refinar árboles filogenéticos, los cuales se emplean para clasificar las relaciones evolutivas entre genes homólogos presentes en los genomas de especies divergentes. Es improbable que los árboles filogenéticos construidos mediante métodos computacionales reproduzcan a la perfección el árbol evolutivo que representa las relaciones históricas entre las especies analizadas. El árbol filogenético histórico de las especies también puede diferir del árbol histórico de un gen homólogo individual compartido por dichas especies.

Tipos de árboles y redes filogenéticas

Los árboles filogenéticos pueden ser enraizados o no enraizados , dependiendo de los datos de entrada y del algoritmo utilizado. Un árbol enraizado es un grafo dirigido que identifica explícitamente un ancestro común más reciente (ACMR), generalmente una secuencia de entrada que no está representada en los datos de entrada. Se pueden usar medidas de distancia genética para trazar un árbol con las secuencias de entrada como nodos hoja y sus distancias a la raíz proporcionales a su distancia genética al ACMR hipotético. La identificación de una raíz generalmente requiere la inclusión en los datos de entrada de al menos un grupo externo conocido por estar solo lejanamente relacionado con las secuencias de interés.

Por el contrario, los árboles sin raíz representan las distancias y relaciones entre las secuencias de entrada sin hacer suposiciones sobre su descendencia. Siempre se puede generar un árbol sin raíz a partir de un árbol con raíz, pero normalmente no se puede colocar una raíz en un árbol sin raíz sin datos adicionales sobre las tasas de divergencia, como la hipótesis del reloj molecular . [ 3 ]

El conjunto de todos los árboles filogenéticos posibles para un grupo dado de secuencias de entrada puede conceptualizarse como un espacio de árboles multidimensional definido discretamente a través del cual los algoritmos de optimización pueden trazar rutas de búsqueda . Si bien contar el número total de árboles para un número no trivial de secuencias de entrada puede complicarse por variaciones en la definición de una topología de árbol, siempre es cierto que hay más árboles enraizados que no enraizados para un número dado de entradas y una elección de parámetros. [ 2 ]

Tanto los árboles filogenéticos enraizados como los no enraizados pueden generalizarse aún más a redes filogenéticas enraizadas o no enraizadas , que permiten modelar fenómenos evolutivos como la hibridación o la transferencia horizontal de genes .

Caracteres de codificación y definición de homología

Análisis morfológico

El problema fundamental en la filogenética morfológica es la construcción de una matriz que represente una correspondencia entre cada uno de los taxones comparados y las mediciones representativas de cada una de las características fenotípicas utilizadas como clasificador. Los tipos de datos fenotípicos empleados para construir esta matriz dependen de los taxones comparados; para especies individuales, pueden incluir mediciones del tamaño corporal promedio, longitudes o tamaños de huesos específicos u otras características físicas, o incluso manifestaciones conductuales. Por supuesto, dado que no todas las características fenotípicas posibles pueden medirse y codificarse para su análisis, la selección de las características a medir constituye un importante obstáculo inherente al método. La decisión de qué rasgos utilizar como base para la matriz representa necesariamente una hipótesis sobre qué rasgos de una especie o taxón superior son evolutivamente relevantes. [ 4 ] Los estudios morfológicos pueden verse afectados por ejemplos de evolución convergente de fenotipos. [ 5 ] Un desafío importante en la construcción de clases útiles es la alta probabilidad de solapamiento entre taxones en la distribución de la variación del fenotipo. La inclusión de taxones extintos en el análisis morfológico suele ser difícil debido a la ausencia o la incompletitud de los registros fósiles , pero se ha demostrado que tiene un efecto significativo en los árboles resultantes; en un estudio, solo la inclusión de especies extintas de simios produjo un árbol derivado morfológicamente que coincidía con el obtenido a partir de datos moleculares. [ 6 ]

Algunas clasificaciones fenotípicas, en particular las utilizadas para analizar grupos taxonómicos muy diversos, son discretas e inequívocas; clasificar organismos según posean o carezcan de cola, por ejemplo, es sencillo en la mayoría de los casos, al igual que contar características como ojos o vértebras. Sin embargo, la representación más adecuada de mediciones fenotípicas que varían continuamente es un problema controvertido sin una solución general. Un método común consiste simplemente en clasificar las mediciones de interés en dos o más clases, lo que permite clasificar discretamente la variación observada de forma continua (por ejemplo, todos los ejemplos con huesos del húmero más largos que un umbral determinado se clasifican como miembros de un estado, y todos los miembros cuyos huesos del húmero son más cortos que dicho umbral se clasifican como miembros de un segundo estado). Esto da como resultado un conjunto de datos fácilmente manipulable , pero ha sido criticado por la deficiente descripción de la base de las definiciones de clase y por la pérdida de información en comparación con los métodos que utilizan una distribución ponderada continua de las mediciones. [ 7 ]

Debido a que la recopilación de datos morfológicos es extremadamente laboriosa, ya sea a partir de fuentes bibliográficas o de observaciones de campo, la reutilización de matrices de datos previamente compiladas no es infrecuente, aunque esto puede propagar fallas en la matriz original a múltiples análisis derivados. [ 8 ]

Análisis molecular

El problema de la codificación de caracteres es muy diferente en los análisis moleculares, ya que los caracteres en los datos de secuencias biológicas están definidos de forma inmediata y discreta: nucleótidos distintos en secuencias de ADN o ARN y aminoácidos distintos en secuencias de proteínas . Sin embargo, definir la homología puede ser un desafío debido a las dificultades inherentes al alineamiento múltiple de secuencias (AMS). Para un AMS con huecos, se pueden construir varios árboles filogenéticos enraizados que difieren en sus interpretaciones sobre qué cambios son mutaciones frente a caracteres ancestrales, y qué eventos son mutaciones de inserción o deleción . Por ejemplo, con solo un alineamiento por pares con una región de huecos, es imposible determinar si una secuencia presenta una mutación de inserción o la otra una deleción. El problema se magnifica en los AMS con huecos no alineados y no superpuestos. En la práctica, se pueden descartar regiones considerables de un alineamiento calculado en la construcción del árbol filogenético para evitar integrar datos ruidosos en el cálculo del árbol.

filogenia multigénica

Un árbol construido a partir de un solo gen presente en diferentes organismos ( ortólogos ) puede no mostrar suficiente señal filogenética para extraer conclusiones sólidas. Añadir más genes concatenando sus respectivas alineaciones de secuencias múltiples en una "supermatriz" crea, en efecto, un enorme gen virtual con más cambios evolutivos disponibles para la inferencia del árbol. Este método ingenuo solo funciona bien con genes con historias evolutivas similares; para casos más complejos (conjuntos de datos organelares y nucleares o alineaciones conjuntas de aminoácidos y nucleótidos), algunos algoritmos permiten determinar dónde comienza y termina cada gen (particionamiento de datos). Alternativamente, se pueden inferir varios árboles de un solo gen y combinarlos en un superárbol. Con el advenimiento de la filogenómica , se pueden analizar cientos de genes a la vez. [ 9 ]

Métodos de matriz de distancias

Los métodos de matriz de distancias para el análisis filogenético se basan explícitamente en una medida de "distancia genética" entre las secuencias que se clasifican y, por lo tanto, requieren un alineamiento múltiple de secuencias (AMS) como entrada. La distancia se define a menudo como la fracción de desajustes en las posiciones alineadas, donde los huecos se ignoran o se cuentan como desajustes. [ 3 ] Los métodos de distancia intentan construir una matriz de todos a todos a partir del conjunto de secuencias de consulta que describe la distancia entre cada par de secuencias. A partir de esto, se construye un árbol filogenético que coloca secuencias estrechamente relacionadas bajo el mismo nodo interno y cuyas longitudes de rama reproducen fielmente las distancias observadas entre las secuencias. Los métodos de matriz de distancias pueden producir árboles enraizados o no enraizados, dependiendo del algoritmo utilizado para calcularlos. Se utilizan frecuentemente como base para tipos progresivos e iterativos de alineamientos múltiples de secuencias . La principal desventaja de los métodos de matriz de distancias es su incapacidad para utilizar eficientemente la información sobre regiones locales de alta variación que aparecen en múltiples subárboles. [ 2 ]

UPGMA y WPGMA

Los métodos UPGMA ( Método de grupo de pares no ponderados con media aritmética ) y WPGMA ( Método de grupo de pares ponderados con media aritmética ) producen árboles enraizados y requieren una suposición de tasa constante; es decir, asumen un árbol ultramétrico en el que las distancias desde la raíz hasta la punta de cada rama son iguales . [ 10 ]

Unión de vecinos

Los métodos de unión de vecinos aplican técnicas generales de análisis de clústeres al análisis de secuencias utilizando la distancia genética como métrica de agrupamiento. El método simple de unión de vecinos produce árboles sin raíz, pero no asume una tasa constante de evolución (es decir, un reloj molecular ) a través de los linajes. [ 11 ]

Método de Fitch-Margoliash

El método Fitch-Margoliash utiliza un método de mínimos cuadrados ponderados para la agrupación basada en la distancia genética. [ 12 ] Las secuencias estrechamente relacionadas reciben mayor peso en el proceso de construcción del árbol para corregir la mayor imprecisión en la medición de distancias entre secuencias distantemente relacionadas. Las distancias utilizadas como entrada al algoritmo deben normalizarse para evitar grandes artefactos en el cálculo de relaciones entre grupos estrechamente relacionados y distantemente relacionados. Las distancias calculadas por este método deben ser lineales ; el criterio de linealidad para distancias requiere que los valores esperados de las longitudes de rama para dos ramas individuales deben ser iguales al valor esperado de la suma de las distancias de las dos ramas, una propiedad que se aplica a las secuencias biológicas solo cuando se han corregido para la posibilidad de mutaciones inversas en sitios individuales. Esta corrección se realiza mediante el uso de una matriz de sustitución como la derivada del modelo de Jukes-Cantor de evolución del ADN. La corrección de distancia solo es necesaria en la práctica cuando las tasas de evolución difieren entre ramas. [ 2 ] Otra modificación del algoritmo puede ser útil, especialmente en el caso de distancias concentradas (consulte el fenómeno de concentración de medidas y la maldición de la dimensionalidad ): se ha demostrado que esa modificación, descrita en [ 13 ] , mejora la eficiencia del algoritmo y su robustez.

El criterio de mínimos cuadrados aplicado a estas distancias es más preciso pero menos eficiente que los métodos de unión de vecinos. También se puede aplicar una mejora adicional que corrija las correlaciones entre distancias que surgen de muchas secuencias estrechamente relacionadas en el conjunto de datos, aunque con un mayor costo computacional. Encontrar el árbol óptimo de mínimos cuadrados con cualquier factor de corrección es NP-completo , [ 14 ] por lo que se aplican métodos de búsqueda heurísticos , como los utilizados en el análisis de máxima parsimonia, para la búsqueda en el espacio de árboles.

Utilizar grupos externos

La información independiente sobre la relación entre secuencias o grupos puede utilizarse para ayudar a reducir el espacio de búsqueda del árbol y enraizar árboles sin raíz. El uso estándar de los métodos de matriz de distancias implica la inclusión de al menos una secuencia de grupo externo que se sabe que está solo distantemente relacionada con las secuencias de interés en el conjunto de consulta. [ 3 ] Este uso puede considerarse un tipo de control experimental . Si el grupo externo se ha elegido adecuadamente, tendrá una distancia genética mucho mayor y, por lo tanto, una longitud de rama más larga que cualquier otra secuencia, y aparecerá cerca de la raíz de un árbol enraizado. Elegir un grupo externo apropiado requiere la selección de una secuencia que esté moderadamente relacionada con las secuencias de interés; una relación demasiado cercana anula el propósito del grupo externo y una demasiado distante añade ruido al análisis. [ 3 ] También se debe tener cuidado para evitar situaciones en las que las especies de las que se tomaron las secuencias estén distantemente relacionadas, pero el gen codificado por las secuencias esté altamente conservado a través de los linajes. La transferencia horizontal de genes , especialmente entre bacterias que de otro modo serían divergentes , también puede confundir el uso del grupo externo.

Máxima parsimonia

La máxima parsimonia (MP) es un método para identificar el árbol filogenético potencial que requiere el menor número total de eventos evolutivos para explicar los datos de secuencia observados. Algunos métodos de puntuación de árboles también incluyen un "costo" asociado a tipos específicos de eventos evolutivos e intentan localizar el árbol con el menor costo total. Este enfoque resulta útil en casos donde no todos los tipos de eventos posibles son igualmente probables; por ejemplo, cuando se sabe que ciertos nucleótidos o aminoácidos son más mutables que otros.

La forma más ingenua de identificar el árbol más parsimonioso es la enumeración simple: considerar cada árbol posible sucesivamente y buscar el árbol con la puntuación más pequeña. Sin embargo, esto solo es posible para un número relativamente pequeño de secuencias o especies porque se sabe que el problema de identificar el árbol más parsimonioso es NP-difícil ; [ 2 ] en consecuencia, se han desarrollado varios métodos de búsqueda heurística para la optimización con el fin de localizar un árbol altamente parsimonioso, si no el mejor del conjunto. La mayoría de estos métodos implican un mecanismo de minimización al estilo del descenso más pronunciado que opera sobre un criterio de reordenamiento del árbol .

Ramificar y enlazar

El algoritmo de ramificación y acotación es un método general utilizado para aumentar la eficiencia de las búsquedas de soluciones casi óptimas de problemas NP-difíciles, aplicado por primera vez a la filogenética a principios de la década de 1980. [ 15 ] La ramificación y acotación es particularmente adecuada para la construcción de árboles filogenéticos porque inherentemente requiere dividir un problema en una estructura de árbol al subdividir el espacio del problema en regiones más pequeñas. Como su nombre lo indica, requiere como entrada tanto una regla de ramificación (en el caso de la filogenética, la adición de la siguiente especie o secuencia al árbol) como una cota (una regla que excluye ciertas regiones del espacio de búsqueda de la consideración, asumiendo así que la solución óptima no puede ocupar esa región). Identificar una buena cota es el aspecto más desafiante de la aplicación del algoritmo a la filogenética. Una forma simple de definir la cota es un número máximo de cambios evolutivos asumidos permitidos por árbol. Un conjunto de criterios conocidos como reglas de Zharkikh [ 16 ] limita severamente el espacio de búsqueda al definir características compartidas por todos los árboles candidatos "más parsimoniosos". Las dos reglas más básicas exigen la eliminación de todas las secuencias redundantes excepto una (en los casos en que múltiples observaciones hayan producido datos idénticos) y la eliminación de los sitios de caracteres en los que no se presenten dos o más estados en al menos dos especies. En condiciones ideales, estas reglas y su algoritmo asociado definirían completamente un árbol filogenético.

Algoritmo de Sankoff-Morel-Cedergren

El algoritmo de Sankoff-Morel-Cedergren fue uno de los primeros métodos publicados para producir simultáneamente un MSA y un árbol filogenético para secuencias de nucleótidos. [ 17 ] El método utiliza un cálculo de máxima parsimonia junto con una función de puntuación que penaliza los huecos y las discrepancias, favoreciendo así el árbol que introduce un número mínimo de tales eventos (una visión alternativa sostiene que los árboles que deben favorecerse son aquellos que maximizan la cantidad de similitud de secuencia que puede interpretarse como homología, un punto de vista que puede conducir a diferentes árboles óptimos [ 18 ] ). Las secuencias imputadas en los nodos internos del árbol se puntúan y se suman en todos los nodos de cada árbol posible. La suma del árbol con la puntuación más baja proporciona tanto un árbol óptimo como un MSA óptimo dada la función de puntuación. Debido a que el método es altamente intensivo computacionalmente, existe un método aproximado en el que las estimaciones iniciales para los alineamientos internos se refinan nodo por nodo. Tanto la versión completa como la aproximada se calculan en la práctica mediante programación dinámica. [ 2 ]

MALIGNO y POY

Los métodos más recientes de árboles filogenéticos/MSA utilizan heurísticas para aislar árboles con puntuaciones altas, pero no necesariamente óptimos. El método MALIGN utiliza una técnica de máxima parsimonia para calcular un alineamiento múltiple maximizando la puntuación de un cladograma , y ​​su método complementario POY utiliza un método iterativo que combina la optimización del árbol filogenético con mejoras en el MSA correspondiente. [ 19 ] Sin embargo, el uso de estos métodos en la construcción de hipótesis evolutivas ha sido criticado por estar sesgado debido a la construcción deliberada de árboles que reflejan eventos evolutivos mínimos. [ 20 ] Esto, a su vez, ha sido rebatido por la visión de que tales métodos deben considerarse enfoques heurísticos para encontrar los árboles que maximizan la cantidad de similitud de secuencia que puede interpretarse como homología. [ 18 ] [ 21 ]

Máxima probabilidad

El método de máxima verosimilitud utiliza técnicas estadísticas estándar para inferir distribuciones de probabilidad y asignar probabilidades a posibles árboles filogenéticos. Este método requiere un modelo de sustitución para evaluar la probabilidad de mutaciones específicas ; en términos generales, un árbol que requiere más mutaciones en nodos internos para explicar la filogenia observada se evaluará con una probabilidad menor. Esto es similar al método de máxima parsimonia, pero la máxima verosimilitud permite una mayor flexibilidad estadística al permitir tasas de evolución variables tanto en linajes como en sitios. De hecho, el método requiere que la evolución en diferentes sitios y a lo largo de diferentes linajes sea estadísticamente independiente . Por lo tanto, la máxima verosimilitud es adecuada para el análisis de secuencias distantemente relacionadas, pero se considera computacionalmente intratable debido a su complejidad NP. [ 22 ]

El algoritmo de poda, una variante de la programación dinámica , se utiliza a menudo para reducir el espacio de búsqueda calculando eficientemente la probabilidad de los subárboles. [ 2 ] El método calcula la probabilidad para cada sitio de forma lineal, comenzando en un nodo cuyos únicos descendientes son hojas (es decir, las puntas del árbol) y retrocediendo hacia el nodo inferior en conjuntos anidados. Sin embargo, los árboles producidos por el método solo se enraízan si el modelo de sustitución es irreversible, lo cual no suele ser cierto en los sistemas biológicos. La búsqueda del árbol de máxima verosimilitud también incluye un componente de optimización de la longitud de las ramas que es difícil de mejorar algorítmicamente; a menudo se utilizan herramientas de optimización global generales como el método de Newton-Raphson .

Algunas herramientas que utilizan la máxima verosimilitud para inferir árboles filogenéticos a partir de datos de frecuencia alélica de variantes (VAF) incluyen AncesTree y CITUP. [ 23 ] [ 24 ]

Inferencia bayesiana

La inferencia bayesiana puede utilizarse para generar árboles filogenéticos de forma muy similar a los métodos de máxima verosimilitud. Los métodos bayesianos presuponen una distribución de probabilidad a priori de los árboles posibles, que puede ser simplemente la probabilidad de cualquier árbol entre todos los árboles posibles que podrían generarse a partir de los datos, o bien una estimación más sofisticada derivada de la suposición de que los eventos de divergencia, como la especiación, ocurren como procesos estocásticos . La elección de la distribución a priori es un punto de controversia entre los usuarios de los métodos filogenéticos de inferencia bayesiana. [ 2 ]

Las implementaciones de métodos bayesianos generalmente utilizan algoritmos de muestreo de Monte Carlo de cadena de Markov , aunque la elección del conjunto de movimientos varía; las selecciones utilizadas en filogenética bayesiana incluyen la permutación circular de nodos hoja de un árbol propuesto en cada paso [ 25 ] y el intercambio de subárboles descendientes de un nodo interno aleatorio entre dos árboles relacionados. [ 26 ] El uso de métodos bayesianos en filogenética ha sido controvertido, en gran medida debido a la especificación incompleta de la elección del conjunto de movimientos, el criterio de aceptación y la distribución previa en los trabajos publicados. [ 2 ] Generalmente se considera que los métodos bayesianos son superiores a los métodos basados ​​en parsimonia; pueden ser más propensos a la atracción de ramas largas que las técnicas de máxima verosimilitud, [ 27 ] aunque son más capaces de manejar datos faltantes. [ 28 ]

Mientras que los métodos de máxima verosimilitud encuentran el árbol que maximiza la probabilidad de los datos, un enfoque bayesiano recupera un árbol que representa los clados más probables, basándose en la distribución posterior. Sin embargo, las estimaciones de la probabilidad posterior de los clados (que miden su "soporte") pueden ser bastante inexactas, especialmente en clados que no son abrumadoramente probables. Por ello, se han propuesto otros métodos para estimar la probabilidad posterior. [ 29 ]

Algunas herramientas que utilizan inferencia bayesiana para inferir árboles filogenéticos a partir de datos de frecuencia alélica de variantes (VAF) incluyen Canopy, EXACT y PhyloWGS. [ 30 ] [ 31 ] [ 32 ]

Selección de modelos

Los métodos de filogenética molecular se basan en un modelo de sustitución definido que codifica una hipótesis sobre las tasas relativas de mutación en varios sitios a lo largo de las secuencias de genes o aminoácidos que se estudian. En su forma más simple, los modelos de sustitución buscan corregir las diferencias en las tasas de transiciones y transversiones en las secuencias de nucleótidos. El uso de modelos de sustitución es necesario debido a que la distancia genética entre dos secuencias aumenta linealmente solo durante un breve período después de que divergen entre sí (o bien, la distancia es lineal solo poco antes de la coalescencia ). Cuanto mayor sea el tiempo transcurrido desde la divergencia, mayor será la probabilidad de que dos mutaciones ocurran en el mismo sitio de nucleótido. Por lo tanto, los cálculos simples de distancia genética subestimarán el número de eventos de mutación que han ocurrido en la historia evolutiva. La magnitud de esta subestimación aumenta con el tiempo transcurrido desde la divergencia, lo que puede conducir al fenómeno de atracción de ramas largas , o la asignación errónea de dos secuencias distantemente relacionadas pero que evolucionan convergentemente como estrechamente relacionadas. [ 33 ] El método de máxima parsimonia es particularmente susceptible a este problema debido a su búsqueda explícita de un árbol que represente un número mínimo de eventos evolutivos distintos. [ 2 ]

Tipos de modelos

Todos los modelos de sustitución asignan un conjunto de pesos a cada posible cambio de estado representado en la secuencia. Los tipos de modelos más comunes son implícitamente reversibles porque asignan el mismo peso, por ejemplo, a una mutación de nucleótido G>C que a una mutación C>G. El modelo más simple posible, el modelo de Jukes-Cantor , asigna una probabilidad igual a cada posible cambio de estado para una base de nucleótido dada. La tasa de cambio entre dos nucleótidos distintos cualesquiera será un tercio de la tasa de sustitución general. [ 2 ] Los modelos más avanzados distinguen entre transiciones y transversiones . El modelo reversible en el tiempo más general posible, llamado modelo GTR, tiene seis parámetros de tasa de mutación. Un modelo aún más generalizado, conocido como el modelo general de 12 parámetros, rompe la reversibilidad en el tiempo, a costa de una complejidad mucho mayor en el cálculo de distancias genéticas que sean consistentes entre múltiples linajes. [ 2 ] Una posible variación sobre este tema ajusta las tasas de modo que el contenido general de GC, una medida importante de la estabilidad de la doble hélice del ADN, varíe en el tiempo. [ 34 ]

Los modelos también pueden permitir la variación de las tasas con las posiciones en la secuencia de entrada. El ejemplo más obvio de dicha variación proviene de la disposición de los nucleótidos en los genes codificadores de proteínas en codones de tres bases . Si se conoce la ubicación del marco de lectura abierto (ORF), las tasas de mutación se pueden ajustar para la posición de un sitio dado dentro de un codón, ya que se sabe que el apareamiento de bases tambaleante puede permitir tasas de mutación más altas en el tercer nucleótido de un codón dado sin afectar el significado del codón en el código genético . [ 33 ] Un ejemplo menos basado en hipótesis que no depende de la identificación del ORF simplemente asigna a cada sitio una tasa extraída aleatoriamente de una distribución predeterminada, a menudo la distribución gamma o la distribución log-normal . [ 2 ] Finalmente, una estimación más conservadora de las variaciones de la tasa conocida como el método de covariación permite variaciones autocorrelacionadas en las tasas, de modo que la tasa de mutación de un sitio dado está correlacionada entre sitios y linajes. [ 35 ]

Elegir el mejor modelo

La selección de un modelo apropiado es fundamental para la producción de buenos análisis filogenéticos, tanto porque los modelos subparametrizados o excesivamente restrictivos pueden producir un comportamiento aberrante cuando se violan sus supuestos subyacentes, como porque los modelos excesivamente complejos o sobreparametrizados son computacionalmente costosos y los parámetros pueden sobreajustarse. [ 33 ] El método más común de selección de modelos es la prueba de razón de verosimilitud (LRT), que produce una estimación de verosimilitud que puede interpretarse como una medida de " bondad de ajuste " entre el modelo y los datos de entrada. [ 33 ] Sin embargo, se debe tener cuidado al usar estos resultados, ya que un modelo más complejo con más parámetros siempre tendrá una mayor verosimilitud que una versión simplificada del mismo modelo, lo que puede llevar a la selección ingenua de modelos que son excesivamente complejos. [ 2 ] Por esta razón, los programas informáticos de selección de modelos elegirán el modelo más simple que no sea significativamente peor que los modelos de sustitución más complejos. Una desventaja significativa de la LRT es la necesidad de hacer una serie de comparaciones por pares entre modelos; Se ha demostrado que el orden en que se comparan los modelos tiene un efecto importante en el que finalmente se selecciona. [ 36 ]

Un método alternativo de selección de modelos es el criterio de información de Akaike (AIC), formalmente una estimación de la divergencia de Kullback-Leibler entre el modelo verdadero y el modelo que se está probando. Puede interpretarse como una estimación de verosimilitud con un factor de corrección para penalizar los modelos sobreparametrizados. [ 33 ] El AIC se calcula sobre un modelo individual en lugar de un par, por lo que es independiente del orden en que se evalúan los modelos. Una alternativa relacionada, el criterio de información bayesiano (BIC), tiene una interpretación básica similar, pero penaliza más severamente los modelos complejos. [ 33 ] Determinar el modelo más adecuado para la reconstrucción filogenética constituye un paso fundamental en numerosos estudios evolutivos. Sin embargo, varios criterios para la selección de modelos están generando debate sobre cuál criterio es preferible. Recientemente se ha demostrado que, cuando las topologías y la reconstrucción de secuencias ancestrales son el resultado deseado, elegir un criterio sobre otro no es crucial. En cambio, el uso del modelo de sustitución de nucleótidos más complejo, GTR+I+G, conduce a resultados similares para la inferencia de la topología del árbol y las secuencias ancestrales. [ 37 ]

Un protocolo completo paso a paso para la construcción de árboles filogenéticos, que incluye el ensamblaje de secuencias contiguas de ADN/aminoácidos, el alineamiento de secuencias múltiples, la prueba de modelos (prueba de los modelos de sustitución que mejor se ajustan) y la reconstrucción filogenética mediante máxima verosimilitud e inferencia bayesiana, está disponible en Protocol Exchange [ 38 ].

Una forma no tradicional de evaluar el árbol filogenético es compararlo con el resultado del agrupamiento. Se puede utilizar una técnica de escalamiento multidimensional, denominada unión interpolativa, para reducir la dimensionalidad y visualizar el resultado del agrupamiento de las secuencias en 3D, y luego mapear el árbol filogenético sobre dicho resultado. Un mejor árbol suele tener una mayor correlación con el resultado del agrupamiento. [ 39 ]

Evaluación del soporte para árboles

Como en todo análisis estadístico, la estimación de filogenias a partir de datos de caracteres requiere una evaluación de la confianza. Existen varios métodos para comprobar el grado de apoyo a un árbol filogenético, ya sea evaluando el apoyo a cada subárbol de la filogenia (apoyo nodal) o evaluando si la filogenia difiere significativamente de otros árboles posibles (pruebas de hipótesis de árboles alternativos).

Soporte nodal

El método más común para evaluar el soporte de un árbol filogenético consiste en analizar el soporte estadístico de cada nodo. Por lo general, un nodo con un soporte muy bajo no se considera válido para análisis posteriores y, visualmente, puede colapsarse en una politomía para indicar que las relaciones dentro de un clado no están resueltas.

Árbol de consenso

Muchos métodos para evaluar el soporte nodal implican la consideración de múltiples filogenias. El árbol de consenso resume los nodos que son compartidos entre un conjunto de árboles. [ 40 ] En un consenso estricto, solo se muestran los nodos que se encuentran en todos los árboles, y el resto se colapsa en una politomía no resuelta . Los métodos menos conservadores, como el árbol de consenso por mayoría, consideran los nodos que son respaldados por un porcentaje determinado de los árboles considerados (por ejemplo, al menos el 50%).

Por ejemplo, en el análisis de máxima parsimonia, puede haber muchos árboles con la misma puntuación de parsimonia. Un árbol de consenso estricto mostraría qué nodos se encuentran en todos los árboles igualmente parsimoniosos y cuáles difieren. Los árboles de consenso también se utilizan para evaluar el soporte en filogenias reconstruidas con inferencia bayesiana (véase más adelante).

Arranque automático y autodestrucción

En estadística, el método bootstrap permite inferir la variabilidad de datos con distribución desconocida mediante pseudorréplicas de los datos originales. Por ejemplo, dado un conjunto de 100 puntos de datos, una pseudorréplica es un conjunto de datos del mismo tamaño (100 puntos) muestreado aleatoriamente a partir de los datos originales, con reemplazo. Es decir, cada punto de datos original puede estar representado más de una vez en la pseudorréplica, o no estarlo en absoluto. El respaldo estadístico implica evaluar si los datos originales presentan propiedades similares a las de un conjunto grande de pseudorréplicas.

En filogenética, el remuestreo bootstrap se realiza utilizando las columnas de la matriz de caracteres. Cada pseudoréplica contiene el mismo número de especies (filas) y caracteres (columnas) muestreados aleatoriamente de la matriz original, con reemplazo. Se reconstruye una filogenia a partir de cada pseudoréplica, utilizando los mismos métodos que para reconstruir la filogenia a partir de los datos originales. Para cada nodo de la filogenia, el soporte nodal es el porcentaje de pseudoréplicas que contienen ese nodo. [ 41 ]

El rigor estadístico de la prueba bootstrap se ha evaluado empíricamente utilizando poblaciones virales con historias evolutivas conocidas, [ 42 ] encontrándose que un soporte bootstrap del 70 % corresponde a una probabilidad del 95 % de que el clado exista. Sin embargo, esto se probó en condiciones ideales (por ejemplo, sin cambios en las tasas evolutivas, filogenias simétricas). En la práctica, los valores superiores al 70 % generalmente se consideran respaldados y se deja a criterio del investigador o lector evaluar la confianza. Los nodos con un soporte inferior al 70 % se consideran generalmente no resueltos.

El método jackknife en filogenética es un procedimiento similar, con la diferencia de que las columnas de la matriz se muestrean sin reemplazo. Las pseudoréplicas se generan mediante un submuestreo aleatorio de los datos; por ejemplo, un "jackknife del 10 %" implicaría muestrear aleatoriamente el 10 % de la matriz varias veces para evaluar el soporte nodal.

Probabilidad posterior

La reconstrucción de filogenias mediante inferencia bayesiana genera una distribución posterior de árboles altamente probables dados los datos y el modelo evolutivo, en lugar de un único árbol "óptimo". Los árboles en la distribución posterior generalmente presentan topologías muy diversas. Cuando los datos de entrada son datos de frecuencia alélica variante (VAF), la herramienta EXACT puede calcular las probabilidades de los árboles con exactitud, para tamaños de árbol pequeños y biológicamente relevantes, mediante una búsqueda exhaustiva en todo el espacio de árboles. [ 30 ]

La mayoría de los métodos de inferencia bayesiana utilizan una iteración de Monte Carlo de cadena de Markov, y los pasos iniciales de esta cadena no se consideran reconstrucciones fiables de la filogenia. Los árboles generados al principio de la cadena suelen descartarse como fase de calentamiento . El método más común para evaluar el soporte nodal en un análisis filogenético bayesiano consiste en calcular el porcentaje de árboles en la distribución posterior (después del calentamiento) que contienen el nodo.

Se espera que el respaldo estadístico para un nodo en la inferencia bayesiana refleje la probabilidad de que un clado realmente exista dados los datos y el modelo evolutivo. [ 43 ] Por lo tanto, el umbral para aceptar un nodo como respaldado es generalmente más alto que para el bootstrapping.

Métodos de conteo de pasos

El criterio de Bremer contabiliza el número de pasos adicionales necesarios para refutar un clado.

deficiencias

Cada una de estas medidas tiene sus debilidades. Por ejemplo, los clados más pequeños o más grandes tienden a atraer valores de soporte mayores que los clados de tamaño medio, simplemente como resultado del número de taxones que contienen. [ 44 ]

El soporte de Bootstrap puede proporcionar estimaciones altas del soporte de nodos como resultado del ruido en los datos en lugar de la existencia real de un clado. [ 45 ]

Limitaciones y soluciones alternativas

En última instancia, no hay forma de determinar si una hipótesis filogenética en particular es precisa o no, a menos que se conozcan las verdaderas relaciones entre los taxones examinados (lo cual puede ocurrir con bacterias o virus en condiciones de laboratorio). El mejor resultado que un filogenetista empírico puede esperar es un árbol con ramas bien respaldadas por la evidencia disponible. Se han identificado varios posibles inconvenientes:

Homoplasia

Ciertos caracteres tienen más probabilidades de evolucionar convergentemente que otros; lógicamente, a dichos caracteres se les debería dar menos peso en la reconstrucción de un árbol. [ 46 ] Los pesos en forma de un modelo de evolución se pueden inferir a partir de conjuntos de datos moleculares, de modo que se pueden utilizar métodos de máxima verosimilitud o bayesianos para analizarlos. Para las secuencias moleculares, este problema se agrava cuando los taxones en estudio han divergido sustancialmente. A medida que aumenta el tiempo desde la divergencia de dos taxones, también aumenta la probabilidad de múltiples sustituciones en el mismo sitio, o mutaciones inversas, todo lo cual resulta en homoplasias. Para los datos morfológicos, desafortunadamente, la única forma objetiva de determinar la convergencia es mediante la construcción de un árbol  , un método algo circular. Aun así, ponderar los caracteres homoplásicos conduce a árboles mejor respaldados. [ 46 ] Se puede lograr un mayor refinamiento ponderando los cambios en una dirección más que los cambios en otra; Por ejemplo, la presencia de alas torácicas casi garantiza su clasificación entre los insectos pterigotos porque, aunque las alas a menudo se pierden secundariamente, no hay evidencia de que se hayan adquirido más de una vez. [ 47 ]

transferencia horizontal de genes

En general, los organismos pueden heredar genes de dos maneras: transferencia génica vertical y transferencia génica horizontal . La transferencia génica vertical es el paso de genes de padres a hijos, y la transferencia génica horizontal (también llamada lateral) ocurre cuando los genes saltan entre organismos no emparentados, un fenómeno común especialmente en procariotas ; un buen ejemplo de esto es la resistencia adquirida a los antibióticos como resultado del intercambio genético entre diversas bacterias que da lugar a especies bacterianas multirresistentes. También se han documentado casos de transferencia génica horizontal entre eucariotas .

La transferencia horizontal de genes ha complicado la determinación de las filogenias de los organismos, y se han reportado inconsistencias filogenéticas entre grupos específicos de organismos, dependiendo de los genes utilizados para construir los árboles evolutivos. La única forma de determinar qué genes se han adquirido verticalmente y cuáles horizontalmente es asumir, de manera parsimoniosa , que el conjunto más grande de genes heredados conjuntamente se ha heredado verticalmente; esto requiere analizar un gran número de genes.

Híbridos, especiación, introgresiones y clasificación incompleta de linajes

La suposición básica que subyace al modelo matemático de la cladística es una situación en la que las especies se dividen claramente de forma bifurcada. Si bien esta suposición puede ser válida a mayor escala (salvo transferencia horizontal de genes, véase más arriba), la especiación suele ser mucho menos ordenada. Las investigaciones realizadas desde la introducción del método cladístico han demostrado que la especiación híbrida , antes considerada rara, es de hecho bastante común, especialmente en plantas. [ 48 ] [ 49 ] La especiación parafilética también es común, lo que hace que la suposición de un patrón bifurcado sea inadecuada, dando lugar a redes filogenéticas en lugar de árboles. [ 50 ] [ 51 ] La introgresión también puede transferir genes entre especies distintas e incluso, a veces, entre géneros, [ 52 ] lo que complica el análisis filogenético basado en genes. [ 53 ] Este fenómeno puede contribuir a la "clasificación incompleta de linajes" y se cree que es un fenómeno común en varios grupos. En el análisis a nivel de especie, esto se puede abordar mediante un muestreo mayor o un mejor análisis del genoma completo. [ 54 ] A menudo, el problema se evita restringiendo el análisis a un número menor de especímenes que no estén estrechamente relacionados.

Muestreo de taxones

Debido al desarrollo de técnicas avanzadas de secuenciación en biología molecular , se ha vuelto factible recopilar grandes cantidades de datos (ADN o secuencias de aminoácidos) para inferir hipótesis filogenéticas. Por ejemplo, no es raro encontrar estudios con matrices de caracteres basadas en genomas mitocondriales completos (~16.000 nucleótidos, en muchos animales). Sin embargo, las simulaciones han demostrado que es más importante aumentar el número de taxones en la matriz que aumentar el número de caracteres, porque cuantos más taxones haya, más preciso y robusto será el árbol filogenético resultante. [ 55 ] [ 56 ] Esto puede deberse en parte a la fragmentación de ramas largas .

Señal filogenética

Otro factor importante que afecta la precisión de la reconstrucción del árbol es si los datos analizados contienen realmente una señal filogenética útil, un término que se usa generalmente para indicar si un carácter evoluciona lo suficientemente lento como para tener el mismo estado en taxones estrechamente relacionados, en lugar de variar aleatoriamente. Existen pruebas para detectar señales filogenéticas. [ 57 ]

caracteres continuos

Los caracteres morfológicos que muestrean un continuo pueden contener señal filogenética, pero son difíciles de codificar como caracteres discretos. Se han utilizado varios métodos, uno de los cuales es la codificación de huecos, y existen variaciones de la codificación de huecos. [ 58 ] En la forma original de la codificación de huecos: [ 58 ]

Las medias grupales para un personaje se ordenan primero por tamaño. Se calcula la desviación estándar intragrupal combinada... y las diferencias entre medias adyacentes... se comparan con respecto a esta desviación estándar. Cualquier par de medias adyacentes se considera diferente y se le asignan puntuaciones enteras diferentes... si las medias están separadas por una "brecha" mayor que la desviación estándar intragrupal... multiplicada por una constante arbitraria.

Si se añaden más taxones al análisis, las brechas entre ellos pueden volverse tan pequeñas que se pierde toda la información. La codificación generalizada de brechas soluciona este problema comparando pares individuales de taxones en lugar de considerar un conjunto que contenga todos los taxones. [ 58 ]

Datos faltantes

En general, cuantos más datos estén disponibles al construir un árbol, más preciso y fiable será el árbol resultante. La falta de datos no es más perjudicial que simplemente tener menos datos, aunque el impacto es mayor cuando la mayoría de los datos faltantes se encuentran en un número reducido de taxones. Concentrar los datos faltantes en un número reducido de caracteres produce un árbol más robusto. [ 59 ]

El papel de los fósiles

Debido a que muchos caracteres involucran caracteres embriológicos, de tejidos blandos o moleculares que (en el mejor de los casos) casi nunca se fosilizan, y la interpretación de los fósiles es más ambigua que la de los taxones vivos , los taxones extintos casi invariablemente tienen mayores proporciones de datos faltantes que los vivos. Sin embargo, a pesar de estas limitaciones, la inclusión de fósiles es invaluable, ya que pueden proporcionar información en áreas dispersas de los árboles, interrumpiendo ramas largas y restringiendo estados de caracteres intermedios; por lo tanto, los taxones fósiles contribuyen tanto a la resolución del árbol como los taxones modernos. [ 60 ] Los fósiles también pueden restringir la edad de los linajes y por lo tanto demostrar cuán consistente es un árbol con el registro estratigráfico; la estratocladística incorpora información de edad en matrices de datos para análisis filogenéticos.

Véase también

Referencias

  1. 1 2 Khalafvand, Tyler Seyed Amin (2015). Finding Structure in the Phylogeny Search Space (PDF) (tesis de maestría en ciencias científicas). Universidad de Dalhousie.
  2. ^ Felsenstein J ( 2004 ) .Inferir filogenias . Sunderland, Massachusetts: Sinauer Associates. ISBN 978-0-87893-177-4.
  3. 1 2 3 4 Mount DM (2004). Bioinformática: Análisis de secuencias y genomas (2.ª ed.). Cold Spring Harbor, Nueva York: Cold Spring Harbor Laboratory Press. ISBN  978-0-87969-712-9.
  4. Swiderski DL, Zelditch ML, Fink WL (septiembre de 1998). "Por qué la morfometría no es especial: codificación de datos cuantitativos para el análisis filogenético". Systematic Biology . 47 (3): 508– 19. JSTOR 2585256. PMID 12066691 .  
  5. Gaubert P, Wozencraft WC, Cordeiro-Estrela P, Veron G (diciembre de 2005). "Mosaicos de convergencias y ruido en filogenias morfológicas: ¿qué hay en un carnívoro similar a los vivérridos?" . Systematic Biology . 54 (6): 865– 94. doi : 10.1080/10635150500232769 . PMID 16282167 . 
  6. Strait DS, Grine FE (diciembre de 2004). "Inferencia de la filogenia de los hominoideos y homínidos primitivos mediante caracteres craneodentales: el papel de los taxones fósiles". Journal of Human Evolution . 47 (6): 399– 452. Bibcode : 2004JHumE..47..399S . doi : 10.1016/j.jhevol.2004.08.008 . PMID 15566946 . 
  7. Wiens JJ (2001). "Análisis de caracteres en filogenética morfológica: problemas y soluciones". Systematic Biology . 50 (5): 689– 99. doi : 10.1080/106351501753328811 . PMID 12116939 . 
  8. Jenner RA (2001). "Filogenia bilateral y reciclaje acrítico de conjuntos de datos morfológicos" . Systematic Biology . 50 (5): 730–42 . doi : 10.1080/106351501753328857 . PMID 12116943 . 
  9. "Parte 4: Filogenética multigénica" . web.natur.cuni.cz .
  10. Sokal R, Michener C (1958). "Un método estadístico para evaluar relaciones sistemáticas" . Boletín Científico de la Universidad de Kansas . 38 : 1409–1438 .
  11. Saitou N, Nei M (julio de 1987). "El método de unión de vecinos: un nuevo método para reconstruir árboles filogenéticos" . Biología molecular y evolución . 4 (4): 406–25 . doi : 10.1093/oxfordjournals.molbev.a040454 . PMID 3447015 . 
  12. Fitch WM , Margoliash E (enero de 1967). "Construcción de árboles filogenéticos". Science . 155 (3760): 279–84 . Bibcode : 1967Sci...155..279F . doi : 10.1126/science.155.3760.279 . PMID 5334057 . 
  13. ^ Lespinats S, Grando D, Maréchal E, Hakimi MA, Tenaillon O, Bastien O (2011). "Cómo el algoritmo Fitch-Margoliash puede beneficiarse del escalamiento multidimensional" . Bioinformática evolutiva en línea . 7 EBO.S7048: 61– 85. doi : 10.4137/EBO.S7048 . PMC 3118699 . PMID 21697992 .  
  14. Day WH (1987). "Complejidad computacional de la inferencia de filogenias a partir de matrices de disimilitud". Bulletin of Mathematical Biology . 49 (4): 461– 7. doi : 10.1007/BF02458863 . PMID 3664032. S2CID 189885258 .  
  15. Hendy MD, Penny D (1982). "Algoritmos de ramificación y acotación para determinar árboles evolutivos mínimos". Mathematical Biosciences . 59 (2): 277– 290. doi : 10.1016/0025-5564(82)90027-X .
  16. ^ Ratner VA, Zharkikh AA, Kolchanov N, Rodin S, Solovyov S, Antonov AS (1995). Evolución molecular . Serie Biomatemáticas. vol. 24. Nueva York: Springer-Verlag. ISBN  978-3-662-12530-4.
  17. Sankoff D, Morel C, Cedergren RJ (octubre de 1973). "Evolución del ARN 5S y la no aleatoriedad del reemplazo de bases". Nature . 245 (147): 232–4 . doi : 10.1038/newbio245232a0 . PMID 4201431 . 
  18. 1 2 De Laet J (2005). "Parsimonia y el problema de los inaplicables en los datos de secuencias". En Albert VA (ed.). Parsimonia, filogenia y genómica . Oxford University Press. pp. 81–116 . ISBN  978-0-19-856493-5.
  19. Wheeler WC, Gladstein DS (1994). "MALIGN: un programa de alineación de secuencias de ácidos nucleicos múltiples". Journal of Heredity . 85 (5): 417– 418. doi : 10.1093/oxfordjournals.jhered.a111492 .
  20. Simmons MP (junio de 2004). "Independencia de la alineación y la búsqueda de árboles". Molecular Phylogenetics and Evolution . 31 (3): 874– 9. Bibcode : 2004MolPE..31..874S . doi : 10.1016/j.ympev.2003.10.008 . PMID 15120385 . 
  21. De Laet J (2015). "Análisis de parsimonia de datos de secuencias no alineadas: maximización de la homología y minimización de la homoplasia, no minimización del costo total definido operacionalmente ni minimización de transformaciones igualmente ponderadas" . Cladistics . 31 ( 5): 550– 567. doi : 10.1111/cla.12098 . PMID 34772278. S2CID 221582410 .  
  22. Chor B, Tuller T (junio de 2005). "Máxima verosimilitud de árboles evolutivos: dificultad y aproximación" . Bioinformatics . 21 (Supl. 1): i97–106. doi : 10.1093/bioinformatics/bti1027 . PMID 15961504 . 
  23. El-Kebir M, Oesper L, Acheson-Field H, Raphael BJ (junio de 2015). "Reconstrucción de árboles clonales y composición tumoral a partir de datos de secuenciación de múltiples muestras" . Bioinformatics . 31 ( 12): i62-70. doi : 10.1093/bioinformatics/btv261 . PMC 4542783. PMID 26072510 .  
  24. Malikic S, McPherson AW, Donmez N, Sahinalp CS (mayo de 2015). "Inferencia de clonalidad en múltiples muestras tumorales mediante filogenia" . Bioinformatics . 31 (9): 1349– 56. doi : 10.1093/bioinformatics/btv003 . PMID 25568283 . 
  25. Mau B, Newton MA (1997). "Inferencia filogenética para datos binarios en dendrogramas usando cadenas de Markov Monte Carlo". Journal of Computational and Graphical Statistics . 6 (1): 122– 131. doi : 10.2307/1390728 . JSTOR 1390728 . 
  26. Yang Z, Rannala B (julio de 1997). "Inferencia filogenética bayesiana utilizando secuencias de ADN: un método de Monte Carlo de cadena de Markov" . Biología molecular y evolución . 14 (7): 717–24 . doi : 10.1093/oxfordjournals.molbev.a025811 . PMID 9214744 . 
  27. Kolaczkowski B, Thornton JW (diciembre de 2009). Delport W (ed.). "Sesgo de atracción de ramas largas e inconsistencia en filogenética bayesiana" . PLOS ONE . 4 (12) e7891. Bibcode : 2009PLoSO...4.7891K . doi : 10.1371/journal.pone.0007891 . PMC 2785476. PMID 20011052 .  
  28. Simmons MP (2012). "Resultados engañosos de análisis filogenéticos basados ​​en verosimilitud en presencia de datos faltantes" . Cladistics . 28 (2): 208– 222. doi : 10.1111/j.1096-0031.2011.00375.x . PMID 34872185. S2CID 53123024 .  
  29. Larget B (julio de 2013). "La estimación de probabilidades posteriores de árboles utilizando distribuciones de probabilidad de clados condicionales" . Systematic Biology . 62 (4): 501– 11. doi : 10.1093/sysbio/syt014 . PMC 3676676. PMID 23479066 .  
  30. ^ Ray S, Jia B, Safavi S, van Opijnen T, Isberg R, Rosch J, Bento J (22 de agosto de 2019) . "Inferencia exacta bajo el modelo de filogenia perfecta". arXiv : 1908.08623 . Código Bib : 2019arXiv190808623R .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  31. Jiang Y, Qiu Y, Minn AJ, Zhang NR (septiembre de 2016). "Evaluación de la heterogeneidad intratumoral y seguimiento de la historia evolutiva clonal longitudinal y espacial mediante secuenciación de próxima generación" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 113 (37): E5528-37. Bibcode : 2016PNAS..113E5528J . doi : 10.1073/pnas.1522203113 . PMC 5027458. PMID 27573852 .  
  32. Deshwar AG, Vembu S, Yung CK, Jang GH, Stein L, Morris Q (febrero de 2015). "PhyloWGS: reconstrucción de la composición subclonal y la evolución a partir de la secuenciación del genoma completo de tumores" . Genome Biology . 16 (1) 35. doi : 10.1186/s13059-015-0602-8 . PMC 4359439. PMID 25786235 .  
  33. 1 2 3 4 5 6 Sullivan J, Joyce P (2005). "Selección de modelos en filogenética" . Annual Review of Ecology, Evolution, and Systematics . 36 ( 1): 445– 466. doi : 10.1146/annurev.ecolsys.36.102003.152633 . PMC 3144157. PMID 20671039 .  
  34. Galtier N, Gouy M (julio de 1998). "Inferencia de patrones y procesos: implementación de máxima verosimilitud de un modelo no homogéneo de evolución de secuencias de ADN para análisis filogenético" . Biología Molecular y Evolución . 15 (7): 871–9 . doi : 10.1093/oxfordjournals.molbev.a025991 . PMID 9656487 . 
  35. Fitch WM, Markowitz E (octubre de 1970). "Un método mejorado para determinar la variabilidad de codones en un gen y su aplicación a la tasa de fijación de mutaciones en la evolución". Biochemical Genetics . 4 (5): 579– 93. doi : 10.1007/bf00486096 . PMID 5489762. S2CID 26638948 .  
  36. Pol D (diciembre de 2004). "Problemas empíricos de la prueba de razón de verosimilitud jerárquica para la selección de modelos" . Systematic Biology . 53 (6): 949– 62. doi : 10.1080/10635150490888868 . PMID 15764562 . 
  37. Abadi S, Azouri D, Pupko T, Mayrose I (febrero de 2019). "La selección de modelos puede no ser un paso obligatorio para la reconstrucción filogenética" . Nature Communications . 10 (1) 934. Bibcode : 2019NatCo..10..934A . doi : 10.1038/s41467-019-08822- w . PMC 6389923. PMID 30804347 .  
  38. Bast F (2013). "Búsqueda de similitud de secuencias, alineación de secuencias múltiples, selección de modelos, matriz de distancias y reconstrucción filogenética" . Protocol Exchange . doi : 10.1038/protex.2013.065 .
  39. Ruan Y, House GL, Ekanayake S, Schütte U, Bever JD, Tang H, Fox G (26 de mayo de 2014). «Integración de agrupamiento y escalamiento multidimensional para determinar árboles filogenéticos como filogramas esféricos visualizados en 3 dimensiones». 2014 14th IEEE/ACM International Symposium on Cluster, Cloud and Grid Computing . IEEE. pp. 720–729 . doi : 10.1109/CCGrid.2014.126 . ISBN  978-1-4799-2784-5. S2CID 9581901 . 
  40. Baum DA, Smith SD (2013). Tree Thinking: An Introduction to Phylogenetic Biology . Roberts. p. 442. ISBN  978-1-936221-16-5.
  41. Felsenstein J (julio de 1985). " Límites de confianza en filogenias: un enfoque utilizando el bootstrap". Evolution; International Journal of Organic Evolution . 39 (4): 783– 791. doi : 10.2307/2408678 . JSTOR 2408678. PMID 28561359 .  
  42. Hillis DM, Bull JJ (1993). "Una prueba empírica del bootstrapping como método para evaluar la confianza en el análisis filogenético". Systematic Biology . 42 (2): 182– 192. doi : 10.1093/sysbio/42.2.182 . ISSN 1063-5157 . 
  43. Huelsenbeck J, Rannala B (diciembre de 2004). "Propiedades frecuentistas de las probabilidades posteriores bayesianas de árboles filogenéticos bajo modelos de sustitución simples y complejos" . Systematic Biology . 53 (6): 904–13 . doi : 10.1080/10635150490522629 . PMID 15764559 . 
  44. Chemisquy MA, Prevosti FJ (2013). "Evaluación del efecto del tamaño del clado en medidas alternativas de soporte de ramas" . Journal of Zoological Systematics and Evolutionary Research . 51 (4): 260– 273. doi : 10.1111/jzs.12024 . hdl : 11336/4144 .
  45. Phillips MJ, Delsuc F, Penny D (julio de 2004). "Filogenia a escala genómica y detección de sesgos sistemáticos" (PDF) . Biología Molecular y Evolución . 21 (7): 1455–8 . doi : 10.1093/molbev/msh137 . PMID 15084674 . 
  46. 1 2 Goloboff PA, Carpenter JM, Arias JS, Esquivel DR (2008). "La ponderación contra la homoplasia mejora el análisis filogenético de conjuntos de datos morfológicos" . Cladistics . 24 (5): 758– 773. doi : 10.1111/j.1096-0031.2008.00209.x . hdl : 11336/82003 . S2CID 913161 . 
  47. Goloboff PA (1997). "Optimización autoponderada: búsquedas en árboles y reconstrucciones de estados de caracteres bajo costos de transformación implícitos". Cladistics . 13 (3): 225– 245. doi : 10.1111/j.1096-0031.1997.tb00317.x . PMID 34911233 . S2CID 196595734 .  
  48. Arnold ML (1996). Hibridación natural y evolución . Nueva York: Oxford University Press. pág. 232. ISBN  978-0-19-509975-1.
  49. ^ Wendel JF, Doyle JJ (1998). "Secuenciación de ADN". En Soltis DE, Soltis PS , Doyle JJ (eds.). Sistemática Molecular de Plantas II . Boston: Kluwer. págs. 265–296 . ISBN  978-0-19-535668-7.
  50. Funk DJ, Omland KE (2003). "Parafilia y polifilia a nivel de especie: frecuencia, causas y consecuencias, con perspectivas del ADN mitocondrial animal". Annual Review of Ecology, Evolution, and Systematics . 34 : 397–423 . doi : 10.1146/annurev.ecolsys.34.011802.132421 . S2CID 33951905 . 
  51. "Genealogía de la Vida (GoLife)" . Fundación Nacional de Ciencias . Consultado el 5 de mayo de 2015. El programa GoLife se basa en el programa AToL al contemplar la complejidad de los patrones de diversificación a lo largo de toda la historia de la vida. Nuestro conocimiento actual de procesos como la hibridación, la endosimbiosis y la transferencia horizontal de genes deja claro que la historia evolutiva de la vida en la Tierra no puede representarse con precisión —para cada rama del árbol— como un único árbol bifurcado tipológico.
  52. Kutschera VE, Bidon T, Hailer F, Rodi J, Fain SR, Janke A (2014). "Osos en un bosque de árboles genéticos: la inferencia filogenética se complica por la clasificación incompleta de linajes y el flujo genético" . Biología Molecular y Evolución . 31 (8): 2004– 2017. doi : 10.1093/molbev/msu186 . PMC 4104321. PMID 24903145 .  
  53. Qu Y, Zhang R, Quan Q, Song G, Li SH, Lei F (diciembre de 2012). "Clasificación de linajes incompleta o mezcla secundaria: desentrañando la divergencia histórica del flujo genético reciente en el pico de loro de garganta vinosa (Paradoxornis webbianus)". Molecular Ecology . 21 (24): 6117– 33. Bibcode : 2012MolEc..21.6117Q . doi : 10.1111/mec.12080 . PMID 23095021 . S2CID 22635918 .  
  54. Pollard DA, Iyer VN, Moses AM, Eisen MB (octubre de 2006). "Discordancia generalizada de los árboles genéticos con el árbol de especies en Drosophila: evidencia de clasificación de linajes incompleta" . PLOS Genetics . 2 (10) e173. doi : 10.1371/journal.pgen.0020173 . PMC 1626107. PMID 17132051 .  
  55. Zwickl DJ, Hillis DM (agosto de 2002). "El aumento del muestreo de taxones reduce considerablemente el error filogenético" . Systematic Biology . 51 (4): 588– 98. doi : 10.1080/10635150290102339 . PMID 12228001 . 
  56. Wiens JJ (febrero de 2006). "Datos faltantes y el diseño de análisis filogenéticos" . Journal of Biomedical Informatics . 39 (1): 34– 42. doi : 10.1016/j.jbi.2005.04.001 . PMID 15922672 . 
  57. Blomberg SP, Garland T, Ives AR (abril de 2003). "Prueba de señal filogenética en datos comparativos: los rasgos conductuales son más lábiles". Evolution ; International Journal of Organic Evolution . 57 (4): 717– 45. Bibcode : 2003Evolu..57..717B . doi : 10.1111/j.0014-3820.2003.tb00285.x . PMID 12778543. S2CID 221735844 .  
  58. 1 2 3 Archie JW (1985). "Métodos para codificar características morfológicas variables para el análisis taxonómico numérico". Systematic Zoology . 34 (3): 326– 345. doi : 10.2307/2413151 . JSTOR 2413151 . 
  59. Prevosti FJ, Chemisquy MA (2009). "El impacto de los datos faltantes en las filogenias morfológicas reales: Influencia del número y distribución de las entradas faltantes". Cladistics . 26 (3): 326– 339. doi : 10.1111/j.1096-0031.2009.00289.x . hdl : 11336/69010 . PMID 34875786 . S2CID 86850694 .  
  60. Cobbett A, Wilkinson M, Wills MA (octubre de 2007). "Los fósiles tienen un impacto tan fuerte como los taxones vivos en los análisis de parsimonia de la morfología" . Systematic Biology . 56 (5): 753–66 . doi : 10.1080/10635150701627296 . PMID 17886145 . 

Lecturas adicionales

  • Semple C, Steel M (2003). Filogenética . Oxford University Press. ISBN 978-0-19-850942-4.
  • Cipra BA (2007). "Los geómetras algebraicos ven un enfoque ideal para la biología" (PDF) . SIAM News . 40 (6). Archivado del original (PDF) el 3 de marzo de 2016.
  • Press WH, Teukolsky SA, Vetterling WT, Flannery BP (2007). «Sección 16.4. Agrupamiento jerárquico mediante árboles filogenéticos» . Numerical Recipes: The Art of Scientific Computing (3.ª  ed.). Nueva York: Cambridge University Press. ISBN 978-0-521-88068-8Archivado del original el 11 de agosto de 2011. Consultado el 17 de agosto de 2011 .
  • Huson DH, Rupp R, Scornavacca C (2010). Redes filogenéticas: conceptos, algoritmos y aplicaciones . Cambridge University Press. ISBN 978-1-139-49287-4.
  • Logotipo de Wikimedia CommonsContenido multimedia relacionado con la filogenética computacional en Wikimedia Commons.