Articulo de referencia

La D de Tajima

La D de Tajima es una estadística de prueba genética poblacional creada por el investigador japonés Fumio Tajima y nombrada en su honor . [ 1 ] La D de Tajima se calcula como la...

La D de Tajima es una estadística de prueba genética poblacional creada por el investigador japonés Fumio Tajima y nombrada en su honor . [ 1 ] La D de Tajima se calcula como la diferencia entre dos medidas de diversidad genética: el número medio de diferencias por pares y el número de sitios segregantes, cada uno escalado de manera que se espera que sean iguales en una población de tamaño constante que evoluciona de forma neutral.

El propósito de la prueba D de Tajima es distinguir entre una secuencia de ADN que evoluciona aleatoriamente ("neutralmente") y una que evoluciona bajo un proceso no aleatorio, incluyendo selección direccional o selección equilibradora , expansión o contracción demográfica, arrastre genético o introgresión . Una secuencia de ADN que evoluciona aleatoriamente contiene mutaciones sin efecto sobre la aptitud y supervivencia de un organismo. Las mutaciones que evolucionan aleatoriamente se llaman "neutrales", mientras que las mutaciones bajo selección son "no neutrales". Por ejemplo, se esperaría que una mutación que causa muerte prenatal o enfermedad grave estuviera bajo selección. En la población en su conjunto, la frecuencia de una mutación neutral fluctúa aleatoriamente (es decir, el porcentaje de individuos en la población con la mutación cambia de una generación a la siguiente, y este porcentaje tiene la misma probabilidad de aumentar o disminuir) a través de la deriva genética .

La intensidad de la deriva genética depende del tamaño de la población. Si una población tiene un tamaño constante con una tasa de mutación constante, alcanzará un equilibrio de frecuencias génicas. Este equilibrio posee propiedades importantes, incluyendo el número de sitios segregantes.S{\displaystyle S}y el número de diferencias de nucleótidos entre pares muestreados (estas se denominan diferencias por pares ). Para estandarizar las diferencias por pares, se utiliza el número medio o "promedio" de diferencias por pares. Este es simplemente la suma de las diferencias por pares dividida por el número de pares, y a menudo se simboliza conπ{\displaystyle \pi }.

El objetivo de la prueba de Tajima es identificar secuencias que no se ajustan al modelo de la teoría neutral en equilibrio entre mutación y deriva genética . Para realizar la prueba en una secuencia de ADN o un gen, es necesario secuenciar ADN homólogo de al menos tres individuos. El estadístico de Tajima calcula una medida estandarizada del número total de sitios segregantes (sitios de ADN polimórficos ) en el ADN muestreado y el número promedio de mutaciones entre pares en la muestra. Ambas cantidades, cuyos valores se comparan, son estimaciones del parámetro genético poblacional theta mediante el método de los momentos , por lo que se espera que tengan el mismo valor. Si estas dos cantidades solo difieren en lo que cabría esperar razonablemente por azar, entonces no se puede rechazar la hipótesis nula de neutralidad. De lo contrario, se rechaza la hipótesis nula de neutralidad.

Explicación científica

Según el modelo de teoría neutral, para una población de tamaño constante en equilibrio:

mi[π]=θ=mi[Si=1norte11i]=4norteμ{\displaystyle E[\pi ]=\theta =E\left[{\frac {S}{\sum _{i=1}^{n-1}{\frac {1}{i}}}}\right]=4N\mu }

para el ADN diploide y

mi[π]=θ=mi[Si=1norte11i]=2norteμ{\displaystyle E[\pi ]=\theta =E\left[{\frac {S}{\sum _{i=1}^{n-1}{\frac {1}{i}}}}\right]=2N\mu }

para haploide.

En las fórmulas anteriores, S es el número de sitios segregantes, n es el número de muestras, N es el tamaño efectivo de la población, μ{\displaystyle \mu }es la tasa de mutación en el locus genómico examinado, e i es el índice de suma. Pero la selección , las fluctuaciones demográficas y otras violaciones del modelo neutral (incluida la heterogeneidad de la tasa y la introgresión) cambiarán los valores esperados deS{\displaystyle S}yπ{\displaystyle \pi }, de modo que ya no se espera que sean iguales. La diferencia en las expectativas para estas dos variables (que pueden ser positivas o negativas) es el punto clave del estadístico de prueba D de Tajima .

D{\displaystyle D\,}se calcula tomando la diferencia entre las dos estimaciones del parámetro de genética de poblaciones.θ{\displaystyle \theta \,}Esta diferencia se llamad{\displaystyle d\,}y D se calcula dividiendod{\displaystyle d\,}por la raíz cuadrada de su varianzaV^(d){\displaystyle {\sqrt {{\hat {V}}(d)}}}(su desviación estándar , por definición).

D=dV^(d){\displaystyle D={\frac {d}{\sqrt {{\hat {V}}(d)}}}}

Fumio Tajima demostró mediante simulación por computadora que elD{\displaystyle D\,}La estadística descrita anteriormente podría modelarse utilizando una distribución beta . Si laD{\displaystyle D\,}Si el valor de una muestra de secuencias está fuera del intervalo de confianza , entonces se puede rechazar la hipótesis nula de mutación neutra para la secuencia en cuestión. Sin embargo, en usos del mundo real, se debe tener cuidado ya que los cambios poblacionales pasados ​​(por ejemplo, un cuello de botella poblacional ) pueden sesgar el valor de la muestra.D{\displaystyle D\,}estadística. [ 2 ]

Detalles matemáticos

D=dV^(d)=k^Sa1[mi1S+mi2S(S1)]{\displaystyle D={\frac {d}{\sqrt {{\hat {V}}(d)}}}={\frac {{\hat {k}}-{\frac {S}{a_{1}}}}{\sqrt {[e_{1}S+e_{2}S(S-1)]}}}}

dónde

k^{\displaystyle {\hat {k}}\,}ySa1{\displaystyle {\frac {S}{a_{1}}}}son dos estimaciones del número esperado de polimorfismos de un solo nucleótido (SNP) entre dos secuencias de ADN bajo el modelo de mutación neutra en un tamaño de muestranorte{\displaystyle n\,}a partir de un tamaño de población efectivonorte{\displaystyle N}.

La primera estimación es el número promedio de SNP encontrados en(norte2){\displaystyle n \choose 2}comparaciones por pares de secuencias(i,j){\displaystyle (i,j)}en la muestra,

k^=i<jkij(norte2).{\displaystyle {\hat {k}}={\frac {\sum \sum _{i<j}k_{ij}}{\binom {n}{2}}}.}

La segunda estimación se deriva del valor esperado deS{\displaystyle S}, el número total de polimorfismos en la muestra

mi(S)=a1METRO.{\displaystyle E(S)=a_{1}M.}

Tajima defineMETRO=4norteμ{\displaystyle M=4N\mu }, mientras que Hartl y Clark utilizan un símbolo diferente para definir el mismo parámetro.θ=4norteμ{\displaystyle \theta =4N\mu }.

Ejemplo

Supongamos que eres un genetista que estudia un gen desconocido. Como parte de tu investigación, obtienes muestras de ADN de cuatro personas elegidas al azar (además de la tuya). Para simplificar, etiquetas tu secuencia como una cadena de ceros, y para las otras cuatro personas, asignas un cero cuando su ADN es idéntico al tuyo y un uno cuando es diferente. (En este ejemplo, el tipo específico de diferencia no es importante).

 1 2 Posición 12345 67890 12345 67890 Persona Y 00000 00000 00000 00000 Persona A 00100 00000 00100 00010 Persona B 00000 00000 00100 00010 Persona C 00000 01000 00000 00010 Persona D 00000 01000 00100 00010 

Observa los cuatro sitios polimórficos (posiciones donde alguien difiere de ti, en las posiciones 3, 7, 13 y 19 anteriores). Ahora compara cada par de secuencias y calcula el número promedio de polimorfismos entre ellas. Hay que realizar diez comparaciones de "cinco sobre dos". ¡La persona Y eres tú!

Tú vs A: 3 polimorfismos

Persona Y 00000 00000 00000 00000 Persona A 00100 00000 00100 00010

Tú vs B: 2 polimorfismos

Persona Y 00000 00000 00000 00000 Persona B 00000 00000 00100 00010

Tú vs C: 2 polimorfismos

Persona Y 00000 00000 00000 00000 Persona C 00000 01000 00000 00010

Tú contra D: 3 polimorfismos

Persona Y 00000 00000 00000 00000 Persona D 00000 01000 00100 00010

A vs B: 1 polimorfismo

Persona A 00100 00000 00100 00010 Persona B 00000 00000 00100 00010

A vs C: 3 polimorfismos

Persona A 00100 00000 00100 00010 Persona C 00000 01000 00000 00010

A vs D: 2 polimorfismos

Persona A 00100 00000 00100 00010 Persona D 00000 01000 00100 00010

B vs C: 2 polimorfismos

Persona B 00000 00000 00100 00010 Persona C 00000 01000 00000 00010

B frente a D: 1 polimorfismo

Persona B 00000 00000 00100 00010 Persona D 00000 01000 00100 00010

C vs D: 1 polimorfismo

Persona C 00000 01000 00000 00010 Persona D 00000 01000 00100 00010

El número promedio de polimorfismos es3+2+2+3+1+3+2+2+1+110=2{\displaystyle {3+2+2+3+1+3+2+2+1+1 \over 10}=2}.

La segunda estimación del equilibrio es M=S/a1

Dado que había n=5 individuos y S=4 sitios de segregación

a1=1/1+1/2+1/3+1/4=2.08

M = 4 / 2,08 = 1,92

La d minúscula descrita anteriormente es la diferencia entre estos dos números: el número promedio de polimorfismos encontrados en la comparación por pares (2) y M. Por lo tanto,d=21,92=0,08{\displaystyle d=2-1.92=.08}.

Dado que se trata de una prueba estadística, es necesario evaluar la significancia de este valor. A continuación, se explica cómo hacerlo.

Interpretando la D de Tajima

Un valor negativo de la D de Tajima indica un exceso de polimorfismos de baja frecuencia con respecto a lo esperado, lo que sugiere una expansión del tamaño de la población (por ejemplo, tras un cuello de botella o una selección direccional ). Un valor positivo de la D de Tajima indica bajos niveles tanto de polimorfismos de baja como de alta frecuencia, lo que sugiere una disminución del tamaño de la población y/o selección equilibradora.

Sin embargo, esta interpretación solo debe hacerse si el valor D se considera estadísticamente significativo.

Determinación de la importancia

Es imposible calcular un valor p convencional asociado a cualquier valor D de Tajima obtenido de una muestra. En resumen, esto se debe a que no existe una forma de describir la distribución del estadístico que sea independiente del parámetro theta verdadero y desconocido (no existe una cantidad pivote). Para sortear este problema, se han propuesto varias opciones.

Al realizar una prueba estadística como la D de Tajima, la cuestión crucial es si el valor calculado para el estadístico es inesperado bajo un proceso nulo . Para la D de Tajima , se espera que la magnitud del estadístico aumente cuanto más se desvíen los datos del patrón esperado en una población que evoluciona según el modelo coalescente estándar.

Tajima (1989) halló una similitud empírica entre la distribución del estadístico de prueba y una distribución beta con media cero y varianza uno. Estimó theta tomando el estimador de Watterson y dividiéndolo por el número de muestras. Las simulaciones han demostrado que esta distribución es conservadora [ 3 ] , y ahora que la capacidad de cálculo es más accesible, esta aproximación no se utiliza con frecuencia.

En un artículo de Simonsen et al. [ 4 ] se presentó un enfoque más matizado. Estos autores propusieron construir un intervalo de confianza para el verdadero valor de theta y, a continuación, realizar una búsqueda exhaustiva en dicho intervalo para obtener los valores críticos en los que el estadístico es significativo por debajo de un valor alfa determinado. Un enfoque alternativo consiste en que el investigador realice la búsqueda exhaustiva sobre los valores de theta que considere plausibles, basándose en su conocimiento del organismo en estudio. Los enfoques bayesianos constituyen una extensión natural de este método.

Una regla general aproximada para determinar la significancia estadística es que los valores mayores que +2 o menores que -2 probablemente sean significativos. Esta regla se basa en las propiedades asintóticas de algunas estadísticas, por lo que +/- 2 no representa un valor crítico para una prueba de significancia.

Finalmente, se suelen realizar análisis genómicos del estadístico D de Tajima en ventanas deslizantes a lo largo de un segmento cromosómico. Con este método, se consideran significativas las regiones cuyo valor de D se desvía notablemente de la distribución empírica general de todas las ventanas. Si bien este método no evalúa la significancia en el sentido estadístico tradicional, resulta bastante potente para regiones genómicas extensas y es improbable que identifique erróneamente regiones de interés en un cromosoma si solo se informan los valores atípicos más significativos.

Véase también

Referencias

  1. Tajima, F. (noviembre de 1989). "Método estadístico para probar la hipótesis de mutación neutra mediante polimorfismo de ADN" . Genetics . 123 (3): 585–95 . doi : 10.1093/genetics/123.3.585 . PMC 1203831. PMID 2513255 .  
  2. ^ Elgvin, Tore O.; Tréveris, Cassandra N.; Tørresen, Ole K.; Hagen, Ingerid J.; Gravamen, Sigbjørn; Nederbragt, Alexander J.; Ravinet, Marcos; Jensen, Henrik; Sætre, Glenn-Peter (2 de junio de 2017). "El mosaicismo genómico de la especiación híbrida" . Avances científicos . 3 (6) e1602996. Código Bib : 2017SciA....3E2996E . doi : 10.1126/sciadv.1602996 . eISSN 2375-2548 . PMC 5470830 . PMID 28630911 .   
  3. Fu, YX.; Li, WH. (marzo de 1993). " Pruebas estadísticas de neutralidad de mutaciones" . Genetics . 133 (3): 693–709 . doi : 10.1093/genetics/133.3.693 . PMC 1205353. PMID 8454210 .  
  4. Simonsen, KL.; Churchill, GA.; Aquadro, CF. (septiembre de 1995). "Propiedades de las pruebas estadísticas de neutralidad para datos de polimorfismo de ADN" . Genetics . 141 ( 1): 413–29 . doi : 10.1093/genetics/141.1.413 . PMC 1206737. PMID 8536987 .  

Notas

  • Hartl, Daniel L.; Clark, Andrew G. (2007). Principios de genética de poblaciones (4.ª  ed.). Sinauer Associates. ISBN 978-0-87893-308-2.

Herramientas computacionales:

  • DNAsp (Windows)
  • Varisco (Mac OS X, Linux, Windows)
  • Arlequín (Ventanas)
  • Visualización en línea de los valores D de Tajima en el genoma humano.
  • Paquete Python3 para el cálculo de la D de Tajima
  • MEGA4 o MEGA5
  • Bio::PopGen::Statistics Archivado el 22/02/2014 en la Wayback Machine en BioPerl
  • Un vídeo explicativo sobre la D de Tajima y su aplicación a las secuencias de ADN está disponible en línea.
Obtenido de " https://en.wikipedia.org/w/index.php?title=Tajima%27s_D&oldid=1314686985 "