Articulo de referencia

Control genómico

El control genómico (CG) es un método estadístico que se utiliza para controlar los efectos de confusión de la estratificación poblacional en estudios de asociación genética . E...

El control genómico (CG) es un método estadístico que se utiliza para controlar los efectos de confusión de la estratificación poblacional en estudios de asociación genética . El método fue descrito originalmente por Bernie Devlin y Kathryn Roeder en un artículo de 1999. [ 1 ] Consiste en utilizar un conjunto de marcadores genéticos anónimos para estimar el efecto de la estructura poblacional en la distribución del estadístico chi-cuadrado . La distribución del estadístico chi-cuadrado para un alelo dado que se sospecha que está asociado con un rasgo dado se puede comparar con la distribución del mismo estadístico para un alelo que se espera que no esté relacionado con el rasgo. [ 2 ] [ 3 ] Se supone que el método implica el uso de marcadores que no están ligados al marcador que se está probando para una posible asociación. [ 4 ] En teoría, aprovecha la tendencia de la estructura poblacional a causar sobredispersión de los estadísticos de prueba en los análisis de asociación. [ 5 ] El método de control genómico es tan robusto como los diseños basados ​​en familias, a pesar de aplicarse a datos basados ​​en poblaciones. [ 6 ] Tiene el potencial de conducir a una disminución en el poder estadístico para detectar una asociación verdadera, y también puede no eliminar los efectos de sesgo de la estratificación poblacional. [ 7 ] Una forma más robusta del método de control genómico se puede realizar expresando la asociación que se está estudiando como dos pruebas de tendencia de Cochran-Armitage , y luego aplicando el método a cada prueba por separado. [ 8 ]

La suposición de homogeneidad poblacional en los estudios de asociación, especialmente en los estudios de casos y controles, puede incumplirse fácilmente y dar lugar a errores de tipo I y tipo II . Por lo tanto, es importante que los modelos utilizados en el estudio compensen la estructura poblacional. El problema en los estudios de casos y controles es que, si existe una implicación genética en la enfermedad, es más probable que la población de casos esté emparentada que los individuos de la población de control. Esto significa que se incumple la suposición de independencia de las observaciones. A menudo, esto conlleva una sobreestimación de la significación de una asociación, pero depende de la forma en que se haya seleccionado la muestra. Si, por casualidad, existe una mayor frecuencia alélica en una subpoblación de los casos, se encontrará una asociación con cualquier rasgo que sea más prevalente en la población de casos. [ 9 ] Este tipo de asociación espuria aumenta a medida que crece la población de la muestra, por lo que el problema debería ser de especial preocupación en los estudios de asociación a gran escala, cuando los loci solo causan efectos relativamente pequeños sobre el rasgo. Devlin y Roeder (1999) desarrollaron un método que, en algunos casos, puede compensar los problemas descritos anteriormente. [ 10 ] Utiliza un enfoque tanto frecuentista como bayesiano (este último es apropiado cuando se trata de un gran número de genes candidatos ).

El método frecuentista para corregir la estructura poblacional funciona utilizando marcadores que no están ligados al rasgo en cuestión para corregir cualquier inflación de la estadística causada por la estructura poblacional. El método se desarrolló inicialmente para rasgos binarios, pero desde entonces se ha generalizado para rasgos cuantitativos. [ 11 ] Para el rasgo binario, que se aplica a la búsqueda de diferencias genéticas entre las poblaciones de casos y controles, Devlin y Roeder (1999) utilizan la prueba de tendencia de Armitage.

Y2=norte(norte(r1+2r2)R(norte1+2norte2))2R(norteR)(norte(norte1+4norte2)(norte1+2norte2)2){\displaystyle Y^{2}={\frac {N(N(r_{1}+2r_{2})-R(n_{1}+2n_{2}))^{2}}{R(NR)(N(n_{1}+4n_{2})-(n_{1}+2n_{2})^{2})}}}

y elχ2{\displaystyle \chi ^{2}}prueba de frecuencias alélicas

χ2incógnitaA2=2norte(2norte(r1+2r2)R(norte1+2norte2))24R(norteR)(2norte(norte1+2norte2)(norte1+2norte2)2){\displaystyle \chi ^{2}\sim X_{A}^{2}={\frac {2N(2N(r_{1}+2r_{2})-R(n_{1}+2n_{2}))^{2}}{4R(NR)(2N(n_{1}+2n_{2})-(n_{1}+2n_{2})^{2})}}}

Si la población está en equilibrio de Hardy-Weinberg, las dos estadísticas son aproximadamente iguales. Bajo la hipótesis nula de que no existe estratificación poblacional, la prueba de tendencia es asintótica.χ2{\displaystyle \chi ^{2}}distribución con un grado de libertad. La idea es que la estadística se infla por un factor.λ{\displaystyle \lambda }de modo queY2λχ12{\displaystyle Y^{2}\sim \lambda \chi _{1}^{2}}dóndeλ{\displaystyle \lambda }depende del efecto de la estratificación. El método anterior se basa en los supuestos de que el factor de inflaciónλ{\displaystyle \lambda }es constante, lo que significa que los loci deberían tener tasas de mutación aproximadamente iguales, no deberían estar bajo una selección diferente en las dos poblaciones, y la cantidad de desequilibrio de Hardy-Weinberg medida en el coeficiente de endogamia F de Wright no debería diferir entre los diferentes loci. Este último punto es el de mayor preocupación. Si el efecto de la estratificación es similar en los diferentes lociλ{\displaystyle \lambda }se puede estimar a partir de los marcadores no ligados

λ^=mediana(Y12,Y22,,YL2)0,456{\displaystyle {\widehat {\lambda }}={\frac {\operatorname {median} (Y_{1}^{2},Y_{2}^{2},\ldots ,Y_{L}^{2})}{0.456}}}

donde L es el número de marcadores no vinculados. El denominador se deriva de la distribución gamma como un estimador robusto deλ{\displaystyle \lambda }Se han sugerido otros estimadores; por ejemplo, Reich y Goldstein [ 12 ] sugirieron utilizar la media de las estadísticas en su lugar. Esta no es la única forma de estimar.λ{\displaystyle \lambda }pero según Bacanu et al. [ 13 ] es una estimación apropiada incluso si algunos de los marcadores no ligados están realmente en desequilibrio con un locus causante de la enfermedad o están ellos mismos asociados con la enfermedad. Bajo la hipótesis nula y al corregir la estratificación usando L genes no ligados,Y2{\displaystyle Y^{2}}es aproximadamenteχ12{\displaystyle \chi _{1}^{2}}distribuido. Con esta corrección, la tasa de error de tipo I general debería ser aproximadamente igual aα{\displaystyle \alpha }incluso cuando la población está estratificada. Devlin y Roeder (1999) [ 10 ] consideraron principalmente la situación dondeα=0,05{\displaystyle \alpha =0.05}da un nivel de confianza del 95% y no valores p más pequeños. Marchini et al. (2004) [ 14 ] demuestran mediante simulación que el control genómico puede conducir a un valor p anticonservador si este valor es muy pequeño y las dos poblaciones (caso y control) son extremadamente distintas. Esto fue especialmente problemático si el número de marcadores no ligados estaba en el orden de 50-100. Esto puede resultar en falsos positivos (a ese nivel de significancia).

Referencias

  1. Devlin, Bernie ; Roeder, Kathryn (1999). "Control genómico para estudios de asociación". Biometrics . 55 ( 4 ): 997–1004 . CiteSeerX 10.1.1.420.1751 . doi : 10.1111/j.0006-341X.1999.00997.x . ISSN 1541-0420 . PMID 11315092. S2CID 6297807 .    
  2. Donnelly, Peter ; Phillips, Michael S.; Cardon, Lon R.; Marchini, Jonathan (mayo de 2004). "Los efectos de la estructura de la población humana en los grandes estudios de asociación genética" . Nature Genetics . 36 (5): 512– 517. doi : 10.1038/ng1337 . ISSN 1546-1718 . PMID 15052271 .  
  3. Altshuler, David ; Hirschhorn, Joel N.; Henderson, Brian; Sklar, Pamela ; Lander, Eric S.; Kolonel, Laurence N.; Petryshen, Tracey L.; Pato, Michele T.; Pato, Carlos N. (abril de 2004). "Evaluación del impacto de la estratificación poblacional en los estudios de asociación genética" . Nature Genetics . 36 (4): 388–393 . doi : 10.1038/ng1333 . ISSN 1546-1718 . PMID 15052270 .  
  4. Krawczak, Michael; Dempfle, Astrid; Lieb, Wolfgang; Freitag-Wolf, Sandra; Yadav, Pankaj (2015-10-01). "Permitiendo la estratificación poblacional en estudios de solo casos de interacción gen-ambiente, utilizando control genómico". Human Genetics . 134 (10): 1117– 1125. doi : 10.1007/s00439-015-1593-y . ISSN 1432-1203 . PMID 26297539 . S2CID 18146948 .   
  5. Devlin, Bernie; Roeder, Kathryn; Wasserman, Larry (2001-11-01). "Control genómico, un nuevo enfoque para los estudios de asociación basados ​​en la genética" . Theoretical Population Biology . 60 (3): 155– 166. doi : 10.1006/tpbi.2001.1542 . ISSN 0040-5809 . PMID 11855950. S2CID 11547174 .   
  6. Roeder, Kathryn; Devlin, B.; Bacanu, Silviu-Alin (2000-06-01). "El poder del control genómico" . The American Journal of Human Genetics . 66 (6): 1933– 1944. doi : 10.1086/302929 . ISSN 1537-6605 . PMC 1378064. PMID 10801388 .   
  7. Greenberg, David A.; Zhang, Junying; Shmulewitz, Dvora (2004). "Estudios de asociación de casos y controles en poblaciones mixtas: corrección mediante control genómico". Human Heredity . 58 ( 3–4 ): 145–153 . doi : 10.1159/000083541 . ISSN 1423-0062 . PMID 15812171. S2CID 24635575 .   
  8. Gastwirth, Joseph L.; Freidlin, Boris; Zheng, Gang (1 de febrero de 2006). "Control genómico robusto para estudios de asociación" . The American Journal of Human Genetics . 78 (2): 350–356 . doi : 10.1086/500054 . ISSN 1537-6605 . PMC 1380242. PMID 16400614 .   
  9. Lander ES, Schork NJ (septiembre de 1994). "Análisis genético de rasgos complejos". Science . 265 (5181): 2037– 48. Bibcode : 1994Sci...265.2037L . doi : 10.1126/science.8091226 . PMID 8091226 . 
  10. 1 2 Devlin B, Roeder K (diciembre de 1999). "Control genómico para estudios de asociación". Biometrics . 55 (4): 997– 1004. doi : 10.1111/j.0006-341X.1999.00997.x . PMID 11315092 . S2CID 6297807 .  
  11. Bacanu SA, Devlin B, Roeder K (enero de 2002). " Estudios de asociación para rasgos cuantitativos en poblaciones estructuradas" . Epidemiología genética . 22 (1): 78– 93. doi : 10.1002/gepi.1045 . PMID 11754475. S2CID 3053350 .  
  12. Reich DE, Goldstein DB (enero de 2001). "Detección de asociación en un estudio de casos y controles corrigiendo la estratificación poblacional". Epidemiología genética . 20 (1): 4– 16. doi : 10.1002/1098-2272(200101)20:1 < 4::AID-GEPI2 > 3.0.CO ; 2-T . PMID 11119293 . S2CID 17480622 .  
  13. Bacanu SA, Devlin B, Roeder K (junio de 2000). " El poder del control genómico" . American Journal of Human Genetics . 66 (6): 1933– 44. doi : 10.1086/302929 . PMC 1378064. PMID 10801388 .  
  14. Marchini J, Cardon LR, Phillips MS, Donnelly P (mayo de 2004). "Los efectos de la estructura de la población humana en los grandes estudios de asociación genética" . Nature Genetics . 36 (5): 512–7 . doi : 10.1038/ng1337 . PMID 15052271. S2CID 11694537 .