La tasa de error familiar ( FWER , por sus siglas en inglés ) es un término estadístico que se refiere a la probabilidad de obtener uno o más falsos positivos, o errores de tipo I, al realizar pruebas de hipótesis múltiples . La FWER es una métrica que cuantifica el riesgo causado por las pruebas múltiples . Es la probabilidad de cometer uno o más errores de tipo I en todas las pruebas de una familia de comparaciones. [ 1 ] Controlar la FWER (por ejemplo, con correcciones de Bonferroni o Holm) es una forma de abordar el problema que generan las pruebas múltiples.
Tasas de error familiares y experimentales
John Tukey desarrolló en 1953 el concepto de tasa de error familiar como la probabilidad de cometer un error de tipo I entre un grupo específico, o "familia", de pruebas. [ 2 ] Ryan (1959) propuso el concepto relacionado de tasa de error experimental , que es la probabilidad de cometer un error de tipo I en un experimento dado. [ 3 ] Por lo tanto, una tasa de error experimental es una tasa de error familiar donde la familia incluye todas las pruebas que se realizan dentro de un experimento.
Como explicó Ryan (1959, nota al pie 3), un experimento puede contener dos o más familias de comparaciones múltiples, cada una de las cuales se relaciona con una inferencia estadística particular y cada una tiene su propia tasa de error familiar independiente. [ 3 ] Por lo tanto, las tasas de error familiares generalmente se basan en colecciones teóricamente informativas de comparaciones múltiples. En contraste, una tasa de error del experimento puede basarse en una colección de comparaciones simultáneas que se refieren a una gama diversa de inferencias separadas. Algunos han argumentado que puede no ser útil controlar la tasa de error del experimento en tales casos. [ 4 ] De hecho, Tukey sugirió que el control familiar era preferible en tales casos (Tukey, 1956, comunicación personal, en Ryan, 1962, p. 302). [ 5 ]
Fondo
Dentro del marco estadístico, existen varias definiciones para el término "familia":
- Hochberg y Tamhane (1987) definieron "familia" como "cualquier conjunto de inferencias para las cuales es significativo tener en cuenta alguna medida combinada de error". [ 4 ]
- Según Cox (2006), un conjunto de inferencias debe considerarse una familia: [ 6 ] : 7
- Para tener en cuenta el efecto de selección debido al dragado de datos
- Para asegurar la corrección simultánea de un conjunto de inferencias y garantizar así una decisión global correcta.
En resumen, una familia podría definirse mejor por la inferencia selectiva potencial a la que se enfrenta: una familia es el conjunto más pequeño de elementos de inferencia en un análisis, intercambiables en cuanto a su significado para el objetivo de la investigación, a partir del cual se podría hacer la selección de resultados para la acción, presentación o resaltado ( Yoav Benjamini ).
Clasificación de pruebas de hipótesis múltiples
La siguiente tabla define los posibles resultados al probar múltiples hipótesis nulas. Supongamos que tenemos m hipótesis nulas, denotadas por: H₁ , H₂ , ..., Hₘ . Mediante una prueba estadística , rechazamos la hipótesis nula si la prueba resulta significativa. No rechazamos la hipótesis nula si la prueba no es significativa. La suma de cada tipo de resultado para todas las Hᵢ produce las siguientes variables aleatorias:
- m es el número total de hipótesis probadas
- es el número de hipótesis nulas verdaderas , un parámetro desconocido
- es el número de hipótesis alternativas verdaderas
- V es el número de falsos positivos (error de tipo I) (también llamados "falsos descubrimientos").
- S es el número de verdaderos positivos (también llamados "verdaderos descubrimientos").
- T es el número de falsos negativos (error de tipo II).
- U es el número de verdaderos negativos
- es el número de hipótesis nulas rechazadas (también llamadas "descubrimientos", ya sean verdaderas o falsas)
En m pruebas de hipótesis de las cualesson hipótesis nulas verdaderas, R es una variable aleatoria observable y S , T , U y V son variables aleatorias no observables .
Definición
El FWER es la probabilidad de cometer al menos un error de tipo I en la familia,
o equivalentemente,
Por lo tanto, al asegurar, la probabilidad de cometer uno o más errores de tipo I en la familia se controla a nivel.
Un procedimiento controla el FWER en el sentido débil si el control FWER en el nivelestá garantizado solo cuando todas las hipótesis nulas son verdaderas (es decir, cuando, lo que significa que la " hipótesis nula global " es verdadera). [ 7 ]
Un procedimiento controla el FWER en sentido estricto si el control FWER en el nivelSe garantiza para cualquier configuración de hipótesis nulas verdaderas y falsas (ya sea que la hipótesis nula global sea verdadera o falsa). [ 7 ]
Procedimientos de control
Algunas soluciones clásicas que garantizan un nivel sólidoExisten soluciones más recientes para el control de FWER.
El procedimiento de Bonferroni
- Denotemos porel valor p para la prueba
- rechazarsi
El procedimiento Šidák
- Probar cada hipótesis en el niveles el procedimiento de pruebas múltiples de Sidak.
- Este procedimiento es más eficaz que el de Bonferroni, pero la mejora es pequeña.
- Este procedimiento puede fallar al controlar el FWER cuando las pruebas son negativamente dependientes.
Procedimiento de Tukey
- El procedimiento de Tukey solo es aplicable para comparaciones por pares.
- Se presupone la independencia de las observaciones que se están probando, así como la igualdad de variación entre las observaciones ( homoscedasticidad ).
- El procedimiento calcula para cada par el estadístico de rango estudentizado :dóndees la mayor de las dos medias que se comparan,es el más pequeño, yes el error estándar de los datos en cuestión.
- La prueba de Tukey es esencialmente una prueba t de Student , excepto que corrige la tasa de error familiar .
Procedimiento de reducción de Holm (1979)
- Comience ordenando los valores p (de menor a mayor).y sean las hipótesis asociadas
- Dejarsea el índice mínimo tal que
- Rechazar las hipótesis nulas. Sientonces ninguna de las hipótesis es rechazada.
Este procedimiento es uniformemente más potente que el procedimiento de Bonferroni. [ 8 ] La razón por la que este procedimiento controla la tasa de error global para las m hipótesis en el nivel α en sentido estricto es porque se trata de un procedimiento de prueba cerrado . Por lo tanto, cada intersección se prueba utilizando la prueba de Bonferroni simple.
Procedimiento de ascenso de Hochberg
El procedimiento escalonado de Yosef Hochberg (1988) se realiza utilizando los siguientes pasos: [ 9 ]
- Comience ordenando los valores p (de menor a mayor).y sean las hipótesis asociadas
- Para un dado, dejarser el más grandede tal manera que
- Rechazar las hipótesis nulas
El procedimiento de Hochberg es más potente que el de Holm. Sin embargo, mientras que el de Holm es un procedimiento de prueba cerrado (y, por lo tanto, al igual que el de Bonferroni, no tiene restricciones sobre la distribución conjunta de los estadísticos de prueba), el de Hochberg se basa en la prueba de Simes, por lo que solo es válido bajo dependencia no negativa. La prueba de Simes se deriva bajo el supuesto de pruebas independientes; [ 10 ] es conservadora para pruebas que son positivamente dependientes en cierto sentido [ 11 ] [ 12 ] y es anticonservadora para ciertos casos de dependencia negativa. [ 13 ] [ 14 ] Sin embargo, se ha sugerido que una versión modificada del procedimiento de Hochberg sigue siendo válida bajo dependencia negativa general. [ 15 ]
Corrección de Dunnett
Charles Dunnett (1955, 1966) describió un ajuste alternativo del error alfa cuando se comparan k grupos con el mismo grupo de control. Este método, conocido actualmente como la prueba de Dunnett, es menos conservador que el ajuste de Bonferroni.
Método de Scheffé
Procedimientos de remuestreo
Los procedimientos de Bonferroni y Holm controlan la FWER bajo cualquier estructura de dependencia de los valores p (o, equivalentemente, de los estadísticos de prueba individuales). Básicamente, esto se logra considerando una estructura de dependencia en el peor de los casos (que, para la mayoría de los fines prácticos, se aproxima a la independencia). Sin embargo, este enfoque es conservador si la dependencia es positiva. Por poner un ejemplo extremo, bajo una dependencia positiva perfecta, existe efectivamente una sola prueba y, por lo tanto, la FWER no se ve inflada.
Considerar la estructura de dependencia de los valores p (o de los estadísticos de prueba individuales) produce procedimientos más potentes. Esto se puede lograr aplicando métodos de remuestreo, como el bootstrapping y los métodos de permutación. El procedimiento de Westfall y Young (1993) requiere una condición que no siempre se cumple en la práctica (a saber, la pivotalidad de subconjuntos). [ 16 ] Los procedimientos de Romano y Wolf (2005a,b) prescinden de esta condición y, por lo tanto, son más generalmente válidos. [ 17 ] [ 18 ]
Procedimiento de valor p de media armónica
El procedimiento de valor p de media armónica (HMP) [ 19 ] [ 20 ] proporciona una prueba multinivel que mejora la potencia de la corrección de Bonferroni al evaluar la significancia de grupos de hipótesis mientras controla la tasa de error familiar en sentido estricto. La significancia de cualquier subconjuntodelLas pruebas se evalúan calculando el HMP para el subconjunto,dóndeson pesos que suman uno (es decir,). Un procedimiento aproximado que controla la tasa de error familiar en sentido fuerte a un nivel aproximadorechaza la hipótesis nula de que ninguno de los valores p en el subconjuntoson significativos cuando[ 21 ] (donde). Esta aproximación es razonable para valores pequeños(p.ej) y se vuelve arbitrariamente bueno comose aproxima a cero. También está disponible una prueba asintóticamente exacta (véase el artículo principal ).
Enfoques alternativos
El control FWER ejerce un control más estricto sobre los falsos descubrimientos en comparación con los procedimientos de tasa de falsos descubrimientos (FDR). El control FWER limita la probabilidad de al menos un falso descubrimiento, mientras que el control FDR limita (en un sentido amplio) la proporción esperada de falsos descubrimientos. Por lo tanto, los procedimientos FDR tienen mayor potencia a costa de mayores tasas de errores de tipo I , es decir, rechazar hipótesis nulas que en realidad son verdaderas. [ 22 ]
Por otro lado, el control de la tasa de error de tipo I (FWER) es menos estricto que el control de la tasa de error por familia, que limita el número esperado de errores por familia. Dado que el control de la FWER se centra en al menos un falso descubrimiento, a diferencia del control de la tasa de error por familia, no considera que múltiples falsos descubrimientos simultáneos sean peores que un solo falso descubrimiento. La corrección de Bonferroni a menudo se considera simplemente como un control de la FWER, pero de hecho también controla la tasa de error por familia. [ 23 ]
Referencias
- ↑ "Tasa de error familiar" . GeeksforGeeks . 8 de mayo de 2025. Consultado el 2 de noviembre de 2025 .
- ↑ Tukey, JW (1953). El problema de las comparaciones múltiples .Basado en Tukey (1953),
- 1 2 Ryan, Thomas A. (1959). "Comparación múltiple en la investigación psicológica". Psychological Bulletin . 56 (1). American Psychological Association (APA): 26– 47. doi : 10.1037/h0042478 . ISSN 1939-1455 . PMID 13623958 .
- 1 2 Hochberg, Y.; Tamhane, AC (1987). Procedimientos de comparación múltiple . Nueva York: Wiley. pág . 5. ISBN 978-0-471-82222-6.
- ↑ Ryan, TA (1962). "El experimento como unidad para calcular tasas de error". Psychological Bulletin . 59 (4): 301– 305. doi : 10.1037/h0040562 . PMID 14495585 .
- ↑ Cox (2006). Principios de inferencia estadística . Cambridge University Press. ISBN 978-0-511-34950-8.
- 1 2 Dmitrienko, Alex; Tamhane, Ajit; Bretz, Frank (2009). Problemas de pruebas múltiples en estadística farmacéutica (1.ª ed.). CRC Press. pág. 37. ISBN 9781584889847.
- ↑ Aickin, M; Gensler, H (1996). "Ajuste para pruebas múltiples al informar resultados de investigación: los métodos de Bonferroni vs Holm" . American Journal of Public Health . 86 (5): 726– 728. doi : 10.2105/ajph.86.5.726 . PMC 1380484. PMID 8629727 .
- ↑ Hochberg, Yosef (1988). "Un procedimiento Bonferroni más preciso para pruebas de significancia múltiples" (PDF) . Biometrika . 75 (4): 800– 802. doi : 10.1093/biomet/75.4.800 .
- ↑ Simes, RJ (1986). "Un procedimiento de Bonferroni mejorado para pruebas de significancia múltiples". Biometrika . 73 (3): 751– 754. doi : 10.1093/biomet/73.3.751 .
- ↑ Sarkar, Sanat K.; Chang, Chung-Kuei (1997). "El método Simes para pruebas de hipótesis múltiples con estadísticos de prueba positivamente dependientes". Journal of the American Statistical Association . 92 (440): 1601– 1608. doi : 10.1080/01621459.1997.10473682 .
- ↑ Sarkar, Sanat K. (1998). "Algunas desigualdades de probabilidad para variables aleatorias MTP2 ordenadas: una demostración de la conjetura de Simes". The Annals of Statistics . 26 (2): 494– 504. doi : 10.1214/aos/1028144846 .
- ↑ Samuel-Cahn, Ester (1996). "¿Es conservador el procedimiento de Bonferroni mejorado de Simes?". Biometrika . 83 (4): 928– 933. doi : 10.1093/biomet/83.4.928 .
- ↑ Block, Henry W.; Savits, Thomas H.; Wang, Jie (2008). "Dependencia negativa y la desigualdad de Simes". Journal of Statistical Planning and Inference . 138 (12): 4107– 4110. doi : 10.1016/j.jspi.2008.03.026 .
- ↑ Gou, Jiangtao; Tamhane, Ajit C. (2018). "Procedimiento de Hochberg bajo dependencia negativa" (PDF) . Statistica Sinica . 28 : 339–362 . doi : 10.5705/ss.202016.0306 (inactivo el 12 de julio de 2025).
{{cite journal}}: CS1 maint: DOI inactivo desde julio de 2025 ( enlace ) - ↑ Westfall, PH; Young, SS (1993). Resampling-Based Multiple Testing: Examples and Methods for p-Value Adjustment . Nueva York: John Wiley. ISBN 978-0-471-55761-6.
- ↑ Romano, JP; Wolf, M. (2005a). "Métodos de pasos descendentes exactos y aproximados para pruebas de hipótesis múltiples". Journal of the American Statistical Association . 100 (469): 94– 108. doi : 10.1198/016214504000000539 . hdl : 10230/576 . S2CID 219594470 .
- ↑ Romano, JP; Wolf, M. (2005b). "Pruebas múltiples por pasos como espionaje formalizado de datos". Econometrica . 73 (4): 1237– 1282. CiteSeerX 10.1.1.198.2473 . doi : 10.1111/j.1468-0262.2005.00615.x .
- ↑ Good, IJ (1958). "Pruebas de significancia en paralelo y en serie". Journal of the American Statistical Association . 53 (284): 799– 813. doi : 10.1080/01621459.1958.10501480 . JSTOR 2281953 .
- ↑ Wilson, DJ (2019). "El valor p de la media armónica para combinar pruebas dependientes" . Actas de la Academia Nacional de Ciencias de EE. UU . 116 ( 4): 1195–1200 . Bibcode : 2019PNAS..116.1195W . doi : 10.1073/pnas.1814092116 . PMC 6347718. PMID 30610179 .
- ↑ Ciencias, Academia Nacional de (22-10-2019). "Corrección para Wilson, El valor p de la media armónica para combinar pruebas dependientes" . Actas de la Academia Nacional de Ciencias . 116 (43): 21948. Bibcode : 2019PNAS..11621948. . doi : 10.1073/pnas.1914128116 . PMC 6815184. PMID 31591234 .
- ↑ Shaffer, JP (1995). "Prueba de hipótesis múltiples". Annual Review of Psychology . 46 : 561–584 . doi : 10.1146/annurev.ps.46.020195.003021 . hdl : 10338.dmlcz/142950 .
- ↑ Frane, Andrew (2015). "¿Son relevantes las tasas de error de tipo I por familia en las ciencias sociales y del comportamiento?" . Journal of Modern Applied Statistical Methods . 14 (1) jmasm.eP1855: 12– 23. doi : 10.22237/jmasm/1430453040 .
Enlaces externos
- Comprender la tasa de error familiar : publicación de blog que incluye su utilidad en relación con la tasa de falsos descubrimientos.
- Comparaciones múltiples
- Razones estadísticas