En estadística , la prueba de Barnard es una prueba exacta utilizada en el análisis de tablas de contingencia de 2 × 2 con un margen fijo. Las pruebas de Barnard son en realidad una clase de pruebas de hipótesis, también conocidas como pruebas exactas incondicionales para dos binomios independientes. [ 1 ] [ 2 ] [ 3 ] Estas pruebas examinan la asociación de dos variables categóricas y suelen ser una alternativa más potente que la prueba exacta de Fisher para tablas de contingencia de 2 × 2. Aunque fue publicada por primera vez en 1945 por GA Barnard , [ 4 ] [ 5 ] la prueba no ganó popularidad debido a la dificultad computacional de calcular el valor p y la desaprobación falaz de Fisher. Hoy en día, incluso para tamaños de muestra n ~ 1 millón, las computadoras a menudo pueden implementar la prueba de Barnard en unos pocos segundos o menos.
Propósito y alcance
La prueba de Barnard se utiliza para comprobar la independencia de filas y columnas en una tabla de contingencia de 2 × 2. La prueba presupone que cada respuesta es independiente. En el caso de la independencia, existen tres tipos de diseños de estudio que dan como resultado una tabla de 2 × 2 , y la prueba de Barnard se aplica al segundo tipo.
Para distinguir los diferentes tipos de diseños, supongamos que un investigador está interesado en comprobar si un nuevo tratamiento cura rápidamente una infección.
- Un posible diseño de estudio consistiría en seleccionar una muestra de 100 sujetos infectados y, para cada uno, determinar si recibieron el tratamiento novedoso o el tratamiento estándar anterior, y observar si la infección persiste tras un período de tiempo determinado. Este tipo de diseño es común en estudios transversales u "observaciones de campo", como en epidemiología .
- Otro posible diseño de estudio consistiría en administrar el tratamiento novedoso a 50 sujetos infectados y el tratamiento estándar a otros 50, y observar si la infección persiste tras un tiempo determinado. Este tipo de diseño es común en los ensayos clínicos .
- El diseño de estudio final posible consistiría en administrar el tratamiento novedoso a 50 sujetos infectados, el tratamiento estándar a otros 50 y detener el experimento una vez que un número predeterminado de sujetos se haya recuperado de la infección. Este tipo de diseño es poco común, pero tiene la misma estructura que el estudio de la mujer que probó el té, que llevó a R. A. Fisher a crear la prueba exacta de Fisher .
Aunque los resultados de cada diseño experimental se pueden presentar en tablas de 2 × 2 de apariencia casi idéntica , sus estadísticas son diferentes y, por lo tanto, los criterios para un resultado "significativo" son diferentes para cada uno:
- La probabilidad de una tabla de 2 × 2 bajo el primer diseño de estudio viene dada por la distribución multinomial ; donde el número total de muestras tomadas es la única restricción estadística. Esta es una forma de experimento no controlado, u "observación de campo", donde el experimentador simplemente "toma los datos tal como vienen". [ a ]
- El segundo diseño de estudio se obtiene mediante el producto de dos distribuciones binomiales independientes ; los totales en uno de los márgenes (ya sean los totales de fila o los totales de columna) están limitados por el diseño experimental, pero los totales en el otro margen son libres. Esta es, con mucho, la forma más común de diseño experimental, donde el experimentador limita parte del experimento, por ejemplo, asignando a la mitad de los sujetos a recibir un medicamento nuevo y a la otra mitad un medicamento convencional más antiguo, pero no tiene control sobre la cantidad de individuos en cada categoría controlada que se recuperan o sucumben a la enfermedad.
- El tercer diseño viene dado por la distribución hipergeométrica ; donde tanto el número total en cada columna como en cada fila están restringidos. Por ejemplo, a un individuo se le permite probar 8 vasos de refresco, pero debe asignar cuatro a cada categoría "marca X" y "marca Y", de modo que tanto los totales de fila como los totales de columna estén restringidos a cuatro. [ b ]
La diferencia operativa entre la prueba exacta de Barnard y la prueba exacta de Fisher radica en cómo manejan el parámetro o parámetros de perturbación de la probabilidad de éxito común al calcular el valor p . La prueba exacta de Fisher evita estimar el parámetro o parámetros de perturbación condicionando ambos márgenes, una estadística auxiliar aproximada que restringe los resultados posibles. El problema con este procedimiento de Fisher es que excluye algunos resultados que son posibles cuando no hay restricciones en el número total de elementos en cada columna y fila. La prueba de Barnard considera todos los valores posibles legítimos del parámetro o parámetros de perturbación y elige el o los valores que maximizan el valor p . La diferencia teórica entre las pruebas es que la prueba de Barnard utiliza la distribución binomial doble , mientras que la prueba de Fisher, debido al condicionamiento, utiliza la distribución hipergeométrica , lo que significa que los valores p estimados que produce no son correctos ; en general, son demasiado grandes, lo que hace que la prueba de Fisher sea demasiado "conservadora": propensa a errores de tipo II innecesarios (número excesivo de falsos negativos). Sin embargo, incluso cuando los datos provienen de una distribución binomial doble, el condicionamiento (que lleva a utilizar la distribución hipergeométrica para calcular el valor p exacto de Fisher ) produce una prueba válida, si se acepta que la prueba de Fisher necesariamente omitirá algunos resultados positivos. [ 3 ] La prueba de Barnard no está sesgada de esta manera y es más adecuada para una gama más amplia de tipos de experimentos, incluidos los más comunes, en los que no hay ninguna restricción experimental sobre la suma de filas o la suma de columnas de la tabla.
Ambas pruebas limitan la tasa de error de tipo I al nivel α y, por lo tanto, son técnicamente "válidas". Sin embargo, para el diseño de casi todos los experimentos realizados, la prueba de Barnard es mucho más potente que la de Fisher, porque considera tablas más "iguales o más extremas", al no imponer una restricción ("condicionamiento") en el segundo margen, que el procedimiento de la prueba de Fisher requiere y que no se usa con frecuencia en los diseños experimentales . De hecho, una variante de la prueba de Barnard, llamada prueba de Boschloo , es uniformemente más potente que la de Fisher. [ 6 ] La prueba de Barnard se ha utilizado junto con la prueba exacta de Fisher en la investigación de gestión de proyectos. [ 7 ]
Críticas
Bajo la presión de Fisher, Barnard retractó su prueba en un artículo publicado, [ 8 ] sin embargo, muchos investigadores prefieren la prueba exacta de Barnard sobre la prueba exacta de Fisher para analizar tablas de contingencia de 2 × 2 , [ 9 ] ya que sus estadísticas son más potentes para la gran mayoría de los diseños experimentales, mientras que las estadísticas de la prueba exacta de Fisher son conservadoras, lo que significa que la significancia mostrada por sus valores p es demasiado alta, lo que lleva al experimentador a descartar como insignificantes resultados que serían estadísticamente significativos utilizando las estadísticas doble binomiales de las pruebas de Barnard en lugar de las estadísticas hipergeométricas a menudo demasiado conservadoras de la prueba "exacta" de Fisher. Las pruebas de Barnard no son apropiadas en el raro caso de un diseño experimental que restringe ambos resultados marginales (por ejemplo, "pruebas de sabor" ); aunque raro, las restricciones impuestas experimentalmente en ambos totales marginales hacen que la verdadera distribución de muestreo para la tabla sea hipergeométrica .
La prueba de Barnard se puede aplicar a tablas más grandes, pero el tiempo de cálculo aumenta y la ventaja en potencia disminuye rápidamente. [ 10 ] Aún no está claro qué estadístico de prueba es preferible al implementar la prueba de Barnard; sin embargo, la mayoría de los estadísticos de prueba producen pruebas uniformemente más potentes que la prueba exacta de Fisher. [ 11 ]
Véase también
Notas a pie de página
- ↑ Para las observaciones de campo de datos con distribución multinomial, la prueba de chi-cuadrado es el método de análisis más utilizado; produce resultados estadísticamente correctos, pero se basa en una aproximación normal en lugar de estadísticas exactas. También se aplican otros métodos, que se analizan en el artículo sobre la prueba de chi-cuadrado de Pearson .
- ↑ El resultado experimental solo se revela en el interior de la tabla, con el recuento del número de tazasidentificado correcta o incorrectamente .
Referencias
- ↑ Mehrotra, DV; Chan, ISF; Berger, RL (2003). "Una nota de precaución sobre la inferencia incondicional exacta para una diferencia entre dos proporciones binomiales independientes" . Biometrics . 59 ( 2): 441– 450. doi : 10.1111/1541-0420.00051 . PMID 12926729. S2CID 28556526 .
- ↑ Ripamonti, E.; Lloyd, C.; Quatto, P. (2017). "Visiones frecuentistas contemporáneas del ensayo binomial 2 × 2 " . Statistical Science . 32 : 600–615 . doi : 10.1214/17-STS627 . hdl : 10281/182103 .
- 1 2 Fay, MP; Hunsberger, SA (2021). "Inferencias válidas prácticas para el problema binomial de dos muestras" . Statistics Surveys . 15. arXiv : 1904.05416 . doi : 10.1214/21-SS131 .
- ↑ Barnard, GA (1945). "Una nueva prueba para tablas de 2 × 2 " . Nature . 156 (3954): 177. doi : 10.1038/156177a0 . S2CID 186244479 .
- ↑ Barnard, GA (1947). "Pruebas de significancia para tablas de 2 × 2 ". Biometrika . 34 ( 1– 2): 123– 138. doi : 10.1093/biomet/34.1-2.123 . PMID 20287826 .
- ↑ Boschloo, RD (1970). "Nivel de significancia condicional elevado para la tabla 2 × 2 al probar la igualdad de dos probabilidades". Statistica Neerlandica . 24 : 1– 35. doi : 10.1111/j.1467-9574.1970.tb00104.x .
- ↑ Invernizzi, Diletta Colette; Locatelli, Giorgio; Brookes, Naomi J. (1 de enero de 2019). "Una exploración de la relación entre las características de los proyectos de desmantelamiento nuclear y el rendimiento de los costos" (PDF) . Progress in Nuclear Energy . 110 : 129–141 . Bibcode : 2019PNuE..110..129I . doi : 10.1016/j.pnucene.2018.09.011 . ISSN 0149-1970 . S2CID 125100734 .
- ↑ Barnard, GA (1949). "Inferencia estadística". Journal of the Royal Statistical Society . Serie B. 11 (2): 115– 149. doi : 10.1111/j.2517-6161.1949.tb00028.x .
- ↑ Lydersen, S.; Fagerland, MW; Laake, P. (2009). "Pruebas recomendadas para la asociación en tablas de 2x2". Statistics in Medicine . 28 (7): 1159– 1175. doi : 10.1002/sim.3531 . PMID 19170020. S2CID 3900997 .
- ↑ Mehta, CR; Hilton, JF (1993). "Potencia exacta de las pruebas condicionales e incondicionales: Más allá de la tabla de contingencia de 2 × 2 ". The American Statistician . 47 (2): 91– 98. doi : 10.1080/00031305.1993.10475946 .
- ↑ Berger, RL (1994). "Comparación de potencia de pruebas incondicionales exactas para comparar dos proporciones binomiales". Instituto de Estadística . Serie Mimeo. 2266 : 1–19 .
Enlaces externos
- "Implementación de la prueba exacta de Barnard usando R" (PDF) .
- Pruebas estadísticas para tablas de contingencia