En estadística , la nueva prueba de rangos múltiples de Duncan ( MRT ) es un procedimiento de comparación múltiple desarrollado por David B. Duncan en 1955. La MRT de Duncan pertenece a la clase general de procedimientos de comparación múltiple que utilizan el estadístico de rango estudentizado q r para comparar conjuntos de medias.
David B. Duncan desarrolló esta prueba como una modificación del método Student-Newman-Keuls con mayor potencia estadística. La prueba MRT de Duncan ofrece una protección especial contra los errores de falso negativo (tipo II), aunque conlleva un mayor riesgo de errores de falso positivo (tipo I) . La prueba de Duncan se utiliza habitualmente en agronomía y otras investigaciones agrícolas.
El resultado de la prueba es un conjunto de subconjuntos de medias, donde en cada subconjunto se ha comprobado que las medias no son significativamente diferentes entre sí.
Esta prueba suele ir seguida de la metodología de Visualización Compacta de Letras (CLD, por sus siglas en inglés) , que hace que el resultado de dicha prueba sea mucho más accesible para un público no especializado en estadística.
Definición
Supuestos: 1. Una muestra de medias observadas , que se han extraído independientemente de n poblaciones normales con medias "verdaderas", respectivamente. 2. Un error estándar comúnEste error estándar es desconocido, pero se dispone de la estimación habitual., que es independiente de las medias observadas y se basa en una serie de grados de libertad , denotados por. (Más precisamente,, tiene la propiedad de que se distribuye comocongrados de libertad, independientemente de las medias de la muestra).
La definición exacta de la prueba es:
La diferencia entre dos medias cualesquiera en un conjunto de n medias es significativa siempre que el rango de cada subconjunto que contiene las medias dadas sea significativo según unaprueba de rango de nivel donde,yes el número de medias en el subconjunto en cuestión.
Excepción: La única excepción a esta regla es que ninguna diferencia entre dos medias puede declararse significativa si ambas medias en cuestión están contenidas en un subconjunto de las medias que tiene un rango no significativo.
Procedimiento
El procedimiento consiste en una serie de comparaciones por pares entre medias. Cada comparación se realiza a un nivel de significancia, definido por el número de medias que separan las dos medias comparadas (paraseparando medias). Las pruebas se realizan secuencialmente, donde el resultado de una prueba determina cuál se realiza a continuación.
Las pruebas se realizan en el siguiente orden: el mayor menos el menor, el mayor menos el segundo menor, hasta el mayor menos el segundo mayor; luego el segundo mayor menos el menor, el segundo mayor menos el segundo menor, y así sucesivamente, terminando con el segundo menor menos el menor.
Con una sola excepción, que se indica a continuación, cada diferencia es significativa si excede el rango significativo más corto correspondiente; de lo contrario, no es significativa. Donde el rango significativo más corto es el rango estudentizado significativo , multiplicado por el error estándar. El rango significativo más corto se designará como, dóndees el número de medias en el subconjunto. La única excepción a esta regla es que ninguna diferencia entre dos medias puede declararse significativa si ambas medias en cuestión están contenidas en un subconjunto de las medias cuyo rango no es significativo.
El algoritmo para realizar la prueba es el siguiente:
1. Clasifique las medias de la muestra, de mayor a menor. 2. Por cadaMedia de la muestra, de mayor a menor, haga lo siguiente: 2.1 para cada media de muestra, (denotada), para los más pequeños hasta. 2.1.1 comparara valor crítico, 2.1.2 sino excede el valor crítico, el subconjuntose declara que no es significativamente diferente : 2.1.2.1 Ir a la siguiente iteración del bucle 2. 2.1.3 De lo contrario, continúe con el bucle 2.1.
Valores críticos
La prueba de rangos múltiples de Duncan utiliza la distribución de rango estudentizada para determinar valores críticos en las comparaciones entre medias. Cabe destacar que las comparaciones entre medias pueden diferir en sus niveles de significancia, ya que estos dependen del tamaño del subconjunto de medias en cuestión.
Denotemoscomo elcuantil de la distribución de rango estudentizado , con p observaciones, ygrados de libertad para la segunda muestra (véase el rango estudentizado para más información). Denotemoscomo valor crítico estandarizado, dado por la regla:
Si p=2 Demás
El rango crítico más corto (el valor crítico real de la prueba) se calcula como : . Para->∞, existe una tabulación para un valor exacto de Q (ver enlace). Es necesario hacer una advertencia: las notaciones para Q y R no son las mismas en toda la literatura, donde Q a veces se denota como el intervalo significativo más corto, y R como el cuantil significativo para la distribución de rango estudentizado (el artículo de Duncan de 1955 utiliza ambas notaciones en diferentes partes).
Ejemplo numérico
Veamos el ejemplo de 5 tratamientos:
Con un error estándar de, y(grados de libertad para estimar el error estándar). Utilizando una tabulación conocida para Q, se obtienen los valores de:
Ahora podemos obtener los valores del rango significativo más corto, mediante la fórmula:
Alcanzando:
Luego, se prueban las diferencias observadas entre las medias, comenzando con la mayor frente a la menor, que se compararía con el rango menos significativo.A continuación, se calcula la diferencia entre el mayor y el segundo menor y se compara con la diferencia menos significativa.Si una diferencia observada es mayor que el intervalo significativo más corto correspondiente, concluimos que el par de medias en cuestión es significativamente diferente. Si una diferencia observada es menor que el intervalo significativo más corto correspondiente, todas las diferencias que comparten la misma media superior se consideran insignificantes, para evitar contradicciones (las diferencias que comparten la misma media superior son más cortas por definición). En nuestro caso, la comparación dará como resultado:
Observamos que existen diferencias significativas entre todos los pares de tratamientos, excepto (T3,T2) y (T5,T1). A continuación se muestra un gráfico que subraya las medias que no presentan diferencias significativas: T1 T5 T2 T3 T4
Niveles de protección y significancia basados en grados de libertad
La nueva prueba de rangos múltiples propuesta por Duncan utiliza niveles de protección especiales basados en grados de libertad . sea el nivel de protección para probar la significancia de una diferencia entre dos medias; es decir, la probabilidad de que no se encuentre una diferencia significativa entre dos medias si las medias poblacionales son iguales. Duncan razona que se tienen p-1 grados de libertad para probar p medias ordenadas, y por lo tanto se pueden realizar p-1 pruebas independientes, cada una con nivel de protección Por lo tanto, el nivel de protección conjunta es:
dónde
es decir, la probabilidad de que no se encuentren diferencias significativas al realizar p-1 pruebas independientes, cada una a nivel de protección., es , bajo la hipótesis de que todas las p medias poblacionales son iguales. En general: la diferencia entre dos medias cualesquiera en un conjunto de n medias es significativa siempre que el rango de cada subconjunto que contiene las medias dadas sea significativo según una–prueba de rango de nivel, donde p es el número de medias en el subconjunto en cuestión.
ParaEl nivel de protección se puede tabular para varios valores de r de la siguiente manera:
Cabe señalar que, si bien este procedimiento utiliza el rango estudentizado , su tasa de error no se basa ni en el experimento en su conjunto (como en el método de Tukey) ni en las comparaciones individuales. La prueba de rangos múltiples de Duncan no controla la tasa de error global . Consulte la sección de Crítica para obtener más detalles.
Procedimiento de comparación múltiple bayesiano de Duncan
Duncan (1965) también propuso el primer procedimiento bayesiano de comparaciones múltiples para comparaciones por pares entre las medias en un diseño unidireccional. Este procedimiento de comparaciones múltiples difiere del descrito anteriormente.
El método bayesiano MCP de Duncan analiza las diferencias entre las medias de grupos ordenados, donde las estadísticas en cuestión son comparaciones por pares (no se define un equivalente para la propiedad de que un subconjunto tenga una propiedad "significativamente diferente").
Duncan modeló las consecuencias de que dos o más medias sean iguales utilizando funciones de pérdida aditivas dentro y entre las comparaciones por pares . Si se asume la misma función de pérdida en todas las comparaciones por pares, solo es necesario especificar una constante K, que indica la gravedad relativa de los errores de tipo I frente a los de tipo II en cada comparación por pares.
Un estudio realizado por Juliet Popper Shaffer (1998) ha demostrado que el método propuesto por Duncan, modificado para proporcionar un control débil de FWE y utilizando una estimación empírica de la varianza de las medias poblacionales, tiene buenas propiedades tanto desde el punto de vista bayesiano, como método de riesgo mínimo, como desde el punto de vista frecuentista, con una buena potencia media.
Además, los resultados indican una similitud considerable tanto en el riesgo como en la potencia promedio entre el procedimiento modificado de Duncan y el procedimiento de control de la tasa de falsos descubrimientos de Benjamini y Hochberg (1995) , con el mismo control débil de errores familiares.
Crítica
La prueba de Duncan ha sido criticada por ser demasiado permisiva por muchos estadísticos, incluidos Henry Scheffé y John W. Tukey . Duncan argumentó que un procedimiento más permisivo era apropiado porque, en la práctica, la hipótesis nula global H₀ = "Todas las medias son iguales" suele ser falsa, y por lo tanto, los estadísticos tradicionales sobreprotegen una hipótesis nula probablemente falsa contra los errores de tipo I. Según Duncan, se deben ajustar los niveles de protección para diferentes comparaciones de p-medias según el problema en cuestión. El ejemplo que Duncan analizó en su artículo de 1955 es una comparación de muchas medias (es decir, 100), cuando solo interesan las comparaciones de dos y tres medias, y las comparaciones generales de p-medias (decidir si existe alguna diferencia entre p-medias) no son de especial interés (si p es 15 o más, por ejemplo). La prueba de rangos múltiples de Duncan es muy "permisiva" en términos de errores de tipo I. El siguiente ejemplo ilustrará por qué:
Supongamos que uno está realmente interesado, como sugirió Duncan, solo en la clasificación correcta de subconjuntos de tamaño 4 o inferior. Supongamos también que uno realiza la comparación simple por pares con un nivel de protección.Dado un conjunto total de 100 medias, analicemos las hipótesis nulas de la prueba:
Hay hipótesis nulas para la correcta clasificación de cada 2 medias. El nivel de significancia de cada hipótesis es
Hay Hipótesis nulas para la correcta clasificación de cada una de las 3 medias. El nivel de significancia de cada hipótesis es
Hay Hipótesis nulas para la correcta clasificación de cada una de las 4 medias. El nivel de significancia de cada hipótesis es
Como podemos ver, la prueba tiene dos problemas principales en lo que respecta a los errores de tipo I:
- Las pruebas de Duncan se basan en el procedimiento de Newman-Keuls , que no protege la tasa de error global (aunque sí protege el nivel alfa por comparación).
- La prueba de Duncan eleva intencionalmente los niveles alfa ( tasa de error de tipo I ) en cada paso del procedimiento de Newman-Keuls (niveles de significancia de).
Por lo tanto, se recomienda no utilizar el procedimiento descrito.
Posteriormente, Duncan desarrolló la prueba de Duncan-Waller, que se basa en principios bayesianos. Esta prueba utiliza el valor F obtenido para estimar la probabilidad a priori de que la hipótesis nula sea verdadera.
Diferentes enfoques para abordar el problema
Si aún se desea abordar el problema de encontrar subconjuntos similares de medias de grupos, se pueden encontrar otras soluciones en la literatura.
La prueba de rango de Tukey se utiliza comúnmente para comparar pares de medias; este procedimiento controla la tasa de error global en el sentido estricto.
Otra solución es realizar la prueba t de Student de todos los pares de medias y luego utilizar el procedimiento de control FDR (para controlar la proporción esperada de hipótesis nulas rechazadas incorrectamente ).
Otras posibles soluciones, que no incluyen pruebas de hipótesis , pero que dan como resultado una partición de subconjuntos, incluyen el agrupamiento y el agrupamiento jerárquico . Estas soluciones difieren del enfoque presentado en este método:
- Al basarse en la distancia/densidad, y no en la distribución.
- Necesitar un grupo más grande de medias para producir resultados significativos o trabajar con el conjunto de datos completo .
Referencias
- Duncan, DB (1955). "Pruebas de rango múltiple y pruebas F múltiples". Biometrics . 11 (1): 1– 42. doi : 10.2307/3001478 . JSTOR 3001478 .
- Shaffer, Juliet Popper (1999). "Un estudio semibayesiano del procedimiento de comparación múltiple bayesiano de Duncan". Journal of Statistical Planning and Inference . 82 ( 1– 2): 197– 213. doi : 10.1016/S0378-3758(99)00042-7 .
- Berry, Donald A.; Hochberg, Yosef (1999). "Perspectivas bayesianas sobre comparaciones múltiples". Journal of Statistical Planning and Inference . 82 ( 1– 2): 215– 227. doi : 10.1016/S0378-3758(99)00044-0 .
- Parsad, Rajender. "Procedimientos de comparación múltiple" (Documento). IASRI, Library Avenue, Nueva Delhi 110012.
- Tablas para el uso del rango y el rango estudentizado en pruebas de hipótesis
- H. Leon Harter, Champaigne, IL; N. Balakrishnan, Universidad McMaster, Hamilton, Ontario, Canadá; Tapa dura - Publicado el 27 de octubre de 1997
Enlaces externos
- Valores críticos para las pruebas de rangos múltiples de Duncan
- Pruebas estadísticas
- Comparaciones múltiples