Articulo de referencia

Prueba de tendencia de Jonckheere

En estadística , la prueba de tendencia de Jonckheere [ 1 ] (a veces llamada prueba de Jonckheere-Terpstra [ 2 ] ) es una prueba para una hipótesis alternativa ordenada dentro d...

En estadística , la prueba de tendencia de Jonckheere [ 1 ] (a veces llamada prueba de Jonckheere-Terpstra [ 2 ] ) es una prueba para una hipótesis alternativa ordenada dentro de un diseño de muestras independientes (entre participantes). Es similar a la prueba de Kruskal-Wallis en que la hipótesis nula es que varias muestras independientes provienen de la misma población. Sin embargo, con la prueba de Kruskal-Wallis no hay un ordenamiento a priori de las poblaciones de las que se extraen las muestras. Cuando hay un ordenamiento a priori , la prueba de Jonckheere tiene mayor potencia estadística que la prueba de Kruskal-Wallis. La prueba fue desarrollada por Aimable Robert Jonckheere , quien fue psicólogo y estadístico en el University College London .

Las hipótesis nula y alternativa pueden expresarse convenientemente en términos de medianas poblacionales para k poblaciones (donde k > 2). Siendo θ i la mediana poblacional para la i -ésima población, la hipótesis nula es:

H0:θ1=θ2==θk{\displaystyle H_{0}:\theta _{1}=\theta _{2}=\cdots =\theta _{k}}

La hipótesis alternativa es que las medianas de la población tienen un orden a priori, por ejemplo:

HA:θ1{\displaystyle H_{A}:\theta _{1}}θ2{\displaystyle \theta _{2}}{\displaystyle \cdots }θk{\displaystyle \theta _{k}}

con al menos una desigualdad estricta.

Procedimiento

La prueba puede considerarse un caso especial del método más general de correlación de rangos de Maurice Kendall [ 3 ] y utiliza el estadístico S de Kendall . Este se puede calcular de dos maneras:

El método de "conteo directo"

  1. Ordena las muestras en el orden previsto.
  2. Para cada puntuación , por turno, cuenta cuántas puntuaciones en las muestras de la derecha son mayores que la puntuación en cuestión. Esto es P.
  3. Para cada puntuación , por turno, cuenta cuántas puntuaciones en las muestras de la derecha son menores que la puntuación en cuestión. Esto es Q.
  4. S = PQ

El método 'náutico'

  1. Convierta los datos en una tabla de contingencia ordenada , donde los niveles de la variable independiente aumenten de izquierda a derecha y los valores de la variable dependiente aumenten de arriba hacia abajo.
  2. Para cada entrada en la tabla, cuente todas las demás entradas que se encuentran al 'sureste' de la entrada en particular. Esto es P.
  3. Para cada entrada en la tabla, cuente todas las demás entradas que se encuentran al 'suroeste' de la entrada en particular. Esto es Q.
  4. S = PQ

Nótese que siempre habrá empates en la variable independiente (los individuos están "empatados" en el sentido de que pertenecen al mismo grupo), pero puede haber o no empates en la variable dependiente. Si no hay empates, o si los empates ocurren dentro de una muestra particular (lo cual no afecta el valor del estadístico de prueba), se dispone de tablas exactas de S ; por ejemplo, Jonckheere [ 1 ] proporcionó tablas seleccionadas para valores de k de 3 a 6 y tamaños de muestra iguales ( m ) de 2 a 5. Leach presentó valores críticos de S para k = 3 con tamaños de muestra que van de 2,2,1 a 5,5,5. [ 4 ]

Aproximación normal a S

La distribución normal estándar se puede utilizar para aproximar la distribución de S bajo la hipótesis nula en los casos en que no se dispone de tablas exactas. La media de la distribución de S siempre será cero, y suponiendo que no hay empates entre los valores de dos (o más) muestras diferentes, la varianza viene dada por

VAR(S)=2(norte3ti3)+3(norte2ti2)18{\displaystyle \operatorname {VAR} (S)={\frac {2(n^{3}-\sum t_{i}^{3})+3(n^{2}-\sum t_{i}^{2})}{18}}}

Donde n es el número total de puntuaciones y t i es el número de puntuaciones en la i-ésima muestra. La aproximación a la distribución normal estándar se puede mejorar mediante el uso de una corrección de continuidad: S c = | S | – 1. Por lo tanto, se resta 1 a un valor S positivo y se suma 1 a un valor S negativo . El equivalente de la puntuación z viene dado entonces por

z=SdoVAR(S){\displaystyle z={\frac {S_{c}}{\sqrt {\operatorname {VAR} (S)}}}}

Corbatas

Si las puntuaciones están empatadas entre los valores de dos (o más) muestras diferentes, no existe una tabla exacta para la distribución S y se debe utilizar una aproximación a la distribución normal. En este caso, no se aplica ninguna corrección de continuidad al valor de S y la varianza viene dada por

VAR(S)=2(norte3ti3i3)+3(norte2ti2i2)+5norte18+(ti33ti2+2norte)(i33i2+2norte)9norte(norte1)(norte2)+(ti2norte)(i2norte)2norte(norte1){\displaystyle {\begin{aligned}\operatorname {VAR} (S)=&{\frac {2\left(n^{3}-\sum t_{i}^{3}-\sum u_{i}^{3}\right)+3\left(n^{2}-\sum t_{i}^{2}-\sum u_{i}^{2}\right)+5n}{18}}\\&{}+{\frac {\left(\sum t_{i}^{3}-3\sum t_{i}^{2}+2n\right)\left(\sum u_{i}^{3}-3\sum u_{i}^{2}+2n\right)}{9n(n-1)(n-2)}}\\&{}+{\frac {\left(\sum t_{i}^{2}-n\right)\left(\sum u_{i}^{2}-n\right)}{2n(n-1)}}\end{aligned}}}

donde t i es un total marginal de fila y u i un total marginal de columna en la tabla de contingencia. El equivalente de la puntuación z viene dado por

z=SVAR(S){\displaystyle z={\frac {S}{\sqrt {\operatorname {VAR} (S)}}}}

Un ejemplo numérico

En una replicación parcial de un estudio de Loftus y Palmer, los participantes fueron asignados aleatoriamente a uno de tres grupos y luego se les mostró una película de dos autos chocando entre sí. [ 5 ] Después de ver la película, a los participantes de un grupo se les hizo la siguiente pregunta: "¿Aproximadamente a qué velocidad iban los autos cuando entraron en contacto?" A los participantes de un segundo grupo se les preguntó: "¿Aproximadamente a qué velocidad iban los autos cuando chocaron entre sí?" A los participantes del tercer grupo se les preguntó: "¿Aproximadamente a qué velocidad iban los autos cuando chocaron entre sí?" Loftus y Palmer predijeron que el verbo de acción utilizado (en contacto, chocaron, chocaron) influiría en las estimaciones de velocidad en millas por hora (mph), de modo que los verbos de acción que implican mayor energía conducirían a velocidades estimadas más altas. Se obtuvieron los siguientes resultados (datos simulados):

El método de "conteo directo"

  • Las muestras ya están en el orden previsto.
  • Para cada puntuación, por turno, cuente cuántas puntuaciones en las muestras de la derecha son mayores que la puntuación en cuestión para obtener P :
P = 8 + 7 + 7 + 7 + 4 + 4 + 3 + 3 = 43
  • Para cada puntuación, por turno, cuente cuántas puntuaciones en las muestras de la derecha son menores que la puntuación en cuestión para obtener Q :
Q = 0 + 0 + 1 + 1 + 0 + 0 + 0 + 1 = 3
  • S = P - Q = 43 - 3
  • S = 40

El método 'náutico'

  • Convierta los datos en una tabla de contingencia ordenada.
  • Para cada entrada de la tabla, cuente todas las demás entradas que se encuentran al 'sureste' de la entrada en cuestión. Esto es P :
P = (1 × 8) + (1 × 7) + (1 × 7) + (1 × 7) + (1 × 4) + (1 × 4) + (1 × 3) + (1 × 3) = 43
  • Para cada entrada en la tabla, cuente todas las demás entradas que se encuentran al 'suroeste' de la entrada en particular. Esta es la pregunta :
Q = (1 × 2) + (1 × 1) = 3
  • S = PQ = 43 − 3
  • S = 40

Utilizando tablas exactas

Cuando los empates entre muestras son pocos (como en este ejemplo), Leach sugirió que ignorar los empates y usar tablas exactas proporcionaría un resultado razonablemente preciso. [ 4 ] Jonckheere sugirió romper los empates contra la hipótesis alternativa y luego usar tablas exactas. [ 1 ] En el ejemplo actual donde las puntuaciones empatadas solo aparecen en grupos adyacentes, el valor de S no cambia si los empates se rompen contra la hipótesis alternativa. Esto puede verificarse sustituyendo 11  mph en lugar de 12  mph en la muestra Bumped, y 19  mph en lugar de 20  mph en la muestra Smashed y recalculando el estadístico de prueba. De tablas con k = 3, y m = 4, el valor crítico de S para α = 0,05 es 36 y por lo tanto el resultado se declararía estadísticamente significativo a este nivel.

Cálculo de una aproximación normal estándar

Comonorte=12{\displaystyle n=12},norte2=144{\displaystyle n^{2}=144}, ynorte3=1728{\displaystyle n^{3}=1728}, y

ti2=16,{\displaystyle \sum t_{i}^{2}=16,}
ti3=24,{\displaystyle \sum t_{i}^{3}=24,}
i2=48,{\displaystyle \sum u_{i}^{2}=48,}
i3=192,{\displaystyle \sum u_{i}^{3}=192,}

La varianza de S es entonces

VAR(S)=2(172824192)+3(1441648)+6018+(2448+24)(192144+24)9×12×11×10+(1612)(4812)2×12×11=185.212{\displaystyle {\begin{aligned}\operatorname {VAR} (S)=&{\frac {2(1728-24-192)+3(144-16-48)+60}{18}}\\&+{\frac {(24-48+24)(192-144+24)}{9\times 12\times 11\times 10}}\\&+{\frac {(16-12)(48-12)}{2\times 12\times 11}}\\&=185.212\end{aligned}}}

Y z viene dado por

z=SVAR(S)=40185.212=2.939{\displaystyle z={\frac {S}{\sqrt {\operatorname {VAR} (S)}}}={\frac {40}{\sqrt {185.212}}}=2.939}

Para α = 0,05 (unilateral), el valor crítico de z es 1,645, por lo que, nuevamente, el resultado se consideraría significativo a este nivel. Page desarrolló una prueba similar para la tendencia en el contexto de diseños de medidas repetidas (intrasujetos) y basada en el coeficiente de correlación de rangos de Spearman . [ 6 ]

Véase también

Referencias

  1. 1 2 3 Jonckheere, AR (1954). "Una prueba de k muestras no paramétrica contra alternativas ordenadas". Biometrika . 41 : 133– 145. doi : 10.2307/2333011 .
  2. Terpstra, TJ (1952). "La normalidad asintótica y la consistencia de la prueba de Kendall contra la tendencia, cuando hay empates en una clasificación" (PDF) . Indagationes Mathematicae . 14 : 327–333 .
  3. Kendall, MG (1962). Métodos de correlación de rangos (3.ª ed.). Londres: Charles Griffin. 
  4. 1 2 Leach, C. (1979). Introducción a la estadística: un enfoque no paramétrico para las ciencias sociales . Chichester: John Wiley.
  5. Loftus, EF; Palmer, JC (1974). "Reconstrucción de la destrucción de un automóvil: un ejemplo de la interacción entre el lenguaje y la memoria". Journal of Verbal Learning and Verbal Behavior . 13 : 585–589 . doi : 10.1016/S0022-5371(74)80011-3 .
  6. Page, EB (1963). "Hipótesis ordenadas para tratamientos múltiples: una prueba de significancia para rangos lineales". Journal of the American Statistical Association . 58 (301): 216– 30. doi : 10.2307/2282965 .

Lecturas adicionales

  • Daniel, Wayne W. (1990). "Jonckheere-Terpstra tst para alternativas ordenadas" . Estadística no paramétrica aplicada (2ª  ed.). Boston: PWS-Kent. págs. 234-240 . ISBN  0-534-91976-6.