The Mann–Whitney test (also called the Mann–Whitney–Wilcoxon (MWW/MWU), Wilcoxon rank-sum test, or Wilcoxon–Mann–Whitney test) is a nonparametricstatistical test of the null hypothesis that randomly selected values X and Y from two populations have the same distribution.
The value of U calculated by the test can be converted to a measure of effect size by dividing it by the maximum value of U, which is the product of the sizes of the two samples being compared. This measure is the probability that the value of a random observation from the higher group will be greater than that of a random observation from the lower group.[1]
Nonparametric tests used on two dependent samples are the sign test and the Wilcoxon signed-rank test.
Assumptions and formal statement of hypotheses
Henry Mann and Donald Ransom Whitney[2] developed the Mann–Whitney U test under the assumption of continuous responses with the alternative hypothesis being that one distribution is stochastically greater than the other. That is to say that the probability of a random observation from one group being larger than a random observation from the other group is 0.5. There are many other ways to formulate the null and alternative hypotheses such that the Mann–Whitney U test will give a valid test.[3]
A very general formulation is to assume the following conditions:
- All the observations from both groups are independent of each other,
- The responses are at least ordinal (i.e., one can at least say, of any two observations, which is the greater),
- Under the null hypothesis H0, the distributions of both populations are identical.[4]
- The alternative hypothesis H1 is that the distributions are not identical.
Under the general formulation, the test is only consistent when the following occurs under H1:
- La probabilidad de que una observación de la población X supere una observación de la población Y es diferente (mayor o menor) que la probabilidad de que una observación de Y supere una observación de X ; es decir, P( X > Y ) ≠ P( Y > X ) o P( X > Y ) + 0,5 · P( X = Y ) ≠ 0,5 .
Bajo supuestos más estrictos que la formulación general anterior, por ejemplo, si se supone que las respuestas son continuas y la alternativa se restringe a un cambio de ubicación, es decir, F 1 ( x ) = F 2 ( x + δ ) , podemos interpretar una prueba U de Mann-Whitney significativa como una diferencia en las medianas. Esta práctica se basa en supuestos estrictos sobre la distribución de los datos. Cuando este supuesto no se cumple, es sencillo demostrar que la prueba produce un resultado estadísticamente significativo cuando las medianas de los dos grupos son, de hecho, idénticas. Si se requiere una prueba de medianas, la regresión de cuantiles la evalúa explícitamente. [ 1 ]
Bajo este supuesto de cambio de localización, también podemos interpretar la prueba U de Mann-Whitney como una evaluación de si la estimación de Hodges-Lehmann de la diferencia en la tendencia central entre las dos poblaciones difiere de cero. La estimación de Hodges-Lehmann para este problema de dos muestras es la mediana de todas las diferencias posibles entre una observación de la primera muestra y una observación de la segunda muestra.
De lo contrario, si tanto la dispersión como la forma de la distribución de ambas muestras difieren, la prueba U de Mann-Whitney no cumple con los requisitos para comparar medianas. Es posible mostrar ejemplos donde las medianas son numéricamente iguales, mientras que la prueba rechaza la hipótesis nula con un valor p pequeño. [ 5 ] [ 6 ] [ 7 ]
La prueba U de Mann-Whitney /prueba de suma de rangos de Wilcoxon no es lo mismo que la prueba de rangos con signo de Wilcoxon , aunque ambas son no paramétricas e implican la suma de rangos . La prueba U de Mann-Whitney se aplica a muestras independientes. La prueba de rangos con signo de Wilcoxon se aplica a muestras emparejadas o dependientes.
Estadístico U
Aunque el artículo original de Mann y Whitney describía la prueba como una de superioridad estocástica —es decir, como una prueba para determinar si una observación de un grupo tenía más probabilidades de ser mayor que una observación del otro grupo—, el estadístico de prueba, U , no proporciona esta probabilidad. Esta probabilidad se puede calcular simplemente dividiendo U por su valor máximo, que es el producto de los tamaños de las dos muestras.
Dejarser grupo 1, una muestra iid de, yser grupo 2, una muestra iid dey supongamos que ambas muestras son independientes entre sí. El estadístico U de Mann-Whitney correspondiente se define como el menor de:
con
- siendo la suma de los rangos en los grupos 1 y 2, después de clasificar todas las muestras de ambos grupos de manera que el valor más pequeño obtenga el rango 1 y el más grande el rango. [ 8 ]
Estadística de área bajo la curva (AUC) para curvas ROC
La estadística U está relacionada con el área bajo la curva de características operativas del receptor ( AUC ): [ 9 ]
Nótese que esta es la misma definición que el tamaño del efecto del lenguaje común , es decir, la probabilidad de que un clasificador clasifique una instancia elegida al azar del primer grupo por encima de una instancia elegida al azar del segundo grupo. [ 10 ]
Debido a su forma probabilística, la estadística U puede generalizarse a una medida del poder de separación de un clasificador para más de dos clases: [ 11 ]
Donde c es el número de clases, y el término R k , ℓ de AUC k , ℓ considera solo la clasificación de los elementos que pertenecen a las clases k y ℓ (es decir, se ignoran los elementos que pertenecen a todas las demás clases) de acuerdo con las estimaciones del clasificador de la probabilidad de que esos elementos pertenezcan a la clase k . AUC k , k siempre será cero pero, a diferencia del caso de dos clases, generalmente AUC k , ℓ ≠ AUC ℓ , k , razón por la cual la medida M suma sobre todos los pares ( k , ℓ ), en efecto utilizando el promedio de AUC k , ℓ y AUC ℓ , k .
Cálculos
The test involves the calculation of a statistic, usually called U, whose distribution under the null hypothesis is known:
- In the case of small samples, the distribution is tabulated
- For sample sizes above ~20, approximation using the normal distribution is fairly good.
Alternatively, the null distribution can be approximated using permutation tests and Monte Carlo simulations.
Some books tabulate statistics equivalent to U, such as the sum of ranks in one of the samples, rather than U itself.
The Mann–Whitney U test is included in most statistical packages.
It is also easily calculated by hand, especially for small samples. There are multiple ways of doing this.
Method one:
For comparing two small sets of observations, a direct method is quick, and gives insight into the meaning of the U statistic, which corresponds to the number of wins out of all pairwise contests (see the tortoise and hare example under Examples below). For each observation in one set, count the number of times this first value wins over any observations in the other set (the other value loses if this first is larger). Count 0.5 for any ties. The sum of wins and ties is U (i.e., ) for the first set. U for the other set is the converse (i.e., ).
Method two:
For larger samples:
- Assign numeric ranks to all the observations (put the observations from both groups to one set), beginning with 1 for the smallest value. Where there are groups of tied values, assign a rank equal to the midpoint of unadjusted rankings (e.g., the ranks of (3, 5, 5, 5, 5, 8) are (1, 3.5, 3.5, 3.5, 3.5, 6), where the unadjusted ranks would be (1, 2, 3, 4, 5, 6)).
- Now, add up the ranks for the observations which came from sample 1. The sum of ranks in sample 2 is now determined, since the sum of all the ranks equals N(N + 1)/2 where N is the total number of observations.
- U is then given by:[12]
- where n1 is the sample size for sample 1, and R1 is the sum of the ranks in sample 1.
- Note that it doesn't matter which of the two samples is considered sample 1. An equally valid formula for U is
- The smaller value of U1 and U2 is the one used when consulting significance tables. The sum of the two values is given by
- The smaller value of U1 and U2 is the one used when consulting significance tables. The sum of the two values is given by
- Sabiendo que R 1 + R 2 = N ( N + 1)/2 y N = n 1 + n 2 , y haciendo algunos cálculos algebraicos , encontramos que la suma es
- U 1 + U 2 = n 1 n 2 .
- Sabiendo que R 1 + R 2 = N ( N + 1)/2 y N = n 1 + n 2 , y haciendo algunos cálculos algebraicos , encontramos que la suma es
Propiedades
El valor máximo de U es el producto de los tamaños de muestra para las dos muestras (es decir,). En tal caso, la "otra" U sería 0.
Ejemplos
Ilustración de los métodos de cálculo
Supongamos que Esopo no está satisfecho con su experimento clásico, en el que una tortuga venció a una liebre en una carrera, y decide realizar una prueba de significancia para descubrir si los resultados se pueden extender a tortugas y liebres en general. Reúne una muestra de 6 tortugas y 6 liebres, y las hace correr su carrera simultáneamente. El orden en que llegan a la meta (su clasificación, de la primera a la última en cruzar la línea de meta) es el siguiente, donde T representa a una tortuga y H a una liebre:
- THHHHHTTTTTH
¿Cuál es el valor de U ?
- Usando el método directo, tomamos cada tortuga por turno y contamos la cantidad de liebres que vence, obteniendo 6, 1, 1, 1, 1, 1, lo que significa que U T = 11. Alternativamente, podríamos tomar cada liebre por turno y contar la cantidad de tortugas que vence. En este caso, obtenemos 5, 5, 5, 5, 5, 0, por lo que U H = 25. Nótese que la suma de estos dos valores para U = 36 , que es 6 × 6 .
- Utilizando el método indirecto:
- Clasifica a los animales según el tiempo que tarden en completar el recorrido; así, asigna al primer animal el rango 12, al segundo el rango 11, y así sucesivamente.
- La suma de los rangos alcanzados por las tortugas es 12 + 6 + 5 + 4 + 3 + 2 = 32 .
- Por lo tanto U T = 32 − (6×7)/2 = 32 − 21 = 11 (igual que el método uno).
- La suma de los rangos alcanzados por las liebres es 11 + 10 + 9 + 8 + 7 + 1 = 46 , lo que lleva a U H = 46 − 21 = 25 .
Ejemplo de declaración de resultados
Al informar los resultados de una prueba U de Mann-Whitney , es importante indicar: [ 13 ]
- Una medida de las tendencias centrales de los dos grupos (medias o medianas; dado que la prueba U de Mann-Whitney es una prueba ordinal, generalmente se recomiendan las medianas).
- The value of U (perhaps with some measure of effect size, such as common language effect size or rank-biserial correlation).
- The sample sizes
- The significance level.
In practice some of this information may already have been supplied and common sense should be used in deciding whether to repeat it. A typical report might run,
- "Median latencies in groups E and C were 153 and 247 ms; the distributions in the two groups differed significantly (Mann–Whitney U = 10.5, n1 = n2 = 8, P < 0.05 two-tailed)."
A statement that does full justice to the statistical status of the test might run,
- "Outcomes of the two treatments were compared using the Wilcoxon–Mann–Whitney two-sample rank-sum test. The treatment effect (difference between treatments) was quantified using the Hodges–Lehmann (HL) estimator, which is consistent with the Wilcoxon test.[14] This estimator (HLΔ) is the median of all possible differences in outcomes between a subject in group B and a subject in group A. A non-parametric 0.95 confidence interval for HLΔ accompanies these estimates as does ρ, an estimate of the probability that a randomly chosen subject from population B has a higher weight than a randomly chosen subject from population A. The median [quartiles] weight for subjects on treatment A and B respectively are 147 [121, 177] and 151 [130, 180] kg. Treatment A decreased weight by HLΔ = 5 kg (0.95 CL [2, 9] kg, 2P = 0.02, ρ = 0.58)."
However it would be rare to find such an extensive report in a document whose major topic was not statistical inference.
Normal approximation and tie correction
For large samples, U is approximately normally distributed. In that case, the standardized value
where mU and σU are the mean and standard deviation of U, is approximately a standard normal deviate whose significance can be checked in tables of the normal distribution. mU and σU are given by
- [15] and
The formula for the standard deviation is more complicated in the presence of tied ranks. If there are ties in ranks, σ should be adjusted as follows:
donde el lado izquierdo es simplemente la varianza y el lado derecho es el ajuste por empates, t k es el número de empates para el rango k , y K es el número total de rangos únicos con empates.
Una forma computacionalmente más eficiente con n 1 n 2 /12 factorizado es
donde n = n 1 + n 2 .
Si el número de empates es pequeño (y especialmente si no hay grandes intervalos de empate), estos pueden ignorarse al realizar los cálculos manualmente. Los programas informáticos de estadística utilizarán la fórmula correctamente ajustada de forma rutinaria.
Nótese que, dado que U 1 + U 2 = n 1 n 2 , la media n 1 n 2 /2 utilizada en la aproximación normal es la media de los dos valores de U . Por lo tanto, el valor absoluto del estadístico z calculado será el mismo independientemente del valor de U que se utilice.
Tamaños del efecto
Es una práctica ampliamente recomendada para que los científicos informen el tamaño del efecto para una prueba inferencial. [ 17 ] [ 18 ]
Proporción de concordancia respecto al total de pares
Las siguientes medidas son equivalentes.
tamaño del efecto del lenguaje común
Un método para informar el tamaño del efecto para la prueba U de Mann-Whitney es con f , el tamaño del efecto del lenguaje común. [ 19 ] [ 20 ] Como estadística de muestra, el tamaño del efecto del lenguaje común se calcula formando todos los pares posibles entre los dos grupos y luego encontrando la proporción de pares que apoyan una dirección (por ejemplo, que los elementos del grupo 1 son más grandes que los elementos del grupo 2). [ 20 ] Para ilustrar, en un estudio con una muestra de diez liebres y diez tortugas, el número total de pares ordenados es diez veces diez o 100 pares de liebres y tortugas. Supongamos que los resultados muestran que la liebre corrió más rápido que la tortuga en 90 de los 100 pares de la muestra; en ese caso, el tamaño del efecto del lenguaje común de la muestra es del 90%. [ 21 ]
La relación entre f y la U de Mann-Whitney (específicamente) es el siguiente:
Esto es lo mismo que el área bajo la curva (AUC) para la curva ROC .
estadístico ρ
Una estadística llamada ρ que está linealmente relacionada con U y ampliamente utilizada en estudios de categorización ( aprendizaje de discriminación que involucra conceptos ), y en otros lugares, [ 22 ] se calcula dividiendo U por su valor máximo para los tamaños de muestra dados, que es simplemente n 1 × n 2 . ρ es, por lo tanto, una medida no paramétrica de la superposición entre dos distribuciones; puede tomar valores entre 0 y 1, y estima P( Y > X ) + 0.5 P( Y = X ) , donde X e Y son observaciones elegidas aleatoriamente de las dos distribuciones. Ambos valores extremos representan una separación completa de las distribuciones, mientras que un ρ de 0.5 representa una superposición completa. La utilidad del estadístico ρ se puede apreciar en el caso del ejemplo peculiar mencionado anteriormente, donde dos distribuciones que resultaron significativamente diferentes en una prueba U de Mann-Whitney , sin embargo, tenían medianas casi idénticas: el valor de ρ en este caso es aproximadamente 0,723 a favor de las liebres, lo que refleja correctamente el hecho de que, aunque la tortuga mediana superó a la liebre mediana, las liebres en conjunto obtuvieron mejores resultados que las tortugas en conjunto.
correlación biserial de rangos
Un método para informar el tamaño del efecto en la prueba U de Mann-Whitney es mediante una medida de correlación de rangos conocida como correlación biserial de rangos. Edward Cureton introdujo y nombró esta medida. [ 23 ] Al igual que otras medidas de correlación, la correlación biserial de rangos puede variar de menos uno a más uno, y un valor de cero indica que no existe relación.
Existe una fórmula de diferencia simple para calcular la correlación biserial de rangos a partir del tamaño del efecto del lenguaje común: la correlación es la diferencia entre la proporción de pares favorables a la hipótesis ( f ) menos su complemento (es decir, la proporción que es desfavorable ( u )). Esta fórmula de diferencia simple es simplemente la diferencia del tamaño del efecto del lenguaje común de cada grupo, y es la siguiente: [ 19 ]
Por ejemplo, consideremos el ejemplo en el que las liebres corren más rápido que las tortugas en 90 de 100 pares. El tamaño del efecto del lenguaje común es del 90%, por lo que la correlación biserial de rangos es del 90% menos el 10%, y la r biserial de rangos = 0,80 .
Se puede utilizar una fórmula alternativa para el rango biserial para calcularlo a partir de la U de Mann-Whitney (ya seao) and the sample sizes of each group:[24]
This formula is useful when the data are not available, but when there is a published report, because U and the sample sizes are routinely reported. Using the example above with 90 pairs that favor the hares and 10 pairs that favor the tortoise, U2 is the smaller of the two, so U2 = 10. This formula then gives r = 1 – (2×10) / (10×10) = 0.80, which is the same result as with the simple difference formula above.
Relation to other tests
Comparison to Student's t-test
The Mann–Whitney U test tests a null hypothesis that the probability distribution of a randomly drawn observation from one group is the same as the probability distribution of a randomly drawn observation from the other group against an alternative that those distributions are not equal (see Mann–Whitney U test#Assumptions and formal statement of hypotheses). In contrast, a t-test tests a null hypothesis of equal means in two groups against an alternative of unequal means (under some regularity assumptions [3]). Hence, except in special cases, the Mann–Whitney U test and the t-test do not test the same hypotheses and should be compared with this in mind.
- Ordinal data
- The Mann–Whitney U test is preferable to the t-test when the data are ordinal but not interval scaled, in which case the spacing between adjacent values of the scale cannot be assumed to be constant.
- Robustness
- As it compares the sums of ranks,[25] the Mann–Whitney U test is less likely than the t-test to spuriously indicate significance because of the presence of outliers. However, the Mann–Whitney U test may have worse type I error control when data are both heteroscedastic and non-normal.[26]
- Efficiency
- When normality holds, the Mann–Whitney U test has an (asymptotic) efficiency of 3/π or about 0.95 when compared to the t-test.[27] For distributions sufficiently far from normal and for sufficiently large sample sizes, the Mann–Whitney U test is considerably more efficient than the t.[28] This comparison in efficiency, however, should be interpreted with caution, as Mann–Whitney and the t-test do not test the same quantities. If, for example, a difference of group means is of primary interest, Mann–Whitney is not an appropriate test.[29]
The Mann–Whitney U test will give very similar results to performing an ordinary parametric two-sample t-test on the rankings of the data.[30]
Different distributions
The Mann–Whitney U test is not valid for testing the null hypothesis against the alternative hypothesis , without assuming that the distributions are the same under the null hypothesis (i.e., assuming ).[3] To test between those hypotheses, better tests are available. Among those are the Brunner-Munzel and the Fligner–Policello test.[32] Specifically, under the more general null hypothesis , the Mann–Whitney U test can have inflated type I error rates even in large samples (especially if the variances of two populations are unequal and the sample sizes are different), a problem the better alternatives solve.[33] As a result, it has been suggested to use one of the alternatives (specifically the Brunner–Munzel test) if it cannot be assumed that the distributions are equal under the null hypothesis.[33]
Alternatives
If one desires a simple shift interpretation, the Mann–Whitney U test should not be used when the distributions of the two samples are very different, as it can give erroneous interpretation of significant results.[34] In that situation, the unequal variances version of the t-test may give more reliable results.
De manera similar, algunos autores ( Conover, WJ (1999). Practical Nonparametric Statistics -- 3rd ed . New York: John Wiley & Sons. p. 272-281. ISBN 0-471-16068-7.Se sugiere transformar los datos a rangos (si aún no lo son) y luego realizar la prueba t sobre los datos transformados. La versión de la prueba t utilizada dependerá de si se sospecha que las varianzas poblacionales son diferentes. Las transformaciones de rangos no conservan las varianzas, pero estas se recalculan a partir de las muestras después de dichas transformaciones.
Se ha sugerido que la prueba de Brown-Forsythe es un equivalente no paramétrico apropiado a la prueba F para varianzas iguales.
Una prueba más potente es la prueba de Brunner-Munzel , que supera a la prueba U de Mann-Whitney en caso de incumplimiento del supuesto de intercambiabilidad. [ 35 ]
La prueba U de Mann-Whitney es un caso especial del modelo de probabilidades proporcionales , que permite el ajuste de covariables. [ 36 ]
Véase también la prueba de Kolmogorov-Smirnov .
Estadísticas de prueba relacionadas
El tau de Kendall
La prueba U de Mann-Whitney está relacionada con otros procedimientos estadísticos no paramétricos. Por ejemplo, es equivalente al coeficiente de correlación tau de Kendall si una de las variables es binaria (es decir, solo puede tomar dos valores).
Implementaciones de software
En muchos paquetes de software, la prueba U de Mann-Whitney (de la hipótesis de distribuciones iguales frente a alternativas apropiadas) ha estado mal documentada. Algunos paquetes tratan incorrectamente los empates o no documentan las técnicas asintóticas (por ejemplo, la corrección de continuidad). Una revisión de 2000 analizó algunos de los siguientes paquetes: [ 37 ]
- MATLAB incluye la función ranksum en su caja de herramientas de estadística.
- El paquete base de estadística de R implementa la prueba wilcox.test en su paquete "stats".
- La función wilcoxonZ del paquete rcompanion de R calcula el estadístico z para una prueba de Wilcoxon de dos muestras, pareada o de una muestra.
- SAS implementa la prueba en su
PROC NPAR1WAYprocedimiento. - Python tiene una implementación de esta prueba proporcionada por SciPy . [ 38 ]
- SigmaStat (SPSS Inc., Chicago, IL)
- SYSTAT (SPSS Inc., Chicago, IL)
- Java tiene una implementación de esta prueba proporcionada por Apache Commons [ 39 ].
- Julia tiene implementaciones de esta prueba a través de varios paquetes. En el paquete
HypothesisTests.jl, se encuentra comopvalue(MannWhitneyUTest(X, Y)). [ 40 ] - JMP (SAS Institute Inc., Cary, Carolina del Norte)
- S-Plus (MathSoft, Inc., Seattle, WA)
- ESTADÍSTICA (StatSoft, Inc., Tulsa, OK)
- SPSS (SPSS Inc., Chicago)
- StatsDirect (StatsDirect Ltd, Manchester, Reino Unido) implementa todas las variantes comunes .
- Stata (Stata Corporation, College Station, TX) implementa la prueba en su comando ranksum .
- StatXact (Cytel Software Corporation, Cambridge, Massachusetts)
- PSPP implementa la prueba en su función WILCOXON .
- KNIME implementa la prueba en su nodo de prueba de Wilcoxon-Mann-Whitney .
- ClickHouse implementa la prueba en su función mannWhitneyUTest .
Historia
La estadística apareció en un artículo de 1914 [ 41 ] del alemán Gustav Deuchler (con un término faltante en la varianza).
En un único artículo de 1945, Frank Wilcoxon propuso [ 42 ] tanto la prueba de rangos con signo de una muestra como la prueba de suma de rangos de dos muestras, en una prueba de significancia con una hipótesis nula puntual frente a su alternativa complementaria (es decir, igual frente a no igual). Sin embargo, en ese artículo solo tabuló unos pocos puntos para el caso de tamaño de muestra igual (aunque en un artículo posterior proporcionó tablas más extensas).
Un análisis exhaustivo del estadístico, que incluía una recurrencia que permitía el cálculo de probabilidades de cola para tamaños de muestra arbitrarios y tablas para tamaños de muestra de ocho o menos, apareció en el artículo de Henry Mann y su estudiante Donald Ransom Whitney en 1947. [ 2 ] Este artículo discutió hipótesis alternativas, incluyendo un ordenamiento estocástico (donde las funciones de distribución acumulativa satisfacían la desigualdad puntual F X ( t ) < F Y ( t ) ). Este trabajo también calculó los primeros cuatro momentos y estableció la normalidad límite del estadístico bajo la hipótesis nula, estableciendo así que es asintóticamente libre de distribución.
Véase también
Notas
- 12Conroy, Ronán M. (2012). "What Hypotheses do "Nonparametric" Two-Group Tests Actually Test?". The Stata Journal: Promoting communications on statistics and Stata. 12 (2): 182–190. doi:10.1177/1536867X1201200202. ISSN 1536-867X.
- 12Mann, Henry B.; Whitney, Donald R. (1947). "On a Test of Whether one of Two Random Variables is Stochastically Larger than the Other". Annals of Mathematical Statistics. 18 (1): 50–60. doi:10.1214/aoms/1177730491. MR 0022058. Zbl 0041.26103.
- 123Fay, Michael P.; Proschan, Michael A. (2010). "Wilcoxon–Mann–Whitney or t-test? On assumptions for hypothesis tests and multiple interpretations of decision rules". Statistics Surveys. 4: 1–39. doi:10.1214/09-SS051. MR 2595125. PMC 2857732. PMID 20414472.
- ↑, See Table 2.1 of Pratt (1964) "Robustness of Some Procedures for the Two-Sample Location Problem." Journal of the American Statistical Association. 59 (307): 655–680. If the two distributions are normal with the same mean but different variances, then Pr[X > Y] = Pr[Y < X] but the size of the Mann–Whitney test can be larger than the nominal level. So we cannot define the null hypothesis as Pr[X > Y] = Pr[Y < X] and get a valid test.
- ↑Divine, George W.; Norton, H. James; Barón, Anna E.; Juarez-Colunga, Elizabeth (2018). "The Wilcoxon–Mann–Whitney Procedure Fails as a Test of Medians". The American Statistician. 72 (3): 278–286. doi:10.1080/00031305.2017.1305291.
- ↑Conroy, Ronán (2012). "What Hypotheses do "Nonparametric" Two-Group Tests Actually Test?". Stata Journal. 12 (2): 182–190. doi:10.1177/1536867X1201200202. S2CID 118445807. Retrieved 24 May 2021.
- ↑Hart, Anna (2001). "Mann–Whitney test is not just a test of medians: differences in spread can be important". BMJ. 323 (7309): 391–393. doi:10.1136/bmj.323.7309.391. PMC 1120984. PMID 11509435.
- ↑Boston University (SPH), 2017
- ↑Mason, S. J., Graham, N. E. (2002). "Areas beneath the relative operating characteristics (ROC) and relative operating levels (ROL) curves: Statistical significance and interpretation". Quarterly Journal of the Royal Meteorological Society. 128 (584): 2145–2166. doi:10.1256/003590002320603584. ISSN 1477-870X.
- ↑Fawcett, Tom (2006); An introduction to ROC analysis, Pattern Recognition Letters, 27, 861–874.
- ↑Hand, David J.; Till, Robert J. (2001). "A Simple Generalisation of the Area Under the ROC Curve for Multiple Class Classification Problems". Machine Learning. 45 (2): 171–186. doi:10.1023/A:1010920819831.
- ↑Zar, Jerrold H. (1998). Biostatistical Analysis. New Jersey: Prentice Hall International, INC. p. 147. ISBN 978-0-13-082390-8.
- ↑Fritz, Catherine O.; Morris, Peter E.; Richler, Jennifer J. (2012). "Effect size estimates: Current use, calculations, and interpretation". Journal of Experimental Psychology: General. 141 (1): 2–18. doi:10.1037/a0024338. ISSN 1939-2222. PMID 21823805.
- ↑Myles Hollander; Douglas A. Wolfe (1999). Nonparametric Statistical Methods (2 ed.). Wiley-Interscience. ISBN 978-0-471-19045-5.
- 12Siegal, Sidney (1956). Nonparametric statistics for the behavioral sciences. McGraw-Hill. p. 121.
{{cite book}}: CS1 maint: numeric names: authors list (link) - ↑Lehmann, Erich; D'Abrera, Howard (1975). Nonparametrics: Statistical Methods Based on Ranks. Holden-Day. p. 20.
{{cite book}}: CS1 maint: numeric names: authors list (link) - ↑Wilkinson, Leland (1999). "Statistical methods in psychology journals: Guidelines and explanations". American Psychologist. 54 (8): 594–604. doi:10.1037/0003-066X.54.8.594.
- ↑Nakagawa, Shinichi; Cuthill, Innes C (2007). "Effect size, confidence interval and statistical significance: a practical guide for biologists". Biological Reviews of the Cambridge Philosophical Society. 82 (4): 591–605. doi:10.1111/j.1469-185X.2007.00027.x. PMID 17944619. S2CID 615371.
- 12Kerby, D.S. (2014). "The simple difference formula: An approach to teaching nonparametric correlation". Comprehensive Psychology. 3 11.IT.3.1. doi:10.2466/11.IT.3.1. S2CID 120622013.
- 12McGraw, K.O.; Wong, J.J. (1992). "A common language effect size statistic". Psychological Bulletin. 111 (2): 361–365. doi:10.1037/0033-2909.111.2.361.
- ↑Grissom RJ (1994). "Statistical analysis of ordinal categorical status after therapies". Journal of Consulting and Clinical Psychology. 62 (2): 281–284. doi:10.1037/0022-006X.62.2.281. PMID 8201065.
- ↑Herrnstein, Richard J.; Loveland, Donald H.; Cable, Cynthia (1976). "Natural Concepts in Pigeons". Journal of Experimental Psychology: Animal Behavior Processes. 2 (4): 285–302. doi:10.1037/0097-7403.2.4.285. PMID 978139.
- ↑ Cureton, EE (1956). "Correlación biserial de rangos". Psychometrika . 21 (3): 287– 290. doi : 10.1007/BF02289138 . S2CID 122500836 .
- ↑ Wendt, HW (1972). "Abordando un problema común en las ciencias sociales: Un coeficiente de correlación biserial de rango simplificado basado en el estadístico U ". European Journal of Social Psychology . 2 (4): 463– 465. doi : 10.1002/ejsp.2420020412 .
- ↑ Motulsky, Harvey J.; Guía de estadística , San Diego, CA: GraphPad Software, 2007, pág. 123
- ↑ Zimmerman, Donald W. (1998-01-01). "Invalidación de pruebas estadísticas paramétricas y no paramétricas por violación concurrente de dos supuestos". The Journal of Experimental Education . 67 (1): 55– 68. doi : 10.1080/00220979809598344 . ISSN 0022-0973 .
- ↑ Lehamnn, Erich L.; Elementos de la teoría de muestras grandes , Springer, 1999, pág. 176
- ↑ Conover, William J.; Estadística práctica no paramétrica , John Wiley & Sons, 1980 (2.ª edición), págs. 225-226
- ↑ Lumley, Thomas; Diehr, Paula ; Emerson, Scott; Chen, Lu (mayo de 2002). "La importancia del supuesto de normalidad en grandes conjuntos de datos de salud pública" . Annual Review of Public Health . 23 (1): 151– 169. doi : 10.1146/annurev.publhealth.23.100901.140546 . ISSN 0163-7525 . PMID 11910059 .
- ↑ Conover, William J.; Iman, Ronald L. (1981). "Transformaciones de rango como puente entre la estadística paramétrica y la no paramétrica". The American Statistician . 35 (3): 124– 129. doi : 10.2307/2683975 . JSTOR 2683975 .
- ↑ Vaart, AW van der (13 de octubre de 1998). Estadística asintótica . Cambridge University Press. doi : 10.1017/cbo9780511802256 . ISBN 978-0-511-80225-6.
- ↑Brunner, Edgar; Bathke, Arne C.; Konietschke, Frank (2018). Rank and pseudo-rank procedures for independent observations in factorial designs: Using R and SAS. Springer Series in Statistics. Cham: Springer International Publishing. doi:10.1007/978-3-030-02914-2. ISBN 978-3-030-02912-8.
- 12Karch, Julian D. (2021). "Psychologists Should Use Brunner–Munzel's Instead of Mann–Whitney's U Test as the Default Nonparametric Procedure". Advances in Methods and Practices in Psychological Science. 4 (2). doi:10.1177/2515245921999602. hdl:1887/3209569. ISSN 2515-2459.
- ↑Kasuya, Eiiti (2001). "Mann–Whitney U test when variances are unequal". Animal Behaviour. 61 (6): 1247–1249. doi:10.1006/anbe.2001.1691. S2CID 140209347.
- ↑Karch, Julian (2021). "Psychologists Should Use Brunner–Munzel's Instead of Mann–Whitney's U Test as the Default Nonparametric Procedure". Advances in Methods and Practices in Psychological Science. 4 (2). doi:10.1177/2515245921999602. hdl:1887/3209569. S2CID 235521799.
- ↑Harrell, Frank (20 September 2020). "Violation of Proportional Odds is Not Fatal".
{{cite journal}}: Cite journal requires|journal=(help) - ↑Bergmann, Reinhard; Ludbrook, John; Spooren, Will P.J.M. (2000). "Different Outcomes of the Wilcoxon–Mann–Whitney Test from Different Statistics Packages". The American Statistician. 54 (1): 72–77. doi:10.1080/00031305.2000.10474513. JSTOR 2685616. S2CID 120473946.
- ↑"scipy.stats.mannwhitneyu". SciPy v0.16.0 Reference Guide. The Scipy community. 24 July 2015. Retrieved 11 September 2015.
scipy.stats.mannwhitneyu(x, y, use_continuity=True): Computes the Mann–Whitney rank test on samples x and y.
- ↑ "MannWhitneyUTest (API de Apache Commons Math 3.3)" . commons.apache.org . Archivado del original el 28 de febrero de 2017. Consultado el 27 de febrero de 2017 .
- ↑ "JuliaStats/HypothesisTests.jl" . GitHub . 30 de mayo de 2021.
- ↑ Kruskal, William H. (septiembre de 1957). "Notas históricas sobre la prueba de Wilcoxon para dos muestras independientes". Journal of the American Statistical Association . 52 (279): 356– 360. doi : 10.2307/2280906 . JSTOR 2280906 .
- ↑ Wilcoxon, Frank (1945). "Comparaciones individuales mediante métodos de clasificación". Biometrics Bulletin . 1 (6): 80– 83. doi : 10.2307/3001968 . hdl : 10338.dmlcz/135688 . JSTOR 3001968 .
Referencias
- Hettmansperger, TP; McKean, JW (1998). Métodos estadísticos no paramétricos robustos . Biblioteca de Estadística de Kendall. Vol. 5 (Primera ed., en lugar de la segunda ed. de Taylor and Francis (2010)). Londres; Nueva York: Edward Arnold; John Wiley and Sons, Inc. pp. xiv+467. ISBN 978-0-340-54937-7MR 1604954 .
- Corder, GW; Foreman, DI (2014). Estadística no paramétrica: un enfoque paso a paso . Wiley. ISBN 978-1-118-84031-3.
- Hodges, JL; Lehmann, EL (1963). "Estimación de la ubicación basada en rangos" . Annals of Mathematical Statistics . 34 (2): 598– 611. doi : 10.1214/aoms/1177704172 . JSTOR 2238406. MR 0152070. Zbl 0203.21105 . PE euclid.aoms/1177704172 .
- Kerby, DS (2014). "La fórmula de diferencia simple: un enfoque para la enseñanza de la correlación no paramétrica" . Psicología Integral . 3 11.IT.3.1. doi : 10.2466/11.IT.3.1 . S2CID 120622013 .
- Lehmann, Erich L. (2006). Métodos no paramétricos: métodos estadísticos basados en rangos . Con la colaboración especial de HJM D'Abrera (Reimpresión de la revisión de 1988 de la edición de Holden-Day de 1975 ). Nueva York: Springer. pp. xvi+463. ISBN 978-0-387-35212-1MR 0395032 .
- Oja, Hannu (2010). Métodos no paramétricos multivariados con R : Un enfoque basado en signos y rangos espaciales . Lecture Notes in Statistics. Vol. 199. Nueva York: Springer. pp. xiv+232. doi : 10.1007/978-1-4419-0468-3 . ISBN 978-1-4419-0467-6. MR 2598854 .
- Sen, Pranab Kumar (diciembre de 1963). "Sobre la estimación de la potencia relativa en ensayos de dilución (directos) mediante métodos libres de distribución". Biometrics . 19 ( 4): 532– 552. doi : 10.2307/2527532 . JSTOR 2527532. Zbl 0119.15604 .
- Chicco D.; Sichenze A.; Jurman G. (2025). "Una guía sencilla para el uso de la prueba t de Student, la prueba U de Mann-Whitney, la prueba de chi-cuadrado y la prueba de Kruskal-Wallis en bioestadística" . BioData Mining . 18 (56): 1-51. doi : 10.1186/s13040-025-00465-6 . PMC 12366075 .
Enlaces externos
- Tabla de valores críticos de U (pdf) Archivado el 6 de julio de 2011 en Wayback Machine
- Calculadora interactiva para U y su significado
- Breve guía del psicólogo experimental Karl L. Weunsch : Estimadores no paramétricos del tamaño del efecto (Copyright 2015 por Karl L. Weunsch)
- Pruebas estadísticas
- estadística no paramétrica
- Estadísticas U