En estadística , la correlación de rangos es una estadística que mide la asociación ordinal : la relación entre clasificaciones de diferentes variables ordinales o diferentes clasificaciones de la misma variable, donde una "clasificación" es la asignación de las etiquetas de ordenación "primero", "segundo", "tercero", etc., a diferentes observaciones de una variable en particular. El coeficiente de correlación de rangos mide el grado de similitud entre dos clasificaciones y puede utilizarse para evaluar la significancia de la relación entre ellas. Por ejemplo, dos métodos no paramétricos comunes de significancia que utilizan la correlación de rangos son la prueba U de Mann-Whitney y la prueba de rangos con signo de Wilcoxon .
Contexto
Por ejemplo, si una variable es la identidad de un programa de baloncesto universitario y otra variable es la identidad de un programa de fútbol americano universitario, se podría analizar la relación entre las clasificaciones de ambos programas: ¿tienden las universidades con un programa de baloncesto mejor clasificado a tener también un programa de fútbol americano mejor clasificado? Un coeficiente de correlación de rangos puede medir dicha relación, y la significancia de este coeficiente puede indicar si la relación observada es lo suficientemente pequeña como para ser una mera coincidencia.
Si solo existe una variable, la identidad de un programa de fútbol americano universitario, pero está sujeta a dos clasificaciones diferentes en encuestas (por ejemplo, una realizada por entrenadores y otra por periodistas deportivos), entonces la similitud de las clasificaciones de las dos encuestas diferentes se puede medir con un coeficiente de correlación de rangos.
Como otro ejemplo, en una tabla de contingencia con ingresos bajos , ingresos medios e ingresos altos en la variable de fila y nivel educativo ( sin escuela secundaria , escuela secundaria , universidad) en la variable de columna, [ 1 ] una correlación de rangos mide la relación entre ingresos y nivel educativo.
Coeficientes de correlación
Algunas de las estadísticas de correlación de rangos más populares incluyen:
Un coeficiente de correlación de rangos creciente implica una mayor concordancia entre las clasificaciones. El coeficiente se encuentra dentro del intervalo [ − 1, 1] y toma el valor:
- 1 Si la concordancia entre las dos clasificaciones es perfecta, las dos clasificaciones son iguales.
- 0 si las clasificaciones son completamente independientes.
- − 1 si la discrepancia entre las dos clasificaciones es perfecta; una clasificación es la inversa de la otra.
Siguiendo a Diaconis (1988) , una clasificación puede considerarse como una permutación de un conjunto de objetos. Así, podemos interpretar las clasificaciones observadas como datos obtenidos cuando el espacio muestral se identifica con un grupo simétrico . Podemos entonces introducir una métrica , transformando el grupo simétrico en un espacio métrico . Diferentes métricas corresponderán a diferentes correlaciones de rango.
Coeficiente de correlación general
Kendall 1970 [ 2 ] demostró que su(tau) y Spearman(rho) son casos particulares de un coeficiente de correlación general.
Supongamos que tenemos un conjunto deobjetos, que se están considerando en relación con dos propiedades, representadas pory, formando los conjuntos de valoresy. A cualquier par de individuos, digamos el-o y el-asignamos unPuntuación -, denotada pory unPuntuación -, denotada porEl único requisito para estas funciones es que sean antisimétricas, por lo quey. (Tenga en cuenta que en particularsi.) Luego, el coeficiente de correlación generalizadose define como
De forma equivalente, si todos los coeficientes se recopilan en matricesy, cony, entonces
dóndees el producto interno de Frobenius yla norma de Frobenius . En particular, el coeficiente de correlación general es el coseno del ángulo entre las matrices.y.
El τ de Kendall como caso particular
Si,son las filas de la-miembro según el-calidad y-calidad respectivamente, entonces podemos definir
La sumaes el número de pares concordantes menos el número de pares discordantes (véase el coeficiente de correlación de rangos tau de Kendall ). La sumaes solo, el número de términos, tal como está. Por lo tanto, en este caso,
El coeficiente ρ de Spearman como caso particular
Si,son las filas de la-miembro según ely el-calidad respectivamente, podemos considerar las matricesdefinido por
Las sumasyson iguales, ya que ambosyabarca desdea. Por eso
Para simplificar esta expresión, dejemosdenotan la diferencia en los rangos para cada uno. Además, dejemossea una variable aleatoria discreta uniformemente distribuida en. Desde los rangosson simplemente permutaciones de, podemos ver ambas como variables aleatorias distribuidas como. Utilizando resultados básicos de sumatoria de matemáticas discretas, es fácil ver que para la variable aleatoria uniformemente distribuida,, tenemos y y por lo tanto . Ahora, observar las simetrías nos permite calcular las partes de como sigue:
y
Por eso
dóndees la diferencia entre rangos, que es exactamente el coeficiente de correlación de rangos de Spearman.
correlación biserial de rangos
Gene Glass (1965) señaló que el rango biserial puede derivarse del de Spearman."Se puede derivar un coeficiente definido en X , la variable dicotómica, e Y , la variable de clasificación, que estima el coeficiente rho de Spearman entre X e Y de la misma manera que el coeficiente r biserial estima el coeficiente r de Pearson entre dos variables normales" (p. 91). La correlación biserial de rangos había sido introducida nueve años antes por Edward Cureton (1956) como una medida de correlación de rangos cuando los rangos están en dos grupos. [ 3 ]
Fórmula de diferencias simples de Kerby
Dave Kerby (2014) recomendó la correlación biserial de rangos como medida para introducir a los estudiantes a la correlación de rangos, ya que su lógica general puede explicarse a nivel introductorio. La correlación biserial de rangos se utiliza con la prueba U de Mann-Whitney , un método comúnmente estudiado en cursos universitarios introductorios de estadística. Los datos para esta prueba constan de dos grupos; y para cada miembro de los grupos, el resultado se clasifica para el estudio en su conjunto.
Kerby demostró que esta correlación de rangos puede expresarse en términos de dos conceptos: el porcentaje de datos que respaldan una hipótesis planteada y el porcentaje de datos que no la respaldan. La fórmula de diferencia simple de Kerby establece que la correlación de rangos puede expresarse como la diferencia entre la proporción de evidencia favorable ( f ) menos la proporción de evidencia desfavorable ( u ).
Ejemplo e interpretación
Para ilustrar el cálculo, supongamos que un entrenador prepara a corredores de larga distancia durante un mes utilizando dos métodos. El Grupo A tiene 5 corredores y el Grupo B tiene 4. La hipótesis planteada es que el método A produce corredores más rápidos. La prueba para evaluar los resultados revela que los corredores del Grupo A efectivamente corren más rápido, con los siguientes puestos: 1, 2, 3, 4 y 6. Los corredores más lentos del Grupo B, por lo tanto, obtienen los puestos 5, 7, 8 y 9.
El análisis se realiza en pares, definidos como un miembro de un grupo comparado con un miembro del otro grupo. Por ejemplo, el corredor más rápido del estudio es miembro de cuatro pares: (1,5), (1,7), (1,8) y (1,9). Estos cuatro pares respaldan la hipótesis, ya que en cada par el corredor del Grupo A es más rápido que el corredor del Grupo B. Hay un total de 20 pares, y 19 pares respaldan la hipótesis. El único par que no la respalda son los dos corredores con rangos 5 y 6, porque en este par, el corredor del Grupo B tuvo el mejor tiempo. Según la fórmula de diferencia simple de Kerby, el 95% de los datos respaldan la hipótesis (19 de 20 pares) y el 5% no la respaldan (1 de 20 pares), por lo que la correlación de rangos es r = 0,95 − 0,05 = 0,90.
The maximum value for the correlation is r = 1, which means that 100% of the pairs favor the hypothesis. A correlation of r = 0 indicates that half the pairs favor the hypothesis and half do not; in other words, the sample groups do not differ in ranks, so there is no evidence that they come from two different populations. An effect size of r = 0 can be said to describe no relationship between group membership and the members' ranks.
In their article “Improving statistical reporting in psychology,” Anna-Lena Schubert and her colleagues (2025) set forth guidelines for statistical reporting, drawing from established recommendations and emerging best practices. In Table 5 they offered an overview of effect sizes for commonly used statistical models. In this table they cited the Kerby (2014) paper as a key resource for the application and interpretation of the rank-biserial correlation.
References
- ↑Kruskal, William H. (1958). "Ordinal Measures of Association". Journal of the American Statistical Association. 53 (284): 814–861. doi:10.2307/2281954. JSTOR 2281954.
- ↑Kendall, Maurice G (1970). Rank Correlation Methods (4 ed.). Griffin. ISBN 978-0-85264-199-6.
- ↑Zar, Jerrold H. (2005). "Spearman Rank Correlation". Encyclopedia of Biostatistics. John Wiley & Sons, Ltd. doi:10.1002/0470011815.b2a15150. ISBN 978-0-470-84907-1.
Further reading
- Cureton, Edward E. (1956). "Rank-biserial correlation". Psychometrika. 21 (3): 287–290. doi:10.1007/BF02289138. S2CID 122500836.
- Everitt, B. S. (2002), The Cambridge Dictionary of Statistics, Cambridge: Cambridge University Press, ISBN 0-521-81099-X
- Diaconis, P. (1988), Group Representations in Probability and Statistics, Lecture Notes-Monograph Series, Hayward, CA: Institute of Mathematical Statistics, ISBN 0-940600-14-5
- Glass, Gene V. (1965). "A ranking variable analogue of biserial correlation: implications for short-cut item analysis". Journal of Educational Measurement. 2 (1): 91–95. doi:10.1111/j.1745-3984.1965.tb00396.x.
- Kendall, M. G. (1970), Rank Correlation Methods, London: Griffin, ISBN 0-85264-199-0
- Kerby, Dave S. (2014). "The Simple Difference Formula: An Approach to Teaching Nonparametric Correlation". Comprehensive Psychology. 3 (1) 11.IT.3.1. doi:10.2466/11.IT.3.1.
- Schubert, A.L.; Steinhilber, M.; Kang, H.; Quintana, D.S. (2025). "Improving statistical reporting in psychology". Communications Psychology. 3 (1) 156. doi:10.1038/s44271-025-00356-w. PMC 12618885. PMID 41238797.
External links
- Brief guide by experimental psychologist Karl L. Weunsch - Nonparametric effect sizes (Copyright 2015 by Karl L. Weunsch)
- Covariance and correlation
- Nonparametric statistics
- Rankings