Articulo de referencia

coeficiente de correlación de Pearson

Varios conjuntos de puntos ( x , y ), con el coeficiente de correlación de x e y para cada conjunto. La correlación refleja la fuerza y ​​la dirección de una relación lineal (fi...

Varios conjuntos de puntos ( x , y ), con el coeficiente de correlación de x e y para cada conjunto. La correlación refleja la fuerza y ​​la dirección de una relación lineal (fila superior), pero no la pendiente de dicha relación (fila central), ni muchos aspectos de las relaciones no lineales (fila inferior). Nota: la figura central tiene una pendiente de 0, pero en ese caso el coeficiente de correlación no está definido porque la varianza de Y es cero. 

En estadística , el coeficiente de correlación de Pearson ( PCC ), también conocido como r de Pearson , coeficiente de correlación producto-momento de Pearson ( PPMCC ) o simplemente coeficiente de correlación no cualificado , [ 1 ] es un coeficiente de correlación que mide la correlación lineal entre dos conjuntos de datos. Es la razón entre la covarianza de dos variables y el producto de sus desviaciones estándar ; por lo tanto, es esencialmente una medida normalizada de la covarianza, de modo que el resultado siempre tiene un valor entre -1 y 1. [ 2 ] Una diferencia clave es que, a diferencia de la covarianza, este coeficiente de correlación no tiene unidades , lo que permite comparar la fuerza de la asociación conjunta entre diferentes pares de variables aleatorias que no necesariamente tienen las mismas unidades. [ 3 ] Al igual que con la covarianza misma, la medida solo puede reflejar una correlación lineal de variables e ignora muchos otros tipos de relaciones o correlaciones. Como ejemplo sencillo, cabría esperar que la edad y la altura de una muestra de niños de una escuela tuvieran un coeficiente de correlación de Pearson significativamente mayor que 0, pero menor que 1 (ya que 1 representaría una correlación irrealmente perfecta).

Nombres e historia

Fue desarrollada por Karl Pearson a partir de una idea relacionada introducida por Francis Galton en la década de 1880, y para la cual Auguste Bravais derivó y publicó la fórmula matemática en 1844. [ a ] ​​[ 7 ] [ 8 ] [ 9 ] [ 10 ] La denominación del coeficiente es, por lo tanto, un ejemplo de la Ley de Stigler .

Explicación intuitiva

El punto máximo de la curva coseno azul se encuentra en cero. La curva decae a medida que aumenta el ángulo y es cero en un ángulo recto ( π /2).

El coeficiente de correlación se puede derivar desplazando los valores de datos x e y de modo que cada uno tenga un promedio cero sobre la población de n individuos, recopilando cada conjunto de datos para formar las coordenadas de un vector n- dimensional y calculando el coseno entre estas dos direcciones de vector. [ 11 ] Cuando el ángulo entre los vectores es cercano a cero, entonces el coseno es cercano a uno, lo que indica una alta correlación. Cuando el ángulo entre ellos es cercano a un ángulo recto , entonces el coseno es cercano a cero. La falta absoluta de correlación se denomina entonces "ortogonalidad" correspondiente a la perpendicularidad de los vectores de los datos x e y . Además, cuando los vectores apuntan en direcciones casi opuestas, el coseno es cercano a menos uno. Este caso es anticorrelación .

Las fórmulas que aparecen a continuación pueden derivarse de las fórmulas del producto escalar y de la longitud de los vectores.

Definición

El coeficiente de correlación de Pearson es la covarianza de las dos variables dividida por el producto de sus desviaciones estándar. La definición formal implica un "momento de producto", es decir, la media (el primer momento respecto al origen) del producto de las variables aleatorias ajustadas a la media.

Para una población

El coeficiente de correlación de Pearson, cuando se aplica a una población , se representa comúnmente con la letra griega ρ (rho) y puede denominarse coeficiente de correlación poblacional o coeficiente de correlación de Pearson poblacional . Dado un par de variables aleatorias(incógnita,Y){\displaystyle (X,Y)}(por ejemplo, altura y peso), la fórmula para ρ [ 12 ] es [ 13 ]

ρincógnita,Y=cobertura(incógnita,Y)σincógnitaσY{\displaystyle \rho _{X,Y}={\frac {\operatorname {cov} (X,Y)}{\sigma _{X}\sigma _{Y}}}}

dónde

  • cobertura{\displaystyle \operatorname {cov} }es la covarianza
  • σincógnita{\displaystyle \sigma _{X}}es la desviación estándar de incógnita{\displaystyle X}
  • σY{\displaystyle \sigma _{Y}}es la desviación estándar de Y{\displaystyle Y}.

La fórmula paracobertura(incógnita,Y){\displaystyle \operatorname {cov} (X,Y)}puede expresarse en términos de media y esperanza . Dado que [ 12 ]

cobertura(incógnita,Y)=mi[(incógnitaμincógnita)(YμY)],{\displaystyle \operatorname {cov} (X,Y)=\operatorname {\mathbb {E} } [(X-\mu _{X})(Y-\mu _{Y})],}

la fórmula paraρ{\displaystyle \rho }también se puede escribir como

ρincógnita,Y=mi[(incógnitaμincógnita)(YμY)]σincógnitaσY{\displaystyle \rho _{X,Y}={\frac {\operatorname {\mathbb {E} } [(X-\mu _{X})(Y-\mu _{Y})]}{\sigma _{X}\sigma _{Y}}}}

dónde

  • σY{\displaystyle \sigma _{Y}}yσincógnita{\displaystyle \sigma _{X}}se definen como se indica arriba
  • μincógnita{\displaystyle \mu _{X}}es la media deincógnita{\displaystyle X}
  • μY{\displaystyle \mu _{Y}}es la media deY{\displaystyle Y}
  • mi{\displaystyle \operatorname {\mathbb {E} } }es la expectativa.

La fórmula paraρ{\displaystyle \rho }puede expresarse en términos de momentos descentrados. Dado que

μincógnita=mi[incógnita]μY=mi[Y]σincógnita2=mi[(incógnitami[incógnita])2]=mi[incógnita2](mi[incógnita])2σY2=mi[(Ymi[Y])2]=mi[Y2](mi[Y])2cobertura(incógnita,Y)=mi[(incógnitaμincógnita)(YμY)]=mi[(incógnitami[incógnita])(Ymi[Y])]=mi[incógnitaY]mi[incógnita]mi[Y],{\displaystyle {\begin{aligned}\mu _{X}={}&\operatorname {\mathbb {E} } [X]\\\mu _{Y}={}&\operatorname {\mathbb {E} } [Y]\\\sigma _{X}^{2}={}&\operatorname {\mathbb {E} } \left[\left(X-\operatorname {\mathbb {E} } [X]\right)^{2}\right]=\operatorname {\mathbb {E} } \left[X^{2}\right]-\left(\operatorname {\mathbb {E} } [X]\right)^{2}\\\sigma _{Y}^{2}={}&\operatorname {\mathbb {E} } \left[\left(Y-\operatorname {\mathbb {E} } [Y]\right)^{2}\right]=\operatorname {\mathbb {E} } \left[Y^{2}\right]-\left(\operatorname {\mathbb {E} } [Y]\right)^{2}\\\operatorname {cov} (X,Y)={}&\operatorname {\mathbb {E} } [\left(X-\mu _{X}\right)\left(Y-\mu _{Y}\right)]=\operatorname {\mathbb {E} } [\left(X-\operatorname {\mathbb {E} } [X]\right)\left(Y-\operatorname {\mathbb {E} } [Y]\right)]=\operatorname {\mathbb {E} } [XY]-\operatorname {\mathbb {E} } [X]\operatorname {\mathbb {E} } [Y],\end{aligned}}}

la fórmula paraρ{\displaystyle \rho }también se puede escribir como ρincógnita,Y=mi[incógnitaY]mi[incógnita]mi[Y]mi[incógnita2](mi[incógnita])2 mi[Y2](mi[Y])2.{\displaystyle \rho _{X,Y}={\frac {\operatorname {\mathbb {E} } [XY]-\operatorname {\mathbb {E} } [X]\operatorname {\mathbb {E} } [Y]}{{\sqrt {\operatorname {\mathbb {E} } \left[X^{2}\right]-\left(\operatorname {\mathbb {E} } [X]\right)^{2}}}~{\sqrt {\operatorname {\mathbb {E} } \left[Y^{2}\right]-\left(\operatorname {\mathbb {E} } [Y]\right)^{2}}}}}.}

Para una muestra

El coeficiente de correlación de Pearson, cuando se aplica a una muestra , se representa comúnmente porrincógnitay{\displaystyle r_{xy}}y puede denominarse coeficiente de correlación muestral o coeficiente de correlación de Pearson muestral . Podemos obtener una fórmula pararincógnitay{\displaystyle r_{xy}}sustituyendo las estimaciones de las covarianzas y varianzas basadas en una muestra en la fórmula anterior. Dados datos pareados{(incógnita1,y1),,(incógnitanorte,ynorte)}{\displaystyle \left\{(x_{1},y_{1}),\ldots ,(x_{n},y_{n})\right\}}compuesto denorte{\displaystyle n}pares,rincógnitay{\displaystyle r_{xy}}se define como

rincógnitay=i=1norte(incógnitaiincógnita¯)(yiy¯)i=1norte(incógnitaiincógnita¯)2i=1norte(yiy¯)2{\displaystyle r_{xy}={\frac {\sum _{i=1}^{n}(x_{i}-{\bar {x}})(y_{i}-{\bar {y}})}{{\sqrt {\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}{\sqrt {\sum _{i=1}^{n}(y_{i}-{\bar {y}})^{2}}}}}}

dónde

  • norte{\displaystyle n}es el tamaño de la muestra
  • incógnitai,yi{\displaystyle x_{i},y_{i}}son los puntos de muestra individuales indexados con i
  • incógnita¯=1nortei=1norteincógnitai{\textstyle {\bar {x}}={\frac {1}{n}}\sum _{i=1}^{n}x_{i}}(la media de la muestra); y análogamente paray¯{\displaystyle {\bar {y}}}.

Reordenando obtenemos esta [ 12 ] fórmula pararincógnitay{\displaystyle r_{xy}}:

rincógnitay=iincógnitaiyinorteincógnita¯y¯iincógnitai2norteincógnita¯2 iyi2nortey¯2,{\displaystyle r_{xy}={\frac {\sum _{i}x_{i}y_{i}-n{\bar {x}}{\bar {y}}}{{\sqrt {\sum _{i}x_{i}^{2}-n{\bar {x}}^{2}}}~{\sqrt {\sum _{i}y_{i}^{2}-n{\bar {y}}^{2}}}}},}

dóndenorte,incógnitai,yi,incógnita¯,y¯{\displaystyle n,x_{i},y_{i},{\bar {x}},{\bar {y}}}se definen como se indicó anteriormente.

Reordenando de nuevo obtenemos esta fórmula pararincógnitay{\displaystyle r_{xy}}:

rincógnitay=norteincógnitaiyiincógnitaiyinorteincógnitai2(incógnitai)2 norteyi2(yi)2,{\displaystyle r_{xy}={\frac {n\sum x_{i}y_{i}-\sum x_{i}\sum y_{i}}{{\sqrt {n\sum x_{i}^{2}-\left(\sum x_{i}\right)^{2}}}~{\sqrt {n\sum y_{i}^{2}-\left(\sum y_{i}\right)^{2}}}}},}

dóndenorte,incógnitai,yi{\displaystyle n,x_{i},y_{i}}se definen como se indicó anteriormente.

Esta fórmula sugiere un algoritmo conveniente de una sola pasada para calcular correlaciones de muestras, aunque dependiendo de los números involucrados, a veces puede ser numéricamente inestable .

Una expresión equivalente da la fórmula pararincógnitay{\displaystyle r_{xy}}como la media de los productos de las puntuaciones estándar de la siguiente manera:

rincógnitay=1norte1i=1norte(incógnitaiincógnita¯sincógnita)(yiy¯sy){\displaystyle r_{xy}={\frac {1}{n-1}}\sum _{i=1}^{n}\left({\frac {x_{i}-{\bar {x}}}{s_{x}}}\right)\left({\frac {y_{i}-{\bar {y}}}{s_{y}}}\right)}

dónde

  • norte,incógnitai,yi,incógnita¯,y¯{\displaystyle n,x_{i},y_{i},{\bar {x}},{\bar {y}}}se definen como arriba, ysincógnita,sy{\displaystyle s_{x},s_{y}}se definen a continuación
  • (incógnitaiincógnita¯sincógnita){\textstyle \left({\frac {x_{i}-{\bar {x}}}{s_{x}}}\right)}es la puntuación estándar (y análogamente para la puntuación estándar dey{\displaystyle y}).

Fórmulas alternativas pararincógnitay{\displaystyle r_{xy}}También están disponibles. Por ejemplo, se puede utilizar la siguiente fórmula pararincógnitay{\displaystyle r_{xy}}:

rincógnitay=incógnitaiyinorteincógnita¯y¯(norte1)sincógnitasy{\displaystyle r_{xy}={\frac {\sum x_{i}y_{i}-n{\bar {x}}{\bar {y}}}{(n-1)s_{x}s_{y}}}}

dónde

  • norte,incógnitai,yi,incógnita¯,y¯{\displaystyle n,x_{i},y_{i},{\bar {x}},{\bar {y}}}se definen como se indicó anteriormente y:
  • sincógnita=1norte1i=1norte(incógnitaiincógnita¯)2{\textstyle s_{x}={\sqrt {{\frac {1}{n-1}}\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}}(la desviación estándar de la muestra ); y de forma análoga parasy{\displaystyle s_{y}}.

Para distribuciones gaussianas conjuntas

Si(incógnita,Y){\displaystyle (X,Y)}es conjuntamente gaussiana , con media cero y varianzaΣ{\displaystyle \Sigma }, entoncesΣ=[σincógnita2ρincógnita,YσincógnitaσYρincógnita,YσincógnitaσYσY2]{\displaystyle \Sigma ={\begin{bmatrix}\sigma _{X}^{2}&\rho _{X,Y}\sigma _{X}\sigma _{Y}\\\rho _{X,Y}\sigma _{X}\sigma _{Y}&\sigma _{Y}^{2}\\\end{bmatrix}}}.

Cuestiones prácticas

En condiciones de ruido intenso , extraer el coeficiente de correlación entre dos conjuntos de variables estocásticas no es trivial. Este problema se conoce como dilución de regresión . Según la teoría clásica de pruebas , la corrección esρincógnitay=ρincógnitayρincógnitaincógnitaρyy{\textstyle \rho _{x'y'}={\frac {\rho _{xy}}{\sqrt {\rho _{xx^{\prime }}\rho _{yy^{\prime }}}}}}, aunque la estimación de la fiabilidad (o equivalentemente los niveles de ruido)σϵincógnita,σϵy{\textstyle \sigma _{\epsilon _{x}},\sigma _{\epsilon _{y}}}) es necesario. El análisis de correlación canónica tiene un problema análogo. Una generalización del enfoque para CCA, y con un método para estimar el nivel de ruido, se presenta en otro lugar. [ 14 ]

En caso de datos faltantes, Garren derivó el estimador de máxima verosimilitud . [ 15 ]

Algunas distribuciones (por ejemplo, distribuciones estables distintas de la distribución normal ) no tienen una varianza definida.

Propiedades matemáticas

Los valores de los coeficientes de correlación de Pearson tanto de la muestra como de la población se encuentran en o entre −1 y 1. Las correlaciones iguales a +1 o −1 corresponden a puntos de datos que se encuentran exactamente sobre una línea (en el caso de la correlación de la muestra), o a una distribución bivariada totalmente soportada sobre una línea (en el caso de la correlación de la población). El coeficiente de correlación de Pearson es simétrico: corr( X , Y )  =  corr( Y , X ).

Una propiedad matemática clave del coeficiente de correlación de Pearson es que es invariante ante cambios separados de ubicación y escala en las dos variables. Es decir, podemos transformar X en a + bX y transformar Y en c + dY , donde a , b , c y d son constantes con b , d > 0 , sin cambiar el coeficiente de correlación. (Esto se cumple tanto para los coeficientes de correlación de Pearson poblacionales como muestrales). Las transformaciones lineales más generales sí cambian la correlación: véase §  Decorrelación de n variables aleatorias para una aplicación de esto. En particular, podría ser útil observar que corr( -X , Y )  =  -corr( X , Y ).

Interpretación

El coeficiente de correlación varía de -1 a 1. Un valor absoluto de 1 implica que una ecuación lineal describe perfectamente la relación entre X e Y , con todos los puntos de datos situados sobre una línea . El signo de la correlación se determina por la pendiente de regresión : un valor de +1 implica que todos los puntos de datos se sitúan sobre una línea en la que Y aumenta a medida que X aumenta, mientras que un valor de -1 implica una línea en la que Y aumenta mientras X disminuye. [ 16 ] Un valor de 0 implica que no existe dependencia lineal entre las variables. [ 17 ]

En términos más generales, ( Xᵢ X )( Yᵢ Y ) es positivo si y solo si Xᵢ e Yᵢ se encuentran en el mismo lado de sus respectivas medias. Por lo tanto, el coeficiente de correlación es positivo si Xᵢ e Yᵢ tienden a ser simultáneamente mayores o menores que sus respectivas medias. El coeficiente de correlación es negativo ( anticorrelación ) si Xᵢ e Yᵢ tienden a estar en lados opuestos de sus respectivas medias. Además, cuanto más fuerte sea cualquiera de las tendencias, mayor será el valor absoluto del coeficiente de correlación.

Rodgers y Nicewander [ 18 ] catalogaron trece formas de interpretar la correlación o funciones simples de la misma:

  • Función de las puntuaciones brutas y las medias
  • Covarianza estandarizada
  • Pendiente estandarizada de la línea de regresión
  • Media geométrica de las dos pendientes de regresión
  • Raíz cuadrada de la razón de dos varianzas
  • Producto cruzado medio de variables estandarizadas
  • Función del ángulo entre dos líneas de regresión estandarizadas
  • Función del ángulo entre dos vectores variables
  • Varianza reescalada de la diferencia entre puntuaciones estandarizadas
  • Estimado a partir de la regla del globo
  • Relacionado con las elipses bivariadas de isoconcentración
  • Función de las estadísticas de prueba de experimentos diseñados
  • Cociente de dos medias

Interpretación geométrica

Líneas de regresión para y = g X ( x ) [ rojo ] y x = g Y ( y ) [ azul ]

Para datos no centrados, existe una relación entre el coeficiente de correlación y el ángulo φ entre las dos líneas de regresión, y = g X ( x ) y x = g Y ( y ) , obtenidas al regresar y sobre x y x sobre y respectivamente. (Aquí, φ se mide en sentido antihorario dentro del primer cuadrante formado alrededor del punto de intersección de las líneas si r > 0 , o en sentido antihorario desde el cuarto al segundo cuadrante si r < 0 .) Se puede demostrar [ 19 ] que si las desviaciones estándar son iguales, entonces r = sec φ − tan φ , donde sec y tan son funciones trigonométricas .

Para datos centrados (es decir, datos que han sido desplazados por las medias muestrales de sus respectivas variables de modo que tengan un promedio de cero para cada variable), el coeficiente de correlación también puede verse como el coseno del ángulo θ entre los dos vectores observados en un espacio N -dimensional (para N observaciones de cada variable). [ 20 ]

Se pueden determinar tanto los coeficientes de correlación no centrados (que no cumplen con la correlación de Pearson) como los centrados para un conjunto de datos. Por ejemplo, supongamos que se encuentra que cinco países tienen productos nacionales brutos de 1, 2, 3, 5 y 8 mil millones de dólares, respectivamente. Supongamos que estos mismos cinco países (en el mismo orden) tienen 11%, 12%, 13%, 15% y 18% de pobreza. Entonces, sean x e y vectores ordenados de 5 elementos que contienen los datos anteriores: x = (1, 2, 3, 5, 8) e y = (0.11, 0.12, 0.13, 0.15, 0.18) .

Mediante el procedimiento habitual para hallar el ángulo θ entre dos vectores (véase producto escalar ), el coeficiente de correlación no centrado es

porqueθ=incógnitayincógnitay=2,931030,0983=0,920814711.{\displaystyle \cos \theta ={\frac {\mathbf {x} \cdot \mathbf {y} }{\left\|\mathbf {x} \right\|\left\|\mathbf {y} \right\|}}={\frac {2.93}{{\sqrt {103}}{\sqrt {0.0983}}}}=0.920814711.}

Este coeficiente de correlación no centrado es idéntico a la similitud del coseno . Los datos anteriores fueron elegidos deliberadamente para estar perfectamente correlacionados: y = 0,10 + 0,01 x . Por lo tanto, el coeficiente de correlación de Pearson debe ser exactamente uno. Centrando los datos (desplazando x por ℰ( x ) = 3,8 e y por ℰ( y ) = 0,138 ) se obtiene x = (−2,8, −1,8, −0,8, 1,2, 4,2) e y = (−0,028, −0,018, −0,008, 0,012, 0,042) , de donde

porqueθ=incógnitayincógnitay=0,30830.80,00308=1=ρincógnitay,{\displaystyle \cos \theta ={\frac {\mathbf {x} \cdot \mathbf {y} }{\left\|\mathbf {x} \right\|\left\|\mathbf {y} \right\|}}={\frac {0.308}{{\sqrt {30.8}}{\sqrt {0.00308}}}}=1=\rho _{xy},}

Como era de esperar.

Interpretación del tamaño de una correlación

Esta figura da una idea de cómo la utilidad de una correlación de Pearson para predecir valores varía con su magnitud. Dados X , Y conjuntamente normales con correlación ρ ,11ρ2{\displaystyle 1-{\sqrt {1-\rho ^{2}}}}(representado aquí como una función de ρ ) es el factor por el cual un intervalo de predicción dado para Y puede reducirse dado el valor correspondiente de X. Por ejemplo, si ρ = ​​0,5, entonces el intervalo de predicción del 95 % de Y | X será aproximadamente un 13 % menor que el intervalo de predicción del 95 % de Y.

Varios autores han ofrecido directrices para la interpretación de un coeficiente de correlación. [ 21 ] [ 22 ] Sin embargo, todos estos criterios son, en cierto modo, arbitrarios. [ 22 ] La interpretación de un coeficiente de correlación depende del contexto y los objetivos. Una correlación de 0,8 puede ser muy baja si se verifica una ley física con instrumentos de alta calidad, pero puede considerarse muy alta en las ciencias sociales, donde puede haber una mayor influencia de factores que complican el análisis.

Inferencia

La inferencia estadística basada en el coeficiente de correlación de Pearson a menudo se centra en uno de los dos objetivos siguientes:

  • Uno de los objetivos es probar la hipótesis nula de que el coeficiente de correlación verdadero ρ es igual a 0, basándose en el valor del coeficiente de correlación muestral r .
  • El otro objetivo es derivar un intervalo de confianza que, en muestreos repetidos, tenga una probabilidad dada de contener ρ .

A continuación se analizan los métodos para lograr uno o ambos objetivos.

Utilizando una prueba de permutación

Las pruebas de permutación proporcionan un método directo para realizar pruebas de hipótesis y construir intervalos de confianza. Una prueba de permutación para el coeficiente de correlación de Pearson consta de los siguientes dos pasos:

  1. Utilizando los datos emparejados originales ( x i , y i ), redefina aleatoriamente los pares para crear un nuevo conjunto de datos ( x i , y i ), donde los i son una permutación del conjunto {1,..., n }. La permutación i se selecciona aleatoriamente, con probabilidades iguales colocadas en todas las n ! permutaciones posibles. Esto es equivalente a extraer los i aleatoriamente sin reemplazo del conjunto {1, ..., n }. En el bootstrapping , un enfoque estrechamente relacionado, los i y los i son iguales y se extraen con reemplazo de {1, ..., n };  
  2. Construya un coeficiente de correlación r a partir de los datos aleatorios.

Para realizar la prueba de permutación, repita los pasos  (1) y (2) un gran número de veces. El valor p de la prueba de permutación es la proporción de los valores r generados en el paso  (2) que son mayores que el coeficiente de correlación de Pearson calculado a partir de los datos originales. Aquí, "mayor" puede significar que el valor es mayor en magnitud o mayor en signo, según se desee una prueba bilateral o unilateral .

Utilizando un bootstrap

El método bootstrap se puede utilizar para construir intervalos de confianza para el coeficiente de correlación de Pearson. En el bootstrap "no paramétrico", se remuestrean n pares ( xᵢ , yᵢ ) con reemplazo del conjunto observado de n pares, y el coeficiente de correlación r se calcula a partir de los datos remuestreados. Este proceso se repite muchas veces, y la distribución empírica de los valores de r remuestreados se utiliza para aproximar la distribución muestral del estadístico. Un intervalo de confianza del 95% para ρ se define como el intervalo que abarca desde el percentil 2,5 hasta el percentil 97,5 de los valores de r remuestreados . 

Error estándar

Siincógnita{\displaystyle x}yy{\displaystyle y}son variables aleatorias, con una relación lineal simple entre ellas con un ruido normal aditivo (es decir, y = a + bx + e), entonces un error estándar asociado a la correlación es

σr1r2norte{\displaystyle \sigma _{r}\approx {\frac {1-r^{2}}{\sqrt {n}}}}

dónder{\displaystyle r}es la correlación ynorte{\displaystyle n}el tamaño de la muestra. [ 23 ] [ 24 ]

Pruebas mediante la distribución t de Student

Valores críticos del coeficiente de correlación de Pearson que deben superarse para ser considerados significativamente distintos de cero al nivel de significancia de 0,05.

Para pares de una distribución normal bivariada no correlacionada , la distribución muestral del coeficiente de correlación de Pearson estudentizado sigue una distribución t de Student con grados de libertad n  2. Específicamente, si las variables subyacentes tienen una distribución normal bivariada, la variable

t=rσr=rnorte21r2{\displaystyle t={\frac {r}{\sigma _{r}}}=r{\sqrt {\frac {n-2}{1-r^{2}}}}}

tiene una distribución t de Student en el caso nulo (correlación cero). [ 25 ] Esto se cumple aproximadamente en caso de valores observados no normales si los tamaños de muestra son suficientemente grandes. [ 26 ] Para determinar los valores críticos de r se necesita la función inversa:

r=tnorte2+t2.{\displaystyle r={\frac {t}{\sqrt {n-2+t^{2}}}}.}

Como alternativa, se pueden utilizar enfoques asintóticos con muestras grandes.

Otro artículo anterior [ 27 ] proporciona gráficos y tablas para valores generales de ρ , para tamaños de muestra pequeños, y analiza enfoques computacionales.

En el caso de que las variables subyacentes no sean normales, la distribución muestral del coeficiente de correlación de Pearson sigue una distribución t de Student , pero los grados de libertad se reducen. [ 28 ]

Utilizando la distribución exacta

Para datos que siguen una distribución normal bivariada , la función de densidad exacta f ( r ) para el coeficiente de correlación muestral r de una distribución normal bivariada es [ 29 ] [ 30 ] [ 31 ]

F(r)=(norte2)Γ(norte1)(1ρ2)norte12(1r2)norte422πΓ(norte12)(1ρr)norte322F1(12,12;12(2norte1);12(ρr+1)){\displaystyle f(r)={\frac {(n-2)\,\mathrm {\Gamma } (n-1)\left(1-\rho ^{2}\right)^{\frac {n-1}{2}}\left(1-r^{2}\right)^{\frac {n-4}{2}}}{{\sqrt {2\pi }}\,\operatorname {\Gamma } {\mathord {\left(n-{\tfrac {1}{2}}\right)}}(1-\rho r)^{n-{\frac {3}{2}}}}}{}_{2}\mathrm {F} _{1}{\mathord {\left({\tfrac {1}{2}},{\tfrac {1}{2}};{\tfrac {1}{2}}(2n-1);{\tfrac {1}{2}}(\rho r+1)\right)}}}

dóndeΓ{\displaystyle \Gamma }es la función gamma y2F1(a,b;do;z){\displaystyle {}_{2}\mathrm {F} _{1}(a,b;c;z)}es la función hipergeométrica gaussiana .

En el caso especial cuandoρ=0{\displaystyle \rho =0}(correlación poblacional cero), la función de densidad exacta f ( r ) se puede escribir como

F(r)=(1r2)norte42B(12,norte22),{\displaystyle f(r)={\frac {\left(1-r^{2}\right)^{\frac {n-4}{2}}}{\operatorname {\mathrm {B} } {\mathord {\left({\tfrac {1}{2}},{\tfrac {n-2}{2}}\right)}}}},}

dóndeB{\displaystyle \mathrm {B} }es la función beta , que es una forma de escribir la densidad de una distribución t de Student para un coeficiente de correlación de muestra estudentizado , como se indicó anteriormente.

Utilizando la transformación de Fisher

En la práctica, los intervalos de confianza y las pruebas de hipótesis relacionadas con ρ se suelen llevar a cabo utilizando la transformación estabilizadora de la varianza , la transformación de Fisher ,F{\displaystyle F}:

F(r)12ln(1+r1r)=artanh(r){\displaystyle F(r)\equiv {\tfrac {1}{2}}\,\ln \left({\frac {1+r}{1-r}}\right)=\operatorname {artanh} (r)}

F ( r ) sigue aproximadamente una distribución normal con

significar=F(ρ)=artanh(ρ){\displaystyle {\text{mean}}=F(\rho )=\operatorname {artanh} (\rho )}    y error estándar=SE=1norte3,{\displaystyle ={\text{SE}}={\frac {1}{\sqrt {n-3}}},}

donde n es el tamaño de la muestra. El error de aproximación es mínimo para un tamaño de muestra grande.norte{\displaystyle n}y pequeñosr{\displaystyle r}yρ0{\displaystyle \rho _{0}}y aumenta en caso contrario.

Utilizando la aproximación, se obtiene una puntuación z.

z=incógnitasignificarSE=[F(r)F(ρ0)]norte3{\displaystyle z={\frac {x-{\text{mean}}}{\text{SE}}}=[F(r)-F(\rho _{0})]{\sqrt {n-3}}}

bajo la hipótesis nula queρ=ρ0{\displaystyle \rho =\rho _{0}}, dado el supuesto de que los pares de muestras son independientes e idénticamente distribuidos y siguen una distribución normal bivariada . Por lo tanto, se puede obtener un valor p aproximado a partir de una tabla de probabilidad normal. Por ejemplo, si se observa z  =  2.2 y se desea un valor p bilateral para probar la hipótesis nula queρ=0{\displaystyle \rho =0}, el valor p es 2Φ(−2.2) = 0.028 , donde Φ es la función de distribución acumulativa normal estándar .

Para obtener un intervalo de confianza para ρ, primero calculamos un intervalo de confianza para F (ρ{\displaystyle \rho }):

100(1α)%CI:artanh(ρ)[artanh(r)±zα/2SE]{\displaystyle 100(1-\alpha )\%{\text{CI}}:\operatorname {artanh} (\rho )\in [\operatorname {artanh} (r)\pm z_{\alpha /2}{\text{SE}}]}

La transformación inversa de Fisher devuelve el intervalo a la escala de correlación.

100(1α)%CI:ρ[tanh(artanh(r)zα/2SE),tanh(artanh(r)+zα/2SE)]{\displaystyle 100(1-\alpha )\%{\text{CI}}:\rho \in [\tanh(\operatorname {artanh} (r)-z_{\alpha /2}{\text{SE}}),\tanh(\operatorname {artanh} (r)+z_{\alpha /2}{\text{SE}})]}

Por ejemplo, supongamos que observamos r  =  0,7 con un tamaño de muestra de n = 50, y deseamos obtener un intervalo de confianza del 95% para ρ . El valor transformado es arctanh(r)=0,8673{\textstyle \operatorname {arctanh} \left(r\right)=0.8673}, por lo que el intervalo de confianza en la escala transformada es0,8673±1,9647{\displaystyle 0.8673\pm {\frac {1.96}{\sqrt {47}}}}o (0,5814,  1,1532). Al convertir de nuevo a la escala de correlación se obtiene (0,5237,  0,8188).

En el análisis de regresión por mínimos cuadrados

El cuadrado del coeficiente de correlación muestral se suele denotar como y es un caso especial del coeficiente de determinación . En este caso, estima la fracción de la varianza en Y que es explicada por X en una regresión lineal simple . Por lo tanto, si tenemos el conjunto de datos observadoY1,,Ynorte{\displaystyle Y_{1},\dots ,Y_{n}}y el conjunto de datos ajustadoY^1,,Y^norte{\displaystyle {\hat {Y}}_{1},\dots ,{\hat {Y}}_{n}}Entonces, como punto de partida, la variación total en Y i alrededor de su valor promedio se puede descomponer de la siguiente manera:

i(YiY¯)2=i(YiY^i)2+i(Y^iY¯)2,{\displaystyle \sum _{i}(Y_{i}-{\bar {Y}})^{2}=\sum _{i}(Y_{i}-{\hat {Y}}_{i})^{2}+\sum _{i}({\hat {Y}}_{i}-{\bar {Y}})^{2},}

donde elY^i{\displaystyle {\hat {Y}}_{i}}son los valores ajustados del análisis de regresión. Esto se puede reorganizar para dar

1=i(YiY^i)2i(YiY¯)2+i(Y^iY¯)2i(YiY¯)2.{\displaystyle 1={\frac {\sum _{i}(Y_{i}-{\hat {Y}}_{i})^{2}}{\sum _{i}(Y_{i}-{\bar {Y}})^{2}}}+{\frac {\sum _{i}({\hat {Y}}_{i}-{\bar {Y}})^{2}}{\sum _{i}(Y_{i}-{\bar {Y}})^{2}}}.}

Los dos sumandos anteriores representan la fracción de la varianza en Y que es explicada por X (derecha) y la que no es explicada por X (izquierda).

A continuación, aplicamos una propiedad de los modelos de regresión de mínimos cuadrados , que la covarianza muestral entreY^i{\displaystyle {\hat {Y}}_{i}}yYiY^i{\displaystyle Y_{i}-{\hat {Y}}_{i}}es cero. Por lo tanto, el coeficiente de correlación muestral entre los valores de respuesta observados y ajustados en la regresión se puede escribir

r(Y,Y^)=i(YiY¯)(Y^iY¯)i(YiY¯)2i(Y^iY¯)2=i(YiY^i+Y^iY¯)(Y^iY¯)i(YiY¯)2i(Y^iY¯)2=i[(YiY^i)(Y^iY¯)+(Y^iY¯)2]i(YiY¯)2i(Y^iY¯)2=i(Y^iY¯)2i(YiY¯)2i(Y^iY¯)2=i(Y^iY¯)2i(YiY¯)2.{\displaystyle {\begin{aligned}r(Y,{\hat {Y}})&={\frac {\sum _{i}(Y_{i}-{\bar {Y}})({\hat {Y}}_{i}-{\bar {Y}})}{\sqrt {\sum _{i}(Y_{i}-{\bar {Y}})^{2}\cdot \sum _{i}({\hat {Y}}_{i}-{\bar {Y}})^{2}}}}\\[6pt]&={\frac {\sum _{i}(Y_{i}-{\hat {Y}}_{i}+{\hat {Y}}_{i}-{\bar {Y}})({\hat {Y}}_{i}-{\bar {Y}})}{\sqrt {\sum _{i}(Y_{i}-{\bar {Y}})^{2}\cdot \sum _{i}({\hat {Y}}_{i}-{\bar {Y}})^{2}}}}\\[6pt]&={\frac {\sum _{i}[(Y_{i}-{\hat {Y}}_{i})({\hat {Y}}_{i}-{\bar {Y}})+({\hat {Y}}_{i}-{\bar {Y}})^{2}]}{\sqrt {\sum _{i}(Y_{i}-{\bar {Y}})^{2}\cdot \sum _{i}({\hat {Y}}_{i}-{\bar {Y}})^{2}}}}\\[6pt]&={\frac {\sum _{i}({\hat {Y}}_{i}-{\bar {Y}})^{2}}{\sqrt {\sum _{i}(Y_{i}-{\bar {Y}})^{2}\cdot \sum _{i}({\hat {Y}}_{i}-{\bar {Y}})^{2}}}}\\[6pt]&={\sqrt {\frac {\sum _{i}({\hat {Y}}_{i}-{\bar {Y}})^{2}}{\sum _{i}(Y_{i}-{\bar {Y}})^{2}}}}.\end{aligned}}}

De este modo

r(Y,Y^)2=i(Y^iY¯)2i(YiY¯)2{\displaystyle r(Y,{\hat {Y}})^{2}={\frac {\sum _{i}({\hat {Y}}_{i}-{\bar {Y}})^{2}}{\sum _{i}(Y_{i}-{\bar {Y}})^{2}}}}

dónder(Y,Y^)2{\displaystyle r(Y,{\hat {Y}})^{2}}es la proporción de la varianza en Y explicada por una función lineal de X.

En la derivación anterior, el hecho de que

i(YiY^i)(Y^iY¯)=0{\displaystyle \sum _{i}(Y_{i}-{\hat {Y}}_{i})({\hat {Y}}_{i}-{\bar {Y}})=0}

se puede demostrar observando que las derivadas parciales de la suma residual de cuadrados ( RSS ) sobre β 0 y β 1 son iguales a 0 en el modelo de mínimos cuadrados, donde

RSS=i(YiY^i)2{\displaystyle {\text{RSS}}=\sum _{i}(Y_{i}-{\hat {Y}}_{i})^{2}}.

Al final, la ecuación se puede escribir como

r(Y,Y^)2=SSregSSnene{\displaystyle r(Y,{\hat {Y}})^{2}={\frac {{\text{SS}}_{\text{reg}}}{{\text{SS}}_{\text{tot}}}}}

dónde

  • SSreg=i(Y^iY¯)2{\displaystyle {\text{SS}}_{\text{reg}}=\sum _{i}({\hat {Y}}_{i}-{\bar {Y}})^{2}}
  • SSnene=i(YiY¯)2{\displaystyle {\text{SS}}_{\text{tot}}=\sum _{i}(Y_{i}-{\bar {Y}})^{2}}.

El símboloSSreg{\displaystyle {\text{SS}}_{\text{reg}}}se denomina suma de cuadrados de regresión, también llamada suma de cuadrados explicada , ySSnene{\displaystyle {\text{SS}}_{\text{tot}}}es la suma total de cuadrados (proporcional a la varianza de los datos).

Sensibilidad a la distribución de los datos

Existencia

El coeficiente de correlación de Pearson poblacional se define en términos de momentos y, por lo tanto, existe para cualquier distribución de probabilidad bivariada para la cual la covarianza poblacional esté definida y las varianzas poblacionales marginales estén definidas y sean distintas de cero. Algunas distribuciones de probabilidad, como la distribución de Cauchy , tienen varianza indefinida y, por lo tanto, ρ no está definido si X o Y siguen dicha distribución. En algunas aplicaciones prácticas, como aquellas que involucran datos que se sospecha que siguen una distribución de cola pesada , esta es una consideración importante. Sin embargo, la existencia del coeficiente de correlación generalmente no es un problema; por ejemplo, si el rango de la distribución está acotado, ρ siempre está definido.

Tamaño de la muestra

  • Si el tamaño de la muestra es moderado o grande y la población es normal, entonces, en el caso de la distribución normal bivariada , el coeficiente de correlación muestral es la estimación de máxima verosimilitud del coeficiente de correlación poblacional, y es asintóticamente insesgado y eficiente , lo que significa aproximadamente que es imposible construir una estimación más precisa que el coeficiente de correlación muestral.
  • Si el tamaño de la muestra es grande y la población no es normal, el coeficiente de correlación muestral permanece aproximadamente insesgado, pero puede que no sea eficiente.
  • Si el tamaño de la muestra es grande, el coeficiente de correlación muestral es un estimador consistente del coeficiente de correlación poblacional siempre que las medias, varianzas y covarianzas muestrales sean consistentes (lo cual está garantizado cuando se puede aplicar la ley de los grandes números ).
  • Si el tamaño de la muestra es pequeño, entonces el coeficiente de correlación muestral r no es una estimación insesgada de ρ . [ 12 ] En su lugar, debe utilizarse el coeficiente de correlación ajustado: consulte la definición en otra parte de este artículo.
  • Las correlaciones pueden ser diferentes para datos dicotómicos desequilibrados cuando hay error de varianza en la muestra. [ 32 ]

Robustez

Al igual que muchas estadísticas de uso común, la estadística muestral r no es robusta , [ 33 ] por lo que su valor puede ser engañoso si hay valores atípicos presentes. [ 34 ] [ 35 ] Específicamente, el PMCC no es robusto en cuanto a la distribución, [ 36 ] ni resistente a valores atípicos [ 33 ] (véase Estadísticas robustas §  Definición ). La inspección del diagrama de dispersión entre X e Y generalmente revelará una situación en la que la falta de robustez podría ser un problema, y ​​en tales casos puede ser aconsejable utilizar una medida de asociación robusta. Sin embargo, tenga en cuenta que si bien la mayoría de los estimadores robustos de asociación miden la dependencia estadística de alguna manera, generalmente no son interpretables en la misma escala que el coeficiente de correlación de Pearson.

La inferencia estadística para el coeficiente de correlación de Pearson es sensible a la distribución de los datos. Se pueden aplicar pruebas exactas y pruebas asintóticas basadas en la transformación de Fisher si los datos se distribuyen aproximadamente de forma normal, pero pueden resultar engañosas en caso contrario. En algunos casos, se puede aplicar el método bootstrap para construir intervalos de confianza y pruebas de permutación para realizar pruebas de hipótesis. Estos enfoques no paramétricos pueden ofrecer resultados más significativos en situaciones donde no se cumple la normalidad bivariada. Sin embargo, las versiones estándar de estos enfoques se basan en la intercambiabilidad de los datos, lo que significa que no existe un ordenamiento o agrupamiento de los pares de datos analizados que pueda afectar el comportamiento de la estimación de la correlación.

Un análisis estratificado es una forma de abordar la falta de normalidad bivariada o de aislar la correlación resultante de un factor controlando otro. Si W representa la pertenencia a un clúster u otro factor que se desea controlar, podemos estratificar los datos según el valor de W y luego calcular un coeficiente de correlación dentro de cada estrato. Las estimaciones a nivel de estrato se pueden combinar para estimar la correlación general controlando W. [ 37 ]

Variantes

Se pueden calcular variaciones del coeficiente de correlación para diferentes propósitos. Aquí hay algunos ejemplos.

Coeficiente de correlación ajustado

El coeficiente de correlación muestral r no es una estimación insesgada de ρ . Para datos que siguen una distribución normal bivariada , la esperanza E[ r ] para el coeficiente de correlación muestral r de una distribución normal bivariada es [ 38 ].

mi[r]=ρρ(1ρ2)2norte+,{\displaystyle \operatorname {\mathbb {E} } \left[r\right]=\rho -{\frac {\rho \left(1-\rho ^{2}\right)}{2n}}+\cdots ,\quad }Por lo tanto, r es un estimador sesgado deρ.{\displaystyle \rho .}

El estimador insesgado de varianza mínima único r adj viene dado por [ 39 ].

dónde:

Se puede obtener un estimador aproximadamente insesgado r adj truncando E[ r ] y resolviendo esta ecuación truncada:

Una solución aproximada a la ecuación ( 2 ) es

donde en ( 3 )

  • r,norte{\displaystyle r,n}se definen como se indicó anteriormente,
  • r adj es un estimador subóptimo,
  • r adj también se puede obtener maximizando log( f ( r )),
  • r adj tiene varianza mínima para valores grandes de n ,
  • r adj tiene un sesgo de orden 1 ( n − 1) .

Otro coeficiente de correlación ajustado propuesto [ 12 ] es

radj=1(1r2)(norte1)(norte2).{\displaystyle r_{\text{adj}}={\sqrt {1-{\frac {(1-r^{2})(n-1)}{(n-2)}}}}.}

r adjr para valores grandes de n . 

Coeficiente de correlación ponderado

Supongamos que las observaciones que se correlacionan tienen diferentes grados de importancia que se pueden expresar con un vector de pesos w . Para calcular la correlación entre los vectores x e y con el vector de pesos w (todos de longitud n ), [ 40 ] [ 41 ] 

  • Media ponderada:metro(incógnita;w)=iwiincógnitaiiwi.{\displaystyle \operatorname {m} (x;w)={\frac {\sum _{i}w_{i}x_{i}}{\sum _{i}w_{i}}}.}
  • Covarianza ponderadacobertura(incógnita,y;w)=iwi(incógnitaimetro(incógnita;w))(yimetro(y;w))iwi.{\displaystyle \operatorname {cov} (x,y;w)={\frac {\sum _{i}w_{i}\cdot (x_{i}-\operatorname {m} (x;w))(y_{i}-\operatorname {m} (y;w))}{\sum _{i}w_{i}}}.}
  • Correlación ponderadacorr(incógnita,y;w)=cobertura(incógnita,y;w)cobertura(incógnita,incógnita;w)cobertura(y,y;w).{\displaystyle \operatorname {corr} (x,y;w)={\frac {\operatorname {cov} (x,y;w)}{\sqrt {\operatorname {cov} (x,x;w)\operatorname {cov} (y,y;w)}}}.}

Coeficiente de correlación reflectiva

La correlación reflectiva es una variante de la correlación de Pearson en la que los datos no están centrados alrededor de sus valores medios. La correlación reflectiva poblacional es

corrr(incógnita,Y)=mi[incógnitaY]mi[incógnita2]mi[Y2].{\displaystyle \operatorname {corr} _{r}(X,Y)={\frac {\operatorname {\mathbb {E} } [\,X\,Y\,]}{\sqrt {\operatorname {\mathbb {E} } [\,X^{2}\,]\cdot \operatorname {\mathbb {E} } [\,Y^{2}\,]}}}.}

La correlación reflectiva es simétrica, pero no es invariante bajo traslación:

corrr(incógnita,Y)=corrr(Y,incógnita)=corrr(incógnita,bY)corrr(incógnita,a+bY),a0,b>0.{\displaystyle \operatorname {corr} _{r}(X,Y)=\operatorname {corr} _{r}(Y,X)=\operatorname {corr} _{r}(X,bY)\neq \operatorname {corr} _{r}(X,a+bY),\quad a\neq 0,b>0.}

La correlación reflectiva de la muestra es equivalente a la similitud del coseno :

rrincógnitay=incógnitaiyi(incógnitai2)(yi2).{\displaystyle rr_{xy}={\frac {\sum x_{i}y_{i}}{\sqrt {(\sum x_{i}^{2})(\sum y_{i}^{2})}}}.}

La versión ponderada de la correlación reflectiva de la muestra es

rrincógnitay,w=wiincógnitaiyi(wiincógnitai2)(wiyi2).{\displaystyle rr_{xy,w}={\frac {\sum w_{i}x_{i}y_{i}}{\sqrt {(\sum w_{i}x_{i}^{2})(\sum w_{i}y_{i}^{2})}}}.}

Coeficiente de correlación escalado

La correlación escalada es una variante de la correlación de Pearson en la que el rango de los datos se restringe intencionalmente y de manera controlada para revelar correlaciones entre componentes rápidos en series temporales . [ 42 ] La correlación escalada se define como la correlación promedio en segmentos cortos de datos.

DejarK{\displaystyle K}sea ​​el número de segmentos que caben en la longitud total de la señalT{\displaystyle T}para una escala determinadas{\displaystyle s}:

K=redondo(Ts).{\displaystyle K=\operatorname {round} \left({\frac {T}{s}}\right).}

La correlación escalada en todas las señalesr¯s{\displaystyle {\bar {r}}_{s}}se calcula entonces como

r¯s=1Kk=1Krk,{\displaystyle {\bar {r}}_{s}={\frac {1}{K}}\sum \limits _{k=1}^{K}r_{k},}

dónderk{\displaystyle r_{k}}es el coeficiente de correlación de Pearson para el segmentok{\displaystyle k}.

Al elegir el parámetros{\displaystyle s}Se reduce el rango de valores y se filtran las correlaciones a largo plazo, revelándose únicamente las correlaciones a corto plazo. De este modo, se eliminan las contribuciones de los componentes lentos y se conservan las de los componentes rápidos.

distancia de Pearson

Una métrica de distancia para dos variables X e Y conocida como distancia de Pearson se puede definir a partir de su coeficiente de correlación como [ 43 ].

dincógnita,Y=1ρincógnita,Y.{\displaystyle d_{X,Y}=1-\rho _{X,Y}.}

Considerando que el coeficiente de correlación de Pearson se encuentra entre [−1, +1], la distancia de Pearson se sitúa en [0, 2]. La distancia de Pearson se ha utilizado en análisis de clústeres y detección de datos para comunicaciones y almacenamiento con ganancia y desplazamiento desconocidos. [ 44 ]

The Pearson "distance" defined this way assigns distance greater than 1 to negative correlations. In reality, both strong positive correlation and negative correlations are meaningful, so care must be taken when Pearson "distance" is used for nearest neighbor algorithm as such algorithm will only include neighbors with positive correlation and exclude neighbors with negative correlation. Alternatively, an absolute valued distance, dX,Y=1|ρX,Y|{\displaystyle d_{X,Y}=1-|\rho _{X,Y}|}, can be applied, which will take both positive and negative correlations into consideration. The information on positive and negative association can be extracted separately, later.

Circular correlation coefficient

For variables X = {x1,...,xn} and Y = {y1,...,yn} that are defined on the unit circle [0, 2π), it is possible to define a circular analog of Pearson's coefficient.[45] This is done by transforming data points in X and Y with a sine function such that the correlation coefficient is given as:

rcircular=i=1nsin(xix¯)sin(yiy¯)i=1nsin(xix¯)2i=1nsin(yiy¯)2{\displaystyle r_{\text{circular}}={\frac {\sum _{i=1}^{n}\sin(x_{i}-{\bar {x}})\sin(y_{i}-{\bar {y}})}{{\sqrt {\sum _{i=1}^{n}\sin(x_{i}-{\bar {x}})^{2}}}{\sqrt {\sum _{i=1}^{n}\sin(y_{i}-{\bar {y}})^{2}}}}}}

where x¯{\displaystyle {\bar {x}}} and y¯{\displaystyle {\bar {y}}} are the circular means of X and Y. This measure can be useful in fields like meteorology where the angular direction of data is important.

Partial correlation

If a population or data-set is characterized by more than two variables, a partial correlation coefficient measures the strength of dependence between a pair of variables that is not accounted for by the way in which they both change in response to variations in a selected subset of the other variables.

Pearson correlation coefficient in quantum systems

For two observables, X{\displaystyle X} and Y{\displaystyle Y}, in a bipartite quantum system Pearson correlation coefficient is defined as[46][47]

Cor(X,Y)=E[XY]E[X]E[Y]V[X]V[Y],{\displaystyle \mathbb {Cor} (X,Y)={\frac {\mathbb {E} [X\otimes Y]-\mathbb {E} [X]\cdot \mathbb {E} [Y]}{\sqrt {\mathbb {V} [X]\cdot \mathbb {V} [Y]}}}\,,}

where

  • E[X]{\displaystyle \mathbb {E} [X]} is the expectation value of the observable X{\displaystyle X},
  • E[Y]{\displaystyle \mathbb {E} [Y]} is the expectation value of the observable Y{\displaystyle Y},
  • E[XY]{\displaystyle \mathbb {E} [X\otimes Y]} is the expectation value of the observable XY{\displaystyle X\otimes Y},
  • V[X]{\displaystyle \mathbb {V} [X]} is the variance of the observable X{\displaystyle X}, and
  • V[Y]{\displaystyle \mathbb {V} [Y]} is the variance of the observable Y{\displaystyle Y}.

Cor(X,Y){\displaystyle \mathbb {Cor} (X,Y)} is symmetric, i.e., Cor(X,Y)=Cor(Y,X){\displaystyle \mathbb {Cor} (X,Y)=\mathbb {Cor} (Y,X)}, and its absolute value is invariant under affine transformations.

Decorrelation of n random variables

It is always possible to remove the correlations between all pairs of an arbitrary number of random variables by using a data transformation, even if the relationship between the variables is nonlinear. A presentation of this result for population distributions is given by Cox & Hinkley.[48]

A corresponding result exists for reducing the sample correlations to zero. Suppose a vector of n random variables is observed m times. Let X be a matrix where Xi,j{\displaystyle X_{i,j}}es la j -ésima variable de la observación i . SeaZmetro,metro{\displaystyle Z_{m,m}}Sea una matriz cuadrada m x m con cada elemento 1. Entonces D es la matriz de datos transformada de modo que cada variable aleatoria tenga media cero, y T es la matriz de datos transformada de modo que todas las variables tengan media cero y correlación cero con todas las demás variables; la matriz de correlación muestral de T será la matriz identidad. Esta debe dividirse además por la desviación estándar para obtener varianza unitaria. Las variables transformadas no estarán correlacionadas, aunque no sean independientes .

D=incógnita1metroZmetro,metroincógnita{\displaystyle D=X-{\frac {1}{m}}Z_{m,m}X}
T=D(DTD)12,{\displaystyle T=D(D^{\mathsf {T}}D)^{-{\frac {1}{2}}},}

donde un exponente de + 1 2 representa la raíz cuadrada de la matriz inversa de una matriz. La matriz de correlación de T será la matriz identidad. Si una nueva observación de datos x es un vector fila de n elementos, entonces se puede aplicar la misma transformación a x para obtener los vectores transformados d y t :

d=incógnita1metroZ1,metroincógnita,{\displaystyle d=x-{\frac {1}{m}}Z_{1,m}X,}
t=d(DTD)12.{\displaystyle t=d(D^{\mathsf {T}}D)^{-{\frac {1}{2}}}.}

Esta decorrelación está relacionada con el análisis de componentes principales para datos multivariados.

Implementaciones de software

  • El paquete base de estadística de Rcor(x, y) implementa el coeficiente de correlación con , o (con el valor p también) con cor.test(x, y).
  • La biblioteca SciPy de Pythonpearsonr(x, y) a través de .
  • Las bibliotecas Pandas y Polars de Python implementan el cálculo del coeficiente de correlación de Pearson como opción predeterminada para los métodos pandas.DataFrame.corry polars.corr, respectivamente.
  • Wolfram Mathematica a través de la Correlationfunción, o (con el valor p) con CorrelationTest.
  • La biblioteca Boost C++correlation_coefficient a través de la función.
  • Excel cuenta con una función integrada correl(array1, array2)para calcular el coeficiente de correlación de Pearson.

Véase también

Notas a pie de página

  1. Ya en 1877, Galton utilizaba el término "reversión" y el símbolo " r " para lo que más tarde se convertiría en "regresión". [ 4 ] [ 5 ] [ 6 ]

Referencias

  1. "Coeficiente de correlación: definición simple, fórmula, pasos fáciles" . Estadística práctica .
  2. "4.3. Covarianza y coeficiente de correlación — Libro de texto de la TU Delft" . mude.citg.tudelft.nl . Consultado el 30 de octubre de 2025 .
  3. "4.3. Covarianza y coeficiente de correlación — Libro de texto de la TU Delft" . mude.citg.tudelft.nl . Consultado el 30 de octubre de 2025 .
  4. Galton, F. (5–19 de abril de 1877). "Leyes típicas de la herencia" . Nature . 15 (388, 389, 390): 492–495 , 512–514 , 532–533 . Bibcode : 1877Natur..15..492. . doi : 10.1038/015492a0 . S2CID 4136393 . En el "Apéndice" de la página 532, Galton utiliza el término "reversión" y el símbolo r .
  5. Galton, F. (24 de septiembre de 1885). "La Asociación Británica: Sección II, Antropología: Discurso de apertura de Francis Galton, FRS, etc., Presidente del Instituto Antropológico, Presidente de la Sección" . Nature . 32 (830): 507–510 .
  6. Galton, F. (1886). "Regresión hacia la mediocridad en la estatura hereditaria" . Journal of the Anthropological Institute of Great Britain and Ireland . 15 : 246–263 . doi : 10.2307/2841583 . JSTOR 2841583 . 
  7. Pearson, Karl (20 de junio de 1895). "Notas sobre regresión y herencia en el caso de dos padres" . Actas de la Royal Society de Londres . 58 : 240–242 . Bibcode : 1895RSPS...58..240P .
  8. Stigler, Stephen M. (1989). "El relato de Francis Galton sobre la invención de la correlación" . Statistical Science . 4 (2): 73– 79. doi : 10.1214/ss/1177012580 . JSTOR 2245329 . 
  9. "Análisis matemático sobre las probabilidades de errores de situación de un punto" . Memoria. Acad. Roy. Ciencia. Inst. Francia . Ciencia. Matemáticas y Física. (en francés). 9 : 255– 332. 1844 - vía Google Books.
  10. Wright, S. (1921). "Correlación y causalidad" . Journal of Agricultural Research . 20 (7): 557– 585.
  11. "¿Cómo se derivó la fórmula del coeficiente de correlación?" . Validado cruzadamente . Consultado el 26 de octubre de 2024 .
  12. 1 2 3 4 5 Estadísticas reales con Excel, " Conceptos básicos de correlación ", consultado el 22 de febrero de 2015.
  13. Weisstein, Eric W. "Correlación estadística" . Wolfram MathWorld . Consultado el 22 de agosto de 2020 .
  14. Moriya, N. (2008). "Análisis conjunto óptimo multivariado relacionado con el ruido en procesos estocásticos longitudinales". En Yang, Fengshan (ed.). Avances en modelado matemático aplicado . Nova Science Publishers, Inc. pp. 223–260 . ISBN  978-1-60021-976-4.
  15. Garren, Steven T. (15 de junio de 1998). "Estimación de máxima verosimilitud del coeficiente de correlación en un modelo normal bivariado, con datos faltantes". Statistics & Probability Letters . 38 (3): 281– 288. doi : 10.1016/S0167-7152(98)00035-2 .
  16. "2,6 - Coeficiente de correlación (de Pearson) r" . ESTADÍSTICA 462. Consultado el 10 de julio de 2021 .
  17. "Estadística empresarial introductoria: el coeficiente de correlación r" . opentextbc.ca . Consultado el 21 de agosto de 2020 .
  18. Rodgers; Nicewander (1988). "Trece maneras de analizar el coeficiente de correlación" (PDF) . The American Statistician . 42 (1): 59– 66. doi : 10.2307/2685263 . JSTOR 2685263 . 
  19. Schmid, John Jr. (diciembre de 1947). "La relación entre el coeficiente de correlación y el ángulo incluido entre las líneas de regresión". The Journal of Educational Research . 41 (4): 311– 313. doi : 10.1080/00220671.1947.10881608 . JSTOR 27528906 . 
  20. Rummel, RJ (1976). "Understanding Correlation" . Cap. 5 (como se ilustra para un caso especial en el párrafo siguiente). Archivado del original el 1 de marzo de 2021. Recuperado el 17 de junio de 2015 .
  21. Buda, Andrzej; Jarynowski, Andrzej (diciembre de 2010). Vida útil de las correlaciones y sus aplicaciones . Wydawnictwo Niezależne. págs. 5 a 21. ISBN  978-83-915272-9-0.
  22. 1 2 Cohen, J. (1988). Análisis de potencia estadística para las ciencias del comportamiento (2.ª ed.). 
  23. Bowley, AL (1928). "La desviación estándar del coeficiente de correlación". Journal of the American Statistical Association . 23 (161): 31– 34. doi : 10.2307/2277400 . ISSN 0162-1459 . JSTOR 2277400 .  
  24. "Derivación del error estándar para el coeficiente de correlación de Pearson" . Validado cruzadamente . Consultado el 30 de julio de 2021 .
  25. Rahman, NA (1968) Un curso de estadística teórica , Charles Griffin and Company, 1968
  26. Kendall, MG, Stuart, A. (1973) The Advanced Theory of Statistics, Volume 2: Inference and Relationship , Griffin. ISBN 0-85264-215-6(Sección 31.19)
  27. Soper, HE ; ​​Young, AW; Cave, BM; Lee, A.; Pearson, K. (1917). "Sobre la distribución del coeficiente de correlación en muestras pequeñas. Apéndice II a los trabajos de "Student" y RA Fisher. Un estudio cooperativo" . Biometrika . 11 (4): 328– 413. doi : 10.1093/biomet/11.4.328 .
  28. Davey, Catherine E.; Grayden, David B.; Egan, Gary F.; Johnston, Leigh A. (enero de 2013). "El filtrado induce correlación en datos de estado de reposo de fMRI". NeuroImage . 64 : 728–740 . doi : 10.1016 /j.neuroimage.2012.08.022 . hdl : 11343/44035 . PMID 22939874. S2CID 207184701 .  
  29. Hotelling, Harold (1953). "Nueva luz sobre el coeficiente de correlación y sus transformaciones". Journal of the Royal Statistical Society . Serie B (Metodológica). 15 (2): 193– 232. doi : 10.1111/j.2517-6161.1953.tb00135.x . JSTOR 2983768 . 
  30. Kenney, JF; Keeping, ES (1951). Matemáticas de la estadística . Vol. Parte 2 (2.ª ed.). Princeton, NJ: Van Nostrand.  
  31. Weisstein, Eric W. "Coeficiente de correlación: distribución normal bivariada" . Wolfram MathWorld . Archivado del original el 11 de mayo de 2012. Consultado el 30 de agosto de 2011 .
  32. Lai, Chun Sing; Tao, Yingshan; Xu, Fangyuan; Ng, Wing WY; Jia, Youwei; Yuan, Haoliang; Huang, Chao; Lai, Loi Lei; Xu, Zhao; Locatelli, Giorgio (enero de 2019). "Un marco de análisis de correlación robusto para datos dicotómicos y desequilibrados con incertidumbre" (PDF) . Information Sciences . 470 : 58–77 . doi : 10.1016/j.ins.2018.08.017 . S2CID 52878443 . 
  33. 1 2 Wilcox, Rand R. (2005). Introducción a la estimación robusta y la prueba de hipótesis . Academic Press.
  34. Devlin, Susan J. ; Gnanadesikan, R.; Kettenring JR (1975). "Estimación robusta y detección de valores atípicos con coeficientes de correlación". Biometrika . 62 (3): 531– 545. doi : 10.1093/biomet/62.3.531 . JSTOR 2335508 . 
  35. Huber, Peter J. (2004). Estadística robusta . Wiley. ISBN 0-471-65072-2.
  36. Vaart, AW van der (13 de octubre de 1998). Asymptotic Statistics . Cambridge University Press. doi : 10.1017/cbo9780511802256 . ISBN 978-0-511-80225-6.
  37. Katz, Mitchell H. (2006) Análisis multivariable: una guía práctica para clínicos . 2.ª edición. Cambridge University Press. ISBN 978-0-521-54985-1ISBN 0-521-54985-X
  38. Hotelling, H. (1953). "Nueva luz sobre el coeficiente de correlación y sus transformaciones". Journal of the Royal Statistical Society. Serie B (Metodológica) . 15 (2): 193– 232. doi : 10.1111/j.2517-6161.1953.tb00135.x . JSTOR 2983768 . 
  39. Olkin, Ingram; Pratt, John W. (marzo de 1958). "Estimación insesgada de ciertos coeficientes de correlación" . The Annals of Mathematical Statistics . 29 (1): 201– 211. doi : 10.1214/aoms/1177706717 . JSTOR 2237306 . .
  40. "Re: Calcular una correlación ponderada" . sci.tech-archive.net . Archivado del original el 28 de julio de 2012. Recuperado el 5 de junio de 2009 .
  41. "Matriz de correlación ponderada – Intercambio de archivos – MATLAB Central" . Archivado del original el 15 de mayo de 2021. Consultado el 18 de noviembre de 2017 .
  42. Nikolić, D; Muresan, RC; Feng, W; Singer, W (2012). "Análisis de correlación escalada: una mejor manera de calcular un correlograma cruzado" ( PDF) . European Journal of Neuroscience . 35 (5): 1– 21. doi : 10.1111/j.1460-9568.2011.07987.x . PMID 22324876. S2CID 4694570 .  
  43. Fulekar (Ed.), MH (2009) Bioinformática: Aplicaciones en Ciencias de la Vida y del Medio Ambiente , Springer (págs. 110) ISBN 1-4020-8879-5
  44. Immink, K. Schouhamer; Weber, J. (octubre de 2010). "Detección de distancia de Pearson mínima para canales multinivel con desajuste de ganancia y/o desplazamiento" . IEEE Transactions on Information Theory . 60 (10): 5966– 5974. CiteSeerX 10.1.1.642.9971 . doi : 10.1109/tit.2014.2342744 . S2CID 1027502. Recuperado el 11 de febrero de 2018 .  
  45. Jammalamadaka, S. Rao; SenGupta, A. (2001). Temas de estadística circular . Nueva Jersey: World Scientific. pág. 176. ISBN  978-981-02-3778-3Consultado el 21 de septiembre de 2016 .
  46. Reid, MD (1 de julio de 1989). "Demostración de la paradoja de Einstein-Podolsky-Rosen mediante amplificación paramétrica no degenerada" . Physical Review A. 40 ( 2): 913– 923. doi : 10.1103/PhysRevA.40.913 .
  47. Maccone, L.; Dagmar, B.; Macchiavello, C. (1 de abril de 2015). "Complementaridad y correlaciones" . Physical Review Letters . 114 (13) 130401. arXiv : 1408.6851 . doi : 10.1103/PhysRevLett.114.130401 .
  48. Cox, DR; Hinkley, DV (1974). Estadística teórica . Chapman & Hall. Apéndice 3. ISBN 0-412-12420-3.
  • "coco" . comparandocorrelaciones.org .– Una interfaz web gratuita y un paquete de R para la comparación estadística de dos correlaciones dependientes o independientes con variables superpuestas o no superpuestas.
  • "Correlación" . nagysandor.eu . Archivado del original el 17 de mayo de 2021. Consultado el 30 de enero de 2013 .– una simulación interactiva en Flash sobre la correlación de dos variables con distribución normal.
  • Calculadora de coeficiente de correlación . hackmath.net . Regresión lineal.
  • "Valores críticos para el coeficiente de correlación de Pearson" (PDF) . frank.mtsu.edu/~dkfuller .– mesa grande.
  • "Adivina la correlación" .– Un juego en el que los jugadores adivinan el grado de correlación entre dos variables en un diagrama de dispersión, con el fin de comprender mejor el concepto de correlación.