Articulo de referencia

Análisis de correspondencias

El análisis de correspondencias ( AC ) es una técnica estadística multivariante propuesta [ 1 ] por Herman Otto Hartley (Hirschfeld) [ 2 ] y posteriormente desarrollada por Jean...

El análisis de correspondencias ( AC ) es una técnica estadística multivariante propuesta [ 1 ] por Herman Otto Hartley (Hirschfeld) [ 2 ] y posteriormente desarrollada por Jean-Paul Benzécri [ 3 ] . Es conceptualmente similar al análisis de componentes principales , pero se aplica a datos categóricos en lugar de continuos. De manera similar al análisis de componentes principales, proporciona un medio para mostrar o resumir un conjunto de datos en forma gráfica bidimensional. Su objetivo es mostrar en un biplot cualquier estructura oculta en el contexto multivariante de la tabla de datos. Como tal, es una técnica del campo de la ordenación multivariante . Dado que la variante de AC descrita aquí puede aplicarse centrándose tanto en las filas como en las columnas, en realidad debería llamarse análisis de correspondencias simple (simétrico) [ 4 ] .

Tradicionalmente se aplica a la tabla de contingencia de un par de variables nominales donde cada celda contiene un recuento o un valor cero. Si se van a resumir más de dos variables categóricas, se debe elegir una variante llamada análisis de correspondencias múltiples . El CA también se puede aplicar a datos binarios dado que la codificación de presencia/ausencia representa datos de recuento simplificados, es decir, un 1 describe un recuento positivo y un 0 representa un recuento cero. Dependiendo de las puntuaciones utilizadas, el CA conserva la distancia chi-cuadrado [ 5 ] [ 6 ] entre las filas o las columnas de la tabla. Debido a que el CA es una técnica descriptiva, se puede aplicar a tablas independientemente de una prueba chi-cuadrado significativa . [ 7 ] [ 8 ] Aunque elχ2{\displaystyle \chi ^{2}}La estadística utilizada en estadística inferencial y la distancia chi-cuadrado están relacionadas computacionalmente, no deben confundirse ya que esta última funciona como una medida de distancia estadística multivariada en CA mientras que laχ2{\displaystyle \chi ^{2}}La estadística es, de hecho, un escalar, no una métrica . [ 9 ]

Detalles

Al igual que el análisis de componentes principales , el análisis de correspondencias crea componentes ortogonales (o ejes) y, para cada elemento de una tabla, es decir, para cada fila, un conjunto de puntuaciones (a veces llamadas puntuaciones factoriales; véase Análisis factorial ). El análisis de correspondencias se realiza sobre la tabla de datos, concebida como una matriz C de tamaño m  × n, donde m es el número de filas y n es el número de columnas. En la siguiente descripción matemática del método, las letras mayúsculas en cursiva se refieren a una matriz, mientras que las letras en cursiva se refieren a vectores . Para comprender los siguientes cálculos se requieren conocimientos de álgebra matricial . 

Preprocesamiento

Antes de proceder al paso computacional central del algoritmo, los valores de la matriz C deben transformarse. [ 10 ] Primero se calcula un conjunto de pesos para las columnas y las filas (a veces llamados masas ), [ 7 ] [ 11 ] donde los pesos de fila y columna vienen dados por los vectores de fila y columna, respectivamente:

wmetro=1nortedodo1,wnorte=1nortedo1Tdo.{\displaystyle w_{m}={\frac {1}{n_{C}}}C\mathbf {1} ,\quad w_{n}={\frac {1}{n_{C}}}\mathbf {1} ^{T}C.}

Aquínortedo=i=1nortej=1metrodoij{\displaystyle n_{C}=\sum _{i=1}^{n}\sum _{j=1}^{m}C_{ij}}es la suma de todos los valores de las celdas en la matriz C , o abreviado como la suma de C , y1{\displaystyle \mathbf {1} }es un vector columna de unos con la dimensión apropiada.

Dicho en pocas palabras,wmetro{\displaystyle w_{m}}es simplemente un vector cuyos elementos son las sumas de las filas de C divididas por la suma de C ywnorte{\displaystyle w_{n}}es un vector cuyos elementos son las sumas de las columnas de C divididas por la suma de C.

Los pesos se transforman en matrices diagonales.

Wmetro=diagnóstico(1/wmetro){\displaystyle W_{m}=\operatorname {diag} (1/{\sqrt {w_{m}}})}

y

Wnorte=diagnóstico(1/wnorte){\displaystyle W_{n}=\operatorname {diag} (1/{\sqrt {w_{n}}})}

donde los elementos diagonales deWnorte{\displaystyle W_{n}}son1/wnorte{\displaystyle 1/{\sqrt {w_{n}}}}y los deWmetro{\displaystyle W_{m}}son1/wmetro{\displaystyle 1/{\sqrt {w_{m}}}}respectivamente, es decir, los elementos del vector son los inversos de las raíces cuadradas de las masas. Los elementos fuera de la diagonal son todos 0.

A continuación, calcule la matriz.PAG{\displaystyle P}dividiendodo{\displaystyle C}por su suma

PAG=1nortedodo.{\displaystyle P={\frac {1}{n_{C}}}C.}

En pocas palabras, MatrixPAG{\displaystyle P}es simplemente la matriz de datos (tabla de contingencia o tabla binaria) transformada en porciones, es decir, cada valor de celda es solo la porción de celda de la suma de toda la tabla.

Finalmente, calcule la matrizS{\displaystyle S}, a veces llamada matriz de residuos estandarizados , [ 10 ] mediante multiplicación de matrices como

S=Wmetro(PAGwmetrownorte)Wnorte{\displaystyle S=W_{m}(P-w_{m}w_{n})W_{n}}

Nótese que los vectoreswmetro{\displaystyle w_{m}}y wnorte{\displaystyle w_{n}}se combinan en un producto exterior que da como resultado una matriz de las mismas dimensiones quePAG{\displaystyle P}En palabras, la fórmula se lee: matrizexterior(wmetro,wnorte){\displaystyle \operatorname {exterior} (w_ {m}, w_ {n})}se resta de la matrizPAG{\displaystyle P}y la matriz resultante se escala (pondera) mediante las matrices diagonales.Wmetro{\displaystyle W_{m}}yWnorte{\displaystyle W_{n}}. Multiplicar la matriz resultante por las matrices diagonales es equivalente a multiplicar la i-ésima fila (o columna) de la misma por el i-ésimo elemento de la diagonal deWmetro{\displaystyle W_{m}}oWnorte{\displaystyle W_{n}}, respectivamente [ 12 ] .

Interpretación del preprocesamiento

Los vectoreswmetro{\displaystyle w_{m}}ywnorte{\displaystyle w_{n}}son las masas de filas y columnas o las probabilidades marginales para las filas y columnas, respectivamente. Restar matrizexterior(wmetro,wnorte){\displaystyle \operatorname {exterior} (w_ {m}, w_ {n})}de matrizPAG{\displaystyle P}es la versión de álgebra matricial del doble centrado de los datos. Multiplicar esta diferencia por las matrices de ponderación diagonales da como resultado una matriz que contiene desviaciones ponderadas del origen de un espacio vectorial . Este origen se define mediante la matrizexterior(wmetro,wnorte){\displaystyle \operatorname {exterior} (w_ {m}, w_ {n})}.

De hecho matrizexterior(wmetro,wnorte){\displaystyle \operatorname {exterior} (w_ {m}, w_ {n})}es idéntica a la matriz de frecuencias esperadas en la prueba chi-cuadrado . Por lo tantoS{\displaystyle S}Está relacionado computacionalmente con el modelo de independencia utilizado en esa prueba. Pero dado que el análisis de correspondencias no es un método inferencial, el término modelo de independencia resulta inapropiado en este caso.

Componentes ortogonales

La mesaS{\displaystyle S}luego se descompone [ 10 ] mediante una descomposición en valores singulares como

S=UΣV{\displaystyle S=U\Sigma V^{*}\,}

dóndeU{\displaystyle U}y V{\displaystyle V}son los vectores singulares izquierdo y derecho deS{\displaystyle S}yΣ{\displaystyle \Sigma }es una matriz diagonal cuadrada con valores singularesσi{\displaystyle \sigma _{i}}deS{\displaystyle S}en diagonal.Σ{\displaystyle \Sigma }es de dimensión pag(min(metro,norte)1){\displaystyle p\leq (\min(m,n)-1)}por esoU{\displaystyle U}es de dimensión m×p yV{\displaystyle V}es de n×p . A s vectores ortonormalesU{\displaystyle U}y V{\displaystyle V}realizar

UU=VV=I{\displaystyle U^{*}U=V^{*}V=I}.

En otras palabras, la información multivariada que está contenida endo{\displaystyle C}así como enS{\displaystyle S}ahora se distribuye en dos matrices (de coordenadas)U{\displaystyle U}y V{\displaystyle V}y una matriz diagonal (de escalado)Σ{\displaystyle \Sigma }. El espacio vectorial definido por ellos tiene como número de dimensiones p, que es el menor de los dos valores, número de filas y número de columnas, menos 1.

Inercia

Si bien se puede decir que un análisis de componentes principales descompone la (co)varianza , y por lo tanto su medida de éxito es la cantidad de (co)varianza cubierta por los primeros ejes de PCA (medida en valor propio), un CA trabaja con una (co)varianza ponderada que se llama inercia . [ 13 ] La suma de los valores singulares al cuadrado es la inercia total.I{\displaystyle \mathrm {I} }de la tabla de datos, calculada como

I=i=1pagσi2.{\displaystyle \mathrm {I} =\sum _{i=1}^{p}\sigma _{i}^{2}.}

La inercia totalI{\displaystyle \mathrm {I} }de la tabla de datos también se puede calcular directamente desdeS{\displaystyle S}como

I=i=1nortej=1metrosij2.{\displaystyle \mathrm {I} =\sum _{i=1}^{n}\sum _{j=1}^{m}s_{ij}^{2}.}

La cantidad de inercia cubierta por el i-ésimo conjunto de vectores singulares esyoi{\displaystyle \iota _{i}}, la inercia principal. Cuanto mayor sea la porción de inercia cubierta por los primeros vectores singulares, es decir, cuanto mayor sea la suma de las inercias principales en comparación con la inercia total, más exitoso será un CA. [ 13 ] Por lo tanto, todos los valores de inercia principal se expresan como porciónϵi{\displaystyle \epsilon _{i}}de la inercia total

ϵi=σi2/i=1pagσi2{\displaystyle \epsilon _{i}=\sigma _{i}^{2}/\sum _{i=1}^{p}\sigma _{i}^{2}}

y se presentan en forma de un gráfico de sedimentación . De hecho, un gráfico de sedimentación es simplemente un gráfico de barras de todas las porciones de inercia principales.ϵi{\displaystyle \epsilon _{i}}.

Coordenadas

Para transformar los vectores singulares en coordenadas que preserven las distancias chi-cuadrado entre filas o columnas, es necesario un paso de ponderación adicional. Las coordenadas resultantes se denominan coordenadas principales [ 10 ] en los libros de texto de CA. Si se utilizan coordenadas principales para filas, su visualización se denomina escalamiento isométrico de fila [ 14 ] en econometría y escalamiento 1 [ 15 ] en ecología. Dado que la ponderación incluye los valores singularesΣ{\displaystyle \Sigma }de la matriz de residuos estandarizadosS{\displaystyle S}Estas coordenadas a veces se denominan vectores singulares escalados de valor singular o, de forma un tanto engañosa, vectores propios escalados de valor propio. De hecho, los vectores propios no triviales deSS{\displaystyle SS^{*}}son los vectores singulares izquierdosU{\displaystyle U}de S{\displaystyle S}y los de SS{\displaystyle S^{*}S}son los vectores singulares derechosV{\displaystyle V}deS{\displaystyle S}mientras que los valores propios de cualquiera de estas matrices son los cuadrados de los valores singulares.Σ{\displaystyle \Sigma }Pero dado que todos los algoritmos modernos para CA se basan en una descomposición en valores singulares, esta terminología debe evitarse. En la tradición francesa de CA, las coordenadas a veces se denominan puntuaciones (factoriales) .

Las puntuaciones factoriales o coordenadas principales para las filas de la matriz C se calculan mediante

Fmetro=WmetroUΣ{\displaystyle F_{m}=W_{m}U\Sigma }

Es decir, los vectores singulares izquierdos se escalan mediante el inverso de las raíces cuadradas de las masas de las filas y mediante los valores singulares. Dado que las coordenadas principales se calculan utilizando valores singulares, contienen información sobre la dispersión entre las filas (o columnas) de la tabla original. El cálculo de las distancias euclidianas entre las entidades en coordenadas principales da como resultado valores iguales a sus distancias chi-cuadrado, razón por la cual se dice que el CA "conserva las distancias chi-cuadrado" .

Calcular las coordenadas principales para las columnas mediante

Fnorte=WnorteVΣ.{\displaystyle F_{n}=W_{n}V\Sigma .}

Para representar el resultado de CA en un biplot adecuado , aquellas categorías que no se grafican en coordenadas principales, es decir, en coordenadas que preservan la distancia chi-cuadrado, deben graficarse en las llamadas coordenadas estándar . [ 10 ] Se llaman coordenadas estándar porque cada vector de coordenadas estándar se ha estandarizado para exhibir media 0 y varianza 1. [ 16 ] Al calcular las coordenadas estándar, se omiten los valores singulares, lo cual es un resultado directo de aplicar la regla del biplot por la cual uno de los dos conjuntos de matrices de vectores singulares debe escalarse por valores singulares elevados a la potencia de cero, es decir, multiplicado por uno, es decir, debe calcularse omitiendo los valores singulares si el otro conjunto de vectores singulares se ha escalado por los valores singulares. Esto asegura la existencia de un producto interno entre los dos conjuntos de coordenadas, es decir, conduce a interpretaciones significativas de sus relaciones espaciales en un biplot.

En términos prácticos, se puede pensar en las coordenadas estándar como los vértices del espacio vectorial en el que "existe" el conjunto de coordenadas principales (es decir, los puntos respectivos). [ 17 ] Las coordenadas estándar para las filas son

GRAMOmetro=WmetroU{\displaystyle G_{m}=W_{m}U}

y los de las columnas son

GRAMOnorte=WnorteV{\displaystyle G_{n}=W_{n}V}

Nótese que un biplot de escala 1 [ 15 ] en ecología implica que las filas estén en coordenadas principales y las columnas en coordenadas estándar, mientras que el escalado 2 implica que las filas estén en coordenadas estándar y las columnas en coordenadas principales. Es decir, el escalado 1 implica un biplot deFmetro{\displaystyle F_{m}}junto conGRAMOnorte{\displaystyle G_{n}}mientras que el escalado 2 implica un biplot deFnorte{\displaystyle F_{n}}junto conGRAMOmetro{\displaystyle G_{m}}.

Representación gráfica del resultado

La visualización del resultado de un CA siempre comienza mostrando el gráfico de sedimentación de los valores de inercia principales para evaluar el éxito de resumir la dispersión mediante los primeros vectores singulares.

La ordenación se presenta en un gráfico que, a primera vista, podría confundirse con un diagrama de dispersión complejo . De hecho, consiste en dos diagramas de dispersión superpuestos: uno para las filas y otro para las columnas. Sin embargo, al tratarse de un biplot, existe una regla de interpretación clara que relaciona las dos matrices de coordenadas utilizadas.

Generalmente, se representan las dos primeras dimensiones de la solución CA, ya que abarcan la mayor cantidad de información posible sobre la tabla de datos en 2D, aunque se pueden analizar otras combinaciones de dimensiones mediante un biplot. Un biplot es, de hecho, una representación de baja dimensión de una parte de la información contenida en la tabla original.

Como regla general, el conjunto (filas o columnas) que debe analizarse en función de su composición, medida por el otro conjunto, se muestra en coordenadas principales, mientras que el otro conjunto se muestra en coordenadas estándar. Por ejemplo, una tabla que muestra los distritos electorales en filas y los partidos políticos en columnas, con las celdas que contienen los votos contabilizados , puede mostrarse con los distritos (filas) en coordenadas principales cuando el objetivo es ordenar los distritos según su nivel de votación.

Tradicionalmente, con origen en la tradición francesa en CA, [ 18 ] los primeros biplots de CA representaban ambas entidades en la misma versión de coordenadas, generalmente coordenadas principales, pero este tipo de visualización es engañosa en la medida en que: "Aunque se le llama biplot, no tiene ninguna relación útil de producto interno entre las puntuaciones de fila y columna", como señala correctamente Brian Ripley , mantenedor del paquete MASS de R. [ 19 ] Hoy en día, ese tipo de visualización debe evitarse, ya que los profanos generalmente no son conscientes de la falta de relación entre los dos conjuntos de puntos.

Un biplot de escala 1 [ 15 ] (filas en coordenadas principales, columnas en coordenadas estándar) se interpreta de la siguiente manera: [ 20 ]

  • Las distancias entre los puntos de las filas se aproximan a su distancia chi-cuadrado. Los puntos cercanos entre sí representan filas con valores muy similares en la tabla de datos original. Es decir, pueden presentar frecuencias bastante similares en el caso de datos de conteo o valores binarios muy relacionados en el caso de datos de presencia/ausencia.
  • Los puntos de columna en coordenadas estándar representan los vértices del espacio vectorial, es decir, la esquina exterior de algo que en el espacio multidimensional tiene la forma de un poliedro irregular. Proyecte los puntos de fila sobre la línea que conecta el origen con la coordenada estándar de una columna; si la posición proyectada a lo largo de esa línea de conexión está cerca de la posición de la coordenada estándar, ese punto de fila está fuertemente asociado con esa columna; es decir, en el caso de datos de conteo, la fila tiene una alta frecuencia de esa categoría y, en el caso de datos de presencia/ausencia, es probable que la fila presente un 1 en esa columna. Los puntos de fila cuya proyección requeriría alargar la línea de conexión más allá del origen tienen un valor inferior al promedio en esa columna.

Extensiones y aplicaciones

Existen varias variantes del análisis de correspondencias (AC), incluyendo el análisis de correspondencias sin tendencia (ACD) y el análisis de correspondencias canónicas (ACC). Este último se utiliza cuando se dispone de información sobre las posibles causas de las similitudes entre las entidades investigadas. La extensión del análisis de correspondencias a múltiples variables categóricas se denomina análisis de correspondencias múltiples . Una adaptación del análisis de correspondencias al problema de la discriminación basada en variables cualitativas (es decir, el equivalente del análisis discriminante para datos cualitativos) se denomina análisis de correspondencias discriminantes o análisis discriminante baricéntrico.

En las ciencias sociales, el análisis de correspondencias, y en particular su extensión , el análisis de correspondencias múltiples , se dio a conocer fuera de Francia gracias a la aplicación que hizo de él el sociólogo francés Pierre Bourdieu . [ 21 ]

Implementaciones

  • El sistema de visualización de datos Orange incluye el módulo: orngCA.
  • El lenguaje de programación estadística R incluye varios paquetes que ofrecen una función para el análisis de correspondencias (simétricas simples). Utilizando la notación de R [nombre_paquete::nombre_función], los paquetes y sus respectivas funciones son: ade4::dudi.coa(), ca::ca(), ExPosition::epCA(), FactoMineR::CA(), MASS::corresp(), vegan::cca(). El enfoque más sencillo para principiantes es, ca::ca()ya que existe un extenso libro de texto [ 22 ] que acompaña a ese paquete.
  • El software gratuito PAST ( PAleontological STatistics ) [ 23 ] ofrece análisis de correspondencia (simétrico simple) a través del menú "Multivariado/Ordenación/Correspondencia (CA)".

Véase también

Referencias

  1. Dodge, Y. (2003) The Oxford Dictionary of Statistical Terms , OUP ISBN 0-19-850994-4
  2. Hirschfeld, HO (1935) "Una conexión entre correlación y contingencia", Proc. Cambridge Philosophical Society , 31, 520 524
  3. ^ Benzécri, J.-P. (1973). L'Analyse des Données. Volumen II. L'Analyse des Correspondances . París, Francia: Dunod.
  4. Beh, Eric; Lombardo, Rosaria (2014). Análisis de correspondencias. Teoría, práctica y nuevas estrategias . Chichester: Wiley. pág. 120. ISBN  978-1-119-95324-1.
  5. Greenacre, Michael (2007). Análisis de correspondencias en la práctica . Boca Raton: CRC Press. pág. 204. ISBN  9781584886167.
  6. Legendre, Pierre; Legendre, Louis (2012). Ecología numérica . Ámsterdam: Elsevier. pág. 465. ISBN  978-0-444-53868-0.
  7. 1 2 Greenacre, Michael (1983). Teoría y aplicaciones del análisis de correspondencias . Londres: Academic Press. ISBN 0-12-299050-1.
  8. Greenacre, Michael (2007). Análisis de correspondencias en la práctica, segunda edición . Londres: Chapman & Hall/CRC.
  9. Greenacre, Michael (2017). Análisis de correspondencias en la práctica (3.ª ed.). Boca Raton: CRC Press. págs. 26–29 . ISBN   9781498731775.
  10. 1 2 3 4 5 Greenacre, Michael (2007). Análisis de correspondencias en la práctica . Boca Raton: CRC Press. pág. 202. ISBN  9781584886167.
  11. Greenacre, Michael (2007). Análisis de correspondencias en la práctica, segunda edición . Londres: Chapman & Hall/CRC. pág. 202. 
  12. Abadir, Karim; Magnus, Jan (2005). Álgebra matricial . Cambridge: Cambridge University Press. pág. 24. ISBN  9786612394256.
  13. 1 2 Beh, Eric; Lombardo, Rosaria (2014). Análisis de correspondencias. Teoría, práctica y nuevas estrategias . Chichester: Wiley. pp. 87, 129. ISBN  978-1-119-95324-1.
  14. Beh, Eric; Lombardo, Rosaria (2014). Análisis de correspondencias. Teoría, práctica y nuevas estrategias . Chichester: Wiley. pp. 132–134 . ISBN  978-1-119-95324-1.
  15. 1 2 3 Legendre, Pierre; Legendre, Louis (2012). Ecología numérica . Ámsterdam: Elsevier. pág. 470. ISBN  978-0-444-53868-0.
  16. Greenacre, Michael (2017). Análisis de correspondencias en la práctica (3.ª ed.). Boca Raton: CRC Press. pág. 62. ISBN   9781498731775.
  17. ^ Blasius, Jörg (2001). Korrespondenzanalyse (en alemán). Berlín: Walter de Gruyter. págs.40 , 60. ISBN  9783486257304.
  18. Greenacre, Michael (2017). Análisis de correspondencias en la práctica (3.ª ed.). Boca Raton: CRC Press. p. 70. doi : 10.1201/9781315369983 . ISBN   9781498731775.
  19. Ripley, Brian (2022-01-13). "Manual del paquete MASS R" . Documentación del paquete R (rdrr.io) . Detalles . Consultado el 2022-03-17 .
  20. Borcard, Daniel; Gillet, Francois; Legendre, Pierre (2018). Ecología numérica con R (2.ª ed.). Cham: Springer. p. 175. doi : 10.1007/978-3-319-71404-2 . ISBN   9783319714042.
  21. Bourdieu, Pierre (1984). La distinción . Routledge . pp . 41. ISBN  0674212770.
  22. Greenacre, Michael (2021). Análisis de correspondencias en la práctica (tercera ed.). Londres: CRC PRESS. ISBN  9780367782511.
  23. Hammer, Øyvind. "Past 4 - the Past of the Future" . Archivado del original el 1 de noviembre de 2020. Consultado el 14 de septiembre de 2021 .