In statistics, canonical-correlation analysis (CCA), also called canonical variates analysis, is a way of inferring information from cross-covariance matrices. If we have two vectors X = (X1, ..., Xn) and Y = (Y1, ..., Ym) of random variables, and there are correlations among the variables, then canonical-correlation analysis will find linear combinations of X and Y that have a maximum correlation with each other.[1] T. R. Knapp notes that "virtually all of the commonly encountered parametric tests of significance can be treated as special cases of canonical-correlation analysis, which is the general procedure for investigating the relationships between two sets of variables."[2] The method was first introduced by Harold Hotelling in 1936,[3] although in the context of angles between flats the mathematical concept was published by Camille Jordan in 1875.[4]
CCA is now a cornerstone of multivariate statistics and multi-view learning, and a great number of interpretations and extensions have been proposed, such as probabilistic CCA, sparse CCA, multi-view CCA, deep CCA,[5] and DeepGeoCCA.[6] Unfortunately, perhaps because of its popularity, the literature can be inconsistent with notation. We attempt to highlight such inconsistencies in this article to help the reader make best use of the existing literature and techniques available.
Like its sister method PCA, CCA can be viewed in population form (corresponding to random vectors and their covariance matrices) or in sample form (corresponding to datasets and their sample covariance matrices). These two forms are almost exact analogues of each other, which is why their distinction is often overlooked, but they can behave very differently in high dimensional settings.[7] We next give explicit mathematical definitions for the population problem and highlight the different objects in the so-called canonical decomposition - understanding the differences between these objects is crucial for interpretation of the technique.
Population CCA definition via correlations
Given two column vectors and of random variables with finitesecond moments, one may define the cross-covariance to be the matrix whose entry is the covariance. In practice, we would estimate the covariance matrix based on sampled data from and (i.e. from a pair of data matrices).
Canonical-correlation analysis seeks a sequence of vectors () and () such that the random variables and maximize the correlation. The (scalar) random variables and are the first pair of canonical variables. Then one seeks vectors maximizing the same correlation subject to the constraint that they are to be uncorrelated with the first pair of canonical variables; this gives the second pair of canonical variables. This procedure may be continued up to times.
The sets of vectors are called canonical directions or weight vectors or simply weights. The 'dual' sets of vectors are called canonical loading vectors or simply loadings; these are often more straightforward to interpret than the weights.[8]
Computation
Derivation
Let be the cross-covariance matrix for any pair of (vector-shaped) random variables and . The target function to maximize is
The first step is to define a change of basis and define
where and can be obtained from the eigen-decomposition (or by diagonalization):
and
Thus
By the Cauchy–Schwarz inequality,
There is equality if the vectors and are collinear. In addition, the maximum of correlation is attained if is the eigenvector with the maximum eigenvalue for the matrix (Véase el cociente de Rayleigh ). Los pares subsiguientes se obtienen utilizando valores propios de magnitud decreciente. La ortogonalidad está garantizada por la simetría de las matrices de correlación.
Otra forma de ver este cálculo es queyson los vectores singulares izquierdo y derecho de la matriz de correlación de X e Y correspondientes al valor singular más alto.
Solución
Por lo tanto, la solución es:
- es un vector propio de
- es proporcional a
Recíprocamente, también existe:
- es un vector propio de
- es proporcional a
Invirtiendo el cambio de coordenadas, tenemos que
- es un vector propio de,
- es proporcional a
- es un vector propio de
- es proporcional a.
Las variables canónicas se definen mediante:
Implementación
El CCA se puede calcular utilizando la descomposición en valores singulares de una matriz de correlación. [ 9 ] Está disponible como una función en [ 10 ]
- MATLAB como canoncorr ( también en Octave )
- R como la función estándar cancor y varios otros paquetes, incluidos candisc , CCA y vegan . CCP para pruebas de hipótesis estadísticas en análisis de correlación canónica.
- SAS como procedimiento cancorr
- Python en la biblioteca scikit-learn , como descomposición cruzada y en statsmodels, como CanCorr . La biblioteca CCA-Zoo [ 11 ] implementa extensiones de CCA, como CCA probabilística, CCA dispersa, CCA multivista y CCA profunda.
- SPSS como macro CanCorr incluido con el software principal
- Julia (lenguaje de programación) en el paquete MultivariateStats.jl .
El cálculo de CCA mediante descomposición en valores singulares en una matriz de correlación está relacionado con el coseno de los ángulos entre planos . La función coseno está mal condicionada para ángulos pequeños, lo que lleva a un cálculo muy impreciso de vectores principales altamente correlacionados en aritmética computacional de precisión finita . Para solucionar este problema , existen algoritmos alternativos [ 12 ] disponibles en
Prueba de hipótesis
Cada fila puede ser probada para determinar su significancia con el siguiente método. Dado que las correlaciones están ordenadas, decir que la filaes cero implica que todas las correlaciones posteriores también son cero. Si tenemosobservaciones independientes en una muestra yes la correlación estimada para. Para elEn la fila n, el estadístico de prueba es:
que se distribuye asintóticamente como una chi-cuadrado congrados de libertad para grandes. [ 13 ] Dado que todas las correlaciones deason lógicamente cero (y se estiman de esa manera también) el producto para los términos después de este punto es irrelevante.
Tenga en cuenta que en el límite de tamaño de muestra pequeño conentonces tenemos la garantía de que lo mejorLas correlaciones serán idénticamente 1 y, por lo tanto, la prueba carece de sentido. [ 14 ]
Usos prácticos
Un uso típico de la correlación canónica en el contexto experimental es tomar dos conjuntos de variables y ver qué tienen en común. [ 15 ] Por ejemplo, en las pruebas psicológicas, se podrían tomar dos pruebas de personalidad multidimensionales bien establecidas , como el Inventario Multifásico de Personalidad de Minnesota (MMPI-2) y el NEO . Al ver cómo se relacionan los factores del MMPI-2 con los factores del NEO, se podría obtener información sobre qué dimensiones eran comunes entre las pruebas y cuánta varianza se compartía. Por ejemplo, se podría encontrar que una dimensión de extraversión o neuroticismo explicaba una cantidad sustancial de varianza compartida entre las dos pruebas.
También se puede utilizar el análisis de correlación canónica para generar una ecuación modelo que relacione dos conjuntos de variables, por ejemplo, un conjunto de medidas de rendimiento y un conjunto de variables explicativas, o un conjunto de salidas y un conjunto de entradas. Se pueden imponer restricciones a dicho modelo para asegurar que refleje los requisitos teóricos o condiciones intuitivamente obvias. Este tipo de modelo se conoce como modelo de correlación máxima. [ 16 ]
La visualización de los resultados de la correlación canónica se realiza generalmente mediante gráficos de barras de los coeficientes de los dos conjuntos de variables para los pares de variables canónicas que muestran una correlación significativa. Algunos autores sugieren que la mejor manera de visualizarlos es representándolos como heliógrafos, un formato circular con barras en forma de rayos, donde cada mitad representa los dos conjuntos de variables. [ 17 ]
Ejemplos
Dejarcon valor esperado cero , es decir,.
- Si, es decir,yestán perfectamente correlacionados, entonces, por ejemplo,y, de modo que el primer (y único en este ejemplo) par de variables canónicas esy.
- Si, es decir,yestán perfectamente anticorrelacionados, entonces, por ejemplo,y, de modo que el primer (y único en este ejemplo) par de variables canónicas esy.
Observamos que en ambos casos, lo que demuestra que el análisis de correlación canónica trata las variables correlacionadas y anticorrelacionadas de manera similar.
Conexión con los ángulos principales
Suponiendo queytienen valores esperados cero , es decir,, sus matrices de covarianzaypueden verse como matrices de Gram en un producto interno para las entradas de y, correspondientemente. En esta interpretación, las variables aleatorias, entradasde ydese tratan como elementos de un espacio vectorial con un producto interno dado por la covarianza; véase Covarianza#Relación con productos internos .
La definición de las variables canónicasyes entonces equivalente a la definición de vectores principales para el par de subespacios generados por las entradas de ycon respecto a este producto interno . Las correlaciones canónicases igual al coseno de los ángulos principales .
Blanqueamiento y análisis de correlación canónica probabilística
CCA también puede considerarse una transformación de blanqueamiento especial donde los vectores aleatoriosyse transforman simultáneamente de tal manera que la correlación cruzada entre los vectores blanqueadosyes diagonal. [ 18 ] Las correlaciones canónicas se interpretan entonces como coeficientes de regresión que vinculanyy también puede ser negativo. La perspectiva de regresión del CCA también proporciona una forma de construir un modelo generativo probabilístico de variables latentes para el CCA, con variables ocultas no correlacionadas que representan la variabilidad compartida y no compartida. [ 19 ]
Véase también
Enlaces externos
- Análisis de correlación discriminante (DCA) [ 20 ] ( MATLAB )
- Hardoon, DR; Szedmak, S.; Shawe-Taylor, J. (2004). "Análisis de correlación canónica: una visión general con aplicación a métodos de aprendizaje". Neural Computation . 16 (12): 2639– 2664. CiteSeerX 10.1.1.14.6452 . doi : 10.1162/0899766042321814 . PMID 15516276 . S2CID 202473 .
- Una nota sobre el análisis de correlación canónica ordinal de dos conjuntos de puntuaciones de clasificación (también proporciona un programa FORTRAN ) - en Journal of Quantitative Economics 7(2), 2009, pp. 173–199
- Análisis de correlación canónica con restricciones de representación: una hibridación de la correlación canónica y el análisis de componentes principales (también incluye un programa en FORTRAN ) - en Journal of Applied Economic Sciences 4(1), 2009, pp. 115–124
Referencias
- ↑ Härdle, Wolfgang; Simar, Léopold (2007). «Análisis de correlación canónica». Análisis estadístico multivariante aplicado . págs. 321–330 . CiteSeerX 10.1.1.324.403 . doi : 10.1007/978-3-540-72244-1_14 . ISBN 978-3-540-72243-4.
- ↑ Knapp, TR (1978). "Análisis de correlación canónica: un sistema general de prueba de significancia paramétrica". Psychological Bulletin . 85 (2): 410– 416. doi : 10.1037/0033-2909.85.2.410 .
- ↑ Hotelling, H. (1936). "Relaciones entre dos conjuntos de variables". Biometrika . 28 ( 3–4 ): 321–377 . doi : 10.1093/biomet/28.3-4.321 . JSTOR 2333955 .
- ^ Jordania, C. (1875). "Ensayo sobre la geometríadimensiones" . Bull. Soc. Math. France . 3 : 103.
- ↑ Andrew, Galen; Arora, Raman; Bilmes, Jeff; Livescu, Karen (26 de mayo de 2013). "Análisis de correlación canónica profunda" . Actas de la 30.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 1247–1255 .
- ↑ Ju, Ce; Kobler, Reinmar J; Tang, Liyao; Guan, Cuntai; Kawanabe, Motoaki (2024). Análisis de correlación canónica geodésica profunda para datos de neuroimagen basados en covarianza . Duodécima Conferencia Internacional sobre Representaciones de Aprendizaje (ICLR 2024, Spotlight).
- ↑ "Aprendizaje estadístico con escasez: el Lasso y generalizaciones" . hastie.su.domains . Consultado el 12 de septiembre de 2023 .
- ↑ Gu, Fei; Wu, Hao (2018-04-01). "Análisis de correlación canónica simultánea con cargas canónicas invariantes" . Behaviormetrika . 45 (1): 111– 132. doi : 10.1007/s41237-017-0042-8 . ISSN 1349-6964 .
- ↑ Hsu, D.; Kakade, SM; Zhang, T. (2012). "Un algoritmo espectral para el aprendizaje de modelos ocultos de Markov" (PDF) . Journal of Computer and System Sciences . 78 (5): 1460. arXiv : 0811.4413 . doi : 10.1016/j.jcss.2011.12.025 . S2CID 220740158 .
- ↑ Huang, SY; Lee, MH; Hsiao, CK (2009). "Medidas no lineales de asociación con análisis de correlación canónica de núcleo y aplicaciones" (PDF) . Journal of Statistical Planning and Inference . 139 (7): 2162. doi : 10.1016/j.jspi.2008.10.011 . Archivado del original (PDF) el 13 de marzo de 2017. Recuperado el 4 de septiembre de 2015 .
- ↑ Chapman, James; Wang, Hao-Ting (18 de diciembre de 2021). "CCA-Zoo: Una colección de métodos CCA regularizados, basados en aprendizaje profundo, kernel y probabilísticos en un marco de estilo scikit-learn" . Journal of Open Source Software . 6 (68): 3823. Bibcode : 2021JOSS....6.3823C . doi : 10.21105/joss.03823 . ISSN 2475-9066 .
- ↑ Knyazev, AV; Argentati, ME (2002), "Ángulos principales entre subespacios en un producto escalar basado en A: algoritmos y estimaciones de perturbación", SIAM Journal on Scientific Computing , 23 (6): 2009–2041 , Bibcode : 2002SJSC...23.2008K , CiteSeerX 10.1.1.73.2914 , doi : 10.1137/S1064827500377332
- ↑ Kanti V. Mardia , JT Kent y JM Bibby (1979). Análisis multivariado . Academic Press .
- ↑ Yang Song, Peter J. Schreier, David Ramírez y Tanuj Hasija Análisis de correlación canónica de datos de alta dimensión con soporte de muestra muy pequeño arXiv : 1604.02047
- ↑ Sieranoja, S.; Sahidullah, Md; Kinnunen, T.; Komulainen, J.; Hadid, A. (julio de 2018). "Detección de sincronía audiovisual con características de audio optimizadas" (PDF) . 2018 IEEE 3rd International Conference on Signal and Image Processing (ICSIP) . pp. 377–381 . doi : 10.1109/SIPROCESS.2018.8600424 . ISBN 978-1-5386-6396-7. S2CID 51682024 .
- ↑ Tofallis, C. (1999). "Model Building with Multiple Dependent Variables and Constraints". Journal of the Royal Statistical Society, Series D . 48 (3): 371– 378. arXiv : 1109.0725 . doi : 10.1111/1467-9884.00195 . S2CID 8942357 .
- ↑ Degani, A.; Shafto, M.; Olson, L. (2006). "Análisis de correlación canónica: uso de heliógrafos compuestos para representar múltiples patrones" (PDF) . Representación diagramática e inferencia . Notas de clase en ciencias de la computación. Vol. 4045. pág. 93. CiteSeerX 10.1.1.538.5217 . doi : 10.1007/11783183_11 . ISBN 978-3-540-35623-3.
- ↑ Jendoubi, T.; Strimmer, K. (2018). "Un enfoque de blanqueamiento para el análisis de correlación canónica probabilística para la integración de datos ómicos" . BMC Bioinformatics . 20 (1): 15. arXiv : 1802.03490 . doi : 10.1186/ s12859-018-2572-9 . PMC 6327589. PMID 30626338 .
- ↑ Jendoubi, Takoua; Strimmer, Korbinian (9 de enero de 2019). "Un enfoque de blanqueamiento para el análisis de correlación canónica probabilística para la integración de datos ómicos" . BMC Bioinformatics . 20 (1): 15. doi : 10.1186/s12859-018-2572-9 . ISSN 1471-2105 . PMC 6327589. PMID 30626338 .
- ↑ Haghighat, Mohammad; Abdel-Mottaleb, Mohamed; Alhalabi, Wadee (2016). "Análisis de correlación discriminante: fusión de características en tiempo real para el reconocimiento biométrico multimodal" . IEEE Transactions on Information Forensics and Security . 11 (9): 1984–1996 . doi : 10.1109/TIFS.2016.2569061 . S2CID 15624506 .
- Covarianza y correlación