
El análisis de componentes principales ( PCA ) es una técnica de reducción de dimensionalidad lineal con aplicaciones en el análisis exploratorio de datos , la visualización y el preprocesamiento de datos .
Los datos se transforman linealmente a un nuevo sistema de coordenadas, de manera que se puedan identificar fácilmente las direcciones (componentes principales) que capturan la mayor variación en los datos.
Los componentes principales de una colección de puntos en un espacio de coordenadas reales son una secuencia devectores unitarios , donde elEl vector -ésimo es la dirección de una línea que mejor se ajusta a los datos siendo ortogonal al primero.vectores. Aquí, una línea de mejor ajuste se define como aquella que minimiza la distancia perpendicular al cuadrado promedio desde los puntos a la línea . Estas direcciones (es decir, componentes principales) constituyen una base ortonormal en la que las diferentes dimensiones individuales de los datos no están correlacionadas linealmente . Muchos estudios utilizan los dos primeros componentes principales para representar los datos en dos dimensiones e identificar visualmente grupos de puntos de datos estrechamente relacionados. [ 1 ]
El análisis de componentes principales tiene aplicaciones en muchos campos, como la genética de poblaciones , los estudios del microbioma y la ciencia atmosférica . [ 2 ]
Descripción general
Al realizar PCA, el primer componente principal de un conjunto deLa variable derivada es la que se forma como una combinación lineal de las variables originales y explica la mayor parte de la varianza. El segundo componente principal explica la mayor parte de la varianza en lo que queda una vez que se elimina el efecto del primer componente, y podemos continuar a través deiteraciones hasta que se explique toda la varianza. El PCA se utiliza con mayor frecuencia cuando muchas de las variables están altamente correlacionadas entre sí y es deseable reducir su número a un conjunto independiente . El primer componente principal puede definirse equivalentemente como una dirección que maximiza la varianza de los datos proyectados.El -ésimo componente principal puede tomarse como una dirección ortogonal a la primera.componentes principales que maximizan la varianza de los datos proyectados.
Para cualquiera de los objetivos, se puede demostrar que los componentes principales son autovectores de la matriz de covarianza de los datos . Por lo tanto, los componentes principales se calculan a menudo mediante la descomposición en autovalores de la matriz de covarianza de los datos o la descomposición en valores singulares de la matriz de datos. El PCA es el más simple de los análisis multivariados basados en autovectores verdaderos y está estrechamente relacionado con el análisis factorial . El análisis factorial generalmente incorpora más supuestos específicos del dominio sobre la estructura subyacente y resuelve los autovectores de una matriz ligeramente diferente. El PCA también está relacionado con el análisis de correlación canónica (CCA) . El CCA define sistemas de coordenadas que describen de manera óptima la covarianza cruzada entre dos conjuntos de datos, mientras que el PCA define un nuevo sistema de coordenadas ortogonales que describe de manera óptima la varianza en un solo conjunto de datos. [ 3 ] [ 4 ] [ 5 ] [ 6 ] También se han propuesto variantes robustas y basadas en la norma L1 del PCA estándar. [ 7 ] [ 8 ] [ 9 ] [ 6 ]
Historia
PCA fue inventado en 1901 por Karl Pearson , [ 10 ] como un análogo del teorema del eje principal en mecánica; posteriormente fue desarrollado y nombrado de forma independiente por Harold Hotelling en la década de 1930. [ 11 ] Dependiendo del campo de aplicación, también se denomina transformada discreta de Karhunen-Loève (KLT) en procesamiento de señales , transformada de Hotelling en control de calidad multivariado, descomposición ortogonal propia (POD) en ingeniería mecánica, descomposición en valores singulares (SVD) de X (inventada en el último cuarto del siglo XIX [ 12 ] ), descomposición en valores propios (EVD) de X T X en álgebra lineal, análisis factorial (para una discusión de las diferencias entre PCA y análisis factorial, véase el cap. 7 de Análisis de componentes principales de Jolliffe ), [ 13 ] teorema de Eckart-Young (Harman, 1960), o funciones ortogonales empíricas (EOF) en ciencias meteorológicas (Lorenz, 1956), descomposición de autofunciones empíricas (Sirovich, 1987), modos cuasiharmónicos (Brooks et al., 1988), espectral descomposición en ruido y vibración, y análisis modal empírico en dinámica estructural.
Intuición

El análisis de componentes principales (PCA) puede entenderse como el ajuste de un elipsoide p -dimensional a los datos, donde cada eje del elipsoide representa un componente principal. Si algún eje del elipsoide es pequeño, entonces la varianza a lo largo de ese eje también es pequeña.
Para hallar los ejes del elipsoide, primero debemos centrar los valores de cada variable en el conjunto de datos en 0, restando la media de los valores observados de cada variable a dichos valores. Estos valores transformados se utilizan en lugar de los valores observados originales para cada variable. A continuación, calculamos la matriz de covarianza de los datos y sus autovalores y autovectores correspondientes. Posteriormente, debemos normalizar cada uno de los autovectores ortogonales para convertirlos en vectores unitarios. Una vez hecho esto, cada uno de los autovectores unitarios mutuamente ortogonales puede interpretarse como un eje del elipsoide ajustado a los datos. Esta elección de base transformará la matriz de covarianza en una forma diagonalizada, en la que los elementos de la diagonal representan la varianza de cada eje. La proporción de la varianza que representa cada autovector se puede calcular dividiendo el autovalor correspondiente a ese autovector entre la suma de todos los autovalores.
Los biplots y los gráficos de sedimentación (grado de varianza explicada ) se utilizan para interpretar los resultados del PCA.
Detalles
PCA se define como una transformación lineal ortogonal en un espacio real con producto interno que transforma los datos a un nuevo sistema de coordenadas de tal manera que la mayor varianza por alguna proyección escalar de los datos se sitúa en la primera coordenada (llamada primer componente principal), la segunda mayor varianza en la segunda coordenada, y así sucesivamente. [ 13 ]
Considere unmatriz de datos , X , con media empírica cero por columna (la media muestral de cada columna se ha desplazado a cero), donde cada una de las n filas representa una repetición diferente del experimento, y cada una de las p columnas da un tipo particular de característica (por ejemplo, los resultados de un sensor en particular).
Matemáticamente, la transformación se define mediante un conjunto de tamaño(dóndePor lo general, se selecciona para que sea estrictamente menor quepara reducir la dimensionalidad) deVectores de -dimensiones de pesos o coeficientesque mapean cada vector filade X a un nuevo vector de puntuaciones de componentes principales, dado por
de tal manera que las variables individualesde t considerado sobre el conjunto de datos heredan sucesivamente la máxima varianza posible de X , con cada vector de coeficientes w restringido a ser un vector unitario .
Lo anterior puede escribirse de forma equivalente en forma matricial como
dónde , , y .
Primer componente
Para maximizar la varianza, el primer vector de pesos w (1) debe satisfacer
De forma equivalente, escribir esto en forma matricial da como resultado
Dado que w (1) se ha definido como un vector unitario, también satisface de forma equivalente
La cantidad que se va a maximizar se puede reconocer como un cociente de Rayleigh . Un resultado estándar para una matriz semidefinida positiva como X T X es que el valor máximo posible del cociente es el mayor valor propio de la matriz, que ocurre cuando w es el vector propio correspondiente .
Una vez hallado w (1) , el primer componente principal de un vector de datos x ( i ) puede entonces darse como una puntuación t 1( i ) = x ( i ) ⋅ w (1) en las coordenadas transformadas, o como el vector correspondiente en las variables originales, { x ( i ) ⋅ w (1) } w (1) .
Componentes adicionales
El k -ésimo componente se puede encontrar restando los primeros k − 1 componentes principales de X :
y luego encontrar el vector de pesos que extrae la máxima varianza de esta nueva matriz de datos.
Resulta que esto da los autovectores restantes de X T X , con los valores máximos para la cantidad entre paréntesis dados por sus autovalores correspondientes. Por lo tanto, los vectores de peso son autovectores de X T X .
Por lo tanto, el k -ésimo componente principal de un vector de datos x ( i ) puede darse como una puntuación t k ( i ) = x ( i ) ⋅ w ( k ) en las coordenadas transformadas, o como el vector correspondiente en el espacio de las variables originales, { x ( i ) ⋅ w ( k ) } w ( k ) , donde w ( k ) es el k -ésimo vector propio de X T X .
Por lo tanto, la descomposición completa en componentes principales de X se puede expresar como:
donde W es una matriz de pesos de p × p cuyas columnas son los vectores propios de X T X . La transpuesta de W a veces se denomina transformación de blanqueamiento o de esferización . Las columnas de W multiplicadas por la raíz cuadrada de los valores propios correspondientes, es decir, los vectores propios escalados por las varianzas, se denominan cargas en el análisis de componentes principales (PCA) o en el análisis factorial.
Covarianzas
X T X mismo puede reconocerse como proporcional a la matriz de covarianza de la muestra empírica del conjunto de datos X. [ 13 ] : 30–31
La covarianza muestral Q entre dos de los diferentes componentes principales del conjunto de datos viene dada por:
donde la propiedad de autovalor de w ( k ) se ha utilizado para pasar de la línea 2 a la línea 3. Sin embargo, los autovectores w ( j ) y w ( k ) correspondientes a los autovalores de una matriz simétrica son ortogonales (si los autovalores son diferentes) o pueden ortogonalizarse (si los vectores comparten un valor repetido igual). Por lo tanto, el producto en la última línea es cero; no hay covarianza muestral entre los diferentes componentes principales en el conjunto de datos.
Otra forma de caracterizar la transformación de componentes principales es, por lo tanto, como la transformación a coordenadas que diagonalizan la matriz de covarianza de la muestra empírica.
En forma matricial, la matriz de covarianza empírica para las variables originales se puede escribir
La matriz de covarianza empírica entre los componentes principales se convierte en
donde Λ es la matriz diagonal de valores propios λ ( k ) de X T X . λ ( k ) es igual a la suma de los cuadrados sobre el conjunto de datos asociado con cada componente k , es decir, λ ( k ) = Σ i t k 2 ( i ) = Σ i ( x ( i ) ⋅ w ( k ) ) 2 .
Reducción de dimensionalidad
La transformación P = X W mapea un vector de datos x ( i ) de un espacio original de x variables a un nuevo espacio de p variables que no están correlacionadas en el conjunto de datos. Para adimensionalizar los datos centrados, sea X c el conjunto de valores característicos de los vectores de datos X i , dados por:
- (norma máxima),
- (valor absoluto medio), o
- (norma euclidiana normalizada),
para un conjunto de datos de tamaño n . Estas normas se utilizan para transformar el espacio original de variables x, y a un nuevo espacio de variables no correlacionadas p, q (dada Y c con el mismo significado), de tal manera que; y las nuevas variables están relacionadas linealmente de la siguiente manera:Para encontrar la relación lineal óptima, minimizamos el error cuadrático total de reconstrucción: ; de tal manera que se establece la derivada de la función de error a cero.rendimientos:dónde. [ 14 ]

Esta reducción de dimensionalidad puede ser un paso muy útil para visualizar y procesar conjuntos de datos de alta dimensión, conservando al mismo tiempo la mayor parte de la varianza posible. Por ejemplo, al seleccionar L = 2 y conservar solo los dos primeros componentes principales, se encuentra el plano bidimensional a través del conjunto de datos de alta dimensión en el que los datos están más dispersos. De esta manera, si los datos contienen clústeres, estos también pueden estar más dispersos y, por lo tanto, ser más visibles para representarlos en un diagrama bidimensional. En cambio, si se eligen al azar dos direcciones a través de los datos (o dos de las variables originales), los clústeres pueden estar mucho menos dispersos entre sí y, de hecho, es mucho más probable que se superpongan sustancialmente, haciéndolos indistinguibles.
De manera similar, en el análisis de regresión , cuanto mayor sea el número de variables explicativas permitidas, mayor será la probabilidad de sobreajustar el modelo, lo que produce conclusiones que no se generalizan a otros conjuntos de datos. Un enfoque, especialmente cuando existen fuertes correlaciones entre diferentes variables explicativas posibles, consiste en reducirlas a unos pocos componentes principales y luego realizar la regresión con ellos, un método denominado regresión de componentes principales .
La reducción de dimensionalidad también puede ser apropiada cuando las variables de un conjunto de datos son ruidosas. Si cada columna del conjunto de datos contiene ruido gaussiano independiente e idénticamente distribuido, entonces las columnas de T también contendrán ruido gaussiano similarmente idénticamente distribuido (dicha distribución es invariante bajo los efectos de la matriz W , que puede considerarse como una rotación de alta dimensión de los ejes de coordenadas). Sin embargo, con una mayor concentración de la varianza total en los primeros componentes principales en comparación con la misma varianza de ruido, el efecto proporcional del ruido es menor: los primeros componentes alcanzan una mayor relación señal-ruido . Por lo tanto, el PCA puede tener el efecto de concentrar gran parte de la señal en los primeros componentes principales, que pueden capturarse útilmente mediante la reducción de dimensionalidad; mientras que los componentes principales posteriores pueden estar dominados por el ruido y, por lo tanto, descartarse sin una gran pérdida. Si el conjunto de datos no es demasiado grande, la significancia de los componentes principales puede probarse utilizando bootstrap paramétrico , como ayuda para determinar cuántos componentes principales retener. [ 15 ]
Descomposición en valores singulares
La transformación de componentes principales también puede asociarse con otra factorización de matrices, la descomposición en valores singulares (SVD) de X ,
Aquí Σ es una matriz diagonal rectangular de n por p de números positivos σ ( k ) , llamados valores singulares de X ; U es una matriz de n por n , cuyas columnas son vectores unitarios ortogonales de longitud n llamados vectores singulares izquierdos de X ; y W es una matriz de p por p cuyas columnas son vectores unitarios ortogonales de longitud p y llamados vectores singulares derechos de X .
En términos de esta factorización, la matriz X T X se puede escribir
dóndees la matriz diagonal cuadrada con los valores singulares de X y los ceros sobrantes eliminados que satisface. La comparación con la factorización de vectores propios de X T X establece que los vectores singulares derechos W de X son equivalentes a los vectores propios de X T X , mientras que los valores singulares σ ( k ) deson iguales a la raíz cuadrada de los valores propios λ ( k ) de X T X .
Utilizando la descomposición en valores singulares, la matriz de puntuación T se puede escribir
Así , cada columna de T viene dada por uno de los vectores singulares izquierdos de X multiplicado por el valor singular correspondiente. Esta forma es también la descomposición polar de T.
Existen algoritmos eficientes para calcular la SVD de X sin tener que formar la matriz X T X , por lo que calcular la SVD es ahora la forma estándar de calcular un análisis de componentes principales a partir de una matriz de datos, [ 16 ] a menos que solo se requieran unos pocos componentes.
Al igual que con la descomposición en valores propios, se puede obtener una matriz de puntuación truncada n × L T L considerando solo los primeros L valores singulares más grandes y sus vectores singulares:
La truncación de una matriz M o T utilizando una descomposición en valores singulares truncada de esta manera produce una matriz truncada que es la matriz de rango L más cercana posible a la matriz original, en el sentido de que la diferencia entre las dos tiene la norma de Frobenius más pequeña posible , un resultado conocido como el teorema de Eckart-Young [1936].
Teorema (Ajuste óptimo k-dimensional). Sea P una matriz de datos n×m cuyas columnas han sido centradas en la media y escaladas, y sea sea su descomposición en valores singulares. Entonces, la mejor aproximación de rango k a P en el sentido de mínimos cuadrados (norma de Frobenius) es , donde V k consta de las primeras k columnas de V. Además, la varianza residual relativa es .
Consideraciones adicionales
Los valores singulares (en Σ ) son las raíces cuadradas de los autovalores de la matriz X T X. Cada autovalor es proporcional a la porción de la "varianza" (más correctamente, de la suma de las distancias al cuadrado de los puntos a su media multidimensional) que está asociada con cada autovector. La suma de todos los autovalores es igual a la suma de las distancias al cuadrado de los puntos a su media multidimensional. PCA esencialmente rota el conjunto de puntos alrededor de su media para alinearlos con los componentes principales. Esto mueve la mayor parte de la varianza posible (usando una transformación ortogonal) a las primeras dimensiones. Por lo tanto, los valores en las dimensiones restantes tienden a ser pequeños y pueden descartarse con una pérdida mínima de información (ver más adelante ). PCA se usa a menudo de esta manera para la reducción de dimensionalidad . PCA tiene la distinción de ser la transformación ortogonal óptima para mantener el subespacio que tiene la mayor "varianza" (como se definió anteriormente). Esta ventaja, sin embargo, conlleva mayores requisitos computacionales si se compara, por ejemplo, y cuando corresponda, con la transformada discreta del coseno , y en particular con la DCT-II, conocida simplemente como "DCT". Las técnicas de reducción de dimensionalidad no lineal tienden a ser computacionalmente más exigentes que el PCA.
El PCA es sensible al escalado de las variables. Matemáticamente, esta sensibilidad proviene de la forma en que un reescalado cambia la matriz de covarianza muestral que el PCA diagonaliza. [ 14 ]
DejarSea la matriz de datos *centrada* ( n filas, p columnas) y defina la covarianza. Si elLa -ésima variable se multiplica por un factor.obtenemos Por lo tanto, la nueva covarianza es
Debido a que los valores propios y los vectores propios deson los deescalado porLos ejes principales giran hacia cualquier columna cuya varianza se haya incrementado, tal como lo ilustra el ejemplo bidimensional a continuación.
Si tenemos solo dos variables con la misma varianza muestral y completamente correlacionadas, el PCA implicará una rotación de 45° y los "pesos" (los cosenos de rotación) de las dos variables con respecto al componente principal serán iguales. Pero si multiplicamos todos los valores de la primera variable por 100, el primer componente principal será casi idéntico a esa variable, con una pequeña contribución de la otra, mientras que el segundo componente estará casi alineado con la segunda variable original. Esto significa que, cuando las diferentes variables tienen unidades distintas (como la temperatura y la masa), el PCA es un método de análisis algo arbitrario. (Se obtendrían resultados diferentes si se utilizara Fahrenheit en lugar de Celsius, por ejemplo). El artículo original de Pearson se titulaba "Sobre líneas y planos de ajuste más cercano a sistemas de puntos en el espacio"; "en el espacio" implica el espacio euclidiano físico, donde tales preocupaciones no surgen. Una forma de reducir la arbitrariedad del PCA es utilizar variables escaladas para que tengan varianza unitaria, estandarizando los datos y, por lo tanto, empleando la matriz de autocorrelación en lugar de la matriz de autocovarianza como base para el PCA. Sin embargo, esto comprime (o expande) las fluctuaciones en todas las dimensiones del espacio de la señal hasta alcanzar una varianza unitaria.
El PCA clásico asume que la nube de puntos ya ha sido trasladada de manera que su centroide se encuentra en el origen. [ 14 ]
Escriba cada observación como
Sin restarestamos diagonalizando de hecho
dóndees la matriz centrada. El término de rango unoa menudo domina, forzando al vector propio principal a apuntar casi exactamente hacia la media y borrando cualquier estructura en la parte central.Tras restar la media, ese término desaparece y los ejes principales se alinean con las direcciones reales de máxima varianza.
El centrado en la media es innecesario si se realiza un análisis de componentes principales en una matriz de correlación, ya que los datos ya están centrados después de calcular las correlaciones. Las correlaciones se derivan del producto cruzado de dos puntuaciones estándar (puntuaciones Z) o momentos estadísticos (de ahí el nombre: Correlación Producto-Momento de Pearson ). Véase también el artículo de Kromrey y Foster-Johnson (1998) sobre "Centrado en la media en la regresión moderada: mucho ruido y pocas nueces" . Dado que las covarianzas son correlaciones de variables normalizadas ( puntuaciones Z o estándar ) , un PCA basado en la matriz de correlación de X es igual a un PCA basado en la matriz de covarianza de Z , la versión estandarizada de X.
El PCA es una técnica primaria popular en el reconocimiento de patrones . Sin embargo, no está optimizado para la separabilidad de clases. [ 17 ] No obstante, se ha utilizado para cuantificar la distancia entre dos o más clases calculando el centro de masa para cada clase en el espacio de componentes principales e informando la distancia euclidiana entre los centros de masa de dos o más clases. [ 18 ] El análisis discriminante lineal es una alternativa que sí está optimizada para la separabilidad de clases.
Tabla de símbolos y abreviaturas
Propiedades y limitaciones
Propiedades
Algunas propiedades del PCA incluyen: [ 13 ]
- Propiedad 1 : Para cualquier enteroq, 1 ≤q≤p, considere latransformación lineal
- dóndees un vector de q elementos yes una matriz ( q × p ), y seasea la matriz de varianza - covarianza para. Luego el rastro de, denotado, se maximiza tomando, dóndeconsta de las primeras q columnas dees la transpuesta de. (no está definido aquí)
- Propiedad 2 : Consideremos nuevamente latransformación ortonormal.
- conydefinido como antes. Entoncesse minimiza tomandodóndeconsta de las últimas q columnas de.
La implicación estadística de esta propiedad es que los últimos componentes principales (CP) no son simplemente restos no estructurados tras eliminar los CP importantes. Dado que estos últimos CP tienen varianzas lo más pequeñas posible, resultan útiles por sí mismos. Pueden ayudar a detectar relaciones lineales casi constantes e insospechadas entre los elementos de x , y también pueden ser útiles en regresión , en la selección de un subconjunto de variables de x y en la detección de valores atípicos.
- Propiedad 3 : (Descomposición espectral de Σ )
Antes de analizar su uso, primero analizaremos los elementos diagonales .
Entonces, quizás la principal implicación estadística del resultado es que no solo podemos descomponer las varianzas combinadas de todos los elementos de x en contribuciones decrecientes debidas a cada PC, sino que también podemos descomponer toda la matriz de covarianza en contribuciones.de cada PC. Aunque no estrictamente decreciente, los elementos detenderá a hacerse más pequeño a medida queaumenta, a medida queno es creciente para creciente, mientras que los elementos detienden a mantenerse aproximadamente del mismo tamaño debido a las restricciones de normalización:.
Limitaciones
Como se indicó anteriormente, los resultados del PCA dependen del escalado de las variables. Esto se puede solucionar escalando cada característica por su desviación estándar, de modo que se obtengan características adimensionales con varianza unitaria. [ 19 ]
La aplicabilidad del PCA, tal como se describe anteriormente, está limitada por ciertas suposiciones (tácitas) [ 20 ] realizadas en su derivación. En particular, el PCA puede capturar correlaciones lineales entre las características, pero falla cuando se incumple esta suposición (véase la Figura 6a en la referencia). En algunos casos, las transformaciones de coordenadas pueden restablecer la suposición de linealidad y, por lo tanto, se puede aplicar el PCA (véase PCA de núcleo ).
Otra limitación es el proceso de eliminación de la media antes de construir la matriz de covarianza para PCA. En campos como la astronomía, todas las señales son no negativas, y el proceso de eliminación de la media forzará que la media de algunas exposiciones astrofísicas sea cero, lo que en consecuencia crea flujos negativos no físicos, [ 21 ] y se debe realizar un modelado directo para recuperar la magnitud real de las señales. [ 22 ] Como método alternativo, la factorización de matrices no negativas que se centra solo en los elementos no negativos en las matrices es muy adecuada para observaciones astrofísicas. [ 23 ] [ 24 ] [ 25 ] Véase más en la relación entre PCA y factorización de matrices no negativas .
El PCA presenta desventajas si los datos no se han estandarizado antes de aplicar el algoritmo. El PCA transforma los datos originales en datos relevantes para los componentes principales de dichos datos, lo que significa que las nuevas variables de datos no pueden interpretarse de la misma manera que las originales. Son interpretaciones lineales de las variables originales. Además, si el PCA no se realiza correctamente, existe una alta probabilidad de pérdida de información. [ 26 ]
El PCA se basa en un modelo lineal. Si un conjunto de datos contiene un patrón no lineal oculto, el PCA puede dirigir el análisis en la dirección completamente opuesta al progreso esperado. [ 27 ] Investigadores de la Universidad Estatal de Kansas descubrieron que el error de muestreo en sus experimentos afectaba el sesgo de los resultados del PCA. "Si el número de sujetos o bloques es menor a 30, y/o el investigador está interesado en componentes principales (PC) más allá del primero, puede ser mejor corregir primero la autocorrelación serial, antes de realizar el PCA". [ 28 ] Los investigadores de la Universidad Estatal de Kansas también encontraron que el PCA podría estar "gravemente sesgado si la estructura de autocorrelación de los datos no se maneja correctamente". [ 28 ]
Análisis de componentes principales y teoría de la información
La reducción de dimensionalidad conlleva, en general, una pérdida de información. La reducción de dimensionalidad basada en PCA tiende a minimizar dicha pérdida de información, bajo ciertos modelos de señal y ruido.
Bajo el supuesto de que
es decir, que el vector de datoses la suma de la señal portadora de información deseaday una señal de ruidoDesde un punto de vista de la teoría de la información, se puede demostrar que el análisis de componentes principales (PCA) puede ser óptimo para la reducción de dimensionalidad.
En particular, Linker demostró que sies gaussiana yes ruido gaussiano con una matriz de covarianza proporcional a la matriz identidad, el PCA maximiza la información mutua ;\mathbf {s} )} entre la información deseaday la salida con dimensionalidad reducida. [ 29 ]
Si el ruido sigue siendo gaussiano y tiene una matriz de covarianza proporcional a la matriz identidad (es decir, los componentes del vectorson iid ), pero la señal portadora de informaciónes no gaussiano (lo cual es un escenario común), PCA al menos minimiza un límite superior en la pérdida de información , que se define como [ 30 ] [ 31 ]
- ;\mathbf {s} )-I(\mathbf {y} ;\mathbf {s} ).}
La optimalidad de PCA también se conserva si el ruidoes i.i.d. y al menos más gaussiana (en términos de la divergencia de Kullback-Leibler ) que la señal portadora de información.. [ 32 ] En general, incluso si el modelo de señal anterior es válido, PCA pierde su optimalidad teórica de la información tan pronto como el ruidose vuelve dependiente.
Cálculo mediante el método de covarianza
A continuación se presenta una descripción detallada del PCA utilizando el método de covarianza [ 33 ] en contraposición al método de correlación. [ 34 ]
El objetivo es transformar un conjunto de datos X de dimensión p en un conjunto de datos alternativo Y de menor dimensión L. Equivalentemente, buscamos encontrar la matriz Y , donde Y es la transformada de Karhunen-Loève (KLT) de la matriz X :
- Organizar el conjunto de datos
Supongamos que tenemos datos que comprenden un conjunto de observaciones de p variables, y queremos reducir los datos de modo que cada observación pueda describirse con solo L variables, L < p . Supongamos además que los datos están organizados como un conjunto de n vectores de datos.con cadarepresenta una única observación agrupada de las variables p .
- Escribircomo vectores fila, cada uno con p elementos.
- Coloca los vectores fila en una única matriz X de dimensiones n × p .
- Calcular la media empírica
- Encuentra la media empírica a lo largo de cada columna j = 1, ..., p .
- Coloca los valores medios calculados en un vector de media empírica u de dimensiones p × 1.
- Calcula las desviaciones respecto a la media.
La resta de la media es una parte integral de la solución para encontrar una base de componentes principales que minimice el error cuadrático medio de la aproximación de los datos. [ 35 ] Por lo tanto, procedemos centrando los datos de la siguiente manera:
- Resta el vector de media empíricade cada fila de la matriz de datos X.
- Almacene los datos con la media restada en la matriz B de n × p .donde h es un vector columna de n × 1 compuesto únicamente por unos:
En algunas aplicaciones, cada variable (columna de B ) también puede escalarse para tener una varianza igual a 1 (véase la puntuación Z ). [ 36 ] Este paso afecta a los componentes principales calculados, pero los hace independientes de las unidades utilizadas para medir las diferentes variables.
- Halla la matriz de covarianza
- Halla la matriz de covarianza empírica p × p C a partir de la matriz B :dóndees el operador de transposición conjugada . Si B consiste enteramente en números reales, lo cual es el caso en muchas aplicaciones, la "transposición conjugada" es lo mismo que la transposición regular .
- El razonamiento detrás del uso de n − 1 en lugar de n para calcular la covarianza es la corrección de Bessel .
- Halla los vectores propios y los valores propios de la matriz de covarianza.
- Calcula la matriz V de vectores propios que diagonaliza la matriz de covarianza C :donde D es la matriz diagonal de valores propios de C. Este paso normalmente implicará el uso de un algoritmo basado en computadora para calcular vectores propios y valores propios . Estos algoritmos están fácilmente disponibles como subcomponentes de la mayoría de los sistemas de álgebra matricial , como SAS , [ 37 ] R , MATLAB , [ 38 ] [ 39 ] Mathematica , [ 40 ] SciPy , IDL ( Interactive Data Language ) o GNU Octave , así como OpenCV .
- La matriz D tomará la forma de una matriz diagonal p × p , dondees el j -ésimo valor propio de la matriz de covarianza C , y
- La matriz V , también de dimensión p × p , contiene p vectores columna, cada uno de longitud p , que representan los p vectores propios de la matriz de covarianza C.
- Los valores y vectores propios están ordenados y emparejados. El j -ésimo valor propio corresponde al j -ésimo vector propio.
- La matriz V representa la matriz de autovectores derechos (en contraposición a los autovectores izquierdos ). En general, la matriz de autovectores derechos no tiene por qué ser la transpuesta (conjugada) de la matriz de autovectores izquierdos.
- Reorganizar los vectores propios y los valores propios.
- Ordena las columnas de la matriz de vectores propios V y de la matriz de valores propios D en orden descendente de valor propio.
- Asegúrese de mantener las correspondencias correctas entre las columnas de cada matriz.
- Calcula el contenido energético acumulado para cada vector propio.
- Los autovalores representan la distribución de la energía de los datos fuente entre cada uno de los autovectores, donde los autovectores forman una base para los datos. El contenido energético acumulado g para el j -ésimo autovector es la suma del contenido energético de todos los autovalores desde 1 hasta j dividida por la suma del contenido energético de todos los autovalores (mostrado en el paso 8):
- Seleccione un subconjunto de los autovectores como vectores base.
- Guarda las primeras L columnas de V como la matriz W de p × L :dónde
- Utilice el vector g como guía para elegir un valor apropiado para L. El objetivo es elegir un valor de L lo más pequeño posible, al tiempo que se logra un valor de g razonablemente alto en términos porcentuales. Por ejemplo, puede que desee elegir L de modo que la energía acumulada g esté por encima de un cierto umbral, como el 90 por ciento. En este caso, elija el valor más pequeño de L tal que
- Proyectar los datos sobre la nueva base.
- Los puntos de datos proyectados son las filas de la matriz.
Es decir, la primera columna dees la proyección de los puntos de datos sobre el primer componente principal, la segunda columna es la proyección sobre el segundo componente principal, etc.
Derivación mediante el método de covarianza
Sea X un vector aleatorio de dimensión d expresado como un vector columna. Sin pérdida de generalidad, supongamos que X tiene media cero.
Queremos encontraruna matriz de transformación ortonormal d × d P de modo que PX tenga una matriz de covarianza diagonal (es decir, PX es un vector aleatorio con todos sus componentes distintos no correlacionados entre sí).
Un cálculo rápido suponiendofueron rendimientos unitarios:
Por esose cumple si y solo sieran diagonalizables por.
Esto es muy constructivo, ya que se garantiza que cov( X ) es una matriz semidefinida positiva y, por lo tanto, se garantiza que es diagonalizable por alguna matriz unitaria.
Computación sin covarianza
En implementaciones prácticas, especialmente con datos de alta dimensión ( p grande ), el método de covarianza ingenuo rara vez se utiliza porque no es eficiente debido a los altos costos computacionales y de memoria de determinar explícitamente la matriz de covarianza. El enfoque sin covarianza evita las np 2 operaciones de calcular y almacenar explícitamente la matriz de covarianza X T X , utilizando en su lugar uno de los métodos sin matriz , por ejemplo, basado en la función que evalúa el producto X T (X r) a un costo de 2 np operaciones.
Computación iterativa
Una forma de calcular el primer componente principal de manera eficiente [ 41 ] se muestra en el siguiente pseudocódigo, para una matriz de datos X con media cero, sin calcular nunca su matriz de covarianza.
r = un vector aleatorio de longitud p r = r / norma( r ) hacer c veces: s = 0 (un vector de longitud p ) para cada fila x en X s = s + ( x ⋅ r ) x λ = r T s // λ es el valor propio error = |λ ⋅ r − s | r = s / norm( s ) salir si error < tolerancia devolver λ, r
Este algoritmo de iteración de potencia simplemente calcula el vector X T (X r) , lo normaliza y coloca el resultado de nuevo en r . El valor propio se aproxima mediante r T (X T X) r , que es el cociente de Rayleigh en el vector unitario r para la matriz de covarianza X T X. Si el valor singular más grande está bien separado del siguiente más grande, el vector r se acerca al primer componente principal de X dentro del número de iteraciones c , que es pequeño en relación con p , con un coste total de 2cnp . La convergencia de la iteración de potencia se puede acelerar sin sacrificar notablemente el pequeño coste por iteración utilizando métodos sin matriz más avanzados , como el algoritmo de Lanczos o el método de gradiente conjugado precondicionado por bloques óptimo local ( LOBPCG ).
Los componentes principales subsiguientes pueden calcularse uno a uno mediante deflación o simultáneamente como un bloque. En el primer enfoque, las imprecisiones en los componentes principales aproximados ya calculados afectan de forma aditiva la precisión de los componentes principales calculados posteriormente, aumentando así el error con cada nuevo cálculo. El segundo enfoque en el método de potencia de bloques reemplaza los vectores individuales r y s con vectores de bloques, matrices R y S. Cada columna de R aproxima uno de los componentes principales principales, mientras que todas las columnas se iteran simultáneamente. El cálculo principal es la evaluación del producto X T (XR) . Implementado, por ejemplo, en LOBPCG , el bloqueo eficiente elimina la acumulación de errores, permite utilizar funciones de producto matriz-matriz BLAS de alto nivel y, por lo general, conduce a una convergencia más rápida, en comparación con la técnica de vector único uno a uno.
El método NIPALS
El método de mínimos cuadrados parciales iterativos no lineales (NIPALS) es una variante de la iteración de potencia clásica con deflación de matriz por sustracción, implementada para calcular los primeros componentes en un análisis de componentes principales o mínimos cuadrados parciales . Para conjuntos de datos de muy alta dimensión, como los generados en las ciencias ómicas (por ejemplo, genómica , metabolómica ), generalmente solo es necesario calcular los primeros componentes principales. El algoritmo de mínimos cuadrados parciales iterativos no lineales (NIPALS) actualiza las aproximaciones iterativas a las puntuaciones y cargas principales t 1 y r 1 T mediante la iteración de potencia, multiplicando en cada iteración por X a la izquierda y a la derecha; es decir, se evita el cálculo de la matriz de covarianza, al igual que en la implementación sin matriz de las iteraciones de potencia a X T X , basada en la función que evalúa el producto X T (X r) = ((X r) T X) T .
La deflación de la matriz por sustracción se realiza restando el producto exterior, t 1 r 1 T de X, dejando la matriz residual deflacionada que se utiliza para calcular los PC principales subsiguientes. [ 42 ] Para matrices de datos grandes, o matrices que tienen un alto grado de colinealidad de columna, NIPALS sufre una pérdida de ortogonalidad de los PC debido a errores de redondeo de precisión de máquina acumulados en cada iteración y deflación de matriz por sustracción. [ 43 ] Se aplica un algoritmo de reortogonalización de Gram-Schmidt tanto a las puntuaciones como a las cargas en cada paso de iteración para eliminar esta pérdida de ortogonalidad. [ 44 ] La dependencia de NIPALS de multiplicaciones de un solo vector no puede aprovechar BLAS de alto nivel y da como resultado una convergencia lenta para valores singulares principales agrupados; ambas deficiencias se resuelven en solucionadores de bloques sin matriz más sofisticados, como el método de gradiente conjugado precondicionado de bloque óptimo local ( LOBPCG ).
Estimación en línea/secuencial
En una situación "en línea" o "en tiempo real", donde los datos llegan poco a poco en lugar de almacenarse en un solo lote, es útil realizar una estimación de la proyección PCA que pueda actualizarse secuencialmente. Esto puede hacerse de manera eficiente, pero requiere algoritmos diferentes. [ 45 ]
Variables cualitativas
En el análisis exploratorio de datos, las variables cualitativas (categóricas) no utilizadas para construir el modelo pueden proyectarse sobre los ejes de componentes principales como elementos suplementarios. [ 46 ] [ 47 ] [ 48 ] El uso de variables cualitativas suplementarias fue una característica definitoria de la escuela francesa de análisis de datos desarrollada en las décadas de 1960 y 1970. [ 49 ] Basado en el trabajo de Ludovic Lebart , el método está disponible en el entorno R a través de paquetes como FactoMineR. [ 50 ] [ 51 ] [ 52 ]
Aplicaciones
Inteligencia
La primera aplicación del análisis factorial fue la localización y medición de los componentes de la inteligencia humana. Se creía que la inteligencia tenía varios componentes no correlacionados, como la inteligencia espacial, la inteligencia verbal, la inducción, la deducción, etc., y que las puntuaciones en estos componentes podían deducirse mediante el análisis factorial a partir de los resultados de diversas pruebas, para obtener un índice único conocido como Cociente Intelectual (CI). El pionero psicólogo estadístico Spearman desarrolló el análisis factorial en 1904 para su teoría bifactorial de la inteligencia, añadiendo una técnica formal a la ciencia de la psicometría . En 1924, Thurstone buscó 56 factores de inteligencia, desarrollando la noción de Edad Mental. Las pruebas de CI estándar actuales se basan en este trabajo inicial. [ 53 ]
diferenciación residencial
En 1949, Shevky y Williams introdujeron la teoría de la ecología factorial , que dominó los estudios de diferenciación residencial desde la década de 1950 hasta la de 1970. [ 54 ] Los barrios de una ciudad eran reconocibles o podían distinguirse entre sí por varias características que podían reducirse a tres mediante el análisis factorial. Estas se conocían como «rango social» (un índice de estatus ocupacional), «familismo» o tamaño de la familia y «etnicidad»; el análisis de conglomerados podía aplicarse para dividir la ciudad en conglomerados o distritos según los valores de las tres variables factoriales clave. Se desarrolló una extensa bibliografía en torno a la ecología factorial en geografía urbana, pero el enfoque cayó en desuso después de 1980 por ser metodológicamente primitivo y tener poca cabida en los paradigmas geográficos posmodernos.
Uno de los problemas del análisis factorial siempre ha sido encontrar nombres convincentes para los diversos factores artificiales. En 2000, Flood revivió el enfoque de la ecología factorial para demostrar que el análisis de componentes principales proporcionaba respuestas significativas directamente, sin recurrir a la rotación de factores. Los componentes principales eran en realidad variables duales o precios sombra de las "fuerzas" que impulsan a las personas a unirse o separarse en las ciudades. El primer componente era la "accesibilidad", la clásica disyuntiva entre la demanda de transporte y la demanda de espacio, en torno a la cual se basa la economía urbana clásica. Los dos componentes siguientes eran la "desventaja", que mantiene a las personas de estatus similar en barrios separados (mediada por la planificación), y la etnicidad, donde las personas de orígenes étnicos similares intentan ubicarse juntas. [ 55 ]
Casi al mismo tiempo, la Oficina Australiana de Estadística definió índices distintos de ventaja y desventaja tomando el primer componente principal de conjuntos de variables clave que se consideraban importantes. Estos índices SEIFA se publican periódicamente para diversas jurisdicciones y se utilizan con frecuencia en el análisis espacial. [ 56 ]
Índices de desarrollo
El PCA puede utilizarse como método formal para el desarrollo de índices. Como alternativa, se ha propuesto el análisis compuesto confirmatorio para desarrollar y evaluar índices. [ 57 ]
El Índice de Desarrollo Urbano fue desarrollado por PCA a partir de aproximadamente 200 indicadores de resultados urbanos, obtenidos en una encuesta realizada en 1996 a 254 ciudades globales. El primer componente principal se sometió a una regresión iterativa, añadiendo las variables originales de forma individual hasta explicar aproximadamente el 90% de su variación. El índice finalmente utilizó unos 15 indicadores, pero resultó ser un buen predictor de muchas más variables. Su valor comparativo coincidió muy bien con una evaluación subjetiva del estado de cada ciudad. Los coeficientes de los elementos de infraestructura fueron aproximadamente proporcionales a los costos promedio de prestación de los servicios subyacentes, lo que sugiere que el Índice era, en realidad, una medida de la inversión física y social efectiva en la ciudad.
El Índice de Desarrollo Humano (IDH) a nivel de país del PNUD , que se publica desde 1990 y se utiliza ampliamente en estudios de desarrollo, [ 58 ] tiene coeficientes muy similares en indicadores similares, lo que sugiere fuertemente que fue construido originalmente utilizando PCA.
genética de poblaciones
En 1978, Cavalli-Sforza y otros fueron pioneros en el uso del análisis de componentes principales (ACP) para resumir datos sobre la variación en las frecuencias genéticas humanas en diferentes regiones. Los componentes mostraron patrones distintivos, incluyendo gradientes y ondas sinusoidales. Interpretaron estos patrones como resultado de eventos migratorios antiguos específicos.
Desde entonces, el PCA se ha vuelto omnipresente en la genética de poblaciones, con miles de artículos que lo utilizan como mecanismo de visualización. La genética varía en gran medida según la proximidad, por lo que los dos primeros componentes principales muestran la distribución espacial y pueden usarse para mapear la ubicación geográfica relativa de diferentes grupos de población, mostrando así a los individuos que se han desplazado de sus ubicaciones originales. [ 59 ]
El análisis de componentes principales (ACP) en genética ha sido técnicamente controvertido, ya que la técnica se ha aplicado a variables discretas no normales y, a menudo, a marcadores alélicos binarios. La falta de medidas de error estándar en el ACP también dificulta su uso más consistente. En agosto de 2022, el biólogo molecular Eran Elhaik publicó un artículo teórico en Scientific Reports que analizaba 12 aplicaciones del ACP. Concluyó que era fácil manipular el método, el cual, en su opinión, generaba resultados «erróneos, contradictorios y absurdos». En concreto, argumentó que los resultados obtenidos en genética de poblaciones se caracterizaban por la selección sesgada de datos y el razonamiento circular . [ 60 ]
Investigación de mercado e índices de actitud
La investigación de mercado ha utilizado ampliamente el PCA. Se emplea para desarrollar índices de satisfacción o fidelización del cliente para productos y, mediante la agrupación, para desarrollar segmentos de mercado que pueden ser objeto de campañas publicitarias, de forma muy similar a como la ecología factorial localiza áreas geográficas con características similares. [ 61 ]
El PCA transforma rápidamente grandes cantidades de datos en variables más pequeñas y fáciles de digerir, que pueden analizarse con mayor rapidez y facilidad. En cualquier cuestionario para consumidores, existen series de preguntas diseñadas para obtener información sobre sus actitudes, y el análisis de componentes principales busca variables latentes subyacentes a estas actitudes. Por ejemplo, la encuesta de Oxford sobre Internet de 2013 preguntó a 2000 personas sobre sus actitudes y creencias, y a partir de ellas, los analistas extrajeron cuatro dimensiones de componentes principales, que identificaron como «evasión», «redes sociales», «eficiencia» y «creación de problemas». [ 62 ]
Otro ejemplo de Joe Flood en 2008 extrajo un índice de actitud hacia la vivienda a partir de 28 preguntas sobre actitudes en una encuesta nacional de 2697 hogares en Australia. El primer componente principal representaba una actitud general hacia la propiedad y la titularidad de la vivienda. El índice, o las preguntas sobre actitudes que lo componían, podían incorporarse a un modelo lineal general de elección de tenencia. El determinante más importante del alquiler privado fue, con diferencia, el índice de actitud, en lugar de los ingresos, el estado civil o el tipo de hogar. [ 63 ]
finanzas cuantitativas
En finanzas cuantitativas , el PCA se utiliza [ 64 ] en la gestión del riesgo financiero y se ha aplicado a otros problemas como la optimización de carteras .
PCA se usa comúnmente en problemas que involucran valores y carteras de renta fija y derivados de tasas de interés . Las valoraciones aquí dependen de toda la curva de rendimiento , que comprende numerosos instrumentos altamente correlacionados, y PCA se usa para definir un conjunto de componentes o factores que explican los movimientos de tasas, [ 65 ] facilitando así el modelado. Una aplicación común de gestión de riesgos es el cálculo del valor en riesgo , VaR, aplicando PCA a la simulación de Monte Carlo . [ 66 ] Aquí, para cada muestra de simulación, los componentes se someten a estrés y las tasas, y a su vez los valores de las opciones , se reconstruyen; con VaR calculado, finalmente, sobre toda la ejecución. PCA también se usa en la cobertura de la exposición al riesgo de tasa de interés , dadas duraciones parciales y otras sensibilidades. [ 65 ] En ambos casos, los primeros tres, típicamente, componentes principales del sistema son de interés ( que representan "desplazamiento", "torsión" y "curvatura"). Estos componentes principales se derivan de una descomposición en valores propios de la matriz de covarianza del rendimiento en vencimientos predefinidos; [ 67 ] y donde la varianza de cada componente es su valor propio (y como los componentes son ortogonales , no es necesario incorporar ninguna correlación en el modelado posterior).
Para la renta variable , una cartera óptima es aquella donde se maximiza el rendimiento esperado para un nivel de riesgo dado, o alternativamente, donde se minimiza el riesgo para un rendimiento dado; véase el modelo de Markowitz para más detalles. Por lo tanto, un enfoque es reducir el riesgo de la cartera, donde las estrategias de asignación se aplican a las "carteras principales" en lugar de a las acciones subyacentes . Un segundo enfoque es mejorar el rendimiento de la cartera, utilizando los componentes principales para seleccionar acciones de empresas con potencial alcista. [ 68 ] [ 69 ] El PCA también se ha utilizado para comprender las relaciones [ 64 ] entre los mercados de renta variable internacionales y dentro de los mercados entre grupos de empresas en industrias o sectores .
El PCA también puede aplicarse a las pruebas de estrés , [ 70 ] esencialmente un análisis de la capacidad de un banco para soportar un escenario económico adverso hipotético . Su utilidad radica en "destilar la información contenida en [varias] variables macroeconómicas en un conjunto de datos más manejable, que luego puede [utilizarse] para el análisis". [ 70 ] Aquí, los factores resultantes se vinculan, por ejemplo, a las tasas de interés, basándose en los elementos más grandes del vector propio del factor , y luego se observa cómo un "choque" en cada uno de los factores afecta los activos implícitos de cada uno de los bancos.
Neurociencia
Una variante del análisis de componentes principales se utiliza en neurociencia para identificar las propiedades específicas de un estímulo que aumentan la probabilidad de que una neurona genere un potencial de acción . [ 71 ] [ 72 ] Esta técnica se conoce como análisis de covarianza activado por espigas . En una aplicación típica, un experimentador presenta un proceso de ruido blanco como un estímulo (generalmente como una entrada sensorial a un sujeto de prueba, o como una corriente inyectada directamente en la neurona) y registra un tren de potenciales de acción, o espigas, producidos por la neurona como resultado. Presumiblemente, ciertas características del estímulo hacen que la neurona sea más propensa a generar espigas. Para extraer estas características, el experimentador calcula la matriz de covarianza del conjunto activado por espigas , el conjunto de todos los estímulos (definidos y discretizados en una ventana de tiempo finita, típicamente del orden de 100 ms) que precedieron inmediatamente a una espiga. Los autovectores de la diferencia entre la matriz de covarianza desencadenada por el pico y la matriz de covarianza del conjunto de estímulos previo (el conjunto de todos los estímulos, definidos en la misma ventana temporal) indican las direcciones en el espacio de estímulos a lo largo de las cuales la varianza del conjunto desencadenado por el pico difirió más de la del conjunto de estímulos previo. Específicamente, los autovectores con los autovalores positivos más grandes corresponden a las direcciones a lo largo de las cuales la varianza del conjunto desencadenado por el pico mostró el mayor cambio positivo en comparación con la varianza previa. Dado que estas fueron las direcciones en las que la variación del estímulo condujo a un pico, suelen ser buenas aproximaciones de las características relevantes del estímulo que se buscan.
En neurociencia, el análisis de componentes principales (PCA) también se utiliza para identificar una neurona a partir de la forma de su potencial de acción. La clasificación de potenciales de acción es un procedimiento importante, ya que las técnicas de registro extracelular suelen captar señales de más de una neurona. En este proceso, primero se utiliza el PCA para reducir la dimensionalidad del espacio de las formas de onda de los potenciales de acción y, posteriormente, se realiza un análisis de agrupamiento para asociar potenciales de acción específicos con neuronas individuales.
El PCA, como técnica de reducción de dimensionalidad, es particularmente adecuado para detectar actividades coordinadas de grandes conjuntos neuronales. Se ha utilizado para determinar variables colectivas, es decir, parámetros de orden , durante las transiciones de fase en el cerebro. [ 73 ]
Relación con otros métodos
Análisis de correspondencias
El análisis de correspondencias (AC) fue desarrollado por Jean-Paul Benzécri [ 74 ] y es conceptualmente similar al PCA, pero escala los datos (que deben ser no negativos) de manera que las filas y columnas se traten de forma equivalente. Tradicionalmente se aplica a tablas de contingencia . El AC descompone el estadístico chi-cuadrado asociado a esta tabla en factores ortogonales. [ 75 ] Dado que el AC es una técnica descriptiva, puede aplicarse a tablas para las que el estadístico chi-cuadrado sea apropiado o no. Existen varias variantes de AC, incluyendo el análisis de correspondencias sin tendencia y el análisis de correspondencias canónico . Una extensión especial es el análisis de correspondencias múltiples , que puede considerarse la contraparte del análisis de componentes principales para datos categóricos. [ 76 ]
Análisis factorial

El análisis de componentes principales (ACP) crea variables que son combinaciones lineales de las variables originales. Las nuevas variables tienen la propiedad de ser todas ortogonales. La transformación ACP puede ser útil como paso previo al agrupamiento. El ACP es un enfoque centrado en la varianza que busca reproducir la varianza total de la variable, donde los componentes reflejan tanto la varianza común como la única de la variable. Generalmente, se prefiere el ACP para la reducción de datos (es decir, para transformar el espacio de variables en un espacio de factores óptimo), pero no cuando el objetivo es detectar el constructo latente o los factores.
El análisis factorial es similar al análisis de componentes principales, ya que también implica combinaciones lineales de variables. A diferencia del PCA, el análisis factorial es un enfoque centrado en la correlación que busca reproducir las intercorrelaciones entre variables, en las que los factores "representan la varianza común de las variables, excluyendo la varianza única". [ 77 ] En términos de la matriz de correlación, esto corresponde a centrarse en explicar los términos fuera de la diagonal (es decir, la covarianza compartida), mientras que el PCA se centra en explicar los términos que se encuentran en la diagonal. Sin embargo, como resultado secundario, al intentar reproducir los términos en la diagonal, el PCA también tiende a ajustarse relativamente bien a las correlaciones fuera de la diagonal. [ 13 ] : 158 Los resultados dados por el PCA y el análisis factorial son muy similares en la mayoría de las situaciones, pero no siempre es así, y hay algunos problemas en los que los resultados son significativamente diferentes. El análisis factorial se utiliza generalmente cuando el propósito de la investigación es detectar la estructura de los datos (es decir, constructos latentes o factores) o el modelado causal . Si el modelo factorial está formulado incorrectamente o no se cumplen los supuestos, el análisis factorial dará resultados erróneos. [ 78 ]
Agrupamiento K -means
Se ha afirmado que la solución relajada del agrupamiento k -medias , especificada por los indicadores de clúster, viene dada por los componentes principales, y el subespacio PCA generado por las direcciones principales es idéntico al subespacio del centroide del clúster. [ 79 ] [ 80 ] Sin embargo, que PCA sea una relajación útil del agrupamiento k -medias no era un resultado nuevo, [ 81 ] y es sencillo encontrar contraejemplos a la afirmación de que el subespacio del centroide del clúster está generado por las direcciones principales. [ 82 ]
Factorización de matrices no negativas

La factorización de matrices no negativas (NMF) es un método de reducción de dimensionalidad que utiliza únicamente elementos no negativos en las matrices, lo que lo convierte en un método prometedor en astronomía, [ 23 ] [ 24 ] [ 25 ] dado que las señales astrofísicas son no negativas. Los componentes del PCA son ortogonales entre sí, mientras que los componentes de la NMF son todos no negativos y, por lo tanto, construyen una base no ortogonal.
En PCA, la contribución de cada componente se clasifica en función de la magnitud de su valor propio correspondiente, que es equivalente a la varianza residual fraccionaria (FRV) en el análisis de datos empíricos. [ 21 ] Para NMF, sus componentes se clasifican en función únicamente de las curvas FRV empíricas. [ 25 ] Los gráficos de valores propios fraccionarios residuales, es decir,en función del número de componentesdado un total deLos componentes, para PCA tienen una meseta plana, donde no se capturan datos para eliminar el ruido cuasiestático, luego las curvas caen rápidamente como una indicación de sobreajuste (ruido aleatorio). [ 21 ] Las curvas FRV para NMF disminuyen continuamente [ 25 ] cuando los componentes NMF se construyen secuencialmente , [ 24 ] lo que indica la captura continua de ruido cuasiestático; luego convergen a niveles más altos que PCA, [ 25 ] lo que indica la propiedad de menor sobreajuste de NMF.
Iconografía de correlaciones
A menudo resulta difícil interpretar los componentes principales cuando los datos incluyen muchas variables de diversos orígenes o cuando algunas variables son cualitativas. Esto lleva al usuario del PCA a realizar una cuidadosa eliminación de varias variables. Si las observaciones o variables tienen un impacto excesivo en la dirección de los ejes, deben eliminarse y proyectarse como elementos suplementarios. Además, es necesario evitar interpretar las proximidades entre los puntos cercanos al centro del plano factorial.

Por el contrario, la iconografía de las correlaciones , que no es una proyección sobre un sistema de ejes, no presenta estos inconvenientes. Por lo tanto, podemos conservar todas las variables.
El principio del diagrama consiste en resaltar las correlaciones "notables" de la matriz de correlación mediante una línea continua (correlación positiva) o una línea punteada (correlación negativa).
Una correlación fuerte no es "notable" si no es directa, sino causada por el efecto de una tercera variable. Por el contrario, las correlaciones débiles sí pueden ser "notables". Por ejemplo, si una variable Y depende de varias variables independientes, las correlaciones de Y con cada una de ellas son débiles y, sin embargo, "notables".
Generalizaciones
PCA disperso
Una desventaja particular del PCA es que los componentes principales suelen ser combinaciones lineales de todas las variables de entrada. El PCA disperso supera esta desventaja al encontrar combinaciones lineales que contienen solo unas pocas variables de entrada. Extiende el método clásico de análisis de componentes principales (PCA) para la reducción de la dimensionalidad de los datos al agregar una restricción de dispersión a las variables de entrada. Se han propuesto varios enfoques, incluyendo:
- un marco de regresión, [ 83 ]
- un marco de relajación convexa/programación semidefinida, [ 84 ]
- un marco de método de potencia generalizado [ 85 ]
- un marco de maximización alternada [ 86 ]
- búsqueda voraz hacia adelante y hacia atrás y métodos exactos que utilizan técnicas de ramificación y acotación, [ 87 ]
- Marco de formulación bayesiana. [ 88 ]
Los desarrollos metodológicos y teóricos del PCA disperso, así como sus aplicaciones en estudios científicos, fueron revisados recientemente en un artículo de revisión. [ 89 ]
PCA no lineal

La mayoría de los métodos modernos para la reducción de dimensionalidad no lineal encuentran sus raíces teóricas y algorítmicas en PCA o K-means. La idea original de Pearson era tomar una línea recta (o plano) que sería "el mejor ajuste" a un conjunto de puntos de datos. Trevor Hastie amplió este concepto proponiendo curvas principales [ 93 ] como la extensión natural para la interpretación geométrica de PCA, que construye explícitamente una variedad para la aproximación de datos seguida de la proyección de los puntos sobre ella. Véase también el algoritmo de mapa elástico y el análisis geodésico principal . [ 94 ] Otra generalización popular es kernel PCA , que corresponde a PCA realizado en un espacio de Hilbert de núcleo reproductor asociado con un núcleo definido positivo.
En el aprendizaje de subespacios multilineales , [ 95 ] [ 96 ] [ 97 ] el PCA se generaliza al PCA multilineal (MPCA), que extrae características directamente de las representaciones tensoriales. El MPCA se resuelve realizando el PCA en cada modo del tensor de forma iterativa. El MPCA se ha aplicado al reconocimiento facial, al reconocimiento de la marcha, etc. El MPCA se extiende además al MPCA no correlacionado, al MPCA no negativo y al MPCA robusto.
El análisis de componentes principales N -direccional se puede realizar con modelos como la descomposición de Tucker , PARAFAC , el análisis de factores múltiples, el análisis de coinercia, STATIS y DISTATIS.
PCA robusto
Aunque el PCA encuentra el método matemáticamente óptimo (como al minimizar el error cuadrático), sigue siendo sensible a los valores atípicos en los datos que producen grandes errores, algo que el método intenta evitar desde el principio. Por lo tanto, es práctica común eliminar los valores atípicos antes de calcular el PCA. Sin embargo, en algunos contextos, los valores atípicos pueden ser difíciles de identificar. [ 98 ] Por ejemplo, en algoritmos de minería de datos como el clustering de correlación , la asignación de puntos a clústeres y valores atípicos no se conoce de antemano. Una generalización del PCA propuesta recientemente [ 99 ] basada en un PCA ponderado aumenta la robustez al asignar diferentes pesos a los objetos de datos según su relevancia estimada.
También se han propuesto variantes de PCA resistentes a valores atípicos, basadas en formulaciones de norma L1 ( L1-PCA ). [ 7 ] [ 5 ]
El análisis de componentes principales robusto (RPCA) mediante descomposición en matrices dispersas y de bajo rango es una modificación del PCA que funciona bien con respecto a observaciones muy corruptas. [ 100 ] [ 101 ] [ 102 ]
Técnicas similares
Análisis de componentes independientes
El análisis de componentes independientes (ICA) se centra en problemas similares a los del análisis de componentes principales, pero encuentra componentes separables de forma aditiva en lugar de aproximaciones sucesivas.
Análisis de componentes de red
Dada una matriz, intenta descomponerlo en dos matrices de tal manera que. Una diferencia clave con respecto a técnicas como PCA e ICA es que algunas de las entradas deestán restringidos a ser 0. AquíSe denomina capa reguladora. Si bien, en general, dicha descomposición puede tener múltiples soluciones, demuestran que si se cumplen las siguientes condiciones :
- tiene rango de columna completo
- Cada columna dedebe tener al menosceros dondees el número de columnas de(o alternativamente el número de filas de). La justificación de este criterio es que si se elimina un nodo de la capa reguladora junto con todos los nodos de salida conectados a él, el resultado aún debe caracterizarse por una matriz de conectividad con rango de columna completo.
- debe tener rango de fila completo.
entonces la descomposición es única salvo multiplicación por un escalar. [ 103 ]
Análisis discriminante de componentes principales
El análisis discriminante de componentes principales (DAPC) es un método multivariado utilizado para identificar y describir grupos de individuos genéticamente relacionados. La variación genética se divide en dos componentes: variación entre grupos y dentro de los grupos, y maximiza la primera. Los discriminantes lineales son combinaciones lineales de alelos que mejor separan los grupos. Por lo tanto, los alelos que más contribuyen a esta discriminación son aquellos que son más marcadamente diferentes entre grupos. Las contribuciones de los alelos a las agrupaciones identificadas por DAPC pueden permitir identificar regiones del genoma que impulsan la divergencia genética entre grupos [ 104 ]. En DAPC, los datos se transforman primero utilizando un análisis de componentes principales (PCA) y posteriormente se identifican los grupos utilizando un análisis discriminante (DA).
Un DAPC se puede implementar en R utilizando el paquete Adegenet. (más información: adegenet en la web )
Análisis de componentes direccionales
El análisis de componentes direccionales (DCA) es un método utilizado en las ciencias atmosféricas para analizar conjuntos de datos multivariados. [ 105 ] Al igual que el PCA, permite la reducción de dimensionalidad, una mejor visualización y una mejor interpretabilidad de grandes conjuntos de datos. También como el PCA, se basa en una matriz de covarianza derivada del conjunto de datos de entrada. La diferencia entre el PCA y el DCA es que el DCA requiere además la entrada de una dirección vectorial, denominada impacto. Mientras que el PCA maximiza la varianza explicada, el DCA maximiza la densidad de probabilidad dado el impacto. La motivación del DCA es encontrar componentes de un conjunto de datos multivariados que sean tanto probables (medidos mediante la densidad de probabilidad) como importantes (medidos mediante el impacto). El DCA se ha utilizado para encontrar los patrones de olas de calor más probables y más graves en conjuntos de predicción meteorológica, [ 106 ] y los cambios más probables y de mayor impacto en las precipitaciones debido al cambio climático. [ 107 ]
Software/código fuente
- ALGLIB : una biblioteca de C++ y C# que implementa PCA y PCA truncado.
- Analytica : la función integrada EigenDecomp calcula los componentes principales.
- ELKI – incluye PCA para proyección, incluyendo variantes robustas de PCA, así como algoritmos de agrupamiento basados en PCA .
- Gretl : el análisis de componentes principales se puede realizar mediante el
pcacomando o mediante laprincomp()función. - Julia – Admite PCA con la
pcafunción del paquete MultivariateStats. - KNIME – Un software de organización nodal basado en Java para análisis, en el que los nodos llamados PCA, PCA compute, PCA apply, PCA inverse lo hacen fácil.
- Maple (software) : El comando PCA se utiliza para realizar un análisis de componentes principales en un conjunto de datos.
- Mathematica : Implementa el análisis de componentes principales con el comando PrincipalComponents, utilizando métodos de covarianza y correlación.
- MathPHP – Biblioteca matemática para PHP con soporte para PCA.
- MATLAB – La función SVD forma parte del sistema básico. En Statistics Toolbox, las funciones
princompypca(R2012b) proporcionan los componentes principales, mientras que la funciónpcaresproporciona los residuos y la matriz reconstruida para una aproximación PCA de bajo rango. - Matplotlib : una biblioteca de Python que incluye un paquete PCA en el módulo .mlab.
- mlpack – Proporciona una implementación del análisis de componentes principales en C++ .
- mrmath : una biblioteca matemática de alto rendimiento para Delphi y FreePascal que puede realizar PCA, incluyendo variantes robustas.
- Biblioteca NAG : el análisis de componentes principales se implementa a través de la
g03aarutina (disponible en ambas versiones Fortran de la biblioteca). - NMath : biblioteca numérica propietaria que contiene PCA para .NET Framework .
- GNU Octave – Entorno de computación de software libre mayormente compatible con MATLAB, la función
princompproporciona el componente principal. - OpenCV
- Oracle Database 12c – Implementado mediante
DBMS_DATA_MINING.SVDS_SCORING_MODEla especificación del valor de configuraciónSVDS_SCORING_PCA. - Orange (software) : integra el análisis de componentes principales (PCA) en su entorno de programación visual. PCA muestra un gráfico de sedimentación (grado de varianza explicada) donde el usuario puede seleccionar interactivamente el número de componentes principales.
- Origen : Contiene PCA en su versión Pro.
- Qlucore : software comercial para el análisis de datos multivariados con respuesta instantánea mediante PCA.
- R – Paquete estadístico gratuito , las funciones
princompyprcompse pueden utilizar para el análisis de componentes principales;prcomputiliza la descomposición en valores singulares que generalmente proporciona una mayor precisión numérica. Algunos paquetes que implementan PCA en R incluyen, entre otros:ade4,vegan,ExPosition,dimRed, yFactoMineR. - SAS – Software propietario; por ejemplo, véase [ 108 ] .
- scikit-learn : biblioteca de Python para aprendizaje automático que contiene PCA, PCA probabilístico, PCA de kernel, PCA disperso y otras técnicas en el módulo de descomposición.
- Scilab – Paquete de cálculo numérico multiplataforma, gratuito y de código abierto; la función
princompcalcula el análisis de componentes principales; la funciónpcacalcula el análisis de componentes principales con variables estandarizadas. - SPSS : software propietario comúnmente utilizado por los científicos sociales para el análisis de componentes principales (PCA), el análisis factorial y el análisis de conglomerados asociado.
- Weka : biblioteca Java para aprendizaje automático que contiene módulos para el cálculo de componentes principales.
Véase también
- Análisis de correspondencias (para tablas de contingencia)
- Análisis de correspondencias múltiples (para variables cualitativas)
- Análisis factorial de datos mixtos (para variables cuantitativas y cualitativas)
- Correlación canónica
- Aproximación de matriz CUR (puede reemplazar la aproximación SVD de bajo rango)
- Análisis de correspondencia sin tendencia
- Análisis de componentes direccionales
- descomposición de modo dinámico
- Eigenface
- Algoritmo de expectativa-maximización
- Análisis factorial exploratorio (Wikiversidad)
- Código factorial
- Análisis de componentes principales funcionales
- Análisis de datos geométricos
- Análisis de componentes independientes
- PCA del núcleo
- Análisis de componentes principales con norma L1
- Aproximación de bajo rango
- Descomposición matricial
- Factorización de matrices no negativas
- Reducción de dimensionalidad no lineal
- El gobierno de Oja
- Modelo de distribución de puntos (PCA aplicado a la morfometría y la visión por computadora)
- Análisis de componentes principales (Wikibooks)
- regresión de componentes principales
- Análisis de espectro singular
- Descomposición en valores singulares
- PCA disperso
- Codificación de transformación
- mínimos cuadrados ponderados
Referencias
- ↑ Gewers, Felipe L.; Ferreira, Gustavo R.; Arruda, Henrique F. De; Silva, Filipi N.; Comín, César H.; Amancio, Diego R.; Costa, Luciano Da F. (24 de mayo de 2021). "Análisis de componentes principales: un enfoque natural para la exploración de datos" . Computación ACM. Sobrevivir . 54 (4): 70:1–70:34. arXiv : 1804.02502 . doi : 10.1145/3447755 .
- ↑ Jolliffe, Ian T.; Cadima, Jorge (13 de abril de 2016). "Análisis de componentes principales: una revisión y desarrollos recientes" . Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences . 374 (2065) 20150202. Bibcode : 2016RSPTA.37450202J . doi : 10.1098/rsta.2015.0202 . PMC 4792409. PMID 26953178 .
- ↑ Barnett, TP y R. Preisendorfer. (1987). "Orígenes y niveles de habilidad de pronóstico mensual y estacional para las temperaturas del aire superficial de los Estados Unidos determinados por análisis de correlación canónica" . Monthly Weather Review . 115 (9): 1825. Bibcode : 1987MWRv..115.1825B . doi : 10.1175/1520-0493(1987)115 < 1825:oaloma > 2.0.co ; 2 .
- ↑ Hsu, Daniel; Kakade, Sham M.; Zhang, Tong (2008). Un algoritmo espectral para el aprendizaje de modelos ocultos de Markov . arXiv : 0811.4413 . Bibcode : 2008arXiv0811.4413H .
- 1 2 Markopoulos, Panos P.; Kundu, Sandipan; Chamadia, Shubham; Pados, Dimitris A. (15 de agosto de 2017). "Análisis eficiente de componentes principales con norma L1 mediante inversión de bits". IEEE Transactions on Signal Processing . 65 (16): 4252– 4264. arXiv : 1610.01959 . Bibcode : 2017ITSP...65.4252M . doi : 10.1109/TSP.2017.2708023 . S2CID 7931130 .
- 1 2 Chachlakis, Dimitris G.; Prater-Bennette, Ashley; Markopoulos, Panos P. (22 de noviembre de 2019). "Descomposición del tensor de Tucker con norma L1" . IEEE Access . 7 : 178454–178465 . arXiv : 1904.06455 . Bibcode : 2019IEEEA...7q8454C . doi : 10.1109/ACCESS.2019.2955134 .
- 1 2 Markopoulos, Panos P.; Karystinos, George N.; Pados, Dimitris A. (octubre de 2014). "Algoritmos óptimos para el procesamiento de señales en subespacios L1". IEEE Transactions on Signal Processing . 62 (19): 5046– 5058. arXiv : 1405.6785 . Bibcode : 2014ITSP...62.5046M . doi : 10.1109/TSP.2014.2338077 . S2CID 1494171 .
- ↑ Zhan, J.; Vaswani, N. (2015). "PCA robusto con conocimiento parcial de subespacios". IEEE Transactions on Signal Processing . 63 (13): 3332– 3347. arXiv : 1403.1591 . Bibcode : 2015ITSP...63.3332Z . doi : 10.1109/tsp.2015.2421485 . S2CID 1516440 .
- ↑ Kanade, T.; Ke, Qifa (junio de 2005). "Factorización robusta de la norma L₁ en presencia de valores atípicos y datos faltantes mediante programación convexa alternativa". Conferencia de la Sociedad de Computación IEEE de 2005 sobre Visión por Computadora y Reconocimiento de Patrones (CVPR'05) . Vol. 1. IEEE. págs. 739–746 . CiteSeerX 10.1.1.63.4605 . doi : 10.1109/CVPR.2005.309 . ISBN 978-0-7695-2372-9. S2CID 17144854 .
- ↑ Pearson, K. (1901). "Sobre líneas y planos de ajuste más cercano a sistemas de puntos en el espacio" . Philosophical Magazine . 2 (11): 559– 572. doi : 10.1080/14786440109462720 . S2CID 125037489 .
- ↑ Hotelling, H. (1933). Análisis de un complejo de variables estadísticas en componentes principales. Journal of Educational Psychology , 24 , 417–441 y 498–520. Hotelling, H. (1936). "Relaciones entre dos conjuntos de variables". Biometrika . 28 (3/4): 321–377 . doi : 10.2307/2333955 . JSTOR 2333955 .
- ↑ Stewart, GW (1993). "Sobre la historia temprana de la descomposición en valores singulares" . SIAM Review . 35 (4): 551– 566. Bibcode : 1993SIAMR..35..551S . doi : 10.1137/1035134 . hdl : 1903/566 .
- 1 2 3 4 5 Jolliffe, IT (2002). Análisis de componentes principales . Springer Series in Statistics. Nueva York: Springer-Verlag. doi : 10.1007/b98835 . ISBN 978-0-387-95442-4.
- 1 2 3 4 Holmes, Mark H. (2023). Introducción a la computación científica y al análisis de datos . Textos en ciencia e ingeniería computacional (2.ª ed.). Springer. págs. 475–490 . ISBN 978-3-031-22429-4.
- ↑ Forkman J., Josse, J., Piepho, HP (2019). "Pruebas de hipótesis para el análisis de componentes principales cuando las variables están estandarizadas" . Journal of Agricultural, Biological, and Environmental Statistics . 24 (2): 289– 308. Bibcode : 2019JABES..24..289F . doi : 10.1007/s13253-019-00355-5 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Boyd, Stephen; Vandenberghe, Lieven (8 de marzo de 2004). Optimización convexa . Cambridge University Press. doi : 10.1017/cbo9780511804441 . ISBN 978-0-521-83378-3.
- ↑ Fukunaga, Keinosuke (1990). Introducción al reconocimiento estadístico de patrones . Elsevier. ISBN 978-0-12-269851-4.
- ↑ Alizadeh, Elaheh; Lyons, Samanthe M; Castle, Jordan M; Prasad, Ashok (2016). "Medición de cambios sistemáticos en la forma de células cancerosas invasivas mediante momentos de Zernike" . Integrative Biology . 8 (11): 1183– 1193. doi : 10.1039/C6IB00100A . PMID 27735002 .
- ↑ Leznik, M; Tofallis, C. 2005 Estimación de componentes principales invariantes mediante regresión diagonal.
- ↑ Jonathon Shlens, Un tutorial sobre análisis de componentes principales.
- 1 2 3 Soummer, Rémi; Pueyo, Laurent; Larkin, James (2012). "Detección y caracterización de exoplanetas y discos mediante proyecciones en autoimágenes de Karhunen-Loève". The Astrophysical Journal Letters . 755 (2): L28. arXiv : 1207.4197 . Bibcode : 2012ApJ...755L..28S . doi : 10.1088/2041-8205/755/2/L28 . S2CID 51088743 .
- ↑ Pueyo, Laurent (2016). "Detección y caracterización de exoplanetas mediante proyecciones en autoimágenes de Karhunen Loeve: modelado directo" . The Astrophysical Journal . 824 (2): 117. arXiv : 1604.06097 . Bibcode : 2016ApJ...824..117P . doi : 10.3847/0004-637X/824/2/117 . S2CID 118349503 .
- 1 2 Blanton, Michael R.; Roweis, Sam (2007). "Correcciones K y transformaciones de filtros en el ultravioleta, óptico e infrarrojo cercano". The Astronomical Journal . 133 (2): 734– 754. arXiv : astro-ph/0606170 . Bibcode : 2007AJ....133..734B . doi : 10.1086/510127 . S2CID 18561804 .
- 1 2 3 Zhu, Guangtun B. (2016-12-19). "Factorización de matrices no negativas (NMF) con incertidumbres heterocedásticas y datos faltantes". arXiv : 1612.06037 [ astro-ph.IM ].
- 1 2 3 4 5 6 Ren, Bin; Pueyo, Laurent; Zhu, Guangtun B.; Duchêne, Gaspard (2018). "Factorización de matrices no negativas: extracción robusta de estructuras extendidas" . The Astrophysical Journal . 852 (2): 104. arXiv : 1712.10317 . Bibcode : 2018ApJ...852..104R . doi : 10.3847/1538-4357/aaa1f2 . S2CID 3966513 .
- ↑ "¿Cuáles son las ventajas y desventajas del PCA?" . i2tutorials . 1 de septiembre de 2019 . Consultado el 4 de junio de 2021 .
- ↑ Abbott, Dean (mayo de 2014). Análisis predictivo aplicado . Wiley. ISBN 978-1-118-72796-6.
- 1 2 Jiang, Hong; Eskridge, Kent M. (2000). "Sesgo en el análisis de componentes principales debido a observaciones correlacionadas" . Conferencia sobre estadística aplicada en agricultura . doi : 10.4148/2475-7772.1247 . ISSN 2475-7772 .
- ↑ Linker, Ralph (marzo de 1988). "Autoorganización en una red perceptual". IEEE Computer . 21 (3): 105– 117. Bibcode : 1988Compr..21c.105L . doi : 10.1109/2.36 . S2CID 1527671 .
- ↑ Deco y Obradovic (1996). Un enfoque de la teoría de la información para la computación neuronal . Nueva York, NY: Springer. ISBN 978-1-4612-4016-7.
- ↑ Plumbley, Mark (1991). Teoría de la información y redes neuronales no supervisadas .Nota técnica
- ↑ Geiger, Bernhard; Kubin, Gernot (enero de 2013). "Mejora de la señal como minimización de la pérdida de información relevante". Actas de la Conferencia ITG sobre Sistemas, Comunicación y Codificación . arXiv : 1205.6935 . Bibcode : 2012arXiv1205.6935G .
- ↑ Consulta también el tutorial aquí.
- ↑ "Manual de Estadística para Ingeniería, Sección 6.5.5.2" . Consultado el 19 de enero de 2015 .
- ↑ AA Miranda, Y.-A. Le Borgne y G. Bontempi. Nuevas rutas desde el error mínimo de aproximación hasta los componentes principales , Volumen 27, Número 3 / Junio de 2008, Neural Processing Letters, Springer
- ↑ Abdi, H. y Williams, LJ (2010). "Análisis de componentes principales". Wiley Interdisciplinary Reviews: Computational Statistics . 2 (4): 433– 459. arXiv : 1108.4372 . doi : 10.1002/wics.101 . S2CID 122379222 .
- ↑ "Guía del usuario de SAS/STAT(R) 9.3" .
- ↑ Documentación de Matlab sobre la función eig
- ↑ "Sistema de reconocimiento facial basado en PCA" . www.mathworks.com . 19 de junio de 2023.
- ↑ Documentación de Mathematica sobre la función de valores propios
- ↑ Roweis, Sam. "Algoritmos EM para PCA y SPCA." Avances en sistemas de procesamiento de información neuronal. Editado por Michael I. Jordan, Michael J. Kearns y Sara A. Solla. The MIT Press, 1998.
- ↑ Geladi, Paul; Kowalski, Bruce (1986). "Regresión por mínimos cuadrados parciales: un tutorial". Analytica Chimica Acta . 185 : 1–17 . Bibcode : 1986AcAC..185....1G . doi : 10.1016/0003-2670(86)80028-9 .
- ↑ Kramer, R. (1998). Técnicas quimiométricas para el análisis cuantitativo . Nueva York: CRC Press. ISBN 978-0-203-90980-5.
- ↑ Andrecut, M. (2009). "Implementación paralela en GPU de algoritmos iterativos de PCA". Journal of Computational Biology . 16 (11): 1593– 1599. arXiv : 0811.1081 . doi : 10.1089/cmb.2008.0221 . PMID 19772385. S2CID 1362603 .
- ↑ Warmuth, MK; Kuzmin, D. (2008). "Algoritmos PCA en línea aleatorios con límites de arrepentimiento logarítmicos en la dimensión" (PDF) . Journal of Machine Learning Research . 9 : 2287–2320 .
- ^ Husson, Francois; Le, Sebastián; Pagès, Jérôme (25 de abril de 2017). Análisis exploratorio multivariado mediante ejemplo utilizando R (0 ed.). Chapman y Hall/CRC. doi : 10.1201/b21874 . ISBN 978-0-429-22543-7.
- ↑ Abdi, Hervé; Williams, Lynne J. (2010-07-15). "Análisis de componentes principales" . WIREs Computational Statistics . 2 (4): 433– 459. doi : 10.1002/wics.101 . ISSN 1939-5108 .
- ↑ Atkinson, Will (28 de abril de 2023). "Cartografiando campos y espacios cuantitativamente: del análisis de correspondencias múltiples al análisis de componentes principales categóricos" . Quality & Quantity . 58 (1): 829–848 . doi : 10.1007/s11135-023-01669-w . hdl : 1983/7cbbf631-d50e-477e-8904-4e30f85b4bed . ISSN 0033-5177 .
- ^ Husson, François; José, Julie; Saporta, Gilbert (12 de septiembre de 2016). "Jan de Leeuw y la Escuela Francesa de Análisis de Datos" . Revista de software estadístico . 73 : 1– 18. doi : 10.18637/jss.v073.i06 . ISSN 1548-7660 .
- ↑ Lebart, Ludovic; Morineau, Alain; Warwick, Kenneth M. (1984). Análisis estadístico descriptivo multivariante: análisis de correspondencias y técnicas relacionadas para matrices grandes . Wiley. ISBN 978-0-471-86743-2.
- ^ Lebart, Ludovic; Morineau, Alain; Pirón, Marie (1995). Estadística exploratoria multidimensional . París: Dunod. ISBN 978-2-10-002886-3.
- ↑ Lê, Sébastien; José, Julie; Husson, François (18 de marzo de 2008). "FactoMineR: un paquete R para análisis multivariado" . Revista de software estadístico . 25 : 1– 18. doi : 10.18637/jss.v025.i01 . ISSN 1548-7660 .
- ↑ Kaplan, RM, & Saccuzzo, DP (2010). Pruebas psicológicas: principios, aplicaciones y cuestiones. (8.ª ed.). Belmont, CA: Wadsworth, Cengage Learning.
- ↑ Shevky, Eshref; Williams, Marilyn (1949). Las áreas sociales de Los Ángeles: análisis y tipología . University of California Press.
- ↑ Flood, J (2000). Sydney dividida: una revisión de la ecología factorial. Ponencia presentada en la Conferencia de la APA 2000, Melbourne, noviembre, y en la 24.ª Conferencia de la ANZRSAI, Hobart, diciembre de 2000.
- ↑ "Índices socioeconómicos por áreas" . Oficina Australiana de Estadística . 2011. Consultado el 5 de mayo de 2022 .
- ^ Schamberger, Tamara; Schuberth, Florián; Henseler, Jörg (2023). "Análisis compuesto confirmatorio en la investigación del desarrollo humano". Revista internacional de desarrollo del comportamiento . 47 (1): 88– 100. doi : 10.1177/01650254221117506 . hdl : 10362/143639 .
- ↑ Informes sobre Desarrollo Humano. "Índice de Desarrollo Humano" . Programa de las Naciones Unidas para el Desarrollo . Consultado el 6 de mayo de 2022 .
- ↑ Novembre, John; Stephens, Matthew (2008). "Interpretación de análisis de componentes principales de variación genética poblacional espacial" . Nat Genet . 40 (5): 646– 49. doi : 10.1038/ng.139 . PMC 3989108. PMID 18425127 .
- ↑ Elhaik, Eran (2022). "Los hallazgos basados en análisis de componentes principales (PCA) en estudios de genética de poblaciones están altamente sesgados y deben reevaluarse" . Scientific Reports . 12 (1) 14683. Bibcode : 2022NatSR..1214683E . doi : 10.1038 / s41598-022-14395-4 . PMC 9424212. PMID 36038559. S2CID 251932226 .
- ↑ DeSarbo, Wayne; Hausmann, Robert; Kukitz, Jeffrey (2007). "Análisis de componentes principales restringido para la investigación de marketing" . Journal of Marketing in Management . 2 : 305–328 – vía ResearchGate.
- ↑ Dutton, William H; Blank, Grant (2013). Culturas de Internet: Internet en Gran Bretaña (PDF) . Oxford Internet Institute. pág. 6.
- ↑ Flood, Joe (2008). "Análisis multinomial para la encuesta de trayectorias profesionales en el sector de la vivienda" . Ponencia presentada en la Conferencia de la Red Europea de Investigación sobre la Vivienda, Dublín . Recuperado el 6 de mayo de 2022 .
- 1 2 Véase el cap. 9 en Michael B. Miller (2013). Matemáticas y estadística para la gestión del riesgo financiero , 2.ª edición. Wiley ISBN 978-1-118-75029-2
- 1 2 §9.7 en John Hull (2018). Gestión de riesgos e instituciones financieras, 5.ª edición. Wiley. ISBN 1119448115
- ↑ §III.A.3.7.2 en Carol Alexander y Elizabeth Sheedy, eds. (2004). The Professional Risk Managers' Handbook . PRMIA . ISBN 978-0976609704
- ↑ ejemplo de descomposición , John Hull
- ↑ Libin Yang. Una aplicación del análisis de componentes principales a la gestión de carteras de acciones . Departamento de Economía y Finanzas, Universidad de Canterbury , enero de 2015.
- ↑ Giorgia Pasini (2017); Análisis de componentes principales para la gestión de carteras de acciones . Revista Internacional de Matemáticas Puras y Aplicadas . Volumen 115, n.º 1, 2017, 153-167.
- 1 2 Véase el cap. 25 § «Pruebas de escenarios mediante análisis de componentes principales» en Li Ong (2014). «Guía de métodos y modelos de pruebas de estrés del FMI» , Fondo Monetario Internacional
- ↑ Chapin, John; Nicolelis, Miguel (1999). "Análisis de componentes principales de la actividad de conjuntos neuronales revela representaciones somatosensoriales multidimensionales". Journal of Neuroscience Methods . 94 (1): 121– 140. doi : 10.1016/S0165-0270(99)00130-2 . PMID 10638820. S2CID 17786731 .
- ^ Brenner, N., Bialek, W. y de Ruyter van Steveninck, RR (2000).
- ↑ Jirsa, Victor; Friedrich, R; Haken, Herman; Kelso, Scott (1994). "Un modelo teórico de transiciones de fase en el cerebro humano". Biological Cybernetics . 71 (1): 27– 35. doi : 10.1007/bf00198909 . PMID 8054384 . S2CID 5155075 .
- ^ Benzécri, J.-P. (1973). L'Analyse des Données. Volumen II. L'Analyse des Correspondances . París, Francia: Dunod.
- ↑ Greenacre, Michael (1983). Teoría y aplicaciones del análisis de correspondencias . Londres: Academic Press. ISBN 978-0-12-299050-2.
- ↑ Le Roux; Brigitte y Henry Rouanet (2004). Análisis geométrico de datos, del análisis de correspondencias al análisis de datos estructurados . Dordrecht: Kluwer. ISBN 978-1-4020-2235-7.
- ↑ Timothy A. Brown. Análisis factorial confirmatorio para la metodología de investigación aplicada en las ciencias sociales . Guilford Press, 2006.
- ↑ Meglen, RR (1991). "Examen de grandes bases de datos: un enfoque quimiométrico mediante análisis de componentes principales". Journal of Chemometrics . 5 (3): 163– 179. doi : 10.1002/cem.1180050305 . S2CID 120886184 .
- ↑ H. Zha; C. Ding; M. Gu; X. He; HD Simon (dic. 2001). "Relajación espectral para agrupamiento K-means" (PDF) . Neural Information Processing Systems Vol. 14 (NIPS 2001) : 1057–1064 .
- ↑ Chris Ding; Xiaofeng He (julio de 2004). "Agrupamiento K-means mediante análisis de componentes principales" (PDF) . Actas de la Conferencia Internacional sobre Aprendizaje Automático (ICML 2004) : 225–232 .
- ↑ Drineas, P.; A. Frieze; R. Kannan; S. Vempala; V. Vinay (2004). "Agrupamiento de grafos grandes mediante la descomposición en valores singulares" (PDF) . Machine Learning . 56 ( 1–3 ): 9–33 . Bibcode : 2004MLear..56....9D . doi : 10.1023/b:mach.0000033113.59016.96 . S2CID 5892850. Recuperado el 2 de agosto de 2012 .
- ↑ Cohen, M.; S. Elder; C. Musco; C. Musco; M. Persu (2014). Reducción de dimensionalidad para agrupamiento k-means y aproximación de rango bajo (Apéndice B) . arXiv : 1410.6801 . Bibcode : 2014arXiv1410.6801C .
- ↑ Hui Zou; Trevor Hastie; Robert Tibshirani (2006). "Análisis de componentes principales dispersos" (PDF) . Journal of Computational and Graphical Statistics . 15 (2): 262– 286. CiteSeerX 10.1.1.62.580 . doi : 10.1198/106186006x113430 . S2CID 5730904 .
- ↑ Alexandre d'Aspremont; Laurent El Ghaoui; Michael I. Jordan; Gert RG Lanckriet (2007). "Una formulación directa para PCA dispersa usando programación semidefinida" (PDF) . SIAM Review . 49 (3): 434– 448. arXiv : cs/0406021 . Bibcode : 2007SIAMR..49..434D . doi : 10.1137/050645506 . S2CID 5490061 .
- ↑ Michel Journee; Yurii Nesterov; Peter Richtarik; Rodolphe Sepulchre (2010). "Método de potencia generalizado para el análisis de componentes principales dispersos" (PDF) . Journal of Machine Learning Research . 11 : 517–553 . arXiv : 0811.4724 . Bibcode : 2008arXiv0811.4724J . CORE Discussion Paper 2008/70.
- ↑ Peter Richtarik; Martin Takac; S. Damla Ahipasaoglu (2012). "Alternating Maximization: Unifying Framework for 8 Sparse PCA Formulations and Efficient Parallel Codes". arXiv : 1212.4137 [ stat.ML ].
- ↑ Baback Moghaddam; Yair Weiss; Shai Avidan (2005). "Límites espectrales para PCA dispersa: algoritmos exactos y voraces" (PDF) . Avances en sistemas de procesamiento de información neuronal . Vol. 18. MIT Press.
- ↑ Yue Guan; Jennifer Dy (2009). "Análisis de componentes principales probabilístico disperso" (PDF) . Actas del taller y conferencia de la revista Journal of Machine Learning Research . 5 : 185.
- ↑ Hui Zou; Lingzhou Xue (2018). "Una visión general selectiva del análisis de componentes principales dispersos" . Actas del IEEE . 106 (8): 1311– 1320. doi : 10.1109/JPROC.2018.2846588 .
- ↑ AN Gorban , AY Zinovyev, "Grafos principales y variedades" , En: Manual de investigación sobre aplicaciones y tendencias del aprendizaje automático: algoritmos, métodos y técnicas , Olivas ES et al Eds. Information Science Reference, IGI Global: Hershey, PA, EE. UU., 2009. 28–59.
- ^ Wang, Y.; Klijn, JG; Zhang, Y.; Sieuwerts, AM; Mire, diputado; Yang, F.; Talántov, D.; Timmermans, M.; Meijer-van Gelder, ME; Yu, J.; et al. (2005). "Perfiles de expresión genética para predecir metástasis a distancia de cáncer de mama primario con ganglios linfáticos negativos". La Lanceta . 365 (9460): 671– 679. doi : 10.1016/S0140-6736(05)17947-1 . PMID 15721472 . S2CID 16358549 . Datos en línea
- ↑ Zinovyev, A. "ViDaExpert – Herramienta de visualización de datos multidimensionales" . Instituto Curie . París.(Gratis para uso no comercial)
- ↑ Hastie, T. ; Stuetzle, W. (junio de 1989). "Curvas principales" (PDF) . Journal of the American Statistical Association . 84 (406): 502– 506. Bibcode : 1989JASA...84..502H . doi : 10.1080/01621459.1989.10478797 .
- ↑ AN Gorban, B. Kegl, DC Wunsch, A. Zinovyev (Eds.), Principal Manifolds for Data Visualisation and Dimension Reduction , LNCSE 58, Springer, Berlín – Heidelberg – Nueva York, 2007. ISBN 978-3-540-73749-0
- ↑ Vasilescu, MAO; Terzopoulos, D. (2003). Análisis de subespacios multilineales de conjuntos de imágenes (PDF) . Actas de la Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones (CVPR'03). Madison, WI.
- ↑ Vasilescu, MAO; Terzopoulos, D. (2002). Análisis multilineal de conjuntos de imágenes: TensorFaces (PDF) . Lecture Notes in Computer Science 2350; (Presentado en las Actas de la 7.ª Conferencia Europea sobre Visión por Computadora (ECCV'02), Copenhague, Dinamarca). Springer, Berlín, Heidelberg. doi : 10.1007/3-540-47969-4_30 . ISBN 978-3-540-43745-1.
- ↑ Vasilescu, MAO; Terzopoulos, D. (junio de 2005). Análisis de componentes independientes multilineales (PDF) . Actas de la Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones (CVPR'05). Vol. 1. San Diego, CA. págs. 547–553 .
- ↑ Kirill Simonov, Fedor V. Fomin, Petr A. Golovach, Fahad Panolan (9-15 de junio de 2019). "Complejidad refinada de PCA con valores atípicos" . En Kamalika Chaudhuri, Ruslan Salakhutdinov (eds.). Actas de la 36.ª Conferencia Internacional sobre Aprendizaje Automático (ICML 2019) . Vol. 97. Long Beach, California, EE. UU.: PMLR. págs. 5818-5826 .
{{cite conference}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Kriegel, HP; Kröger, P.; Schubert, E.; Zimek, A. (2008). "Un marco general para aumentar la robustez de los algoritmos de agrupamiento por correlación basados en PCA". Gestión de bases de datos científicas y estadísticas . Notas de clase en informática. Vol. 5069. págs. 418–435 . CiteSeerX 10.1.1.144.4864 . doi : 10.1007/978-3-540-69497-7_27 . ISBN 978-3-540-69476-2.
- ↑ Emmanuel J. Candes; Xiaodong Li; Yi Ma; John Wright (2011). "¿Análisis de componentes principales robusto?". Journal of the ACM . 58 (3): 11. arXiv : 0912.3599 . doi : 10.1145/1970392.1970395 . S2CID 7128002 .
- ↑ T. Bouwmans; E. Zahzah (2014). "PCA robusto mediante búsqueda de componentes principales: una revisión para una evaluación comparativa en videovigilancia". Visión por computadora y comprensión de imágenes . 122 : 22–34 . Bibcode : 2014CVIU..122...22B . doi : 10.1016/j.cviu.2013.11.009 .
- ↑ T. Bouwmans; A. Sobral; S. Javed; S. Jung; E. Zahzah (2015). "Descomposición en matrices aditivas de bajo rango para la separación de fondo/primer plano: una revisión para una evaluación comparativa con un conjunto de datos a gran escala". Computer Science Review . 23 : 1–71 . arXiv : 1511.01245 . Bibcode : 2015arXiv151101245B . doi : 10.1016/j.cosrev.2016.11.001 . S2CID 10420698 .
- ↑ Liao, JC; Boscolo, R.; Yang, Y.-L.; Tran, LM; Sabatti, C. ; Roychowdhury, VP (2003). "Análisis de componentes de red: Reconstrucción de señales reguladoras en sistemas biológicos" . Actas de la Academia Nacional de Ciencias . 100 (26): 15522– 15527. Bibcode : 2003PNAS..10015522L . doi : 10.1073 / pnas.2136632100 . PMC 307600. PMID 14673099 .
- ↑ Liao, T.; Jombart, S.; Devillard, F.; Balloux (2010). "Análisis discriminante de componentes principales: un nuevo método para el análisis de poblaciones genéticamente estructuradas" . BMC Genetics . 11:11:94 . doi : 10.1186/1471-2156-11-94 . PMC 2973851. PMID 20950446 .
- ↑ Jewson, S. (2020). "Una alternativa al PCA para estimar patrones dominantes de variabilidad climática y extremos, con aplicación a las precipitaciones estacionales de EE. UU. y China" . Atmosphere . 11 (4): 354. Bibcode : 2020Atmos..11..354J . doi : 10.3390/atmos11040354 .
- ↑ Scher, S.; Jewson, S.; Messori, G. (2021). "Escenarios robustos en el peor de los casos a partir de pronósticos de conjunto" . Weather and Forecasting . 36 (4): 1357– 1373. Bibcode : 2021WtFor..36.1357S . doi : 10.1175/WAF-D-20-0219.1 . S2CID 236300040 .
- ↑ Jewson, S.; Messori, G.; Barbato, G.; Mercogliano, P.; Mysiak, J.; Sassi, M. (2022). "Desarrollo de escenarios de impacto representativos a partir de conjuntos de proyecciones climáticas, con aplicación a UKCP18 y la precipitación de EURO-CORDEX" . Journal of Advances in Modeling Earth Systems . 15 (1) e2022MS003038. doi : 10.1029/2022MS003038 . S2CID 254965361 .
- ↑ "Análisis de componentes principales" . Instituto de Investigación y Educación Digital . UCLA . Consultado el 29 de mayo de 2018 .
Lecturas adicionales
- Jackson, JE (1991). Guía del usuario de componentes principales (Wiley).
- Jolliffe, IT (1986). Análisis de componentes principales . Springer Series in Statistics. Springer-Verlag. pp. 487. CiteSeerX 10.1.1.149.8828 . doi : 10.1007/b98835 . ISBN 978-0-387-95442-4.
- Jolliffe, IT (2002). Análisis de componentes principales . Springer Series in Statistics. Nueva York: Springer-Verlag. doi : 10.1007/b98835 . ISBN 978-0-387-95442-4.
- Husson François, Lê Sébastien y Pagès Jérôme (2009). Análisis exploratorio multivariado mediante ejemplo utilizando R. Chapman & Hall/CRC The R Series, Londres. 224p. ISBN 978-2-7535-0938-2
- Pagès Jérôme (2014). Análisis factorial múltiple mediante ejemplos con R. Chapman & Hall/CRC The R Series, Londres, 272 págs.
Enlaces externos
- Vídeo de la Universidad de Copenhague realizado por Rasmus Bro en YouTube.
- Vídeo de la Universidad de Stanford de Andrew Ng en YouTube
- Tutorial sobre análisis de componentes principales
- Introducción al análisis de componentes principales para principiantes en YouTube (un vídeo de menos de 100 segundos).
- StatQuest: Análisis de componentes principales (PCA), paso a paso en YouTube
- Explicación sencilla para comprender el análisis de componentes principales, los vectores propios y los valores propios en Stack Overflow.
- Véase también la lista de implementaciones de software.
- Descomposiciones matriciales
- Reducción de dimensiones