La estadística multivariante es una subdivisión de la estadística que abarca la observación y el análisis simultáneos de más de una variable de resultado , es decir, variables aleatorias multivariantes . La estadística multivariante se centra en comprender los diferentes objetivos y fundamentos de cada una de las distintas formas de análisis multivariante, así como su interrelación. La aplicación práctica de la estadística multivariante a un problema concreto puede implicar diversos tipos de análisis univariantes y multivariantes para comprender las relaciones entre las variables y su relevancia para el problema en estudio.
Además, la estadística multivariante se ocupa de las distribuciones de probabilidad multivariantes , en términos de ambos
- cómo se pueden utilizar para representar las distribuciones de los datos observados;
- cómo pueden utilizarse como parte de la inferencia estadística , en particular cuando varias cantidades diferentes son de interés para el mismo análisis.
Ciertos tipos de problemas que involucran datos multivariados, por ejemplo la regresión lineal simple y la regresión múltiple , no suelen considerarse casos especiales de estadística multivariada porque el análisis se aborda considerando la distribución condicional (univariada) de una sola variable de resultado dadas las otras variables.
Análisis multivariado
El análisis multivariado ( AMV ) se basa en los principios de la estadística multivariada. Típicamente, el AMV se utiliza para abordar situaciones en las que se realizan múltiples mediciones en cada unidad experimental y las relaciones entre estas mediciones y sus estructuras son importantes. [ 1 ] Una categorización moderna y superpuesta del AMV incluye: [ 1 ]
- Modelos multivariados normales y generales y teoría de la distribución
- El estudio y la medición de las relaciones
- Cálculos de probabilidad de regiones multidimensionales
- La exploración de estructuras y patrones de datos
El análisis multivariante puede complicarse por el deseo de incluir análisis basados en la física para calcular los efectos de las variables en un "sistema de sistemas" jerárquico. A menudo, los estudios que pretenden utilizar el análisis multivariante se ven obstaculizados por la dimensionalidad del problema. Estas dificultades suelen mitigarse mediante el uso de modelos sustitutos , aproximaciones de alta precisión del código basado en la física. Dado que los modelos sustitutos adoptan la forma de una ecuación, pueden evaluarse con gran rapidez. Esto facilita los estudios de análisis multivariante a gran escala: si bien una simulación de Monte Carlo en todo el espacio de diseño es difícil con códigos basados en la física, resulta trivial al evaluar modelos sustitutos, que suelen adoptar la forma de ecuaciones de superficie de respuesta .
Tipos de análisis
En el análisis multivariante (AMV) se utilizan muchos modelos diferentes, cada uno con su propio tipo de análisis:
- El análisis multivariado de varianza (MANOVA) extiende el análisis de varianza para abarcar casos en los que hay más de una variable dependiente que analizar simultáneamente; véase también el análisis multivariado de covarianza (MANCOVA).
- La regresión multivariante intenta determinar una fórmula que describa cómo los elementos de un vector de variables responden simultáneamente a los cambios en otras. Para relaciones lineales, los análisis de regresión aquí presentados se basan en formas del modelo lineal general . Algunos sugieren que la regresión multivariante es distinta de la regresión multivariante; sin embargo, esto es objeto de debate y no es una verdad absoluta en todos los campos científicos. [ 2 ]
- El análisis de componentes principales (ACP) crea un nuevo conjunto de variables ortogonales que contienen la misma información que el conjunto original. Rota los ejes de variación para obtener un nuevo conjunto de ejes ortogonales, ordenados de manera que resuman proporciones decrecientes de la variación.
- El análisis factorial es similar al análisis de componentes principales (ACP), pero permite extraer un número específico de variables sintéticas, menor que el conjunto original, dejando la variación restante sin explicar como error. Las variables extraídas se conocen como variables latentes o factores; se supone que cada una explica la covariación en un grupo de variables observadas.
- El análisis de correlación canónica encuentra relaciones lineales entre dos conjuntos de variables; es la versión generalizada (es decir, canónica) de la correlación bivariada [ 3 ] .
- El análisis de redundancia [ 4 ] (RDA) es similar al análisis de correlación canónica, pero permite al usuario derivar un número específico de variables sintéticas a partir de un conjunto de variables (independientes) que expliquen la mayor varianza posible en otro conjunto (independiente). Es un análogo multivariado de la regresión . [ 5 ]
- El análisis de correspondencias (AC), o promedio recíproco, encuentra (al igual que el PCA) un conjunto de variables sintéticas que resumen el conjunto original. El modelo subyacente asume disimilitudes de chi-cuadrado entre los registros (casos).
- Análisis de correspondencia canónica (o "restringida") (CCA) para resumir la variación conjunta en dos conjuntos de variables (similar al análisis de redundancia); combinación de análisis de correspondencia y análisis de regresión multivariante. El modelo subyacente asume disimilitudes de chi-cuadrado entre registros (casos).
- El escalamiento multidimensional comprende varios algoritmos para determinar un conjunto de variables sintéticas que representen mejor las distancias entre pares de registros. El método original es el análisis de coordenadas principales (PCoA; basado en PCA).
- El análisis discriminante , o análisis de variables canónicas, intenta determinar si un conjunto de variables puede utilizarse para distinguir entre dos o más grupos de casos.
- El análisis discriminante lineal (LDA) calcula un predictor lineal a partir de dos conjuntos de datos con distribución normal para permitir la clasificación de nuevas observaciones.
- Los sistemas de agrupamiento clasifican los objetos en grupos (denominados clústeres) de manera que los objetos (casos) del mismo clúster sean más similares entre sí que los objetos de clústeres diferentes.
- La partición recursiva crea un árbol de decisión que intenta clasificar correctamente a los miembros de la población basándose en una variable dependiente dicotómica.
- Las redes neuronales artificiales extienden los métodos de regresión y agrupamiento a modelos multivariados no lineales.
- Se pueden utilizar gráficos estadísticos, como recorridos, diagramas de coordenadas paralelas y matrices de diagramas de dispersión, para explorar datos multivariados.
- Los modelos de ecuaciones simultáneas implican más de una ecuación de regresión, con diferentes variables dependientes, que se estiman conjuntamente.
- La autorregresión vectorial implica regresiones simultáneas de varias variables de series temporales sobre sus propios valores rezagados y sobre los de las demás.
- El análisis de curvas de respuesta principal (PRC) es un método basado en RDA que permite al usuario centrarse en los efectos del tratamiento a lo largo del tiempo corrigiendo los cambios en los tratamientos de control a lo largo del tiempo. [ 6 ]
- La iconografía de las correlaciones consiste en sustituir una matriz de correlación por un diagrama donde las correlaciones "destacadas" están representadas por una línea continua (correlación positiva) o una línea punteada (correlación negativa).
Cómo tratar con datos incompletos
Es muy común que en un conjunto de datos adquiridos experimentalmente falten valores de algunos componentes de un punto de datos determinado . En lugar de descartar el punto de datos completo, es común "completar" los valores de los componentes faltantes, un proceso llamado " imputación ". [ 7 ]
Distribuciones de probabilidad importantes
Existe un conjunto de distribuciones de probabilidad utilizadas en análisis multivariados que desempeñan un papel similar al del conjunto correspondiente de distribuciones utilizadas en análisis univariados cuando la distribución normal es apropiada para un conjunto de datos. Estas distribuciones multivariadas son:
La distribución inversa de Wishart es importante en la inferencia bayesiana , por ejemplo, en la regresión lineal multivariante bayesiana . Además, la distribución T-cuadrada de Hotelling es una distribución multivariante que generaliza la distribución t de Student y se utiliza en pruebas de hipótesis multivariantes .
Historia
CR Rao realizó importantes contribuciones a la teoría estadística multivariante a lo largo de su carrera, particularmente a mediados del siglo XX. Una de sus obras clave es el libro titulado "Métodos estadísticos avanzados en la investigación biométrica", publicado en 1952. Esta obra sentó las bases de muchos conceptos en estadística multivariante. [ 8 ] El libro de texto de Anderson de 1958, "Una introducción al análisis estadístico multivariante" , [ 9 ] formó a una generación de teóricos y estadísticos aplicados; el libro de Anderson enfatiza la prueba de hipótesis mediante pruebas de razón de verosimilitud y las propiedades de las funciones de potencia : admisibilidad , insesgadez y monotonicidad . [ 10 ] [ 11 ]
Anteriormente, el análisis multivariante (AMV) se discutía exclusivamente en el contexto de las teorías estadísticas, debido al tamaño y la complejidad de los conjuntos de datos subyacentes y su elevado consumo computacional. Con el notable aumento de la capacidad de cálculo, el AMV desempeña ahora un papel cada vez más importante en el análisis de datos y tiene una amplia aplicación en los campos ómicos .
Aplicaciones
- Prueba de hipótesis multivariante
- Reducción de dimensionalidad
- Descubrimiento de estructuras latentes [ 12 ]
- Agrupamiento
- Análisis de regresión multivariante [ 13 ]
- Análisis de clasificación y discriminación
- Selección de variables
- Análisis multidimensional
- Escalamiento multidimensional
- minería de datos
Software y herramientas
Existe una enorme cantidad de paquetes de software y otras herramientas para el análisis multivariado, entre las que se incluyen:
- JMP (software estadístico)
- MiniTab
- Cálculo
- PSPP
- R [ 14 ]
- SAS (software)
- SciPy para Python
- SPSS
- Stata
- ESTADÍSTICA
- El descifrador
- WarpPLS
- SmartPLS
- MATLAB
- Eviews
- El software estadístico NCSS incluye análisis multivariante.
- El Unscrambler® X es una herramienta de análisis multivariante.
- SIMCA
- DataPandit (Aplicaciones SaaS gratuitas de Let's Excel Analytics Solutions )
Véase también
- Estimación de matrices de covarianza
- Publicaciones importantes en análisis multivariante
- Pruebas multivariantes en marketing
- Análisis de datos estructurados (estadística)
- Modelado de ecuaciones estructurales
- coeficiente RV
- Análisis bivariado
- Diseño de experimentos (DoE)
- Análisis dimensional
- Análisis exploratorio de datos
- MCO
- Regresión de mínimos cuadrados parciales
- Reconocimiento de patrones
- Análisis de componentes principales (ACP)
- Análisis de regresión
- Modelado suave e independiente de analogías de clases (SIMCA)
- Interferencia estadística
- Análisis univariado
Referencias
- 1 2 Olkin, I.; Sampson, AR (2001-01-01), "Análisis multivariante: descripción general" , en Smelser, Neil J.; Baltes, Paul B. (eds.), Enciclopedia internacional de las ciencias sociales y del comportamiento , Pergamon, pp. 10240–10247 , ISBN 978-0-08-043076-8, consultado el 2 de septiembre de 2019
- ↑ Hidalgo, B; Goodman, M (2013). "¿Regresión multivariante o multivariable?" . Am J Public Health . 103 (1): 39– 40. doi : 10.2105/AJPH.2012.300897 . PMC 3518362 . PMID 23153131 .
- ↑ Los analistas no sofisticados de problemas gaussianos bivariados pueden encontrar útil un método crudo pero preciso para medir con precisión la probabilidad simplemente tomando la suma S de los cuadrados de los N residuos, restando la suma Sm en el mínimo, dividiendo esta diferencia por Sm , multiplicando el resultado por ( N - 2) y tomando el inverso del antilonar de la mitad de ese producto.
- ↑ Serie, desarrollada y mantenida por los colaboradores del taller QCBS R. Capítulo 6 Análisis de redundancia | Taller 10: Análisis multivariante avanzado en R.
{{cite book}}:|first=tiene nombre genérico ( ayuda ) - ↑ Van Den Wollenberg, Arnold L. (1977). "Análisis de redundancia: una alternativa al análisis de correlación canónica". Psychometrika . 42 (2): 207– 219. doi : 10.1007/BF02294050 .
- ↑ ter Braak, Cajo JF y Šmilauer, Petr (2012). Manual de referencia y guía del usuario de Canoco: software para ordenación (versión 5.0) , pág. 292. Microcomputer Power, Ithaca, NY.
- ↑ JL Schafer (1997). Análisis de datos multivariados incompletos . Chapman & Hall/CRC. ISBN 978-1-4398-2186-2.
- ↑ Dasgupta, Anirban (2024). "CR Rao: Científico estadístico supremo (1920 a 2023)" . Actas de la Academia Nacional de Ciencias . 121 ( 9) e2321318121. Bibcode : 2024PNAS..12121318D . doi : 10.1073/pnas.2321318121 . PMC 10907269. PMID 38377193 .
- ↑ TW Anderson (1958) Introducción al análisis multivariante , Nueva York: Wiley ISBN 0471026409; 2e (1984) ISBN 0471889873; 3e (2003) ISBN 0471360910
- ↑ Sen, Pranab Kumar ; Anderson, TW; Arnold, SF; Eaton, ML; Giri, NC; Gnanadesikan, R.; Kendall, MG; Kshirsagar, AM; et al. (junio de 1986). "Revisión: Libros de texto contemporáneos sobre análisis estadístico multivariante: una evaluación panorámica y crítica". Journal of the American Statistical Association . 81 (394): 560– 564. doi : 10.2307/2289251 . ISSN 0162-1459 . JSTOR 2289251 . (Páginas 560–561)
- ↑ Schervish, Mark J. (noviembre de 1987). "Una revisión del análisis multivariado" . Statistical Science . 2 (4): 396– 413. Bibcode : 1987StaSc...213111S . doi : 10.1214/ss/1177013111 . ISSN 0883-4237 . JSTOR 2245530 .
- ↑ Huang, Biwei; Low, Charles Jia Han; Xie, Feng; Glymour, Clark; Zhang, Kun (2022-10-01). "Descubrimiento de la estructura causal jerárquica latente con restricciones de rango". arXiv : 2210.01798v1 [ cs.LG ].
- ↑ "Análisis de regresión multivariante | Ejemplos de análisis de datos con Stata" . stats.oarc.ucla.edu . Consultado el 9 de junio de 2025 .
- ↑ CRAN tiene detalles sobre los paquetes disponibles para el análisis de datos multivariados.
Lecturas adicionales
- Johnson, Richard A.; Wichern, Dean W. (2007). Análisis estadístico multivariante aplicado (Sexta ed.). Prentice Hall. ISBN 978-0-13-187715-3.
- KV Mardia ; JT Kent; JM Bibby (1979). Análisis multivariante . Academic Press. ISBN 0-12-471252-5.
- A. Sen, M. Srivastava, Análisis de regresión : teoría, métodos y aplicaciones , Springer-Verlag, Berlín, 2011 (4.ª edición).
- Cook, Swayne (2007). Gráficos interactivos para el análisis de datos .
- Malakooti, B. (2013). Sistemas de operaciones y producción con objetivos múltiples. John Wiley & Sons.
- TW Anderson, Introducción al análisis estadístico multivariante , Wiley, Nueva York, 1958.
- KV Mardia; JT Kent y JM Bibby (1979). Análisis multivariante. Academic Press . ISBN 978-0-12-471252-2.(Enfoque de "probabilidad" a nivel de MA)
- Feinstein, AR (1996) Análisis multivariable . New Haven, CT: Yale University Press.
- Hair, JF Jr. (1995) Análisis de datos multivariados con lecturas , 4.ª ed. Prentice-Hall.
- Schafer, JL (1997) Análisis de datos multivariados incompletos . CRC Press. (Advanced)
- Sharma, S. (1996) Técnicas multivariadas aplicadas . Wiley. (Informal, aplicada)
- Izenman, Alan J. (2008). Técnicas estadísticas multivariantes modernas: regresión, clasificación y aprendizaje de variedades. Textos de Springer en estadística. Nueva York: Springer-Verlag. ISBN 9780387781884.
- Tinsley, Howard EA; Brown, Steven D., eds. (2000). Manual de estadística multivariante aplicada y modelado matemático . Academic Press. doi : 10.1016/B978-0-12-691360-6.X5000-9 . ISBN 978-0-12-691360-6.
Enlaces externos
- Notas estadísticas: Temas de análisis multivariante, por G. David Garson
- Mike Palmer: La página web de la ordenación
- InsightsNow: Creadores de ReportsNow, ProfilesNow y KnowledgeNow.
- estadística multivariante