Una función de densidad de probabilidad gaussiana bivariada centrada en (0, 0), con matriz de covarianza dada por [ 1 0,5 0,5 1 ] {\displaystyle {\begin{bmatrix}1&0.5\\0.5&1\end...
Hispanopedia WikiContenido en espanolLectura gratuita
Una función de densidad de probabilidad gaussiana bivariada centrada en (0, 0), con matriz de covarianza dada por Puntos de muestra de una distribución gaussiana bivariada con una desviación estándar de 3 en la dirección aproximadamente inferior izquierda-superior derecha y de 1 en la dirección ortogonal. Debido a que los componentes x e y covarían, las varianzas deyno describen completamente la distribución. ASe necesita la matriz de covarianza; las direcciones de las flechas corresponden a los vectores propios de esta matriz de covarianza y sus longitudes a las raíces cuadradas de los valores propios .
Intuitivamente, la matriz de covarianza generaliza la noción de varianza a múltiples dimensiones. Como ejemplo, la variación en una colección de puntos aleatorios en un espacio bidimensional no puede caracterizarse completamente por un solo número, ni tampoco las varianzas en layLas instrucciones contienen toda la información necesaria;Sería necesaria una matriz para caracterizar completamente la variación bidimensional.
La matriz de covarianza de un vector aleatoriose suele denotar por,o.
Definición
A lo largo de este artículo, en negrita y sin subtítuloyse utilizan para referirse a vectores aleatorios y subíndices romanosyse utilizan para referirse a variables aleatorias escalares.
Las nomenclaturas difieren. Algunos estadísticos, siguiendo al probabilista William Feller en su libro de dos volúmenes Una introducción a la teoría de la probabilidad y sus aplicaciones , [ 2 ] llaman a la matrizla varianza del vector aleatorio, porque es la generalización natural a dimensiones superiores de la varianza unidimensional. Otros la llaman matriz de covarianza , porque es la matriz de covarianzas entre las componentes escalares del vector.
Ambas formas son bastante estándar y no hay ambigüedad entre ellas. La matrizTambién se la suele llamar matriz de varianza-covarianza , ya que los términos diagonales son, de hecho, varianzas.
La matriz de autocovarianzaestá relacionado con la matriz de autocorrelaciónpor donde la matriz de autocorrelación se define como.
Relación con la matriz de correlación
Una entidad estrechamente relacionada con la matriz de covarianza es la matriz de coeficientes de correlación de Pearson entre cada una de las variables aleatorias en el vector aleatorio., que se puede escribir como dónde es la matriz de los elementos diagonales de(es decir, una matriz diagonal de las varianzas de para).
Cada elemento de la diagonal principal de una matriz de correlación es la correlación de una variable aleatoria consigo misma, que siempre es igual a 1. Cada elemento fuera de la diagonal está entre -1 y +1, ambos inclusive.
Inversa de la matriz de covarianza
La inversa de esta matriz,, si existe, es la matriz de covarianza inversa, también conocida como matriz de precisión (o matriz de concentración ). [ 3 ]
Así como la matriz de covarianza puede escribirse como el reescalamiento de una matriz de correlación por las varianzas marginales:
Así pues, utilizando la idea de correlación parcial y varianza parcial, la matriz de covarianza inversa puede expresarse de forma análoga:
Esta dualidad motiva una serie de otras dualidades entre la marginalización y el condicionamiento para variables aleatorias gaussianas.
Propiedades básicas
Paray, dóndees unVariable aleatoria de dimensión , se aplican las siguientes propiedades básicas: [ 4 ]
En efecto, de la propiedad 4 se deduce que bajo transformación lineal de variable aleatoriacon matriz de covariaciónmediante operador linealsa, la matriz de covarianza se transforma como
.
Según la matriz de propiedad 3es simétrica, puede diagonalizarse mediante una transformación ortogonal lineal, es decir, existe tal matriz ortogonal(mientras tanto), eso
yson los valores propios de. Pero esto significa que esta matriz es una matriz de covarianza para una variable aleatoria.y la diagonal principal deconsiste en variaciones de elementos devector. Como la varianza siempre es no negativa, concluimos quepara cualquier. Pero esto significa que la matrizes semidefinido positivo.
La matriz de coeficientes de regresión a menudo se puede dar en forma transpuesta,, adecuado para la postmultiplicación de un vector fila de variables explicativasen lugar de premultiplicar un vector columna. En esta forma corresponden a los coeficientes obtenidos al invertir la matriz de las ecuaciones normales de mínimos cuadrados ordinarios (MCO).
Matriz de covarianza parcial
Una matriz de covarianza con todos sus elementos distintos de cero indica que todas las variables aleatorias individuales están interrelacionadas. Esto significa que las variables no solo están correlacionadas directamente, sino también indirectamente a través de otras variables. A menudo, estas correlaciones indirectas de modo común son triviales y carecen de interés. Se pueden suprimir calculando la matriz de covarianza parcial, es decir, la parte de la matriz de covarianza que muestra únicamente la parte relevante de las correlaciones.
Si dos vectores de variables aleatoriasyestán correlacionados a través de otro vector, estas últimas correlaciones se suprimen en una matriz [ 6 ] La matriz de covarianza parciales efectivamente la matriz de covarianza simplecomo si las variables aleatorias no fueran interesantesse mantuvieron constantes.
matriz de desviación estándar
La matriz de desviación estándares la extensión de la desviación estándar a múltiples dimensiones. Es la raíz cuadrada simétrica de la matriz de covarianza..
Matriz de covarianza como parámetro de una distribución
Aplicada a un vector, la matriz de covarianza transforma una combinación lineal c de las variables aleatorias X en un vector de covarianzas con esas variables:Al tratarse como una forma bilineal , se obtiene la covarianza entre las dos combinaciones lineales:La varianza de una combinación lineal es entonces, su covarianza consigo misma.
De manera similar, la matriz de covarianza (pseudo)inversa proporciona un producto interno., lo que induce la distancia de Mahalanobis , una medida de la "improbabilidad" de c .
Admisibilidad
A partir de la propiedad básica 4. anterior, seaser unvector de valores reales, entonces que siempre debe ser no negativa, ya que es la varianza de una variable aleatoria de valor real, por lo que una matriz de covarianza es siempre una matriz semidefinida positiva .
El argumento anterior se puede ampliar de la siguiente manera:donde la última desigualdad se deduce de la observación de quees un escalar.
Por el contrario, toda matriz simétrica semidefinida positiva es una matriz de covarianza. Para ver esto, supongamos que...es unmatriz simétrica semidefinida positiva. Del caso de dimensión finita del teorema espectral , se deduce quetiene una raíz cuadrada simétrica no negativa , que se puede denotar por M 1/2 . Seaser cualquieravariable aleatoria con valores de vector columna cuya matriz de covarianza es lamatriz identidad. Entonces
vectores aleatorios complejos
La varianza de una variable aleatoria escalar compleja con valor esperadoconvencionalmente se define mediante conjugación compleja : donde el conjugado complejo de un número complejose denota; por lo tanto, la varianza de una variable aleatoria compleja es un número real.
Sies un vector columna de variables aleatorias de valor complejo, entonces la transpuesta conjugadase forma mediante transposición y conjugación. En la siguiente expresión, el producto de un vector con su transpuesta conjugada da como resultado una matriz cuadrada llamada matriz de covarianza , como su esperanza: [ 7 ] : 293 La matriz así obtenida será hermitiana semidefinida positiva , [ 8 ] con números reales en la diagonal principal y números complejos fuera de la diagonal.
Los elementos diagonales de la matriz de covarianza son reales. [ 1 ] : 179
Matriz de pseudocovarianza
Para vectores aleatorios complejos, otro tipo de segundo momento central, la matriz de pseudocovarianza (también llamada matriz de relación ) se define de la siguiente manera:
A diferencia de la matriz de covarianza definida anteriormente, la transposición hermitiana se reemplaza por transposición en la definición. Sus elementos diagonales pueden ser de valor complejo; es una matriz simétrica compleja .
Estimación
Siyson matrices de datos centradas de dimensiónyrespectivamente, es decir, con n columnas de observaciones de p y q filas de variables, de las cuales se han restado las medias de las filas, entonces, si las medias de las filas se estimaron a partir de los datos, matrices de covarianza muestralesypuede definirse como o, si las medias de las filas se conocieran a priori,
Estas matrices de covarianza de muestra empíricas son los estimadores más sencillos y utilizados con mayor frecuencia para las matrices de covarianza, pero también existen otros estimadores, incluidos los estimadores regularizados o de contracción, que pueden tener mejores propiedades.
La estrategia evolutiva , una familia particular de heurísticas de búsqueda aleatoria, se basa fundamentalmente en una matriz de covarianza en su mecanismo. El operador de mutación característico extrae el paso de actualización de una distribución normal multivariada utilizando una matriz de covarianza evolutiva. Existe una prueba formal de que la matriz de covarianza de la estrategia evolutiva se adapta a la inversa de la matriz hessiana del paisaje de búsqueda, salvo un factor escalar y pequeñas fluctuaciones aleatorias (demostrado para una estrategia de un solo progenitor y un modelo estático, a medida que aumenta el tamaño de la población, basándose en la aproximación cuadrática). [ 10 ] Intuitivamente, este resultado se apoya en el razonamiento de que la distribución de covarianza óptima puede ofrecer pasos de mutación cuyos contornos de probabilidad de equidensidad coinciden con los conjuntos de nivel del paisaje, y por lo tanto maximizan la tasa de progreso.
Mapeo de covarianza
En el mapeo de covarianza los valores de laoLas matrices se representan como un mapa bidimensional. Cuando los vectoresyLas funciones aleatorias discretas se representan mediante el mapa, que muestra las relaciones estadísticas entre las distintas regiones de dichas funciones. Las regiones estadísticamente independientes aparecen en el mapa como llanuras de nivel cero, mientras que las correlaciones positivas o negativas se representan, respectivamente, como colinas o valles.
En la práctica, los vectores columna, yse adquieren experimentalmente como filas demuestras, por ejemplo dóndees el i -ésimo valor discreto en la muestra j de la función aleatoriaLos valores esperados necesarios en la fórmula de covarianza se estiman utilizando la media muestral , por ejemplo y la matriz de covarianza se estima mediante la matriz de covarianza muestral. donde los corchetes angulares denotan el promedio de muestras como antes, excepto que se debe realizar la corrección de Bessel para evitar el sesgo . Usando esta estimación, la matriz de covarianza parcial se puede calcular como donde la barra invertida denota el operador de división matricial izquierda , que evita la necesidad de invertir una matriz y está disponible en algunos paquetes de cálculo como Matlab . [ 11 ]
Figura 1: Construcción de un mapa de covarianza parcial de moléculas de N₂ que experimentan una explosión de Coulomb inducida por un láser de electrones libres. [ 12 ] Los paneles a y b representan los dos términos de la matriz de covarianza, que se muestra en el panel c . El panel d representa las correlaciones de modo común mediante fluctuaciones de intensidad del láser. El panel e representa la matriz de covarianza parcial corregida para las fluctuaciones de intensidad. El panel f muestra que una sobrecorrección del 10 % mejora el mapa y hace que las correlaciones ión-ión sean claramente visibles. Debido a la conservación del momento, estas correlaciones aparecen como líneas aproximadamente perpendiculares a la línea de autocorrelación (y a las modulaciones periódicas causadas por el efecto de anillo del detector).
La figura 1 ilustra cómo se construye un mapa de covarianza parcial en un ejemplo de un experimento realizado en el láser de electrones libres FLASH en Hamburgo. [ 12 ] La función aleatoriaes el espectro de tiempo de vuelo de iones de una explosión de Coulomb de moléculas de nitrógeno ionizadas por múltiples pulsos láser. Dado que solo se ionizan unos pocos cientos de moléculas en cada pulso láser, los espectros de un solo disparo son altamente fluctuantes. Sin embargo, la recolección típicamentetales espectros,y promediándolos duranteproduce un espectro suave, que se muestra en rojo en la parte inferior de la Fig. 1. El espectro promedioSe observan varios iones de nitrógeno en forma de picos ensanchados por su energía cinética, pero para encontrar las correlaciones entre las etapas de ionización y los momentos iónicos es necesario calcular un mapa de covarianza.
En el ejemplo de la Fig. 1 espectrosyson los mismos, excepto que el rango del tiempo de vuelodifiere. El panel a muestra, el panel b muestray el panel c muestra su diferencia, que es(nótese un cambio en la escala de color). Desafortunadamente, este mapa está saturado de correlaciones de modo común poco interesantes inducidas por la fluctuación de la intensidad del láser de disparo a disparo. Para suprimir dichas correlaciones, la intensidad del láserse registra en cada disparo, se coloca enyse calcula como muestran los paneles d y e . Sin embargo, la supresión de las correlaciones no interesantes es imperfecta porque existen otras fuentes de fluctuaciones de modo común además de la intensidad del láser y, en principio, todas estas fuentes deberían ser monitoreadas en el vectorSin embargo, en la práctica, a menudo basta con sobrecompensar la corrección de covarianza parcial, como muestra el panel f , donde ahora se aprecian claramente correlaciones interesantes de los momentos iónicos como líneas rectas centradas en las etapas de ionización del nitrógeno atómico.
Espectroscopia infrarroja bidimensional
La espectroscopia infrarroja bidimensional emplea análisis de correlación para obtener espectros 2D de la fase condensada . Existen dos versiones de este análisis: síncrona y asíncrona . Matemáticamente, la primera se expresa en términos de la matriz de covarianza de la muestra y la técnica es equivalente al mapeo de covarianza. [ 13 ]
1 2 3 Park, Kun Il (2018). Fundamentos de probabilidad y procesos estocásticos con aplicaciones a las comunicaciones . Springer. ISBN978-3-319-68074-3.
↑ William Feller (1971). Introducción a la teoría de la probabilidad y sus aplicaciones . Wiley. ISBN978-0-471-25709-7Consultado el 10 de agosto de 2012 .
↑ Wasserman, Larry (2004). All of Statistics: A Concise Course in Statistical Inference . Springer. ISBN0-387-40272-1.
↑ Taboga, Marco (2010). "Lecciones sobre teoría de la probabilidad y estadística matemática" .
↑ Eaton, Morris L. (1983). Multivariate Statistics: a Vector Space Approach . John Wiley and Sons. pp. 116–117 . ISBN0-471-02776-6.
1 2 W J Krzanowski "Principios de análisis multivariante" (Oxford University Press, Nueva York, 1988), Cap. 14.4; KV Mardia, JT Kent y JM Bibby "Análisis multivariante" (Academic Press, Londres, 1997), Cap. 6.5.3; TW Anderson "Introducción al análisis estadístico multivariante" (Wiley, Nueva York, 2003), 3.ª ed., Caps. 2.5.1 y 4.3.1.
↑ Lapidoth, Amos (2009). Fundamentos de la comunicación digital . Cambridge University Press. ISBN978-0-521-19395-5.
↑ Brookes, Mike. "Manual de referencia de Matrix" .
↑ Kessy, Agnan; Strimmer, Korbinian; Lewin, Alex (2018). "Blanqueamiento óptimo y decorrelación" . The American Statistician . 72 (4). Taylor & Francis: 309–314 . arXiv : 1512.00809 . doi : 10.1080/00031305.2016.1277159 .
↑ Shir, OM; A. Yehudayoff (2020). "Sobre la relación covarianza-hessiana en estrategias evolutivas" . Theoretical Computer Science . 801. Elsevier: 157–174 . arXiv : 1806.03674 . doi : 10.1016/j.tcs.2019.09.002 .
↑ LJ Frasinski "Técnicas de mapeo de covarianza" J. Phys. B: At. Mol. Opt. Phys. 49 152004 (2016), doi : 10.1088/0953-4075/49/15/152004
1 2 O Kornilov, M Eckstein, M Rosenblatt, CP Schulz, K Motomura, A Rouzée, J Klei, L Foucar, M Siano, A Lübcke, F. Schapper, P Johnsson, DMP Holland, T Schlatholter, T Marchenko, S Düsterer, K Ueda, MJJ Vrakking y LJ Frasinski "Explosión de Coulomb de moléculas diatómicas en campos XUV intensos mapeados por covarianza parcial" J. Phys. B: At. Mol. Opt. Phys. 46 164028 (2013), doi : 10.1088/0953-4075/46/16/164028
↑ Noda, I. (1993). "Método de correlación bidimensional generalizado aplicable a espectroscopia infrarroja, Raman y de otros tipos". Appl. Spectrosc . 47 (9): 1329– 36. Bibcode : 1993ApSpe..47.1329N . doi : 10.1366/0003702934067694 .