Articulo de referencia

Media y covarianza de la muestra

La media muestral ( promedio muestral ) o media empírica ( promedio empírico ), y la covarianza muestral o covarianza empírica son estadísticas calculadas a partir de una muestr...

La media muestral ( promedio muestral ) o media empírica ( promedio empírico ), y la covarianza muestral o covarianza empírica son estadísticas calculadas a partir de una muestra de datos sobre una o más variables aleatorias .

La media muestral es el valor promedio (o media ) de una muestra de números extraída de una población mayor , donde "población" se refiere no al número de personas, sino a la totalidad de los datos relevantes, ya sean recopilados o no. Por conveniencia, se puede utilizar una muestra de las ventas de 40 empresas de la lista Fortune 500 en lugar de analizar la población, es decir, las ventas de las 500 empresas. La media muestral se utiliza como estimador de la media poblacional, el valor promedio de toda la población, y es más probable que la estimación se aproxime a la media poblacional si la muestra es grande y representativa. La fiabilidad de la media muestral se estima mediante el error estándar , que a su vez se calcula utilizando la varianza de la muestra. Si la muestra es aleatoria, el error estándar disminuye con el tamaño de la muestra y la distribución de la media muestral se aproxima a la distribución normal a medida que aumenta el tamaño de la muestra.

El término "media muestral" también puede referirse a un vector de valores promedio cuando el estadístico analiza los valores de varias variables en la muestra, por ejemplo, las ventas, las ganancias y el número de empleados de una muestra de empresas Fortune 500. En este caso, no solo se dispone de la varianza muestral para cada variable, sino también de una matriz de covarianza muestral (o simplemente matriz de covarianza ) que muestra la relación entre cada par de variables. Esta sería una matriz de 3×3 cuando se consideran tres variables. La covarianza muestral es útil para evaluar la fiabilidad de las medias muestrales como estimadores y también como estimación de la matriz de covarianza poblacional.

Debido a su facilidad de cálculo y otras características deseables, la media muestral y la covarianza muestral se utilizan ampliamente en estadística para representar la ubicación y la dispersión de la distribución de valores en la muestra, y para estimar los valores de la población.

Definición de la media muestral

La media muestral es el promedio de los valores de una variable en una muestra, que es la suma de esos valores dividida por el número de valores. Utilizando notación matemática , si se toma una muestra de N observaciones de la variable X de la población, la media muestral es:

incógnita¯=1nortei=1norteincógnitai.{\displaystyle {\bar {X}}={\frac {1}{N}}\sum _{i=1}^{N}X_{i}.}

Según esta definición, si la muestra (1, 4, 1) se toma de la población (1,1,3,4,0,2,1,0), entonces la media de la muestra esincógnita¯=(1+4+1)/3=2{\displaystyle {\bar {x}}=(1+4+1)/3=2}, en comparación con la media poblacional deμ=(1+1+3+4+0+2+1+0)/8=12/8=1.5{\displaystyle \mu =(1+1+3+4+0+2+1+0)/8=12/8=1.5}Aunque una muestra sea aleatoria, rara vez es perfectamente representativa, y otras muestras tendrían medias diferentes incluso si todas provinieran de la misma población. La muestra (2, 1, 0), por ejemplo, tendría una media de 1.

Si el estadístico está interesado en K variables en lugar de una, y cada observación tiene un valor para cada una de esas K variables, la media muestral general consta de K medias muestrales para variables individuales.incógnitaij{\displaystyle x_{ij}}sea ​​la i -ésima observación extraída independientemente ( i = 1, ..., N ) de la j -ésima variable aleatoria ( j = 1, ..., K ). Estas observaciones se pueden organizar en N vectores columna, cada uno con K entradas, donde el vector columna K × 1 que da las i -ésimas observaciones de todas las variables se denotaincógnitai{\displaystyle \mathbf {x} _ {i}}( i =1,..., N ).

El vector de media muestralincógnita¯{\displaystyle \mathbf {\bar {x}} }es un vector columna cuyo j -ésimo elementoincógnita¯j{\displaystyle {\bar {x}}_{j}}es el valor promedio de las N observaciones de la j -ésima variable:

incógnita¯j=1nortei=1norteincógnitaij,j=1,,K.{\displaystyle {\bar {x}}_{j}={\frac {1}{N}}\sum _{i=1}^{N}x_{ij},\quad j=1,\ldots ,K.}

Así, el vector de media muestral contiene el promedio de las observaciones para cada variable y se escribe

incógnita¯=1nortei=1norteincógnitai=[incógnita¯1incógnita¯jincógnita¯K]{\displaystyle \mathbf {\bar {x}} ={\frac {1}{N}}\sum _{i=1}^{N}\mathbf {x} _{i}={\begin{bmatrix}{\bar {x}}_{1}\\\vdots \\{\bar {x}}_{j}\\\vdots \\{\bar {x}}_{K}\end{bmatrix}}}

Definición de covarianza muestral

La matriz de covarianza muestral es una matriz de K por K.Q=[qjk]{\displaystyle \textstyle \mathbf {Q} =\left[q_{jk}\right]}con entradas

qjk=1norte1i=1norte(incógnitaijincógnita¯j)(incógnitaikincógnita¯k),{\displaystyle q_{jk}={\frac {1}{N-1}}\sum _{i=1}^{N}\left(x_{ij}-{\bar {x}}_{j}\right)\left(x_{ik}-{\bar {x}}_{k}\right),}

dóndeqjk{\displaystyle q_{jk}}es una estimación de la covarianza entre la j -ésima variable y la k -ésima variable de la población subyacente a los datos. En términos de los vectores de observación, la covarianza muestral es

Q=1norte1i=1norte(incógnitai.incógnita¯)(incógnitai.incógnita¯)T,{\displaystyle \mathbf {Q} ={1 \over {N-1}}\sum _{i=1}^{N}(\mathbf {x} _{i}.-\mathbf {\bar {x}} )(\mathbf {x} _{i}.-\mathbf {\bar {x}} )^{\mathrm {T} },}

Alternativamente, se pueden organizar los vectores de observación como las columnas de una matriz, de modo que

F=[incógnita1incógnita2incógnitanorte]{\displaystyle \mathbf {F} ={\begin{bmatrix}\mathbf {x} _{1}&\mathbf {x} _{2}&\dots &\mathbf {x} _{N}\end{bmatrix}}},

que es una matriz de K filas y N columnas. Aquí, la matriz de covarianza muestral se puede calcular como

Q=1norte1(Fincógnita¯1norteT)(Fincógnita¯1norteT)T{\displaystyle \mathbf {Q} ={\frac {1}{N-1}}(\mathbf {F} -\mathbf {\bar {x}} \,\mathbf {1} _{N}^{\mathrm {T} })(\mathbf {F} -\mathbf {\bar {x}} \,\mathbf {1} _{N}^{\mathrm {T} })^{\mathrm {T} }},

dónde1norte{\displaystyle \mathbf {1} _{N}}es un vector de unos de N por 1. Si las observaciones se organizan en filas en lugar de columnas, entoncesincógnita¯{\displaystyle \mathbf {\bar {x}} }ahora es un vector fila de 1× K yMETRO=FT{\displaystyle \mathbf {M} =\mathbf {F} ^{\mathrm {T} }}es una matriz N × K cuya columna j es el vector de N observaciones de la variable j , entonces al aplicar transposiciones en los lugares apropiados se obtiene

Q=1norte1(METRO1norteincógnita¯)T(METRO1norteincógnita¯).{\displaystyle \mathbf {Q} ={\frac {1}{N-1}}(\mathbf {M} -\mathbf {1} _{N}\mathbf {\bar {x}} )^{\mathrm {T} }(\mathbf {M} -\mathbf {1} _{N}\mathbf {\bar {x}} ).}

Al igual que las matrices de covarianza para vectores aleatorios , las matrices de covarianza de muestra son semidefinidas positivas . Para demostrarlo, observe que para cualquier matrizA{\displaystyle \mathbf {A} }la matrizATA{\displaystyle \mathbf {A} ^{T}\mathbf {A} }es semidefinida positiva. Además, una matriz de covarianza es definida positiva si y solo si el rango de laincógnitai.incógnita¯{\displaystyle \mathbf {x} _{i}.-\mathbf {\bar {x}} }Los vectores son K.

Imparcialidad

La media muestral y la matriz de covarianza muestral son estimaciones insesgadas de la media y la matriz de covarianza del vector aleatorio.incógnita{\displaystyle \textstyle \mathbf {X} }, un vector fila cuyo j -ésimo elemento ( j = 1, ..., K ) es una de las variables aleatorias. [ 1 ] La matriz de covarianza muestral tienenorte1{\displaystyle \textstyle N-1}en el denominador en lugar denorte{\displaystyle \textstyle N}debido a una variante de la corrección de Bessel : En resumen, la covarianza muestral se basa en la diferencia entre cada observación y la media muestral, pero la media muestral está ligeramente correlacionada con cada observación ya que se define en términos de todas las observaciones. Si la media poblacionalmi(incógnita){\displaystyle \operatorname {E} (\mathbf {X} )}Se conoce la estimación análoga insesgada.

qjk=1nortei=1norte(incógnitaijmi(incógnitaj))(incógnitaikmi(incógnitak)),{\displaystyle q_{jk}={\frac {1}{N}}\sum _{i=1}^{N}\left(x_{ij}-\operatorname {E} (X_{j})\right)\left(x_{ik}-\operatorname {E} (X_{k})\right),}

utilizando la media poblacional, tienenorte{\displaystyle \textstyle N}en el denominador. Este es un ejemplo de por qué en probabilidad y estadística es esencial distinguir entre variables aleatorias (letras mayúsculas) y realizaciones de las variables aleatorias (letras minúsculas).

La estimación de máxima verosimilitud de la covarianza

qjk=1nortei=1norte(incógnitaijincógnita¯j)(incógnitaikincógnita¯k){\displaystyle q_{jk}={\frac {1}{N}}\sum _{i=1}^{N}\left(x_{ij}-{\bar {x}}_{j}\right)\left(x_{ik}-{\bar {x}}_{k}\right)}

En el caso de la distribución gaussiana, N también está en el denominador. La razón de 1/ N a 1/( N 1) se aproxima a 1 para valores grandes de N , por lo que la estimación de máxima verosimilitud es aproximadamente igual a la estimación insesgada cuando la muestra es grande.   

Distribución de la media muestral

Para cada variable aleatoria, la media muestral es un buen estimador de la media poblacional, donde un estimador "bueno" se define como eficiente e insesgado. Por supuesto, es probable que el estimador no sea el valor real de la media poblacional , ya que diferentes muestras extraídas de la misma distribución darán diferentes medias muestrales y, por lo tanto, diferentes estimaciones de la media real. Así pues, la media muestral es una variable aleatoria , no una constante, y, en consecuencia, tiene su propia distribución.

Denotando con μ la media poblacional y conσ2{\displaystyle \sigma ^{2}}La varianza poblacional, para una muestra aleatoria de n observaciones independientes extraídas de la población, el valor esperado de la media muestral es

mi(incógnita¯)=μ{\displaystyle \operatorname {E} ({\bar {x}})=\mu }

y la varianza de la media muestral es

var(incógnita¯)=σ2norte.{\displaystyle \operatorname {var} ({\bar {x}})={\frac {\sigma ^{2}}{n}}.}

Si las muestras no son independientes, sino que están correlacionadas , entonces se debe tener especial cuidado para evitar el problema de la pseudorreplicación .

Si la población tiene una distribución normal , entonces la media muestral tiene una distribución normal de la siguiente manera:

incógnita¯norte{μ,σ2norte}.{\displaystyle {\bar {x}}\thicksim N\left\{\mu ,{\frac {\sigma ^{2}}{n}}\right\}.}

Si la población no tiene una distribución normal, la media muestral, no obstante, tiene una distribución aproximadamente normal si n es grande y σ 2 / n < +∞. Esto es una consecuencia del teorema del límite central .   

Muestras ponderadas

En una muestra ponderada, cada vectorincógnitai{\displaystyle \textstyle {\textbf {x}}_{i}}(a cada conjunto de observaciones individuales en cada una de las K variables aleatorias) se le asigna un pesowi0{\displaystyle \textstyle w_{i}\geq 0}Sin pérdida de generalidad , supongamos que los pesos están normalizados :

i=1nortewi=1.{\displaystyle \sum _{i=1}^{N}w_{i}=1.}

(Si no lo son, divida los pesos por su suma). Entonces el vector de media ponderadaincógnita¯{\displaystyle \textstyle \mathbf {\bar {x}} }es dado por

incógnita¯=i=1nortewiincógnitai.{\displaystyle \mathbf {\bar {x}} =\sum _{i=1}^{N}w_{i}\mathbf {x} _{i}.}

y los elementosqjk{\displaystyle q_{jk}}de la matriz de covarianza ponderadaQ{\displaystyle \textstyle \mathbf {Q} }son [ 2 ]

qjk=11i=1nortewi2i=1nortewi(incógnitaijincógnita¯j)(incógnitaikincógnita¯k).{\displaystyle q_{jk}={\frac {1}{1-\sum _{i=1}^{N}w_{i}^{2}}}\sum _{i=1}^{N}w_{i}\left(x_{ij}-{\bar {x}}_{j}\right)\left(x_{ik}-{\bar {x}}_{k}\right).}

Si todos los pesos son iguales,wi=1/norte{\displaystyle \textstyle w_{i}=1/N}, la media ponderada y la covarianza se reducen a la media muestral (sesgada) y la covarianza mencionadas anteriormente.

Crítica

La media muestral y la covarianza muestral no son estadísticas robustas , lo que significa que son sensibles a los valores atípicos . Dado que la robustez suele ser una característica deseada, especialmente en aplicaciones del mundo real, pueden resultar deseables alternativas robustas, en particular las estadísticas basadas en cuantiles , como la mediana muestral para la ubicación [ 3 ] y el rango intercuartil (RIC) para la dispersión. Otras alternativas incluyen el recorte y la winsorización , como en la media recortada y la media winsorizada .

Véase también

Referencias

  1. Richard Arnold Johnson; Dean W. Wichern (2007). Análisis estadístico multivariante aplicado . Pearson Prentice Hall. ISBN 978-0-13-187715-3Consultado el 10 de agosto de 2012 .
  2. Mark Galassi, Jim Davies, James Theiler, Brian Gough, Gerard Jungman, Michael Booth y Fabrice Rossi. Biblioteca Científica GNU - Manual de referencia, Versión 2.6 , 2021. Sección Estadísticas: Muestras ponderadas
  3. The World Question Center 2006: La media muestral Archivado el 12/07/2019 en Wayback Machine , Bart Kosko