Articulo de referencia

Diferencia

Ejemplo de muestras de dos poblaciones con la misma media pero diferentes varianzas. La población roja tiene una media μ = 100 y una varianza 2 = 100"}},"i":0}}]}"> σ 2 = 100 ( ...

Ejemplo de muestras de dos poblaciones con la misma media pero diferentes varianzas. La población roja tiene una media μ = 100 y una varianza σ 2 = 100 ( σ = 10 ), mientras que la población azul tiene una media μ = 100 y una varianza σ 2 = 2500 ( σ = 50 ).

En teoría de la probabilidad y estadística , la varianza es una medida de dispersión , es decir, una medida de cuán disperso está un conjunto de números con respecto a su valor promedio. Se define como el valor esperado de la desviación al cuadrado con respecto a la media de una variable aleatoria . La desviación estándar es la raíz cuadrada de la varianza. Técnicamente, es el segundo momento central de una distribución y la covarianza de la variable aleatoria consigo misma, y ​​a menudo se representa mediante σ2{\displaystyle \sigma ^{2}},s2{\displaystyle s^{2}},Var(incógnita){\displaystyle \operatorname {Var} (X)},V(incógnita){\displaystyle V(X)}, oV(incógnita){\displaystyle \mathbb {V} (X)} . [ 1 ]

Una ventaja de la varianza como medida de dispersión es que se presta más a la manipulación algebraica que otras medidas de dispersión, como la desviación absoluta esperada ; por ejemplo, la varianza de una suma de variables aleatorias no correlacionadas es igual a la suma de sus varianzas. Una desventaja de la varianza para aplicaciones prácticas es que, a diferencia de la desviación estándar, sus unidades difieren de las de la variable aleatoria, razón por la cual la desviación estándar se suele reportar como medida de dispersión una vez finalizado el cálculo. Otra desventaja es que la varianza no es finita para muchas distribuciones.

Existen dos conceptos distintos que se denominan "varianza". Uno, como se mencionó anteriormente, forma parte de una distribución de probabilidad teórica y se define mediante una ecuación. El otro es una característica de un conjunto de observaciones. Cuando la varianza se calcula a partir de observaciones, estas suelen obtenerse de un sistema real. Si se dispone de todas las observaciones posibles del sistema, la varianza calculada se denomina varianza poblacional. Sin embargo, normalmente solo se dispone de un subconjunto, y la varianza calculada a partir de este se denomina varianza muestral. La varianza calculada a partir de una muestra se considera una estimación de la varianza poblacional total. Existen diversas maneras de estimar la varianza poblacional a partir de la varianza muestral, como se explica en la siguiente sección.

Los dos tipos de varianza están estrechamente relacionados. Para comprenderlo mejor, consideremos que una distribución de probabilidad teórica puede utilizarse como generador de observaciones hipotéticas. Si se genera un número infinito de observaciones mediante una distribución, la varianza muestral calculada a partir de ese conjunto infinito coincidirá con el valor calculado mediante la ecuación de varianza de dicha distribución. La varianza desempeña un papel fundamental en estadística, donde se utiliza en conceptos como la estadística descriptiva , la inferencia estadística , las pruebas de hipótesis , la bondad de ajuste y el muestreo de Monte Carlo .

Visualización geométrica de la varianza de una distribución arbitraria (2, 4, 4, 4, 5, 5, 7, 9):
  1. Se construye una distribución de frecuencias.
  2. El centroide de la distribución proporciona su media.
  3. Para cada valor, se forma un cuadrado cuyos lados son iguales a la diferencia de cada valor con respecto a la media.
  4. Al disponer los cuadrados en un rectángulo con un lado igual al número de valores, n , el otro lado resulta ser la varianza de la distribución, σ 2 .

Definición

La varianza de una variable aleatoriaincógnita{\displaystyle X}es el valor esperado de la desviación al cuadrado con respecto a la media de incógnita{\displaystyle X},μ=mi[incógnita]{\displaystyle \mu =\operatorname {E} [X]}:Var(incógnita)=mi[(incógnitaμ)2].{\displaystyle \operatorname {Var} (X)=\operatorname {E} \left[(X-\mu )^{2}\right].} Esta definición abarca variables aleatorias generadas por procesos discretos , continuos , neutros o mixtos. La varianza también puede entenderse como la covarianza de una variable aleatoria consigo misma. Var(incógnita)=Cov(incógnita,incógnita).{\displaystyle \operatorname {Var} (X)=\operatorname {Cov} (X,X).}

La varianza también es equivalente al segundo cumulante de una distribución de probabilidad que genera incógnita{\displaystyle X} . La variación se designa normalmente comoVar(incógnita){\displaystyle \operatorname {Var} (X)} , o a veces comoV(incógnita){\displaystyle V(X)}oV(incógnita){\displaystyle \mathbb {V} (X)} , o simbólicamente comoσincógnita2{\displaystyle \sigma _{X}^{2}}o simplementeσ2{\displaystyle \sigma ^{2}}(se pronuncia " sigma al cuadrado"). La expresión para la varianza se puede expandir de la siguiente manera: Var(incógnita)=mi[(incógnitami[incógnita])2]=mi[incógnita22incógnitami[incógnita]+mi[incógnita]2]=mi[incógnita2]2mi[incógnita]mi[incógnita]+mi[incógnita]2=mi[incógnita2]2mi[incógnita]2+mi[incógnita]2=mi[incógnita2]mi[incógnita]2{\displaystyle {\begin{aligned}\operatorname {Var} (X)&=\operatorname {E} \left[{\left(X-\operatorname {E} [X]\right)}^{2}\right]\\[4pt]&=\operatorname {E} \left[X^{2}-2X\operatorname {E} [X]+\operatorname {E} [X]^{2}\right]\\[4pt]&=\operatorname {E} \left[X^{2}\right]-2\operatorname {E} [X]\operatorname {E} [X]+\operatorname {E} [X]^{2}\\[4pt]&=\operatorname {E} \left[X^{2}\right]-2\operatorname {E} [X]^{2}+\operatorname {E} [X]^{2}\\[4pt]&=\operatorname {E} \left[X^{2}\right]-\operatorname {E} [X]^{2}\end{aligned}}}

En otras palabras, la varianza deincógnita{\displaystyle X}es igual a la media del cuadrado deincógnita{\displaystyle X}menos el cuadrado de la media deincógnita{\displaystyle X}Esta ecuación no debe utilizarse para cálculos con aritmética de punto flotante , ya que sufre una cancelación catastrófica si los dos componentes de la ecuación tienen magnitudes similares. Para otras alternativas numéricamente estables, consulte Algoritmos para el cálculo de la varianza .

Variable aleatoria discreta

Si el generador de variables aleatoriasincógnita{\displaystyle X}es discreto con función de masa de probabilidadincógnita1pag1,incógnita2pag2,,incógnitanortepagnorte{\displaystyle x_{1}\mapsto p_{1},x_{2}\mapsto p_{2},\ldots ,x_{n}\mapsto p_{n}}, entonces Var(incógnita)=i=1nortepagi(incógnitaiμ)2,{\displaystyle \operatorname {Var} (X)=\sum _{i=1}^{n}p_{i}\cdot {\left(x_{i}-\mu \right)}^{2},} dóndeμ{\displaystyle \mu }es el valor esperado. Es decir, μ=i=1nortepagiincógnitai.{\displaystyle \mu =\sum _{i=1}^{n}p_{i}x_{i}.}(Cuando se especifica una varianza ponderada  discreta mediante ponderaciones cuya suma no es 1, entonces se divide por la suma de las ponderaciones).

La varianza de una colección denorte{\displaystyle n}Los valores igualmente probables se pueden escribir como Var(incógnita)=1nortei=1norte(incógnitaiμ)2,{\displaystyle \operatorname {Var} (X)={\frac {1}{n}}\sum _{i=1}^{n}(x_{i}-\mu )^{2},} dóndeμ{\displaystyle \mu }es el valor promedio. Es decir, μ=1nortei=1norteincógnitai.{\displaystyle \mu ={\frac {1}{n}}\sum _{i=1}^{n}x_{i}.}

La varianza de un conjunto denorte{\displaystyle n}Los valores igualmente probables pueden expresarse de manera equivalente, sin referirse directamente a la media, en términos de desviaciones cuadradas de todas las distancias cuadradas por pares de puntos entre sí: [ 2 ]Var(incógnita)=1norte2i=1nortej=1norte12(incógnitaiincógnitaj)2=1norte2ij>i(incógnitaiincógnitaj)2.{\displaystyle \operatorname {Var} (X)={\frac {1}{n^{2}}}\sum _{i=1}^{n}\sum _{j=1}^{n}{\frac {1}{2}}{\left(x_{i}-x_{j}\right)}^{2}={\frac {1}{n^{2}}}\sum _{i}\sum _{j>i}{\left(x_{i}-x_{j}\right)}^{2}.}

Variable aleatoria absolutamente continua

Si la variable aleatoriaincógnita{\displaystyle X}tiene una función de densidad de probabilidadF(incógnita){\displaystyle f(x)}yF(incógnita){\displaystyle F(x)}es la función de distribución acumulativa correspondiente , entonces Var(incógnita)=σ2=R(incógnitaμ)2F(incógnita)dincógnita=Rincógnita2F(incógnita)dincógnita2μRincógnitaF(incógnita)dincógnita+μ2RF(incógnita)dincógnita=Rincógnita2dF(incógnita)2μRincógnitadF(incógnita)+μ2RdF(incógnita)=Rincógnita2dF(incógnita)2μμ+μ21=Rincógnita2dF(incógnita)μ2,{\displaystyle {\begin{aligned}\operatorname {Var} (X)=\sigma ^{2}&=\int _{\mathbb {R} }{\left(x-\mu \right)}^{2}f(x)\,dx\\[4pt]&=\int _{\mathbb {R} }x^{2}f(x)\,dx-2\mu \int _{\mathbb {R} }xf(x)\,dx+\mu ^{2}\int _{\mathbb {R} }f(x)\,dx\\[4pt]&=\int _{\mathbb {R} }x^{2}\,dF(x)-2\mu \int _{\mathbb {R} }x\,dF(x)+\mu ^{2}\int _{\mathbb {R} }\,dF(x)\\[4pt]&=\int _{\mathbb {R} }x^{2}\,dF(x)-2\mu \cdot \mu +\mu ^{2}\cdot 1\\[4pt]&=\int _{\mathbb {R} }x^{2}\,dF(x)-\mu ^{2},\end{aligned}}} o equivalentemente, Var(incógnita)=Rincógnita2F(incógnita)dincógnitaμ2,{\displaystyle \operatorname {Var} (X)=\int _{\mathbb {R} }x^{2}f(x)\,dx-\mu ^{2},} dóndeμ{\displaystyle \mu }es el valor esperado deincógnita{\displaystyle X}dado por μ=RincógnitaF(incógnita)dincógnita=RincógnitadF(incógnita).{\displaystyle \mu =\int _{\mathbb {R} }xf(x)\,dx=\int _{\mathbb {R} }x\,dF(x).}

En estas fórmulas, las integrales con respecto adincógnita{\displaystyle dx}ydF(incógnita){\displaystyle dF(x)}son las integrales de Lebesgue y Lebesgue-Stieltjes , respectivamente.

Si la funciónincógnita2F(incógnita){\displaystyle x^{2}f(x)}es integrable de Riemann en cada intervalo finito[a,b]R,{\displaystyle [a,b]\subset \mathbb {R} ,}entonces Var(incógnita)=+incógnita2F(incógnita)dincógnitaμ2,{\displaystyle \operatorname {Var} (X)=\int _{-\infty }^{+\infty }x^{2}f(x)\,dx-\mu ^{2},} donde la integral es una integral de Riemann impropia .

Ejemplos

Distribución exponencial

La distribución exponencial con parámetro λ>0{\displaystyle \lambda >0}es una distribución continua cuya función de densidad de probabilidad viene dada por F(incógnita)=λmiλincógnita{\displaystyle f(x)=\lambda e^{-\lambda x}} en el intervalo [ 0, ∞) . Se puede demostrar que su media es mi[incógnita]=0incógnitaλmiλincógnitadincógnita=1λ.{\displaystyle \operatorname {E} [X]=\int _{0}^{\infty }x\lambda e^{-\lambda x}\,dx={\frac {1}{\lambda }}.}

Utilizando la integración por partes y haciendo uso del valor esperado ya calculado, tenemos: mi[incógnita2]=0incógnita2λmiλincógnitadincógnita=[incógnita2miλincógnita]0+02incógnitamiλincógnitadincógnita=0+2λmi[incógnita]=2λ2.{\displaystyle {\begin{aligned}\operatorname {E} \left[X^{2}\right]&=\int _{0}^{\infty }x^{2}\lambda e^{-\lambda x}\,dx\\&={\left[-x^{2}e^{-\lambda x}\right]}_{0}^{\infty }+\int _{0}^{\infty }2xe^{-\lambda x}\,dx\\&=0+{\frac {2}{\lambda }}\operatorname {E} [X]\\&={\frac {2}{\lambda ^{2}}}.\end{aligned}}}

Por lo tanto, la varianza deincógnita{\displaystyle X} se da por Var(incógnita)=mi[incógnita2]mi[incógnita]2=2λ2(1λ)2=1λ2.{\displaystyle \operatorname {Var} (X)=\operatorname {E} \left[X^{2}\right]-\operatorname {E} [X]^{2}={\frac {2}{\lambda ^{2}}}-\left({\frac {1}{\lambda }}\right)^{2}={\frac {1}{\lambda ^{2}}}.}

Mueran justo

Un dado justo de seis caras puede modelarse como una variable aleatoria discreta ,incógnita{\displaystyle X} , con resultados del 1 al 6, cada uno con igual probabilidad 1/6. El valor esperado deincógnita{\displaystyle X}es(1+2+3+4+5+6)/6=7/2.{\displaystyle (1+2+3+4+5+6)/6=7/2.}Por lo tanto, la varianza deincógnita{\displaystyle X}esVar(incógnita)=i=1616(i72)2=16((5/2)2+(3/2)2+(1/2)2+(1/2)2+(3/2)2+(5/2)2)=35122.92.{\displaystyle {\begin{aligned}\operatorname {Var} (X)&=\sum _{i=1}^{6}{\frac {1}{6}}\left(i-{\frac {7}{2}}\right)^{2}\\[5pt]&={\frac {1}{6}}\left((-5/2)^{2}+(-3/2)^{2}+(-1/2)^{2}+(1/2)^{2}+(3/2)^{2}+(5/2)^{2}\right)\\[5pt]&={\frac {35}{12}}\approx 2.92.\end{aligned}}}

La fórmula general para la varianza del resultado ,incógnita{\displaystyle X} , de unnorte{\displaystyle n}-dado decaras es Var(incógnita)=mi(incógnita2)(mi(incógnita))2=1nortei=1nortei2(1nortei=1nortei)2=(norte+1)(2norte+1)6(norte+12)2=norte2112.{\displaystyle {\begin{aligned}\operatorname {Var} (X)&=\operatorname {E} \left(X^{2}\right)-(\operatorname {E} (X))^{2}\\[5pt]&={\frac {1}{n}}\sum _{i=1}^{n}i^{2}-\left({\frac {1}{n}}\sum _{i=1}^{n}i\right)^{2}\\[5pt]&={\frac {(n+1)(2n+1)}{6}}-\left({\frac {n+1}{2}}\right)^{2}\\[4pt]&={\frac {n^{2}-1}{12}}.\end{aligned}}}

Distribuciones de probabilidad de uso común

La siguiente tabla muestra la varianza de algunas distribuciones de probabilidad de uso común.

Propiedades

Propiedades básicas

La varianza es no negativa porque los cuadrados son positivos o cero: Var(incógnita)0.{\displaystyle \operatorname {Var} (X)\geq 0.}

La varianza de una constante es cero. Var(a)=0.{\displaystyle \operatorname {Var} (a)=0.}

Por el contrario, si la varianza de una variable aleatoria es 0, entonces casi con seguridad es una constante. Es decir, siempre tiene el mismo valor: Var(incógnita)=0a:PAG(incógnita=a)=1.{\displaystyle \operatorname {Var} (X)=0\iff \exists a:P(X=a)=1.}

Cuestiones de finitud

Si una distribución no tiene un valor esperado finito, como es el caso de la distribución de Cauchy , entonces la varianza tampoco puede ser finita. Sin embargo, algunas distribuciones pueden no tener una varianza finita, a pesar de que su valor esperado sea finito. Un ejemplo es una distribución de Pareto cuyo índicek{\displaystyle k}Satisface1<k2.{\displaystyle 1<k\leq 2.}

Descomposición

La fórmula general para la descomposición de la varianza o la ley de la varianza total es: Siincógnita{\displaystyle X}yY{\displaystyle Y}son dos variables aleatorias, y la varianza deincógnita{\displaystyle X}entonces existe Var[incógnita]=mi(Var[incógnitaY])+Var(mi[incógnitaY]).{\displaystyle \operatorname {Var} [X]=\operatorname {E} (\operatorname {Var} [X\mid Y])+\operatorname {Var} (\operatorname {E} [X\mid Y]).}

La expectativa condicionalmi(incógnitaY){\displaystyle \operatorname {E} (X\mid Y)}deincógnita{\displaystyle X}dadoY{\displaystyle Y}y la varianza condicionalVar(incógnitaY){\displaystyle \operatorname {Var} (X\mid Y)}puede entenderse de la siguiente manera. Dado cualquier valor particular y de  la variable aleatoria Y , existe una esperanza condicional mi(incógnitaY=y){\displaystyle \operatorname {E} (X\mid Y=y)} dado el evento Y = y . Esta cantidad depende del valor particular de y ; es una función.    gramo(y)=mi(incógnitaY=y){\displaystyle g(y)=\operatorname {E} (X\mid Y=y)}. Esa misma función evaluada en la variable aleatoria Y es la esperanza condicional mi(incógnitaY)=gramo(Y){\displaystyle \operatorname {E} (X\mid Y)=g(Y)}.

En particular, siY{\displaystyle Y}es una variable aleatoria discreta que toma valores posiblesy1,y2,y3{\displaystyle y_{1},y_{2},y_{3}\ldots }con probabilidades correspondientespag1,pag2,pag3,{\displaystyle p_{1},p_{2},p_{3}\ldots ,}, entonces en la fórmula para la varianza total, el primer término del lado derecho se convierte en mi(Var[incógnitaY])=ipagiσi2,{\displaystyle \operatorname {E} (\operatorname {Var} [X\mid Y])=\sum _{i}p_{i}\sigma _{i}^{2},} dóndeσi2=Var[incógnitaY=yi]{\displaystyle \sigma _{i}^{2}=\operatorname {Var} [X\mid Y=y_{i}]}. De manera similar, el segundo término del lado derecho se convierte en Var(mi[incógnitaY])=ipagiμi2(ipagiμi)2=ipagiμi2μ2,{\displaystyle \operatorname {Var} (\operatorname {E} [X\mid Y])=\sum _{i}p_{i}\mu _{i}^{2}-\left(\sum _{i}p_{i}\mu _{i}\right)^{2}=\sum _{i}p_{i}\mu _{i}^{2}-\mu ^{2},} donde1{\displaystyle {1}}yμ=ipagiμi{\displaystyle \textstyle \mu =\sum _{i}p_{i}\mu _{i}} . Por lo tanto, la varianza total viene dada por Var[incógnita]=ipagiσi2+(ipagiμi2μ2).{\displaystyle \operatorname {Var} [X]=\sum _{i}p_{i}\sigma _{i}^{2}+\left(\sum _{i}p_{i}\mu _{i}^{2}-\mu ^{2}\right).}

Una fórmula similar se aplica en el análisis de varianza , donde la fórmula correspondiente es METROStotal=METROSentre+METROSdentro;{\displaystyle {\mathit {MS}}_{\text{total}}={\mathit {MS}}_{\text{between}}+{\mathit {MS}}_{\text{within}};} aquíMETROS{\displaystyle {\mathit {MS}}}Se refiere a la media de los cuadrados. En el análisis de regresión lineal, la fórmula correspondiente es METROStotal=METROSregresión+METROSresidual.{\displaystyle {\mathit {MS}}_{\text{total}}={\mathit {MS}}_{\text{regression}}+{\mathit {MS}}_{\text{residual}}.}

Esto también se puede derivar de la aditividad de las varianzas, ya que la puntuación total (observada) es la suma de la puntuación predicha y la puntuación de error, donde estas dos últimas no están correlacionadas.

Descomposiciones similares son posibles para la suma de desviaciones al cuadrado (suma de cuadrados,SS{\displaystyle {\mathit {SS}}}): SStotal=SSentre+SSdentro,{\displaystyle {\mathit {SS}}_{\text{total}}={\mathit {SS}}_{\text{between}}+{\mathit {SS}}_{\text{within}},}SStotal=SSregresión+SSresidual.{\displaystyle {\mathit {SS}}_{\text{total}}={\mathit {SS}}_{\text{regression}}+{\mathit {SS}}_{\text{residual}}.}

Cálculo a partir de la función de distribución acumulada (CDF)

La varianza poblacional para una variable aleatoria no negativa puede expresarse en términos de la función de distribución acumulativa F utilizando 20(1F())d[0(1F())d]2.{\displaystyle 2\int _{0}^{\infty }u(1-F(u))\,du-{\left[\int _{0}^{\infty }(1-F(u))\,du\right]}^{2}.}

Esta expresión se puede utilizar para calcular la varianza en situaciones donde la función de distribución acumulada (CDF), pero no la densidad , se puede expresar de manera conveniente.

Propiedad característica

El segundo momento de una variable aleatoria alcanza el valor mínimo cuando se toma alrededor del primer momento (es decir, la media) de la variable aleatoria, es decirargramometroinortemetromi((incógnitametro)2)=mi(incógnita){\displaystyle \mathrm {argmin} _{m}\,\mathrm {E} \left(\left(X-m\right)^{2}\right)=\mathrm {E} (X)} . Por el contrario, si una función continuaφ{\displaystyle \varphi }Satisfaceargramometroinortemetromi(φ(incógnitametro))=mi(incógnita){\displaystyle \mathrm {argmin} _{m}\,\mathrm {E} (\varphi (X-m))=\mathrm {E} (X)}para todas las variables aleatorias X , entonces necesariamente tiene la formaφ(incógnita)=aincógnita2+b{\displaystyle \varphi (x)=ax^{2}+b} , donde a > 0 . Esto también se cumple en el caso multidimensional. [ 3 ]

Unidades de medida

A diferencia de la desviación absoluta esperada , la varianza de una variable tiene unidades que son el cuadrado de las unidades de la variable misma. Por ejemplo, una variable medida en metros tendrá una varianza medida en metros al cuadrado. Por esta razón, a menudo se prefiere describir los conjuntos de datos mediante su desviación estándar o desviación cuadrática media en lugar de usar la varianza. En el ejemplo de los dados , la desviación estándar es √2,9 ≈ 1,7 , ligeramente mayor que la desviación absoluta esperada de  1,5.

Tanto la desviación estándar como la desviación absoluta esperada pueden utilizarse como indicadores de la dispersión de una distribución. La desviación estándar es más fácil de manipular algebraicamente que la desviación absoluta esperada y, junto con la varianza y su generalización, la covarianza , se utiliza con frecuencia en estadística teórica; sin embargo, la desviación absoluta esperada tiende a ser más robusta, ya que es menos sensible a los valores atípicos derivados de anomalías en las mediciones o de una distribución con colas excesivamente pesadas .

Propagación

Suma y multiplicación por una constante

La varianza es invariante con respecto a los cambios en un parámetro de localización . Es decir, si se suma una constante a todos los valores de la variable, la varianza no cambia: Var(incógnita+a)=Var(incógnita).{\displaystyle \operatorname {Var} (X+a)=\operatorname {Var} (X).}

Si todos los valores se escalan por una constante, la varianza se escala por el cuadrado de esa constante: Var(aincógnita)=a2Var(incógnita).{\displaystyle \operatorname {Var} (aX)=a^{2}\operatorname {Var} (X).}

La varianza de la suma de dos variables aleatorias viene dada por Var(aincógnita+bY)=a2Var(incógnita)+b2Var(Y)+2abCov(incógnita,Y)Var(aincógnitabY)=a2Var(incógnita)+b2Var(Y)2abCov(incógnita,Y){\displaystyle {\begin{aligned}\operatorname {Var} (aX+bY)&=a^{2}\operatorname {Var} (X)+b^{2}\operatorname {Var} (Y)+2ab\,\operatorname {Cov} (X,Y)\\[1ex]\operatorname {Var} (aX-bY)&=a^{2}\operatorname {Var} (X)+b^{2}\operatorname {Var} (Y)-2ab\,\operatorname {Cov} (X,Y)\end{aligned}}} dóndeCov(incógnita,Y){\displaystyle \operatorname {Cov} (X,Y)}es la covarianza .

Combinaciones lineales

En general, para la suma denorte{\displaystyle N}variables aleatorias{incógnita1,,incógnitanorte}{\displaystyle \{X_{1},\dots ,X_{N}\}} , la varianza se convierte en: Var(i=1norteincógnitai)=i,j=1norteCov(incógnitai,incógnitaj)=i=1norteVar(incógnitai)+i,j=1,ijnorteCov(incógnitai,incógnitaj),{\displaystyle \operatorname {Var} \left(\sum _{i=1}^{N}X_{i}\right)=\sum _{i,j=1}^{N}\operatorname {Cov} (X_{i},X_{j})=\sum _{i=1}^{N}\operatorname {Var} (X_{i})+\sum _{i,j=1,i\neq j}^{N}\operatorname {Cov} (X_{i},X_{j}),} Véase también la identidad del general Bienaymé .

Estos resultados conducen a la varianza de una combinación lineal como: Var(i=1norteaiincógnitai)=i,j=1norteaiajCov(incógnitai,incógnitaj)=i=1norteai2Var(incógnitai)+ijaiajCov(incógnitai,incógnitaj)=i=1norteai2Var(incógnitai)+21i<jnorteaiajCov(incógnitai,incógnitaj).{\displaystyle {\begin{aligned}\operatorname {Var} \left(\sum _{i=1}^{N}a_{i}X_{i}\right)&=\sum _{i,j=1}^{N}a_{i}a_{j}\operatorname {Cov} (X_{i},X_{j})\\&=\sum _{i=1}^{N}a_{i}^{2}\operatorname {Var} (X_{i})+\sum _{i\neq j}a_{i}a_{j}\operatorname {Cov} (X_{i},X_{j})\\&=\sum _{i=1}^{N}a_{i}^{2}\operatorname {Var} (X_{i})+2\sum _{1\leq i<j\leq N}a_{i}a_{j}\operatorname {Cov} (X_{i},X_{j}).\end{aligned}}}

Si las variables aleatoriasincógnita1,,incógnitanorte{\displaystyle X_{1},\dots ,X_{N}}son tales que Cov(incógnitai,incógnitaj)=0 ,  (ij),{\displaystyle \operatorname {Cov} (X_{i},X_{j})=0\ ,\ \forall \ (i\neq j),} Entonces se dice que no están correlacionadas . De la expresión dada anteriormente se deduce inmediatamente que si las variables aleatoriasincógnita1,,incógnitanorte{\displaystyle X_{1},\dots ,X_{N}}Si no están correlacionadas, entonces la varianza de su suma es igual a la suma de sus varianzas, o, expresado simbólicamente: Var(i=1norteincógnitai)=i=1norteVar(incógnitai).{\displaystyle \operatorname {Var} \left(\sum _{i=1}^{N}X_{i}\right)=\sum _{i=1}^{N}\operatorname {Var} (X_{i}).}

Dado que las variables aleatorias independientes siempre están incorrelacionadas (véase Covarianza §  Incorrelación e independencia ), la ecuación anterior se cumple en particular cuando las variables aleatoriasincógnita1,,incógnitanorte{\displaystyle X_{1},\dots ,X_{n}}son independientes. Por lo tanto, la independencia es suficiente pero no necesaria para que la varianza de la suma sea igual a la suma de las varianzas.

Notación matricial para la varianza de una combinación lineal

Definirincógnita{\displaystyle X}como vector columna denorte{\displaystyle n}variables aleatoriasincógnita1,,incógnitanorte{\displaystyle X_{1},\ldots ,X_{n}}ydo{\displaystyle c}como vector columna denorte{\displaystyle n}escalaresdo1,,donorte{\displaystyle c_{1},\ldots ,c_{n}} . Por lo tanto,doTincógnita{\displaystyle c^{\mathsf {T}}X}es una combinación lineal de estas variables aleatorias, dondedoT{\displaystyle c^{\mathsf {T}}}denota la transpuesta de do{\displaystyle c} . También dejaΣ{\displaystyle \Sigma }sea ​​la matriz de covarianza deincógnita{\displaystyle X} . La varianza dedoTincógnita{\displaystyle c^{\mathsf {T}}X}entonces viene dado por: [ 4 ]Var(doTincógnita)=doTΣdo.{\displaystyle \operatorname {Var} \left(c^{\mathsf {T}}X\right)=c^{\mathsf {T}}\Sigma c.}

Esto implica que la varianza de la media se puede escribir como (con un vector columna de unos) Var(incógnita¯)=Var(1norte1incógnita)=1norte21Σ1.{\displaystyle \operatorname {Var} \left({\bar {x}}\right)=\operatorname {Var} \left({\frac {1}{n}}1'X\right)={\frac {1}{n^{2}}}1'\Sigma 1.}

Suma de variables

Suma de variables no correlacionadas

Una de las razones para utilizar la varianza en lugar de otras medidas de dispersión es que la varianza de la suma (o la diferencia) de variables aleatorias no correlacionadas es la suma de sus varianzas: Var(i=1norteincógnitai)=i=1norteVar(incógnitai).{\displaystyle \operatorname {Var} \left(\sum _{i=1}^{n}X_{i}\right)=\sum _{i=1}^{n}\operatorname {Var} (X_{i}).}

Esta afirmación se denomina fórmula de Bienaymé [ 5 ] y fue descubierta en 1853. [ 6 ] [ 7 ] A menudo se formula con la condición más estricta de que las variables sean independientes , pero basta con que no estén correlacionadas. Así, si todas las variables tienen la misma varianza σ 2 , entonces, dado que la división por n es una transformación lineal, esta fórmula implica inmediatamente que la varianza de su media es Var(incógnita¯)=Var(1nortei=1norteincógnitai)=1norte2i=1norteVar(incógnitai)=1norte2norteσ2=σ2norte.{\displaystyle \operatorname {Var} \left({\overline {X}}\right)=\operatorname {Var} \left({\frac {1}{n}}\sum _{i=1}^{n}X_{i}\right)={\frac {1}{n^{2}}}\sum _{i=1}^{n}\operatorname {Var} \left(X_{i}\right)={\frac {1}{n^{2}}}n\sigma ^{2}={\frac {\sigma ^{2}}{n}}.}

Es decir, la varianza de la media disminuye cuando n aumenta. Esta fórmula para la varianza de la media se utiliza en la definición del error estándar de la media muestral, que a su vez se utiliza en el teorema del límite central .

Para probar la afirmación inicial, basta con demostrar que Var(incógnita+Y)=Var(incógnita)+Var(Y).{\displaystyle \operatorname {Var} (X+Y)=\operatorname {Var} (X)+\operatorname {Var} (Y).}

El resultado general se deduce entonces por inducción. Partiendo de la definición, Var(incógnita+Y)=mi[(incógnita+Y)2](mi[incógnita+Y])2=mi[incógnita2+2incógnitaY+Y2](mi[incógnita]+mi[Y])2.{\displaystyle {\begin{aligned}\operatorname {Var} (X+Y)&=\operatorname {E} \left[(X+Y)^{2}\right]-(\operatorname {E} [X+Y])^{2}\\[5pt]&=\operatorname {E} \left[X^{2}+2XY+Y^{2}\right]-(\operatorname {E} [X]+\operatorname {E} [Y])^{2}.\end{aligned}}}

Utilizando la linealidad del operador de esperanza matemática y la suposición de independencia (o falta de correlación) entre X e Y , esto se simplifica aún más de la siguiente manera: Var(incógnita+Y)=mi[incógnita2]+2mi[incógnitaY]+mi[Y2](mi[incógnita]2+2mi[incógnita]mi[Y]+mi[Y]2)=mi[incógnita2]+mi[Y2]mi[incógnita]2mi[Y]2=Var(incógnita)+Var(Y).{\displaystyle {\begin{aligned}\operatorname {Var} (X+Y)&=\operatorname {E} {\left[X^{2}\right]}+2\operatorname {E} [XY]+\operatorname {E} {\left[Y^{2}\right]}-\left(\operatorname {E} [X]^{2}+2\operatorname {E} [X]\operatorname {E} [Y]+\operatorname {E} [Y]^{2}\right)\\[5pt]&=\operatorname {E} \left[X^{2}\right]+\operatorname {E} \left[Y^{2}\right]-\operatorname {E} [X]^{2}-\operatorname {E} [Y]^{2}\\[5pt]&=\operatorname {Var} (X)+\operatorname {Var} (Y).\end{aligned}}}

Suma de variables correlacionadas

Suma de variables correlacionadas con tamaño de muestra fijo

En general, la varianza de la suma de n variables es la suma de sus covarianzas : Var(i=1norteincógnitai)=i=1nortej=1norteCov(incógnitai,incógnitaj)=i=1norteVar(incógnitai)+21i<jnorteCov(incógnitai,incógnitaj).{\displaystyle \operatorname {Var} \left(\sum _{i=1}^{n}X_{i}\right)=\sum _{i=1}^{n}\sum _{j=1}^{n}\operatorname {Cov} \left(X_{i},X_{j}\right)=\sum _{i=1}^{n}\operatorname {Var} \left(X_{i}\right)+2\sum _{1\leq i<j\leq n}\operatorname {Cov} \left(X_{i},X_{j}\right).} (Nota: La segunda igualdad proviene del hecho de que Cov( X i , X i ) = Var( X i ) .)

Aquí,Cov(,){\displaystyle \operatorname {Cov} (\cdot ,\cdot )}es la covarianza , que es cero para variables aleatorias independientes (si existe). La fórmula establece que la varianza de una suma es igual a la suma de todos los elementos de la matriz de covarianza de los componentes. La siguiente expresión establece de forma equivalente que la varianza de la suma es la suma de la diagonal de la matriz de covarianza más dos veces la suma de sus elementos triangulares superiores (o sus elementos triangulares inferiores); esto enfatiza que la matriz de covarianza es simétrica. Esta fórmula se utiliza en la teoría del alfa de Cronbach en la teoría clásica de pruebas .

Entonces, si las variables tienen varianza igual σ² y la correlación promedio de variables distintas es ρ , entonces la varianza de su media es Var(incógnita¯)=σ2norte+norte1norteρσ2.{\displaystyle \operatorname {Var} \left({\overline {X}}\right)={\frac {\sigma ^{2}}{n}}+{\frac {n-1}{n}}\rho \sigma ^{2}.}

Esto implica que la varianza de la media aumenta con el promedio de las correlaciones. En otras palabras, las observaciones correlacionadas adicionales no son tan efectivas como las observaciones independientes adicionales para reducir la incertidumbre de la media . Además, si las variables tienen varianza unitaria, por ejemplo, si están estandarizadas, entonces esto se simplifica a Var(incógnita¯)=1norte+norte1norteρ.{\displaystyle \operatorname {Var} \left({\overline {X}}\right)={\frac {1}{n}}+{\frac {n-1}{n}}\rho .}

Esta fórmula se utiliza en la fórmula de predicción de Spearman-Brown de la teoría clásica de pruebas. Converge a ρ si n tiende a infinito, siempre que la correlación promedio permanezca constante o también converja. Por lo tanto, para la varianza de la media de variables estandarizadas con correlaciones iguales o correlación promedio convergente, tenemos: límitenorteVar(incógnita¯)=ρ.{\displaystyle \lim _{n\to \infty }\operatorname {Var} \left({\overline {X}}\right)=\rho .}

Por lo tanto, la varianza de la media de un gran número de variables estandarizadas es aproximadamente igual a su correlación promedio. Esto deja claro que la media muestral de variables correlacionadas generalmente no converge a la media poblacional, aunque la ley de los grandes números establece que la media muestral sí convergerá para variables independientes.

Suma de variables no correlacionadas con tamaño de muestra aleatorio

Hay casos en que se toma una muestra sin saber de antemano cuántas observaciones serán aceptables según algún criterio. En tales casos, el tamaño de la muestra N es una variable aleatoria cuya variación se suma a la variación de X , de tal manera que, [ 8 ]Var(i=1norteincógnitai)=mi[norte]Var(incógnita)+Var(norte)(mi[incógnita])2{\displaystyle \operatorname {Var} \left(\sum _{i=1}^{N}X_{i}\right)=\operatorname {E} \left[N\right]\operatorname {Var} (X)+\operatorname {Var} (N)(\operatorname {E} \left[X\right])^{2}} lo cual se deduce de la ley de la varianza total .

Si N tiene una distribución de Poisson , entoncesmi[norte]=Var(norte){\displaystyle \operatorname {E} [N]=\operatorname {Var} (N)}con estimador n = N . Por lo tanto, el estimador deVar(i=1norteincógnitai){\displaystyle \textstyle \operatorname {Var} \left(\sum _{i=1}^{n}X_{i}\right)}se convierte ennorteSincógnita2+norteincógnita¯2{\displaystyle \textstyle n{S_{x}}^{2}+n{\bar {X}}^{2}} , dandoSE(incógnita¯)=(Sincógnita2+incógnita¯2)/norte{\displaystyle \textstyle \operatorname {SE} ({\bar {X}})={\sqrt {{({S_{x}}^{2}+{\bar {X}}^{2})}/{n}}}} (véase Error estándar §  Error estándar de la media muestral ).

Suma ponderada de variables

La propiedad de escala y la fórmula de Bienaymé, junto con la propiedad de la covarianza Cov( aX , bY ) = ab Cov( X , Y )   implican conjuntamente que Var(aincógnita±bY)=a2Var(incógnita)+b2Var(Y)±2abCov(incógnita,Y).{\displaystyle \operatorname {Var} (aX\pm bY)=a^{2}\operatorname {Var} (X)+b^{2}\operatorname {Var} (Y)\pm 2ab\,\operatorname {Cov} (X,Y).}

Esto implica que, en una suma ponderada de variables, la variable con el mayor peso tendrá un peso desproporcionadamente grande en la varianza total. Por ejemplo, si X e Y no están correlacionadas y el peso de X es el doble que el de Y , entonces el peso de la varianza de X será cuatro veces mayor que el de la varianza de Y.

La expresión anterior puede extenderse a una suma ponderada de múltiples variables: Var(inorteaiincógnitai)=i=1norteai2Var(incógnitai)+21i<jnorteaiajCov(incógnitai,incógnitaj){\displaystyle \operatorname {Var} \left(\sum _{i}^{n}a_{i}X_{i}\right)=\sum _{i=1}^{n}a_{i}^{2}\operatorname {Var} (X_{i})+2\sum _{1\leq i}\sum _{<j\leq n}a_{i}a_{j}\operatorname {Cov} (X_{i},X_{j})}

Producto de variables

Producto de variables independientes

Si dos variables X e Y son independientes , la varianza de su producto viene dada por [ 9 ].Var(incógnitaY)=[mi(incógnita)]2Var(Y)+[mi(Y)]2Var(incógnita)+Var(incógnita)Var(Y).{\displaystyle \operatorname {Var} (XY)=[\operatorname {E} (X)]^{2}\operatorname {Var} (Y)+[\operatorname {E} (Y)]^{2}\operatorname {Var} (X)+\operatorname {Var} (X)\operatorname {Var} (Y).}

De forma equivalente, utilizando las propiedades básicas de la esperanza matemática, se obtiene mediante: Var(incógnitaY)=mi(incógnita2)mi(Y2)[mi(incógnita)]2[mi(Y)]2.{\displaystyle \operatorname {Var} (XY)=\operatorname {E} \left(X^{2}\right)\operatorname {E} \left(Y^{2}\right)-[\operatorname {E} (X)]^{2}[\operatorname {E} (Y)]^{2}.}

Producto de variables estadísticamente dependientes

En general, si dos variables son estadísticamente dependientes, entonces la varianza de su producto viene dada por:

Var(incógnitaY)=mi[incógnita2Y2][mi(incógnitaY)]2=Cov(incógnita2,Y2)+mi(incógnita2)mi(Y2)[mi(incógnitaY)]2=Cov(incógnita2,Y2)+(Var(incógnita)+[mi(incógnita)]2)(Var(Y)+[mi(Y)]2)[Cov(incógnita,Y)+mi(incógnita)mi(Y)]2{\displaystyle {\begin{aligned}\operatorname {Var} (XY)={}&\operatorname {E} \left[X^{2}Y^{2}\right]-[\operatorname {E} (XY)]^{2}\\[5pt]={}&\operatorname {Cov} \left(X^{2},Y^{2}\right)+\operatorname {E} (X^{2})\operatorname {E} \left(Y^{2}\right)-[\operatorname {E} (XY)]^{2}\\[5pt]={}&\operatorname {Cov} \left(X^{2},Y^{2}\right)+\left(\operatorname {Var} (X)+[\operatorname {E} (X)]^{2}\right)\left(\operatorname {Var} (Y)+[\operatorname {E} (Y)]^{2}\right)\\[5pt]&-[\operatorname {Cov} (X,Y)+\operatorname {E} (X)\operatorname {E} (Y)]^{2}\end{aligned}}}

Funciones arbitrarias

El método delta utiliza expansiones de Taylor de segundo orden para aproximar la varianza de una función de una o más variables aleatorias (véase Expansiones de Taylor para los momentos de funciones de variables aleatorias ). Por ejemplo, la varianza aproximada de una función de una variable viene dada por Var[F(incógnita)](F(mi[incógnita]))2Var[incógnita]{\displaystyle \operatorname {Var} \left[f(X)\right]\approx \left(f'(\operatorname {E} \left[X\right])\right)^{2}\operatorname {Var} \left[X\right]} siempre que f sea dos veces diferenciable y que la media y la varianza de X sean finitas.

Varianza poblacional y varianza muestral

Las observaciones del mundo real, como las mediciones de la lluvia de ayer a lo largo del día, generalmente no constituyen conjuntos completos de todas las observaciones posibles. Por lo tanto, la varianza calculada a partir del conjunto finito no coincidirá, en general, con la varianza que se habría calculado a partir de la población total de observaciones posibles. Esto significa que la media y la varianza se estiman a partir de un conjunto limitado de observaciones mediante una ecuación de estimación . El estimador es una función de la muestra de n observaciones extraídas sin sesgo de observación de toda la población de observaciones potenciales. En este ejemplo, la muestra sería el conjunto de mediciones reales de la lluvia de ayer obtenidas de los pluviómetros disponibles en la zona geográfica de interés.

Los estimadores más simples para la media y la varianza poblacionales son simplemente la media y la varianza de la muestra, la media muestral y la varianza muestral (sin corregir) ; estos son estimadores consistentes (convergen al valor de toda la población a medida que aumenta el número de muestras), pero pueden mejorarse. De la forma más simple, la varianza muestral se calcula como la suma de las desviaciones al cuadrado alrededor de la media (muestral), dividida por n como el número de muestras. Sin embargo, usar valores distintos de n mejora el estimador de varias maneras. Cuatro valores comunes para el denominador son n , n − 1 , n + 1 y n − 1.5 : n es el más simple (la varianza de la muestra), n − 1 elimina el sesgo, [ 10 ] n + 1 minimiza el error cuadrático medio para la distribución normal, [ 11 ] y n − 1.5 elimina en gran medida el sesgo en la estimación insesgada de la desviación estándar para la distribución normal. [ 12 ]

En primer lugar, si se desconoce la media poblacional verdadera, la varianza muestral (que utiliza la media muestral en lugar de la media verdadera) es un estimador sesgado : subestima la varianza por un factor de ( n − 1) / n ; corregir este factor, lo que resulta en la suma de las desviaciones al cuadrado alrededor de la media muestral dividida por n − 1 en lugar de n , se llama corrección de Bessel . [ 10 ] El estimador resultante es insesgado y se llama varianza muestral (corregida) o varianza muestral insesgada . Si la media se determina de alguna otra manera que no sea a partir de las mismas muestras utilizadas para estimar la varianza, entonces este sesgo no surge, y la varianza puede estimarse con seguridad como la de las muestras alrededor de la media (conocida independientemente).

En segundo lugar, la varianza muestral generalmente no minimiza el error cuadrático medio entre la varianza muestral y la varianza poblacional. Corregir el sesgo a menudo empeora esto: siempre se puede elegir un factor de escala que funcione mejor que la varianza muestral corregida, aunque el factor de escala óptimo depende de la curtosis de exceso de la población (ver Error cuadrático medio §  Varianza ) e introduce sesgo. Esto siempre consiste en reducir el estimador insesgado (dividiendo por un número mayor que n − 1 ) y es un ejemplo simple de un estimador de contracción : se "contrae" el estimador insesgado hacia cero. Para la distribución normal, dividir por n + 1 (en lugar de n − 1 o n ) minimiza el error cuadrático medio. [ 11 ] Sin embargo, el estimador resultante está sesgado y se conoce como variación muestral sesgada .

varianza poblacional

En general, la varianza poblacional de una población finita de tamaño norte{\displaystyle N}con valores x i viene dado por σ2=1nortei=1norte(incógnitaiμ)2=1nortei=1norte(incógnitai22μincógnitai+μ2)=(1nortei=1norteincógnitai2)2μ(1nortei=1norteincógnitai)+μ2=mi[incógnitai2]μ2,{\displaystyle {\begin{aligned}\sigma ^{2}&={\frac {1}{N}}\sum _{i=1}^{N}{\left(x_{i}-\mu \right)}^{2}={\frac {1}{N}}\sum _{i=1}^{N}\left(x_{i}^{2}-2\mu x_{i}+\mu ^{2}\right)\\[5pt]&=\left({\frac {1}{N}}\sum _{i=1}^{N}x_{i}^{2}\right)-2\mu \left({\frac {1}{N}}\sum _{i=1}^{N}x_{i}\right)+\mu ^{2}\\[5pt]&=\operatorname {E} [x_{i}^{2}]-\mu ^{2},\end{aligned}}} donde la media poblacional esμ=mi[incógnitai]=1nortei=1norteincógnitai{\textstyle \mu =\operatorname {E} [x_{i}]={\frac {1}{N}}\sum _{i=1}^{N}x_{i}}ymi[incógnitai2]=(1nortei=1norteincógnitai2){\displaystyle \textstyle \operatorname {E} [x_{i}^{2}]=\left({\frac {1}{N}}\sum _{i=1}^{N}x_{i}^{2}\right)}, dondemi{\textstyle \operatorname {E} }es el operador de valor esperado .

La varianza poblacional también se puede calcular utilizando [ 13 ].σ2=1norte2i<j(incógnitaiincógnitaj)2=12norte2i,j=1norte(incógnitaiincógnitaj)2.{\displaystyle \sigma ^{2}={\frac {1}{N^{2}}}\sum _{i<j}\left(x_{i}-x_{j}\right)^{2}={\frac {1}{2N^{2}}}\sum _{i,j=1}^{N}\left(x_{i}-x_{j}\right)^{2}.}

(El lado derecho tiene términos duplicados en la suma, mientras que el lado central solo tiene términos únicos para sumar). Esto es cierto porque 12norte2i,j=1norte(incógnitaiincógnitaj)2=12norte2i,j=1norte(incógnitai22incógnitaiincógnitaj+incógnitaj2)=12nortej=1norte(1nortei=1norteincógnitai2)(1nortei=1norteincógnitai)(1nortej=1norteincógnitaj)+12nortei=1norte(1nortej=1norteincógnitaj2)=12(σ2+μ2)μ2+12(σ2+μ2)=σ2.{\displaystyle {\begin{aligned}&{\frac {1}{2N^{2}}}\sum _{i,j=1}^{N}{\left(x_{i}-x_{j}\right)}^{2}\\[5pt]={}&{\frac {1}{2N^{2}}}\sum _{i,j=1}^{N}\left(x_{i}^{2}-2x_{i}x_{j}+x_{j}^{2}\right)\\[5pt]={}&{\frac {1}{2N}}\sum _{j=1}^{N}\left({\frac {1}{N}}\sum _{i=1}^{N}x_{i}^{2}\right)-\left({\frac {1}{N}}\sum _{i=1}^{N}x_{i}\right)\left({\frac {1}{N}}\sum _{j=1}^{N}x_{j}\right)+{\frac {1}{2N}}\sum _{i=1}^{N}\left({\frac {1}{N}}\sum _{j=1}^{N}x_{j}^{2}\right)\\[5pt]={}&{\frac {1}{2}}\left(\sigma ^{2}+\mu ^{2}\right)-\mu ^{2}+{\frac {1}{2}}\left(\sigma ^{2}+\mu ^{2}\right)\\[5pt]={}&\sigma ^{2}.\end{aligned}}}

La varianza poblacional coincide con la varianza de la distribución de probabilidad generadora. En este sentido, el concepto de población puede extenderse a variables aleatorias continuas con poblaciones infinitas.

Varianza de la muestra

Varianza de muestra sesgada

En muchas situaciones prácticas, la varianza real de una población no se conoce a priori y debe calcularse de alguna manera. Cuando se trata de poblaciones extremadamente grandes, no es posible contar todos los elementos de la población, por lo que el cálculo debe realizarse sobre una muestra de la misma. [ 14 ] Esto se conoce generalmente como varianza muestral o varianza empírica . La varianza muestral también puede aplicarse a la estimación de la varianza de una distribución continua a partir de una muestra de dicha distribución.

Tomamos una muestra con reemplazo de norte{\displaystyle n} valores Y 1 , ..., Y n de la población de tamañonorte{\displaystyle N} , donde n < N , y estimar la varianza sobre la base de esta muestra. [ 15 ] Tomar directamente la varianza de los datos de la muestra da el promedio de las desviaciones al cuadrado : [ 16 ]S~Y2=1nortei=1norte(YiY¯)2=(1nortei=1norteYi2)Y¯2=1norte2i,j:i<j(YiYj)2.{\displaystyle {\tilde {S}}_{Y}^{2}={\frac {1}{n}}\sum _{i=1}^{n}\left(Y_{i}-{\overline {Y}}\right)^{2}=\left({\frac {1}{n}}\sum _{i=1}^{n}Y_{i}^{2}\right)-{\overline {Y}}^{2}={\frac {1}{n^{2}}}\sum _{i,j\,:\,i<j}\left(Y_{i}-Y_{j}\right)^{2}.} (Véase la sección §  Varianza poblacional para la derivación de esta fórmula). Aquí,Y¯{\displaystyle {\overline {Y}}}denota la media de la muestra : Y¯=1nortei=1norteYi.{\displaystyle {\overline {Y}}={\frac {1}{n}}\sum _{i=1}^{n}Y_{i}.}

Dado que los Y i se seleccionan aleatoriamente, ambosY¯{\displaystyle {\overline {Y}}}yS~Y2{\displaystyle {\tilde {S}}_{Y}^{2}}son variables aleatorias . Sus valores esperados pueden evaluarse promediando sobre el conjunto de todas las muestras posibles { Y i } de tamaño norte{\displaystyle n}de la población. ParaS~Y2{\displaystyle {\tilde {S}}_{Y}^{2}}Esto da como resultado: mi[S~Y2]=mi[1nortei=1norte(Yi1nortej=1norteYj)2]=1nortei=1nortemi[Yi22norteYij=1norteYj+1norte2j=1norteYjk=1norteYk]=1nortei=1norte(mi[Yi2]2norte(jimi[YiYj]+mi[Yi2])+1norte2j=1nortekjnortemi[YjYk]+1norte2j=1nortemi[Yj2])=1nortei=1norte(norte2nortemi[Yi2]2nortejimi[YiYj]+1norte2j=1nortekjnortemi[YjYk]+1norte2j=1nortemi[Yj2])=1nortei=1norte[norte2norte(σ2+μ2)2norte(norte1)μ2+1norte2norte(norte1)μ2+1norte(σ2+μ2)]=norte1norteσ2.{\displaystyle {\begin{aligned}\operatorname {E} [{\tilde {S}}_{Y}^{2}]&=\operatorname {E} \left[{\frac {1}{n}}\sum _{i=1}^{n}{\left(Y_{i}-{\frac {1}{n}}\sum _{j=1}^{n}Y_{j}\right)}^{2}\right]\\[5pt]&={\frac {1}{n}}\sum _{i=1}^{n}\operatorname {E} \left[Y_{i}^{2}-{\frac {2}{n}}Y_{i}\sum _{j=1}^{n}Y_{j}+{\frac {1}{n^{2}}}\sum _{j=1}^{n}Y_{j}\sum _{k=1}^{n}Y_{k}\right]\\[5pt]&={\frac {1}{n}}\sum _{i=1}^{n}\left(\operatorname {E} \left[Y_{i}^{2}\right]-{\frac {2}{n}}\left(\sum _{j\neq i}\operatorname {E} \left[Y_{i}Y_{j}\right]+\operatorname {E} \left[Y_{i}^{2}\right]\right)+{\frac {1}{n^{2}}}\sum _{j=1}^{n}\sum _{k\neq j}^{n}\operatorname {E} \left[Y_{j}Y_{k}\right]+{\frac {1}{n^{2}}}\sum _{j=1}^{n}\operatorname {E} \left[Y_{j}^{2}\right]\right)\\[5pt]&={\frac {1}{n}}\sum _{i=1}^{n}\left({\frac {n-2}{n}}\operatorname {E} \left[Y_{i}^{2}\right]-{\frac {2}{n}}\sum _{j\neq i}\operatorname {E} \left[Y_{i}Y_{j}\right]+{\frac {1}{n^{2}}}\sum _{j=1}^{n}\sum _{k\neq j}^{n}\operatorname {E} \left[Y_{j}Y_{k}\right]+{\frac {1}{n^{2}}}\sum _{j=1}^{n}\operatorname {E} \left[Y_{j}^{2}\right]\right)\\[5pt]&={\frac {1}{n}}\sum _{i=1}^{n}\left[{\frac {n-2}{n}}\left(\sigma ^{2}+\mu ^{2}\right)-{\frac {2}{n}}(n-1)\mu ^{2}+{\frac {1}{n^{2}}}n(n-1)\mu ^{2}+{\frac {1}{n}}\left(\sigma ^{2}+\mu ^{2}\right)\right]\\[5pt]&={\frac {n-1}{n}}\sigma ^{2}.\end{aligned}}}

Aquíσ2=mi[Yi2]μ2{\textstyle \sigma ^{2}=\operatorname {E} [Y_{i}^{2}]-\mu ^{2}}La varianza poblacional derivada en la sección es ymi[YiYj]=mi[Yi]mi[Yj]=μ2{\textstyle \operatorname {E} [Y_{i}Y_{j}]=\operatorname {E} [Y_{i}]\operatorname {E} [Y_{j}]=\mu ^{2}}debido a la independencia deYi{\displaystyle Y_{i}}yYj{\displaystyle Y_{j}}.

Por esoS~Y2{\textstyle {\tilde {S}}_{Y}^{2}}proporciona una estimación de la varianza poblacionalσ2{\textstyle \sigma ^{2}}que está sesgado por un factor denorte1norte{\textstyle {\frac {n-1}{n}}}porque el valor esperado deS~Y2{\textstyle {\tilde {S}}_{Y}^{2}}es menor que la varianza poblacional (varianza verdadera) por ese factor. Por esta razón,S~Y2{\textstyle {\tilde {S}}_{Y}^{2}}se denomina varianza de muestra sesgada .

Varianza de muestra insesgada

La corrección de este sesgo produce la varianza de muestra insesgada , denotada por S2{\displaystyle S^{2}}:S2=nortenorte1S~Y2=nortenorte1[1nortei=1norte(YiY¯)2]=1norte1i=1norte(YiY¯)2{\displaystyle S^{2}={\frac {n}{n-1}}{\tilde {S}}_{Y}^{2}={\frac {n}{n-1}}\left[{\frac {1}{n}}\sum _{i=1}^{n}\left(Y_{i}-{\overline {Y}}\right)^{2}\right]={\frac {1}{n-1}}\sum _{i=1}^{n}\left(Y_{i}-{\overline {Y}}\right)^{2}}

Cualquiera de los dos estimadores puede denominarse simplemente varianza muestral cuando el contexto permite determinar la versión. La misma demostración es aplicable también a muestras extraídas de una distribución de probabilidad continua.

El uso del término n − 1 se denomina corrección de Bessel y también se utiliza en la covarianza muestral y la desviación estándar muestral (la raíz cuadrada de la varianza). La raíz cuadrada es una función cóncava y, por lo tanto, introduce un sesgo negativo (según la desigualdad de Jensen ), que depende de la distribución; en consecuencia, la desviación estándar muestral corregida (mediante la corrección de Bessel) está sesgada. La estimación insesgada de la desviación estándar es un problema técnicamente complejo, aunque para la distribución normal, el uso del término n − 1,5 produce un estimador casi insesgado.

La varianza de muestra insesgada es una estadística U para la función f ( y 1 , y 2 ) = ( y 1y 2 ) 2 /2 , lo que significa que se obtiene promediando una estadística de 2 muestras sobre subconjuntos de 2 elementos de la población.

Ejemplo

Para un conjunto de números {10, 15, 30, 45, 57, 52, 63, 72, 81, 93, 102, 105} , si este conjunto es la población total de datos para alguna medición, entonces la varianza es la varianza poblacional 932.743 como la suma de las desviaciones al cuadrado alrededor de la media de este conjunto, dividida por 12 como el número de miembros del conjunto. Si el conjunto es una muestra de toda la población, entonces la varianza muestral insesgada se puede calcular como 1017.538 que es la suma de las desviaciones al cuadrado alrededor de la media de la muestra, dividida por 11 en lugar de 12. Una función VAR.S en Microsoft Excel proporciona la varianza muestral insesgada, mientras que VAR.P es para la varianza poblacional.

Distribución de la varianza muestral

Distribución y distribución acumulativa de S 2 / σ 2 , para varios valores de ν = n − 1, cuando los y i son independientes y están distribuidos normalmente.

Al ser una función de variables aleatorias , la varianza muestral es en sí misma una variable aleatoria, y es natural estudiar su distribución. En el caso de que Y i sean observaciones independientes de una distribución normal , el teorema de Cochran muestra que la varianza muestral insesgada S 2 sigue una distribución chi-cuadrado escalada (véase también: propiedades asintóticas y una demostración elemental ): [ 17 ](norte1)S2σ2χnorte12,{\displaystyle (n-1){\frac {S^{2}}{\sigma ^{2}}}\sim \chi _{n-1}^{2},} donde σ² es la varianza poblacional . Como consecuencia directa, se deduce quemi(S2)=mi(σ2norte1χnorte12)=σ2,{\displaystyle \operatorname {E} \left(S^{2}\right)=\operatorname {E} \left({\frac {\sigma ^{2}}{n-1}}\chi _{n-1}^{2}\right)=\sigma ^{2},} y [ 18 ]Var[S2]=Var(σ2norte1χnorte12)=σ4(norte1)2Var(χnorte12)=2σ4norte1.{\displaystyle \operatorname {Var} \left[S^{2}\right]=\operatorname {Var} \left({\frac {\sigma ^{2}}{n-1}}\chi _{n-1}^{2}\right)={\frac {\sigma ^{4}}{{\left(n-1\right)}^{2}}}\operatorname {Var} \left(\chi _{n-1}^{2}\right)={\frac {2\sigma ^{4}}{n-1}}.}

Si Y i son independientes e idénticamente distribuidas, pero no necesariamente distribuidas normalmente, entonces [ 19 ]mi[S2]=σ2;Var[S2]=σ4norte(κ1+2norte1)=1norte(μ4norte3norte1σ4),{\displaystyle \operatorname {E} \left[S^{2}\right]=\sigma ^{2};\quad \operatorname {Var} \left[S^{2}\right]={\frac {\sigma ^{4}}{n}}\left(\kappa -1+{\frac {2}{n-1}}\right)={\frac {1}{n}}\left(\mu _{4}-{\frac {n-3}{n-1}}\sigma ^{4}\right),} donde κ es la curtosis de la distribución y μ 4 es el cuarto momento central .

Si se cumplen las condiciones de la ley de los grandes números para las observaciones al cuadrado, es un estimador consistente de σ² . De hecho , se puede observar que la varianza del estimador tiende asintóticamente a cero. Una fórmula asintóticamente equivalente fue dada en Kenney y Keeping (1951:164), Rose y Smith (2002:264) y Weisstein (s.f.). [ 20 ] [ 21 ] [ 22 ] 

La desigualdad de Samuelson

La desigualdad de Samuelson es un resultado que establece límites a los valores que pueden tomar las observaciones individuales en una muestra, dado que se han calculado la media muestral y la varianza (sesgada). [ 23 ] Los valores deben estar dentro de los límites .y¯±σY(norte1)1/2{\displaystyle {\bar {y}}\pm \sigma _{Y}(n-1)^{1/2}}.

Efecto de añadir una observación sobre la varianza

Cuando una sola observación nuevaincógnitanorte+1{\displaystyle x_{n+1}}se agrega a un conjunto denorte{\displaystyle n}observaciones con mediaincógnita¯norte{\displaystyle {\bar {x}}_{n}}y varianzasnorte2{\displaystyle s_{n}^{2}}, la nueva variaciónsnorte+12{\displaystyle s_{n+1}^{2}}puede expresarse utilizando una fórmula de actualización recursiva. Basado en la identidad para la suma de cuadrados proporcionada por Chan et al. (1983) [ 24 ] :

nortesnorte+12=(norte1)snorte2+nortenorte+1(incógnitanorte+1incógnita¯norte)2{\displaystyle ns_{n+1}^{2}=(n-1)s_{n}^{2}+{\frac {n}{n+1}}(x_{n+1}-{\bar {x}}_{n})^{2}}

A partir de esta relación, el impacto de la nueva observación sobre la varianza depende de su distancia de la media actual. Siincógnitanorte+1=incógnita¯norte±snortenorte+1norte{\displaystyle x_{n+1}={\bar {x}}_{n}\pm s_{n}{\sqrt {\frac {n+1}{n}}}}, entonces la varianza permanecerá sin cambios . En consecuencia, si la nueva observación está más cerca de la media (|incógnitanorte+1|<incógnita¯norte+snortenorte+1norte{\displaystyle |x_{n+1}|<{\bar {x}}_{n}+s_{n}{\sqrt {\frac {n+1}{n}}}}), entonces la varianza disminuirá, y si está más alejada de la media (|incógnitanorte+1|>incógnita¯norte+snortenorte+1norte{\displaystyle |x_{n+1}|>{\bar {x}}_{n}+s_{n}{\sqrt {\frac {n+1}{n}}}}), entonces la varianza aumentará.

[Prueba]

Derivación de la varianza muestral

Utilizando la fórmula de actualización para la suma de cuadrados (SS{\displaystyle SS}):

SSnorte+1=SSnorte+nortenorte+1(incógnitanorte+1incógnita¯norte)2{\displaystyle SS_{n+1}=SS_{n}+{\frac {n}{n+1}}(x_{n+1}-{\bar {x}}_{n})^{2}}

Sustituyendo la relación por la varianza de la muestra (SS=(norte1)s2{\displaystyle SS=(n-1)s^{2}}):

nortesnorte+12=(norte1)snorte2+nortenorte+1(incógnitanorte+1incógnita¯norte)2{\displaystyle ns_{n+1}^{2}=(n-1)s_{n}^{2}+{\frac {n}{n+1}}(x_{n+1}-{\bar {x}}_{n})^{2}}

Configuraciónsnorte+12=snorte2{\displaystyle s_{n+1}^{2}=s_{n}^{2}}:

nortesnorte2=(norte1)snorte2+nortenorte+1(incógnitanorte+1incógnita¯norte)2{\displaystyle ns_{n}^{2}=(n-1)s_{n}^{2}+{\frac {n}{n+1}}(x_{n+1}-{\bar {x}}_{n})^{2}}
snorte2=nortenorte+1(incógnitanorte+1incógnita¯norte)2{\displaystyle s_{n}^{2}={\frac {n}{n+1}}(x_{n+1}-{\bar {x}}_{n})^{2}}

Resolver paraincógnitanorte+1{\displaystyle x_{n+1}}rendimientos:

incógnitanorte+1=incógnita¯norte±snortenorte+1norte{\displaystyle x_{n+1}={\bar {x}}_{n}\pm s_{n}{\sqrt {\frac {n+1}{n}}}}

Derivación de la varianza poblacional

Para la varianza poblacional (σ2=SSnorte{\displaystyle \sigma ^{2}={\frac {SS}{n}}}), la fórmula de actualización es:

(norte+1)σnorte+12=norteσnorte2+nortenorte+1(incógnitanorte+1μnorte)2{\displaystyle (n+1)\sigma _{n+1}^{2}=n\sigma _{n}^{2}+{\frac {n}{n+1}}(x_{n+1}-\mu _{n})^{2}}

Configuraciónσnorte+12=σnorte2{\displaystyle \sigma _{n+1}^{2}=\sigma _{n}^{2}}:

(norte+1)σnorte2=norteσnorte2+nortenorte+1(incógnitanorte+1μnorte)2{\displaystyle (n+1)\sigma _{n}^{2}=n\sigma _{n}^{2}+{\frac {n}{n+1}}(x_{n+1}-\mu _{n})^{2}}
σnorte2=nortenorte+1(incógnitanorte+1μnorte)2{\displaystyle \sigma _{n}^{2}={\frac {n}{n+1}}(x_{n+1}-\mu _{n})^{2}}

Resolver paraincógnitanorte+1{\displaystyle x_{n+1}}rendimientos:

incógnitanorte+1=μnorte±σnortenorte+1norte{\displaystyle x_{n+1}=\mu _{n}\pm \sigma _{n}{\sqrt {\frac {n+1}{n}}}}

Relaciones con las medias armónicas y aritméticas

Se ha demostrado [ 25 ] que para una muestra { y i } de números reales positivos, σy22ymáximo(AH),{\displaystyle \sigma _{y}^{2}\leq 2y_{\max }(A-H),} donde y max es el máximo de la muestra ,A{\displaystyle A}es la media aritmética ,H{\displaystyle H}es la media armónica de la muestra yσy2{\displaystyle \sigma _{y}^{2}}es la varianza (sesgada) de la muestra.

Este límite se ha mejorado y se sabe que la varianza está acotada por σy2ymáximo(AH)(ymáximoA)ymáximoH,σy2ymin(AH)(Aymin)Hymin,{\displaystyle {\begin{aligned}\sigma _{y}^{2}&\leq {\frac {y_{\max }(A-H)(y_{\max }-A)}{y_{\max }-H}},\\[1ex]\sigma _{y}^{2}&\geq {\frac {y_{\min }(A-H)(A-y_{\min })}{H-y_{\min }}},\end{aligned}}} donde y min es el mínimo de la muestra. [ 26 ]

Pruebas de igualdad de varianzas

La prueba F de igualdad de varianzas y la prueba de chi cuadrado son adecuadas cuando la muestra sigue una distribución normal. La falta de normalidad dificulta la comprobación de la igualdad de dos o más varianzas.

Se han propuesto varias pruebas no paramétricas, entre ellas la prueba de Barton-David-Ansari-Freund-Siegel-Tukey, la prueba de Capon , la prueba de Mood , la prueba de Klotz y la prueba de Sukhatme . La prueba de Sukhatme se aplica a dos varianzas y requiere que ambas medianas sean conocidas e iguales a cero. Las pruebas de Mood, Klotz, Capon y Barton-David-Ansari-Freund-Siegel-Tukey también se aplican a dos varianzas. Permiten que la mediana sea desconocida, pero requieren que ambas medianas sean iguales.

La prueba de Lehmann es una prueba paramétrica de dos varianzas. Existen varias variantes conocidas de esta prueba. Otras pruebas de igualdad de varianzas incluyen la prueba de Box , la prueba de Box-Anderson y la prueba de Moses .

Para comprobar la igualdad de varianzas, se pueden utilizar métodos de remuestreo, como el bootstrap y el jackknife .

Momento de inercia

La varianza de una distribución de probabilidad es análoga al momento de inercia en la mecánica clásica de una distribución de masa correspondiente a lo largo de una línea, con respecto a la rotación alrededor de su centro de masa. [ 27 ] Es debido a esta analogía que tales cosas como la varianza se llaman momentos de distribuciones de probabilidad . [ 27 ] La matriz de covarianza está relacionada con el tensor de momento de inercia para distribuciones multivariadas. El momento de inercia de una nube de n puntos con una matriz de covarianza deΣ{\displaystyle \Sigma }es dado porI=norte(13×3tr(Σ)Σ).{\displaystyle I=n\left(\mathbf {1} _{3\times 3}\operatorname {tr} (\Sigma )-\Sigma \right).}

Esta diferencia entre el momento de inercia en física y en estadística es clara para puntos que se agrupan a lo largo de una línea. Supongamos que muchos puntos están cerca del eje x y distribuidos a lo largo de él. La matriz de covarianza podría verse así: Σ=[100000.10000.1].{\displaystyle \Sigma ={\begin{bmatrix}10&0&0\\0&0.1&0\\0&0&0.1\end{bmatrix}}.}

Es decir, la mayor variación se encuentra en la dirección x . Los físicos considerarían que esto tiene un momento bajo alrededor del eje x , por lo que el tensor de momento de inercia es I=norte[0,200010.100010.1].{\displaystyle I=n{\begin{bmatrix}0.2&0&0\\0&10.1&0\\0&0&10.1\end{bmatrix}}.}

Semivarianza

La semivarianza se calcula de la misma manera que la varianza, pero solo se incluyen en el cálculo aquellas observaciones que se encuentran por debajo de la media: Semivarianza=1nortei:incógnitai<μ(incógnitaiμ)2{\displaystyle {\text{Semivariance}}={\frac {1}{n}}\sum _{i:x_{i}<\mu }{\left(x_{i}-\mu \right)}^{2}} También se describe como una medida específica en diferentes campos de aplicación. Para distribuciones asimétricas, la semivarianza puede proporcionar información adicional que la varianza no ofrece. [ 28 ]

Para desigualdades asociadas con la semivarianza, véase la desigualdad de Chebyshev §  Semivarianzas .

Etimología

El término varianza fue introducido por primera vez por Ronald Fisher en su artículo de 1918 The Correlation Between Relatives on the Supposition of Mendelian Inheritance : [ 29 ]

El gran conjunto de estadísticas disponibles nos muestra que las desviaciones de una medición humana respecto a su media siguen muy de cerca la Ley Normal de Errores y, por lo tanto, que la variabilidad puede medirse uniformemente mediante la desviación estándar correspondiente a la raíz cuadrada del error cuadrático medio . Cuando existen dos causas independientes de variabilidad capaces de producir en una población que de otro modo sería uniforme distribuciones con desviaciones estándarσ1{\displaystyle \sigma _{1}}yσ2{\displaystyle \sigma _{2}}Se encuentra que la distribución, cuando ambas causas actúan juntas, tiene una desviación estándarσ12+σ22{\displaystyle {\sqrt {\sigma _{1}^{2}+\sigma _{2}^{2}}}}Por lo tanto, al analizar las causas de la variabilidad, es conveniente utilizar el cuadrado de la desviación estándar como medida de variabilidad. Denominaremos a esta magnitud Varianza...

Generalizaciones

Para variables complejas

Siincógnita{\displaystyle x}es una variable aleatoria escalar compleja con valores en do{\displaystyle \mathbb {C} } , entonces su varianza esmi[(incógnitaμ)(incógnitaμ)]{\displaystyle \operatorname {E} \left[(x-\mu )(x-\mu )^{*}\right]}, dondeincógnita{\displaystyle x^{*}}es el conjugado complejo de incógnita{\displaystyle x}Esta varianza es un escalar real.

Para variables aleatorias con valores vectoriales

Como una matriz

Siincógnita{\displaystyle X}es una variable aleatoria con valores vectoriales , con valores enRnorte,{\displaystyle \mathbb {R} ^{n},}y pensándolo como un vector columna, entonces una generalización natural de la varianza esmi[(incógnitaμ)(incógnitaμ)T],{\displaystyle \operatorname {E} \left[(X-\mu ){(X-\mu )}^{\mathsf {T}}\right],}dóndeμ=mi(incógnita){\displaystyle \mu =\operatorname {E} (X)}yincógnitaT{\displaystyle X^{\mathsf {T}}}es la transpuesta deincógnita{\displaystyle X} , y también es un vector fila. El resultado es una matriz cuadrada semidefinida positiva , comúnmente denominada matriz de varianza-covarianza (o simplemente matriz de covarianza ).

Siincógnita{\displaystyle X}es una variable aleatoria vectorial y de valores complejos, con valores en donorte{\displaystyle \mathbb {C} ^{n}} , entonces la matriz de covarianza es mi[(incógnitaμ)(incógnitaμ)]{\displaystyle \operatorname {E} \left[(X-\mu ){(X-\mu )}^{\dagger }\right]}, dondeincógnita{\displaystyle X^{\dagger }}es la transpuesta conjugada de incógnita{\displaystyle X}Esta matriz tambiénes semidefinida positiva y cuadrada.

Como escalar

Otra generalización de la varianza para variables aleatorias con valores vectoriales.incógnita,{\displaystyle X,}que da como resultado un valor escalar en lugar de una matriz, es la varianza generalizada .det(do){\displaystyle \det(C)} , el determinante de la matriz de covarianza. Se puede demostrar que la varianza generalizada está relacionada con la dispersión multidimensional de puntos alrededor de su media. [ 30 ]

Se obtiene una generalización diferente al considerar la ecuación para la varianza escalar,Var(incógnita)=mi[(incógnitaμ)2],{\displaystyle \operatorname {Var} (X)=\operatorname {E} \left[(X-\mu )^{2}\right],}y reinterpretando(incógnitaμ)2{\displaystyle (X-\mu )^{2}}como la distancia euclidiana al cuadrado entre la variable aleatoria y su media, o, simplemente como el producto escalar del vectorincógnitaμ{\displaystyle X-\mu }consigo mismo. Esto da como resultadomi[(incógnitaμ)T(incógnitaμ)]=tr(do),{\displaystyle \operatorname {E} \left[(X-\mu )^{\mathsf {T}}(X-\mu )\right]=\operatorname {tr} (C),}que es la traza de la matriz de covarianza.

Véase también

Tipos de varianza

Referencias

  1. Wasserman, Larry (2005). Todo sobre estadística: un curso conciso de inferencia estadística . Textos de estadística de Springer. pág.  51. ISBN 978-1-4419-2322-6.
  2. Yuli Zhang; Huaiyu Wu; Lei Cheng (junio de 2012). Algunas fórmulas nuevas de deformación sobre varianza y covarianza . Actas de la 4.ª Conferencia Internacional sobre Modelado, Identificación y Control (ICMIC2012). págs. 987–992 . 
  3. Kagan, A.; Shepp, LA (1998). "¿Por qué la varianza?". Statistics & Probability Letters . 38 (4): 329– 333. doi : 10.1016/S0167-7152(98)00041-8 .
  4. Johnson, Richard; Wichern, Dean (2001). Análisis estadístico multivariante aplicado . Prentice Hall. pág . 76. ISBN  0-13-187715-1.
  5. Loève, M. (1977) "Teoría de la probabilidad", Textos de posgrado en matemáticas , Volumen 45, 4.ª edición, Springer-Verlag, pág. 12.
  6. Bienaymé, I.-J. (1853) "Considérations à l'appui de la découverte de Laplace sur la loi de probabilité dans la méthode des moindres carrés", Comptes rendus de l'Académie des sciences Paris , 37, p. 309–317; copia digital disponibleArchivado el 23 de junio de 2018 en Wayback Machine.
  7. Bienaymé, I.-J. (1867) "Considérations à l'appui de la découverte de Laplace sur la loi de probabilité dans la méthode des moindres carrés", Journal de Mathématiques Pures et Appliquées, Serie 2 , Tomo 12, p. 158–167; copia digital disponible
  8. Cornell, JR y Benjamin, CA, Probabilidad, estadística y decisiones para ingenieros civiles , McGraw-Hill, NY, 1970, págs. 178-9.
  9. Goodman, Leo A. (diciembre de 1960). "Sobre la varianza exacta de los productos". Journal of the American Statistical Association . 55 (292): 708– 713. doi : 10.2307/2281592 . JSTOR 2281592 . 
  10. 1 2 Reichmann, WJ (1961). "Apéndice 8". Uso y abuso de las estadísticas (Reimpreso 1964–1970 por Pelican ed.). Londres: Methuen. 
  11. 1 2 Kourouklis, Stavros (2012). "Un nuevo estimador de la varianza basado en la minimización del error cuadrático medio" . The American Statistician . 66 (4): 234– 236. doi : 10.1080/00031305.2012.735209 . ISSN 0003-1305 . JSTOR 23339501 .  
  12. Brugger, RM (1969). "Una nota sobre la estimación insesgada de la desviación estándar". The American Statistician . 23 (4): 32. doi : 10.1080/00031305.1969.10481865 .
  13. Yuli Zhang; Huaiyu Wu; Lei Cheng (junio de 2012). Algunas fórmulas nuevas de deformación sobre varianza y covarianza . Actas de la 4.ª Conferencia Internacional sobre Modelado, Identificación y Control (ICMIC2012). págs. 987–992 . 
  14. Navidi, William (2006). Estadística para ingenieros y científicos . McGraw-Hill. pág. 14. 
  15. Montgomery, DC y Runger, GC (1994) Estadística aplicada y probabilidad para ingenieros , página 201. John Wiley & Sons, Nueva York.
  16. Yuli Zhang; Huaiyu Wu; Lei Cheng (junio de 2012). Algunas fórmulas nuevas de deformación sobre varianza y covarianza . Actas de la 4.ª Conferencia Internacional sobre Modelado, Identificación y Control (ICMIC2012). págs. 987–992 . 
  17. Knight, K. (2000). Estadística matemática . Nueva York: Chapman and Hall. Proposición 2.11.
  18. Casella, George ; Berger, Roger L. (2002). Inferencia estadística (2.ª ed.). Ejemplo 7.3.3, pág. 331. ISBN   0-534-24312-6.
  19. Mood, AM, Graybill, FA y Boes, DC (1974) Introducción a la teoría de la estadística , 3.ª edición, McGraw-Hill, Nueva York, pág. 229
  20. Kenney, John F.; Keeping, ES (1951). Matemáticas de la estadística. Segunda parte (PDF) (2.ª ed.). Princeton, Nueva Jersey: D. Van Nostrand Company, Inc. Archivado del original (PDF) el 17 de noviembre de 2018 vía KrishiKosh. 
  21. Rose, Colin; Smith, Murray D. (2002). " Estadística matemática con Mathematica ". Springer-Verlag, Nueva York.
  22. Weisstein, Eric W. " Distribución de la varianza muestral ". MathWorld Wolfram.
  23. Samuelson, Paul (1968). "¿Hasta qué punto puedes ser desviado?". Journal of the American Statistical Association . 63 (324): 1522– 1525. doi : 10.1080/01621459.1968.10480944 . JSTOR 2285901 . 
  24. Chan, Tony F.; Golub, Gene H.; LeVeque, Randall J. (1983). "Algoritmos para el cálculo de la varianza muestral: análisis y recomendaciones" . The American Statistician . 37 (3): 242– 247. doi : 10.2307/2683386 .fórmula 1.3(b página 1
  25. Mercer, A. McD. (2000). "Límites para A–G, A–H, G–H y una familia de desigualdades del tipo de Ky Fan, utilizando un método general" . J. Math. Anal. Appl . 243 (1): 163–173 . doi : 10.1006/jmaa.1999.6688 .
  26. Sharma, R. (2008). "Algunas desigualdades más para la media aritmética, la media armónica y la varianza". Journal of Mathematical Inequalities . 2 (1): 109– 114. CiteSeerX 10.1.1.551.9397 . doi : 10.7153/jmi-02-11 . 
  27. 1 2 Magnello, M. Eileen. "Karl Pearson y los orígenes de la estadística moderna: un elástico se convierte en estadístico" . The Rutherford Journal .
  28. Fama, Eugene F.; French, Kenneth R. (21 de abril de 2010). "Preguntas y respuestas: Semivarianza: ¿Una mejor medida de riesgo?" . Foro Fama/French .
  29. Ronald Fisher (1918) La correlación entre parientes bajo la suposición de herencia mendeliana
  30. Kocherlakota, S.; Kocherlakota, K. (2004). "Varianza generalizada". Enciclopedia de Ciencias Estadísticas . Wiley Online Library. doi : 10.1002/0471667196.ess0869 . ISBN 0-471-66719-6.