Articulo de referencia

Distribución normal

\\mathcal{N}(\\mu,\\sigma^2) "},"parameters":{"wt":" \\mu\\in\\R = [[mean]] ([[location parameter|location]]) \\sigma^2\\in\\R_{>0} = [[variance]] (squared [[scale parameter|sca...

En teoría de la probabilidad y estadística , una distribución normal o distribución gaussiana es un tipo de distribución de probabilidad continua para una variable aleatoria de valor real . La forma general de su función de densidad de probabilidad es [ 1 ] [ 2 ] [ 3 ]F(incógnita)=12πσ2exp((incógnitaμ)22σ2).{\displaystyle f(x)={\frac {1}{\sqrt {2\pi \sigma ^{2}}}}\exp {\left(-{\frac {(x-\mu )^{2}}{2\sigma ^{2}}}\right)}\,.}El parámetroμ{\displaystyle \mu }es la media o esperanza de la distribución (y también su mediana y moda ), mientras que el parámetroσ2{\textstyle \sigma ^{2}}es la varianza . La desviación estándar de la distribución es el valor positivo .σ{\displaystyle \sigma } (sigma). Se dice que una variable aleatoria con distribución gaussiana tiene distribución normal y se denomina desviación normal .

Las distribuciones normales pueden ser importantes en estadística y se utilizan con frecuencia en las ciencias naturales y sociales para representar variables aleatorias de valor real cuyas distribuciones se desconocen. [ 4 ] [ 5 ] Su importancia se debe en parte al teorema del límite central . Este teorema establece que el promedio de muchas muestras (observaciones) estadísticamente independientes de una variable aleatoria con media y varianza finitas es en sí mismo una variable aleatoria, cuya distribución converge a una distribución normal a medida que aumenta el número de muestras. Por lo tanto, las magnitudes físicas que se espera que sean la suma de muchos procesos independientes, como los errores de medición , suelen tener distribuciones casi normales. [ 6 ]

Además, las distribuciones gaussianas poseen propiedades únicas que resultan valiosas en estudios analíticos. Por ejemplo, cualquier combinación lineal de un conjunto fijo de desviaciones normales independientes constituye una desviación normal. Muchos resultados y métodos, como la propagación de la incertidumbre y el ajuste de parámetros por mínimos cuadrados [ 7 ] , pueden derivarse analíticamente de forma explícita cuando las variables relevantes siguen una distribución normal.

Sin embargo, las distribuciones normales se utilizan con frecuencia de forma incorrecta en contextos donde no se cumple el supuesto de que los datos se distribuyen normalmente y la distribución normal es un modelo deficiente. [ 8 ]

A la distribución normal se la denomina a veces informalmente curva de campana . [ 9 ] [ 10 ] Sin embargo, muchas otras distribuciones tienen forma de campana (como las distribuciones de Cauchy , t de Student y logística ). (Para otros nombres, véase Nomenclatura ).

La distribución de probabilidad univariada se generaliza para vectores en la distribución normal multivariada y para matrices en la distribución normal matricial .

Definiciones

Distribución normal estándar

El caso más simple de una distribución normal se conoce como distribución normal estándar o distribución normal unitaria . Este es un caso especial cuandoμ=0{\textstyle \mu =0}yσ2=1{\textstyle \sigma ^{2}=1}y se describe mediante esta función de densidad de probabilidad (o densidad): [ 11 ]φ(z)=miz2/22π.{\displaystyle \varphi (z)={\frac {e^{-z^{2}/2}}{\sqrt {2\pi }}}\,.}La variablez{\displaystyle z}Tiene una media de 0 y una varianza y desviación estándar de 1. La densidadφ(z){\textstyle \varphi (z)}tiene su valor máximo12π{\textstyle {\frac {1}{\sqrt {2\pi }}}}enz=0{\textstyle z=0}y puntos de inflexión enz=+1{\textstyle z=+1}yz=1{\displaystyle z=-1}.

Aunque la densidad anterior se conoce más comúnmente como la normal estándar, algunos autores han utilizado ese término para describir otras versiones de la distribución normal. Carl Friedrich Gauss , por ejemplo, definió una vez la normal estándar comoφ(z)=1πmiz2,{\textstyle \varphi (z)={\frac {1}{\sqrt {\pi }}}e^{-z^{2}},}que tiene una varianza de 12{\displaystyle {\tfrac {1}{2}}} , y Stephen Stigler definió una vez la distribución normal estándar comoφ(z)=miπz2,{\textstyle \varphi (z)=e^{-\pi z^{2}},}que tiene una forma funcional simple y una variación deσ2=12π.{\textstyle \sigma ^{2}={\frac {1}{2\pi }}.}[ 12 ]

Distribución normal general

SiZ{\displaystyle Z}Si es una desviación normal estándar , entoncesincógnita=σZ+μ{\textstyle X=\sigma Z+\mu }tendrá una distribución normal con valor esperado μ{\displaystyle \mu }y desviación estándarσ{\displaystyle \sigma } . Esto equivale a decir que la distribución normal estándarZ{\displaystyle Z} se puede escalar/estirar por un factor deσ{\displaystyle \sigma }y desplazado porμ{\displaystyle \mu }para producir una distribución normal diferente, llamadaincógnita{\displaystyle X}.

Por el contrario, siincógnita{\displaystyle X} es una desviación normal con parámetrosμ{\displaystyle \mu }yσ2{\textstyle \sigma ^{2}}, entonces estoincógnita{\displaystyle X}La distribución se puede reescalar y desplazar mediante la fórmula.Z=(incógnitaμ)/σ{\textstyle Z=(X-\mu )/\sigma }para convertirlo a la distribución normal estándar. Esta variable también se denomina forma estandarizada deincógnita{\displaystyle X}.

En particular, la función de densidad de probabilidad para incógnita{\displaystyle X}Se puede expresar en términos de la distribución normal estándar .φ{\displaystyle \varphi }( con media cero y varianza unitaria): F(incógnitaμ,σ2)=1σφ(incógnitaμσ).{\displaystyle f(x\mid \mu ,\sigma ^{2})={\frac {1}{\sigma }}\varphi \left({\frac {x-\mu }{\sigma }}\right)\,.} La densidad de probabilidad debe escalarse por1/σ{\textstyle 1/\sigma }de modo que la integral siga siendo  1.

Notación

La función de densidad de probabilidad de la distribución normal estándar se suele denotar con la letra griega phi ,ϕ{\displaystyle \phi } . [ 13 ] La forma varianteφ{\displaystyle \varphi }También se utiliza.

La función de distribución acumulativa de la distribución normal estándar se suele denotar con la letra griega mayúscula phi, Φ{\displaystyle \Phi }.

La distribución normal se suele denominarnorte(μ,σ2){\textstyle N(\mu ,\sigma ^{2})}onorte(μ,σ2){\displaystyle {\mathcal {N}}(\mu,\sigma ^{2})} . [ 14 ] Cuando una variable aleatoriaincógnita{\displaystyle X} se distribuye normalmente con mediaμ{\displaystyle \mu }y desviación estándarσ{\displaystyle \sigma } , uno puede escribir

incógnitanorte(μ,σ2).{\displaystyle X\sim {\mathcal {N}}(\mu,\sigma ^{2}).}

Parametrizaciones alternativas

Algunos autores abogan por utilizar la precisión .τ{\displaystyle \tau }como parámetro que define la amplitud de la distribución, en lugar de la desviación estándar .σ{\displaystyle \sigma }o la varianzaσ2{\displaystyle \sigma ^{2}}La precisión se define normalmente como el recíproco de la varianza ,1/σ2{\displaystyle 1/\sigma ^{2}} . [ 15 ] La fórmula para la distribución queda entonces F(incógnita)=τ2πmiτ(incógnitaμ)2/2.{\displaystyle f(x)={\sqrt {\frac {\tau }{2\pi }}}e^{-\tau (x-\mu )^{2}/2}.}

Se afirma que esta opción tiene ventajas en los cálculos numéricos cuandoσ{\displaystyle \sigma }es muy cercano a cero y simplifica fórmulas en algunos contextos, como en la inferencia bayesiana de variables con distribución normal multivariada .

Alternativamente, el recíproco de la desviación estándarτ=1/σ{\textstyle \tau '=1/\sigma }podría definirse como la precisión , en cuyo caso la expresión de la distribución normal se convierte en F(incógnita)=τ2πmi(τ)2(incógnitaμ)2/2.{\displaystyle f(x)={\frac {\tau '}{\sqrt {2\pi }}}e^{-(\tau ')^{2}(x-\mu )^{2}/2}.}

Según Stigler, esta formulación es ventajosa debido a que tiene una fórmula mucho más simple y fácil de recordar, y a que utiliza fórmulas aproximadas sencillas para los cuantiles de la distribución.

Las distribuciones normales forman una familia exponencial con parámetros naturales.θ1=μσ2{\textstyle \textstyle \theta _{1}={\frac {\mu }{\sigma ^{2}}}}yθ2=12σ2{\textstyle \textstyle \theta _{2}=-{\frac {1}{2\sigma ^{2}}}}y las estadísticas naturales x y x 2 . Los parámetros de expectativa dual para la distribución normal son η 1 = μ y η 2 = μ 2 + σ 2 .

Función de distribución acumulativa

La función de distribución acumulativa (FDA) de la distribución normal estándar, generalmente denotada con la letra griega mayúscula Φ{\displaystyle \Phi } , es la integral Φ(incógnita)=12πincógnitamit2/2dt.{\displaystyle \Phi (x)={\frac {1}{\sqrt {2\pi }}}\int _{-\infty }^{x}e^{-t^{2}/2}\,dt\,.}

La función de error relacionadaterreno(incógnita){\textstyle \operatorname {erf} (x)}da la probabilidad de que una variable aleatoria, con distribución normal de media 0 y varianza 1/2, caiga en el rango [incógnita,incógnita]{\displaystyle [-x,x]} . Es decir: terreno(incógnita)=1πincógnitaincógnitamit2dt=2π0incógnitamit2dt.{\displaystyle \operatorname {erf} (x)={\frac {1}{\sqrt {\pi }}}\int _{-x}^{x}e^{-t^{2}}\,dt={\frac {2}{\sqrt {\pi }}}\int _{0}^{x}e^{-t^{2}}\,dt\,.}

Estas integrales no pueden expresarse en términos de funciones elementales y, a menudo, se las denomina funciones especiales . Sin embargo, se conocen muchas aproximaciones numéricas; véase más abajo para más información.

Las dos funciones están estrechamente relacionadas, a saber: Φ(incógnita)=12[1+terreno(incógnita2)].{\displaystyle \Phi (x)={\frac {1}{2}}\left[1+\operatorname {erf} \left({\frac {x}{\sqrt {2}}}\right)\right].}

Para una distribución normal genérica con densidad F{\displaystyle f}, significaμ{\displaystyle \mu }y varianzaσ2{\textstyle \sigma ^{2}}, la función de distribución acumulativa es F(incógnita)=Φ(incógnitaμσ)=12[1+terreno(incógnitaμσ2)].{\displaystyle F(x)=\Phi {\left({\frac {x-\mu }{\sigma }}\right)}={\frac {1}{2}}\left[1+\operatorname {erf} \left({\frac {x-\mu }{\sigma {\sqrt {2}}}}\right)\right].}

Por lo tanto, la probabilidad de que x se encuentre entre a y b con a < b es [ 16 ] : 84PAG(a<incógnitab)=12[terreno(bμσ2)terreno(aμσ2)]{\displaystyle \operatorname {P} (a<x\leq b)={\frac {1}{2}}\left[\operatorname {erf} \left({\frac {b-\mu }{\sigma {\sqrt {2}}}}\right)-\operatorname {erf} \left({\frac {a-\mu }{\sigma {\sqrt {2}}}}\right)\right]}

El complemento de la función de distribución acumulativa normal estándar,Q(incógnita)=1Φ(incógnita){\textstyle Q(x)=1-\Phi (x)}, a menudo se la denomina función Q , especialmente en textos de ingeniería. [ 17 ] [ 18 ] Da la probabilidad de que el valor de una variable aleatoria normal estándar incógnita{\displaystyle X}excederáincógnita{\displaystyle x}:PAG(incógnita>incógnita){\displaystyle P(X>x)} . Otras definiciones de laQ{\displaystyle Q}-función , todas las cuales son transformaciones simples deΦ{\displaystyle \Phi } , también se utilizan ocasionalmente. [ 19 ]

La gráfica de la función de distribución acumulativa normal estándarΦ{\displaystyle \Phi } tiene simetría rotacional doblealrededor del punto (0,1/2); es decir,Φ(incógnita)=1Φ(incógnita){\displaystyle \Phi (-x)=1-\Phi (x)}Su antiderivada (integral indefinida) se puede expresar de la siguiente manera :Φ(incógnita)dincógnita=incógnitaΦ(incógnita)+φ(incógnita)+do.{\displaystyle \int \Phi (x)\,dx=x\Phi (x)+\varphi (x)+C.}

Se puede obtener una expansión asintótica de la función de distribución acumulativa para valores grandes de x mediante integración por partes : Φ(incógnita)=12+12πmiincógnita2/2norte=01(2norte+1)¡¡incógnita2norte+1.{\displaystyle \Phi (x)={\frac {1}{2}}+{\frac {1}{\sqrt {2\pi }}}e^{-x^{2}/2}\sum _{n=0}^{\infty }{\frac {1}{(2n+1)!!}}x^{2n+1}\,.} dónde¡¡{\textstyle !!} denota el factorial doble . Para más información, véase Función de error §  Expansión asintótica . [ 20 ]

Representación de la serie Taylor

La serie de Taylor para la distribución normalφ{\displaystyle \varphi } se puede derivar sustituyendo12incógnita2{\displaystyle -{\tfrac {1}{2}}x^{2}}en la serie de Taylor para la función exponencial : [ 21 ]

φ(incógnita)=12πnorte=0(1)nortenorte¡2norteincógnita2norte{\displaystyle \varphi (x)={\frac {1}{\sqrt {2\pi }}}\sum _{n=0}^{\infty }{\frac {(-1)^{n}}{n!\,2^{n}}}x^{2n}}

Esta serie se puede integrar término a término para obtener la serie de Taylor para la función de distribución acumulativa: [ 22 ]

Φ(incógnita)=12+12πnorte=0(1)nortenorte¡2norte(2norte+1)incógnita2norte+1.{\displaystyle \Phi (x)={\frac {1}{2}}+{\frac {1}{\sqrt {2\pi }}}\sum _{n=0}^{\infty }{\frac {(-1)^{n}}{n!\,2^{n}(2n+1)}}x^{2n+1}.} Sin embargo, esta serie es ineficaz para el cálculo debido a la lenta convergencia, excepto cuandoincógnita{\displaystyle x}es pequeño . [ 22 ]

Ambas series describen funciones enteras que convergen para todos los valores reales y complejos de .incógnita{\displaystyle x}.

Cálculo recursivo con series de Taylor

La relación de recurrencia para los polinomios de Hermite He n ( x ) puede utilizarse para construir eficientemente la expansión en serie de Taylor alrededor de cualquier punto x 0 : Φ(incógnita)=norte=0Φ(norte)(incógnita0)norte¡(incógnitaincógnita0)norte,{\displaystyle \Phi (x)=\sum _{n=0}^{\infty }{\frac {\Phi ^{(n)}(x_{0})}{n!}}(x-x_{0})^{n}\,,} dónde: Φ(0)(incógnita0)=12πincógnita0mit2/2dtΦ(1)(incógnita0)=12πmiincógnita02/2Φ(norte)(incógnita0)=(incógnita0Φ(norte1)(incógnita0)+(norte2)Φ(norte2)(incógnita0)),norte2.{\displaystyle {\begin{aligned}\Phi ^{(0)}(x_{0})&={\frac {1}{\sqrt {2\pi }}}\int _{-\infty }^{x_{0}}e^{-t^{2}/2}\,dt\\\Phi ^{(1)}(x_{0})&={\frac {1}{\sqrt {2\pi }}}e^{-x_{0}^{2}/2}\\\Phi ^{(n)}(x_{0})&=-\left(x_{0}\Phi ^{(n-1)}(x_{0})+(n-2)\Phi ^{(n-2)}(x_{0})\right),&n\geq 2\,.\end{aligned}}}

Desviación estándar y cobertura

En la distribución normal, los valores inferiores a una desviación estándar de la media representan el 68,27% del conjunto; mientras que los que se encuentran a dos desviaciones estándar de la media representan el 95,45%; y los que se encuentran a tres desviaciones estándar representan el 99,73%.

Aproximadamente el 68% de los valores extraídos de una distribución normal se encuentran dentro de una desviación estándar σ de la media; aproximadamente el 95% de los valores se encuentran dentro de dos desviaciones estándar; y aproximadamente el 99,7% se encuentran dentro de tres desviaciones estándar. [ 9 ] Esto se conoce como la regla 68–95–99,7 (empírica) o la regla de 3 sigma .

Más precisamente, la probabilidad de que una desviación normal se encuentre en el rango entreμnorteσ{\textstyle \mu -n\sigma }yμ+norteσ{\textstyle \mu +n\sigma }es dado por F(μ+norteσ)F(μnorteσ)=Φ(norte)Φ(norte)=terreno(norte2).{\displaystyle F(\mu +n\sigma )-F(\mu -n\sigma )=\Phi (n)-\Phi (-n)=\operatorname {erf} \left({\frac {n}{\sqrt {2}}}\right).} Con 12 cifras significativas, los valores paranorte=1,2,,6{\textstyle n=1,2,\ldots ,6}son:

Para grandesnorte{\displaystyle n} , se puede utilizar la aproximación1pag2norteπminorte2{\displaystyle 1-p\approx {\frac {\sqrt {2}}{n{\sqrt {\pi e^{n^{2}}}}}}}

Función cuantil

La función cuantil de una distribución es la inversa de la función de distribución acumulativa. La función cuantil de la distribución normal estándar se denomina función probit y puede expresarse en términos de la función de error inversa : Φ1(pag)=2terreno1(2pag1),pag(0,1).{\displaystyle \Phi ^{-1}(p)={\sqrt {2}}\operatorname {erf} ^{-1}(2p-1),\quad p\in (0,1).} Para una variable aleatoria normal con media μ{\displaystyle \mu }y varianzaσ2{\textstyle \sigma ^{2}}, la función cuantil es F1(pag)=μ+σΦ1(pag)=μ+σ2terreno1(2pag1),pag(0,1).{\displaystyle F^{-1}(p)=\mu +\sigma \Phi ^{-1}(p)=\mu +\sigma {\sqrt {2}}\operatorname {erf} ^{-1}(2p-1),\quad p\in (0,1).} El cuantilΦ1(pag){\textstyle \Phi ^{-1}(p)}de la distribución normal estándar se denota comúnmente como zpag{\displaystyle z_{p}}Estos valores se utilizan en pruebas de hipótesis , construcción de intervalos de confianza y gráficos Q-Q . Una variable aleatoria normal .incógnita{\displaystyle X}excederáμ+zpagσ{\textstyle \mu +z_{p}\sigma }con probabilidad1pag{\textstyle 1-p}y quedará fuera del intervaloμ±zpagσ{\textstyle \mu \pm z_{p}\sigma }con probabilidad2(1pag){\displaystyle 2(1-p)} . En particular, el cuantilz0,975{\textstyle z_{0.975}}es 1,96 ; por lo tanto, una variable aleatoria normal estará fuera del intervaloμ±1,96σ{\textstyle \mu \pm 1.96\sigma }En tan solo el 5% de los casos.

La siguiente tabla muestra el cuantil.zpag{\textstyle z_{p}}de tal manera queincógnita{\displaystyle X}estará dentro del rangoμ±zpagσ{\textstyle \mu \pm z_{p}\sigma }con una probabilidad especificadapag{\displaystyle p}Estos valores son útiles para determinar el intervalo de tolerancia para promedios de muestra y otros estimadores estadísticos condistribuciones normales (o asintóticamente normales). [ 23 ] La siguiente tabla muestra2terreno1(pag)=Φ1(pag+12){\textstyle {\sqrt {2}}\operatorname {erf} ^{-1}(p)=\Phi ^{-1}\left({\frac {p+1}{2}}\right)}, noΦ1(pag){\textstyle \Phi ^{-1}(p)}como se definió anteriormente.

Para pequeñospag{\displaystyle p} , la función cuantil tiene la útil expansión asintóticaΦ1(pag)=ln1pag2lnln1pag2ln(2π)+o(1).{\textstyle \Phi ^{-1}(p)=-{\sqrt {\ln {\frac {1}{p^{2}}}-\ln \ln {\frac {1}{p^{2}}}-\ln(2\pi )}}+{\mathcal {o}}(1).}

Utilizando la búsqueda de raíces para calcular la función cuantil

Cualquiera de los métodos descritos para calcular la función de distribución acumulativaΦ(incógnita){\textstyle \Phi (x)}se puede utilizar con el método de Newton (o con otro algoritmo de búsqueda de raíces como el método de Halley ) para encontrar el valor de incógnita{\displaystyle x}para el cualΦ(incógnita)=q{\displaystyle \Phi (x)=q}para algún cuantil deseadoq{\displaystyle q}Por ejemplo, comenzando con una suposición inicial, aproximadamente correcta .incógnita0{\displaystyle x_{0}}, aproximaciones cada vez mejoresincógnita1{\displaystyle x_{1}},incógnita2{\displaystyle x_{2}} , ... se puede calcular iterativamente utilizando el método de Newton con incógnitanorte=incógnitanorte1Φ(incógnitanorte1)qφ(incógnitanorte1).{\displaystyle x_{n}=x_{n-1}-{\frac {\Phi (x_{n-1})-q}{\varphi (x_{n-1})}}\,.}

Propiedades

La distribución normal es la única distribución cuyos cumulantes más allá de los dos primeros (es decir, distintos de la media y la varianza ) son cero. También es la distribución continua con la máxima entropía para una media y varianza especificadas. [ 24 ] [ 25 ] Geary ha demostrado, suponiendo que la media y la varianza son finitas, que la distribución normal es la única distribución en la que la media y la varianza calculadas a partir de un conjunto de extracciones independientes son independientes entre sí. [ 26 ] [ 27 ]

La distribución normal es una subclase de las distribuciones elípticas . Es simétrica respecto a su media y no es nula en toda la recta real. Por ello, puede no ser un modelo adecuado para variables inherentemente positivas o con una fuerte asimetría, como el peso de una persona o el precio de una acción . Estas variables se describen mejor mediante otras distribuciones, como la distribución log-normal o la distribución de Pareto .

El valor de la densidad normal es prácticamente cero cuando el valor incógnita{\displaystyle x}Se encuentra a más de unas pocas desviaciones estándar de la media (por ejemplo, una dispersión de tres desviaciones estándar cubre casi toda la distribución, excepto el 0,27 %). Por lo tanto, puede no ser un modelo apropiado cuando se espera una fracción significativa de valores atípicos —valores que se encuentran a muchas desviaciones estándar de la media— y los mínimos cuadrados y otros métodos de inferencia estadística que son óptimos para variables con distribución normal a menudo se vuelven muy poco fiables cuando se aplican a dichos datos. En esos casos, se debe asumiruna distribución con colas más pesadas y aplicar métodos de inferencia estadística robustos apropiados.

La distribución gaussiana pertenece a la familia de distribuciones estables, que son los atractores de sumas de distribuciones independientes e idénticamente distribuidas, independientemente de que la media o la varianza sean finitas. Excepto la gaussiana, que es un caso límite, todas las distribuciones estables tienen colas pesadas y varianza infinita. Es una de las pocas distribuciones estables cuyas funciones de densidad de probabilidad pueden expresarse analíticamente, siendo las otras la distribución de Cauchy y la distribución de Lévy .

Simetrías y derivadas

La distribución normal con densidadF(incógnita){\textstyle f(x)}(media μ{\displaystyle \mu }y varianzaσ2>0{\textstyle \sigma ^{2}>0}) tiene las siguientes propiedades:

  • Es simétrico con respecto al puntoincógnita=μ,{\textstyle x=\mu ,}que es al mismo tiempo la moda , la mediana y la media de la distribución. [ 28 ]
  • Es unimodal : su primera derivada es positiva paraincógnita<μ,{\textstyle x<\mu ,}negativo paraincógnita>μ,{\textstyle x>\mu ,}y cero solo enincógnita=μ.{\textstyle x=\mu .}
  • El área delimitada por la curva y elincógnita{\displaystyle x}El eje x es la unidad (es decir, igual a uno).
  • Su primera derivada esF(incógnita)=incógnitaμσ2F(incógnita).{\textstyle f'(x)=-{\frac {x-\mu }{\sigma ^{2}}}f(x).}
  • Su segunda derivada esF(incógnita)=(incógnitaμ)2σ2σ4F(incógnita).{\textstyle f''(x)={\frac {(x-\mu )^{2}-\sigma ^{2}}{\sigma ^{4}}}f(x).}
  • Su densidad tiene dos puntos de inflexión (donde la segunda derivada de F{\displaystyle f}es cero y cambia de signo), ubicado a una desviación estándar de la media, es decir enincógnita=μσ{\textstyle x=\mu -\sigma }yincógnita=μ+σ.{\textstyle x=\mu +\sigma .}[ 28 ]
  • Su densidad es logarítmicamente cóncava . [ 28 ]
  • Su densidad es infinitamente diferenciable , de hecho supersuave de orden 2. [ 29 ]

Además, la densidadφ{\displaystyle \varphi }de la distribución normal estándar (es decir ,μ=0{\textstyle \mu =0}yσ=1{\textstyle \sigma =1}) también tiene las siguientes propiedades:

  • Su primera derivada esφ(incógnita)=incógnitaφ(incógnita).{\textstyle \varphi '(x)=-x\varphi (x).}
  • Su segunda derivada esφ(incógnita)=(incógnita21)φ(incógnita){\textstyle \varphi ''(x)=(x^{2}-1)\varphi (x)}
  • De forma más general, su enésima derivada esφ(norte)(incógnita)=(1)norteÉlnorte(incógnita)φ(incógnita),{\textstyle \varphi ^{(n)}(x)=(-1)^{n}\operatorname {He} _{n}(x)\varphi (x),}dóndeÉlnorte(incógnita){\textstyle \operatorname {He} _{n}(x)}es el n- ésimo polinomio de Hermite (probabilístico) . [ 30 ]
  • La probabilidad de que una variable con distribución normalincógnita{\displaystyle X}con conocidoμ{\displaystyle \mu }yσ2{\textstyle \sigma ^{2}}está en un conjunto particular, se puede calcular dado que la fracciónZ=(incógnitaμ)/σ{\textstyle Z=(X-\mu )/\sigma }tiene una distribución normal estándar.

Momentos

Los momentos simples y absolutos de una variableincógnita{\displaystyle X}son los valores esperados deincógnitapag{\textstyle X^{p}}y|incógnita|pag{\textstyle |X|^{p}}, respectivamente . Si el valor esperadoμ{\displaystyle \mu }deincógnita{\displaystyle X}Si es cero, estos parámetros se denominan momentos centrales; de lo contrario, se denominan momentos no centrales. Normalmente solo nos interesan los momentos de orden entero .pag{\displaystyle p}.

Siincógnita{\displaystyle X} tiene una distribución normal, los momentos no centrales existen y son finitos para cualquierpag{\displaystyle p}cuya parte real es mayor que −1 .  Para cualquier entero no negativopag{\displaystyle p} , los momentos centrales simples son: [ 31 ]mi[(incógnitaμ)pag]={0si pag es extraño,σpag(pag1)¡¡si pag es par.{\displaystyle \operatorname {E} \left[(X-\mu )^{p}\right]={\begin{cases}0&{\text{if }}p{\text{ is odd,}}\\\sigma ^{p}(p-1)!!&{\text{if }}p{\text{ is even.}}\end{cases}}} Aquínorte¡¡{\textstyle n!!}denota el doble factorial , es decir, el producto de todos los números desde norte{\displaystyle n}a 1 que tienen la misma paridad quenorte.{\textstyle n.}

Los momentos absolutos centrales coinciden con los momentos simples para todos los órdenes pares, pero son distintos de cero para los órdenes impares. Para cualquier entero no negativopag,{\textstyle p,}

mi[|incógnitaμ|pag]=σpag(pag1)¡¡{2πsi pag es extraño1si pag es incluso=σpag2pag/2Γ(pag+12)π.{\displaystyle {\begin{aligned}\operatorname {E} \left[|X-\mu |^{p}\right]&=\sigma ^{p}(p-1)!!\cdot {\begin{cases}{\sqrt {\frac {2}{\pi }}}&{\text{if }}p{\text{ is odd}}\\1&{\text{if }}p{\text{ is even}}\end{cases}}\\[8pt]&=\sigma ^{p}\cdot {\frac {2^{p/2}\Gamma \left({\frac {p+1}{2}}\right)}{\sqrt {\pi }}}.\end{aligned}}} La última fórmula también es válida para cualquier número no entero.pag>1.{\textstyle p>-1.}Cuando la mediaμ0,{\textstyle \mu \neq 0,}Los momentos simples y absolutos pueden expresarse en términos de funciones hipergeométricas confluentes.1F1{\textstyle {}_{1}F_{1}}yU.{\textstyle U.}[ 32 ]mi[incógnitapag]=σpag(i2)pagU(pag2,12,μ22σ2),mi[|incógnita|pag]=σpag2pag/2Γ(1+pag2)π1F1(pag2,12,μ22σ2).{\displaystyle {\begin{aligned}\operatorname {E} \left[X^{p}\right]&=\sigma ^{p}\cdot {\left(-i{\sqrt {2}}\right)}^{p}\,U{\left(-{\frac {p}{2}},{\frac {1}{2}},-{\frac {\mu ^{2}}{2\sigma ^{2}}}\right)},\\\operatorname {E} \left[|X|^{p}\right]&=\sigma ^{p}\cdot 2^{p/2}{\frac {\Gamma {\left({\frac {1+p}{2}}\right)}}{\sqrt {\pi }}}\,{}_{1}F_{1}{\left(-{\frac {p}{2}},{\frac {1}{2}},-{\frac {\mu ^{2}}{2\sigma ^{2}}}\right)}.\end{aligned}}}

Estas expresiones siguen siendo válidas incluso cuandopag>1{\displaystyle p>-1} no es un número entero. Véase también polinomios de Hermite generalizados .

La expectativa deincógnita{\displaystyle X}condicionado al evento de queincógnita{\displaystyle X} se encuentra en un intervalo[a,b]{\textstyle [a,b]}es dado por mi[incógnitaa<incógnita<b]=μσ2F(b)F(a)F(b)F(a),{\displaystyle \operatorname {E} \left[X\mid a<X<b\right]=\mu -\sigma ^{2}{\frac {f(b)-f(a)}{F(b)-F(a)}}\,,} dondeF{\displaystyle f}yF{\displaystyle F} son respectivamente la densidad y la función de distribución acumulativa deincógnita{\displaystyle X} . Parab={\textstyle b=\infty }Esto se conoce como la relación inversa de Mills . Nótese que arriba, la densidadF{\displaystyle f}deincógnita{\displaystyle X} se utiliza en lugar de la densidad normal estándar como en la razón inversa de Mills, por lo que aquí tenemosσ2{\textstyle \sigma ^{2}}en lugar deσ{\displaystyle \sigma }.

transformada de Fourier y función característica

La transformada de Fourier de una densidad normalF{\displaystyle f}con mediaμ{\displaystyle \mu }y varianzaσ2{\textstyle \sigma ^{2}}es [ 33 ]

F^(t)=F(incógnita)miitincógnitadincógnita=miiμtmi12σ2t2,{\displaystyle {\hat {f}}(t)=\int _{-\infty }^{\infty }f(x)e^{-itx}\,dx=e^{-i\mu t}e^{-{\frac {1}{2}}\sigma ^{2}t^{2}}\,,}

dondei{\displaystyle i}es la unidad imaginaria . Si la mediaμ=0{\textstyle \mu =0}, el primer factor es 1, y la transformada de Fourier es, aparte de un factor constante, una densidad normal en el dominio de la frecuencia , con media 0 y varianza 1/σ2{\displaystyle 1/\sigma ^{2}} . En particular, la distribución normal estándarφ{\displaystyle \varphi }es una autofunción de la transformada de Fourier.

En teoría de la probabilidad, la transformada de Fourier de la distribución de probabilidad de una variable aleatoria de valor realincógnita{\displaystyle X}está estrechamente relacionado con la función característicaφincógnita(t){\textstyle \varphi _{X}(t)}de esa variable, que se define como el valor esperado demiitincógnita{\textstyle e^{itX}}, como función de la variable real t{\displaystyle t}( el parámetro de frecuencia de la transformada de Fourier). Esta definición puede extenderse analíticamente a una variable de valor complejo .t{\displaystyle t} . [ 34 ] La relación entre ambos es: φincógnita(t)=F^(t).{\displaystyle \varphi _{X}(t)={\hat {f}}(-t)\,.}

Las partes reales e imaginarias deF^(t)=mi[miitincógnita]=miiμtmi12σ2t2{\displaystyle {\hat {f}}(t)=\operatorname {E} [e^{-itx}]=e^{-i\mu t}e^{-{\frac {1}{2}}\sigma ^{2}t^{2}}}dar: mi[porque(tincógnita)]=porque(μt)mi12σ2t2{\displaystyle \operatorname {E} [\cos(tx)]=\cos(\mu t)e^{-{\frac {1}{2}}\sigma ^{2}t^{2}}}y mi[pecado(tincógnita)]=pecado(μt)mi12σ2t2.{\displaystyle \operatorname {E} [\sin(tx)]=\sin(\mu t)e^{-{\frac {1}{2}}\sigma ^{2}t^{2}}.}

Similarmente, mi[aporrear(tincógnita)]=aporrear(μt)mi12σ2t2{\displaystyle \operatorname {E} [\cosh(tx)]=\cosh(\mu t)e^{{\frac {1}{2}}\sigma ^{2}t^{2}}}y mi[sinh(tincógnita)]=sinh(μt)mi12σ2t2.{\displaystyle \operatorname {E} [\sinh(tx)]=\sinh(\mu t)e^{{\frac {1}{2}}\sigma ^{2}t^{2}}.}

Estas fórmulas se evaluaron ent=1{\displaystyle t=1}dar el valor esperado de estas funciones trigonométricas e hiperbólicas básicas sobre una variable aleatoria gaussianaincógnitanorte(μ,σ2){\displaystyle X\sim N(\mu ,\sigma ^{2})}, lo cual también podría considerarse una consecuencia del teorema de Isserlis .

Funciones generadoras de momentos y cumulantes

La función generadora de momentos de una variable aleatoria realincógnita{\displaystyle X}es el valor esperado demitincógnita{\textstyle e^{tX}}, en función del parámetro real t{\displaystyle t} . Para una distribución normal con densidadF{\displaystyle f}, significaμ{\displaystyle \mu }y varianzaσ2{\textstyle \sigma ^{2}}, la función generadora de momentos existe y es igual a

METRO(t)=mi[mitincógnita]=F^(it)=miμtmiσ2t2/2.{\displaystyle M(t)=\operatorname {E} \left[e^{tX}\right]={\hat {f}}(it)=e^{\mu t}e^{\sigma ^{2}t^{2}/2}\,.} Para cualquier k{\displaystyle k} , el coeficiente detk/k¡{\displaystyle t^{k}/k!}en la función generadora de momentos (expresada como una serie de potencias exponenciales ent{\displaystyle t}) es el valor esperado de la distribución normalmi[incógnitak]{\displaystyle \operatorname {E} [X^{k}]}.

La función generadora de cumulantes es el logaritmo de la función generadora de momentos, a saber: gramo(t)=lnMETRO(t)=μt+12σ2t2.{\displaystyle g(t)=\ln M(t)=\mu t+{\tfrac {1}{2}}\sigma ^{2}t^{2}\,.}

Los coeficientes de esta serie de potencias exponenciales definen los cumulantes, pero debido a que se trata de un polinomio cuadrático en t{\displaystyle t} , solo los dos primeros cumulantes son distintos de cero, es decir, la media μ{\displaystyle \mu }y la varianza σ2{\displaystyle \sigma ^{2}}.

Algunos autores prefieren trabajar en cambio con la función característica E[ e itX ] = e iμtσ 2 t 2 /2 y ln E[ e itX ] = iμt1 / 2 σ 2 t 2 .

Operador y clase de Stein

Dentro del método de Stein, el operador de Stein y la clase de una variable aleatoria incógnitanorte(μ,σ2){\textstyle X\sim {\mathcal {N}}(\mu ,\sigma ^{2})}sonAF(incógnita)=σ2F(incógnita)(incógnitaμ)F(incógnita){\textstyle {\mathcal {A}}f(x)=\sigma ^{2}f'(x)-(x-\mu )f(x)}yF{\textstyle {\mathcal {F}}}la clase de todas las funciones absolutamente continuasF:RR{\displaystyle \textstyle f:\mathbb {R} \to \mathbb {R} }de tal manera quemi[|F(incógnita)|]<{\displaystyle \operatorname {E} [\vert f'(X)\vert ]<\infty }.

Límite de varianza cero

En el límite cuandoσ2{\textstyle \sigma ^{2}}La densidad de probabilidad se acerca a ceroF{\textstyle f}se aproxima a cero en todas partes excepto enμ{\textstyle \mu }, donde se acerca{\textstyle \infty }mientras que su integral permanece igual a 1. Se puede definir una extensión de la distribución normal al caso con varianza cero utilizando la medida delta de Dirac.δμ{\textstyle \delta _{\mu }}, aunque las variables aleatorias resultantes no son absolutamente continuas y, por lo tanto, no tienen funciones de densidad de probabilidad . La función de distribución acumulativa de dicha variable aleatoria es entonces la función escalón de Heaviside trasladada por la media.μ{\textstyle \mu }, es decir F(incógnita)={0si incógnita<μ1si incógnitaμ.{\displaystyle F(x)={\begin{cases}0&{\text{if }}x<\mu \\1&{\text{if }}x\geq \mu .\end{cases}}}

entropía máxima

De todas las distribuciones de probabilidad sobre los números reales con una media finita especificadaμ{\displaystyle \mu }y varianza finitaσ2{\displaystyle \sigma ^{2}} , la distribución normalnorte(μ,σ2){\textstyle N(\mu ,\sigma ^{2})}es la que tiene máxima entropía . [ 24 ] Para ver esto, sea incógnita{\displaystyle X}Sea una variable aleatoria continua con densidad de probabilidad .F(incógnita){\displaystyle f(x)} . La entropía deincógnita{\displaystyle X} se define como [ 35 ] [ 36 ] [ 37 ]H(incógnita)=F(incógnita)lnF(incógnita)dincógnita,{\displaystyle H(X)=-\int _{-\infty }^{\infty }f(x)\ln f(x)\,dx\,,} dóndeF(incógnita)registroF(incógnita){\textstyle f(x)\log f(x)}se entiende que es cero siempre queF(incógnita)=0{\displaystyle f(x)=0}Este funcional puede maximizarse, sujeto a las restricciones de que la distribución esté debidamente normalizada y tenga una media y varianza especificadas, mediante el cálculo variacional . Se define una función con tres multiplicadores de Lagrange :L=F(incógnita)lnF(incógnita)dincógnitaλ0(1F(incógnita)dincógnita)λ1(μF(incógnita)incógnitadincógnita)λ2(σ2F(incógnita)(incógnitaμ)2dincógnita).{\displaystyle L=-\int _{-\infty }^{\infty }f(x)\ln f(x)\,dx-\lambda _{0}\left(1-\int _{-\infty }^{\infty }f(x)\,dx\right)-\lambda _{1}\left(\mu -\int _{-\infty }^{\infty }f(x)x\,dx\right)-\lambda _{2}\left(\sigma ^{2}-\int _{-\infty }^{\infty }f(x)(x-\mu )^{2}\,dx\right)\,.}

En la entropía máxima, una pequeña variaciónδF(incógnita){\textstyle \delta f(x)}acerca deF(incógnita){\textstyle f(x)}producirá una variaciónδL{\textstyle \delta L}sobreL{\displaystyle L}que es igual a 0: 0=δL=δF(incógnita)(lnF(incógnita)1+λ0+λ1incógnita+λ2(incógnitaμ)2)dincógnita.{\displaystyle 0=\delta L=\int _{-\infty }^{\infty }\delta f(x)\left(-\ln f(x)-1+\lambda _{0}+\lambda _{1}x+\lambda _{2}(x-\mu )^{2}\right)\,dx\,.}

Dado que esto debe cumplirse para cualquier pequeñoδF(incógnita){\displaystyle \delta f(x)} , el factor multiplicadorδF(incógnita){\displaystyle \delta f(x)} debe ser cero, y resolver paraF(incógnita){\displaystyle f(x)} produce: F(incógnita)=exp(1+λ0+λ1incógnita+λ2(incógnitaμ)2).{\displaystyle f(x)=\exp \left(-1+\lambda _{0}+\lambda _{1}x+\lambda _{2}(x-\mu )^{2}\right)\,.}

Las restricciones de Lagrange queF(incógnita){\displaystyle f(x)} está correctamente normalizado y tiene la media y varianza especificadas se satisfacen si y solo siλ0{\displaystyle \lambda _{0}},λ1{\displaystyle \lambda _{1}}yλ2{\displaystyle \lambda _{2}} se eligen de manera que F(incógnita)=12πσ2mi(incógnitaμ)22σ2.{\displaystyle f(x)={\frac {1}{\sqrt {2\pi \sigma ^{2}}}}e^{-{\frac {(x-\mu )^{2}}{2\sigma ^{2}}}}\,.} La entropía de una distribución normalincógnitanorte(μ,σ2){\textstyle X\sim N(\mu ,\sigma ^{2})}es igual a H(incógnita)=12(1+ln2σ2π),{\displaystyle H(X)={\tfrac {1}{2}}(1+\ln 2\sigma ^{2}\pi )\,,}que es independiente de la mediaμ{\displaystyle \mu }.

Otras propiedades

  1. Si la función característicaϕincógnita{\textstyle \phi _{X}}de alguna variable aleatoriaincógnita{\displaystyle X}es de la formaϕincógnita(t)=expQ(t){\textstyle \phi _{X}(t)=\exp Q(t)}en un vecindario de cero, dondeQ(t){\textstyle Q(t)}es un polinomio , entonces el teorema de Marcinkiewicz (llamado así por Józef Marcinkiewicz ) afirma que Q{\displaystyle Q} puede ser como máximo un polinomio cuadrático, y por lo tantoincógnita{\displaystyle X}es una variable aleatoria normal. [ 38 ] La consecuencia de este resultado es que la distribución normal es la única distribución con un número finito (dos) de cumulantes distintos de cero.
  2. Siincógnita{\displaystyle X}yY{\displaystyle Y}Si son conjuntamente normales y no están correlacionadas , entonces son independientes . El requisito de queincógnita{\displaystyle X}yY{\displaystyle Y} debe ser conjuntamente normal es esencial; sin ello la propiedad no se cumple. [ 39 ] [ 40 ] [prueba] Para variables aleatorias no normales la falta de correlación no implica independencia.
  3. La divergencia de Kullback-Leibler de una distribución normalincógnita1norte(μ1,σ12){\textstyle X_{1}\sim N(\mu _{1},\sigma _{1}^{2})}de otroincógnita2norte(μ2,σ22){\textstyle X_{2}\sim N(\mu _{2},\sigma _{2}^{2})}está dado por: [ 41 ]DKL(incógnita1incógnita2)=(μ1μ2)22σ22+12(σ12σ221lnσ12σ22){\displaystyle D_{\mathrm {KL} }(X_{1}\parallel X_{2})={\frac {(\mu _{1}-\mu _{2})^{2}}{2\sigma _{2}^{2}}}+{\frac {1}{2}}\left({\frac {\sigma _{1}^{2}}{\sigma _{2}^{2}}}-1-\ln {\frac {\sigma _{1}^{2}}{\sigma _{2}^{2}}}\right)} La distancia de Hellinger entre las mismas distribuciones es igual aH2(incógnita1,incógnita2)=12σ1σ2σ12+σ22exp(14(μ1μ2)2σ12+σ22){\displaystyle H^{2}(X_{1},X_{2})=1-{\sqrt {\frac {2\sigma _{1}\sigma _{2}}{\sigma _{1}^{2}+\sigma _{2}^{2}}}}\exp \left(-{\frac {1}{4}}{\frac {(\mu _{1}-\mu _{2})^{2}}{\sigma _{1}^{2}+\sigma _{2}^{2}}}\right)}
  4. La matriz de información de Fisher para una distribución normal con respecto aμ{\displaystyle \mu }yσ2{\textstyle \sigma ^{2}}es diagonal y toma la formaI(μ,σ2)=(1σ20012σ4){\displaystyle {\mathcal {I}}(\mu ,\sigma ^{2})={\begin{pmatrix}{\frac {1}{\sigma ^{2}}}&0\\0&{\frac {1}{2\sigma ^{4}}}\end{pmatrix}}}
  5. La distribución a priori conjugada de la media de una distribución normal es otra distribución normal. [ 42 ] Específicamente, siincógnita1,,incógnitanorte{\textstyle x_{1},\ldots ,x_{n}}son iidnorte(μ,σ2){\textstyle \sim N(\mu ,\sigma ^{2})}y el anterior esμnorte(μ0,σ02){\textstyle \mu \sim N(\mu _{0},\sigma _{0}^{2})}, entonces la distribución posterior para el estimador de μ{\displaystyle \mu }seráμincógnita1,,incógnitanortenorte(σ2norteμ0+σ02incógnita¯σ2norte+σ02,(norteσ2+1σ02)1){\displaystyle \mu \mid x_{1},\ldots ,x_{n}\sim {\mathcal {N}}\left({\frac {{\frac {\sigma ^{2}}{n}}\mu _{0}+\sigma _{0}^{2}{\bar {x}}}{{\frac {\sigma ^{2}}{n}}+\sigma _{0}^{2}}},\left({\frac {n}{\sigma ^{2}}}+{\frac {1}{\sigma _{0}^{2}}}\right)^{-1}\right)}
  6. La familia de distribuciones normales no solo forma una familia exponencial (FE), sino que, de hecho, forma una familia exponencial natural (FEN) con función de varianza cuadrática ( FEN-FVC ). Muchas propiedades de las distribuciones normales se generalizan a las propiedades de las distribuciones FEN-FVC, las distribuciones FE o las distribuciones FE en general. Las distribuciones FEN-FVC comprenden 6 familias, incluidas las distribuciones de Poisson, Gamma, binomial y binomial negativa, mientras que muchas de las familias comunes estudiadas en probabilidad y estadística son FEN o FE.
  7. En geometría de la información , la familia de distribuciones normales forma una variedad estadística con curvatura constante .1{\displaystyle -1} . La misma familia es plana con respecto a las conexiones (±1)(mi){\textstyle \nabla ^{(e)}}y(metro){\textstyle \nabla ^{(m)}}. [ 43 ]
  8. Siincógnita1,,incógnitanorte{\textstyle X_{1},\dots ,X_{n}}se distribuyen segúnnorte(0,σ2){\textstyle N(0,\sigma ^{2})}, entoncesmi[máximoiincógnitai]σ2lnnorte{\textstyle E[\max _{i}X_{i}]\leq \sigma {\sqrt {2\ln n}}}. Nótese que no se asume independencia. [ 44 ]

Teorema del límite central

A medida que aumenta el número de eventos discretos, la función comienza a asemejarse a una distribución normal.
Comparación de las funciones de densidad de probabilidad, p ( k ), para la suma de n dados justos de 6 caras, para mostrar su convergencia a una distribución normal al aumentar na , de acuerdo con el teorema del límite central. En el gráfico inferior derecho, los perfiles suavizados de los gráficos anteriores se reescalan, se superponen y se comparan con una distribución normal (curva negra).

El teorema del límite central establece que, bajo ciertas condiciones (bastante comunes), la suma de muchas variables aleatorias tendrá una distribución aproximadamente normal. Más específicamente, dondeincógnita1,,incógnitanorte{\textstyle X_{1},\ldots ,X_{n}}son variables aleatorias independientes e idénticamente distribuidas con la misma distribución arbitraria, media cero y varianzaσ2{\textstyle \sigma ^{2}}yZ{\displaystyle Z}es su media escalada pornorte{\textstyle {\sqrt {n}}}Z=norte(1nortei=1norteincógnitai){\displaystyle Z={\sqrt {n}}{\biggl (}{\frac {1}{n}}\sum _{i=1}^{n}X_{i}{\biggr )}} Entonces, comonorte{\displaystyle n} aumenta, la distribución de probabilidad deZ{\displaystyle Z}tenderá a la distribución normal con media cero y varianza cero .σ2{\displaystyle \sigma ^{2}}.

El teorema puede extenderse a variables(incógnitai){\textstyle (X_{i})}que no son independientes y/o no están distribuidas de forma idéntica si se imponen ciertas restricciones al grado de dependencia y a los momentos de las distribuciones.

Muchos estadísticos de prueba , puntuaciones y estimadores que se encuentran en la práctica contienen sumas de ciertas variables aleatorias, e incluso más estimadores pueden representarse como sumas de variables aleatorias mediante el uso de funciones de influencia . El teorema del límite central implica que estos parámetros estadísticos tendrán distribuciones asintóticamente normales.

El teorema del límite central también implica que ciertas distribuciones pueden aproximarse mediante la distribución normal, por ejemplo:

  • La distribución binomialB(norte,pag){\textstyle B(n,p)}es aproximadamente normal con medianortepag{\textstyle np}y varianzanortepag(1pag){\textstyle np(1-p)}para grandesnorte{\displaystyle n}y parapag{\displaystyle p} no demasiado cerca de 0 o 1.
  • La distribución de Poisson con parámetro λ{\displaystyle \lambda } es aproximadamente normal con mediaλ{\displaystyle \lambda }y varianzaλ{\displaystyle \lambda } , para valores grandes deλ{\displaystyle \lambda } . [ 45 ]
  • La distribución chi-cuadradoχ2(k){\textstyle \chi ^{2}(k)}es aproximadamente normal con media k{\displaystyle k}y varianza2k{\textstyle 2k}, para grandesk{\displaystyle k}.
  • Distribución t de Studentt(ν){\textstyle t(\nu )}es aproximadamente normal con media 0 y varianza 1 cuandoν{\displaystyle \nu }es grande.

La precisión de estas aproximaciones depende del propósito para el que se necesiten y de la velocidad de convergencia a la distribución normal. Por lo general, estas aproximaciones son menos precisas en los extremos de la distribución.

El teorema de Berry-Esseen proporciona una cota superior general para el error de aproximación en el teorema del límite central , y las expansiones de Edgeworth proporcionan mejoras en la aproximación .

Este teorema también puede utilizarse para justificar la modelización de la suma de muchas fuentes de ruido uniforme como ruido gaussiano . Véase AWGN .

Operaciones y funciones de variables normales

Operaciones sobre una única variable normal

Siincógnita{\displaystyle X} se distribuye normalmente con mediaμ{\displaystyle \mu }y varianzaσ2{\textstyle \sigma ^{2}}, entonces

  • aincógnita+b{\textstyle aX+b}, para cualquier número reala{\displaystyle a}yb{\displaystyle b} , también se distribuye normalmente, con mediaaμ+b{\textstyle a\mu +b}y varianzaa2σ2{\textstyle a^{2}\sigma ^{2}}. Es decir, la familia de distribuciones normales es cerrada bajo transformaciones lineales .
  • La exponencial de incógnita{\displaystyle X}Se distribuye log-normalmente :miincógnitaln(norte(μ,σ2)){\textstyle e^{X}\sim \ln(N(\mu ,\sigma ^{2}))}.
  • La sigmoide estándar de incógnita{\displaystyle X}tiene una distribución logit -normal :σ(incógnita)PAG(norte(μ,σ2)){\textstyle \sigma (X)\sim P({\mathcal {N}}(\mu ,\,\sigma ^{2}))}.
  • El valor absoluto deincógnita{\displaystyle X} tiene distribución normal plegada :|incógnita|norteF(μ,σ2){\textstyle {\left|X\right|\sim N_{f}(\mu ,\sigma ^{2})}}. Siμ=0{\textstyle \mu =0}Esto se conoce como distribución seminormal .
  • El valor absoluto de los residuos normalizados,|incógnitaμ|/σ{\textstyle |X-\mu |/\sigma }, tiene una distribución chi con un grado de libertad:|incógnitaμ|/σχ1{\textstyle |X-\mu |/\sigma \sim \chi _{1}}.
  • El cuadrado deincógnita/σ{\textstyle X/\sigma }tiene una distribución chi-cuadrado no central con un grado de libertad:incógnita2/σ2χ12(μ2/σ2){\textstyle X^{2}/\sigma ^{2}\sim \chi _{1}^{2}(\mu ^{2}/\sigma ^{2})}. Siμ=0{\textstyle \mu =0}, la distribución se denomina simplemente chi-cuadrado .
  • La log-verosimilitud de una variable normalincógnita{\displaystyle x}es simplemente el logaritmo de su función de densidad de probabilidad :lnpag(incógnita)=12(incógnitaμσ)2ln(σ2π).{\displaystyle \ln p(x)=-{\frac {1}{2}}\left({\frac {x-\mu }{\sigma }}\right)^{2}-\ln \left(\sigma {\sqrt {2\pi }}\right).}Dado que se trata de un cuadrado escalado y desplazado de una variable normal estándar, se distribuye como una variable chi-cuadrado escalada y desplazada.
  • La distribución de la variableincógnita{\displaystyle X}restringido a un intervalo[a,b]{\textstyle [a,b]}se denomina distribución normal truncada .
  • (incógnitaμ)2{\textstyle (X-\mu )^{-2}}tiene una distribución de Lévy con ubicación 0 y escalaσ2{\textstyle \sigma ^{-2}}.
Operaciones con dos variables normales independientes
  • Siincógnita1{\textstyle X_{1}}yincógnita2{\textstyle X_{2}}son dos variables aleatorias normales independientes , con mediasμ1{\textstyle \mu _{1}},μ2{\textstyle \mu _{2}}y variacionesσ12{\textstyle \sigma _{1}^{2}},σ22{\textstyle \sigma _{2}^{2}}, entonces su sumaincógnita1+incógnita2{\textstyle X_{1}+X_{2}}También se distribuirá normalmente, [prueba] con mediaμ1+μ2{\textstyle \mu _{1}+\mu _{2}}y varianzaσ12+σ22{\textstyle \sigma _{1}^{2}+\sigma _{2}^{2}}.
  • En particular, siincógnita{\displaystyle X}yY{\displaystyle Y}son desviaciones normales independientes con media cero y varianzaσ2{\textstyle \sigma ^{2}}, entoncesincógnita+Y{\textstyle X+Y}yincógnitaY{\textstyle X-Y}También son independientes y se distribuyen normalmente, con media cero y varianza2σ2{\textstyle 2\sigma ^{2}}. Este es un caso especial de la identidad de polarización . [ 46 ]
  • Siincógnita1{\textstyle X_{1}},incógnita2{\textstyle X_{2}}son dos desviaciones normales independientes con media μ{\displaystyle \mu }y varianzaσ2{\textstyle \sigma ^{2}}ya{\displaystyle a},b{\displaystyle b}Si son números reales arbitrarios, entonces la variableincógnita3=aincógnita1+bincógnita2(a+b)μa2+b2+μ{\displaystyle X_{3}={\frac {aX_{1}+bX_{2}-(a+b)\mu }{\sqrt {a^{2}+b^{2}}}}+\mu }También se distribuye normalmente con media μ{\displaystyle \mu }y varianzaσ2{\textstyle \sigma ^{2}}De ello se deduce que la distribución normal es estable (con exponenteα=2{\textstyle \alpha =2}).
  • Siincógnitaknorte(metrok,σk2){\textstyle X_{k}\sim {\mathcal {N}}(m_{k},\sigma _{k}^{2})},k{0,1}{\textstyle k\in \{0,1\}}Si las distribuciones son normales, entonces su media geométrica normalizada1Rnorteincógnita0α(incógnita)incógnita11α(incógnita)dincógnitaincógnita0αincógnita11α{\textstyle {\frac {1}{\int _{\mathbb {R} ^{n}}X_{0}^{\alpha }(x)X_{1}^{1-\alpha }(x)\,{\text{d}}x}}X_{0}^{\alpha }X_{1}^{1-\alpha }}es una distribución normalnorte(metroα,σα2){\textstyle {\mathcal {N}}(m_{\alpha },\sigma _{\alpha }^{2})}conmetroα=αmetro0σ12+(1α)metro1σ02ασ12+(1α)σ02{\textstyle m_{\alpha }={\frac {\alpha m_{0}\sigma _{1}^{2}+(1-\alpha )m_{1}\sigma _{0}^{2}}{\alpha \sigma _{1}^{2}+(1-\alpha )\sigma _{0}^{2}}}}yσα2=σ02σ12ασ12+(1α)σ02{\textstyle \sigma _{\alpha }^{2}={\frac {\sigma _{0}^{2}\sigma _{1}^{2}}{\alpha \sigma _{1}^{2}+(1-\alpha )\sigma _{0}^{2}}}}.
Operaciones con dos variables normales estándar independientes

Siincógnita1{\textstyle X_{1}}yincógnita2{\textstyle X_{2}}son dos variables aleatorias normales estándar independientes con media 0 y varianza 1, entonces

  • Su suma y diferencia se distribuyen normalmente con media cero y varianza dos:incógnita1±incógnita2norte(0,2){\textstyle X_{1}\pm X_{2}\sim {\mathcal {N}}(0,2)}.
  • Su productoZ=incógnita1incógnita2{\textstyle Z=X_{1}X_{2}}sigue la distribución del producto [ 47 ] con función de densidadFZ(z)=π1K0(|z|){\textstyle f_{Z}(z)=\pi ^{-1}K_{0}(|z|)}dóndeK0{\textstyle K_{0}}es la función de Bessel modificada de segundo tipo . Esta distribución es simétrica alrededor de cero, no acotada enz=0{\textstyle z=0}y tiene la función característicaϕZ(t)=(1+t2)1/2{\textstyle \phi _{Z}(t)=(1+t^{2})^{-1/2}}.
  • Su proporción sigue la distribución de Cauchy estándar :incógnita1/incógnita2Cauchy(0,1){\textstyle X_{1}/X_{2}\sim \operatorname {Cauchy} (0,1)}.
  • Su norma euclidianaincógnita12+incógnita22{\textstyle {\sqrt {X_{1}^{2}+X_{2}^{2}}}}tiene la distribución de Rayleigh .

Operaciones sobre múltiples variables normales independientes

  • Cualquier combinación lineal de desviaciones normales independientes es una desviación normal.
  • Siincógnita1,incógnita2,,incógnitanorte{\textstyle X_{1},X_{2},\ldots ,X_{n}}Si son variables aleatorias normales estándar independientes, entonces la suma de sus cuadrados tiene la distribución chi-cuadrado con norte{\displaystyle n}grados de libertadincógnita12++incógnitanorte2χnorte2.{\displaystyle X_{1}^{2}+\cdots +X_{n}^{2}\sim \chi _{n}^{2}.}
  • Siincógnita1,incógnita2,,incógnitanorte{\textstyle X_{1},X_{2},\ldots ,X_{n}}son variables aleatorias independientes con distribución normal y mediasμ{\displaystyle \mu }y variacionesσ2{\textstyle \sigma ^{2}}, entonces su media muestral es independiente de la desviación estándar muestral , [ 48 ] lo cual puede demostrarse utilizando el teorema de Basu o el teorema de Cochran . [ 49 ] La razón de estas dos cantidades tendrá la distribución t de Student connorte1{\textstyle n-1}grados de libertad:t=incógnita¯μS/norte=1norte(incógnita1++incógnitanorte)μ1norte(norte1)[(incógnita1incógnita¯)2++(incógnitanorteincógnita¯)2]tnorte1.{\displaystyle t={\frac {{\overline {X}}-\mu }{S/{\sqrt {n}}}}={\frac {{\frac {1}{n}}(X_{1}+\cdots +X_{n})-\mu }{\sqrt {{\frac {1}{n(n-1)}}\left[(X_{1}-{\overline {X}})^{2}+\cdots +(X_{n}-{\overline {X}})^{2}\right]}}}\sim t_{n-1}.}
  • Siincógnita1,incógnita2,,incógnitanorte{\textstyle X_{1},X_{2},\ldots ,X_{n}},Y1,Y2,,Ymetro{\textstyle Y_{1},Y_{2},\ldots ,Y_{m}}son variables aleatorias normales estándar independientes, entonces la razón de sus sumas de cuadrados normalizadas tendrá la distribución F con ( n , m ) grados de libertad: [ 50 ]F=(incógnita12+incógnita22++incógnitanorte2)/norte(Y12+Y22++Ymetro2)/metroFnorte,metro.{\displaystyle F={\frac {\left(X_{1}^{2}+X_{2}^{2}+\cdots +X_{n}^{2}\right)/n}{\left(Y_{1}^{2}+Y_{2}^{2}+\cdots +Y_{m}^{2}\right)/m}}\sim F_{n,m}.}

Operaciones sobre múltiples variables normales correlacionadas

  • Una forma cuadrática de un vector normal, es decir, una función cuadrática.q=incógnitai2+incógnitaj+do{\textstyle q=\sum x_{i}^{2}+\sum x_{j}+c}De múltiples variables normales independientes o correlacionadas, es una variable chi-cuadrado generalizada .

Operaciones sobre la función de densidad

La distribución normal dividida se define de forma más directa mediante la unión de secciones escaladas de las funciones de densidad de diferentes distribuciones normales y el reescalado de la densidad para que su integral sea igual a uno. La distribución normal truncada resulta del reescalado de una sección de una única función de densidad.

Divisibilidad infinita y el teorema de Cramér

Para cualquier entero positivo n , cualquier distribución normal con media μ{\displaystyle \mu }y varianzaσ2{\textstyle \sigma ^{2}}es la distribución de la suma de n desviaciones normales independientes, cada una con mediaμnorte{\textstyle {\frac {\mu }{n}}}y varianzaσ2norte{\textstyle {\frac {\sigma ^{2}}{n}}}Esta propiedad se denomina divisibilidad infinita . [ 51 ]

Por el contrario, siincógnita1{\textstyle X_{1}}yincógnita2{\textstyle X_{2}}son variables aleatorias independientes y su sumaincógnita1+incógnita2{\textstyle X_{1}+X_{2}}tiene una distribución normal, entonces ambosincógnita1{\textstyle X_{1}}yincógnita2{\textstyle X_{2}}deben ser desviaciones normales. [ 52 ]

Este resultado se conoce como el teorema de descomposición de Cramér y equivale a decir que la convolución de dos distribuciones es normal si y solo si ambas son normales. El teorema de Cramér implica que una combinación lineal de variables independientes no gaussianas nunca tendrá una distribución exactamente normal, aunque puede aproximarse a ella de forma arbitraria. [ 38 ]

El teorema de Kac-Bernstein

El teorema de Kac-Bernstein establece que siincógnita{\textstyle X}yY{\displaystyle Y}son independientes yincógnita+Y{\textstyle X+Y}yincógnitaY{\textstyle X-Y}Si también son independientes, entonces tanto X como Y deben necesariamente tener distribuciones normales. [ 53 ] [ 54 ]

En términos más generales, siincógnita1,,incógnitanorte{\textstyle X_{1},\ldots ,X_{n}}son variables aleatorias independientes, entonces dos combinaciones lineales distintasakincógnitak{\textstyle \sum {a_{k}X_{k}}}ybkincógnitak{\textstyle \sum {b_{k}X_{k}}}será independiente si y solo si todosincógnitak{\textstyle X_{k}}son normales yakbkσk2=0{\textstyle \sum {a_{k}b_{k}\sigma _{k}^{2}=0}}, dóndeσk2{\textstyle \sigma _{k}^{2}}denota la varianza deincógnitak{\textstyle X_{k}}. [ 53 ]

Extensiones

La noción de distribución normal, una de las distribuciones más importantes en la teoría de la probabilidad, se ha extendido mucho más allá del marco estándar del caso univariado (es decir, unidimensional) (Caso 1). Todas estas extensiones también se denominan leyes normales o gaussianas , por lo que existe cierta ambigüedad en la terminología.

Una variable aleatoria X tiene una distribución normal de dos partes si tiene una distribución Fincógnita(incógnita)={norte(μ,σ12), si incógnitaμnorte(μ,σ22), si incógnitaμ{\displaystyle f_{X}(x)={\begin{cases}N(\mu ,\sigma _{1}^{2}),&{\text{ if }}x\leq \mu \\N(\mu ,\sigma _{2}^{2}),&{\text{ if }}x\geq \mu \end{cases}}} donde μ es la media y σ 2 1  y σ 2 2  son las varianzas de la distribución a la izquierda y a la derecha de la media respectivamente.

Se han determinado la media E( X ) , la varianza V( X ) y el tercer momento central T( X ) de esta distribución [ 55 ].mi(incógnita)=μ+2π(σ2σ1),V(incógnita)=(12π)(σ2σ1)2+σ1σ2,T(incógnita)=2π(σ2σ1)[(4π1)(σ2σ1)2+σ1σ2].{\displaystyle {\begin{aligned}\operatorname {E} (X)&=\mu +{\sqrt {\frac {2}{\pi }}}(\sigma _{2}-\sigma _{1}),\\\operatorname {V} (X)&=\left(1-{\frac {2}{\pi }}\right)(\sigma _{2}-\sigma _{1})^{2}+\sigma _{1}\sigma _{2},\\\operatorname {T} (X)&={\sqrt {\frac {2}{\pi }}}(\sigma _{2}-\sigma _{1})\left[\left({\frac {4}{\pi }}-1\right)(\sigma _{2}-\sigma _{1})^{2}+\sigma _{1}\sigma _{2}\right].\end{aligned}}}

Uno de los principales usos prácticos de la ley gaussiana es modelar las distribuciones empíricas de muchas variables aleatorias diferentes que se encuentran en la práctica. En tal caso, una posible extensión sería una familia más rica de distribuciones, con más de dos parámetros y, por lo tanto, capaz de ajustarse con mayor precisión a la distribución empírica. Algunos ejemplos de tales extensiones son:

  • Distribución de Pearson : una familia de distribuciones de probabilidad de cuatro parámetros que extienden la ley normal para incluir diferentes valores de asimetría y curtosis.
  • La distribución normal generalizada , también conocida como distribución de potencia exponencial, permite colas de distribución con comportamientos asintóticos más gruesos o más delgados.

Inferencia estadística

Estimación de parámetros

A menudo ocurre que no conocemos los parámetros de la distribución normal, sino que queremos estimarlos . Es decir, teniendo una muestra(incógnita1,,incógnitanorte){\textstyle (x_{1},\ldots ,x_{n})}de un normalnorte(μ,σ2){\textstyle {\mathcal {N}}(\mu ,\sigma ^{2})}Población de la que nos gustaría conocer los valores aproximados de los parámetros .μ{\displaystyle \mu }yσ2{\textstyle \sigma ^{2}}El enfoque estándar para este problema es el método de máxima verosimilitud , que requiere la maximización de la función de log-verosimilitud :lnL(μ,σ2)=i=1nortelnF(incógnitaiμ,σ2)=norte2ln(2π)norte2lnσ212σ2i=1norte(incógnitaiμ)2.{\displaystyle {\begin{aligned}\ln {\mathcal {L}}(\mu ,\sigma ^{2})&=\sum _{i=1}^{n}\ln f(x_{i}\mid \mu ,\sigma ^{2})\\&=-{\frac {n}{2}}\ln(2\pi )-{\frac {n}{2}}\ln \sigma ^{2}-{\frac {1}{2\sigma ^{2}}}\sum _{i=1}^{n}(x_{i}-\mu )^{2}.\end{aligned}}} Tomando derivadas con respecto a μ{\displaystyle \mu }yσ2{\textstyle \sigma ^{2}}y al resolver el sistema resultante de condiciones de primer orden se obtienen las estimaciones de máxima verosimilitud : μ^=incógnita¯1nortei=1norteincógnitai,σ^2=1nortei=1norte(incógnitaiincógnita¯)2.{\displaystyle {\hat {\mu }}={\overline {x}}\equiv {\frac {1}{n}}\sum _{i=1}^{n}x_{i},\qquad {\hat {\sigma }}^{2}={\frac {1}{n}}\sum _{i=1}^{n}(x_{i}-{\overline {x}})^{2}.}

EntonceslnL(μ^,σ^2){\textstyle \ln {\mathcal {L}}({\hat {\mu }},{\hat {\sigma }}^{2})}es el siguiente: lnL(μ^,σ^2)=norte2[ln(2πσ^2)+1]{\displaystyle \ln {\mathcal {L}}({\hat {\mu }},{\hat {\sigma }}^{2})=-{\frac {n}{2}}[\ln \left(2\pi {\hat {\sigma }}^{2}\right)+1]}

Media de la muestra

Estimadorμ^{\displaystyle \textstyle {\hat {\mu }}}se llama media muestral , ya que es la media aritmética de todas las observaciones. El estadísticoincógnita¯{\displaystyle \textstyle {\overline {x}}}es completo y suficiente paraμ{\displaystyle \mu } , y por lo tanto, según el teorema de Lehmann-Scheffé ,μ^{\displaystyle \textstyle {\hat {\mu }}}es el estimador insesgado de varianza mínima uniforme (UMVU). [ 56 ] En muestras finitas se distribuye normalmente: μ^norte(μ,σ2/norte).{\displaystyle {\hat {\mu }}\sim {\mathcal {N}}(\mu ,\sigma ^{2}/n).} La varianza de este estimador es igual al elemento μμ de la matriz de información de Fisher inversa.I1{\displaystyle \textstyle {\mathcal {I}}^{-1}}Esto implica que el estimador es eficiente para muestras finitas . De importancia práctica es el error estándar deμ^{\displaystyle \textstyle {\hat {\mu }}}ser proporcional a1/norte{\displaystyle \textstyle 1/{\sqrt {n}}}Es decir, si se desea disminuir el error estándar en un factor de 10, se debe aumentar el número de puntos en la muestra en un factor de 100. Este hecho se utiliza ampliamente para determinar el tamaño de la muestra en encuestas de opinión y el número de ensayos en simulaciones de Monte Carlo .

Desde el punto de vista de la teoría asintótica ,μ^{\displaystyle \textstyle {\hat {\mu }}}es consistente , es decir, converge en probabilidad aμ{\displaystyle \mu }comonorte{\textstyle n\rightarrow \infty }El estimador también es asintóticamente normal , lo cual es un corolario simple de que sea normal en muestras finitas: norte(μ^μ)dnorte(0,σ2).{\displaystyle {\sqrt {n}}({\hat {\mu }}-\mu )\,\xrightarrow {d} \,{\mathcal {N}}(0,\sigma ^{2}).}

Varianza de la muestra

El estimadorσ^2{\displaystyle \textstyle {\hat {\sigma }}^{2}}se denomina varianza muestral , puesto que es la varianza de la muestra ((incógnita1,,incógnitanorte){\textstyle (x_{1},\ldots ,x_{n})}). En la práctica, a menudo se utiliza otro estimador en lugar delσ^2{\displaystyle \textstyle {\hat {\sigma }}^{2}}Este otro estimador se denota s2{\textstyle s^{2}}y también se denomina varianza muestral , lo que representa cierta ambigüedad en la terminología; su raíz cuadradas{\displaystyle s}Se denomina desviación estándar de la muestra . El estimadors2{\textstyle s^{2}}difiere deσ^2{\displaystyle \textstyle {\hat {\sigma }}^{2}}al tener ( n − 1) en lugar de n en el denominador (la llamada corrección de Bessel ):  s2=nortenorte1σ^2=1norte1i=1norte(incógnitaiincógnita¯)2.{\displaystyle s^{2}={\frac {n}{n-1}}{\hat {\sigma }}^{2}={\frac {1}{n-1}}\sum _{i=1}^{n}(x_{i}-{\overline {x}})^{2}.} La diferencia entres2{\textstyle s^{2}}yσ^2{\displaystyle \textstyle {\hat {\sigma }}^{2}}se vuelve insignificante para valores grandes de n . Sin embargo, en muestras finitas, la motivación detrás del uso des2{\textstyle s^{2}}es que es un estimador insesgado del parámetro subyacenteσ2{\textstyle \sigma ^{2}}, mientrasσ^2{\displaystyle \textstyle {\hat {\sigma }}^{2}}está sesgado. Además, por el teorema de Lehmann-Scheffé, el estimadors2{\textstyle s^{2}}es uniformemente insesgado de varianza mínima ( UMVU ), [ 56 ] lo que lo convierte en el "mejor" estimador entre todos los insesgados. Sin embargo, se puede demostrar que el estimador sesgadoσ^2{\displaystyle \textstyle {\hat {\sigma }}^{2}}es mejor que els2{\textstyle s^{2}}en términos del criterio del error cuadrático medio (ECM). En muestras finitas amboss2{\textstyle s^{2}}yσ^2{\displaystyle \textstyle {\hat {\sigma }}^{2}}Se ha ajustado la distribución chi-cuadrado con ( n − 1) grados de libertad: s2σ2norte1χnorte12,σ^2σ2norteχnorte12.{\displaystyle s^{2}\sim {\frac {\sigma ^{2}}{n-1}}\cdot \chi _{n-1}^{2},\qquad {\hat {\sigma }}^{2}\sim {\frac {\sigma ^{2}}{n}}\cdot \chi _{n-1}^{2}.} La primera de estas expresiones muestra que la varianza des2{\textstyle s^{2}}es igual a2σ4/(norte1){\textstyle 2\sigma ^{4}/(n-1)}, que es ligeramente mayor que el elemento σσ de la matriz de información de Fisher inversaI1{\displaystyle \textstyle {\mathcal {I}}^{-1}}, que es2σ4/norte{\textstyle 2\sigma ^{4}/n}. De este modo,s2{\textstyle s^{2}}no es un estimador eficiente paraσ2{\textstyle \sigma ^{2}}y además, puesto ques2{\textstyle s^{2}}es UMVU, podemos concluir que el estimador eficiente de muestra finita paraσ2{\textstyle \sigma ^{2}}No existe.

Aplicando la teoría asintótica, ambos estimadoress2{\textstyle s^{2}}yσ^2{\displaystyle \textstyle {\hat {\sigma }}^{2}}son consistentes, es decir, convergen en probabilidad aσ2{\textstyle \sigma ^{2}}como el tamaño de la muestranorte{\textstyle n\rightarrow \infty }. Ambos estimadores son también asintóticamente normales: norte(σ^2σ2)norte(s2σ2)dnorte(0,2σ4).{\displaystyle {\sqrt {n}}({\hat {\sigma }}^{2}-\sigma ^{2})\simeq {\sqrt {n}}(s^{2}-\sigma ^{2})\,\xrightarrow {d} \,{\mathcal {N}}(0,2\sigma ^{4}).} En particular, ambos estimadores son asintóticamente eficientes para σ2{\textstyle \sigma ^{2}}.

Intervalos de confianza

Según el teorema de Cochran , para distribuciones normales la media muestralμ^{\displaystyle \textstyle {\hat {\mu }}}y la varianza muestral s 2 son independientes , lo que significa que no puede haber ninguna ventaja en considerar su distribución conjunta . También existe un teorema recíproco: si en una muestra la media muestral y la varianza muestral son independientes, entonces la muestra debe provenir de la distribución normal. La independencia entreμ^{\displaystyle \textstyle {\hat {\mu }}}y s se puede emplear para construir el llamado estadístico t : t=μ^μs/norte=incógnita¯μ1norte(norte1)(incógnitaiincógnita¯)2tnorte1{\displaystyle t={\frac {{\hat {\mu }}-\mu }{s/{\sqrt {n}}}}={\frac {{\overline {x}}-\mu }{\sqrt {{\frac {1}{n(n-1)}}\sum (x_{i}-{\overline {x}})^{2}}}}\sim t_{n-1}} Esta cantidad t tiene la distribución t de Student con ( n − 1) grados de libertad, y es una estadística auxiliar (independiente del valor de los parámetros). Invertir la distribución de esta estadística t nos permitirá construir el intervalo de confianza para μ ; [ 57 ] de manera similar, invertir la distribución χ² de la estadística nos dará el intervalo de confianza para σ² : [ 58 ]μ[μ^tnorte1,1α/2snorte,μ^+tnorte1,1α/2snorte]{\displaystyle \mu \in \left[{\hat {\mu }}-t_{n-1,1-\alpha /2}{\frac {s}{\sqrt {n}}},\,{\hat {\mu }}+t_{n-1,1-\alpha /2}{\frac {s}{\sqrt {n}}}\right]}σ2[norte1χnorte1,1α/22s2,norte1χnorte1,α/22s2]{\displaystyle \sigma ^{2}\in \left[{\frac {n-1}{\chi _{n-1,1-\alpha /2}^{2}}}s^{2},\,{\frac {n-1}{\chi _{n-1,\alpha /2}^{2}}}s^{2}\right]} donde t k , p y χ 2 k,p   son los cuantiles p de las distribuciones t y χ 2 respectivamente. Estos intervalos de confianza son del nivel de confianza 1 − α , lo que significa que los valores verdaderos μ y σ 2 caen fuera de estos intervalos con una probabilidad (o nivel de significancia ) α . En la práctica, se suele tomar α = 5% , lo que resulta en intervalos de confianza del 95%. El intervalo de confianza para σ se puede encontrar tomando la raíz cuadrada de los límites del intervalo para σ 2 .

Se pueden derivar fórmulas aproximadas a partir de las distribuciones asintóticas deμ^{\displaystyle \textstyle {\hat {\mu }}}y s 2 : μ[μ^|zα/2|nortes,μ^+|zα/2|nortes]{\displaystyle \mu \in \left[{\hat {\mu }}-{\frac {|z_{\alpha /2}|}{\sqrt {n}}}s,\,{\hat {\mu }}+{\frac {|z_{\alpha /2}|}{\sqrt {n}}}s\right]}σ2[s22|zα/2|nortes2,s2+2|zα/2|nortes2]{\displaystyle \sigma ^{2}\in \left[s^{2}-{\sqrt {2}}{\frac {|z_{\alpha /2}|}{\sqrt {n}}}s^{2},\,s^{2}+{\sqrt {2}}{\frac {|z_{\alpha /2}|}{\sqrt {n}}}s^{2}\right]} Las fórmulas aproximadas se vuelven válidas para valores grandes de n y son más convenientes para el cálculo manual ya que los cuantiles normales estándar z α /2 no dependen de n . En particular, el valor más popular de α = 5% , resulta en | z 0.025 | = 1.96 .

Pruebas de normalidad

Las pruebas de normalidad evalúan la probabilidad de que el conjunto de datos { x₁ , ..., xn } provenga de una distribución normal. Normalmente, la hipótesis nula H₀ plantea que las observaciones se distribuyen normalmente con una media μ y una varianza σ² no especificadas , frente a la hipótesis alternativa Hₐ , que plantea que la distribución es arbitraria. Se han diseñado numerosas pruebas (más de 40) para abordar este problema. Las más destacadas se describen a continuación:

Los gráficos de diagnóstico resultan más intuitivos, pero a la vez son subjetivos, ya que dependen del juicio humano informal para aceptar o rechazar la hipótesis nula.

  • El gráfico Q-Q , también conocido como gráfico de probabilidad normal o gráfico de Rankit , es un gráfico de los valores ordenados del conjunto de datos frente a los valores esperados de los cuantiles correspondientes de la distribución normal estándar. Es decir, es un gráfico de puntos de la forma ( Φ −1 ( p k ), x ( k ) ) , donde los puntos de trazado p k son iguales a p k = ( kα )/( n + 1 − 2 α ) y α es una constante de ajuste, que puede ser cualquier valor entre 0 y  1. Si la hipótesis nula es verdadera, los puntos trazados deberían estar aproximadamente sobre una línea recta.
  • Gráfico P–P : similar al gráfico Q–Q, pero utilizado con mucha menos frecuencia. Este método consiste en graficar los puntos ( Φ ( z ( k ) ), p k ) , dondez(k)=(incógnita(k)μ^)/σ^{\textstyle \textstyle z_{(k)}=(x_{(k)}-{\hat {\mu }})/{\hat {\sigma }}}. Para datos con distribución normal, este gráfico debería estar situado en una línea recta entre (0, 0) y (1, 1) . 

Pruebas de bondad de ajuste :

Pruebas basadas en momentos :

Pruebas basadas en la función de distribución empírica :

Análisis bayesiano de la distribución normal

El análisis bayesiano de datos con distribución normal se complica por las muchas posibilidades diferentes que se pueden considerar:

Las fórmulas para los casos de regresión no lineal se resumen en el artículo anterior conjugado .

Suma de dos ecuaciones cuadráticas

Forma escalar

La siguiente fórmula auxiliar resulta útil para simplificar las ecuaciones de actualización posteriores , que de otro modo se vuelven bastante tediosas.

a(incógnitay)2+b(incógnitaz)2=(a+b)(incógnitaay+bza+b)2+aba+b(yz)2{\displaystyle a(x-y)^{2}+b(x-z)^{2}=(a+b)\left(x-{\frac {ay+bz}{a+b}}\right)^{2}+{\frac {ab}{a+b}}(y-z)^{2}}

Esta ecuación reescribe la suma de dos ecuaciones cuadráticas en x mediante la expansión de cuadrados, la agrupación de términos en x y la completación del cuadrado . Nótese lo siguiente acerca de los factores constantes complejos asociados a algunos de los términos:

  1. El factoray+bza+b{\textstyle {\frac {ay+bz}{a+b}}}tiene la forma de un promedio ponderado de y y z .
  2. aba+b=11a+1b=(a1+b1)1.{\textstyle {\frac {ab}{a+b}}={\frac {1}{{\frac {1}{a}}+{\frac {1}{b}}}}=(a^{-1}+b^{-1})^{-1}.}Esto demuestra que este factor puede considerarse como resultado de una situación en la que los recíprocos de las cantidades a y b se suman directamente, por lo que para combinar a y b entre sí, es necesario recíprocos, sumar y volver a recíprocos el resultado para regresar a las unidades originales. Este es exactamente el tipo de operación que realiza la media armónica , por lo que no es sorprendente queaba+b{\textstyle {\frac {ab}{a+b}}}es la mitad de la media armónica de a y b .
Forma vectorial

Se puede escribir una fórmula similar para la suma de dos cuadráticos vectoriales: Si x , y , z son vectores de longitud k , y A y B son matrices simétricas e invertibles de tamañok×k{\textstyle k\times k}, entonces

(yincógnita)A(yincógnita)+(incógnitaz)B(incógnitaz)=(incógnitado)(A+B)(incógnitado)+(yz)(A1+B1)1(yz){\displaystyle {\begin{aligned}&(\mathbf {y} -\mathbf {x} )'\mathbf {A} (\mathbf {y} -\mathbf {x} )+(\mathbf {x} -\mathbf {z} )'\mathbf {B} (\mathbf {x} -\mathbf {z} )\\={}&(\mathbf {x} -\mathbf {c} )'(\mathbf {A} +\mathbf {B} )(\mathbf {x} -\mathbf {c} )+(\mathbf {y} -\mathbf {z} )'(\mathbf {A} ^{-1}+\mathbf {B} ^{-1})^{-1}(\mathbf {y} -\mathbf {z} )\end{aligned}}} dónde do=(A+B)1(Ay+Bz){\displaystyle \mathbf {c} =(\mathbf {A} +\mathbf {B} )^{-1}(\mathbf {A} \mathbf {y} +\mathbf {B} \mathbf {z} )}

La forma xA x se llama forma cuadrática y es un escalar : incógnitaAincógnita=i,jaijincógnitaiincógnitaj{\displaystyle \mathbf {x} '\mathbf {A} \mathbf {x} =\sum _{i,j}a_{ij}x_{i}x_{j}} En otras palabras, suma todas las combinaciones posibles de productos de pares de elementos de x , con un coeficiente separado para cada uno. Además, dado queincógnitaiincógnitaj=incógnitajincógnitai{\textstyle x_{i}x_{j}=x_{j}x_{i}}, solo la sumaaij+aji{\textstyle a_{ij}+a_{ji}}importa para cualquier elemento fuera de la diagonal de A , y no hay pérdida de generalidad al suponer que A es simétrico . Además, si A es simétrico, entonces la formaincógnitaAy=yAincógnita.{\textstyle \mathbf {x} '\mathbf {A} \mathbf {y} =\mathbf {y} '\mathbf {A} \mathbf {x} .}

Suma de las diferencias con respecto a la media

Otra fórmula útil es la siguiente: i=1norte(incógnitaiμ)2=i=1norte(incógnitaiincógnita¯)2+norte(incógnita¯μ)2{\displaystyle \sum _{i=1}^{n}(x_{i}-\mu )^{2}=\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}+n({\bar {x}}-\mu )^{2}} dóndeincógnita¯=1nortei=1norteincógnitai.{\textstyle {\bar {x}}={\frac {1}{n}}\sum _{i=1}^{n}x_{i}.}

Con varianza conocida

Para un conjunto de puntos de datos X distribuidos normalmente e i.i.d. de tamaño n, donde cada punto individual x sigueincógnitanorte(μ,σ2){\textstyle x\sim {\mathcal {N}}(\mu ,\sigma ^{2})}Con una varianza conocida σ 2 , la distribución previa conjugada también tiene una distribución normal.

Esto se puede demostrar más fácilmente reescribiendo la varianza como la precisión , es decir, usando τ = 1/ σ 2 . Entonces, siincógnitanorte(μ,1/τ){\textstyle x\sim {\mathcal {N}}(\mu ,1/\tau )}yμnorte(μ0,1/τ0),{\textstyle \mu \sim {\mathcal {N}}(\mu _{0},1/\tau _{0}),}Procedemos de la siguiente manera.

En primer lugar, la función de verosimilitud es (utilizando la fórmula anterior para la suma de las diferencias con respecto a la media): pag(incógnitaμ,τ)=i=1norteτ2πexp(12τ(incógnitaiμ)2)=(τ2π)norte/2exp(12τi=1norte(incógnitaiμ)2)=(τ2π)norte/2exp[12τ(i=1norte(incógnitaiincógnita¯)2+norte(incógnita¯μ)2)].{\displaystyle {\begin{aligned}p(\mathbf {X} \mid \mu ,\tau )&=\prod _{i=1}^{n}{\sqrt {\frac {\tau }{2\pi }}}\exp \left(-{\frac {1}{2}}\tau (x_{i}-\mu )^{2}\right)\\&=\left({\frac {\tau }{2\pi }}\right)^{n/2}\exp \left(-{\frac {1}{2}}\tau \sum _{i=1}^{n}(x_{i}-\mu )^{2}\right)\\&=\left({\frac {\tau }{2\pi }}\right)^{n/2}\exp \left[-{\frac {1}{2}}\tau \left(\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}+n({\bar {x}}-\mu )^{2}\right)\right].\end{aligned}}}

A continuación, procedemos de la siguiente manera: pag(μincógnita)pag(incógnitaμ)pag(μ)=(τ2π)norte/2exp[12τ(i=1norte(incógnitaiincógnita¯)2+norte(incógnita¯μ)2)]τ02πexp(12τ0(μμ0)2)exp(12(τ(i=1norte(incógnitaiincógnita¯)2+norte(incógnita¯μ)2)+τ0(μμ0)2))exp(12(norteτ(incógnita¯μ)2+τ0(μμ0)2))=exp(12(norteτ+τ0)(μnorteτincógnita¯+τ0μ0norteτ+τ0)2+norteττ0norteτ+τ0(incógnita¯μ0)2)exp(12(norteτ+τ0)(μnorteτincógnita¯+τ0μ0norteτ+τ0)2){\displaystyle {\begin{aligned}p(\mu \mid \mathbf {X} )&\propto p(\mathbf {X} \mid \mu )p(\mu )\\&=\left({\frac {\tau }{2\pi }}\right)^{n/2}\exp \left[-{\frac {1}{2}}\tau \left(\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}+n({\bar {x}}-\mu )^{2}\right)\right]{\sqrt {\frac {\tau _{0}}{2\pi }}}\exp \left(-{\frac {1}{2}}\tau _{0}(\mu -\mu _{0})^{2}\right)\\&\propto \exp \left(-{\frac {1}{2}}\left(\tau \left(\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}+n({\bar {x}}-\mu )^{2}\right)+\tau _{0}(\mu -\mu _{0})^{2}\right)\right)\\&\propto \exp \left(-{\frac {1}{2}}\left(n\tau ({\bar {x}}-\mu )^{2}+\tau _{0}(\mu -\mu _{0})^{2}\right)\right)\\&=\exp \left(-{\frac {1}{2}}(n\tau +\tau _{0})\left(\mu -{\dfrac {n\tau {\bar {x}}+\tau _{0}\mu _{0}}{n\tau +\tau _{0}}}\right)^{2}+{\frac {n\tau \tau _{0}}{n\tau +\tau _{0}}}({\bar {x}}-\mu _{0})^{2}\right)\\&\propto \exp \left(-{\frac {1}{2}}(n\tau +\tau _{0})\left(\mu -{\dfrac {n\tau {\bar {x}}+\tau _{0}\mu _{0}}{n\tau +\tau _{0}}}\right)^{2}\right)\end{aligned}}}

En la derivación anterior, utilizamos la fórmula anterior para la suma de dos ecuaciones cuadráticas y eliminamos todos los factores constantes que no involucran a μ . El resultado es el núcleo de una distribución normal, con media norteτincógnita¯+τ0μ0norteτ+τ0{\textstyle {\frac {n\tau {\bar {x}}+\tau _{0}\mu _{0}}{n\tau +\tau _{0}}}}y precisiónnorteτ+τ0{\textstyle n\tau +\tau _{0}}, es decir pag(μincógnita)norte(norteτincógnita¯+τ0μ0norteτ+τ0,1norteτ+τ0){\displaystyle p(\mu \mid \mathbf {X} )\sim {\mathcal {N}}\left({\frac {n\tau {\bar {x}}+\tau _{0}\mu _{0}}{n\tau +\tau _{0}}},{\frac {1}{n\tau +\tau _{0}}}\right)}

Esto se puede escribir como un conjunto de ecuaciones de actualización bayesianas para los parámetros posteriores en términos de los parámetros previos: τ0=τ0+norteτμ0=norteτincógnita¯+τ0μ0norteτ+τ0incógnita¯=1nortei=1norteincógnitai{\displaystyle {\begin{aligned}\tau _{0}'&=\tau _{0}+n\tau \\[5pt]\mu _{0}'&={\frac {n\tau {\bar {x}}+\tau _{0}\mu _{0}}{n\tau +\tau _{0}}}\\[5pt]{\bar {x}}&={\frac {1}{n}}\sum _{i=1}^{n}x_{i}\end{aligned}}}

Es decir, combinar n puntos de datos con una precisión total de (o equivalentemente, una varianza total de n / σ 2 ) y una media de valores.incógnita¯{\textstyle {\bar {x}}}Se obtiene una nueva precisión total simplemente sumando la precisión total de los datos a la precisión total previa, y se forma una nueva media mediante un promedio ponderado por precisión , es decir, un promedio ponderado de la media de los datos y la media previa, cada una ponderada por la precisión total asociada. Esto tiene sentido lógico si se considera que la precisión indica la certeza de las observaciones: en la distribución de la media posterior, cada uno de los componentes de entrada se pondera por su certeza, y la certeza de esta distribución es la suma de las certezas individuales. (Para comprender mejor esto, compárese con la expresión «el todo es (o no es) mayor que la suma de sus partes». Además, considérese que el conocimiento de la distribución posterior proviene de una combinación del conocimiento de la distribución previa y la verosimilitud, por lo que tiene sentido que tengamos mayor certeza sobre ella que sobre cualquiera de sus componentes).

La fórmula anterior revela por qué es más conveniente realizar un análisis bayesiano de distribuciones a priori conjugadas para la distribución normal en términos de precisión. La precisión posterior es simplemente la suma de las precisiones a priori y de verosimilitud, y la media posterior se calcula mediante un promedio ponderado por precisión, como se describió anteriormente. Las mismas fórmulas pueden escribirse en términos de varianza invirtiendo todas las precisiones, lo que da como resultado fórmulas más complejas. σ02=1norteσ2+1σ02μ0=norteincógnita¯σ2+μ0σ02norteσ2+1σ02incógnita¯=1nortei=1norteincógnitai{\displaystyle {\begin{aligned}{\sigma _{0}^{2}}'&={\frac {1}{{\frac {n}{\sigma ^{2}}}+{\frac {1}{\sigma _{0}^{2}}}}}\\[5pt]\mu _{0}'&={\frac {{\frac {n{\bar {x}}}{\sigma ^{2}}}+{\frac {\mu _{0}}{\sigma _{0}^{2}}}}{{\frac {n}{\sigma ^{2}}}+{\frac {1}{\sigma _{0}^{2}}}}}\\[5pt]{\bar {x}}&={\frac {1}{n}}\sum _{i=1}^{n}x_{i}\end{aligned}}}

Con media conocida

Para un conjunto de puntos de datos X distribuidos normalmente e i.i.d. de tamaño n, donde cada punto individual x sigueincógnitanorte(μ,σ2){\textstyle x\sim {\mathcal {N}}(\mu ,\sigma ^{2})}Con una media μ conocida , la distribución a priori conjugada de la varianza tiene una distribución gamma inversa o una distribución chi-cuadrado inversa escalada . Ambas son equivalentes, excepto por tener parametrizaciones diferentes . Aunque la distribución gamma inversa es la más utilizada, por conveniencia usamos la chi-cuadrado inversa escalada. La distribución a priori para σ² es la siguiente: pag(σ2ν0,σ02)=(σ02ν02)ν0/2Γ(ν02) exp[ν0σ022σ2](σ2)1+ν02exp[ν0σ022σ2](σ2)1+ν02{\displaystyle p(\sigma ^{2}\mid \nu _{0},\sigma _{0}^{2})={\frac {(\sigma _{0}^{2}{\frac {\nu _{0}}{2}})^{\nu _{0}/2}}{\Gamma \left({\frac {\nu _{0}}{2}}\right)}}~{\frac {\exp \left[{\frac {-\nu _{0}\sigma _{0}^{2}}{2\sigma ^{2}}}\right]}{(\sigma ^{2})^{1+{\frac {\nu _{0}}{2}}}}}\propto {\frac {\exp \left[{\frac {-\nu _{0}\sigma _{0}^{2}}{2\sigma ^{2}}}\right]}{(\sigma ^{2})^{1+{\frac {\nu _{0}}{2}}}}}}

La función de verosimilitud anterior, escrita en términos de la varianza, es: pag(incógnitaμ,σ2)=(12πσ2)norte/2exp[12σ2i=1norte(incógnitaiμ)2]=(12πσ2)norte/2exp[S2σ2]{\displaystyle {\begin{aligned}p(\mathbf {X} \mid \mu ,\sigma ^{2})&=\left({\frac {1}{2\pi \sigma ^{2}}}\right)^{n/2}\exp \left[-{\frac {1}{2\sigma ^{2}}}\sum _{i=1}^{n}(x_{i}-\mu )^{2}\right]\\&=\left({\frac {1}{2\pi \sigma ^{2}}}\right)^{n/2}\exp \left[-{\frac {S}{2\sigma ^{2}}}\right]\end{aligned}}} dónde S=i=1norte(incógnitaiμ)2.{\displaystyle S=\sum _{i=1}^{n}(x_{i}-\mu )^{2}.}

Entonces: pag(σ2incógnita)pag(incógnitaσ2)pag(σ2)=(12πσ2)norte/2exp[S2σ2](σ02ν02)ν02Γ(ν02) exp[ν0σ022σ2](σ2)1+ν02(1σ2)norte/21(σ2)1+ν02exp[S2σ2+ν0σ022σ2]=1(σ2)1+ν0+norte2exp[ν0σ02+S2σ2]{\displaystyle {\begin{aligned}p(\sigma ^{2}\mid \mathbf {X} )&\propto p(\mathbf {X} \mid \sigma ^{2})p(\sigma ^{2})\\&=\left({\frac {1}{2\pi \sigma ^{2}}}\right)^{n/2}\exp \left[-{\frac {S}{2\sigma ^{2}}}\right]{\frac {(\sigma _{0}^{2}{\frac {\nu _{0}}{2}})^{\frac {\nu _{0}}{2}}}{\Gamma \left({\frac {\nu _{0}}{2}}\right)}}~{\frac {\exp \left[{\frac {-\nu _{0}\sigma _{0}^{2}}{2\sigma ^{2}}}\right]}{(\sigma ^{2})^{1+{\frac {\nu _{0}}{2}}}}}\\&\propto \left({\frac {1}{\sigma ^{2}}}\right)^{n/2}{\frac {1}{(\sigma ^{2})^{1+{\frac {\nu _{0}}{2}}}}}\exp \left[-{\frac {S}{2\sigma ^{2}}}+{\frac {-\nu _{0}\sigma _{0}^{2}}{2\sigma ^{2}}}\right]\\&={\frac {1}{(\sigma ^{2})^{1+{\frac {\nu _{0}+n}{2}}}}}\exp \left[-{\frac {\nu _{0}\sigma _{0}^{2}+S}{2\sigma ^{2}}}\right]\end{aligned}}}

Lo anterior también es una distribución chi-cuadrado inversa escalada donde ν0=ν0+norteν0σ02=ν0σ02+i=1norte(incógnitaiμ)2{\displaystyle {\begin{aligned}\nu _{0}'&=\nu _{0}+n\\\nu _{0}'{\sigma _{0}^{2}}'&=\nu _{0}\sigma _{0}^{2}+\sum _{i=1}^{n}(x_{i}-\mu )^{2}\end{aligned}}} o equivalentemente ν0=ν0+norteσ02=ν0σ02+i=1norte(incógnitaiμ)2ν0+norte{\displaystyle {\begin{aligned}\nu _{0}'&=\nu _{0}+n\\{\sigma _{0}^{2}}'&={\frac {\nu _{0}\sigma _{0}^{2}+\sum _{i=1}^{n}(x_{i}-\mu )^{2}}{\nu _{0}+n}}\end{aligned}}}

Reparametrizando en términos de una distribución gamma inversa , el resultado es: α=α+norte2β=β+i=1norte(incógnitaiμ)22{\displaystyle {\begin{aligned}\alpha '&=\alpha +{\frac {n}{2}}\\\beta '&=\beta +{\frac {\sum _{i=1}^{n}(x_{i}-\mu )^{2}}{2}}\end{aligned}}}

Con media desconocida y varianza desconocida

Para un conjunto de puntos de datos X distribuidos normalmente e i.i.d. de tamaño n, donde cada punto individual x sigueincógnitanorte(μ,σ2){\textstyle x\sim {\mathcal {N}}(\mu ,\sigma ^{2})}Con una media desconocida μ y una varianza desconocida σ² , se coloca una distribución a priori conjugada combinada (multivariada) sobre la media y la varianza, que consiste en una distribución normal-gamma inversa . Lógicamente, esto se origina de la siguiente manera:

  1. Del análisis del caso con media desconocida pero varianza conocida, vemos que las ecuaciones de actualización implican estadísticas suficientes calculadas a partir de los datos, que consisten en la media de los puntos de datos y la varianza total de los puntos de datos, calculada a su vez a partir de la varianza conocida dividida por el número de puntos de datos.
  2. Del análisis del caso con varianza desconocida pero media conocida, vemos que las ecuaciones de actualización implican estadísticas suficientes sobre los datos que consisten en el número de puntos de datos y la suma de las desviaciones cuadradas .
  3. Tenga en cuenta que los valores de actualización posteriores sirven como distribución previa al procesar datos adicionales. Por lo tanto, debemos considerar lógicamente nuestras distribuciones previas en términos de las estadísticas suficientes descritas, manteniendo la misma semántica en la medida de lo posible.
  4. Para abordar el caso en que tanto la media como la varianza son desconocidas, podríamos establecer distribuciones a priori independientes para la media y la varianza, con estimaciones fijas de la media promedio, la varianza total, el número de puntos de datos utilizados para calcular la distribución a priori de la varianza y la suma de las desviaciones al cuadrado. Sin embargo, cabe señalar que, en realidad, la varianza total de la media depende de la varianza desconocida, y la suma de las desviaciones al cuadrado que se incluye en la distribución a priori de la varianza (aparentemente) depende de la media desconocida. En la práctica, esta última dependencia es relativamente poco importante: al modificar la media real, los puntos generados se desplazan en la misma cantidad, y, en promedio, las desviaciones al cuadrado se mantienen constantes. No obstante, esto no ocurre con la varianza total de la media: a medida que aumenta la varianza desconocida, la varianza total de la media aumenta proporcionalmente, y nos interesa capturar esta dependencia.
  5. Esto sugiere que creemos una distribución a priori condicional de la media sobre la varianza desconocida, con un hiperparámetro que especifica la media de las pseudoobservaciones asociadas a la distribución a priori, y otro parámetro que especifica el número de pseudoobservaciones. Este número sirve como parámetro de escala sobre la varianza, lo que permite controlar la varianza general de la media en relación con el parámetro de varianza real. La distribución a priori para la varianza también tiene dos hiperparámetros: uno que especifica la suma de las desviaciones cuadradas de las pseudoobservaciones asociadas a la distribución a priori, y otro que especifica, una vez más, el número de pseudoobservaciones. Cada una de las distribuciones a priori tiene un hiperparámetro que especifica el número de pseudoobservaciones, y en cada caso esto controla la varianza relativa de esa distribución a priori. Estos se dan como dos hiperparámetros separados para que la varianza (también conocida como confianza) de las dos distribuciones a priori se pueda controlar por separado.
  6. Esto conduce inmediatamente a la distribución normal-gamma inversa , que es el producto de las dos distribuciones que acabamos de definir, utilizando distribuciones a priori conjugadas (una distribución gamma inversa sobre la varianza y una distribución normal sobre la media, condicionada a la varianza) y con los mismos cuatro parámetros que acabamos de definir.

Las probabilidades a priori se definen normalmente de la siguiente manera: pag(μσ2;μ0,norte0)norte(μ0,σ2/norte0)pag(σ2;ν0,σ02)Iχ2(ν0,σ02)=IGRAMO(ν0/2,ν0σ02/2){\displaystyle {\begin{aligned}p(\mu \mid \sigma ^{2};\mu _{0},n_{0})&\sim {\mathcal {N}}(\mu _{0},\sigma ^{2}/n_{0})\\p(\sigma ^{2};\nu _{0},\sigma _{0}^{2})&\sim I\chi ^{2}(\nu _{0},\sigma _{0}^{2})=IG(\nu _{0}/2,\nu _{0}\sigma _{0}^{2}/2)\end{aligned}}}

Las ecuaciones de actualización se pueden derivar y tienen el siguiente aspecto: incógnita¯=1nortei=1norteincógnitaiμ0=norte0μ0+norteincógnita¯norte0+nortenorte0=norte0+norteν0=ν0+norteν0σ02=ν0σ02+i=1norte(incógnitaiincógnita¯)2+norte0nortenorte0+norte(μ0incógnita¯)2{\displaystyle {\begin{aligned}{\bar {x}}&={\frac {1}{n}}\sum _{i=1}^{n}x_{i}\\\mu _{0}'&={\frac {n_{0}\mu _{0}+n{\bar {x}}}{n_{0}+n}}\\n_{0}'&=n_{0}+n\\\nu _{0}'&=\nu _{0}+n\\\nu _{0}'{\sigma _{0}^{2}}'&=\nu _{0}\sigma _{0}^{2}+\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}+{\frac {n_{0}n}{n_{0}+n}}(\mu _{0}-{\bar {x}})^{2}\end{aligned}}}Los respectivos números de pseudo-observaciones suman el número de observaciones reales. El nuevo hiperparámetro medio es, una vez más, un promedio ponderado, esta vez ponderado por los números relativos de observaciones. Finalmente, la actualización paraν0σ02{\textstyle \nu _{0}'{\sigma _{0}^{2}}'}es similar al caso con media conocida, pero en este caso la suma de las desviaciones al cuadrado se toma con respecto a la media de los datos observados en lugar de la media verdadera, y como resultado es necesario agregar un nuevo término de interacción para tener en cuenta la fuente de error adicional que proviene de la desviación entre la media previa y la media de los datos.

Ocurrencia y aplicaciones

La aparición de la distribución normal en problemas prácticos se puede clasificar, a grandes rasgos, en cuatro categorías:

  1. Distribuciones exactamente normales;
  2. Leyes aproximadamente normales, por ejemplo, cuando dicha aproximación está justificada por el teorema del límite central ; y
  3. Distribuciones modeladas como normales: la distribución normal es la distribución con máxima entropía para una media y varianza dadas.
  4. Problemas de regresión: se encuentra la distribución normal después de que los efectos sistemáticos se hayan modelado suficientemente bien.

normalidad exacta

El estado fundamental de un oscilador armónico cuántico tiene una distribución gaussiana.

En algunas teorías físicas se da una distribución normal :

Normalidad aproximada

En muchas situaciones se observan distribuciones aproximadamente normales, como explica el teorema del límite central . Cuando el resultado se produce por la acción aditiva e independiente de múltiples efectos pequeños , su distribución será cercana a la normal. Esta aproximación no será válida si los efectos actúan de forma multiplicativa (en lugar de aditiva) o si existe una única influencia externa con una magnitud considerablemente mayor que la del resto de los efectos.

normalidad asumida

Histograma de anchos de sépalos para Iris versicolor del conjunto de datos de flores de Iris de Fisher , con distribución normal de mejor ajuste superpuesta.

Considero que la aparición de la curva normal —la curva laplaciana de errores— es un fenómeno sumamente anómalo. Se aproxima a ella en ciertas distribuciones; por esta razón, y debido a su notable simplicidad, podríamos utilizarla como primera aproximación, especialmente en investigaciones teóricas.

Existen métodos estadísticos para comprobar empíricamente esa suposición; véase la sección anterior sobre pruebas de normalidad .

  • En biología , el logaritmo de varias variables tiende a tener una distribución normal, es decir, tiende a tener una distribución log-normal (después de la separación en subpoblaciones masculinas/femeninas), con ejemplos que incluyen:
    • Medidas del tamaño del tejido vivo (longitud, altura, área de piel, peso); [ 62 ]
    • La longitud de los apéndices inertes (pelo, garras, uñas, dientes) de los especímenes biológicos, en la dirección del crecimiento ; presumiblemente, el grosor de la corteza de los árboles también entra en esta categoría;
    • Ciertas mediciones fisiológicas, como la presión arterial en humanos adultos.
  • En finanzas, en particular en el modelo Black-Scholes , se asume que las variaciones en el logaritmo de los tipos de cambio, los índices de precios y los índices bursátiles siguen una distribución normal (estas variables se comportan como interés compuesto , no como interés simple, por lo que son multiplicativas). Algunos matemáticos, como Benoit Mandelbrot, han argumentado que las distribuciones log-Lévy , que poseen colas pesadas , serían un modelo más apropiado, especialmente para el análisis de las caídas del mercado bursátil . El uso de la suposición de distribución normal en los modelos financieros también ha sido criticado por Nassim Nicholas Taleb en sus trabajos.
  • Los errores de medición en experimentos físicos suelen modelarse mediante una distribución normal. El uso de esta distribución no implica asumir que los errores de medición siguen una distribución normal, sino que su utilización produce las predicciones más conservadoras posibles, dado únicamente el conocimiento de la media y la varianza de los errores. [ 63 ]
  • En las pruebas estandarizadas , los resultados pueden ajustarse a una distribución normal seleccionando el número y la dificultad de las preguntas (como en el test de CI ) o transformando las puntuaciones brutas en puntuaciones finales mediante el ajuste a la distribución normal. Por ejemplo, el rango tradicional del SAT , de 200 a 800, se basa en una distribución normal con una media de 500 y una desviación estándar de 100.
Distribución normal acumulativa ajustada a las precipitaciones de octubre, véase el ajuste de la distribución.

Problemas metodológicos y revisión por pares

John Ioannidis argumentó que usar desviaciones estándar con distribución normal como criterios para validar los resultados de la investigación deja sin comprobar predicciones falsables sobre fenómenos que no siguen una distribución normal. Esto incluye, por ejemplo, fenómenos que solo aparecen cuando se cumplen todas las condiciones necesarias y en los que uno no puede sustituir al otro de forma aditiva, así como fenómenos que no se distribuyen aleatoriamente. Ioannidis sostiene que la validación centrada en la desviación estándar da una falsa apariencia de validez a las hipótesis y teorías en las que algunas, pero no todas, las predicciones falsables tienen una distribución normal, ya que la parte de las predicciones falsables contra las que existe evidencia puede estar, y en algunos casos lo está, en las partes no normales del rango de predicciones falsables. Además, descarta sin fundamento hipótesis para las que ninguna de las predicciones falsables tiene una distribución normal, como si fueran infalsificables, cuando en realidad sí hacen predicciones falsables. Ioannidis argumenta que muchos casos de teorías mutuamente excluyentes aceptadas como validadas por revistas de investigación se deben a que las revistas no aceptan falsificaciones empíricas de predicciones con distribución no normal, y no a que las teorías mutuamente excluyentes sean verdaderas, lo cual no es posible, aunque dos teorías mutuamente excluyentes pueden ser erróneas y una tercera correcta. [ 65 ]

Métodos computacionales

Generación de valores a partir de la distribución normal

La máquina de las bolitas , inventada por Francis Galton , puede considerarse el primer generador de variables aleatorias normales. Esta máquina consiste en un tablero vertical con filas intercaladas de clavijas. Pequeñas bolitas caen desde la parte superior y rebotan aleatoriamente hacia la izquierda o la derecha al chocar con las clavijas. Las bolitas se recogen en recipientes en la parte inferior y se distribuyen siguiendo un patrón similar a la curva gaussiana.

En las simulaciones por ordenador, especialmente en las aplicaciones del método de Montecarlo , suele ser deseable generar valores con distribución normal. Los algoritmos que se enumeran a continuación generan desviaciones normales estándar, ya que una distribución normal estándar N ( μ , σ² ) se puede generar como X = μ + σZ , donde Z es la distribución normal estándar. Todos estos algoritmos dependen de la disponibilidad de un generador de números aleatorios U capaz de producir variables aleatorias uniformes .

  • El método más directo se basa en la propiedad de la transformación integral de probabilidad : si U se distribuye uniformemente en (0,1), entonces Φ −1 ( U ) tendrá la distribución normal estándar. El inconveniente de este método es que depende del cálculo de la función probit Φ −1 , lo cual no se puede hacer analíticamente. Algunos métodos aproximados se describen en Hart (1968) y en el artículo de erf . Wichura proporciona un algoritmo rápido para calcular esta función con 16 decimales, [ 66 ] que R utiliza para calcular variables aleatorias de la distribución normal.
  • Un enfoque aproximado fácil de programar que se basa en el teorema del límite central es el siguiente: generar 12 desviaciones uniformes U (0,1) , sumarlas todas y restar 6; la variable aleatoria resultante tendrá aproximadamente una distribución normal estándar. En realidad, la distribución será de Irwin-Hall , que es una aproximación polinómica de undécimo orden de 12 secciones a la distribución normal. Esta desviación aleatoria tendrá un rango limitado de (−6, 6) . [ 67 ] Nótese que en una distribución normal verdadera, solo el 0,00034% de todas las muestras caerán fuera de ±6 σ . 
  • El método Box-Muller utiliza dos números aleatorios independientes U y V distribuidos uniformemente en (0,1). Luego, las dos variables aleatorias X e Yincógnita=2lnUporque(2πV),Y=2lnUpecado(2πV).{\displaystyle X={\sqrt {-2\ln U}}\,\cos(2\pi V),\qquad Y={\sqrt {-2\ln U}}\,\sin(2\pi V).}ambas tendrán la distribución normal estándar y serán independientes . Esta formulación surge porque para un vector aleatorio normal bivariado ( X , Y ), la norma al cuadrado + tendrá la distribución chi-cuadrado con dos grados de libertad, que es una variable aleatoria exponencial fácilmente generada correspondiente a la cantidad −2 ln( U ) en estas ecuaciones; y el ángulo se distribuye uniformemente alrededor del círculo, elegido por la variable aleatoria V.
  • El método polar de Marsaglia es una modificación del método de Box-Muller que no requiere el cálculo de las funciones seno y coseno. En este método, U y V se extraen de la distribución uniforme (−1,1), y luego se calcula S = + . Si S es mayor o igual a 1, el método comienza de nuevo; de lo contrario, las dos cantidadesincógnita=U2lnSS,Y=V2lnSS{\displaystyle X=U{\sqrt {\frac {-2\ln S}{S}}},\qquad Y=V{\sqrt {\frac {-2\ln S}{S}}}}se devuelven. Nuevamente, X e Y son variables aleatorias normales estándar independientes.
  • El método de la razón [ 68 ] es un método de rechazo. El algoritmo procede de la siguiente manera:
    • Generar dos desviaciones uniformes independientes U y V ;
    • Calcula X = 8/ e ( V − 0.5)/ U ;
    • Opcional: si X 2 ≤ 5 − 4 e 1/4 U entonces aceptar X y terminar el algoritmo;
    • Opcional: si X 2 ≥ 4 e −1.35 / U + 1.4 entonces rechace X y comience de nuevo desde el paso 1;
    • Si X 2 ≤ −4 ln U entonces acepte X , de lo contrario comience de nuevo el algoritmo.
    Los dos pasos opcionales permiten evitar la evaluación del logaritmo en el último paso en la mayoría de los casos. Estos pasos pueden mejorarse considerablemente [ 69 ] para que el logaritmo rara vez se evalúe.
  • El algoritmo zigurat [ 70 ] es más rápido que la transformada de Box-Muller y sigue siendo exacto. En aproximadamente el 97% de los casos, utiliza solo dos números aleatorios: un entero y un número aleatorio uniforme, una multiplicación y una prueba condicional. Únicamente en el 3% de los casos, cuando la combinación de estos dos números queda fuera del "núcleo del zigurat" (un tipo de muestreo por rechazo mediante logaritmos), es necesario emplear exponenciales y números aleatorios más uniformes.
  • La aritmética entera se puede utilizar para muestrear de la distribución normal estándar. [ 71 ] [ 72 ] Este método es exacto en el sentido de que satisface las condiciones de aproximación ideal ; [ 73 ] es decir, es equivalente a muestrear un número real de la distribución normal estándar y redondearlo al número de punto flotante representable más cercano.
  • También se ha investigado [ 74 ] la relación entre la transformada rápida de Hadamard y la distribución normal, ya que la transformada emplea únicamente sumas y restas, y, según el teorema del límite central, los números aleatorios de casi cualquier distribución se transformarán en una distribución normal. En este sentido, se puede combinar una serie de transformadas de Hadamard con permutaciones aleatorias para convertir conjuntos de datos arbitrarios en datos con distribución normal.

Aproximaciones numéricas para la función de distribución acumulativa normal y la función cuantil normal.

La función de distribución acumulativa normal estándar se utiliza ampliamente en la computación científica y estadística.

Los valores Φ ( x ) pueden aproximarse con gran precisión mediante diversos métodos, como la integración numérica , las series de Taylor , las series asintóticas y las fracciones continuas . Se utilizan diferentes aproximaciones según el nivel de precisión deseado.

  • Zelen y Severo (1964) dan la aproximación para Φ ( x ) para x > 0 con el error absoluto | ε ( x ) | < 7,5·10 −8 (algoritmo 26.2.17 ):Φ(incógnita)=1φ(incógnita)(b1t+b2t2+b3t3+b4t4+b5t5)+ε(incógnita),t=11+b0incógnita,{\displaystyle \Phi (x)=1-\varphi (x)\left(b_{1}t+b_{2}t^{2}+b_{3}t^{3}+b_{4}t^{4}+b_{5}t^{5}\right)+\varepsilon (x),\qquad t={\frac {1}{1+b_{0}x}},}donde ϕ ( x ) es la función de densidad de probabilidad normal estándar, y b 0 = 0,2316419 , b 1 = 0,319381530 , b 2 = −0,356563782 , b 3 = 1,781477937 , b 4 = −1,821255978 , b 5 = 1,330274429 .
  • Hart (1968) enumera docenas de aproximaciones mediante funciones racionales, con o sin exponenciales, para la función erfc() , donde erfc(x) = 1 - erf(x). Sus algoritmos varían en el grado de complejidad y la precisión resultante, con una precisión absoluta máxima de 24 dígitos. Un algoritmo de West (2009) combina el algoritmo 5666 de Hart con una aproximación de fracción continua en la cola para proporcionar un algoritmo de cálculo rápido con una precisión de 16 dígitos.
  • Cody (1969) , después de recordar que la solución de Hart68 no es adecuada para erf, dio una solución tanto para erf como para erfc, con límite de error relativo máximo, a través de la aproximación racional de Chebyshev .
  • Marsaglia (2004) propuso un algoritmo sencillo [ nota 1 ] basado en la expansión en serie de Taylor.Φ(incógnita)=12+φ(incógnita)(incógnita+incógnita33+incógnita535+incógnita7357+incógnita93579+){\displaystyle \Phi (x)={\frac {1}{2}}+\varphi (x)\left(x+{\frac {x^{3}}{3}}+{\frac {x^{5}}{3\cdot 5}}+{\frac {x^{7}}{3\cdot 5\cdot 7}}+{\frac {x^{9}}{3\cdot 5\cdot 7\cdot 9}}+\cdots \right)}para calcular Φ ( x ) con precisión arbitraria. La desventaja de este algoritmo es el tiempo de cálculo relativamente lento (por ejemplo, se necesitan más de 300 iteraciones para calcular la función con 16 dígitos de precisión cuando x = 10 ).
  • La biblioteca científica GNU calcula los valores de la función de distribución acumulativa normal estándar utilizando los algoritmos de Hart y aproximaciones con polinomios de Chebyshev .
  • Dia (2023) propone la siguiente aproximación de1Φ{\textstyle 1-\Phi }con un error relativo máximo menor que253{\textstyle 2^{-53}}(1.1×1016){\textstyle \left(\approx 1.1\times 10^{-16}\right)}en valor absoluto: paraincógnita0{\textstyle x\geq 0}1Φ(incógnita)=(0,39894228040143268incógnita+2.92678600515804815)(incógnita2+8.42742300458043240incógnita+18.38871225773938487incógnita2+5.81582518933527391incógnita+8.97280659046817350)(incógnita2+7.30756258553673541incógnita+18.25323235347346525incógnita2+5.70347935898051437incógnita+10.27157061171363079)(incógnita2+5.66479518878470765incógnita+18.61193318971775795incógnita2+5.51862483025707963incógnita+12.72323261907760928)(incógnita2+4.91396098895240075incógnita+24.14804072812762821incógnita2+5.26184239579604207incógnita+16.88639562007936908)(incógnita2+3.83362947800146179incógnita+11.61511226260603247incógnita2+4.92081346632882033incógnita+24.12333774572479110)miincógnita22{\textstyle {\begin{aligned}1-\Phi \left(x\right)&=\left({\frac {0.39894228040143268}{x+2.92678600515804815}}\right)\left({\frac {x^{2}+8.42742300458043240x+18.38871225773938487}{x^{2}+5.81582518933527391x+8.97280659046817350}}\right)\\&\left({\frac {x^{2}+7.30756258553673541x+18.25323235347346525}{x^{2}+5.70347935898051437x+10.27157061171363079}}\right)\left({\frac {x^{2}+5.66479518878470765x+18.61193318971775795}{x^{2}+5.51862483025707963x+12.72323261907760928}}\right)\\&\left({\frac {x^{2}+4.91396098895240075x+24.14804072812762821}{x^{2}+5.26184239579604207x+16.88639562007936908}}\right)\left({\frac {x^{2}+3.83362947800146179x+11.61511226260603247}{x^{2}+4.92081346632882033x+24.12333774572479110}}\right)e^{-{\frac {x^{2}}{2}}}\end{aligned}}}y paraincógnita<0{\textstyle x<0},

1Φ(incógnita)=1(1Φ(incógnita)){\displaystyle 1-\Phi \left(x\right)=1-\left(1-\Phi \left(-x\right)\right)}

Shore (1982) introdujo aproximaciones simples que pueden incorporarse en modelos de optimización estocástica de ingeniería e investigación operativa, como la ingeniería de confiabilidad y el análisis de inventarios. Denotando p = Φ ( z ) , la aproximación más simple para la función cuantil es: z=Φ1(pag)=5.5556[1(1pagpag)0,1186],pag1/2{\displaystyle z=\Phi ^{-1}(p)=5.5556\left[1-\left({\frac {1-p}{p}}\right)^{0.1186}\right],\qquad p\geq 1/2}

Esta aproximación proporciona para z un error absoluto máximo de 0,026 (para 0,5 ≤ p ≤ 0,9999 , correspondiente a 0 ≤ z ≤ 3,719 ). Para p < 1/2, sustituya p por 1 − p y cambie el signo. Otra aproximación, algo menos precisa, es la aproximación de un solo parámetro: z=0,4115{1pagpag+registro[1pagpag]1},pag1/2{\displaystyle z=-0.4115\left\{{\frac {1-p}{p}}+\log \left[{\frac {1-p}{p}}\right]-1\right\},\qquad p\geq 1/2}

Este último había servido para derivar una aproximación simple para la integral de pérdida de la distribución normal, definida por L(z)=z(z)φ()d=z[1Φ()]dL(z){0,4115(pag1pag)z,pag<1/2,0,4115(1pagpag),pag1/2.o, equivalentemente,L(z){0,4115{1registro[pag1pag]},pag<1/2,0,41151pagpag,pag1/2.{\displaystyle {\begin{aligned}L(z)&=\int _{z}^{\infty }(u-z)\varphi (u)\,du=\int _{z}^{\infty }[1-\Phi (u)]\,du\\[5pt]L(z)&\approx {\begin{cases}0.4115\left({\dfrac {p}{1-p}}\right)-z,&p<1/2,\\\\0.4115\left({\dfrac {1-p}{p}}\right),&p\geq 1/2.\end{cases}}\\[5pt]{\text{or, equivalently,}}\\L(z)&\approx {\begin{cases}0.4115\left\{1-\log \left[{\frac {p}{1-p}}\right]\right\},&p<1/2,\\\\0.4115{\dfrac {1-p}{p}},&p\geq 1/2.\end{cases}}\end{aligned}}}

Esta aproximación es particularmente precisa para la cola derecha extrema (error máximo de 10 −3 para z ≥ 1,4 ). En Shore (2005) se muestran aproximaciones muy precisas para la función de distribución acumulativa, basadas en la Metodología de Modelado de Respuesta (RMM, Shore, 2011, 2012).

Se pueden encontrar algunas aproximaciones adicionales en: Función de error#Aproximación con funciones elementales . En particular, un pequeño error relativo en todo el dominio para la función de distribución acumulativa .Φ{\displaystyle \Phi }y la función cuantilΦ1{\textstyle \Phi ^{-1}}Asimismo, esto se logra mediante una fórmula explícitamente invertible propuesta por Sergei Winitzki en 2008.

Historia

Desarrollo

Algunos autores [ 75 ] [ 76 ] atribuyen el descubrimiento de la distribución normal a de Moivre , quien en 1738 [ nota 2 ] publicó en la segunda edición de su Doctrina de las probabilidades el estudio de los coeficientes en la expansión binomial de ( a + b ) n . De Moivre demostró que el término central en esta expansión tiene una magnitud aproximada de2norte/2πnorte{\textstyle 2^{n}/{\sqrt {2\pi n}}}y que "Si m o 1/2 n es una cantidad infinitamente grande, entonces el logaritmo de la razón que un término alejado del medio por el intervalo ℓ tiene con respecto al término medio es2norte{\textstyle -{\frac {2\ell \ell }{n}}}." [ 77 ] Aunque este teorema puede interpretarse como la primera expresión oscura de la ley de probabilidad normal, Stigler señala que el propio de Moivre no interpretó sus resultados como algo más que la regla aproximada para los coeficientes binomiales, y en particular de Moivre carecía del concepto de función de densidad de probabilidad. [ 78 ]

En 1809, Carl Friedrich Gauss demostró que la distribución normal proporciona una forma de racionalizar el método de mínimos cuadrados .

En 1823, Gauss publicó su monografía " Theoria combinationis observationum erroribus minimis obnoxiae ", donde, entre otras cosas, introduce varios conceptos estadísticos importantes, como el método de mínimos cuadrados , el método de máxima verosimilitud y la distribución normal . Gauss utilizó M , M ' , M' ', ... para denotar las mediciones de alguna cantidad desconocida V , y buscó el estimador más probable de esa cantidad: aquel que maximiza la probabilidad φ ( MV ) · φ ( M ' − V ) · φ ( M '' − V ) · ... de obtener los resultados experimentales observados. En su notación, φΔ es la función de densidad de probabilidad de los errores de medición de magnitud Δ. Sin saber cuál es la función φ , Gauss requiere que su método se reduzca a la respuesta bien conocida: la media aritmética de los valores medidos. [ nota 3 ] Partiendo de estos principios, Gauss demuestra que la única ley que racionaliza la elección de la media aritmética como estimador del parámetro de localización es la ley normal de errores: [ 79 ] φΔ=hπmihhΔΔ,{\displaystyle \varphi {\mathit {\Delta }}={\frac {h}{\surd \pi }}\,e^{-\mathrm {hh} \Delta \Delta },} donde h es "la medida de la precisión de las observaciones". Utilizando esta ley normal como modelo genérico para los errores en los experimentos, Gauss formula lo que ahora se conoce como el método de mínimos cuadrados ponderados no lineales . [ 80 ]

Pierre-Simon Laplace demostró el teorema del límite central en 1810, consolidando así la importancia de la distribución normal en estadística.

Aunque Gauss fue el primero en sugerir la ley de distribución normal, Laplace hizo contribuciones significativas. [ nota 4 ] Fue Laplace quien planteó por primera vez el problema de agregar varias observaciones en 1774, [ 81 ] aunque su propia solución condujo a la distribución laplaciana . Fue Laplace quien calculó por primera vez el valor de la integral e t 2 dt = π en 1782, proporcionando la constante de normalización para la distribución normal. [ 82 ] Por este logro, Gauss reconoció la prioridad de Laplace. [ 83 ] Finalmente, fue Laplace quien en 1810 demostró y presentó a la academia el teorema fundamental del límite central , que enfatizó la importancia teórica de la distribución normal. [ 84 ]

Es interesante señalar que en 1809 el matemático irlandés-estadounidense Robert Adrain publicó dos derivaciones perspicaces pero defectuosas de la ley de probabilidad normal, de forma simultánea e independiente de Gauss. [ 85 ] Sus trabajos pasaron en gran medida desapercibidos para la comunidad científica hasta que en 1871 fueron rescatados por Abbe . [ 86 ]

A mediados del siglo XIX, Maxwell demostró que la distribución normal no es solo una herramienta matemática conveniente, sino que también puede ocurrir en fenómenos naturales: [ 59 ] El número de partículas cuya velocidad, resuelta en una dirección determinada, se encuentra entre x y x + dx es norte1απmiincógnita2α2dincógnita{\displaystyle \operatorname {N} {\frac {1}{\alpha \;{\sqrt {\pi }}}}\;e^{-{\frac {x^{2}}{\alpha ^{2}}}}\,dx}

Nomenclatura

Actualmente, este concepto se conoce comúnmente en inglés como distribución normal o distribución gaussiana . Otros nombres menos comunes incluyen distribución de Gauss, distribución de Laplace-Gauss, ley de error, ley de facilidad de error, segunda ley de Laplace y ley gaussiana.

Aparentemente, el propio Gauss acuñó el término en referencia a las "ecuaciones normales" involucradas en sus aplicaciones, donde "normal" tiene el significado técnico de ortogonal en lugar de usual. [ 87 ] Sin embargo, a finales del siglo XIX, algunos autores [ nota 5 ] comenzaron a usar el nombre de distribución normal , donde la palabra "normal" se usaba como adjetivo  ; el término ahora se veía como un reflejo de que esta distribución se consideraba típica, común  y, por lo tanto, normal. Peirce (uno de esos autores) definió "normal" de la siguiente manera: "...  lo 'normal' no es el promedio (o cualquier otro tipo de media) de lo que realmente ocurre, sino de lo que , a largo plazo, ocurriría bajo ciertas circunstancias." [ 88 ] Alrededor del cambio de siglo XX, Pearson popularizó el término normal como designación para esta distribución. [ 89 ]

Hace muchos años, denominé a la curva de Laplace-Gauss curva normal , nombre que, si bien evita una cuestión internacional de prioridad, tiene la desventaja de llevar a la gente a creer que todas las demás distribuciones de frecuencia son, en un sentido u otro, "anormales".

Además, fue Pearson quien primero escribió la distribución en términos de la desviación estándar σ, como en la notación moderna. Poco después, en 1915, Fisher añadió el parámetro de localización a la fórmula de la distribución normal, expresándola de la forma en que se escribe hoy en día: dF=12σ2πmi(incógnitametro)2/(2σ2)dincógnita.{\displaystyle df={\frac {1}{\sqrt {2\sigma ^{2}\pi }}}e^{-(x-m)^{2}/(2\sigma ^{2})}\,dx.}

El término distribución normal estándar , que denota la distribución normal con media cero y varianza unitaria, se generalizó alrededor de la década de 1950, apareciendo en los libros de texto populares de P.  G. Hoel (1947) Introducción a la estadística matemática y Alexander M. Mood (1950) Introducción a la teoría de la estadística . [ 90 ] [ 91 ] [ 92 ]

Véase también

Notas

  1. Por ejemplo, este algoritmo se presenta en el artículo Lenguaje de programación Bc .
  2. De Moivre publicó por primera vez sus hallazgos en 1733, en un folleto titulado Approximatio ad Summam Terminorum Binomii ( a + b ) n in Seriem Expansi , destinado únicamente a la circulación privada. Pero no fue hasta el año 1738 que hizo públicos sus resultados. El folleto original se reimprimió varias veces; véase, por ejemplo, Walker (1985) .
  3. «Desde hace tiempo se considera un axioma la hipótesis de que si una cantidad se ha determinado mediante varias observaciones directas, realizadas en las mismas circunstancias y con igual cuidado, la media aritmética de los valores observados proporciona el valor más probable, si no de forma rigurosa, al menos muy aproximada, de modo que siempre es más seguro atenerse a ella.» — Gauss (1809 , sección 177)
  4. "Mi costumbre de denominar a la curva curva gaussiana-laplaciana o curva normal nos evita tener que repartir el mérito del descubrimiento entre los dos grandes astrónomos matemáticos." (Cita de Pearson, 1905 , p. 189)
  5. Además de los específicamente mencionados aquí, dicho uso se encuentra en las obras de Peirce , Galton ( Galton (1889 , capítulo V)) y Lexis ( Lexis (1878) , Rohrbasser y Véron (2003) ) c. 1875.

Referencias

Citas

  1. ^ Tsokos, Chris; Wooten, Rebecca (1 de enero de 2016). Tsokos, Chris; Wooten, Rebecca (eds.). El placer de las matemáticas finitas . Boston: Prensa académica. págs. 231–263 . doi : 10.1016/b978-0-12-802967-1.00007-3 . ISBN  978-0-12-802967-1.
  2. Harris, Frank E. (1 de enero de 2014). Harris, Frank E. (ed.). Matemáticas para las ciencias físicas y la ingeniería . Boston: Academic Press. págs. 663–709 . doi : 10.1016/b978-0-12-801000-6.00018-3 . ISBN  978-0-12-801000-6.
  3. Hoel (1947 , p. 31 ) y Mood (1950 , p. 109 ) dan esta definición con una notación ligeramente diferente.
  4. Distribución normal , Enciclopedia de psicología de Gale
  5. Casella y Berger (2001 , pág. 102) 
  6. Lyon, A. (2014). ¿Por qué las distribuciones normales son normales? , The British Journal for the Philosophy of Science.
  7. Jorge, Nocedal; Stephan, J. Wright (2006). Optimización numérica (2.ª ed.). Springer. pág. 249. ISBN   978-0387-30303-1.
  8. Micceri, Theodore. (1989). "El unicornio, la curva normal y otras criaturas improbables" (PDF) . Boletín Psicológico de la APA . 105 (1): 156– 166.
  9. 1 2 "Distribución normal" . www.mathsisfun.com . Consultado el 15 de agosto de 2020 .
  10. "curva de campana" . Diccionario Merriam-Webster.com . Consultado el 25 de mayo de 2025 .
  11. Mood (1950 , p. 112 ) define explícitamente la distribución normal estándar . En contraste, Hoel (1947) define explícitamente la curva normal estándar (p. 33) e introduce el término distribución normal estándar (p. 69) .
  12. Stigler (1982)
  13. ^ Halperin, Hartley y Hoel (1965 , artículo 7)
  14. McPherson (1990 , pág. 110) 
  15. Bernardo y Smith (2000 , pág. 121) 
  16. Park, Kun Il (2018). Fundamentos de probabilidad y procesos estocásticos con aplicaciones a las comunicaciones . Springer. ISBN 978-3-319-68074-3.
  17. Scott, Clayton; Nowak, Robert (7 de agosto de 2003). "La función Q" . Connexions .
  18. Barak, Ohad (6 de abril de 2006). "Función Q y función de error" (PDF) . Universidad de Tel Aviv. Archivado del original (PDF) el 25 de marzo de 2009.
  19. Weisstein, Eric W. "Función de distribución normal" . MathWorld .
  20. Abramowitz, Milton ; Stegun, Irene Ann , eds. (1983) [junio de 1964]. «Capítulo 26, ecuación 26.2.12» . Manual de funciones matemáticas con fórmulas, gráficas y tablas matemáticas . Serie de Matemáticas Aplicadas. Vol. 55 (novena reimpresión con correcciones adicionales de la décima edición original con correcciones (diciembre de 1972); primera ed.). Washington D. C.; Nueva York: Departamento de Comercio de los Estados Unidos, Oficina Nacional de Normas; Dover Publications. pág. 932. ISBN    978-0-486-61272-0. LCCN 64-60036 . MR 0167642 . LCCN 65-12253 .   
  21. Duff, Michael (2003). "Algoritmos de distribución normal". The Mathematical Gazette . 87 (509): 331– 336. JSTOR 3621062 . 
  22. 1 2 Stuart, Alan; Ord, J. Keith (1987). "The normal df" . Teoría avanzada de la estadística de Kendall . Vol. 1: Teoría de la distribución. Originalmente de Maurice Kendall (5.ª ed.). Charles Griffin & Co. § 5.37, pp. 183–185. ISBN     0-85264-285-7.
  23. Vaart, AW van der (13 de octubre de 1998). Asymptotic Statistics . Cambridge University Press. doi : 10.1017/cbo9780511802256 . ISBN 978-0-511-80225-6.
  24. 1 2 Cover y Thomas (2006) , pág. 254.
  25. Park, Sung Y.; Bera, Anil K. (2009). "Modelo de heterocedasticidad condicional autorregresiva de máxima entropía" (PDF) . Journal of Econometrics . 150 (2): 219– 230. Bibcode : 2009JEcon.150..219P . CiteSeerX 10.1.1.511.9750 . doi : 10.1016/j.jeconom.2008.12.014 . Archivado del original (PDF) el 7 de marzo de 2016. Recuperado el 2 de junio de 2011 . 
  26. Geary RC (1936) La distribución del "cociente t de Student para muestras no normales". Suplemento del Journal of the Royal Statistical Society 3 (2): 178–184
  27. Lukacs, Eugene (marzo de 1942). " Una caracterización de la distribución normal" . Annals of Mathematical Statistics . 13 (1): 91– 93. doi : 10.1214/AOMS/1177731647 . ISSN 0003-4851 . JSTOR 2236166. MR 0006626. Zbl 0060.28509 . Wikidata Q55897617 .     
  28. 1 2 3 Patel y Read (1996 , [2.1.4])
  29. Fan (1991 , pág. 1258) 
  30. Patel y Read (1996 , [2.1.8])
  31. Papoulis, Athanasios. Probabilidad, variables aleatorias y procesos estocásticos (4.ª ed.). pág. 148.  
  32. Winkelbauer, Andreas (2012). "Momentos y momentos absolutos de la distribución normal". arXiv : 1209.4340 [ math.ST ].
  33. Bryc (1995 , pág. 23) 
  34. Bryc (1995 , p. 24) 
  35. Williams, David (2001). Weighing the odds : a course in probability and statistics ( Ed. reimpresa). Cambridge [ua]: Cambridge Univ. Press. pp. 197–199 . ISBN    978-0-521-00618-7.
  36. José M. Bernardo; Adrian FM Smith (2000). Teoría bayesiana ( Edición reimpresa). Chichester [ua]: Wiley. pp. 209 , 366. ISBN   978-0-471-49464-5.
  37. O'Hagan, A. (1994) Teoría avanzada de la estadística de Kendall, Vol. 2B, Inferencia bayesiana , Edward Arnold. ISBN 0-340-52922-9(Sección 5.40)
  38. 1 2 Bryc (1995 , pág. 35) 
  39. UIUC, Lección 21. La distribución normal multivariada , 21.6: "Gaussiana individual versus gaussiana conjunta".
  40. Edward L. Melnick y Aaron Tenenbein, "Especificaciones erróneas de la distribución normal", The American Statistician , volumen 36, número 4, noviembre de 1982, páginas 372-373
  41. "Distancia de Kullback-Leibler (KL) de dos distribuciones de probabilidad normales (gaussianas)" . Allisons.org . 5 de diciembre de 2007. Consultado el 3 de marzo de 2017 .
  42. Jordan, Michael I. (8 de febrero de 2010). "Stat260: Modelado e inferencia bayesiana: La distribución a priori conjugada para la distribución normal" (PDF) .
  43. ^ Amari y Nagaoka (2000)
  44. "Esperanza del máximo de variables aleatorias gaussianas" . Mathematics Stack Exchange . Consultado el 7 de abril de 2024 .
  45. "Aproximación normal a la distribución de Poisson" . Stat.ucla.edu . Consultado el 3 de marzo de 2017 .
  46. Bryc (1995 , pág. 27) 
  47. Weisstein, Eric W. "Distribución normal de productos" . MathWorld . wolfram.com.
  48. Lukacs, Eugene (1942). "Una caracterización de la distribución normal" . The Annals of Mathematical Statistics . 13 (1): 91–3 . doi : 10.1214/aoms/1177731647 . ISSN 0003-4851 . JSTOR 2236166 .  
  49. Basu, D.; Laha, RG (1954). "Sobre algunas caracterizaciones de la distribución normal". Sankhyā . 13 (4): 359– 62. ISSN 0036-4452 . JSTOR 25048183 .  
  50. Lehmann, EL (1997). Prueba de hipótesis estadísticas (2.ª ed.). Springer. pág. 199. ISBN   978-0-387-94919-2.
  51. Patel y Read (1996 , [2.3.6])
  52. ^ Galambos y Simonelli (2004 , Teorema 3.5) 
  53. 1 2 Lukács y Rey (1954)
  54. Quine, MP (1993). "Sobre tres caracterizaciones de la distribución normal" . Probabilidad y Estadística Matemática . 14 (2): 257– 263.
  55. John, S (1982). "La familia de distribuciones normales de dos piezas con tres parámetros y su ajuste". Communications in Statistics – Theory and Methods . 11 (8): 879– 885. doi : 10.1080/03610928208828279 .
  56. 1 2 Krishnamoorthy (2006 , pág. 127) 
  57. Krishnamoorthy (2006 , p. 130) 
  58. Krishnamoorthy (2006 , p. 133) 
  59. 1 2 Maxwell (1860) , pág. 23.
  60. Bryc (1995) , pág. 1.
  61. Larkoski, Andrew J. (2023). Mecánica cuántica: una introducción matemática . Reino Unido: Cambridge University Press. págs. 120–121 . ISBN  978-1-009-12222-1. Consultado el 30 de mayo de 2025 .
  62. Huxley (1932)
  63. Jaynes, Edwin T. (2003). Teoría de la probabilidad: La lógica de la ciencia . Cambridge University Press. págs. 592–593 . ISBN  9780521592710.
  64. Oosterbaan, Roland J. (1994). «Capítulo 6: Análisis de frecuencia y regresión de datos hidrológicos» (PDF) . En Ritzema, Henk P. (ed.). Principios y aplicaciones del drenaje, Publicación 16 (segunda edición revisada). Wageningen, Países Bajos: Instituto Internacional para la Recuperación y Mejora de Tierras (ILRI). pp. 175–224 . ISBN   978-90-70754-33-4.
  65. Por qué la mayoría de los hallazgos de investigación publicados son falsos, John PA Ioannidis, 2005
  66. Wichura, Michael J. (1988). "Algoritmo AS241: Los puntos porcentuales de la distribución normal". Applied Statistics . 37 (3): 477– 84. doi : 10.2307/2347330 . JSTOR 2347330 . 
  67. Johnson, Kotz y Balakrishnan (1995 , ecuación (26.48))
  68. Kinderman y Monahan (1977)
  69. Leva (1992)
  70. Marsaglia y Tsang (2000)
  71. Karney (2016)
  72. Du, Fan y Wei (2022)
  73. Monahan (1985 , sección 2)
  74. Wallace (1996)
  75. Johnson, Kotz y Balakrishnan (1994 , pág. 85) 
  76. ^ Le Cam y Lo Yang (2000 , pág. 74) 
  77. De Moivre, Abraham (1733), Corolario I – véase Walker (1985 , p. 77) 
  78. Stigler (1986 , pág. 76 )
  79. Gauss (1809 , sección 177)
  80. Gauss (1809 , sección 179)
  81. Laplace (1774 , Problema III)
  82. Pearson (1905 , pág. 189) 
  83. Gauss (1809 , sección 177)
  84. Stigler (1986 , pág. 144) 
  85. Stigler (1978 , pág. 243) 
  86. Stigler (1978 , pág. 244) 
  87. Jaynes, Edwin J.; Teoría de la probabilidad: La lógica de la ciencia , Cap. 7 .
  88. Peirce, Charles S. (c. 1909 MS), Collected Papers v. 6, párrafo 327.
  89. Kruskal y Stigler (1997) .
  90. "Primeros usos... (Curva normal estándar de entrada)" .
  91. Hoel (1947) introduce los términos curva normal estándar (pág. 33) y distribución normal estándar (pág. 69) .
  92. Mood (1950) define explícitamente la distribución normal estándar (p. 112) .
  93. Sun, Jingchao; Kong, Maiying; Pal, Subhadip (22 de junio de 2021). "La distribución seminormal modificada: propiedades y un esquema de muestreo eficiente" . Communications in Statistics – Theory and Methods . 52 (5): 1591– 1613. doi : 10.1080/03610926.2021.1934700 . ISSN 0361-0926 . S2CID 237919587 .  

Fuentes

  • Aldrich, John; Miller, Jeff. "Primeros usos de los símbolos en probabilidad y estadística" .
  • Aldrich, John; Miller, Jeff. "Primeros usos conocidos de algunas palabras de las matemáticas" .En particular, las entradas para "en forma de campana y curva de campana" , "normal (distribución)" , "gaussiana" y "error, ley de error, teoría de errores, etc." .
  • Amari, Shun'ichi ; Nagaoka, Hiroshi (2000). Métodos de geometría de la información . Oxford University Press. ISBN 978-0-8218-0531-2.
  • Bernardo, José M.; Smith , Adrian FM (2000). Teoría bayesiana . Wiley. ISBN 978-0-471-49464-5.
  • Bryc, Wlodzimierz (1995). La distribución normal: caracterizaciones con aplicaciones . Springer-Verlag. ISBN 978-0-387-97990-8.
  • Casella, George ; Berger, Roger L. (2001). Inferencia estadística (2.ª  ed.). Duxbury. ISBN 978-0-534-24312-8.
  • Cody, William J. (1969). "Aproximaciones racionales de Chebyshev para la función de error" . Matemáticas de la computación . 23 (107): 631– 638. Bibcode : 1969MaCom..23..631C . doi : 10.1090/S0025-5718-1969-0247736-4 .
  • Cover, Thomas M.; Thomas , Joy A. (2006). Elementos de la teoría de la información . John Wiley and Sons. ISBN 9780471241959.
  • Dia, Yaya D. (2023). "Integrales incompletas aproximadas, aplicación a la función de error complementaria" . SSRN . doi : 10.2139/ssrn.4487559 . S2CID 259689086 . 
  • de Moivre, Abraham (2000) [Publicado originalmente en 1738]. La doctrina de las probabilidades . Sociedad Matemática Americana. ISBN 978-0-8218-2103-9.
  • Du, Y.; Fan, B.; Wei, B. (2022). "Un algoritmo de muestreo exacto mejorado para la distribución normal estándar". Computational Statistics . 37 (2): 721– 737. arXiv : 2008.03855 . doi : 10.1007/s00180-021-01136-w .
  • Fan, Jianqing (1991). "Sobre las tasas óptimas de convergencia para problemas de deconvolución no paramétrica" . The Annals of Statistics . 19 (3): 1257– 1272. doi : 10.1214/aos/1176348248 . JSTOR 2241949 . 
  • Galton, Francis (1889). Herencia natural (PDF) . Londres, Reino Unido: Richard Clay and Sons.
  • Galambos, Janos ; Simonelli, Italo (2004). Productos de variables aleatorias: aplicaciones a problemas de física y a funciones aritméticas . Marcel Dekker, Inc. ISBN 978-0-8247-5402-0.
  • Gauss, Carolo Friderico (1809). Theoria motvs corporvm coelestivm in sectionibvs conicis Solem ambientivm [ Teoría del movimiento de los cuerpos celestes que se mueven alrededor del Sol en secciones cónicas ] (en latín). Hambvrgi, Svmtibvs F. Perthes et IH Besser. Traducción al inglés .
  • Gould, Stephen Jay (1981). La falsa medida del hombre (primera  ed.). WW Norton. ISBN 978-0-393-01489-1.
  • Halperin, Max; Hartley, Herman O.; Hoel, Paul G. (1965). "Estándares recomendados para símbolos y notación estadística. Comité COPSS sobre símbolos y notación". The American Statistician . 19 (3): 12– 14. doi : 10.2307/2681417 . JSTOR 2681417 . 
  • Hart, John F.; et  al. (1968). Aproximaciones informáticas . Nueva York, Nueva York: John Wiley & Sons, Inc. ISBN 978-0-88275-642-4.
  • "Distribución normal" , Enciclopedia de matemáticas , EMS Press , 2001 [1994]
  • Herrnstein, Richard J.; Murray , Charles (1994). La curva de campana: inteligencia y estructura de clases en la vida estadounidense . Free Press . ISBN 978-0-02-914673-6.
  • Hoel, Paul G. (1947). Introducción a la estadística matemática . Nueva York: Wiley.
  • Huxley, Julian S. (1972) [Publicado originalmente en 1932]. Problemas del crecimiento relativo . Londres. ISBN 978-0-486-61114-3OCLC 476909537 
  • Johnson, Norman L.; Kotz , Samuel ; Balakrishnan, Narayanaswamy (1994). Distribuciones univariadas continuas, Volumen 1. Wiley. ISBN 978-0-471-58495-7.
  • Johnson, Norman L.; Kotz, Samuel; Balakrishnan, Narayanaswamy (1995). Distribuciones univariadas continuas, volumen 2. Wiley. ISBN 978-0-471-58494-0.
  • Karney, CFF (2016). "Muestreo exacto de la distribución normal" . ACM Transactions on Mathematical Software . 42 (1): 3:1–14. arXiv : 1303.6257 . doi : 10.1145/2710016 . S2CID 14252035 . 
  • Kinderman, Albert J.; Monahan, John F. (1977). "Generación computacional de variables aleatorias utilizando la razón de desviaciones uniformes" . ACM Transactions on Mathematical Software . 3 (3): 257– 260. doi : 10.1145/355744.355750 . S2CID 12884505 . 
  • Krishnamoorthy, Kalimuthu (2006). Manual de distribuciones estadísticas con aplicaciones . Chapman & Hall/CRC. ISBN 978-1-58488-635-8.
  • Kruskal, William H.; Stigler, Stephen M. (1997). Spencer, Bruce D. (ed.). Terminología normativa: «Normal» en estadística y otros ámbitos . Estadística y política pública. Oxford University Press. ISBN 978-0-19-852341-3.
  • Laplace, Pierre-Simon de (1774). "Mémoire sur la probabilité des cause par les événements" . Mémoires de l'Académie Royale des Sciences de Paris (Savants étrangers), Tomo 6 : 621–656 .Traducido por Stephen M. Stigler en Statistical Science 1 (3), 1986: JSTOR 2245476 . 
  • Laplace, Pierre-Simon (1812). Théorie analytique des probabilités [ Teoría analítica de las probabilidades ] . París, Ve. Mensajero.
  • Le Cam, Lucien ; Lo Yang, Grace (2000). Asintótica en estadística: algunos conceptos básicos (segunda  edición). Springer. ISBN 978-0-387-95036-5.
  • Leva, Joseph L. (1992). "Un generador rápido de números aleatorios normales" (PDF) . ACM Transactions on Mathematical Software . 18 (4): 449– 453. CiteSeerX 10.1.1.544.5806 . doi : 10.1145/138351.138364 . S2CID 15802663. Archivado del original (PDF) el 16 de julio de 2010.  
  • Léxis, Wilhelm (1878). "Sobre la duración normal de la vida humana y sobre la teoría de la estabilidad de las relaciones estadísticas". Annales de Démographie Internationale . II . París: 447– 462.
  • Lukacs, Eugene; King, Edgar P. (1954). "Una propiedad de la distribución normal" . The Annals of Mathematical Statistics . 25 (2): 389– 394. doi : 10.1214/aoms/1177728796 . JSTOR 2236741 . 
  • McPherson, Glen (1990). Estadística en la investigación científica: sus fundamentos, aplicación e interpretación . Springer-Verlag. ISBN 978-0-387-97137-7.
  • Marsaglia, George ; Tsang, Wai Wan (2000). "El método Ziggurat para generar variables aleatorias" . Journal of Statistical Software . 5 (8). doi : 10.18637/jss.v005.i08 .
  • Marsaglia, George (2004). "Evaluación de la distribución normal" . Journal of Statistical Software . 11 (4). doi : 10.18637/jss.v011.i04 .
  • Maxwell, James Clerk (1860). "V. Ilustraciones de la teoría dinámica de los gases. — Parte I: Sobre los movimientos y colisiones de esferas perfectamente elásticas" . Philosophical Magazine . Serie 4. 19 (124): 19– 32. Bibcode : 1860LEDPM..19...19M . doi : 10.1080/14786446008642818 .
  • Monahan, JF (1985). "Precisión en la generación de números aleatorios" . Matemáticas de la Computación . 45 (172): 559– 568. doi : 10.1090/S0025-5718-1985-0804945-X .
  • Mood, Alexander McFarlane (1950). Introducción a la teoría de la estadística . Nueva York: McGraw-Hill.
  • Patel, Jagdish K.; Read, Campbell B. (1996). Manual de la distribución normal (2.ª  ed.). CRC Press. ISBN 978-0-8247-9342-5.
  • Pearson, Karl (1901). "Sobre líneas y planos de ajuste más cercano a sistemas de puntos en el espacio" (PDF) . Philosophical Magazine . 6. 2 (11): 559– 572. doi : 10.1080/14786440109462720 . S2CID 125037489 . 
  • Pearson, Karl (1905) .'Das Fehlergesetz und seine Verallgemeinerungen durch Fechner und Pearson'. Una réplica" . Biometrika . 4 (1): 169– 212. doi : 10.2307/2331536 . JSTOR 2331536 . 
  • Pearson, Karl (1920). "Notas sobre la historia de la correlación" . Biometrika . 13 (1): 25– 45. doi : 10.1093/biomet/13.1.25 . JSTOR 2331722 . 
  • Rohrbasser, Jean-Marc; Véron, Jacques (2003). "Wilhelm Lexis: La duración normal de la vida como expresión de la "naturaleza de las cosas"" . Población . 58 (3): 303– 322. doi : 10.3917/pope.303.0303 .
  • Shore, H (1982). "Aproximaciones simples para la función acumulativa inversa, la función de densidad y la integral de pérdida de la distribución normal". Journal of the Royal Statistical Society. Serie C (Estadística aplicada) . 31 (2): 108– 114. doi : 10.2307/2347972 . JSTOR 2347972 . 
  • Shore, H (2005). "Aproximaciones precisas basadas en RMM para la función de distribución acumulada de la distribución normal". Communications in Statistics – Theory and Methods . 34 (3): 507– 513. doi : 10.1081/sta-200052102 . S2CID 122148043 . 
  • Shore, H (2011). "Metodología de modelado de respuesta". WIREs Comput Stat . 3 (4): 357– 372. doi : 10.1002/wics.151 . S2CID 62021374 . 
  • Shore, H (2012). "Estimación de modelos de metodología de modelado de respuesta". WIREs Comput Stat . 4 (3): 323– 333. doi : 10.1002/wics.1199 . S2CID 122366147 . 
  • Stigler, Stephen M. (1978). "Estadística matemática en sus inicios" . The Annals of Statistics . 6 (2): 239– 265. doi : 10.1214/aos/1176344123 . JSTOR 2958876 . 
  • Stigler, Stephen M. (1982). "Una propuesta modesta: un nuevo estándar para la normalidad". The American Statistician . 36 (2): 137– 138. doi : 10.2307/2684031 . JSTOR 2684031 . 
  • Stigler, Stephen M. (1986). Historia de la estadística: La medición de la incertidumbre antes de 1900. Harvard University Press. ISBN 978-0-674-40340-6.
  • Stigler, Stephen M. (1999). Statistics on the Table . Harvard University Press. ISBN 978-0-674-83601-3.
  • Walker, Helen M. (1985). «De Moivre sobre la ley de probabilidad normal» (PDF) . En Smith, David Eugene (ed.). Un libro de referencia en matemáticas . Dover. ISBN 978-0-486-64690-9.
  • Wallace, CS (1996). "Generadores pseudoaleatorios rápidos para variables normales y exponenciales" . ACM Transactions on Mathematical Software . 22 (1): 119– 127. doi : 10.1145/225545.225554 . S2CID 18514848 . 
  • Weisstein, Eric W. "Distribución normal" . MundoMatemático .
  • West, Graeme (2009). "Mejores aproximaciones a las funciones normales acumulativas" (PDF) . Revista Wilmott : 70–76 . Archivado del original (PDF) el 29 de febrero de 2012.
  • Zelen, Marvin; Severo, Norman C. (1972) [First published 1964]. Probability Functions (chapter 26). Handbook of mathematical functions with formulas, graphs, and mathematical tables, by Abramowitz, M.; and Stegun, I. A.: National Bureau of Standards. New York, NY: Dover. ISBN 978-0-486-61272-0.