Articulo de referencia

Distribución normal truncada

\\xi=\\frac{x-\\mu}{\\sigma},\\ \\alpha=\\frac{a-\\mu}{\\sigma},\\ \\beta=\\frac{b-\\mu}{\\sigma} Z = \\Phi(\\beta)-\\Phi(\\alpha) "},"parameters":{"wt":"{{nowrap| \\mu \\in \\m...

En probabilidad y estadística, la distribución normal truncada es la distribución de probabilidad que se obtiene a partir de la de una variable aleatoria con distribución normal, limitando dicha variable aleatoria por debajo o por encima (o ambas). La distribución normal truncada tiene amplias aplicaciones en estadística y econometría .

Definiciones

Suponerincógnita{\displaystyle X}tiene una distribución normal con mediaμ{\displaystyle \mu }y varianzaσ2{\displaystyle \sigma ^{2}}y se encuentra dentro del intervalo(a,b),cona<b{\displaystyle (a,b),{\text{con}}\;-\infty \leq a<b\leq \infty }. Entoncesincógnita{\displaystyle X}condicionado aa<incógnita<b{\displaystyle a<X<b}tiene una distribución normal truncada.

Su función de densidad de probabilidad ,F{\displaystyle f}, paraaincógnitab{\displaystyle a\leq x\leq b}, se da por

F(incógnita;μ,σ,a,b)=1σφ(incógnitaμσ)Φ(bμσ)Φ(aμσ){\displaystyle f(x;\mu ,\sigma ,a,b)={\frac {1}{\sigma }}\,{\frac {\varphi ({\frac {x-\mu }{\sigma }})}{\Phi ({\frac {b-\mu }{\sigma }})-\Phi ({\frac {a-\mu }{\sigma }})}}}

y porF=0{\displaystyle f=0}de lo contrario.

Aquí, φ(ξ)=12πexp(12ξ2){\displaystyle \varphi (\xi )={\frac {1}{\sqrt {2\pi }}}\exp \left(-{\frac {1}{2}}\xi ^{2}\right)} es la función de densidad de probabilidad de la distribución normal estándar yΦ(){\displaystyle \Phi (\cdot )}es su función de distribución acumulativaΦ(incógnita)=12(1+terreno(incógnita/2)).{\displaystyle \Phi (x)={\frac {1}{2}}\left(1+\operatorname {erf} (x/{\sqrt {2}})\right).} Por definición, sib={\displaystyle b=\infty }, entoncesΦ(bμσ)=1{\displaystyle \Phi \left({\tfrac {b-\mu }{\sigma }}\right)=1}y de manera similar, sia={\displaystyle a=-\infty }, entoncesΦ(aμσ)=0{\displaystyle \Phi \left({\tfrac {a-\mu }{\sigma }}\right)=0}.

Las fórmulas anteriores muestran que cuando<a<b<+{\displaystyle -\infty <a<b<+\infty }el parámetro de escalaσ2{\displaystyle \sigma ^{2}}Se permite que la distribución normal truncada tome valores negativos. El parámetroσ{\displaystyle \sigma }en este caso es imaginario, pero la funciónF{\displaystyle f}es, sin embargo, real, positivo y normalizable. El parámetro de escalaσ2{\displaystyle \sigma ^{2}}de la distribución normal no truncada debe ser positivo porque de lo contrario la distribución no sería normalizable. La distribución normal doblemente truncada, por otro lado, puede en principio tener un parámetro de escala negativo (que es diferente de la varianza, ver fórmulas de resumen), porque no surgen tales problemas de integrabilidad en un dominio acotado. En este caso, la distribución no puede interpretarse como una normal no truncada condicionada aa<incógnita<b{\displaystyle a<X<b}Por supuesto, pero aún puede interpretarse como una distribución de máxima entropía con el primer y segundo momento como restricciones, y tiene una característica peculiar adicional: presenta dos máximos locales en lugar de uno, ubicados enincógnita=a{\displaystyle x=a}yincógnita=b{\displaystyle x=b}.

Propiedades

La distribución normal truncada es una de las dos posibles distribuciones de probabilidad de máxima entropía para una media y varianza fijas restringidas al intervalo [a,b], siendo la otra la distribución U truncada . [ 2 ] Las distribuciones normales truncadas con soporte fijo forman una familia exponencial. Nielsen [ 3 ] presentó una fórmula de forma cerrada para calcular la divergencia de Kullback-Leibler y la distancia de Bhattacharyya entre dos distribuciones normales truncadas con el soporte de la primera distribución anidado en el soporte de la segunda.

Momentos

Si la variable aleatoria se ha truncado solo por debajo, parte de la masa de probabilidad se ha desplazado a valores más altos, dando lugar a una distribución estocástica dominante de primer orden y, por lo tanto, aumentando la media a un valor superior a la media.μ{\displaystyle \mu }de la distribución normal original. Del mismo modo, si la variable aleatoria se ha truncado solo por encima, la distribución truncada tiene una media menor queμ.{\displaystyle \mu .}

Independientemente de si la variable aleatoria está acotada superior, inferior o ambas, la truncación es una contracción que preserva la media combinada con un desplazamiento rígido que cambia la media y, por lo tanto, la varianza de la distribución truncada es menor que la varianza.σ2{\displaystyle \sigma ^{2}}de la distribución normal original.

Truncamiento bilateral

Fuente: [ 4 ]

Dejarα=(aμ)/σ{\displaystyle \alpha =(a-\mu )/\sigma }yβ=(bμ)/σ{\displaystyle \beta =(b-\mu )/\sigma }. Entonces: mi(incógnitaa<incógnita<b)=μσφ(β)φ(α)Φ(β)Φ(α){\displaystyle \operatorname {E} (X\mid a<X<b)=\mu -\sigma {\frac {\varphi (\beta )-\varphi (\alpha )}{\Phi (\beta )-\Phi (\alpha )}}} y Var(incógnitaa<incógnita<b)=σ2[1βφ(β)αφ(α)Φ(β)Φ(α)(φ(β)φ(α)Φ(β)Φ(α))2]{\displaystyle \operatorname {Var} (X\mid a<X<b)=\sigma ^{2}\left[1-{\frac {\beta \varphi (\beta )-\alpha \varphi (\alpha )}{\Phi (\beta )-\Phi (\alpha )}}-\left({\frac {\varphi (\beta )-\varphi (\alpha )}{\Phi (\beta )-\Phi (\alpha )}}\right)^{2}\right]}

Se debe tener cuidado en la evaluación numérica de estas fórmulas, ya que puede resultar en una cancelación catastrófica cuando el intervalo[a,b]{\displaystyle [a,b]}no incluyeμ{\displaystyle \mu }. Hay mejores maneras de reescribirlos que evitan este problema. [ 5 ]

Truncamiento unilateral (de la cola inferior)

Fuentes: [ 6 ] [ 7 ]

En este casob=,φ(β)=0,Φ(β)=1,{\displaystyle \;b=\infty ,\;\varphi (\beta )=0,\;\Phi (\beta )=1,}entonces

mi(incógnitaincógnita>a)=μ+σφ(α)/Z,{\displaystyle \operatorname {E} (X\mid X>a)=\mu +\sigma \varphi (\alpha )/Z,\!}

y

Var(incógnitaincógnita>a)=σ2[1+αφ(α)/Z(φ(α)/Z)2],{\displaystyle \operatorname {Var} (X\mid X>a)=\sigma ^{2}[1+\alpha \varphi (\alpha )/Z-(\varphi (\alpha )/Z)^{2}],}

dóndeZ=1Φ(α).{\displaystyle Z=1-\Phi (\alpha ).}

Truncamiento unilateral (de la cola superior)

En este casoa=α=,φ(α)=0,Φ(α)=0,{\displaystyle \;a=\alpha =-\infty ,\;\varphi (\alpha )=0,\;\Phi (\alpha )=0,}entonces

mi(incógnitaincógnita<b)=μσφ(β)Φ(β),{\displaystyle \operatorname {E} (X\mid X<b)=\mu -\sigma {\frac {\varphi (\beta )}{\Phi (\beta )}},}Var(incógnitaincógnita<b)=σ2[1βφ(β)Φ(β)(φ(β)Φ(β))2].{\displaystyle \operatorname {Var} (X\mid X<b)=\sigma ^{2}\left[1-\beta {\frac {\varphi (\beta )}{\Phi (\beta )}}-\left({\frac {\varphi (\beta )}{\Phi (\beta )}}\right)^{2}\right].}

Barr y Sherrill (1999) ofrecen una expresión más sencilla para la varianza de truncamientos unilaterales. Su fórmula se basa en la función de distribución acumulada chi-cuadrado, implementada en bibliotecas de software estándar. Bebu y Mathew (2009) proporcionan fórmulas para intervalos de confianza (generalizados) alrededor de los momentos truncados.

Una fórmula recursiva

En cuanto al caso no truncado, existe una fórmula recursiva para los momentos truncados. [ 8 ]

En particular, paranorte0{\displaystyle n\geq 0}, tenemos

mi[(incógnitaμσ)norte+2]=αnorte+1φ(α)βnorte+1φ(β)Φ(β)Φ(α)+(norte+1)mi[(incógnitaμσ)norte].{\displaystyle \operatorname {E} \left[\left({\frac {x-\mu }{\sigma }}\right)^{n+2}\right]={\frac {\alpha ^{n+1}\varphi (\alpha )-\beta ^{n+1}\varphi (\beta )}{\Phi (\beta )-\Phi (\alpha )}}+(n+1)\operatorname {E} \left[\left({\frac {x-\mu }{\sigma }}\right)^{n}\right].}

Prueba

Mediante el cambio de variablesξ=(incógnitaμ)/σ{\displaystyle \xi =(x-\mu )/\sigma }, uno obtiene mi[(incógnitaμσ)norte+2]=αβξnorte+2φ(ξ)Φ(β)Φ(α)dξ.{\displaystyle \operatorname {E} \left[\left({\frac {x-\mu }{\sigma }}\right)^{n+2}\right]=\int _{\alpha }^{\beta }{\frac {\xi ^{n+2}\varphi (\xi )}{\Phi (\beta )-\Phi (\alpha )}}d\xi .} Usandoφ(ξ)=ξφ(ξ),{\displaystyle \varphi '(\xi )=-\xi \varphi (\xi ),}La integración por partes produce mi[(incógnitaμσ)norte+2]=[ξnorte+1φ(ξ)Φ(β)Φ(α)]αβ+(norte+1)αβξnorteφ(ξ)Φ(β)Φ(α)dξ,{\displaystyle \operatorname {E} \left[\left({\frac {x-\mu }{\sigma }}\right)^{n+2}\right]=\left[{\frac {-\xi ^{n+1}\varphi (\xi )}{\Phi (\beta )-\Phi (\alpha )}}\right]_{\alpha }^{\beta }+(n+1)\int _{\alpha }^{\beta }{\frac {\xi ^{n}\varphi (\xi )}{\Phi (\beta )-\Phi (\alpha )}}d\xi ,} lo que da como resultado la ecuación que se debe demostrar.

Multivariado

Calcular los momentos de una distribución normal truncada multivariada es más difícil.

Generación de valores a partir de la distribución normal truncada.

Una variable aleatoriaincógnita{\displaystyle x}definido como incógnita=Φ1(Φ(α)+U(Φ(β)Φ(α)))σ+μ{\displaystyle x=\Phi ^{-1}(\Phi (\alpha )+U\cdot (\Phi (\beta )-\Phi (\alpha )))\sigma +\mu } conΦ{\displaystyle \Phi }la función de distribución acumulativa de la distribución normal de la que se tomará la muestra (es decir, con la media y la varianza correctas) yΦ1{\displaystyle \Phi ^{-1}}su inverso,U{\displaystyle U}un número aleatorio uniforme en(0,1){\displaystyle (0,1)}, sigue la distribución truncada al rango(a,b){\displaystyle (a,b)}Este es simplemente el método de transformación inversa para simular variables aleatorias. Si bien es uno de los más sencillos, este método puede fallar al muestrear en la cola de la distribución normal [ 9 ] o ser demasiado lento [ 10 ] . Por lo tanto, en la práctica, es necesario encontrar métodos de simulación alternativos.

Uno de estos generadores normales truncados (implementado en Matlab y en R (lenguaje de programación) como trandn.R ) se basa en una idea de aceptación-rechazo debida a Marsaglia. [ 11 ] A pesar de la tasa de aceptación ligeramente subóptima de Marsaglia (1964) en comparación con Robert (1995) , el método de Marsaglia es típicamente más rápido, [ 10 ] porque no requiere la costosa evaluación numérica de la función exponencial.

Para obtener más información sobre cómo simular una muestra de la distribución normal truncada, consulte Robert (1995) , Lynch (2007 , Sección 8.1.3 (páginas 200–206)) y Devroye (1986) . El paquete MSM de R incluye la función rtnorm , que calcula muestras de una distribución normal truncada. El paquete truncnorm de R también incluye funciones para realizar extracciones de una distribución normal truncada.

Chopin (2011) propuso ( arXiv ) un algoritmo inspirado en el algoritmo Ziggurat de Marsaglia y Tsang (1984, 2000), que suele considerarse el muestreador gaussiano más rápido, y que también es muy similar al algoritmo de Ahrens (1995). Se pueden encontrar implementaciones en C , C++ , Matlab y Python .

El muestreo de la distribución normal truncada multivariada es considerablemente más difícil. [ 12 ] La simulación exacta o perfecta solo es factible en el caso de truncamiento de la distribución normal a una región politópica. [ 12 ] [ 13 ] En casos más generales, Damien y Walker (2001) introducen una metodología general para muestrear densidades truncadas dentro de un marco de muestreo de Gibbs . Su algoritmo introduce una variable latente y, dentro de un marco de muestreo de Gibbs, es más eficiente computacionalmente que el algoritmo de Robert (1995) .

Véase también

Notas

  1. «Conferencia 4: Selección» (PDF) . web.ist.utl.pt.Instituto Superior Técnico . 11 de noviembre de 2002. p.  1 . Consultado el 14 de julio de 2015 .
  2. Dowson, D.; Wragg, A. (septiembre de 1973). "Distribuciones de máxima entropía con primeros y segundos momentos prescritos (Corresp.)". IEEE Transactions on Information Theory . 19 (5): 689– 693. doi : 10.1109/TIT.1973.1055060 . ISSN 1557-9654 . 
  3. Frank Nielsen (2022). "Divergencias estadísticas entre densidades de familias exponenciales truncadas con soportes anidados: divergencias de doble Bregman y doble Jensen" . Entropy . 24 ( 3). MDPI: 421. Bibcode : 2022Entrp..24..421N . doi : 10.3390/e24030421 . PMC 8947456. PMID 35327931 .  
  4. Johnson, Norman Lloyd; Kotz, Samuel; Balakrishnan, N. (1994). Distribuciones univariadas continuas . Vol. 1 (2.ª ed.). Nueva York: Wiley. Sección 10.1. ISBN   0-471-58495-9OCLC 29428092 
  5. Fernández-de-Cossio-Díaz, Jorge (2017-12-06), TruncatedNormal.jl: Calcula la media y la varianza de la distribución normal truncada univariada (funciona lejos del pico) , consultado el 2017-12-06
  6. Greene, William H. (2003). Análisis econométrico (5.ª ed.). Prentice Hall. ISBN  978-0-13-066189-0.
  7. del Castillo, Joan (marzo de 1994). "La distribución normal truncada una sola vez: una familia exponencial no pronunciada" (PDF) . Anales del Instituto de Matemáticas Estadísticas . 46 (1): 57– 66. doi : 10.1007/BF00773592 .
  8. Documento de Eric Orjebin, " https://people.smp.uq.edu.au/YoniNazarathy/teaching_projects/studentWork/EricOrjebin_TruncatedNormalMoments.pdf "
  9. Kroese, DP ; Taimre, T.; Botev, ZI (2011). Manual de métodos de Monte Carlo . John Wiley & Sons.
  10. 1 2 Botev, ZI; L'Ecuyer, P. (2017). "Simulación de la distribución normal truncada a un intervalo en la cola". 10.ª Conferencia Internacional EAI sobre Metodologías y Herramientas de Evaluación del Desempeño . 25-28 de octubre de 2016. Taormina, Italia: ACM. pp. 23-29 . doi : 10.4108/eai.25-10-2016.2266879 . ISBN  978-1-63190-141-6.{{cite conference}}: CS1 mantenimiento: ubicación ( enlace )
  11. Marsaglia, George (1964). "Generación de una variable a partir de la cola de la distribución normal". Technometrics . 6 (1): 101– 102. doi : 10.2307/1266749 . JSTOR 1266749 . 
  12. 1 2 Botev, ZI (2016). "La ley normal bajo restricciones lineales: simulación y estimación mediante inclinación minimax". Journal of the Royal Statistical Society, Serie B. 79 : 125–148 . arXiv : 1603.04166 . doi : 10.1111 /rssb.12162 . S2CID 88515228 . 
  13. Botev, Zdravko y L'Ecuyer, Pierre (2018). «Capítulo 8: Simulación a partir de la cola de la distribución normal univariada y multivariada». En Puliafito, Antonio (ed.). Modelado de sistemas: metodologías y herramientas. EAI/Springer Innovations in Communication and Computing . Springer, Cham. pp. 115–132 . doi : 10.1007/978-3-319-92378-9_8 . ISBN  978-3-319-92377-2. S2CID 125554530 . 

Referencias

  • Botev, Zdravko y L'Ecuyer, Pierre (2018). «Capítulo 8: Simulación a partir de la cola de la distribución normal univariada y multivariada». En Puliafito, Antonio (ed.). Modelado de sistemas: metodologías y herramientas . EAI/Springer Innovations in Communication and Computing. Springer, Cham. pp. 115–132 . doi : 10.1007/978-3-319-92378-9_8 . ISBN  978-3-319-92377-2. S2CID 125554530 . 
  • Devroye, Luc (1986). Generación de variables aleatorias no uniformes (PDF) . Nueva York: Springer-Verlag. Archivado del original (PDF) el 18 de agosto de 2014. Recuperado el 12 de abril de 2012 .
  • Greene, William H. (2003). Análisis econométrico (5.ª ed.) . Prentice Hall. ISBN 978-0-13-066189-0.
  • Norman L. Johnson y Samuel Kotz (1970). Distribuciones univariadas continuas-1 , capítulo 13. John Wiley & Sons.
  • Lynch, Scott (2007). Introducción a la estadística bayesiana aplicada y la estimación para científicos sociales . Nueva York: Springer. ISBN 978-1-4419-2434-6.
  • Robert, Christian P. (1995). "Simulación de variables normales truncadas". Statistics and Computing . 5 (2): 121– 125. arXiv : 0907.4010 . doi : 10.1007/BF00143942 . S2CID 15943491 . 
  • Barr, Donald R.; Sherrill, E.Todd (1999). "Media y varianza de distribuciones normales truncadas". The American Statistician . 53 (4): 357– 361. doi : 10.1080/00031305.1999.10474490 .
  • Bebu, Ionut; Mathew, Thomas (2009). "Intervalos de confianza para momentos limitados y momentos truncados en modelos normales y lognormales". Statistics and Probability Letters . 79 (3): 375– 380. doi : 10.1016/j.spl.2008.09.006 .
  • Damien, Paul; Walker, Stephen G. (2001). "Muestreo de densidades normales, beta y gamma truncadas". Journal of Computational and Graphical Statistics . 10 (2): 206– 215. doi : 10.1198/10618600152627906 . S2CID 123156320 . 
  • Chopin, Nicolas (1 de abril de 2011). "Simulación rápida de distribuciones gaussianas truncadas" . Statistics and Computing . 21 (2): 275– 288. arXiv : 1201.6140 . doi : 10.1007/s11222-009-9168-1 . ISSN 1573-1375 . 
  • Burkardt, John. "La distribución normal truncada" (PDF) . Sitio web del Departamento de Computación Científica . Universidad Estatal de Florida . Consultado el 15 de febrero de 2018 .