Articulo de referencia

Distribución de cola pesada

Las distribuciones de cola pesada disminuyen más lentamente En teoría de la probabilidad , las distribuciones de cola pesada son aquellas cuyas colas no están acotadas exponenci...

Las distribuciones de cola pesada disminuyen más lentamente

En teoría de la probabilidad , las distribuciones de cola pesada son aquellas cuyas colas no están acotadas exponencialmente: [ 1 ] es decir, tienen colas más pesadas que la distribución exponencial . En términos generales, "cola pesada" significa que la distribución disminuye más lentamente que una distribución exponencial, por lo que los valores extremos son más probables. En muchas aplicaciones, lo que interesa es la cola derecha de la distribución, pero una distribución puede tener una cola izquierda pesada, o ambas colas pueden ser pesadas.

Existen tres subclases importantes de distribuciones de cola pesada: las distribuciones de cola gorda , las distribuciones de cola larga y las distribuciones subexponenciales . En la práctica, todas las distribuciones de cola pesada de uso común pertenecen a la clase subexponencial, introducida por Jozef Teugels . [ 2 ]

Todavía existe cierta discrepancia en el uso del término «cola pesada» . Existen otras dos definiciones en uso. Algunos autores lo utilizan para referirse a aquellas distribuciones cuyos momentos de potencia no son finitos; otros, a aquellas cuya varianza no es finita . La definición que se presenta en este artículo es la más general y abarca todas las distribuciones comprendidas en las definiciones alternativas, así como aquellas distribuciones como la log-normal que poseen todos sus momentos de potencia, pero que generalmente se consideran de cola pesada. (En ocasiones, el término «cola pesada» se utiliza para cualquier distribución con colas más pesadas que la distribución normal).

Definiciones

Definición de distribución de cola pesada

Se dice que la distribución de una variable aleatoria X con función de distribución F tiene una cola pesada (derecha) si la función generadora de momentos de X , M X ( t ), es infinita para todo t  >  0. [ 3 ]

Eso significa

mitincógnitadF(incógnita)=a pesar de t>0.{\displaystyle \int _{-\infty }^{\infty }e^{tx}\,dF(x)=\infty \quad {\mbox{para todo }}t>0.}[ 4 ]

Esto también se escribe en términos de la función de distribución de cola.

F¯(incógnita)Pr[incógnita>incógnita]{\displaystyle {\overline {F}}(x)\equiv \Pr[X>x]\,}

como

límiteincógnitamitincógnitaF¯(incógnita)=a pesar de t>0.{\displaystyle \lim _{x\to \infty }e^{tx}{\overline {F}}(x)=\infty \quad {\mbox{para todo }}t>0.\,}

Definición de distribución de cola larga

Se dice que la distribución de una variable aleatoria X con función de distribución F tiene una cola derecha larga [ 1 ] si para todo t  >  0,

límiteincógnitaPr[incógnita>incógnita+tincógnita>incógnita]=1,{\displaystyle \lim _{x\to \infty }\Pr[X>x+t\mid X>x]=1,\,}

o equivalentemente

F¯(incógnita+t)F¯(incógnita)como incógnita.{\displaystyle {\overline {F}}(x+t)\sim {\overline {F}}(x)\quad {\mbox{cuando }}x\to \infty .\,}

Esto tiene la interpretación intuitiva para una cantidad distribuida con cola larga y cola derecha de que si la cantidad de cola larga supera algún nivel alto, la probabilidad se acerca a 1 de que supere cualquier otro nivel superior.

Todas las distribuciones de cola larga son de cola pesada, pero lo contrario es falso, y es posible construir distribuciones de cola pesada que no sean de cola larga.

Distribuciones subexponenciales

Esta sección describe el concepto de subexponencial en el contexto de distribuciones de cola pesada. Existe una definición casi opuesta de distribuciones subexponenciales en el contexto de distribuciones subgaussianas de cola ligera .

La subexponencialidad se define en términos de convoluciones de distribuciones de probabilidad . Para dos variables aleatorias independientes e idénticamente distribuidasincógnita1,incógnita2{\displaystyle X_{1},X_{2}}con una función de distribución comúnF{\displaystyle F}, la convolución deF{\displaystyle F}con sí mismo, escritoF2{\displaystyle F^{*2}}y llamado cuadrado de convolución, se define utilizando la integración de Lebesgue-Stieltjes mediante:

Pr[incógnita1+incógnita2incógnita]=F2(incógnita)=0incógnitaF(incógnitay)dF(y),{\displaystyle \Pr[X_{1}+X_{2}\leq x]=F^{*2}(x)=\int _{0}^{x}F(xy)\,dF(y),}

y la convolución n -plegableFnorte{\displaystyle F^{*n}}se define inductivamente por la regla:

Fnorte(incógnita)=0incógnitaF(incógnitay)dFnorte1(y).{\displaystyle F^{*n}(x)=\int _{0}^{x}F(xy)\,dF^{*n-1}(y).}

La función de distribución de colaF¯{\displaystyle {\overline {F}}}se define comoF¯(incógnita)=1F(incógnita){\displaystyle {\overline {F}}(x)=1-F(x)}.

Una distribuciónF{\displaystyle F}en la semirrecta positiva es subexponencial [ 1 ] [ 5 ] [ 2 ] si

F2¯(incógnita)2F¯(incógnita)como incógnita.{\displaystyle {\overline {F^{*2}}}(x)\sim 2{\overline {F}}(x)\quad {\mbox{as }}x\to \infty .}

Esto implica [ 6 ] que, para cualquiernorte1{\displaystyle n\geq 1},

Fnorte¯(incógnita)norteF¯(incógnita)como incógnita.{\displaystyle {\overline {F^{*n}}}(x)\sim n{\overline {F}}(x)\quad {\mbox{as }}x\to \infty .}

La interpretación probabilística [ 6 ] de esto es que, para una suma denorte{\displaystyle n}variables aleatorias independientesincógnita1,,incógnitanorte{\displaystyle X_{1},\ldots ,X_{n}}con distribución comúnF{\displaystyle F},

Pr[incógnita1++incógnitanorte>incógnita]Pr[máximo(incógnita1,,incógnitanorte)>incógnita]como incógnita.{\displaystyle \Pr[X_{1}+\cdots +X_{n}>x]\sim \Pr[\max(X_{1},\ldots ,X_{n})>x]\quad {\text{as }}x\to \infty .}

Esto se conoce a menudo como el principio del único gran salto [ 7 ] o principio de catástrofe. [ 8 ]

Una distribuciónF{\displaystyle F}en toda la recta real es subexponencial si la distribución FI([0,)){\displaystyle FI([0,\infty ))}es. [ 9 ] AquíI([0,)){\displaystyle I([0,\infty ))}es la función indicadora de la semirrecta positiva. Alternativamente, una variable aleatoriaincógnita{\displaystyle X}soportada en la recta real es subexponencial si y solo siincógnita+=máximo(0,incógnita){\displaystyle X^{+}=\max(0,X)}es subexponencial.

Todas las distribuciones subexponenciales tienen colas largas, pero se pueden construir ejemplos de distribuciones con colas largas que no sean subexponenciales.

Distribuciones comunes de cola pesada

Todas las distribuciones de cola pesada de uso común son subexponenciales. [ 6 ]

Entre las que son unilaterales se incluyen:

Entre las que son de dos colas se incluyen:

Relación con las distribuciones de cola pesada

Una distribución de cola gorda es una distribución para la cual la función de densidad de probabilidad, para valores grandes de x, tiende a cero como una potenciaincógnitaa{\displaystyle x^{-a}}Dado que dicha potencia siempre está acotada inferiormente por la función de densidad de probabilidad de una distribución exponencial, las distribuciones de cola pesada siempre tienen una cola gruesa. Sin embargo, algunas distribuciones tienen una cola que tiende a cero más lentamente que una función exponencial (lo que significa que tienen una cola gruesa), pero más rápidamente que una potencia (lo que significa que no tienen una cola gruesa). Un ejemplo es la distribución log-normal . No obstante, muchas otras distribuciones de cola pesada, como la log-logística y la distribución de Pareto , también tienen colas gruesas.

Estimación del índice de cola

Existen enfoques paramétricos [ 6 ] y no paramétricos [ 13 ] para el problema de la estimación del índice de cola.

Para estimar el índice de cola utilizando el enfoque paramétrico, algunos autores emplean la distribución GEV o la distribución de Pareto ; pueden aplicar el estimador de máxima verosimilitud (MLE).

Estimador del índice de cola de Pickand

Con(incógnitanorte,norte1){\displaystyle (X_{n},n\geq 1)}una secuencia aleatoria de funciones de densidad independientes e idénticasFD(H(ξ)){\displaystyle F\in D(H(\xi ))}, el dominio de máxima atracción [ 14 ] de la densidad de valores extremos generalizadaH{\displaystyle H}, dóndeξR{\displaystyle \xi \in \mathbb {R} }. Silímitenortek(norte)={\displaystyle \lim _{n\to \infty }k(n)=\infty }y límitenortek(norte)norte=0{\displaystyle \lim _{n\to \infty }{\frac {k(n)}{n}}=0}, entonces la estimación del índice de cola de Pickands es [ 6 ] [ 14 ]

ξ(k(norte),norte)Pickands=1ln2ln(incógnita(nortek(norte)+1,norte)incógnita(norte2k(norte)+1,norte)incógnita(norte2k(norte)+1,norte)incógnita(norte4k(norte)+1,norte)),{\displaystyle \xi _{(k(n),n)}^{\text{Pickands}}={\frac {1}{\ln 2}}\ln \left({\frac {X_{(n-k(n)+1,n)}-X_{(n-2k(n)+1,n)}}{X_{(n-2k(n)+1,n)}-X_{(n-4k(n)+1,n)}}}\right),}

dóndeincógnita(nortek(norte)+1,norte)=máximo(incógnitanortek(norte)+1,,incógnitanorte){\displaystyle X_{(n-k(n)+1,n)}=\max \left(X_{n-k(n)+1},\ldots ,X_{n}\right)}Este estimador converge en probabilidad aξ{\displaystyle \xi }.

Estimador del índice de cola de Hill

Dejar(incógnitat,t1){\displaystyle (X_{t},t\geq 1)}Sea una secuencia de variables aleatorias independientes e idénticamente distribuidas con función de distribuciónFD(H(ξ)){\displaystyle F\in D(H(\xi ))}, el dominio máximo de atracción de la distribución generalizada de valores extremosH{\displaystyle H}, dóndeξR{\displaystyle \xi \in \mathbb {R} }. La ruta de ejemplo esincógnitat:1tnorte{\displaystyle {X_{t}:1\leq t\leq n}}dóndenorte{\displaystyle n}es el tamaño de la muestra. Si {k(norte)}{\displaystyle \{k(n)\}}es una secuencia de orden intermedio, es decirk(norte){1,,norte1},{\displaystyle k(n)\in \{1,\ldots ,n-1\},},k(norte){\displaystyle k(n)\to \infty }y k(norte)/norte0{\displaystyle k(n)/n\to 0}, entonces el estimador del índice de cola de Hill es [ 15 ]

ξ(k(norte),norte)Colina=(1k(norte)i=nortek(norte)+1norteln(incógnita(i,norte))ln(incógnita(nortek(norte)+1,norte)))1,{\displaystyle \xi _{(k(n),n)}^{\text{Hill}}=\left({\frac {1}{k(n)}}\sum _{i=n-k(n)+1}^{n}\ln(X_{(i,n)})-\ln(X_{(n-k(n)+1,n)})\right)^{-1},}

dóndeincógnita(i,norte){\displaystyle X_{(i,n)}}es eli{\displaystyle i}-estadística de orden -ésimo deincógnita1,,incógnitanorte{\displaystyle X_{1},\dots ,X_{n}}Este estimador converge en probabilidad aξ{\displaystyle \xi }y es asintóticamente normal siempre quek(norte){\displaystyle k(n)\to \infty }está restringido en base a una propiedad de variación regular de orden superior [ 16 ] . [ 17 ] La consistencia y la normalidad asintótica se extienden a una gran clase de secuencias dependientes y heterogéneas, [ 18 ] [ 19 ] independientemente de siincógnitat{\displaystyle X_{t}}Se observa, o un residuo calculado o datos filtrados de una gran clase de modelos y estimadores, incluidos modelos mal especificados y modelos con errores dependientes. [ 20 ] [ 21 ] [ 22 ] Nótese que tanto los estimadores de índice de cola de Pickand como los de Hill suelen utilizar el logaritmo de las estadísticas de orden. [ 23 ]

Estimador de razón del índice de cola

El estimador de razón (RE-estimador) del índice de cola fue introducido por Goldie y Smith. [ 24 ] Se construye de manera similar al estimador de Hill, pero utiliza un "parámetro de ajuste" no aleatorio.

Una comparación de los estimadores de tipo Hill y de tipo RE se puede encontrar en Novak. [ 13 ]

Software

  • aest Archivado el 25/11/2020 en Wayback Machine , herramienta C para estimar el índice de cola pesada. [ 25 ]

Estimación de la densidad de cola pesada

En Markovich [ 26 ] se presentaron enfoques no paramétricos para estimar funciones de densidad de probabilidad con colas pesadas y superpesadas. Estos enfoques se basan en estimadores de núcleo de ancho de banda variable y de cola larga; en la transformación preliminar de los datos a una nueva variable aleatoria en intervalos finitos o infinitos, lo cual es más conveniente para la estimación y luego la transformación inversa de la estimación de densidad obtenida; y el "enfoque de ensamblaje" que proporciona un cierto modelo paramétrico para la cola de la densidad y un modelo no paramétrico para aproximar la moda de la densidad. Los estimadores no paramétricos requieren una selección apropiada de parámetros de ajuste (suavizado) como el ancho de banda de los estimadores de núcleo y el ancho de los bins del histograma. Los métodos bien conocidos basados ​​en datos para dicha selección son la validación cruzada y sus modificaciones, los métodos basados ​​en la minimización del error cuadrático medio (ECM) y sus límites asintóticos y superiores. [ 27 ] En [ 26 ] se puede encontrar un método de discrepancia que utiliza estadísticas no paramétricas bien conocidas como las de Kolmogorov-Smirnov, von Mises y Anderson-Darling como métrica en el espacio de funciones de distribución (fds) y cuantiles de estas últimas estadísticas como una incertidumbre conocida o un valor de discrepancia. Bootstrap es otra herramienta para encontrar parámetros de suavizado utilizando aproximaciones de MSE desconocido mediante diferentes esquemas de selección de remuestras, véase por ejemplo [ 28 ] .

Véase también

Referencias

  1. 1 2 3 Asmussen, SR (2003). "Propiedades de estado estacionario de GI/G/1". Probabilidad aplicada y colas . Modelado estocástico y probabilidad aplicada. Vol.  51. págs. 266–301 . doi : 10.1007/0-387-21525-5_10 . ISBN  978-0-387-00211-8.
  2. 1 2 Teugels, Jozef L. (1975). "La clase de distribuciones subexponenciales" . Anales de probabilidad . 3 (6). Universidad de Lovaina . doi : 10.1214/aop/1176996225 . Recuperado el 7 de abril de 2019 .
  3. Rolski, Schmidli, Schmidt, Teugels, Procesos estocásticos para seguros y finanzas , 1999
  4. S. Foss, D. Korshunov, S. Zachary, Introducción a las distribuciones de cola pesada y subexponenciales , Springer Science & Business Media, 21 de mayo de 2013
  5. Chistyakov, VP (1964). "Un teorema sobre sumas de variables aleatorias positivas independientes y sus aplicaciones a procesos aleatorios ramificados" . ResearchGate . Recuperado el 7 de abril de 2019 .
  6. 1 2 3 4 5 Embrechts P.; Klueppelberg C.; Mikosch T. (1997). Modelado de eventos extremos para seguros y finanzas . Modelado estocástico y probabilidad aplicada. Vol. 33. Berlín: Springer. doi : 10.1007/978-3-642-33483-2 . ISBN  978-3-642-08242-9.
  7. Foss, S.; Konstantopoulos, T.; Zachary, S. (2007). "Paseos aleatorios modulados en tiempo discreto y continuo con incrementos de cola pesada" (PDF) . Journal of Theoretical Probability . 20 (3): 581. arXiv : math/0509605 . CiteSeerX 10.1.1.210.1699 . doi : 10.1007/s10959-007-0081-2 . S2CID 3047753 .  
  8. Wierman, Adam (9 de enero de 2014). "Catástrofes, conspiraciones y distribuciones subexponenciales (Parte III)" . Blog Rigor + Relevance . RSRG, Caltech . Consultado el 9 de enero de 2014 .
  9. ^ Willekens, E. (1986). "Subexponencialidad en la recta real". Informe Técnico . KU Lovaina.
  10. Falk, M., Hüsler, J. y Reiss, R. (2010). Leyes de los números pequeños: extremos y eventos raros . Springer. pág. 80. ISBN  978-3-0348-0008-2.{{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace )
  11. Alves, MIF, de Haan, L. y Neves, C. (10 de marzo de 2006). "Inferencia estadística para distribuciones de cola pesada y superpesada" (PDF) . Archivado del original (PDF) el 23 de junio de 2007. Recuperado el 1 de noviembre de 2011 .{{cite web}}: CS1 maint: varios nombres: lista de autores ( enlace )
  12. John P. Nolan (2009). "Distribuciones estables: modelos para datos con colas pesadas" (PDF) . Archivado del original (PDF) el 17 de julio de 2011. Consultado el 21 de febrero de 2009 .
  13. 1 2 Novak SY (2011). Métodos de valores extremos con aplicaciones a las finanzas . Londres: CRC. ISBN 978-1-43983-574-6.
  14. 1 2 Pickands III, James (enero de 1975). "Inferencia estadística mediante estadísticas de orden extremo" . The Annals of Statistics . 3 (1): 119– 131. doi : 10.1214/aos/1176343003 . JSTOR 2958083 . 
  15. Hill BM (1975) Un enfoque general simple para la inferencia sobre la cola de una distribución. Ann. Stat., vol. 3, 1163–1174.
  16. Hall, P. (1982) Sobre algunas estimaciones de un exponente de variación regular. JR Stat. Soc. Ser. B., vol. 44, 37–42.
  17. Haeusler, E. y JL Teugels (1985) Sobre la normalidad asintótica del estimador de Hill para el exponente de la variación regular. Ann. Stat., vol. 13, 743–756.
  18. Hsing, T. (1991) Sobre la estimación del índice de cola utilizando datos dependientes. Ann. Stat., vol. 19, 1547–1569.
  19. Hill, J. (2010) Sobre la estimación del índice de cola para datos dependientes y heterogéneos. Econometric Th., vol. 26, 1398–1436.
  20. Resnick, S. y Starica, C. (1997). Comportamiento asintótico del estimador de Hill para datos autorregresivos. Comm. Statist. Stochastic Models 13, 703–721.
  21. Ling, S. y Peng, L. (2004). Estimador de Hill para el índice de cola de un modelo ARMA. J. Statist. Plann. Inference 123, 279–293.
  22. Hill, JB (2015). Estimación del índice de cola para una serie temporal dependiente filtrada. Stat. Sin. 25, 609–630.
  23. Lee, Seyoon; Kim, Joseph HT (2019). "Distribución de Pareto generalizada exponenciada: propiedades y aplicaciones hacia la teoría de valores extremos". Communications in Statistics - Theory and Methods . 48 (8): 2014– 2038. arXiv : 1708.01686 . doi : 10.1080/03610926.2018.1441418 . S2CID 88514574 . 
  24. Goldie CM, Smith RL (1987) Variación lenta con resto: teoría y aplicaciones. Quart. J. Math. Oxford, vol. 38, 45–71.
  25. Crovella, ME; Taqqu, MS (1999). "Estimación del índice de cola pesada a partir de propiedades de escala" . Metodología y computación en probabilidad aplicada . 1 : 55–79 . doi : 10.1023/A:1010012224103 . S2CID 8917289. Archivado del original el 6 de febrero de 2007. Recuperado el 3 de septiembre de 2015 . 
  26. 1 2 Markovich NM (2007). Análisis no paramétrico de datos univariados con colas pesadas: investigación y práctica . Chitester: Wiley. ISBN 978-0-470-72359-3.
  27. Wand MP, Jones MC (1995). Suavizado de núcleo . Nueva York: Chapman and Hall. ISBN 978-0412552700.
  28. Hall P. (1992). The Bootstrap and Edgeworth Expansion . Springer. ISBN 9780387945088.