Articulo de referencia

cópula de vid

Una vid es una herramienta gráfica para etiquetar restricciones en distribuciones de probabilidad de alta dimensión . Una vid regular es un caso especial en el que todas las res...

Una vid es una herramienta gráfica para etiquetar restricciones en distribuciones de probabilidad de alta dimensión . Una vid regular es un caso especial en el que todas las restricciones son bidimensionales o bidimensionales condicionales. Las vides regulares generalizan los árboles y son, a su vez, especializaciones del árbol de Cantor . [ 1 ]

Combinadas con cópulas bivariadas , las vides regulares han demostrado ser una herramienta flexible en el modelado de dependencia de alta dimensión. Las cópulas [ 2 ] [ 3 ] son ​​distribuciones multivariadas con márgenes univariados uniformes. Representar una distribución conjunta como el producto de márgenes univariados y cópulas permite separar el problema de estimar distribuciones univariadas del problema de estimar la dependencia. Esto es útil ya que las distribuciones univariadas a menudo se pueden estimar adecuadamente a partir de datos, mientras que la información de dependencia es aproximadamente desconocida, involucrando indicadores de resumen y juicio. [ 4 ] [ 5 ] Aunque el número de familias de cópulas multivariadas paramétricas con dependencia flexible es limitado, hay muchas familias paramétricas de cópulas bivariadas. Las vides regulares deben su creciente popularidad al hecho de que aprovechan las cópulas bivariadas y permiten extensiones a dimensiones arbitrarias. La teoría del muestreo y la teoría de la estimación para vides regulares están bien desarrolladas [ 6 ] [ 7 ] y la inferencia de modelos ha dejado el puesto. [ 8 ] [ 9 ] [ 7 ] Las vides regulares han demostrado ser útiles en otros problemas como el muestreo (restringido) de matrices de correlación, [ 10 ] [ 11 ] la construcción de redes bayesianas continuas no paramétricas . [ 12 ] [ 13 ]

Por ejemplo, en finanzas, se ha demostrado que las cópulas de vid modelan eficazmente el riesgo de cola en aplicaciones de optimización de cartera. [ 14 ]

Orígenes históricos

La primera vid regular, avant la lettre, fue introducida por Harry Joe. [ 15 ] El motivo era extender las familias de cópulas de valores extremos bivariadas paramétricas a dimensiones superiores. Con este fin introdujo lo que más tarde se llamaría la D-vid . Joe [ 16 ] estaba interesado en una clase de distribuciones n-variadas con márgenes unidimensionales dados y n ( n − 1) parámetros de dependencia, donde n − 1 parámetros corresponden a márgenes bivariados y los otros corresponden a márgenes bivariados condicionales. En el caso de distribuciones normales multivariadas, los parámetros serían n − 1 correlaciones y ( n − 1)( n − 2)/2 correlaciones parciales , que se observó que eran algebraicamente independientes en (−1,  1).

Una motivación completamente diferente subyace a la primera definición formal de vides en Cooke. [ 17 ] Los análisis de incertidumbre de grandes modelos de riesgo, como los realizados para la Unión Europea y la Comisión Reguladora Nuclear de EE. UU. para accidentes en centrales nucleares, implican cuantificar y propagar la incertidumbre sobre cientos de variables. [ 18 ] [ 19 ] [ 20 ] La información de dependencia para tales estudios se había capturado con árboles de Markov , [ 21 ] que son árboles construidos con nodos como variables aleatorias univariadas y aristas como cópulas bivariadas. Para n variables, hay como máximo n − 1 aristas para las que se puede especificar la dependencia. Las nuevas técnicas de ese momento implicaban obtener distribuciones de incertidumbre en los parámetros del modelo mediante la obtención de las incertidumbres de los expertos sobre otras variables que son predichas por los modelos. Estas distribuciones de incertidumbre se transfieren de nuevo a los parámetros del modelo mediante un proceso conocido como inversión probabilística. [ 8 ] [ 18 ] Las distribuciones resultantes a menudo mostraban una estructura de dependencia que no podía ser capturada como un árbol de Markov.

Los modelos gráficos llamados vides fueron introducidos en 1997 y perfeccionados posteriormente por Roger M. Cooke , Tim Bedford y Dorota Kurowicka. [ 17 ] [ 1 ] [ 8 ] Una característica importante de las vides es que pueden agregar dependencias condicionales entre variables sobre un árbol de Markov que generalmente es demasiado parsimonioso para resumir la dependencia entre variables.

Vides regulares (vides R)

C-vine en 4 variables
D-vine en 4 variables
R-vine en 5 variables

Una vid V sobre n variables es un conjunto anidado de árboles conectados donde las aristas del primer árbol son los nodos del segundo árbol, las aristas del segundo árbol son los nodos del tercer árbol, etc. Una vid regular o R-vid sobre n variables es una vid en la que dos aristas del árbol j se unen mediante una arista del árbol j + 1 solo si estas aristas comparten un nodo común, j = 1, ..., n 2. Los nodos del primer árbol son variables aleatorias univariadas. Las aristas son restricciones o restricciones condicionales que se explican a continuación.

Recordemos que una arista en un árbol es un conjunto no ordenado de dos nodos. Cada arista en una vid está asociada a un conjunto de restricciones , que es el conjunto de variables (nodos en el primer árbol) alcanzables mediante la relación de pertenencia al conjunto. Para cada arista, el conjunto de restricciones es la unión de los conjuntos de restricciones de sus dos miembros, denominados conjuntos de restricciones componentes (para una arista en el primer árbol, los conjuntos de restricciones componentes están vacíos). La restricción asociada a cada arista es ahora la diferencia simétrica de sus conjuntos de restricciones componentes, condicionada a la intersección de dichos conjuntos. Se puede demostrar que, para una vid regular, la diferencia simétrica de los conjuntos de restricciones componentes es siempre un doblete y que cada par de variables aparece exactamente una vez como variable restringida. En otras palabras, todas las restricciones son bivariadas o condicionalmente bivariadas.

El grado de un nodo es el número de aristas que se conectan a él. Las vides regulares más simples tienen la estructura de grados más sencilla; la vide D asigna a cada nodo un grado de 1 o 2, mientras que la vide C asigna el grado máximo a un nodo de cada árbol. Para vides grandes, es más claro dibujar cada árbol por separado.

El número de vides regulares en n variables crece rápidamente en n : hay 2 n 3 maneras de extender una vid regular con una variable adicional, y hay n ( n 1)( n 2)!2 ( n 2)( n 3)/2 /2 vides regulares etiquetadas en n variables [ 22 ] . [ 23 ]

Las restricciones en una vid regular pueden estar asociadas con correlaciones parciales o con cópulas bivariadas condicionales . En el primer caso, hablamos de una vid de correlación parcial , y en el segundo caso, de una cópula de vid .

vides de correlación parcial

Bedford y Cooke [ 1 ] muestran que cualquier asignación de valores en el intervalo abierto (−1,  1) a las aristas en cualquier vid de correlación parcial es consistente, las asignaciones son algebraicamente independientes y existe una relación biunívoca entre todas dichas asignaciones y el conjunto de matrices de correlación. En otras palabras, las vid de correlación parcial proporcionan una parametrización algebraicamente independiente del conjunto de matrices de correlación, cuyos términos tienen una interpretación intuitiva. Además, el determinante de la matriz de correlación es el producto sobre las aristas de (1 ρ 2 ik ; D ( ik ) ) donde ρ ik ; D ( ik ) es la correlación parcial asignada a la arista con variables condicionadas i , k y variables de condicionamiento D ( ik ). Una descomposición similar caracteriza la información mutua , que generaliza el determinante de la matriz de correlación. [ 17 ] Estas características se han utilizado en el muestreo restringido de matrices de correlación, [ 10 ] la construcción de redes bayesianas continuas no paramétricas [ 12 ] [ 13 ] y el abordaje del problema de extender matrices parcialmente especificadas a matrices definidas positivas [ 24 ] . [ 25 ]

Cópulas de vid o construcción de cópulas de pares

Bajo condiciones de diferenciabilidad adecuadas, cualquier densidad multivariada f 1... n sobre n variables, con densidades univariadas f 1 ,..., f n , puede representarse en forma cerrada como un producto de densidades univariadas y densidades de cópula (condicionales) sobre cualquier R-vid V

[ 26 ]

f 1...n = f 1 ...f n Π e∈E( V ) C e 1 ,e 2 | D e ( F e 1 | D e , F e 2 | D e )

donde los bordes e = (e 1 , e 2 ) con conjunto de condicionamiento D e están en el conjunto de bordes E( V ) de cualquier vid regular V . Las densidades de cópula condicional C e 1 ,e 2 | D e en esta representación dependen de las funciones de distribución condicional acumulativa de las variables condicionadas, F e 1 | D e , F e 2 | D e , y, potencialmente, de los valores de las variables de condicionamiento. Cuando las cópulas condicionales no dependen de los valores de las variables de condicionamiento, se habla de la suposición simplificadora de cópulas condicionales constantes. Aunque la mayoría de las aplicaciones invocan esta suposición, se ha comenzado a explorar la libertad de modelado que se obtiene al eliminar esta suposición [ 27 ] [ 28 ] . [ 29 ] Cuando se asignan cópulas gaussianas bivariadas a los bordes de una vid, entonces la densidad multivariada resultante es la densidad gaussiana parametrizada por una vid de correlación parcial en lugar de por una matriz de correlación.

La construcción de cópulas de pares de vid, basada en la mezcla secuencial de distribuciones condicionales, se ha adaptado a variables discretas y a respuestas mixtas discretas/continuas [ 30 ] . [ 31 ] También se han propuesto cópulas factoriales, donde se han añadido variables latentes a la vid (por ejemplo, [ 32 ] ).

Los investigadores de Vine han desarrollado algoritmos para la estimación de máxima verosimilitud y la simulación de cópulas de Vine, encontrando vides truncadas que resumen la dependencia en los datos, enumerando a través de vides, etc. El capítulo 6 de Dependence Modeling with Copulas [ 33 ] resume estos algoritmos en pseudocódigo.

Las cópulas de vid truncadas (introducidas por EC Brechmann en su tesis doctoral) son cópulas de vid que tienen cópulas de independencia en los últimos árboles. De esta manera, las cópulas de vid truncadas codifican en su estructura independencias condicionales. Las vides truncadas son muy útiles porque contienen muchos menos parámetros que las vides regulares. Una pregunta importante es cuál debería ser el árbol en el nivel más alto. Una relación interesante entre las vides truncadas y las cópulas de cerezo se presenta en ( [ 34 ] ). Las representaciones gráficas de cerezo se introdujeron como una alternativa a las representaciones gráficas habituales de las cópulas de vid; además, las independencias condicionales codificadas por el último árbol (primer árbol después del truncamiento) también se destacan aquí ( [ 35 ] ) y en ( [ 36 ] ). La representación de secuencia de cerezo de las cópulas de vid proporciona una nueva forma de ver las cópulas truncadas, basada en la independencia condicional que es causada por el truncamiento.

Estimación de parámetros

Para cópulas de vid paramétricas, con una familia de cópulas bivariadas en cada arista de una vid, existen algoritmos y software disponibles para la estimación de máxima verosimilitud de los parámetros de la cópula, asumiendo que los datos se han transformado en puntuaciones uniformes después de ajustar márgenes univariados. También existen algoritmos disponibles (p. ej., [ 37 ] ) para elegir buenas vides regulares truncadas donde las aristas de árboles de alto nivel se toman como independencia condicional. Estos algoritmos asignan variables con fuerte dependencia o fuerte dependencia condicional a árboles de bajo orden para que los árboles de orden superior tengan débil dependencia condicional o independencia condicional. Por lo tanto, se obtienen vides truncadas parsimoniosas para un gran número de variables. Existe software con una interfaz de usuario en R disponible (p. ej., [ 38 ] ).

Muestreo y condicionalización

Un orden de muestreo para n variables es una secuencia de densidades condicionales en la que la primera densidad es incondicional y las densidades para las demás variables están condicionadas a las variables precedentes en el orden. Un orden de muestreo se deduce de una representación de la densidad en forma de vid regular si cada densidad condicional puede escribirse como un producto de densidades de cópula en la vid y márgenes unidimensionales. [ 23 ]

Un orden de muestreo implícito se genera mediante una secuencia anidada de subcadenas , donde cada subcadena contiene una nueva variable que no está presente en la anterior. Para cualquier cadena regular de n variables, existen 2ⁿ - 1 órdenes de muestreo implícitos. Estos órdenes constituyen un pequeño subconjunto de todos los n! ​​órdenes, pero facilitan enormemente el muestreo. Condicionar una cadena regular a los valores de un subconjunto arbitrario de variables es una operación compleja. Sin embargo, condicionar a una secuencia inicial de un orden de muestreo implícito es trivial: basta con introducir los valores condicionales iniciales y proceder con el muestreo. Actualmente, no existe una teoría general de la condicionalización.

Lecturas adicionales

  • Kurowicka, D.; Joe, H., eds. (2010). Modelado de dependencias: Manual de cópulas de vid . Singapur: World Scientific. pp. 43–84 . ISBN  978-981-4299-87-9.

Referencias

  1. 1 2 3 Bedford, TJ; Cooke, RM (2002). "Vines: un nuevo modelo gráfico para variables aleatorias dependientes". Annals of Statistics . 30 (4): 1031– 1068. CiteSeerX 10.1.1.26.8965 . doi : 10.1214/aos/1031689016 . 
  2. Joe, H. (1997). Modelos multivariados y conceptos de dependencia . Londres: Chapman & Hall.
  3. Nelsen, RB (2006). Introducción a las cópulas, 2.ª ed . Nueva York: Springer.
  4. Kraan, BCP; Cooke, RM (2000). "Procesamiento de juicios de expertos en el modelado de consecuencias de accidentes". Radiation Protection Dosimetry . 90 (3): 311– 315. doi : 10.1093/oxfordjournals.rpd.a033153 .
  5. Ale, BJM; Bellamy, LJ; van der Boom, R.; Cooper, J.; Cooke, RM; Goossens, LHJ; Hale, AR; Kurowicka, D.; Morales, O.; Roelen, ALC; Spouge, J. (2009). "Desarrollo posterior de un modelo causal para la seguridad del transporte aéreo (CATS): Construyendo el núcleo matemático". Reliability Engineering and System Safety Journal . 94 (9): 1433– 1441. doi : 10.1016/j.ress.2009.02.024 .
  6. Kurowicka, D.; Cooke, RM (2007). "Algoritmos de muestreo para generar distribuciones uniformes conjuntas utilizando el método de cópula de vid". Computational Statistics and Data Analysis . 51 (6): 2889– 2906. doi : 10.1016/j.csda.2006.11.043 .
  7. 1 2 Aas, K.; Czado, C. ; Frigessi, A.; Bakken, H. (2009). "Construcciones de cópula de pares de dependencia múltiple". Seguros: Matemáticas y Economía . 44 (2): 182– 198. CiteSeerX 10.1.1.61.3984 . doi : 10.1016/j.insmatheco.2007.02.001 . S2CID 18320750 .  
  8. 1 2 3 Kurowicka, D.; Cooke, RM (2006). Análisis de incertidumbre con modelado de dependencia de alta dimensión . Wiley.
  9. Kurowicka, D.; Cooke, RM; Callies, U. (2007). "Inferencia de Vines". Revista Brasileña de Probabilidad y Estadística .
  10. 1 2 Lewandowski, D.; Kurowicka, D.; Joe, H. (2009). "Generación de matrices de correlación aleatorias basadas en viñas y el método de cebolla extendido" . Journal of Multivariate Analysis . 100 (9): 1989– 2001. doi : 10.1016/j.jmva.2009.04.008 .
  11. Kurowicka, D. (2014). "Generación de matrices de correlación aleatorias basadas en vides y el método de cebolla extendido" . Densidad conjunta de correlaciones en la matriz de correlación con patrones de escasez cordal . 129 (C): 160– 170. doi : 10.1016/j.jmva.2014.04.006 .
  12. 1 2 Hanea, AM (2008). Algoritmos para redes bayesianas no paramétricas (Ph.D.). Instituto de Matemáticas Aplicadas de Delft, Universidad Tecnológica de Delft.
  13. 1 2 Hanea, AM; Kurowicka, D.; Cooke, RM; Ababei, DA (2010). "Minería y visualización de datos ordinales con BBN continuas no paramétricas". Computational Statistics and Data Analysis . 54 (3): 668– 687. doi : 10.1016/j.csda.2008.09.032 .
  14. Low, RKY; Alcock, J.; Faff, R.; Brailsford, T. (2013). "Cópulas de vid canónicas en el contexto de la gestión moderna de carteras: ¿merecen la pena?". Journal of Banking & Finance . 37 (8): 3085– 3099. doi : 10.1016/j.jbankfin.2013.02.036 . S2CID 154138333 . 
  15. Joe, H. (1994). "Distribuciones multivariadas de valores extremos con aplicaciones en datos ambientales". The Canadian Journal of Statistics . 22 (1): 47– 64. doi : 10.2307/3315822 . JSTOR 3315822 . 
  16. Joe, H. (1996), "Familias de distribuciones m-variadas con márgenes dados y m(m−1)/2 parámetros de dependencia bivariada", en Rüschendorf, L.; Schweizer, B.; Taylor, MD (eds.), Distribuciones con marginales fijos y temas relacionados , vol. 28, pp. 120–141  
  17. 1 2 3 Cooke, RM (1997). "Propiedades de Markov y entropía de variables dependientes de árboles y vides". Proc. ASA Section of Bayesian Statistical Science .
  18. 1 2 Goossens, LHJ; Harper, FT; Kraan, BCP; Metivier, H. (2000). "Juicio de expertos para un análisis probabilístico de la incertidumbre de las consecuencias de un accidente". Radiation Protection Dosimetry . 90 (3): 295– 301. doi : 10.1093/oxfordjournals.rpd.a033151 .
  19. Harper, F.; Goossens, LHJ; Cooke, RM; Hora, S.; Young, M.; Pasler-Ssauer, J.; Miller, L.; Kraan, BCP; Lui, C.; McKay, M.; Helton, J.; Jones, A. (1994), Estudio conjunto de incertidumbre de consecuencias de la USNRC CEC: Resumen de objetivos, enfoque, aplicación y resultados para la evaluación de la incertidumbre de dispersión y deposición , vol. III, NUREG/CR-6244, EUR 15755 EN, SAND94-1453 
  20. Guégan, D.; Hassani, BK (2013), "VaRs multivariados para el cálculo del capital de riesgo operativo: un enfoque de estructura de vid", International Journal of Risk Assessment and Management , 17 (2): 148– 170, CiteSeerX 10.1.1.686.4277 , doi : 10.1504/IJRAM.2013.057104 , S2CID 4989901  
  21. Whittaker, J. (1990). Modelos gráficos en estadística multivariante aplicada . Chichester: Wiley.
  22. Morales Napoles, O.; Cooke, RM; Kurowicka, D. (2008), El número de vides y vides regulares en n nodos , vol. Informe técnico, Instituto de Matemáticas Aplicadas de Delft, Universidad Tecnológica de Delft 
  23. 1 2 Cooke, RM; Kurowicka, D.; Wilson, K. (2015). "Muestreo, condicionalización, conteo, fusión, búsqueda de viñas regulares" . Journal of Multivariate Analysis . 138 : 4–18 . doi : 10.1016/j.jmva.2015.02.001 .
  24. Kurowicka, D.; Cooke, RM (2003). "Una parametrización de matrices definidas positivas en términos de vides de correlación parcial" . Álgebra lineal y sus aplicaciones . 372 : 225–251 . doi : 10.1016/s0024-3795(03)00507-x .
  25. Kurowicka, D.; Cooke, RM (2006). "Problema de completación con viñas de correlación parcial". Álgebra lineal y sus aplicaciones . 418 (1): 188– 200. doi : 10.1016/j.laa.2006.01.031 .
  26. Beford, TJ; Cooke, RM (2001). "Descomposición de la densidad de probabilidad para variables aleatorias condicionalmente dependientes modeladas por vides". Annals of Mathematics and Artificial Intelligence . 32 ( 1– 4): 245– 268. doi : 10.1023/A:1016725902970 . S2CID 42550420 . 
  27. Hobaek Haff, I.; Aas, K.; Frigessi, A. (2010). "Sobre la construcción simplificada de cópulas de pares: ¿simplemente útil o demasiado simplista?". Journal of Multivariate Analysis . 101 (5): 1296– 1310. doi : 10.1016/j.jmva.2009.12.001 . hdl : 10852/34736 .
  28. Acar, EF; Genest, C.; Nešlehová, J. (2012). "Más allá de las construcciones simplificadas de cópulas de pares" . Journal of Multivariate Analysis . 110 : 74–90 . doi : 10.1016/j.jmva.2012.02.001 .
  29. Stoeber, J.; Joe, H.; Czado, C. (2013). "Construcciones de cópulas de pares simplificadas, limitaciones y extensiones" . Journal of Multivariate Analysis . 119 : 101–118 . doi : 10.1016/j.jmva.2013.04.014 .
  30. Panagiotelis, A.; Czado, C. ; Joe, H. (2012). "Distribuciones regulares de vid para datos discretos". Journal of the American Statistical Association . 105 (499): 1063– 1072. doi : 10.1080/01621459.2012.682850 . S2CID 123502012 . 
  31. Stoeber, J.; Hong, HG; Czado, C. ; Ghosh, P. (2015). "Comorbilidad de enfermedades crónicas en ancianos: patrones identificados mediante un diseño de cópula para respuestas mixtas". Computational Statistics and Data Analysis . 88 : 28– 39. doi : 10.1016/j.csda.2015.02.001 .
  32. Krupskii, P.; Joe, H. (2013). "Modelos de cópula factorial para datos multivariados". Journal of Multivariate Analysis . 120 : 85–101 . doi : 10.1016/j.jmva.2013.05.001 .
  33. Joe, H. (2014). Modelado de dependencias con cópulas . Chapman Hall. ISBN 978-1-4665-8322-1.
  34. Kovacs, E.; Szantai, T. (2017). "Sobre la conexión entre las cópulas de cerezo y las cópulas R-vid truncadas". Kybernetika . 53 (3): 437– 460. arXiv : 1604.03269 . doi : 10.14736/kyb-2017-3-0437 . S2CID 45343495 . 
  35. Kovacs, E.; Szantai, T. (2012), "Cópulas de vid como medio para la construcción de distribuciones de probabilidad de alta dimensión asociadas a una red de Markov", arXiv : 1105.1697 [ math.ST ]
  36. Kovacs, E.; Szantai, T. (2012). "Hipergrafos en la caracterización de estructuras de cópulas de vid regulares". Actas de la 13.ª Conferencia Internacional sobre Matemáticas y sus Aplicaciones, Timisoara . 2012(a): 335–344 .
  37. Brechmann, EC; Czado, C. ; Aas, K. (2012). "Enredaderas regulares truncadas en altas dimensiones con aplicación a datos financieros". Revista Canadiense de Estadística . 40 (1): 68– 85. CiteSeerX 10.1.1.185.2933 . doi : 10.1002/cjs.10141 . S2CID 2155236 .  
  38. Schepsmeier, U.; Stoeber, J.; Brechmann, EC; Graeler, B. (2014). "Vine Copula: Inferencia estadística de cópulas de vid, paquete R versión 1.3" .
  • Roger M. Cooke
  • "Modelos de cópula de Vine" . Lehrstuhl für Mathematische Statistik .- Software para la estimación y el muestreo de vinos, literatura y avisos de eventos habituales.
  • "Modelos estadísticos multivariados no gaussianos y sus aplicaciones (13w5146)" . Taller. BIRS . Mayo de 2013.
  • "Taller Internacional sobre Dependencia de Alta Dimensión y Cópulas: Teoría, Modelado y Aplicaciones" . CUFE . Enero de 2014. Archivado del original el 9 de abril de 2017.