Articulo de referencia

aproximación de Vecchia

La aproximación de Vecchia es una técnica de aproximación de procesos gaussianos desarrollada originalmente por Aldo Vecchia , estadístico del Servicio Geológico de los Estados ...

La aproximación de Vecchia es una técnica de aproximación de procesos gaussianos desarrollada originalmente por Aldo Vecchia , estadístico del Servicio Geológico de los Estados Unidos . [ 1 ] Es uno de los primeros intentos de utilizar procesos gaussianos en entornos de alta dimensionalidad. Desde entonces, se ha generalizado ampliamente, dando lugar a numerosas aproximaciones contemporáneas.

Intuición

Una distribución de probabilidad conjunta para eventosA,B{\displaystyle A,B}, ydo{\displaystyle C}, denotadoPAG(A,B,do){\displaystyle P(A,B,C)}, puede expresarse como

PAG(A,B,do)=PAG(A)PAG(B|A)PAG(do|A,B){\displaystyle P(A,B,C)=P(A)P(B|A)P(C|A,B)}

La aproximación de Vecchia toma la forma, por ejemplo,

PAG(A,B,do)PAG(A)PAG(B|A)PAG(do|A){\displaystyle P(A,B,C)\approx P(A)P(B|A)P(C|A)}

y es preciso cuando ocurren eventosB{\displaystyle B}ydo{\displaystyle C}son casi condicionalmente independientes dado el conocimiento deA{\displaystyle A}Por supuesto, también se podría haber elegido la aproximación.

PAG(A,B,do)PAG(A)PAG(B|A)PAG(do|B){\displaystyle P(A,B,C)\approx P(A)P(B|A)P(C|B)}

y por lo tanto, el uso de la aproximación requiere cierto conocimiento de qué eventos son casi condicionalmente independientes dados otros. Además, podríamos haber elegido un orden diferente, por ejemplo

PAG(A,B,do)PAG(do)PAG(do|A)PAG(B|A).{\displaystyle P(A,B,C)\approx P(C)P(C|A)P(B|A).}

Afortunadamente, en muchos casos existen buenas heurísticas que ayudan a tomar decisiones sobre cómo construir la aproximación.

Más técnicamente, las versiones generales de la aproximación conducen a un factor de Cholesky disperso de la matriz de precisión. El uso de la factorización de Cholesky estándar produce entradas que pueden interpretarse [ 2 ] como correlaciones condicionales con ceros que indican que no hay dependencia (ya que el modelo es gaussiano). Estas relaciones de independencia pueden expresarse alternativamente utilizando modelos gráficos y existen teoremas que vinculan la estructura del grafo y el orden de los vértices con ceros en el factor de Cholesky. En particular, se sabe [ 3 ] que las independencias que están codificadas en un grafo moral conducen a factores de Cholesky de la matriz de precisión que no tienen relleno .

Descripción formal

El problema

Dejarincógnita{\displaystyle x}ser un proceso gaussiano indexado porS{\displaystyle {\mathcal {S}}}con función mediaμ{\displaystyle \mu }y función de covarianzaK{\displaystyle K}. Supongamos queS={s1,,snorte}S{\displaystyle S=\{s_{1},\dots ,s_{n}\}\subset {\mathcal {S}}}es un subconjunto finito deS{\displaystyle {\mathcal {S}}}yincógnita=(incógnita1,,incógnitanorte){\displaystyle \mathbf {x} =(x_{1},\dots ,x_{n})}es un vector de valores deincógnita{\displaystyle x}evaluado enS{\displaystyle S}, es decirincógnitai=incógnita(si){\displaystyle x_{i}=x(s_{i})}parai=1,,norte{\displaystyle i=1,\dots ,n}Supongamos además que se observay=(y1,,ynorte){\displaystyle \mathbf {y} =(y_{1},\dots,y_{n})}dóndeyi=incógnitai+εi{\displaystyle y_{i}=x_{i}+\varepsilon _{i}}conεiiidnorte(0,σ2){\displaystyle \varepsilon _{i}{\overset {\text{iid}}{\sim }}{\mathcal {N}}(0,\sigma ^{2})}En este contexto, las dos tareas de inferencia más comunes incluyen evaluar la probabilidad.

L(y)=F(y,incógnita)dincógnita,{\displaystyle {\mathcal {L}}(\mathbf {y} )=\int f(\mathbf {y} ,\mathbf {x} )\,d\mathbf {x} ,}

o hacer predicciones de valores deincógnita{\displaystyle x}parasS{\displaystyle s^{*}\in {\mathcal {S}}}ysS{\displaystyle s\not \in S}, es decir, calculando

F(incógnita(s)y1,,ynorte).{\displaystyle f(x(s^{*})\mid y_{1},\dots ,y_{n}).}

Fórmula original

El método original de Vecchia comienza con la observación de que la densidad conjunta de observacionesF(y)=(y1,,ynorte){\displaystyle f(\mathbf {y} )=\left(y_{1},\dots ,y_{n}\right)}puede escribirse como un producto de distribuciones condicionales

F(y)=F(y1)i=2norteF(yiyi1,,y1).{\displaystyle f(\mathbf {y} )=f(y_{1})\prod _{i=2}^{n}f(y_{i}\mid y_{i-1},\dots ,y_{1}).}

La aproximación de Vecchia supone en cambio que para algúnknorte{\displaystyle k\ll n}

F^(y)=F(y1)i=2norteF(yiyi1,,ymáximo(ik,1)).{\displaystyle {\hat {f}}(\mathbf {y} )=f(y_{1})\prod _{i=2}^{n}f(y_{i}\mid y_{i-1},\dots ,y_{\max(i-k,1)}).}

Vecchia también sugirió que la aproximación anterior se aplicara a observaciones que se reordenan lexicográficamente utilizando sus coordenadas espaciales. Si bien su método simple tiene muchas debilidades, redujo la complejidad computacional aO(nortek3){\displaystyle {\mathcal {O}}(nk^{3})}Muchas de sus deficiencias fueron subsanadas mediante las generalizaciones posteriores.

Formulación general

Aunque conceptualmente simple, la suposición de la aproximación de Vecchia suele ser bastante restrictiva e imprecisa. [ 4 ] Esto inspiró importantes generalizaciones y mejoras introducidas en la versión básica a lo largo de los años: la inclusión de variables latentes, un condicionamiento más sofisticado y un mejor ordenamiento. Diferentes casos especiales de la aproximación general de Vecchia pueden describirse en función de cómo se seleccionan estos tres elementos. [ 5 ]

variables latentes

Para describir las extensiones del método Vecchia en su forma más general, definazi=(incógnitai,yi){\displaystyle z_{i}=(x_{i},y_{i})}y observe que paraz=(z1,,znorte){\displaystyle \mathbf {z} =(z_{1},\dots ,z_{n})}sostiene que, como en la sección anterior

F(z)=F(incógnita1,y1)(i=2norteF(incógnitaiz1:i1))(i=2norteF(yiincógnitai)){\displaystyle f(\mathbf {z} )=f(x_{1},y_{1})\left(\prod _{i=2}^{n}f(x_{i}\mid z_{1:i-1})\right)\left(\prod _{i=2}^{n}f(y_{i}\mid x_{i})\right)}

porque dadoincógnitai{\displaystyle x_{i}}todas las demás variables son independientes deyi{\displaystyle y_{i}}.

Pedidos

Se ha señalado ampliamente que el ordenamiento lexicográfico original basado en coordenadas cuandoS{\displaystyle {\mathcal {S}}}es bidimensional produce malos resultados. [ 6 ] Más recientemente se han propuesto otros ordenamientos, algunos de los cuales aseguran que los puntos se ordenen de forma cuasi aleatoria. Altamente escalables, se ha demostrado que también mejoran drásticamente la precisión. [ 4 ]

Acondicionamiento

De forma similar a la versión básica descrita anteriormente, para un ordenamiento dado se puede definir una aproximación general de Vecchia como

F^(z)=F(incógnita1,y1)(i=2norteF(incógnitaizq(i)))(i=2norteF(yiincógnitai)),{\displaystyle {\hat {f}}(\mathbf {z} )=f(x_{1},y_{1})\left(\prod _{i=2}^{n}f(x_{i}\mid z_{q(i)})\right)\left(\prod _{i=2}^{n}f(y_{i}\mid x_{i})\right),}

dóndeq(i){1,,i1}{\displaystyle q(i)\subset \left\{1,\dots ,i-1\right\}}. Desdeyiincógnitai,yiincógnitai{\displaystyle y_{i}\perp x_{-i},y_{-i}\mid x_{i}}resulta queF(incógnitaizq(i))=F(incógnitaiincógnitaq(i),yq(i))=F(incógnitaiincógnitaq(i)){\displaystyle f(x_{i}\mid z_{q(i)})=f(x_{i}\mid x_{q}(i),y_{q}(i))=f(x_{i}\mid x_{q}(i))}ya que sugirió que los términosF(incógnitaizq(i)){\displaystyle f(x_{i}\mid z_{q(i)})}ser reemplazado porF(incógnitaiincógnitaq(i)){\displaystyle f(x_{i}\mid x_{q(i)})}Sin embargo, resulta que a veces condicionar algunas de las observacioneszi{\displaystyle z_{i}}aumenta la escasez del factor de Cholesky de la matriz de precisión de(incógnita,y){\displaystyle (\mathbf {x} ,\mathbf {y} )}Por lo tanto, uno podría considerar en cambio conjuntosqy(i){\displaystyle q_{y}(i)}yqincógnita(i){\displaystyle q_{x}(i)}de tal manera queq(i)=qy(i)qincógnita(i){\displaystyle q(i)=q_{y}(i)\cup q_{x}(i)}y expresarF^{\displaystyle {\hat {f}}}como

F^(z)=F(incógnita1,y1)(i=2norteF(incógnitaiincógnitaqincógnita(i),yqy(i)))(i=2norteF(yiincógnitai)).{\displaystyle {\hat {f}}(\mathbf {z} )=f(x_{1},y_{1})\left(\prod _{i=2}^{n}f(x_{i}\mid x_{q_{x}(i)},y_{q_{y}(i)})\right)\left(\prod _{i=2}^{n}f(y_{i}\mid x_{i})\right).}

Múltiples métodos de elecciónqy(i){\displaystyle q_{y}(i)}yqincógnita(i){\displaystyle q_{x}(i)}Se han propuesto, en particular el proceso gaussiano del vecino más cercano (NNGP), [ 7 ] el proceso gaussiano mallado [ 8 ] y los enfoques de aproximación de multirresolución (MRA) utilizandoq(i)=qincógnita(i){\displaystyle q(i)=q_{x}(i)}, Vecchia estándar usandoq(i)=qy(i){\displaystyle q(i)=q_{y}(i)}y Vecchia General Escasa donde ambosqy(i){\displaystyle q_{y}(i)}yqincógnita(i){\displaystyle q_{x}(i)}no están vacíos. [ 5 ]

Software

Se han desarrollado varios paquetes que implementan algunas variantes de la aproximación de Vecchia.

  • GPvecchia es un paquete de R disponible a través de CRAN que implementa la mayoría de las versiones de la aproximación de Vecchia.
  • GpGp es un paquete de R disponible a través de CRAN que implementa un método de ordenación escalable para problemas espaciales que mejora enormemente la precisión.
  • spNNGP es un paquete de R disponible a través de CRAN que implementa la aproximación latente de Vecchia.
  • pyMRA es un paquete de Python disponible a través de pyPI que implementa la aproximación multirresolución, un caso especial del método general de Vecchia utilizado en modelos dinámicos de espacio de estados.
  • meshed es un paquete de R disponible a través de CRAN que implementa modelos de regresión multivariante espaciales o espaciotemporales bayesianos basados ​​en un proceso gaussiano mallado latente (MGP) que utiliza aproximaciones de Vecchia en dominios particionados.
  • GPBoost es una biblioteca de software en C++ con paquetes de alto nivel para Python y R disponibles en PyPI y CRAN, respectivamente, que implementa aproximaciones de Vecchia para procesos gaussianos para probabilidades gaussianas y no gaussianas y múltiples funciones de covarianza, incluidas las espaciotemporales y las de determinación automática de relevancia (ARD).
  • Vecchia.jl es una implementación nativa de Julia altamente extensible. Permite ajustar fácilmente kernels arbitrarios proporcionados por el usuario utilizando información de gradiente y hessiano con Automatic_differentiation , proporcionar métricas de distancia arbitrarias para el diseño de conjuntos de condicionamiento y ofrecer fácilmente optimizadores de alto rendimiento como backend para la estimación.

Notas

  1. Vecchia, AV (1988). "Estimación e identificación de modelos para procesos espaciales continuos" . Journal of the Royal Statistical Society, Serie B (Metodológica) . 50 (2): 297–312 . doi : 10.1111/j.2517-6161.1988.tb01729.x .
  2. Pourahmadi, M. (2007). "Descomposiciones de Cholesky y estimación de una matriz de covarianza: ortogonalidad de los parámetros de correlación de varianza". Biometrika . 94 (4): 1006– 1013. doi : 10.1093/biomet/asm073 . ISSN 0006-3444 . 
  3. Khare, Kshitij; Rajaratnam, Bala (2011). "Distribuciones de Wishart para modelos gráficos de covarianza descomponibles" . The Annals of Statistics . 39 (1): 514– 555. arXiv : 1103.1768 . doi : 10.1214/10-AOS841 . ISSN 0090-5364 . 
  4. 1 2 Guinness, Joseph (2018). " Métodos de permutación y agrupación para afinar las aproximaciones de procesos gaussianos" . Technometrics . 60 (4): 415– 429. doi : 10.1080/00401706.2018.1437476 . ISSN 0040-1706 . PMC 6707751. PMID 31447491 .   
  5. 1 2 Katzfuss, Matthias; Guinness, Joseph (2021). "Un marco general para las aproximaciones de Vecchia de procesos gaussianos". Statistical Science . 36 . arXiv : 1708.06302 . doi : 10.1214/19-STS755 . S2CID 88522976 . 
  6. Sudipto Banerjee; Bradley P. Carlin; Alan E. Gelfand (12 de septiembre de 2014). Modelado y análisis jerárquico de datos espaciales, segunda edición . CRC Press. ISBN 978-1-4398-1917-3.
  7. Datta, Abhirup; Banerjee, Sudipto; Finley, Andrew; Gelfand, Alan (2016). "Modelos jerárquicos de procesos gaussianos del vecino más cercano para grandes datos espaciales" . Journal of the American Statistical Association . 111 (514): 800– 812. doi : 10.1080/01621459.2015.1044091 . PMC 5927603. PMID 29720777 .  
  8. Peruzzi, Michele; Banerjee, Sudipto; Finley, Andrew (2020). "Modelado geoestadístico bayesiano altamente escalable mediante procesos gaussianos mallados en dominios particionados" . Journal of the American Statistical Association . 117 (538): 969– 982. arXiv : 2003.11208 . doi : 10.1080/01621459.2020.1833889 . PMC 9354857. PMID 35935897 .