Articulo de referencia

cuadratura bayesiana

Cuadratura bayesiana con un proceso gaussiano condicionado a norte = 0 , 3 , y 8 {\displaystyle n=0,3,\ {\text{y}}\ 8} evaluaciones del integrando (mostrado en negro). Las á...

Cuadratura bayesiana con un proceso gaussiano condicionado anorte=0,3, y 8{\displaystyle n=0,3,\ {\text{y}}\ 8}evaluaciones del integrando (mostrado en negro). Las áreas sombreadas en la columna izquierda ilustran las desviaciones estándar marginales. La figura de la derecha muestra la distribución a priori (norte=0{\displaystyle n=0}) y posterior (norte=3,8{\displaystyle n=3,8}) Distribución gaussiana sobre el valor de la integral, así como la solución verdadera.

La cuadratura bayesiana [ 1 ] [ 2 ] [ 3 ] [ 4 ] [ 5 ] es un método para aproximar problemas de integración intratables. Pertenece a la clase de métodos numéricos probabilísticos . La cuadratura bayesiana considera la integración numérica como una tarea de inferencia bayesiana , donde se utilizan evaluaciones de funciones para estimar la integral de dicha función. Por esta razón, a veces también se la denomina "integración numérica probabilística bayesiana" o "integración numérica bayesiana". El nombre "cubatura bayesiana" también se utiliza a veces cuando el integrando es multidimensional. Una ventaja potencial de este enfoque es que proporciona una cuantificación de la incertidumbre probabilística para el valor de la integral.

cuadratura bayesiana

Integración numérica

DejarF:incógnitaR{\displaystyle f:{\mathcal {X}}\rightarrow \mathbb {R} }ser una función definida en un dominioincógnita{\displaystyle {\mathcal {X}}}(donde normalmenteincógnitaRd{\displaystyle {\mathcal {X}}\subseteq \mathbb {R} ^{d}}). En la integración numérica , evaluaciones de funcionesF(incógnita1),,F(incógnitanorte){\displaystyle f(x_{1}),\ldots ,f(x_{n})}en distintos lugaresincógnita1,,incógnitanorte{\displaystyle x_{1},\ldots ,x_{n}}enincógnita{\displaystyle {\mathcal {X}}}se utilizan para estimar la integral deF{\displaystyle f}contra una medidaν{\displaystyle \nu }: es decirν[F]:=incógnitaF(incógnita)ν(dincógnita).{\displaystyle \textstyle \nu [f]:=\int _{\mathcal {X}}f(x)\nu (\mathrm {d} x).} Pesos dadosw1,,wnorteR{\displaystyle w_{1},\ldots ,w_{n}\in \mathbb {R} }, una regla de cuadratura es un estimador deν[F]{\displaystyle \nu [f]}de la forma ν^[F]:=i=1nortewiF(incógnitai).\textstyle {\hat {\nu }}[f]:=\sum _{i=1}^{n}w_{i}f(x_{i}).

La cuadratura bayesiana consiste en especificar una distribución previa sobreF{\displaystyle f}, condicionando esto a priori enF(incógnita1),,F(incógnitanorte){\displaystyle f(x_{1}),\ldots ,f(x_{n})}para obtener una distribución posteriorF{\displaystyle f}, luego calculando la distribución posterior implícita enν[F]{\displaystyle \nu [f]}. El nombre "cuadratura" proviene del hecho de que la media posterior enν[F]{\displaystyle \nu [f]}a veces adopta la forma de una regla de cuadratura cuyos pesos están determinados por la elección de la distribución a priori.

Cuadratura bayesiana con procesos gaussianos

La elección más común de distribución previa paraF{\displaystyle f}es un proceso gaussiano ya que esto permite la inferencia conjugada para obtener una distribución posterior de forma cerrada sobreν[F]{\displaystyle \nu [f]}Supongamos que tenemos un proceso gaussiano con función media previametro:incógnitaR{\displaystyle m:{\mathcal {X}}\rightarrow \mathbb {R} }y función de covarianza (o función kernel)k:incógnita×incógnitaR{\displaystyle k:{\mathcal {X}}\times {\mathcal {X}}\rightarrow \mathbb {R} }. Luego, la distribución posterior enF{\displaystyle f}es un proceso gaussiano con mediametronorte:incógnitaR{\displaystyle m_{n}:{\mathcal {X}}\rightarrow \mathbb {R} }y núcleoknorte:incógnita×incógnitaR{\displaystyle k_{n}:{\mathcal {X}}\times {\mathcal {X}}\rightarrow \mathbb {R} }dado por: metronorte(incógnita)=metro(incógnita)+k(incógnita,incógnita)k(incógnita,incógnita)1F(incógnita)yknorte(incógnita,y)=k(incógnita,y)k(incógnita,incógnita)k(incógnita,incógnita)1k(incógnita,y).{\displaystyle m_{n}(x)=m(x)+k(x,X)k(X,X)^{-1}f(X)\qquad {\text{y}}\qquad k_{n}(x,y)=k(x,y)-k(x,X)k(X,X)^{-1}k(X,y).} dónde(k(incógnita,incógnita))ij=k(incógnitai,incógnitaj){\displaystyle (k(X,X))_{ij}=k(x_{i},x_{j})},(F(incógnita))i=F(incógnitai){\displaystyle (f(X))_{i}=f(x_{i})},(k(,incógnita))i=k(,incógnitai){\displaystyle (k(\cdot ,X))_{i}=k(\cdot ,x_{i})}y(k(incógnita,))i=k(incógnitai,){\displaystyle (k(X,\cdot ))_{i}=k(x_{i},\cdot )}.

Además, la distribución posterior enν[F]{\displaystyle \nu [f]}es una distribución gaussiana univariada con mediami[ν[F]]{\displaystyle \mathbb {E} [\nu [f]]}y varianzaV[ν[F]]{\displaystyle \mathbb {V} [\nu [f]]}dado por mi[ν[F]]=ν[metro]+ν[k(,incógnita)]k(incógnita,incógnita)1F(incógnita)yV[ν[F]]=νν[k]ν[k(,incógnita)]k(incógnita,incógnita)1ν[k(incógnita,)].{\displaystyle \mathbb {E} [\nu [f]]=\nu [m]+\nu [k(\cdot ,X)]k(X,X)^{-1}f(X)\qquad {\text{y}}\qquad \mathbb {V} [\nu [f]]=\nu \nu [k]-\nu [k(\cdot ,X)]k(X,X)^{-1}\nu [k(X,\cdot )].} La funciónν[k(,incógnita)]=incógnitak(y,incógnita)ν(dy){\displaystyle \textstyle \nu [k(\cdot ,x)]=\int _{\mathcal {X}}k(y,x)\nu (\mathrm {d} y)} es la incrustación media del núcleo dek{\displaystyle k}yνν[k]=incógnitak(incógnita,y)ν(dincógnita)ν(dy){\displaystyle \textstyle \nu \nu [k]=\int _{\mathcal {X}}k(x,y)\nu (dx)\nu (\mathrm {d} y)}denota la integral dek{\displaystyle k}con respecto a ambas entradas. En particular, observe que la media posterior es una regla de cuadratura con pesoswi=(ν[k(,incógnita)]k(incógnita,incógnita)1)i.{\displaystyle \textstyle w_{i}=(\nu [k(\cdot ,X)]k(X,X)^{-1})_{i}.} y la varianza posterior proporciona una cuantificación de la incertidumbre del usuario sobre el valor deν[F]{\displaystyle \nu [f]}.

En problemas de integración más complejos, donde no se puede confiar en la distribución previa como una representación significativa de la incertidumbre epistémica, es necesario utilizar los datos.F(incógnita1),,F(incógnitanorte){\displaystyle f(x_{1}),\ldots ,f(x_{n})}para establecer los hiperparámetros del kernel usando, por ejemplo, la estimación de máxima verosimilitud . La estimación de los hiperparámetros del kernel introduce adaptabilidad en la cuadratura bayesiana. [ 6 ] [ 7 ]

Ejemplo

Ilustración de la cuadratura bayesiana para la estimaciónν[F]=01F(incógnita)dincógnita{\displaystyle \textstyle \nu [f]=\int _{0}^{1}f(x)\,\mathrm {d} x}dóndeF(incógnita)=(1+incógnita2)pecado(5πincógnita)+8/5{\displaystyle \textstyle f(x)=(1+x^{2})\sin(5\pi x)+8/5}La distribución posterior (azul) se concentra en la integral verdadera cuando se obtienen más datos (los puntos rojos) del integrando.F{\displaystyle f}.

Consideremos la estimación de la integral. ν[F]=01F(incógnita)dincógnita1,79 de la función F(incógnita)=(1+incógnita2)pecado(5πincógnita)+85{\displaystyle \nu [f]=\int _{0}^{1}f(x)\,\mathrm {d} x\approx 1.79\quad {\text{ of the function }}\quad f(x)=(1+x^{2})\sin(5\pi x)+{\frac {8}{5}}} utilizando una regla de cuadratura bayesiana basada en un proceso gaussiano de media cero con la función de covarianza de suavidad de Matérn3/2{\displaystyle 3/2}y longitud de correlaciónρ=1/5{\displaystyle \rho =1/5}Esta función de covarianza es k(incógnita,y)=(1+3|incógnitay|/ρ)exp(3|incógnitay|/ρ).{\displaystyle \textstyle k(x,y)=(1+{\sqrt {3}}\,|x-y|/\rho )\exp(\!-{\sqrt {3}}\,|x-y|/\rho ).} Es sencillo (aunque tedioso) calcular que ν[k(,incógnita)]=01k(y,incógnita)dy=4ρ313exp(3(incógnita1)ρ)(3+23ρ3incógnita)13exp(3incógnitaρ)(3incógnita+23ρ){\displaystyle \nu [k(\cdot ,x)]=\int _{0}^{1}k(y,x)\,\mathrm {d} y={\frac {4\rho }{\sqrt {3}}}-{\frac {1}{3}}\exp {\bigg (}{\frac {{\sqrt {3}}(x-1)}{\rho }}{\bigg )}{\big (}3+2{\sqrt {3}}\,\rho -3x{\big )}-{\frac {1}{3}}\exp {\bigg (}-{\frac {{\sqrt {3}}\,x}{\rho }}{\bigg )}{\big (}3x+2{\sqrt {3}}\,\rho {\big )}}νν[k]=0101k(incógnita,y)dincógnitady=2ρ3[233ρ+exp(3ρ)(3+3ρ)].{\displaystyle \nu \nu [k]=\int _{0}^{1}\int _{0}^{1}k(x,y)\,\mathrm {d} x\,\mathrm {d} y={\frac {2\rho }{3}}{\Bigg [}2{\sqrt {3}}-3\rho +\exp {\bigg (}\!-{\frac {\sqrt {3}}{\rho }}{\bigg )}{\big (}{\sqrt {3}}+3\rho {\big )}{\Bigg ]}.} Convergencia de la estimación puntual de cuadratura bayesianami[ν[F]]{\displaystyle \mathbb {E} [\nu [f]]}y concentración de la masa posterior, cuantificada porV[ν[F]]{\displaystyle \mathbb {V} [\nu [f]]}, alrededor de la verdadera integralν[F]{\displaystyle \nu [f]}comoF{\displaystyle f}La evaluación se realiza en cada vez más puntos, como se muestra en la animación adjunta.

Ventajas y desventajas

Dado que la cuadratura bayesiana es un ejemplo de métodos numéricos probabilísticos , hereda ciertas ventajas en comparación con los métodos de integración numérica tradicionales :

  • Permite cuantificar la incertidumbre y propagarla a través de todos los cálculos subsiguientes para modelar explícitamente el impacto del error numérico . [ 8 ]
  • Proporciona una forma basada en principios para incorporar el conocimiento previo mediante una elección juiciosa de distribuciones previas paraF{\displaystyle f}, que puede ser más sofisticado en comparación con el proceso gaussiano estándar que acabamos de describir. [ 7 ]
  • Permite un uso más eficiente de la información, por ejemplo, inferir conjuntamente múltiples cantidades de interés relacionadas [ 9 ] o utilizar el aprendizaje activo para reducir el número de puntos necesarios. [ 10 ]

A pesar de estas ventajas, los métodos de cuadratura bayesiana presentan las siguientes limitaciones:

  • Aunque el paradigma bayesiano permite un tratamiento basado en principios de la cuantificación de la incertidumbre, la inferencia posterior sobreν[F]{\displaystyle \nu [f]}no siempre es manejable, por lo que requiere una estimación de segundo nivel. Por ejemplo, para la cuadratura bayesiana con procesos gaussianos, la incrustación de la media del núcleoν[k(,incógnita)]{\displaystyle \nu [k(\cdot ,x)]}No tiene una expresión de forma cerrada para un núcleo general.k{\displaystyle k}y medirν{\displaystyle \nu }.
  • El coste computacional de los métodos de cuadratura bayesiana basados ​​en procesos gaussianos es en generalO(norte3){\displaystyle {\mathcal {O}}(n^{3})}debido al costo de la inversiónnorte×norte{\displaystyle n\times n}matrices, que pueden dificultar su aplicación a problemas a gran escala.

Diseño algorítmico

Distribuciones previas

El uso previo más común paraF{\displaystyle f}es una distribución a priori de proceso gaussiano. Esto se debe principalmente a la ventaja que proporciona la conjugación gaussiana y al hecho de que los procesos gaussianos pueden codificar una amplia gama de conocimiento previo, incluyendo suavidad, periodicidad y escasez, a través de una cuidadosa elección de la covarianza a priori. Sin embargo, también se han propuesto otras distribuciones a priori. Esto incluye procesos gaussianos de múltiples salidas , [ 9 ] que son particularmente útiles cuando se abordan múltiples tareas de integración numérica relacionadas de forma simultánea o secuencial, y distribuciones a priori basadas en árboles, como los árboles de regresión aditiva bayesiana, [ 10 ] que son muy adecuados para discontinuos.F{\displaystyle f}Además, también se han propuesto procesos de Dirichlet a priori para la medida de integración.ν{\displaystyle \nu }. [ 11 ]

Selección de puntos

Los puntosincógnita1,,incógnitanorte{\displaystyle x_{1},\ldots ,x_{n}}se consideran dados o pueden seleccionarse de manera que se asegure la posterioridadν[F]{\displaystyle \nu [f]}se concentra a un ritmo más rápido. Un enfoque consiste en utilizar conjuntos de puntos de otras reglas de cuadratura. Por ejemplo, tomar realizaciones independientes e idénticamente distribuidas deν{\displaystyle \nu }recupera un enfoque bayesiano para Monte Carlo , [ 3 ] mientras que el uso de ciertos conjuntos de puntos deterministas, como secuencias de baja discrepancia o retículos, recupera una alternativa bayesiana a cuasi-Monte Carlo . [ 4 ] [ 12 ] Por supuesto, también es posible utilizar conjuntos de puntos diseñados específicamente para la cuadratura bayesiana; véase, por ejemplo, el trabajo de [ 13 ] que explotó las simetrías en los conjuntos de puntos para obtener estimadores de cuadratura bayesiana escalables. Alternativamente, los puntos también pueden seleccionarse de forma adaptativa siguiendo principios del aprendizaje activo y el diseño experimental bayesiano para minimizar directamente la incertidumbre posterior, [ 14 ] [ 15 ] incluso para procesos gaussianos de múltiples salidas. [ 16 ]

Media del núcleo y error inicial

Uno de los desafíos al implementar la cuadratura bayesiana es la necesidad de evaluar la funciónν[k(,incógnita)]{\displaystyle \nu [k(\cdot ,x)]}y la constanteνν[k]{\displaystyle \nu \nu [k]}El primero se denomina comúnmente media del núcleo y es una magnitud clave para el cálculo de distancias basadas en el núcleo, como la discrepancia media máxima. El segundo se denomina comúnmente error inicial, ya que proporciona un límite superior para el error de integración antes de que se observen los valores de la función. Desafortunadamente, la media del núcleo y el error inicial solo se pueden calcular para un número reducido de (k,ν){\displaystyle (k,\nu )}pares; véase, por ejemplo, la Tabla 1 en [ 4 ]

Teoría

Se han derivado varias garantías teóricas para la cuadratura bayesiana. Estas generalmente requieren propiedades de suavidad de Sobolev del integrando, [ 4 ] [ 17 ] [ 18 ] aunque trabajos recientes también se extienden a integrandos en el espacio de Hilbert del núcleo reproductor del núcleo gaussiano. [ 19 ] La mayoría de los resultados se aplican al caso de Monte Carlo o conjuntos de puntos de cuadrícula deterministas, pero algunos resultados también se extienden a diseños adaptativos. [ 20 ] [ 21 ]

Software

  • ProbNum : Métodos numéricos probabilísticos en Python, incluyendo una implementación de cuadratura bayesiana.
  • Emukit : Emulación y toma de decisiones en condiciones de incertidumbre en Python.
  • QMCPy : Cuadratura bayesiana con conjuntos de puntos QMC en Python.

Referencias

  1. Diaconis, P. (1988). «Análisis numérico bayesiano». Teoría de la decisión estadística y temas relacionados IV . págs. 163–175 . doi : 10.1007/978-1-4613-8768-8_20 (inactivo el 1 de julio de 2025). ISBN  978-1-4613-8770-1.{{cite book}}: CS1 maint: DOI inactivo desde julio de 2025 ( enlace )
  2. O'Hagan, A. (2002). "Cuadradura de Bayes-Hermite". Journal of Statistical Planning and Inference (29): 245– 260.
  3. 1 2 Rasmussen, C.; Ghahramani, Z. (2002). "Bayesian Monte Carlo". Neural Information Processing Systems : 489– 496.
  4. 1 2 3 4 Briol, F.-X.; Oates, CJ; Girolami, M.; Osborne, MA; Sejdinovic, D. (2019). "Integración probabilística: ¿Un papel en la computación estadística? (con discusión y réplica)". Statistical Science . 34 (1): 1– 22.
  5. Hennig, P.; Osborne, MA; Kersting, HP (2022). Probabilistic Numerics (PDF) . Cambridge University Press. pp. 63–122 . ISBN  978-1107163447.
  6. Jagadeeswaran, R.; Hickernell, Fred J. (10 de septiembre de 2019). "Cuadrícula bayesiana automática rápida mediante muestreo reticular" . Statistics and Computing . 29 (6): 1215– 1229. arXiv : 1809.09803 . doi : 10.1007/s11222-019-09895-9 . ISSN 0960-3174 . S2CID 119709309 .  
  7. 1 2 Fisher, Matthew; Oates, Chris; Powell, Catherine; Teckentrup, Aretha (2020-06-03). "Un método de cubatura bayesiana localmente adaptativo" . Conferencia internacional sobre inteligencia artificial y estadística . PMLR: 1265–1275 . arXiv : 1910.02995 .
  8. Cockayne, Jon; Oates, Chris; Sullivan, Tim; Girolami, Mark (2017). "Métodos numéricos probabilísticos para problemas inversos bayesianos con restricciones de EDP" . Métodos de inferencia bayesiana y entropía máxima en ciencia e ingeniería . AIP Conference Proceedings. 1853 (1). Autor(es): 060001. arXiv : 1701.04006 . Bibcode : 2017AIPC.1853f0001C . doi : 10.1063/1.4985359 . hdl : 10044/1/66123 . S2CID 17349210 . 
  9. 1 2 Xi, X.; Briol, F.-X.; Girolami, M. (2018). "Cuadradura bayesiana para integrales relacionadas múltiples". Conferencia Internacional sobre Aprendizaje Automático : 8533–8564 . arXiv : 1801.04153 .
  10. 1 2 Zhu, H.; Liu, X.; Kang, R.; Shen, Z.; Flaxman, S.; Briol, F.-X. (2020). "Integración numérica probabilística bayesiana con modelos basados ​​en árboles". Neural Information Processing Systems : 5837–5849 . arXiv : 2006.05371 .
  11. Oates, CJ; Niederer, S.; Lee, A.; Briol, F.-X.; Girolami, M. (2017). "Modelos probabilísticos para el error de integración en la evaluación de modelos cardíacos funcionales". Neural Information Processing Systems : 110–118 . arXiv : 1606.06841 .
  12. Jagadeeswaran, R.; Hickernell, FJ (2019). "Cuadrícula bayesiana automática rápida mediante muestreo reticular". Statistics and Computing . 29 (6): 1215– 1229. arXiv : 1809.09803 . doi : 10.1007/s11222-019-09895-9 . S2CID 119709309 . 
  13. ^ Karvonen, T.; Särkkä, S. (2018). "Cuadratura del kernel totalmente simétrica" . Revista SIAM de Computación Científica . 40 (2): 697– 720. arXiv : 1703.06359 . Código Bib : 2018SJSC...40A.697K . doi : 10.1137/17M1121779 . S2CID 9707762 . 
  14. Gunter, T.; Garnett, R.; Osborne, MA; Hennig, P.; Roberts, S. (2014). "Muestreo para inferencia en modelos probabilísticos con cuadratura bayesiana rápida". Neural Information Processing Systems : 2789–2797 . arXiv : 1411.0439 . doi : 10.1007/s11222-019-09895-9 .
  15. Briol, F.-X.; Oates, CJ; Girolami, M.; Osborne, MA (2015). "Cuadradura bayesiana de Frank-Wolfe: Integración probabilística con garantías teóricas". Neural Information Processing Systems : 1162–1170 . arXiv : 1506.02681 .
  16. Gessner, A.; Gonzalez, J.; Mahsereci, M. (2019). "Cuadradura bayesiana activa de múltiples fuentes de información". Incertidumbre en Inteligencia Artificial . arXiv : 1903.11331 . doi : 10.1063/1.4985359 .
  17. Kanagawa, M.; Sriperumbudur, BK; Fukumizu, K. (2020). "Análisis de convergencia de reglas de cuadratura basadas en núcleos deterministas en entornos mal especificados" . Foundations of Computational Mathematics . 20 : 155–194 . arXiv : 1709.00147 . doi : 10.1007/s10208-018-09407-7 . S2CID 11717907 . 
  18. Wynne, G.; Briol, F.-X.; Girolami, M. (2020). "Garantías de convergencia para medias de procesos gaussianos con verosimilitudes y suavidad mal especificadas". Journal of Machine Learning Research . 22 (123): 1– 40. arXiv : 2001.10818 .
  19. Karvonen, T.; Oates, CJ; Girolami, M. (2021). "Integración en espacios de Hilbert de núcleos reproductores de núcleos gaussianos" . Mathematics of Computation . 90 (331): 2209– 2233. arXiv : 2004.12654 . doi : 10.1090/mcom/3659 . S2CID 216552869 . 
  20. Kanagawa, M.; Hennig, P. (2019). "Garantías de convergencia para métodos de cuadratura bayesiana adaptativa". Neural Information Processing Systems : 6237–6248 . arXiv : 1905.10271 .
  21. Adachi, M.; Satoshi, H.; Jörgensen, M.; Oberhauser, H.; Osborne, MA (2022). "Inferencia bayesiana rápida con cuadratura bayesiana por lotes mediante recombinación de núcleos". Neural Information Processing Systems : 16533–16547 . arXiv : 2206.04734 .