Articulo de referencia

proceso gaussiano

En teoría de la probabilidad y estadística , un proceso gaussiano es un proceso estocástico (un conjunto de variables aleatorias indexadas por el tiempo o el espacio) tal que cu...

En teoría de la probabilidad y estadística , un proceso gaussiano es un proceso estocástico (un conjunto de variables aleatorias indexadas por el tiempo o el espacio) tal que cualquier conjunto finito de dichas variables aleatorias tiene una distribución normal multivariada . La distribución de un proceso gaussiano es la distribución conjunta de todas esas (infinitas) variables aleatorias y, como tal, es una distribución sobre funciones con un dominio continuo, por ejemplo, el tiempo o el espacio.

El concepto de procesos gaussianos recibe su nombre de Carl Friedrich Gauss, ya que se basa en la noción de distribución gaussiana ( distribución normal ). Los procesos gaussianos pueden considerarse una generalización de dimensión infinita de las distribuciones normales multivariadas.

Los procesos gaussianos son útiles en el modelado estadístico , ya que se benefician de las propiedades heredadas de la distribución normal. Por ejemplo, si un proceso aleatorio se modela como un proceso gaussiano, se pueden obtener explícitamente las distribuciones de diversas cantidades derivadas. Estas cantidades incluyen el valor promedio del proceso en un rango de tiempos y el error al estimar el promedio utilizando valores de muestra en un pequeño conjunto de tiempos. Si bien los modelos exactos suelen tener un rendimiento deficiente a medida que aumenta la cantidad de datos, se han desarrollado múltiples métodos de aproximación que a menudo conservan una buena precisión a la vez que reducen drásticamente el tiempo de cálculo.

Definición

Un proceso estocástico continuo en el tiempo{incógnitat;tT}{\displaystyle \left\{X_{t};t\in T\right\}}es gaussiana si y solo si para cada conjunto finito de índicest1,,tk{\displaystyle t_{1},\ldots ,t_{k}}en el conjunto de índicesT{\displaystyle T}

incógnitat1,,tk=(incógnitat1,,incógnitatk){\displaystyle \mathbf {X} _{t_{1},\ldots ,t_{k}}=(X_{t_{1}},\ldots ,X_{t_{k}})}

es una variable aleatoria gaussiana multivariada . [ 1 ] Como la suma de variables aleatorias independientes y con distribución gaussiana también tiene distribución gaussiana, es lo mismo que decir que toda combinación lineal de(incógnitat1,,incógnitatk){\displaystyle (X_{t_{1}},\ldots ,X_{t_{k}})}tiene una distribución gaussiana (o normal) univariada.

Utilizando funciones características de variables aleatorias coni{\displaystyle i}denotando la unidad imaginaria tal quei2=1{\displaystyle i^{2}=-1}La propiedad gaussiana se puede formular de la siguiente manera:{incógnitat;tT}{\displaystyle \left\{X_{t};t\in T\right\}}es gaussiana si y solo si, para cada conjunto finito de índicest1,,tk{\displaystyle t_{1},\ldots ,t_{k}}, hay valores realesσj2{\displaystyle \sigma _{\ell j}^{2}},μ{\displaystyle \mu _{\ell }}conσjj2>0{\displaystyle \sigma _{jj}^{2}>0}de tal manera que se cumpla la siguiente igualdad para todoss1,s2,,skR{\displaystyle s_{1},s_{2},\ldots ,s_{k}\in \mathbb {R} },

mi[exp(i=1ksincógnitat)]=exp(12,jσj2ssj+iμs),{\displaystyle {\mathbb {E} }\left[\exp \left(i\sum _{\ell =1}^{k}s_{\ell }\,\mathbf {X} _{t_{\ell }}\right)\right]=\exp \left(-{\tfrac {1}{2}}\sum _{\ell ,j}\sigma _{\ell j}^{2}s_{\ell }s_{j}+i\sum _{\ell }\mu _{\ell }s_{\ell }\right),}

omi[miis(incógnitatμ)]=misσ2s/2{\displaystyle {\mathbb {E} }\left[{\mathrm {e} }^{i\,\mathbf {s} \,(\mathbf {X} _{t}-\mathbf {\mu } )}\right]={\mathrm {e} }^{-\mathbf {s} \,\sigma ^{2}\,\mathbf {s} /2}}Los númerosσj2{\displaystyle \sigma _{\ell j}^{2}}yμ{\displaystyle \mu _{\ell }}Se puede demostrar que son las covarianzas y las medias de las variables en el proceso. [ 2 ]

Estacionariedad

Para procesos estocásticos generales, la estacionariedad en sentido estricto implica la estacionariedad en sentido amplio , pero no todo proceso estocástico estacionario en sentido amplio es estacionario en sentido estricto. Sin embargo, para un proceso estocástico gaussiano, ambos conceptos son equivalentes. [ 3 ]

Por lo tanto, el proceso gaussiano estacionario está completamente determinado por su función de media de un parámetro y su función de covarianza.

Ejemplo

Existe una representación explícita para procesos gaussianos estacionarios. [ 4 ] Un ejemplo sencillo de esta representación es

incógnitat=porque(at)ξ1+pecado(at)ξ2{\displaystyle X_{t}=\cos(at)\,\xi _{1}+\sin(at)\,\xi _{2}}

dóndeξ1{\displaystyle \xi _{1}}yξ2{\displaystyle \xi _{2}}son variables aleatorias independientes con distribución normal estándar .

Funciones de covarianza

Un hecho clave de los procesos gaussianos es que pueden definirse completamente mediante sus estadísticas de segundo orden. [ 5 ] Por lo tanto, si se supone que un proceso gaussiano tiene media cero, la definición de la función de covarianza define completamente el comportamiento del proceso. Es importante destacar que la no negatividad definida de esta función permite su descomposición espectral mediante la expansión de Karhunen-Loève . Los aspectos básicos que pueden definirse a través de la función de covarianza son la estacionariedad , la isotropía , la suavidad y la periodicidad del proceso . [ 6 ] [ 7 ]

La estacionariedad se refiere al comportamiento del proceso con respecto a la separación de dos puntos cualesquiera.incógnita{\displaystyle x}yincógnita{\displaystyle x'}. Si el proceso es estacionario, la función de covarianza depende únicamente deincógnitaincógnita{\displaystyle xx'}Por ejemplo, el proceso de Ornstein-Uhlenbeck es estacionario.

Si el proceso depende únicamente de|incógnitaincógnita|{\displaystyle |xx'|}, la distancia euclidiana (no la dirección) entreincógnita{\displaystyle x}yincógnita{\displaystyle x'}, entonces el proceso se considera isotrópico. Un proceso que es simultáneamente estacionario e isotrópico se considera homogéneo ; [ 8 ] en la práctica estas propiedades reflejan las diferencias (o más bien la falta de ellas) en el comportamiento del proceso dada la ubicación del observador.

En última instancia, los procesos gaussianos se traducen en tomar distribuciones a priori sobre funciones, y la suavidad de estas distribuciones a priori puede ser inducida por la función de covarianza. [ 6 ] Si esperamos que para puntos de entrada "cercanos"incógnita{\displaystyle x}yincógnita{\displaystyle x'}sus puntos de salida correspondientesy{\displaystyle y}yy{\displaystyle y'}Si además se considera que existe una proximidad, se asume la continuidad. Si deseamos permitir un desplazamiento significativo, podríamos optar por una función de covarianza menos precisa. Ejemplos extremos de este comportamiento son la función de covarianza de Ornstein - Uhlenbeck y la exponencial al cuadrado, donde la primera nunca es diferenciable y la segunda es infinitamente diferenciable.

La periodicidad se refiere a inducir patrones periódicos dentro del comportamiento del proceso. Formalmente, esto se logra mapeando la entrada.incógnita{\displaystyle x}a un vector bidimensional(incógnita)=(porque(incógnita),pecado(incógnita)){\displaystyle u(x)=\left(\cos(x),\sin(x)\right)}.

Funciones de covarianza habituales

Efecto de la elección de diferentes núcleos en la distribución de la función a priori del proceso gaussiano. A la izquierda, un núcleo exponencial al cuadrado. En el centro, un núcleo browniano. A la derecha, un núcleo cuadrático.

Existen varias funciones de covarianza comunes: [ 7 ]

  • Constante  :Kdo(incógnita,incógnita)=do{\displaystyle K_{\operatorname {C} }(x,x')=C}
  • Lineal:KL(incógnita,incógnita)=incógnitaTincógnita{\displaystyle K_{\operatorname {L} }(x,x')=x^{\mathsf {T}}x'}
  • Ruido gaussiano blanco:KGN(incógnita,incógnita)=σ2δincógnita,incógnita{\displaystyle K_{\operatorname {GN} }(x,x')=\sigma ^{2}\delta _{x,x'}}
  • exponencial al cuadrado:KSE(incógnita,incógnita)=exp(d222){\displaystyle K_{\operatorname {SE} }(x,x')=\exp \left(-{\tfrac {d^{2}}{2\ell ^{2}}}\right)}
  • Ornstein Uhlenbeck:KUNED(incógnita,incógnita)=exp(d){\displaystyle K_{\operatorname {OU} }(x,x')=\exp \left(-{\tfrac {d}{\ell }}\right)}
  • Matérn:KMaterna(incógnita,incógnita)=21νΓ(ν)(2νd)νKν(2νd){\displaystyle K_{\operatorname {Matern} }(x,x')={\tfrac {2^{1-\nu }}{\Gamma (\nu )}}\left({\tfrac {{\sqrt {2\nu }}d}{\ell }}\right)^{\nu }K_{\nu }\left({\tfrac {{\sqrt {2\nu }}d}{\ell }}\right)}
  • Periódico:KPAG(incógnita,incógnita)=exp(22pecado2(d/2)){\displaystyle K_{\operatorname {P} }(x,x')=\exp \left(-{\tfrac {2}{\ell ^{2}}}\sin ^{2}(d/2)\right)}
  • Cuadrático racional:KRQ(incógnita,incógnita)=(1+d2)α,α0{\displaystyle K_{\operatorname {RQ} }(x,x')=\left(1+d^{2}\right)^{-\alpha },\quad \alpha \geq 0}

Aquíd=|incógnitaincógnita|{\displaystyle d=|x-x'|}, lo cual es resultado de la propiedad del proceso estacionario, es decir, para cualquier proceso estacionario la función de covarianza solo dependerá ded{\displaystyle d}. El parámetro{\displaystyle \ell }es la escala de longitud característica del proceso (prácticamente, "qué tan cerca" están dos puntosincógnita{\displaystyle x}yincógnita{\displaystyle x'}tienen que influirse mutuamente de manera significativa),δ{\displaystyle \delta }es el delta de Kronecker yσ{\displaystyle \sigma }la desviación estándar de las fluctuaciones del ruido. Además,Kν{\displaystyle K_{\nu }}es la función de Bessel modificada de ordenν{\displaystyle \nu }yΓ(ν){\displaystyle \Gamma (\nu )}es la función gamma evaluada enν{\displaystyle \nu }Es importante destacar que una función de covarianza compleja puede definirse como una combinación lineal de otras funciones de covarianza más simples para incorporar diferentes perspectivas sobre el conjunto de datos en cuestión.

Los resultados de la inferencia dependen de los valores de los hiperparámetros.θ{\displaystyle \theta }(p.ej{\displaystyle \ell }yσ{\displaystyle \sigma }) definiendo el comportamiento del modelo. Una opción popular paraθ{\displaystyle \theta }El objetivo es proporcionar estimaciones de máxima probabilidad a posteriori (MAP) del proceso con alguna distribución a priori elegida. Si la distribución a priori es muy cercana a la uniforme, esto equivale a maximizar la verosimilitud marginal del proceso; la marginalización se realiza sobre los valores observados del proceso.y{\displaystyle y}. [ 7 ] Este enfoque también se conoce como máxima verosimilitud II , maximización de la evidencia o Bayes empírico . [ 9 ]

Continuidad

Para un proceso gaussiano, la continuidad en probabilidad es equivalente a la continuidad en media cuadrática [ 10 ] : 145 : 91 "Los procesos gaussianos son discontinuos en puntos fijos." [ 11 ] y la continuidad con probabilidad uno es equivalente a la continuidad muestral . [ 12 ] Esta última implica, pero no está implicada por, la continuidad en probabilidad. La continuidad en probabilidad se cumple si y solo si la media y la autocovarianza son funciones continuas. En contraste, la continuidad muestral fue un desafío incluso para procesos gaussianos estacionarios (como probablemente señaló primero Andrey Kolmogorov ), y más desafiante para procesos más generales. [ 13 ] : Sect. 2.8 [ 14 ] : 69, 81 [ 15 ] : 80 [ 16 ] Como es habitual, por un proceso continuo muestral se entiende un proceso que admite una modificación continua muestral . [ 17 ] : 292 [ 18 ] : 424

Estuche fijo

Para un proceso gaussiano estacionarioincógnita=(incógnitat)tR,{\displaystyle X=(X_{t})_{t\in \mathbb {R} },}Algunas condiciones en su espectro son suficientes para la continuidad de la muestra, pero no son necesarias. Una condición necesaria y suficiente, a veces llamada teorema de Dudley-Fernique, involucra la funciónσ{\displaystyle \sigma }definido por σ(h)=mi[(incógnita(t+h)incógnita(t))2]{\displaystyle \sigma (h)={\sqrt {{\mathbb {E} }\left[\left(X(t+h)-X(t)\right)^{2}\right]}}} (el lado derecho no depende det{\displaystyle t}debido a la estacionariedad). Continuidad deincógnita{\displaystyle X}en probabilidad es equivalente a la continuidad deσ{\displaystyle \sigma }en0.{\displaystyle 0.}Cuando converge deσ(h){\displaystyle \sigma (h)}a0{\displaystyle 0}(comoh0{\displaystyle h\to 0}) es demasiado lento, continuidad de muestra deincógnita{\displaystyle X}Puede fallar. La convergencia de las siguientes integrales es importante: I(σ)=01σ(h)hregistro(1/h)dh=02σ(miincógnita2)dincógnita,{\displaystyle I(\sigma )=\int _{0}^{1}{\frac {\sigma (h)}{h{\sqrt {\log(1/h)}}}}\,dh=\int _{0}^{\infty }2\sigma (e^{-x^{2}})\,dx,} Estas dos integrales son iguales según la integración por sustitución.h=miincógnita2,{\textstyle h=e^{-x^{2}},}incógnita=registro(1/h).{\textstyle x={\sqrt {\log(1/h)}}.}El primer integrando no necesita estar acotado comoh0+,{\displaystyle h\to 0+,}por lo tanto la integral puede converger (I(σ)<{\displaystyle I(\sigma )<\infty }) o divergir (I(σ)={\displaystyle I(\sigma )=\infty }). Tomando como ejemploσ(miincógnita2)=1incógnitaa{\textstyle \sigma (e^{-x^{2}})={\tfrac {1}{x^{a}}}}para grandesincógnita,{\displaystyle x,}eso es,σ(h)=(registro(1/h))a/2{\textstyle \sigma (h)=(\log(1/h))^{-a/2}}para pequeñosh,{\displaystyle h,}uno obtieneI(σ)<{\displaystyle I(\sigma )<\infty }cuandoa>1,{\displaystyle a>1,}yI(σ)={\displaystyle I(\sigma )=\infty }cuando0<a1.{\displaystyle 0<a\leq 1.} En estos dos casos la funciónσ{\displaystyle \sigma }está aumentando en[0,),{\displaystyle [0,\infty ),}pero generalmente no lo es. Además, la condición

(*)  existeε>0{\displaystyle \varepsilon >0}de tal manera queσ{\displaystyle \sigma }es monótono en[0,ε]{\displaystyle [0,\varepsilon ]}

no se deduce de la continuidad deσ{\displaystyle \sigma }y las relaciones evidentesσ(h)0{\displaystyle \sigma (h)\geq 0}(a pesar deh{\displaystyle h}) yσ(0)=0.{\displaystyle \sigma (0)=0.}

Teorema 1 Seaσ{\displaystyle \sigma }ser continua y satisfacer (*) . Entonces la condiciónI(σ)<{\displaystyle I(\sigma )<\infty }es necesario y suficiente para la continuidad de la muestra deincógnita.{\displaystyle X.}

Un poco de historia. [ 18 ] : 424 La suficiencia fue anunciada por Xavier Fernique en 1964, pero la primera prueba fue publicada por Richard M. Dudley en 1967. [ 17 ] : Teorema 7.1 La necesidad fue probada por Michael B. Marcus y Lawrence Shepp en 1970. [ 19 ] : 380

Existen procesos continuos de muestraincógnita{\displaystyle X}de tal manera queI(σ)=;{\displaystyle I(\sigma )=\infty ;} violan la condición (*) . Un ejemplo encontrado por Marcus y Shepp [ 19 ] : 387 es una serie de Fourier lacunar aleatoriaincógnitat=norte=1donorte(ξnorteporqueλnortet+ηnortepecadoλnortet),{\displaystyle X_{t}=\sum _{n=1}^{\infty }c_{n}(\xi _{n}\cos \lambda _{n}t+\eta _{n}\sin \lambda _{n}t),} dóndeξ1,η1,ξ2,η2,{\displaystyle \xi _{1},\eta _{1},\xi _{2},\eta _{2},\dots }son variables aleatorias independientes con distribución normal estándar ; frecuencias0<λ1<λ2<{\displaystyle 0<\lambda _{1}<\lambda _{2}<\dots }son una secuencia de rápido crecimiento; y coeficientesdonorte>0{\displaystyle c_{n}>0}satisfacernortedonorte<.{\textstyle \sum _{n}c_{n}<\infty .}Esta última relación implica

minortedonorte(|ξnorte|+|ηnorte|)=nortedonortemi[|ξnorte|+|ηnorte|]=constantenortedonorte<,{\textstyle {\mathbb {E} }\sum _{n}c_{n}(|\xi _{n}|+|\eta _{n}|)=\sum _{n}c_{n}{\mathbb {E} }[|\xi _{n}|+|\eta _{n}|]={\text{const}}\cdot \sum _{n}c_{n}<\infty ,}

De dóndenortedonorte(|ξnorte|+|ηnorte|)<{\textstyle \sum _{n}c_{n}(|\xi _{n}|+|\eta _{n}|)<\infty }casi con seguridad, lo que garantiza la convergencia uniforme de la serie de Fourier casi con seguridad, y la continuidad de la muestra deincógnita.{\displaystyle X.}

Autocorrelación de una serie de Fourier lacunar aleatoria

Su función de autocovariación mi[incógnitatincógnitat+h]=norte=1donorte2porqueλnorteh{\displaystyle {\mathbb {E} }[X_{t}X_{t+h}]=\sum _{n=1}^{\infty }c_{n}^{2}\cos \lambda _{n}h} no es monótono en ningún lugar (ver la imagen), al igual que la función correspondiente.σ,{\displaystyle \sigma ,}σ(h)=2mi[incógnitatincógnitat]2mi[incógnitatincógnitat+h]=2norte=1donorte2pecado2λnorteh2.{\displaystyle \sigma (h)={\sqrt {2{\mathbb {E} }[X_{t}X_{t}]-2{\mathbb {E} }[X_{t}X_{t+h}]}}=2{\sqrt {\sum _{n=1}^{\infty }c_{n}^{2}\sin ^{2}{\frac {\lambda _{n}h}{2}}}}.}

El movimiento browniano como la integral de procesos gaussianos

Un proceso de Wiener (también conocido como movimiento browniano) es la integral de un proceso gaussiano generalizado de ruido blanco . No es estacionario , pero tiene incrementos estacionarios .

El proceso de Ornstein-Uhlenbeck es un proceso gaussiano estacionario .

El puente browniano es (al igual que el proceso de Ornstein-Uhlenbeck) un ejemplo de un proceso gaussiano cuyos incrementos no son independientes .

El movimiento browniano fraccional es un proceso gaussiano cuya función de covarianza es una generalización de la del proceso de Wiener.

Estructura RKHS y proceso gaussiano

DejarF{\displaystyle f}ser un proceso gaussiano de media cero{incógnitat;tT}{\displaystyle \left\{X_{t};t\in T\right\}}con una función de covarianza semidefinida positivaK{\displaystyle K}y dejarR{\displaystyle R}Sea una función simétrica y semidefinida positiva. Entonces, existe un proceso gaussiano.incógnita{\displaystyle X}que tiene la covarianzaR{\displaystyle R}. Además, el espacio de Hilbert de núcleo reproductor (RKHS) asociado aR{\displaystyle R}coincide con el espacio asociado al teorema de Cameron-MartinR(H){\displaystyle R(H)}deincógnita{\displaystyle X}y todos los espaciosR(H){\displaystyle R(H)},Hincógnita{\displaystyle H_{X}}, yH(K){\displaystyle {\mathcal {H}}(K)}son isométricos. [ 20 ] De ahora en adelante, dejemosH(R){\displaystyle {\mathcal {H}}(R)}Sea un espacio de Hilbert con núcleo reproductor y núcleo definido positivo.R{\displaystyle R}.

La ley cero-uno de Driscoll es un resultado que caracteriza las funciones de muestra generadas por un proceso gaussiano: límitenortetr[KnorteRnorte1]<,{\displaystyle \lim _{n\to \infty }\operatorname {tr} [K_{n}R_{n}^{-1}]<\infty ,} dóndeKnorte{\displaystyle K_{n}}yRnorte{\displaystyle R_{n}}son las matrices de covarianza de todos los pares posibles denorte{\displaystyle n}puntos, implica Pr[FH(R)]=1.{\displaystyle \Pr[f\in {\mathcal {H}}(R)]=1.}

Además, límitenortetr[KnorteRnorte1]={\displaystyle \lim _{n\to \infty }\operatorname {tr} [K_{n}R_{n}^{-1}]=\infty } implica [ 21 ]Pr[FH(R)]=0.{\displaystyle \Pr[f\in {\mathcal {H}}(R)]=0.}

Esto tiene implicaciones significativas cuandoK=R{\displaystyle K=R}, como límitenortetr[RnorteRnorte1]=límitenortetr[I]=límitenortenorte=.{\displaystyle \lim _{n\to \infty }\operatorname {tr} [R_{n}R_{n}^{-1}]=\lim _{n\to \infty }\operatorname {tr} [I]=\lim _{n\to \infty }n=\infty .}

Por lo tanto, casi todas las trayectorias de muestra de un proceso gaussiano de media cero con núcleo definido positivoK{\displaystyle K}quedará fuera del espacio de HilbertH(K){\displaystyle {\mathcal {H}}(K)}.

Procesos gaussianos con restricciones lineales

Para muchas aplicaciones de interés, ya se dispone de cierto conocimiento previo sobre el sistema en cuestión. Consideremos, por ejemplo, el caso en que la salida del proceso gaussiano corresponde a un campo magnético; en este caso, el campo magnético real está condicionado por las ecuaciones de Maxwell, y sería deseable incorporar esta restricción al formalismo del proceso gaussiano, ya que esto probablemente mejoraría la precisión del algoritmo.

Ya existe un método para incorporar restricciones lineales en procesos gaussianos: [ 22 ]

Consideremos la función de salida (con valores vectoriales).F(incógnita){\displaystyle f(x)}que se sabe que obedece la restricción lineal (es decir,Fincógnita{\displaystyle {\mathcal {F}}_{X}}es un operador lineal) Fincógnita(F(incógnita))=0.{\displaystyle {\mathcal {F}}_{X}(f(x))=0.} Entonces la restricciónFincógnita{\displaystyle {\mathcal {F}}_{X}}puede cumplirse eligiendoF(incógnita)=GRAMOincógnita(gramo(incógnita)){\displaystyle f(x)={\mathcal {G}}_{X}(g(x))}, dóndegramo(incógnita)GRAMOPAG(μgramo,Kgramo){\displaystyle g(x)\sim {\mathcal {GP}}(\mu _{g},K_{g})}se modela como un proceso gaussiano y encontrarGRAMOincógnita{\displaystyle {\mathcal {G}}_{X}}de tal manera que Fincógnita(GRAMOincógnita(gramo))=0gramo.{\displaystyle {\mathcal {F}}_{X}({\mathcal {G}}_{X}(g))=0\qquad \forall g.} DadoGRAMOincógnita{\displaystyle {\mathcal {G}}_{X}}y utilizando el hecho de que los procesos gaussianos son cerrados bajo transformaciones lineales, el proceso gaussiano paraF{\displaystyle f}obedeciendo la restricciónFincógnita{\displaystyle {\mathcal {F}}_{X}}se convierte F(incógnita)=GRAMOincógnitagramoGRAMOPAG(GRAMOincógnitaμgramo,GRAMOincógnitaKgramoGRAMOincógnitaT).{\displaystyle f(x)={\mathcal {G}}_{X}g\sim {\mathcal {GP}}({\mathcal {G}}_{X}\mu _{g},{\mathcal {G}}_{X}K_{g}{\mathcal {G}}_{X'}^{\mathsf {T}}).} Por lo tanto, las restricciones lineales pueden codificarse en la función de media y covarianza de un proceso gaussiano.

Aplicaciones

Un ejemplo de regresión de procesos gaussianos (predicción) comparada con otros modelos de regresión. [ 23 ]

Un proceso gaussiano puede usarse como una distribución de probabilidad previa sobre funciones en inferencia bayesiana . [ 7 ] [ 24 ] Dado cualquier conjunto de N puntos en el dominio deseado de las funciones, se toma una gaussiana multivariada cuyo parámetro de matriz de covarianza es la matriz de Gram de esos N puntos con algún núcleo deseado , y se muestrea de esa gaussiana. Para la solución del problema de predicción de múltiples salidas, se desarrolló la regresión de procesos gaussianos para funciones con valores vectoriales. En este método, se construye una covarianza "grande", que describe las correlaciones entre todas las variables de entrada y salida tomadas en N puntos en el dominio deseado. [ 25 ] Este enfoque se elaboró ​​en detalle para los procesos gaussianos con valores matriciales y se generalizó a procesos con "colas más pesadas" como los procesos t de Student . [ 26 ]

La inferencia de valores continuos con una distribución a priori de proceso gaussiano se conoce como regresión de proceso gaussiano o kriging ; la extensión de la regresión de proceso gaussiano a múltiples variables objetivo se conoce como cokriging . [ 27 ] Los procesos gaussianos son, por lo tanto, útiles como una potente herramienta de interpolación multivariante no lineal . El kriging también se utiliza para extender el proceso gaussiano en el caso de entradas de enteros mixtos. [ 28 ]

Los procesos gaussianos también se utilizan comúnmente para abordar problemas de análisis numérico, como la integración numérica, la resolución de ecuaciones diferenciales o la optimización en el campo de la computación numérica probabilística .

Los procesos gaussianos también pueden utilizarse en el contexto de modelos de mezcla de expertos, por ejemplo. [ 29 ] [ 30 ] La lógica subyacente de este marco de aprendizaje consiste en la suposición de que un mapeo dado no puede ser bien representado por un único modelo de proceso gaussiano. En cambio, el espacio de observación se divide en subconjuntos, cada uno de los cuales se caracteriza por una función de mapeo diferente; cada uno de estos se aprende mediante un componente de proceso gaussiano diferente en la mezcla postulada.

Predicción mediante procesos gaussianos o Kriging

Regresión de procesos gaussianos (predicción) con núcleo exponencial cuadrático. El gráfico de la izquierda muestra extracciones de la distribución de la función a priori. El gráfico del medio muestra extracciones de la distribución a posteriori. El gráfico de la derecha muestra la predicción media con una desviación estándar sombreada.

Cuando se trata de un problema general de regresión de procesos gaussianos (Kriging), se supone que para un proceso gaussianoF{\displaystyle f}observado en las coordenadasincógnita{\displaystyle x}, el vector de valoresF(incógnita){\displaystyle f(x)} es solo una muestra de una distribución gaussiana multivariada de dimensión igual al número de coordenadas observadasnorte{\displaystyle n} . Por lo tanto, bajo el supuesto de una distribución de media cero,F(incógnita)norte(0,K(θ,incógnita,incógnita)){\displaystyle f(x')\sim N(0,K(\theta ,x,x'))}, dondeK(θ,incógnita,incógnita){\displaystyle K(\theta ,x,x')}es la matriz de covarianza entre todos los pares posibles(incógnita,incógnita){\displaystyle (x,x')}para un conjunto dado de hiperparámetros θ . [ 7 ] Por lo tanto, la verosimilitud marginal logarítmica es:

registropag(F(incógnita)θ,incógnita)=12(FT(incógnita)K1(θ,incógnita,incógnita)F(incógnita)+registrodet(K(θ,incógnita,incógnita))+norteregistro2π){\displaystyle \log p(f(x')\mid \theta ,x)=-{\frac {1}{2}}\left(f^{\mathsf {T}}(x)K^{-1}(\theta ,x,x')f(x')+\log \det(K(\theta ,x,x'))+n\log 2\pi \right)}

y maximizar esta probabilidad marginal hacia θ proporciona la especificación completa del proceso gaussiano f . Se puede observar brevemente en este punto que el primer término corresponde a un término de penalización por el fallo del modelo en ajustarse a los valores observados y el segundo término a un término de penalización que aumenta proporcionalmente a la complejidad del modelo. Habiendo especificado θ , hacer predicciones sobre valores no observadosF(incógnita){\displaystyle f(x^{*})}En las coordenadas x * , entonces solo se trata de tomar muestras de la distribución predictiva.pag(yincógnita,F(incógnita),incógnita)=norte(yA,B){\displaystyle p(y^{*}\mid x^{*},f(x),x)=N(y^{*}\mid A,B)}donde la estimación de la media posterior A se define como A=K(θ,incógnita,incógnita)K1(θ,incógnita,incógnita)F(incógnita){\displaystyle A=K(\theta ,x^{*},x)K^{-1}(\theta ,x,x')f(x)} y la estimación de la varianza posterior B se define como: B=K(θ,incógnita,incógnita)K(θ,incógnita,incógnita)K1(θ,incógnita,incógnita)KT(θ,incógnita,incógnita){\displaystyle B=K(\theta ,x^{*},x^{*})-K(\theta ,x^{*},x)K^{-1}(\theta ,x,x')K^{\mathsf {T}}(\theta ,x^{*},x)} dondeK(θ,incógnita,incógnita){\displaystyle K(\theta ,x^{*},x)} es la covarianza entre la nueva coordenada de estimación x * y todas las demás coordenadas observadas x para un vector de hiperparámetros θ dado ,K(θ,incógnita,incógnita){\displaystyle K(\theta ,x,x')}yF(incógnita){\displaystyle f(x)} se definen como antes yK(θ,incógnita,incógnita){\displaystyle K(\theta ,x^{*},x^{*})} es la varianza en el punto x * según lo dictado por θ . Prácticamente, la estimación de la media posterior deF(incógnita){\displaystyle f(x^{*})}( La "estimación puntual") es simplemente una combinación lineal de las observaciones .F(incógnita){\displaystyle f(x)}; de manera similar la varianza deF(incógnita){\displaystyle f(x^{*})}En realidad , es independiente de las observaciones .F(incógnita){\displaystyle f(x)} . Un cuello de botella conocido en la predicción de procesos gaussianos es que la complejidad computacional de la inferencia y la evaluación de la verosimilitud es cúbica en el número de puntos | x |, y como tal puede volverse inviable para conjuntos de datos más grandes. [ 6 ] [ 31 ] Los trabajos sobre procesos gaussianos dispersos, que generalmente se basan en la idea de construir un conjunto representativo para el proceso f dado , intentan sortear este problema. [ 32 ] [ 33 ] [ 34 ] El método de kriging se puede utilizar en el nivel latente de un modelo de efectos mixtos no lineal para una predicción funcional espacial: esta técnica se llama kriging latente. [ 35 ] Otras clases de procesos gaussianos escalables para analizar conjuntos de datos masivos han surgido de la aproximación de Vecchia y los procesos gaussianos del vecino más cercano (NNGP). [ 36 ] [ 31 ]

A menudo, la covarianza tiene la formaK(θ,incógnita,incógnita)=1σ2K~(θ,incógnita,incógnita){\textstyle K(\theta ,x,x')={\frac {1}{\sigma ^{2}}}{\tilde {K}}(\theta ,x,x')}, dóndeσ2{\displaystyle \sigma ^{2}}es un parámetro de escala. Ejemplos de ello son las funciones de covarianza de clase de Matérn. Si este parámetro de escalaσ2{\displaystyle \sigma ^{2}}es conocido o desconocido (es decir, debe ser marginalizado), entonces la probabilidad posterior,pag(θD){\displaystyle p(\theta \mid D)}, es decir, la probabilidad de los hiperparámetrosθ{\displaystyle \theta }dado un conjunto de pares de datosD{\displaystyle D}de observaciones deincógnita{\displaystyle x}yF(incógnita){\displaystyle f(x)}, admite una expresión analítica. [ 37 ]

Redes neuronales bayesianas como procesos gaussianos

Las redes neuronales bayesianas son un tipo particular de red bayesiana que resulta de tratar los modelos de aprendizaje profundo y redes neuronales artificiales de forma probabilística, y asignar una distribución previa a sus parámetros . La computación en redes neuronales artificiales generalmente se organiza en capas secuenciales de neuronas artificiales . El número de neuronas en una capa se llama ancho de capa. A medida que el ancho de capa aumenta, muchas redes neuronales bayesianas se reducen a un proceso gaussiano con un núcleo compositivo de forma cerrada . Este proceso gaussiano se llama Proceso Gaussiano de Red Neuronal (NNGP) (que no debe confundirse con el Proceso Gaussiano del Vecino Más Cercano [ 36 ] ). [ 7 ] [ 38 ] [ 39 ] Permite que las predicciones de las redes neuronales bayesianas se evalúen de manera más eficiente y proporciona una herramienta analítica para comprender los modelos de aprendizaje profundo .

Aplicaciones físicas

Los procesos gaussianos han encontrado aplicaciones cada vez mayores en muchos dominios de las ciencias naturales debido a sus propiedades de modelado estadístico. La predicción de propiedades moleculares ha empleado estos modelos de procesos en conjuntos de datos moleculares pequeños debido a sus capacidades de inferencia y costos computacionales. [ 40 ] [ 41 ] También se están utilizando cada vez más como modelos sustitutos para la optimización de campos de fuerza. [ 42 ]

Astrofísica

Los procesos gaussianos también se han utilizado ampliamente en entornos astrofísicos y astronómicos. Estos procesos pueden modelar el ruido correlacionado, un tipo específico de ruido no gaussiano que depende de alguna distribución subyacente desconocida correlacionada con los valores observados. Este tipo de ruido suele estar presente en las señales astronómicas como sistemáticas instrumentales o como intrínseco al objeto observado como resultado de procesos físicos. El ruido correlacionado se suele tener en cuenta en los eventos de tránsito de exoplanetas , y los procesos gaussianos se han utilizado para eliminar la tendencia de estas curvas de luz de tránsito (en escalas de tiempo mayores que la del tránsito) para permitir la detección de señales más débiles y de menor duración. [ 43 ] Estos procesos también se han utilizado para separar las señales planetarias de los indicadores de actividad estelar dentro de los datos de velocidad radial , otro método de detección de exoplanetas. Esto se logra entrenando el modelo de proceso gaussiano para optimizar los hiperparámetros del núcleo hasta que recree con precisión los componentes de ruido de los datos de velocidad radial, lo que finalmente le permite determinar qué señales se definen mejor como estrictamente periódicas (como debería ser el planeta) y qué señales se representan mejor mediante el núcleo cuasiperiódico en evolución (como debería ser la estrella). [ 44 ] El ruido correlacionado producido por regiones activas en la fotosfera de una estrella (como resultado de interacciones del campo magnético ) puede tener escalas de tiempo similares a las de los eventos de tránsito, y los modelos de proceso gaussiano que manejan datos muestreados de forma dispersa se utilizan para confirmar detecciones de exoplanetas, especialmente alrededor de estrellas jóvenes. [ 45 ] [ 46 ]

La variabilidad de las estrellas rotatorias magnéticamente activas similares al Sol se puede modelar con bastante precisión utilizando procesos gaussianos. [ 45 ] Esta variabilidad cuasiperiódica se representa a menudo mediante una función de covarianza dada por [ 47 ] [ 48 ]KQP(incógnita,incógnita)=α2exp(d22λ12Γpecado2[πdλ2]){\displaystyle {\text{K}}_{\text{QP}}(x,x')=\alpha ^{2}\exp \left(-{\frac {d^{2}}{2\lambda _{1}^{2}}}-\Gamma \sin ^{2}\left[{\frac {\pi d}{\lambda _{2}}}\right]\right)}donde parámetroα{\displaystyle \alpha }es amplitud,λ1{\displaystyle \lambda _{1}}es período, yλ2{\displaystyle \lambda _{2}}es la escala de tiempo de decoherencia. Esta función de covarianza permite la determinación limitada pero factible de los períodos estelares como resultado del parámetroλ1{\displaystyle \lambda _{1}}pero carece de información física sobre dónde se encuentran estas regiones activas en la estrella observada. [ 45 ] [ 49 ]

Los procesos gaussianos también se utilizan en el análisis de núcleos galácticos activos (AGN) individuales y en poblaciones debido a su variabilidad estocástica en las partes óptica y de radio del espectro electromagnético . [ 45 ] Los núcleos de caminata aleatoria amortiguada, en particular, se han utilizado previamente para identificar la extensión de las regiones de emisión de líneas anchas alrededor de agujeros negros supermasivos mediante mapeo de reverberación , y estos núcleos también pueden utilizarse para caracterizar las variaciones de la curva de luz para grandes poblaciones de AGN. [ 50 ] [ 51 ]

Otras aplicaciones astrofísicas de los procesos gaussianos incluyen modelos para la medición de la dispersión y la sincronización de púlsares , la incertidumbre de la estructura de las ondas gravitacionales y de los detectores (en particular en la colaboración LIGO-Virgo-KAGRA ), la clasificación de transitorios y las oscilaciones cuasiperiódicas. [ 45 ] [ 52 ] [ 53 ] [ 54 ] [ 55 ]

Problemas computacionales

En aplicaciones prácticas, los modelos de procesos gaussianos se evalúan a menudo en una cuadrícula, lo que da lugar a distribuciones normales multivariadas. El uso de estos modelos para la predicción o la estimación de parámetros mediante máxima verosimilitud requiere la evaluación de una densidad gaussiana multivariada, lo que implica el cálculo del determinante y la inversa de la matriz de covarianza. Ambas operaciones tienen una complejidad computacional cúbica, lo que significa que, incluso para cuadrículas de tamaño moderado, pueden tener un coste computacional prohibitivo. Este inconveniente impulsó el desarrollo de métodos de aproximación múltiple . [ 31 ]

Véase también

Referencias

  1. MacKay, David JC (2003). Teoría de la información, inferencia y algoritmos de aprendizaje (PDF) . Cambridge University Press . pág.  540. ISBN 9780521642989. La distribución de probabilidad de una funcióny(incógnita){\displaystyle y(\mathbf {x} )}es un proceso gaussiano si para cualquier selección finita de puntosincógnita(1),incógnita(2),,incógnita(norte){\displaystyle \mathbf {x} ^{(1)},\mathbf {x} ^{(2)},\ldots ,\mathbf {x} ^{(N)}}la densidadPAG(y(incógnita(1)),y(incógnita(2)),,y(incógnita(norte))){\displaystyle P(y(\mathbf {x} ^{(1)}),y(\mathbf {x} ^{(2)}),\ldots ,y(\mathbf {x} ^{(N)}))}es una gaussiana
  2. Dudley, RM (1989). Análisis real y probabilidad . Wadsworth and Brooks/Cole. ISBN 0-534-10050-3.
  3. Hida, Takeyuki; Hitsuda, Masuyuki (1976). Procesos gaussianos . Providence, Rhode Island: American Mathematical Society. pp. 37–52 . 
  4. Kac, M.; Siegert, AJF (1947). "Una representación explícita de un proceso gaussiano estacionario" . The Annals of Mathematical Statistics . 18 (3): 438– 442. doi : 10.1214/aoms/1177730391 .
  5. Bishop, CM (2006). Reconocimiento de patrones y aprendizaje automático . Springer . ISBN 978-0-387-31073-2.
  6. 1 2 3 Barber, David (2012). Razonamiento bayesiano y aprendizaje automático . Cambridge University Press . ISBN 978-0-521-51814-7.
  7. 1 2 3 4 5 6 Rasmussen, CE; Williams, CKI (2006). Procesos gaussianos para el aprendizaje automático . MIT Press . ISBN 978-0-262-18253-9.
  8. Grimmett, Geoffrey; David Stirzaker (2001). Probabilidad y procesos aleatorios . Oxford University Press . ISBN 978-0198572220.
  9. Seeger, Matthias (2004). "Procesos gaussianos para el aprendizaje automático". Revista internacional de sistemas neuronales . 14 (2): 69– 104. CiteSeerX 10.1.1.71.1079 . doi : 10.1142/s0129065704001899 . PMID 15112367. S2CID 52807317 .   
  10. Dudley, RM (1975). "El proceso gaussiano y cómo abordarlo" (PDF) . Actas del Congreso Internacional de Matemáticos . Vol. 2. págs. 143–146 .  
  11. Banerjee, Sudipto; Gelfand, Alan E. (2003). "Sobre las propiedades de suavidad de los procesos espaciales" . Journal of Multivariate Analysis . 84 (1): 85– 100. Bibcode : 2003JMA....84...85B . doi : 10.1016/S0047-259X(02)00016-7 .
  12. Dudley, RM (2010). "Funciones de muestra del proceso gaussiano" . Obras selectas de RM Dudley . Vol. 1. págs. 66–103 . doi : 10.1007/978-1-4419-5821-1_13 . ISBN   978-1-4419-5820-4.{{cite book}}: |journal=ignorado ( ayuda )
  13. ^ Talagrand, Michel (2014). Límites superior e inferior de procesos estocásticos: métodos modernos y problemas clásicos . Ergebnisse der Mathematik und ihrer Grenzgebiete. 3. Folge / Una serie de estudios modernos en matemáticas. Springer, Heidelberg. ISBN 978-3-642-54074-5.
  14. Ledoux, Michel (1996), "Isoperimetría y análisis gaussiano", en Dobrushin, Roland; Groeneboom, Piet; Ledoux, Michel (eds.), Lectures on Probability Theory and Statistics: Ecole d'Eté de Probabilités de Saint-Flour XXIV–1994 , Lecture Notes in Mathematics, vol. 1648, Berlín: Springer, pp. 165– 294, doi : 10.1007/BFb0095676 , ISBN   978-3-540-62055-6, MR 1600888 
  15. Adler, Robert J. (1990). Introducción a la continuidad, los extremos y temas relacionados para procesos gaussianos generales . Vol. 12. Hayward, California: Institute of Mathematical Statistics. ISBN  0-940600-17-X. JSTOR 4355563 . MR 1088478 .  {{cite book}}: |journal=ignorado ( ayuda )
  16. Berman, Simeon M. (1992). "Reseña de: Adler 1990 'Una introducción a la continuidad...'". Reseñas Matemáticas . MR 1088478 . 
  17. 1 2 Dudley, RM (1967). "Los tamaños de subconjuntos compactos del espacio de Hilbert y la continuidad de los procesos gaussianos" . Journal of Functional Analysis . 1 (3): 290– 330. doi : 10.1016/0022-1236(67)90017-1 .
  18. 1 2 Marcus, MB; Shepp, Lawrence A. (1972). "Comportamiento de la muestra de procesos gaussianos" . Actas del sexto simposio de Berkeley sobre estadística matemática y probabilidad, vol. II: teoría de la probabilidad . Vol. 6. Univ. California, Berkeley. pp. 423–441 .  
  19. 1 2 Marcus, Michael B.; Shepp, Lawrence A. (1970). "Continuidad de los procesos gaussianos" . Transactions of the American Mathematical Society . 151 (2): 377– 391. doi : 10.1090/s0002-9947-1970-0264749-1 . JSTOR 1995502 . 
  20. ^ Azmoodeh, Ehsan; Sottinen, Tommi; Viitasaari, Lauri; Yazigi, Adil (2014). "Condiciones necesarias y suficientes para la continuidad de Hölder de los procesos gaussianos". Cartas de estadística y probabilidad . 94 : 230–235 . arXiv : 1403.2215 . doi : 10.1016/j.spl.2014.07.030 .
  21. ^ Driscoll, Michael F. (1973). "La estructura espacial de Hilbert del núcleo reproductor de las rutas de muestra de un proceso gaussiano" . Zeitschrift für Wahrscheinlichkeitstheorie und Verwandte Gebiete . 26 (4): 309– 316. doi : 10.1007/BF00534894 . ISSN 0044-3719 . S2CID 123348980 .  
  22. Jidling, Carl; Wahlström, Niklas; Wills, Adrian; Schön, Thomas B. (2017-09-19). "Procesos gaussianos con restricciones lineales". arXiv : 1703.00787 [ stat.ML ].
  23. La documentación de scikit-learn también tiene ejemplos similares .
  24. Liu, W.; Principe, JC; Haykin, S. (2010). Kernel Adaptive Filtering: A Comprehensive Introduction . John Wiley . ISBN 978-0-470-44753-6Archivado del original el 4 de marzo de 2016. Consultado el 26 de marzo de 2010 .
  25. Álvarez, Mauricio A.; Rosasco, Lorenzo; Lawrence, Neil D. (2012). "Núcleos para funciones con valores vectoriales: una revisión" (PDF) . Fundamentos y tendencias en aprendizaje automático . 4 (3): 195– 266. doi : 10.1561/2200000036 . S2CID 456491 . 
  26. Chen, Zexun; Wang, Bo; Gorban, Alexander N. (2019). "Regresión de procesos gaussianos y t de Student multivariados para predicción de múltiples salidas" . Neural Computing and Applications . 32 (8): 3005– 3028. arXiv : 1703.04455 . doi : 10.1007/s00521-019-04687-8 .
  27. Stein, ML (1999). Interpolación de datos espaciales: algo de teoría para Kriging . Springer .
  28. Saves, Paul; Diouane, Youssef; Bartoli, Nathalie; Lefebvre, Thierry; Morlier, Joseph (2023). "Un núcleo de correlación de categorías mixtas para procesos gaussianos". Neurocomputing . 550 126472. arXiv : 2211.08262 . doi : 10.1016/j.neucom.2023.126472 .
  29. Platanios, Emmanouil A.; Chatzis, Sotirios P. (2014). "Heterocedasticidad condicional de mezcla de procesos gaussianos". IEEE Transactions on Pattern Analysis and Machine Intelligence . 36 (5): 888– 900. Bibcode : 2014ITPAM..36..888P . doi : 10.1109/TPAMI.2013.183 . PMID 26353224 . S2CID 10424638 .  
  30. Chatzis, Sotirios P. (2013). "Un modelo de proceso gaussiano de variable latente con priors de proceso de Pitman-Yor para clasificación multiclase". Neurocomputing . 120 : 482–489 . doi : 10.1016/j.neucom.2013.04.029 .
  31. 1 2 3 Banerjee, Sudipto (2017). " Geoestadística bayesiana de alta dimensión" . Análisis bayesiano . 12 (2): 583– 614. doi : 10.1214/17-BA1056R . PMC 5790125. PMID 29391920 .  
  32. Smola, AJ; Schoellkopf, B. (2000). "Aproximación de matriz voraz dispersa para aprendizaje automático". Actas de la Decimoséptima Conferencia Internacional sobre Aprendizaje Automático : 911–918 . CiteSeerX 10.1.1.43.3153 . 
  33. Csato, L.; Opper, M. (2002). "Procesos gaussianos dispersos en línea". Neural Computation . 14 (3): 641– 668. Bibcode : 2002NeCom..14..641C . CiteSeerX 10.1.1.335.9713 . doi : 10.1162/089976602317250933 . PMID 11860686 . S2CID 11375333 .   
  34. Banerjee, Sudipto; Gelfand, Alan E.; Finley, Andrew O.; Sang, Huiyan (2008). "Modelos de procesos predictivos gaussianos para grandes conjuntos de datos espaciales" . Journal of the Royal Statistical Society, Serie B (Metodología estadística) . 70 (4): 825– 848. doi : 10.1111/j.1467-9868.2008.00663.x . PMC 2741335. PMID 19750209 .  
  35. Lee, Se Yoon; Mallick, Bani (2021). "Modelado jerárquico bayesiano: aplicación a los resultados de producción en el esquisto Eagle Ford del sur de Texas" . Sankhya B. 84 : 1–43 . doi : 10.1007 /s13571-020-00245-8 .
  36. 1 2 Datta, Abhirup; Banerjee, Sudipto; Finley, Andrew; Gelfand, Alan (2016). "Modelos jerárquicos de procesos gaussianos del vecino más cercano para grandes datos espaciales" . Journal of the American Statistical Association . 111 (514): 800– 812. doi : 10.1080/01621459.2015.1044091 . PMC 5927603. PMID 29720777 .  
  37. Ranftl, Sascha; Melito, Gian Marco; Badeli, Vahid; Reinbacher-Köstinger, Alice; Ellermann, Katrin; von der Linden, Wolfgang (2019-12-31). "Cuantificación de la incertidumbre bayesiana con datos de multifidelidad y procesos gaussianos para la cardiografía de impedancia de la disección aórtica" . Entropy . 22 ( 1): 58. Bibcode : 2019Entrp..22...58R . doi : 10.3390/e22010058 . ISSN 1099-4300 . PMC 7516489. PMID 33285833 .   
  38. Novak, Roman; Xiao, Lechao; Hron, Jiri; Lee, Jaehoon; Alemi, Alexander A.; Sohl-Dickstein, Jascha; Schoenholz, Samuel S. (2020). "Neural Tangents: Fast and Easy Infinite Neural Networks in Python". Conferencia Internacional sobre Representaciones de Aprendizaje . arXiv : 1912.02803 .
  39. Neal, Radford M. (2012). Aprendizaje bayesiano para redes neuronales . Springer Science and Business Media.
  40. Moss, Henry B.; Griffiths, Ryan-Rhys (2020), Predicción de propiedades moleculares mediante procesos gaussianos con FlowMO , arXiv : 2010.01118
  41. Griffiths, Ryan-Rhys (2022). Aplicaciones de procesos gaussianos en escalas de longitud extremas: de moléculas a agujeros negros (tesis doctoral). Universidad de Cambridge. arXiv : 2303.14291 . doi : 10.17863/CAM.93643 .
  42. Shanks, BL; Sullivan, HW; Shazed, AR; Hoepfner, MP (2024). "Inferencia bayesiana acelerada para simulaciones moleculares utilizando modelos sustitutos de procesos gaussianos locales" . Journal of Chemical Theory and Computation . 20 (9): 3798– 3808. arXiv : 2310.19108 . Bibcode : 2024JCTC...20.3798S . doi : 10.1021/acs.jctc.3c01358 . PMID 38551198 . 
  43. Morris, Brett M; Bobra, Monica G; Agol, Eric; Lee, Yu Jin; Hawley, Suzanne L (2020-04-21). "El nivel de ruido de la variabilidad estelar para la fotometría de exoplanetas en tránsito con PLATO" . Monthly Notices of the Royal Astronomical Society . 493 (4): 5489– 5498. arXiv : 2002.08072 . doi : 10.1093/mnras/staa618 . ISSN 0035-8711 . 
  44. Rajpaul, V.; Aigrain, S.; Osborne, MA; Reece, S.; Roberts, S. (2015-09-21). "Un marco de proceso gaussiano para modelar señales de actividad estelar en datos de velocidad radial" . Monthly Notices of the Royal Astronomical Society . 452 (3): 2269– 2291. arXiv : 1506.07304 . doi : 10.1093/mnras/stv1428 . ISSN 0035-8711 . 
  45. 1 2 3 4 5 Aigrain, Suzanne; Foreman-Mackey, Daniel (2023). "Regresión de procesos gaussianos para series temporales astronómicas" . Annual Review of Astronomy and Astrophysics . 61 : 350–359 . arXiv : 2209.08940 . Bibcode : 2023ARA & A..61..329A . doi : 10.1146/annurev-astro-052920-103508 .
  46. Barragán, O; Aigrain, S; Kubyshkina, D; Gandolfi, D; Livingston, J; Fridlund, MCV; Fossati, L; Korth, J; Parviainen, H; Malavolta, L; Palle, E; Deeg, HJ; Nowak, G; Rajpaul, VM; Zicher, N (2019-11-21). "Confirmación de velocidad radial de K2-100b: un Neptuno caliente en tránsito joven, altamente irradiado y de baja densidad" . Monthly Notices of the Royal Astronomical Society . 490 (1): 698– 708. arXiv : 1909.05252 . doi : 10.1093/mnras/stz2569 . ISSN 0035-8711 . 
  47. Haywood, RD; Collier Cameron, A.; Queloz, D.; Barros, SCC; Deleuil, M.; Fares, R.; Gillon, M.; Lanza, AF; Lovis, C.; Moutou, C.; Pepe, F.; Pollacco, D.; Santerne, A.; Ségransan, D.; Unruh, YC (2014-09-21). "Planetas y actividad estelar: el escondite en el sistema CoRoT-7★" . Monthly Notices of the Royal Astronomical Society . 443 (3): 2517– 2531. arXiv : 1407.1044 . doi : 10.1093/mnras/stu1320 . ISSN 1365-2966 . 
  48. Aigrain, S.; Pont, F.; Zucker, S. (2012-02-01). "Un método simple para estimar las variaciones de velocidad radial debidas a la actividad estelar utilizando fotometría" . Monthly Notices of the Royal Astronomical Society . 419 (4): 3147– 3158. arXiv : 1110.1034 . Bibcode : 2012MNRAS.419.3147A . doi : 10.1111/j.1365-2966.2011.19960.x . ISSN 0035-8711 . 
  49. Nicholson, BA; Aigrain, S (18 de agosto de 2022). "Procesos gaussianos cuasiperiódicos para la actividad estelar: De los parámetros físicos a los del núcleo" . Monthly Notices of the Royal Astronomical Society . 515 (4): 5251– 5266. doi : 10.1093/mnras/stac2097 . ISSN 0035-8711 . 
  50. Kozłowski, Szymon; Kochanek, Christopher S.; Udalski, A.; Wyrzykowski, ł.; Soszyński, I.; Szymanski, MK; Kubiak, M.; Pietrzyński, G.; Szewczyk, O.; Ulaczyk, K.; Poleski, R.; La colaboración OGLE (10 de enero de 2010). "Cuantificar la variabilidad de los cuásares como parte de un enfoque general para clasificar fuentes que varían continuamente" . La revista astrofísica . 708 (2): 927– 945. arXiv : 0909.1326 . Código Bib : 2010ApJ...708..927K . doi : 10.1088/0004-637X/708/2/927 . ISSN 0004-637X . 
  51. MacLeod, CL; Ivezić, ž.; Kochanek, CS; Kozłowski, S.; Kelly, B.; Bullock, E.; Kimball, A.; Sesar, B.; Westman, D.; Brooks, K.; Gibson, R.; Becker, AC; de Vries, WH (2010-10-01). "Modelado de la variabilidad temporal de los cuásares de la franja 82 del SDSS como un paseo aleatorio amortiguado" . The Astrophysical Journal . 721 (2): 1014– 1033. arXiv : 1004.0276 . Bibcode : 2010ApJ...721.1014M . doi : 10.1088/0004-637X/721/2/1014 . ISSN 0004-637X . 
  52. Abbott, R.; Abbott, TD; Abraham, S.; Acernese, F.; Ackley, K.; Adams, C.; Adhikari, RX; Adya, VB; Affeldt, C.; Agathos, M.; Agatsuma, K.; Aggarwal, N.; Aguiar, OD; Aich, A.; Aiello, L. (2020-06-01). "GW190814: Ondas gravitacionales de la coalescencia de un agujero negro de 23 masas solares con un objeto compacto de 2,6 masas solares" . The Astrophysical Journal Letters . 896 (2): L44. arXiv : 2006.12611 . Bibcode : 2020ApJ...896L..44A . doi : 10.3847/2041-8213/ab960f . ISSN 2041-8205 . 
  53. Lochner, Michelle; McEwen, Jason D.; Peiris, Hiranya V.; Lahav, Ofer; Winter, Max K. (2016-08-01). "Clasificación fotométrica de supernovas con aprendizaje automático" . The Astrophysical Journal Supplement Series . 225 (2): 31. arXiv : 1603.00882 . Bibcode : 2016ApJS..225...31L . doi : 10.3847/0067-0049/225/2/31 . ISSN 0067-0049 . 
  54. Yang, Shenbang; Yan, Dahai; Zhang, Pengfei; Dai, Benzhong; Zhang, Li (2021-02-01). "Modelado de procesos gaussianos de la variabilidad de los blázares de rayos gamma de Fermi-LAT: una muestra de blázares con cuasiperiodicidades de rayos gamma" . The Astrophysical Journal . 907 (2): 105. arXiv : 2011.10186 . Bibcode : 2021ApJ...907..105Y . doi : 10.3847/1538-4357/abcbff . ISSN 0004-637X . 
  55. van Haasteren, Rutger; Vallisneri, Michele (11 de noviembre de 2014). "Nuevos avances en el enfoque de procesos gaussianos para el análisis de datos de cronometraje de púlsares" . Physical Review D. 90 ( 10) 104012. arXiv : 1407.1838 . Bibcode : 2014PhRvD..90j4012V . doi : 10.1103/PhysRevD.90.104012 . ISSN 1550-7998 . 

Literatura

  • El sitio web de Procesos Gaussianos, que incluye el texto de Procesos Gaussianos para el Aprendizaje Automático de Rasmussen y Williams.
  • Ebden, Mark (2015). "Procesos gaussianos: una introducción rápida". arXiv : 1505.02965 [ math.ST ].
  • Una revisión de campos aleatorios gaussianos y funciones de correlación
  • Aprendizaje por refuerzo eficiente mediante procesos gaussianos

Software

  • GPML: Una completa caja de herramientas de Matlab para regresión y clasificación mediante procesos gaussianos.
  • STK: una pequeña caja de herramientas (Matlab/Octave) para modelado Kriging y GP
  • Módulo de Kriging en el entorno UQLab (Matlab)
  • Caja de herramientas CODES: implementaciones de Kriging, Kriging variacional y modelos de multifidelidad (Matlab)
  • Función de Matlab/Octave para campos gaussianos estacionarios
  • Yelp MOE: un motor de optimización de caja negra que utiliza aprendizaje por procesos gaussianos.
  • ooDACE Archivado el 9 de agosto de 2020 en Wayback Machine : una caja de herramientas flexible de Matlab para Kriging orientado a objetos.
  • GPstuff: caja de herramientas de procesos gaussianos para Matlab y Octave.
  • GPy: un marco de trabajo para procesos gaussianos en Python.
  • GSTools: una caja de herramientas geoestadísticas, que incluye regresión de procesos gaussianos, escrita en Python.
  • Demostración interactiva de regresión mediante procesos gaussianos
  • Librería básica de procesos gaussianos escrita en C++11
  • scikit-learn : una biblioteca de aprendizaje automático para Python que incluye regresión y clasificación mediante procesos gaussianos.
  • La biblioteca de optimización SAMBO para Python admite la optimización secuencial impulsada por el regresor de procesos gaussianos de scikit-learn .
  • - El kit de herramientas Kriging (KriKit) se desarrolla en el Instituto de Biociencias y Geociencias 1 (IBG-1) del Forschungszentrum Jülich (FZJ)

videotutoriales

  • Conceptos básicos del proceso gaussiano por David MacKay
  • Aprendizaje con procesos gaussianos por Carl Edward Rasmussen
  • Inferencia bayesiana y procesos gaussianos por Carl Edward Rasmussen