En la teoría matemática de la probabilidad, el proceso de Wiener , que recibe su nombre de Norbert Wiener , es un proceso estocástico utilizado para modelar diversos fenómenos, como el movimiento browniano y las fluctuaciones en los mercados financieros. Una fórmula para la distribución de probabilidad condicional del extremo del proceso de Wiener y un esbozo de su demostración aparecen en la obra de H. J. Kusher (apéndice 3, página 106), publicada en 1964. [ 1 ] Una demostración constructiva detallada aparece en la obra de Dario Ballabio en 1978. [ 2 ] Este resultado se desarrolló dentro de un proyecto de investigación sobre algoritmos de optimización bayesiana .
En algunos problemas de optimización global, la definición analítica de la función objetivo es desconocida y solo es posible obtener valores en puntos fijos. Existen funciones objetivo en las que el coste de una evaluación es muy elevado, por ejemplo, cuando la evaluación es el resultado de un experimento o una medición particularmente onerosa. En estos casos, la búsqueda del extremo global (máximo o mínimo) puede llevarse a cabo mediante una metodología denominada " optimización bayesiana ", que tiende a obtener a priori el mejor resultado posible con un número predeterminado de evaluaciones. En resumen, se supone que, fuera de los puntos en los que ya se ha evaluado, la función objetivo presenta un patrón que puede representarse mediante un proceso estocástico con características apropiadas. El proceso estocástico se toma como modelo de la función objetivo, asumiendo que la distribución de probabilidad de sus extremos proporciona la mejor indicación sobre los extremos de la función objetivo. En el caso más simple de la optimización unidimensional, dado que la función objetivo se ha evaluado en varios puntos, surge el problema de elegir en cuál de los intervalos así identificados es más apropiado invertir en una evaluación posterior. Si se elige un proceso estocástico de Wiener como modelo para la función objetivo, es posible calcular la distribución de probabilidad de los puntos extremos del modelo dentro de cada intervalo, condicionada por los valores conocidos en los límites del intervalo. La comparación de las distribuciones obtenidas proporciona un criterio para seleccionar el intervalo en el que debe iterarse el proceso. El valor de probabilidad de haber identificado el intervalo en el que cae el punto extremo global de la función objetivo puede utilizarse como criterio de parada. La optimización bayesiana no es un método eficiente para la búsqueda precisa de extremos locales, por lo que, una vez restringido el rango de búsqueda, según las características del problema, se puede utilizar un método de optimización local específico.
Proposición
Dejarsea un proceso estocástico de Wiener en un intervalocon valor inicial
Por definición del proceso de Wiener , los incrementos tienen una distribución normal :
Dejar
sea la función de distribución de probabilidad acumulada del valor mínimo de lafunción en intervalocondicionado por el valor
Se demuestra que: [ 1 ] [ 3 ] [ nota 1 ]
Prueba constructiva
Casoes una consecuencia inmediata de la definición mínima, en lo sucesivo siempre se asumiráy también caso excepcionalquedará excluido.
Supongamos quedefinido en un número finito de puntos.
Dejar variando el número enteroser una secuencia de conjuntosde tal manera que yser un conjunto denso en,
por lo tanto cada vecindario de cada punto encontiene un elemento de uno de los conjuntos.
Dejarsea un número real positivo tal que
Que el eventoser definido como:.
Habiendo excluido el caso excepcional, seguramente lo es.
DejarLos eventos se definen como:y dejarser la primera k entre losque definen.
Desdees evidente. Ahora se demostrará la ecuación (2.1) .
(2.1)
Por eldefinición de eventos,, por eso Ahora se verificará la relaciónPor lo tanto , (2.1) quedará demostrado.
La definición de , la continuidad dey la hipótesisimplican, por el teorema del valor intermedio , .
Por la continuidad dey la hipótesis de que es denso enSe deduce quede tal manera que paradebe ser,
por esolo cual implica (2.1) .
(2.2)
(2.2) se deduce de (2.1) , considerando queimplica que la secuencia de probabilidadeses monótona no decreciente y por lo tanto converge a su supremo . La definición de eventosimplicay (2.2) implica.
En lo que sigue siempre se asumirá, entoncesestá bien definido.
(2.3)
De hecho, por definición de es , entonces.
De manera similar, puesto que por definición dees, (2.4) es válido:
(2.4)
(2.5)
Lo anterior se explica por el hecho de que la variable aleatoria ;\ \ \sigma ^{2}(b-t_{\nu }))} tiene una densidad de probabilidad simétrica en comparación con su media, que es cero.
Aplicando en secuencia las relaciones (2.3) , (2.5) y (2.4) obtenemos (2.6) :
(2.6)
Con el mismo procedimiento utilizado para obtener (2.3) , (2.4) y (2.5), aprovechando esta vez la relaciónobtenemos (2.7) :
(2.7)
Aplicando en secuencia (2.6) y ( 2.7) obtenemos:
(2.8)
De, considerando la continuidad dey el teorema del valor intermedio obtenemos ,
lo cual implica .
Sustituyendo lo anterior en (2.8) y pasando a los límites:y para , eventoconverge a
(2.9)
, sustituyendoconEn (2.9) obtenemos la relación equivalente:
(2.10)
Aplicación del teorema de Bayes al evento conjunto
(2.11)
Dejar: De las definiciones anteriores se deduce:
(2.12)
Sustituyendo (2.12) en (2.11) , obtenemos el equivalente:
(2.13)
Sustituyendo (2.9) y (2.10) en (2.13):
(2.14)
Se puede observar que en el segundo miembro de (2.14) aparece la distribución de probabilidad de la variable aleatoria., normal con mediae varianza.
Las conclusionesyde la variable aleatoriaque coincidan respectivamente las densidades de probabilidad:
(2.15)
(2.16)
Sustituyendo (2.15) y (2.16) en (2.14) y tomando el límite para La tesis queda demostrada:
Bibliografía
- Un modelo estocástico versátil de una función de forma desconocida y variable en el tiempo - Harold J Kushner - Journal of Mathematical Analysis and Applications Volumen 5, Número 1, agosto de 1962, Páginas 150-167.
- Aplicación de métodos bayesianos para la búsqueda de extremos - J. Mockus, J. Tiesis, A. Zilinskas - Congreso IFIP 1977, 8-12 de agosto, Toronto.
Véase también
Notas
- ↑ El teorema, tal como se expone y demuestra para el caso del mínimo del proceso de Wiener, también se aplica al máximo.
Referencias
- 1 2 H. J. Kushner, "Un nuevo método para localizar el punto máximo de una curva multipico arbitraria en presencia de ruido", J. Basic Eng 86(1), 97–106 (1 de marzo de 1964).
- ^ Dario Ballabio, "Una nuova classe di algoritmi stocastici per l'ottimizzazione globale" (Una nueva clase de algoritmos estocásticos para la optimización global), Universidad de Milán, Instituto de Matemáticas, tesis doctoral presentada el 12 de julio de 1978, págs.
- ↑ János D. Pintér, Optimización global en acción: optimización continua y de Lipschitz, 1996 Springer Science & Business Media , página 57.
- Proceso de Wiener