Articulo de referencia

Red de funciones de base radial

En el campo del modelado matemático , una red de funciones de base radial es una red neuronal artificial que utiliza funciones de base radial como funciones de activación . La s...

En el campo del modelado matemático , una red de funciones de base radial es una red neuronal artificial que utiliza funciones de base radial como funciones de activación . La salida de la red es una combinación lineal de funciones de base radial de las entradas y los parámetros neuronales. Las redes de funciones de base radial tienen muchos usos, incluyendo la aproximación de funciones , la predicción de series temporales , la clasificación y el control de sistemas . Fueron formuladas por primera vez en un artículo de 1988 por Broomhead y Lowe, ambos investigadores del Royal Signals and Radar Establishment . [ 1 ] [ 2 ] [ 3 ]

Arquitectura de red

Arquitectura de una red de funciones de base radial. Un vector de entrada.incógnita{\displaystyle x}Se utiliza como entrada para todas las funciones de base radial, cada una con parámetros diferentes. La salida de la red es una combinación lineal de las salidas de las funciones de base radial.

Las redes de funciones de base radial (RBF) suelen tener tres capas: una capa de entrada, una capa oculta con una función de activación RBF no lineal y una capa de salida lineal. La entrada se puede modelar como un vector de números reales.incógnitaRnorte{\displaystyle \mathbf {x} \in \mathbb {R} ^{n}}. La salida de la red es entonces una función escalar del vector de entrada,φ:RnorteR{\displaystyle \varphi :\mathbb {R} ^{n}\to \mathbb {R} } , y está dado por

φ(incógnita)=i=1norteaiρ(||incógnitadoi||){\displaystyle \varphi (\mathbf {x} )=\sum _{i=1}^{N}a_{i}\rho (||\mathbf {x} -\mathbf {c} _{i}||)}

dóndenorte{\displaystyle N}es el número de neuronas en la capa oculta,doi{\displaystyle \mathbf {c} _{i}}es el vector central para la neuronai{\displaystyle i}, yai{\displaystyle a_{i}}es el peso de la neuronai{\displaystyle i}En la neurona de salida lineal. Las funciones que dependen únicamente de la distancia a un vector central son radialmente simétricas respecto a ese vector, de ahí el nombre de función de base radial. En su forma básica, todas las entradas están conectadas a cada neurona oculta. La norma suele ser la distancia euclidiana (aunque la distancia de Mahalanobis parece funcionar mejor con el reconocimiento de patrones [ 4 ] [ 5 ] ) y la función de base radial suele ser gaussiana.

ρ(incógnitadoi)=exp[βiincógnitadoi2]{\displaystyle \rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}=\exp \left[-\beta _{i}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert ^{2}\right]}.

Las funciones base gaussianas son locales al vector central en el sentido de que

límite||incógnita||ρ(incógnitadoi)=0{\displaystyle \lim _{||x||\to \infty }\rho (\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert )=0}

Es decir, cambiar los parámetros de una neurona tiene solo un pequeño efecto para los valores de entrada que están lejos del centro de esa neurona.

Dadas ciertas condiciones suaves sobre la forma de la función de activación, las redes RBF son aproximadores universales en un subconjunto compacto deRnorte{\displaystyle \mathbb {R} ^{n}}. [ 6 ] Esto significa que una red RBF con suficientes neuronas ocultas puede aproximar cualquier función continua en un conjunto cerrado y acotado con precisión arbitraria.

Los parámetrosai{\displaystyle a_{i}},doi{\displaystyle \mathbf {c} _{i}}, yβi{\displaystyle \beta _{i}}se determinan de manera que se optimice el ajuste entreφ{\displaystyle \varphi }y los datos.

Dos funciones de base radial no normalizadas en una dimensión de entrada. Los centros de las funciones de base se encuentran endo1=0,75{\displaystyle c_{1}=0.75}ydo2=3.25{\displaystyle c_{2}=3.25}.

Normalización

Dos funciones de base radial normalizadas en una dimensión de entrada ( sigmoides ). Los centros de las funciones de base se encuentran endo1=0,75{\displaystyle c_{1}=0.75}ydo2=3.25{\displaystyle c_{2}=3.25}.
Tres funciones de base radial normalizadas en una dimensión de entrada. La función de base adicional tiene centro endo3=2,75{\displaystyle c_{3}=2.75}.
Cuatro funciones de base radial normalizadas en una dimensión de entrada. La cuarta función de base tiene su centro endo4=0{\displaystyle c_{4}=0}Nótese que la primera función base (azul oscuro) se ha localizado.

Arquitectura normalizada

Además de la arquitectura no normalizada anterior , las redes RBF pueden normalizarse . En este caso, el mapeo es

φ(incógnita) =dmiF i=1norteaiρ(incógnitadoi)i=1norteρ(incógnitadoi)=i=1norteai(incógnitadoi){\displaystyle \varphi (\mathbf {x} )\ {\stackrel {\mathrm {def} }{=}}\ {\frac {\sum _{i=1}^{N}a_{i}\rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}}{\sum _{i=1}^{N}\rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}}}=\sum _{i=1}^{N}a_{i}u{\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}}

dónde

(incógnitadoi) =dmiF ρ(incógnitadoi)j=1norteρ(incógnitadoj){\displaystyle u{\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}\ {\stackrel {\mathrm {def} }{=}}\ {\frac {\rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}}{\sum _{j=1}^{N}\rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{j}\right\Vert {\big )}}}}

se conoce como una función de base radial normalizada .

Motivación teórica para la normalización

Existe una justificación teórica para esta arquitectura en el caso de flujo de datos estocástico. Supongamos una aproximación de núcleo estocástico para la densidad de probabilidad conjunta.

PAG(incógnitay)=1nortei=1norteρ(incógnitadoi)σ(|ymii|){\displaystyle P\left(\mathbf {x} \land y\right)={1 \over N}\sum _{i=1}^{N}\,\rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}\,\sigma {\big (}\left\vert y-e_{i}\right\vert {\big )}}

donde los pesosdoi{\displaystyle \mathbf {c} _{i}} ymii{\displaystyle e_{i}}son ejemplos de los datos y requerimos que los núcleos estén normalizados

ρ(incógnitadoi)dnorteincógnita=1{\displaystyle \int \rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}\,d^{n}\mathbf {x} =1}

y

σ(|ymii|)dy=1{\displaystyle \int \sigma {\big (}\left\vert y-e_{i}\right\vert {\big )}\,dy=1}.

Las densidades de probabilidad en los espacios de entrada y salida son

PAG(incógnita)=PAG(incógnitay)dy=1nortei=1norteρ(incógnitadoi){\displaystyle P\left(\mathbf {x} \right)=\int P\left(\mathbf {x} \land y\right)\,dy={1 \over N}\sum _{i=1}^{N}\,\rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}}

y

La esperanza de y dado un valor de entradaincógnita{\displaystyle \mathbf {x} }es

φ(incógnita) =dmiF mi(yincógnita)=yPAG(yincógnita)dy{\displaystyle \varphi \left(\mathbf {x} \right)\ {\stackrel {\mathrm {def} }{=}}\ E\left(y\mid \mathbf {x} \right)=\int y\,P\left(y\mid \mathbf {x} \right)dy}

dónde

PAG(yincógnita){\displaystyle P\left(y\mid \mathbf {x} \right)}

es la probabilidad condicional de y dadoincógnita{\displaystyle \mathbf {x} }La probabilidad condicional está relacionada con la probabilidad conjunta a través del teorema de Bayes .

PAG(yincógnita)=PAG(incógnitay)PAG(incógnita){\displaystyle P\left(y\mid \mathbf {x} \right)={\frac {P\left(\mathbf {x} \land y\right)}{P\left(\mathbf {x} \right)}}}

lo cual produce

φ(incógnita)=yPAG(incógnitay)PAG(incógnita)dy{\displaystyle \varphi \left(\mathbf {x} \right)=\int y\,{\frac {P\left(\mathbf {x} \land y\right)}{P\left(\mathbf {x} \right)}}\,dy}.

Esto se convierte en

φ(incógnita)=i=1nortemiiρ(incógnitadoi)i=1norteρ(incógnitadoi)=i=1nortemii(incógnitadoi){\displaystyle \varphi \left(\mathbf {x} \right)={\frac {\sum _{i=1}^{N}e_{i}\rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}}{\sum _{i=1}^{N}\rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}}}=\sum _{i=1}^{N}e_{i}u{\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}}

cuando se realizan las integraciones.

Modelos lineales locales

A veces es conveniente ampliar la arquitectura para incluir modelos lineales locales . En ese caso, las arquitecturas se convierten, en primera aproximación,

φ(incógnita)=i=1norte(ai+bi(incógnitadoi))ρ(incógnitadoi){\displaystyle \varphi \left(\mathbf {x} \right)=\sum _{i=1}^{N}\left(a_{i}+\mathbf {b} _{i}\cdot \left(\mathbf {x} -\mathbf {c} _{i}\right)\right)\rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}}

y

φ(incógnita)=i=1norte(ai+bi(incógnitadoi))(incógnitadoi){\displaystyle \varphi \left(\mathbf {x} \right)=\sum _{i=1}^{N}\left(a_{i}+\mathbf {b} _{i}\cdot \left(\mathbf {x} -\mathbf {c} _{i}\right)\right)u{\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}}

en los casos no normalizados y normalizados, respectivamente. Aquíbi{\displaystyle \mathbf {b} _{i}}son pesos por determinar. También son posibles términos lineales de orden superior.

Este resultado se puede escribir

φ(incógnita)=i=12nortej=1nortemiijvij(incógnitadoi){\displaystyle \varphi \left(\mathbf {x} \right)=\sum _{i=1}^{2N}\sum _{j=1}^{n}e_{ij}v_{ij}{\big (}\mathbf {x} -\mathbf {c} _{i}{\big )}}

dónde

miij={ai,si i[1,norte]bij,si i[norte+1,2norte]{\displaystyle e_{ij}={\begin{cases}a_{i},&{\mbox{if }}i\in [1,N]\\b_{ij},&{\mbox{if }}i\in [N+1,2N]\end{cases}}}

y

vij(incógnitadoi) =dmiF {δijρ(incógnitadoi),si i[1,norte](incógnitaijdoij)ρ(incógnitadoi),si i[norte+1,2norte]{\displaystyle v_{ij}{\big (}\mathbf {x} -\mathbf {c} _{i}{\big )}\ {\stackrel {\mathrm {def} }{=}}\ {\begin{cases}\delta _{ij}\rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )},&{\mbox{if }}i\in [1,N]\\\left(x_{ij}-c_{ij}\right)\rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )},&{\mbox{if }}i\in [N+1,2N]\end{cases}}}

en el caso no normalizado y en el caso normalizado. Aquíδij{\displaystyle \delta _{ij}}es una función delta de Kronecker definida como

δij={1,si i=j0,si ij{\displaystyle \delta _{ij}={\begin{cases}1,&{\mbox{if }}i=j\\0,&{\mbox{if }}i\neq j\end{cases}}}.

Capacitación

Las redes RBF se entrenan típicamente a partir de pares de valores de entrada y objetivo.incógnita(t),y(t){\displaystyle \mathbf {x} (t),y(t)},t=1,,T{\displaystyle t=1,\dots ,T}mediante un algoritmo de dos pasos.

En el primer paso, los vectores centralesdoi{\displaystyle \mathbf {c} _{i}}Se eligen las funciones RBF en la capa oculta. Este paso se puede realizar de varias maneras; los centros se pueden muestrear aleatoriamente de un conjunto de ejemplos o se pueden determinar mediante agrupamiento k-means . Tenga en cuenta que este paso no es supervisado .

El segundo paso simplemente ajusta un modelo lineal con coeficienteswi{\displaystyle w_{i}}a las salidas de la capa oculta con respecto a alguna función objetivo. Una función objetivo común, al menos para la regresión/estimación de funciones, es la función de mínimos cuadrados :

K(w) =dmiF t=1TKt(w){\displaystyle K(\mathbf {w} )\ {\stackrel {\mathrm {def} }{=}}\ \sum _{t=1}^{T}K_{t}(\mathbf {w} )}

dónde

Kt(w) =dmiF [y(t)φ(incógnita(t),w)]2{\displaystyle K_{t}(\mathbf {w} )\ {\stackrel {\mathrm {def} }{=}}\ {\big [}y(t)-\varphi {\big (}\mathbf {x} (t),\mathbf {w} {\big )}{\big ]}^{2}}.

Hemos incluido explícitamente la dependencia de los pesos. La minimización de la función objetivo de mínimos cuadrados mediante la elección óptima de los pesos optimiza la precisión del ajuste.

Hay ocasiones en las que se deben optimizar múltiples objetivos, como la suavidad y la precisión. En ese caso, es útil optimizar una función objetivo regularizada como

H(w) =dmiF K(w)+λS(w) =dmiF t=1THt(w){\displaystyle H(\mathbf {w} )\ {\stackrel {\mathrm {def} }{=}}\ K(\mathbf {w} )+\lambda S(\mathbf {w} )\ {\stackrel {\mathrm {def} }{=}}\ \sum _{t=1}^{T}H_{t}(\mathbf {w} )}

dónde

S(w) =dmiF t=1TSt(w){\displaystyle S(\mathbf {w} )\ {\stackrel {\mathrm {def} }{=}}\ \sum _{t=1}^{T}S_{t}(\mathbf {w} )}

y

Ht(w) =dmiF Kt(w)+λSt(w){\displaystyle H_{t}(\mathbf {w} )\ {\stackrel {\mathrm {def} }{=}}\ K_{t}(\mathbf {w} )+\lambda S_{t}(\mathbf {w} )}

donde la optimización de S maximiza la suavidad yλ{\displaystyle \lambda }se conoce como parámetro de regularización .

Se puede realizar un tercer paso de retropropagación opcional para ajustar con precisión todos los parámetros de la red RBF. [ 3 ]

Interpolación

Las redes RBF se pueden utilizar para interpolar una función.y:RnorteR{\displaystyle y:\mathbb {R} ^{n}\to \mathbb {R} }cuando se conocen los valores de esa función en un número finito de puntos:y(incógnitai)=bi,i=1,,norte{\displaystyle y(\mathbf {x} _{i})=b_{i},i=1,\ldots ,N}Tomando los puntos conocidosincógnitai{\displaystyle \mathbf {x} _{i}}ser los centros de las funciones de base radial y evaluar los valores de las funciones de base en los mismos puntosgramoij=ρ(||incógnitajincógnitai||){\displaystyle g_{ij}=\rho (||\mathbf {x} _{j}-\mathbf {x} _{i}||)}Los pesos se pueden obtener a partir de la ecuación.

[gramo11gramo12gramo1nortegramo21gramo22gramo2nortegramonorte1gramonorte2gramonortenorte][w1w2wnorte]=[b1b2bnorte]{\displaystyle \left[{\begin{matrix}g_{11}&g_{12}&\cdots &g_{1N}\\g_{21}&g_{22}&\cdots &g_{2N}\\\vdots &&\ddots &\vdots \\g_{N1}&g_{N2}&\cdots &g_{NN}\end{matrix}}\right]\left[{\begin{matrix}w_{1}\\w_{2}\\\vdots \\w_{N}\end{matrix}}\right]=\left[{\begin{matrix}b_{1}\\b_{2}\\\vdots \\b_{N}\end{matrix}}\right]}

Se puede demostrar que la matriz de interpolación en la ecuación anterior no es singular, si los puntosincógnitai{\displaystyle \mathbf {x} _{i}}son distintos y, por lo tanto, los pesosw{\displaystyle w}se puede resolver mediante álgebra lineal simple :

w=GRAMO1b{\displaystyle \mathbf {w} =\mathbf {G} ^{-1}\mathbf {b} }

dóndeGRAMO=(gramoij){\displaystyle G=(g_{ij})}.

Aproximación de funciones

Si el objetivo no es realizar una interpolación estricta, sino una aproximación de función más general o una clasificación, la optimización resulta algo más compleja, ya que no existe una opción obvia para los centros. El entrenamiento se suele realizar en dos fases: primero se fijan el ancho y los centros, y luego los pesos. Esto se justifica al considerar la naturaleza diferente de las neuronas ocultas no lineales frente a la neurona de salida lineal.

Formación de los centros de funciones básicas

Los centros de las funciones base pueden muestrearse aleatoriamente entre las instancias de entrada, obtenerse mediante el algoritmo de aprendizaje de mínimos cuadrados ortogonales o encontrarse agrupando las muestras y eligiendo las medias de los grupos como centros.

Los anchos de las funciones de base radial (RBF) suelen estar todos fijados al mismo valor, que es proporcional a la distancia máxima entre los centros elegidos.

Solución pseudoinversa para los pesos lineales

Después de los centrosdoi{\displaystyle c_{i}}Una vez fijados los pesos que minimizan el error en la salida, se pueden calcular con una solución de pseudoinversa lineal:

w=GRAMO+b{\displaystyle \mathbf {w} =\mathbf {G} ^{+}\mathbf {b} },

donde las entradas de G son los valores de las funciones de base radial evaluadas en los puntosincógnitai{\displaystyle x_{i}}:gramoji=ρ(||incógnitajdoi||){\displaystyle g_{ji}=\rho (||x_{j}-c_{i}||)}.

La existencia de esta solución lineal significa que, a diferencia de las redes de perceptrón multicapa (MLP), las redes RBF tienen un minimizador explícito (cuando los centros están fijos).

Entrenamiento de descenso de gradiente de los pesos lineales

Otro posible algoritmo de entrenamiento es el descenso de gradiente . En el entrenamiento por descenso de gradiente, los pesos se ajustan en cada paso de tiempo moviéndolos en una dirección opuesta al gradiente de la función objetivo (lo que permite encontrar el mínimo de la función objetivo).

w(t+1)=w(t)νddwHt(w){\displaystyle \mathbf {w} (t+1)=\mathbf {w} (t)-\nu {\frac {d}{d\mathbf {w} }}H_{t}(\mathbf {w} )}

dóndeν{\displaystyle \nu }es un "parámetro de aprendizaje".

En el caso del entrenamiento de los pesos lineales,ai{\displaystyle a_{i}}, el algoritmo se convierte en

ai(t+1)=ai(t)+ν[y(t)φ(incógnita(t),w)]ρ(incógnita(t)doi){\displaystyle a_{i}(t+1)=a_{i}(t)+\nu {\big [}y(t)-\varphi {\big (}\mathbf {x} (t),\mathbf {w} {\big )}{\big ]}\rho {\big (}\left\Vert \mathbf {x} (t)-\mathbf {c} _{i}\right\Vert {\big )}}

en el caso no normalizado y

ai(t+1)=ai(t)+ν[y(t)φ(incógnita(t),w)](incógnita(t)doi){\displaystyle a_{i}(t+1)=a_{i}(t)+\nu {\big [}y(t)-\varphi {\big (}\mathbf {x} (t),\mathbf {w} {\big )}{\big ]}u{\big (}\left\Vert \mathbf {x} (t)-\mathbf {c} _{i}\right\Vert {\big )}}

en el caso normalizado.

Para arquitecturas lineales locales, el entrenamiento de descenso de gradiente es

miij(t+1)=miij(t)+ν[y(t)φ(incógnita(t),w)]vij(incógnita(t)doi){\displaystyle e_{ij}(t+1)=e_{ij}(t)+\nu {\big [}y(t)-\varphi {\big (}\mathbf {x} (t),\mathbf {w} {\big )}{\big ]}v_{ij}{\big (}\mathbf {x} (t)-\mathbf {c} _{i}{\big )}}

Entrenamiento del operador de proyección de los pesos lineales

En el caso del entrenamiento de los pesos lineales,ai{\displaystyle a_{i}}ymiij{\displaystyle e_{ij}}, el algoritmo se convierte en

ai(t+1)=ai(t)+ν[y(t)φ(incógnita(t),w)]ρ(incógnita(t)doi)i=1norteρ2(incógnita(t)doi){\displaystyle a_{i}(t+1)=a_{i}(t)+\nu {\big [}y(t)-\varphi {\big (}\mathbf {x} (t),\mathbf {w} {\big )}{\big ]}{\frac {\rho {\big (}\left\Vert \mathbf {x} (t)-\mathbf {c} _{i}\right\Vert {\big )}}{\sum _{i=1}^{N}\rho ^{2}{\big (}\left\Vert \mathbf {x} (t)-\mathbf {c} _{i}\right\Vert {\big )}}}}

en el caso no normalizado y

ai(t+1)=ai(t)+ν[y(t)φ(incógnita(t),w)](incógnita(t)doi)i=1norte2(incógnita(t)doi){\displaystyle a_{i}(t+1)=a_{i}(t)+\nu {\big [}y(t)-\varphi {\big (}\mathbf {x} (t),\mathbf {w} {\big )}{\big ]}{\frac {u{\big (}\left\Vert \mathbf {x} (t)-\mathbf {c} _{i}\right\Vert {\big )}}{\sum _{i=1}^{N}u^{2}{\big (}\left\Vert \mathbf {x} (t)-\mathbf {c} _{i}\right\Vert {\big )}}}}

en el caso normalizado y

miij(t+1)=miij(t)+ν[y(t)φ(incógnita(t),w)]vij(incógnita(t)doi)i=1nortej=1nortevij2(incógnita(t)doi){\displaystyle e_{ij}(t+1)=e_{ij}(t)+\nu {\big [}y(t)-\varphi {\big (}\mathbf {x} (t),\mathbf {w} {\big )}{\big ]}{\frac {v_{ij}{\big (}\mathbf {x} (t)-\mathbf {c} _{i}{\big )}}{\sum _{i=1}^{N}\sum _{j=1}^{n}v_{ij}^{2}{\big (}\mathbf {x} (t)-\mathbf {c} _{i}{\big )}}}}

en el caso lineal local.

Para una función base, el entrenamiento del operador de proyección se reduce al método de Newton .

Figura 6: Serie temporal del mapa logístico. La iteración repetida del mapa logístico genera una serie temporal caótica. Los valores oscilan entre cero y uno. Aquí se muestran los 100 puntos de entrenamiento utilizados para entrenar los ejemplos de esta sección. Los pesos c corresponden a los cinco primeros puntos de esta serie temporal.

Ejemplos

Mapa logístico

Las propiedades básicas de las funciones de base radial se pueden ilustrar con un mapa matemático simple, el mapa logístico , que mapea el intervalo unitario sobre sí mismo. Se puede utilizar para generar un flujo de datos prototipo conveniente. El mapa logístico se puede utilizar para explorar la aproximación de funciones , la predicción de series temporales y la teoría de control . El mapa se originó en el campo de la dinámica de poblaciones y se convirtió en el prototipo para las series temporales caóticas . El mapa, en el régimen completamente caótico, viene dado por

incógnita(t+1) =dmiF F[incógnita(t)]=4incógnita(t)[1incógnita(t)]{\displaystyle x(t+1)\ {\stackrel {\mathrm {def} }{=}}\ f\left[x(t)\right]=4x(t)\left[1-x(t)\right]}

donde t es un índice temporal. El valor de x en el instante t+1 es una función parabólica de x en el instante t. Esta ecuación representa la geometría subyacente de la serie temporal caótica generada por el mapa logístico.

La generación de la serie temporal a partir de esta ecuación es el problema directo . Los ejemplos aquí presentados ilustran el problema inverso : la identificación de la dinámica subyacente, o ecuación fundamental, del mapa logístico a partir de ejemplos de la serie temporal. El objetivo es encontrar una estimación.

incógnita(t+1)=F[incógnita(t)]φ(t)=φ[incógnita(t)]{\displaystyle x(t+1)=f\left[x(t)\right]\approx \varphi (t)=\varphi \left[x(t)\right]}

para f.

Aproximación de funciones

Funciones de base radial no normalizadas

La arquitectura es

Figura 7: Funciones base no normalizadas. El mapa logístico (azul) y la aproximación al mapa logístico (rojo) después de una pasada por el conjunto de entrenamiento.
φ(incógnita) =dmiF i=1norteaiρ(incógnitadoi){\displaystyle \varphi (\mathbf {x} )\ {\stackrel {\mathrm {def} }{=}}\ \sum _{i=1}^{N}a_{i}\rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}}

dónde

ρ(incógnitadoi)=exp[βiincógnitadoi2]=exp[βi(incógnita(t)doi)2]{\displaystyle \rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}=\exp \left[-\beta _{i}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert ^{2}\right]=\exp \left[-\beta _{i}\left(x(t)-c_{i}\right)^{2}\right]}.

Dado que la entrada es un escalar en lugar de un vector , la dimensión de entrada es uno. Elegimos el número de funciones base como N=5 y el tamaño del conjunto de entrenamiento como 100 ejemplares generados por la serie temporal caótica. El pesoβ{\displaystyle \beta }se considera una constante igual a 5. Los pesosdoi{\displaystyle c_{i}}son cinco ejemplos de la serie temporal. Los pesosai{\displaystyle a_{i}}están capacitados con la formación de operador de proyección:

ai(t+1)=ai(t)+ν[incógnita(t+1)φ(incógnita(t),w)]ρ(incógnita(t)doi)i=1norteρ2(incógnita(t)doi){\displaystyle a_{i}(t+1)=a_{i}(t)+\nu {\big [}x(t+1)-\varphi {\big (}\mathbf {x} (t),\mathbf {w} {\big )}{\big ]}{\frac {\rho {\big (}\left\Vert \mathbf {x} (t)-\mathbf {c} _{i}\right\Vert {\big )}}{\sum _{i=1}^{N}\rho ^{2}{\big (}\left\Vert \mathbf {x} (t)-\mathbf {c} _{i}\right\Vert {\big )}}}}

donde la tasa de aprendizajeν{\displaystyle \nu }Se considera que es 0,3. El entrenamiento se realiza con una pasada a través de los 100 puntos de entrenamiento. El error cuadrático medio es 0,15.

Figura 8: Funciones base normalizadas. El mapa logístico (azul) y la aproximación al mapa logístico (rojo) tras una pasada por el conjunto de entrenamiento. Nótese la mejora con respecto al caso no normalizado.

Funciones de base radial normalizadas

La arquitectura RBF normalizada es

φ(incógnita) =dmiF i=1norteaiρ(incógnitadoi)i=1norteρ(incógnitadoi)=i=1norteai(incógnitadoi){\displaystyle \varphi (\mathbf {x} )\ {\stackrel {\mathrm {def} }{=}}\ {\frac {\sum _{i=1}^{N}a_{i}\rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}}{\sum _{i=1}^{N}\rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}}}=\sum _{i=1}^{N}a_{i}u{\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}}

dónde

(incógnitadoi) =dmiF ρ(incógnitadoi)i=1norteρ(incógnitadoi){\displaystyle u{\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}\ {\stackrel {\mathrm {def} }{=}}\ {\frac {\rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}}{\sum _{i=1}^{N}\rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}}}}.

De nuevo:

ρ(incógnitadoi)=exp[βincógnitadoi2]=exp[β(incógnita(t)doi)2]{\displaystyle \rho {\big (}\left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert {\big )}=\exp \left[-\beta \left\Vert \mathbf {x} -\mathbf {c} _{i}\right\Vert ^{2}\right]=\exp \left[-\beta \left(x(t)-c_{i}\right)^{2}\right]}.

Nuevamente, elegimos el número de funciones base como cinco y el tamaño del conjunto de entrenamiento como 100 ejemplares generados por la serie temporal caótica. El pesoβ{\displaystyle \beta }se considera una constante igual a 6. Los pesosdoi{\displaystyle c_{i}}son cinco ejemplos de la serie temporal. Los pesosai{\displaystyle a_{i}}están capacitados con la formación de operador de proyección:

ai(t+1)=ai(t)+ν[incógnita(t+1)φ(incógnita(t),w)](incógnita(t)doi)i=1norte2(incógnita(t)doi){\displaystyle a_{i}(t+1)=a_{i}(t)+\nu {\big [}x(t+1)-\varphi {\big (}\mathbf {x} (t),\mathbf {w} {\big )}{\big ]}{\frac {u{\big (}\left\Vert \mathbf {x} (t)-\mathbf {c} _{i}\right\Vert {\big )}}{\sum _{i=1}^{N}u^{2}{\big (}\left\Vert \mathbf {x} (t)-\mathbf {c} _{i}\right\Vert {\big )}}}}

donde la tasa de aprendizajeν{\displaystyle \nu }Se vuelve a considerar 0,3. El entrenamiento se realiza con una sola pasada a través de los 100 puntos de entrenamiento. El error cuadrático medio en un conjunto de prueba de 100 ejemplos es 0,084, menor que el error sin normalizar. La normalización mejora la precisión. Por lo general, la precisión con funciones base normalizadas aumenta aún más que con funciones sin normalizar a medida que aumenta la dimensionalidad de la entrada.

Figura 9: Funciones base normalizadas. El mapa logístico (azul) y su aproximación (rojo) en función del tiempo. Nótese que la aproximación es válida solo para unos pocos pasos de tiempo. Esta es una característica general de las series temporales caóticas.

predicción de series temporales

Una vez estimada la geometría subyacente de la serie temporal, como en los ejemplos anteriores, se puede realizar una predicción para la serie temporal mediante iteración:

φ(0)=incógnita(1){\displaystyle \varphi (0)=x(1)}
incógnita(t)φ(t1){\displaystyle {x}(t)\approx \varphi (t-1)}
incógnita(t+1)φ(t)=φ[φ(t1)]{\displaystyle {x}(t+1)\approx \varphi (t)=\varphi [\varphi (t-1)]}.

En la figura se muestra una comparación entre la serie temporal real y la estimada. La serie temporal estimada comienza en el instante cero con un conocimiento exacto de x(0). A continuación, utiliza la estimación de la dinámica para actualizar la estimación de la serie temporal durante varios pasos de tiempo.

Nótese que la estimación es precisa solo para unos pocos pasos de tiempo. Esta es una característica general de las series temporales caóticas. Esta es una propiedad de la dependencia sensible de las condiciones iniciales común a las series temporales caóticas. Un pequeño error inicial se amplifica con el tiempo. Una medida de la divergencia de series temporales con condiciones iniciales casi idénticas se conoce como exponente de Lyapunov .

Control de una serie temporal caótica

Figura 10: Control del mapa logístico. Se permite que el sistema evolucione de forma natural durante 49 pasos de tiempo. En el paso 50, se activa el control. La trayectoria deseada para la serie temporal se muestra en rojo. El sistema bajo control aprende la dinámica subyacente y dirige la serie temporal hacia el resultado deseado. La arquitectura es la misma que en el ejemplo de predicción de series temporales.

Suponemos que el resultado del mapa logístico puede manipularse mediante un parámetro de control.do[incógnita(t),t]{\displaystyle c[x(t),t]}de tal manera que

incógnita(t+1)=4incógnita(t)[1incógnita(t)]+do[incógnita(t),t]{\displaystyle {x}_{}^{}(t+1)=4x(t)[1-x(t)]+c[x(t),t]}.

El objetivo es elegir el parámetro de control de tal manera que la serie temporal se dirija hacia una salida deseada.d(t){\displaystyle d(t)}Esto se puede hacer si elegimos el parámetro de control para que sea

do[incógnita(t),t] =dmiF φ[incógnita(t)]+d(t+1){\displaystyle c_{}^{}[x(t),t]\ {\stackrel {\mathrm {def} }{=}}\ -\varphi [x(t)]+d(t+1)}

dónde

y[incógnita(t)]F[incógnita(t)]=incógnita(t+1)do[incógnita(t),t]{\displaystyle y[x(t)]\approx f[x(t)]=x(t+1)-c[x(t),t]}

es una aproximación a la dinámica natural subyacente del sistema.

El algoritmo de aprendizaje viene dado por

ai(t+1)=ai(t)+νε(incógnita(t)doi)i=1norte2(incógnita(t)doi){\displaystyle a_{i}(t+1)=a_{i}(t)+\nu \varepsilon {\frac {u{\big (}\left\Vert \mathbf {x} (t)-\mathbf {c} _{i}\right\Vert {\big )}}{\sum _{i=1}^{N}u^{2}{\big (}\left\Vert \mathbf {x} (t)-\mathbf {c} _{i}\right\Vert {\big )}}}}

dónde

ε =dmiF F[incógnita(t)]φ[incógnita(t)]=incógnita(t+1)do[incógnita(t),t]φ[incógnita(t)]=incógnita(t+1)d(t+1){\displaystyle \varepsilon \ {\stackrel {\mathrm {def} }{=}}\ f[x(t)]-\varphi [x(t)]=x(t+1)-c[x(t),t]-\varphi [x(t)]=x(t+1)-d(t+1)}.

Véase también

Referencias

  1. Broomhead, DS; Lowe, David (1988). Funciones de base radial, interpolación funcional multivariable y redes adaptativas (Informe técnico). RSRE . 4148. Archivado del original el 9 de abril de 2013.
  2. Broomhead, DS; Lowe, David (1988). "Interpolación funcional multivariable y redes adaptativas" (PDF) . Sistemas complejos . 2 : 321–355 . Archivado (PDF) del original el 1 de diciembre de 2020. Recuperado el 29 de enero de 2019 .
  3. 1 2 Schwenker, Friedhelm; Kestler, Hans A.; Palm, Günther (2001). "Tres fases de aprendizaje para redes de funciones de base radial". Redes neuronales . 14 ( 4– 5): 439– 458. Bibcode : 2001NN.....14..439S . CiteSeerX 10.1.1.109.312 . doi : 10.1016/s0893-6080(01)00027-2 . PMID 11411631 .  
  4. Beheim, Larbi; Zitouni, Adel; Belloir, Fabien (enero de 2004). "Nuevo clasificador de redes neuronales RBF con número de neuronas ocultas optimizado" .
  5. Ibrikci, Turgay; Brandt, ME; Wang, Guanyu; Acikkar, Mustafa (23–26 de octubre de 2002). Distancia de Mahalanobis con red de funciones de base radial en estructuras secundarias de proteínas . Actas de la Segunda 24.ª Conferencia Anual Conjunta y la Reunión Anual de Otoño de la Sociedad de Ingeniería Biomédica . Vol. 3. Houston, TX, EE. UU. (publicado el 6 de enero de 2003). págs. 2184–2185 . doi : 10.1109/IEMBS.2002.1053230 . ISBN   0-7803-7612-9ISSN 1094-687X 
  6. Park, J.; IW Sandberg (Verano de 1991). " Aproximación universal mediante redes de funciones de base radial". Neural Computation . 3 (2): 246– 257. doi : 10.1162/neco.1991.3.2.246 . PMID 31167308. S2CID 34868087 .  

Lecturas adicionales

  • J. Moody y C.J. Darken, «Aprendizaje rápido en redes de unidades de procesamiento sintonizadas localmente», Neural Computation, 1, 281-294 (1989). Véase también Redes de funciones de base radial según Moody y Darken.
  • T. Poggio y F. Girosi, " Redes para aproximación y aprendizaje ", Proc. IEEE 78(9), 1484-1487 (1990).
  • Roger D. Jones, YC Lee, CW Barnes, GW Flake, K. Lee, PS Lewis y S. Qian, Aproximación de funciones y predicción de series temporales con redes neuronales , Actas de la Conferencia Internacional Conjunta sobre Redes Neuronales, 17-21 de junio, pág.  I-649 (1990).
  • Martin D. Buhmann (2003). Funciones de base radial: teoría e implementaciones . Cambridge University. ISBN 0-521-63338-9.
  • Yee, Paul V. y Haykin, Simon (2001). Redes de funciones de base radial regularizadas: teoría y aplicaciones . John Wiley. ISBN 0-471-35349-3.
  • Davies, John R.; Coggeshall, Stephen V.; Jones, Roger D .; Schutzer, Daniel (1995). «Sistemas de seguridad inteligentes». En Freedman, Roy S.; Flein, Robert A.; Lederman, Jess (eds.). Inteligencia artificial en los mercados de capitales . Chicago: Irwin. ISBN 1-55738-811-3.
  • Simon Haykin (1999). Redes neuronales: Fundamentos integrales (2.ª  ed.). Upper Saddle River, NJ: Prentice Hall. ISBN 0-13-908385-5.
  • S. Chen, CFN Cowan y PM Grant, " Algoritmo de aprendizaje de mínimos cuadrados ortogonales para redes de funciones de base radial ", IEEE Transactions on Neural Networks, Vol. 2, No. 2 (marzo) 1991.