Articulo de referencia

suavizador de núcleo

Un suavizador de núcleo es una técnica estadística para estimar una función de valor real. F : R pag → R {\displaystyle f:\mathbb {R} ^{p}\to \mathbb {R} } como el promedio pond...

Un suavizador de núcleo es una técnica estadística para estimar una función de valor real.F:RpagR{\displaystyle f:\mathbb {R} ^{p}\to \mathbb {R} }como el promedio ponderado de los datos observados vecinos. El peso se define mediante el núcleo , de modo que a los puntos más cercanos se les asignan pesos mayores. La función estimada es suave, y el nivel de suavidad se establece mediante un único parámetro. El suavizado de núcleo es un tipo de promedio móvil ponderado .

Definiciones

DejarKhλ(incógnita0,incógnita){\displaystyle K_{h_{\lambda }}(X_{0},X)}ser un núcleo definido por

Khλ(incógnita0,incógnita)=D(incógnitaincógnita0hλ(incógnita0)){\displaystyle K_{h_{\lambda }}(X_{0},X)=D\left({\frac {\left\|X-X_{0}\right\|}{h_{\lambda }(X_{0})}}\right)}

dónde:

  • incógnita,incógnita0Rpag{\displaystyle X,X_{0}\in \mathbb {R} ^{p}}
  • {\displaystyle \left\|\cdot \right\|}es la norma euclidiana
  • hλ(incógnita0){\displaystyle h_{\lambda }(X_{0})}es un parámetro (radio del núcleo)
  • D ( t ) es típicamente una función de valor real positivo, cuyo valor es decreciente (o no creciente) a medida que aumenta la distancia entre X y X 0 .

Entre los núcleos más utilizados para el suavizado se encuentran los núcleos parabólico (Epanechnikov), tricubo y gaussiano .

DejarY(incógnita):RpagR{\displaystyle Y(X):\mathbb {R} ^{p}\to \mathbb {R} }sea ​​una función continua de X. Para cadaincógnita0Rpag{\displaystyle X_{0}\in \mathbb {R} ^{p}}, el promedio ponderado por núcleo de Nadaraya-Watson (estimación suave de Y ( X )) se define por

Y^(incógnita0)=i=1norteKhλ(incógnita0,incógnitai)Y(incógnitai)i=1norteKhλ(incógnita0,incógnitai){\displaystyle {\hat {Y}}(X_{0})={\frac {\sum \limits _{i=1}^{N}{K_{h_{\lambda }}(X_{0},X_{i})Y(X_{i})}}{\sum \limits _{i=1}^{N}{K_{h_{\lambda }}(X_{0},X_{i})}}}}

dónde:

  • N es el número de puntos observados
  • Y ( X i ) son las observaciones en los puntos X i .

En las siguientes secciones, describimos algunos casos particulares de suavizadores de núcleo.

Suavizador de núcleo gaussiano

Ejemplo de suavizado de regresión con núcleo gaussiano.

El núcleo gaussiano es uno de los núcleos más utilizados y se expresa mediante la siguiente ecuación.

K(incógnita,incógnitai)=exp((incógnitaincógnitai)22b2){\displaystyle K(x^{*},x_{i})=\exp \left(-{\frac {(x^{*}-x_{i})^{2}}{2b^{2}}}\right)}

Aquí, b es la escala de longitud para el espacio de entrada.

suavizador del vecino más cercano

Ejemplo de suavizado del vecino más cercano.

El algoritmo de k vecinos más cercanos se puede utilizar para definir un suavizador de k vecinos más cercanos de la siguiente manera. Para cada punto X 0 , tome m vecinos más cercanos y estime el valor de Y ( X 0 ) promediando los valores de estos vecinos.

Formalmente,hmetro(incógnita0)=incógnita0incógnita[metro]{\displaystyle h_{m}(X_{0})=\left\|X_{0}-X_{[m]}\right\|}, dóndeincógnita[metro]{\displaystyle X_{[m]}}es el m -ésimo vecino más cercano a X 0 , y

D(t)={1/metrosi |t|10de lo contrario{\displaystyle D(t)={\begin{cases}1/m&{\text{si }}|t|\leq 1\\0&{\text{en otro caso}}\end{cases}}}

En este ejemplo, X es unidimensional. Para cada X 0 , elY^(incógnita0){\displaystyle {\hat {Y}}(X_{0})}es un valor promedio de 16 más cercano a los puntos X 0 (indicado en rojo).

suavizador de promedio de kernel

Ejemplo de suavizado promedio del kernel.

La idea del suavizador de promedio de núcleo es la siguiente. Para cada punto de datos X 0 , elija un tamaño de distancia constante λ (radio del núcleo, o ancho de ventana para p  =  1 dimensión), y calcule un promedio ponderado para todos los puntos de datos que estén más cerca queλ{\displaystyle \lambda }a X 0 (cuanto más cerca de X 0 los puntos obtienen mayor peso).

Formalmente,hλ(incógnita0)=λ=constante,{\displaystyle h_{\lambda }(X_{0})=\lambda ={\text{constante}},}y D ( t ) es uno de los núcleos más populares.

Para cada X₀ , el ancho de la ventana es constante, y el peso de cada punto dentro de la ventana se representa esquemáticamente mediante la figura amarilla en el gráfico. Se observa que la estimación es suave, pero los puntos límite presentan sesgo. Esto se debe a la cantidad desigual de puntos (a la derecha y a la izquierda de X₀ ) dentro de la ventana, cuando X₀ se encuentra lo suficientemente cerca del límite.

regresión local

regresión lineal local

En las dos secciones anteriores asumimos que la función subyacente Y(X) es localmente constante, por lo tanto pudimos usar el promedio ponderado para la estimación. La idea de la regresión lineal local es ajustar localmente una línea recta (o un hiperplano para dimensiones superiores), y no la constante (línea horizontal). Después de ajustar la línea, la estimación Y^(incógnita0){\displaystyle {\hat {Y}}(X_{0})} El valor de esta línea en el punto X 0 lo proporciona . Al repetir este procedimiento para cada X 0 , se puede obtener la función de estimación.Y^(incógnita){\displaystyle {\hat {Y}}(X)}Al igual que en la sección anterior, el ancho de la ventana es constante.hλ(incógnita0)=λ=constante.{\displaystyle h_{\lambda }(X_{0})=\lambda ={\text{constante}}.} Formalmente, la regresión lineal local se calcula resolviendo un problema de mínimos cuadrados ponderados.

Resultado de la regresión lineal local

Para una dimensión ( p = 1):

minα(incógnita0),β(incógnita0)i=1norteKhλ(incógnita0,incógnitai)(Y(incógnitai)α(incógnita0)β(incógnita0)incógnitai)2Y^(incógnita0)=α(incógnita0)+β(incógnita0)incógnita0{\displaystyle {\begin{aligned}&\min _{\alpha (X_{0}),\beta (X_{0})}\sum \limits _{i=1}^{N}{K_{h_{\lambda }}(X_{0},X_{i})\left(Y(X_{i})-\alpha (X_{0})-\beta (X_{0})X_{i}\right)^{2}}\\&\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\Downarrow \\&\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,\,{\hat {Y}}(X_{0})=\alpha (X_{0})+\beta (X_{0})X_{0}\\\end{aligned}}}

La solución en forma cerrada viene dada por:

Y^(incógnita0)=(1,incógnita0)(BTW(incógnita0)B)1BTW(incógnita0)y{\displaystyle {\hat {Y}}(X_{0})=\left(1,X_{0}\right)\left(B^{T}W(X_{0})B\right)^{-1}B^{T}W(X_{0})y}

dónde:

  • y=(Y(incógnita1),,Y(incógnitanorte))T{\displaystyle y=\left(Y(X_{1}),\dots ,Y(X_{N})\right)^{T}}
  • W(incógnita0)=diagnóstico(Khλ(incógnita0,incógnitai))norte×norte{\displaystyle W(X_{0})=\operatorname {diag} \left(K_{h_{\lambda }}(X_{0},X_{i})\right)_{N\times N}}
  • BT=(111incógnita1incógnita2incógnitanorte){\displaystyle B^{T}=\left({\begin{matrix}1&1&\dots &1\\X_{1}&X_{2}&\dots &X_{N}\\\end{matrix}}\right)}

La función resultante es suave y se reduce el problema de los puntos límite sesgados.

La regresión lineal local puede aplicarse a espacios de cualquier dimensión, aunque la definición de vecindario local se vuelve más compleja. Es común utilizar los k puntos de entrenamiento más cercanos a un punto de prueba para ajustar la regresión lineal local. Esto puede generar una alta varianza en la función ajustada. Para limitar la varianza, el conjunto de puntos de entrenamiento debe contener el punto de prueba dentro de su envolvente convexa (véase la referencia de Gupta et al.).

regresión polinómica local

En lugar de ajustar funciones lineales locales, se pueden ajustar funciones polinómicas. Para p=1, se debe minimizar:

minα(incógnita0),βj(incógnita0),j=1,...,di=1norteKhλ(incógnita0,incógnitai)(Y(incógnitai)α(incógnita0)j=1dβj(incógnita0)incógnitaij)2{\displaystyle {\underset {\alpha (X_{0}),\beta _{j}(X_{0}),j=1,...,d}{\mathop {\min } }}\,\sum \limits _{i=1}^{N}{K_{h_{\lambda }}(X_{0},X_{i})\left(Y(X_{i})-\alpha (X_{0})-\sum \limits _{j=1}^{d}{\beta _{j}(X_{0})X_{i}^{j}}\right)^{2}}}

conY^(incógnita0)=α(incógnita0)+j=1dβj(incógnita0)incógnita0j{\displaystyle {\hat {Y}}(X_{0})=\alpha (X_{0})+\sum \limits _{j=1}^{d}{\beta _{j}(X_{0})X_{0}^{j}}}

En el caso general (p>1), se debe minimizar:

β^(incógnita0)=argminβ(incógnita0)i=1norteKhλ(incógnita0,incógnitai)(Y(incógnitai)b(incógnitai)Tβ(incógnita0))2b(incógnita)=(1,incógnita1,incógnita2,...incógnita12,incógnita22,...incógnita1incógnita2...)Y^(incógnita0)=b(incógnita0)Tβ^(incógnita0){\displaystyle {\begin{aligned}&{\hat {\beta }}(X_{0})={\underset {\beta (X_{0})}{\mathop {\arg \min } }}\,\sum \limits _{i=1}^{N}{K_{h_{\lambda }}(X_{0},X_{i})\left(Y(X_{i})-b(X_{i})^{T}\beta (X_{0})\right)}^{2}\\&b(X)=\left({\begin{matrix}1,&X_{1},&X_{2},...&X_{1}^{2},&X_{2}^{2},...&X_{1}X_{2}\,\,\,...\\\end{matrix}}\right)\\&{\hat {Y}}(X_{0})=b(X_{0})^{T}{\hat {\beta }}(X_{0})\\\end{aligned}}}

Véase también

Referencias

  • Li, Q. y JS Racine. Econometría no paramétrica: teoría y práctica . Princeton University Press, 2007, ISBN 0-691-12161-3.
  • T. Hastie, R. Tibshirani y J. Friedman, Los elementos del aprendizaje estadístico , Capítulo 6, Springer, 2001. ISBN 0-387-95284-5( Sitio web del libro complementario ).
  • M. Gupta, E. Garcia y E. Chin, "Regresión lineal local adaptativa con aplicación a la gestión del color de la impresora", IEEE Trans. Image Processing 2008.