Articulo de referencia

Incrustación de núcleos de distribuciones

En el aprendizaje automático , la incrustación de kernel de distribuciones (también llamada media de kernel o mapa de media ) comprende una clase de métodos no paramétricos en l...

En el aprendizaje automático , la incrustación de kernel de distribuciones (también llamada media de kernel o mapa de media ) comprende una clase de métodos no paramétricos en los que una distribución de probabilidad se representa como un elemento de un espacio de Hilbert de kernel reproductor (RKHS). [ 1 ] Una generalización del mapeo de características de puntos de datos individuales realizado en los métodos de kernel clásicos , la incrustación de distribuciones en espacios de características de dimensión infinita puede preservar todas las características estadísticas de distribuciones arbitrarias, al tiempo que permite comparar y manipular distribuciones utilizando operaciones de espacio de Hilbert tales como productos internos , distancias, proyecciones , transformaciones lineales y análisis espectral . [ 2 ] Este marco de aprendizaje es muy general y se puede aplicar a distribuciones sobre cualquier espacioΩ{\displaystyle \Omega }sobre la cual una función de núcleo sensata (que mide la similitud entre elementos deΩ{\displaystyle \Omega }) se puede definir. Por ejemplo, se han propuesto varios núcleos para aprender de los datos que son: vectores enRd{\displaystyle \mathbb {R} ^{d}}, clases/categorías discretas, cadenas , grafos / redes , imágenes, series temporales , variedades , sistemas dinámicos y otros objetos estructurados. [ 3 ] [ 4 ] La teoría detrás de las incrustaciones de núcleo de distribuciones ha sido desarrollada principalmente por Alex Smola, Le Song, Arthur Gretton y Bernhard Schölkopf . Una revisión de trabajos recientes sobre incrustaciones de núcleo de distribuciones se puede encontrar en. [ 5 ]

El análisis de distribuciones es fundamental en el aprendizaje automático y la estadística , y muchos algoritmos en estos campos se basan en enfoques de la teoría de la información, como la entropía , la información mutua o la divergencia de Kullback-Leibler . Sin embargo, para estimar estas cantidades, primero se debe realizar una estimación de densidad o emplear estrategias sofisticadas de partición espacial/corrección de sesgo, que suelen ser inviables para datos de alta dimensión. [ 6 ] Comúnmente, los métodos para modelar distribuciones complejas se basan en supuestos paramétricos que pueden ser infundados o computacionalmente difíciles (por ejemplo, modelos de mezcla gaussiana ), mientras que los métodos no paramétricos como la estimación de densidad de kernel (Nota: los kernels de suavizado en este contexto tienen una interpretación diferente a la de los kernels aquí discutidos) o la representación de la función característica (a través de la transformada de Fourier de la distribución) fallan en entornos de alta dimensión. [ 2 ]

Los métodos basados ​​en la incrustación de núcleos de distribuciones evitan estos problemas y también poseen las siguientes ventajas: [ 6 ]

  1. Los datos pueden modelarse sin supuestos restrictivos sobre la forma de las distribuciones y las relaciones entre variables.
  2. No se necesita una estimación de densidad intermedia.
  3. Los profesionales pueden especificar las propiedades de la distribución más relevantes para su problema (incorporando conocimientos previos mediante la elección del núcleo).
  4. Si se utiliza un núcleo característico , la incrustación puede preservar de forma única toda la información sobre una distribución, gracias al truco del núcleo , mientras que los cálculos en el RKHS de dimensión potencialmente infinita pueden implementarse en la práctica como simples operaciones de matriz de Gram.
  5. Se pueden demostrar tasas de convergencia independientes de la dimensionalidad para la media del núcleo empírico (estimada utilizando muestras de la distribución) hacia la incrustación del núcleo de la verdadera distribución subyacente.
  6. Los algoritmos de aprendizaje basados ​​en este marco exhiben una buena capacidad de generalización y convergencia de muestra finita, a la vez que suelen ser más simples y efectivos que los métodos basados ​​en la teoría de la información.

Por lo tanto, el aprendizaje mediante la incrustación de núcleos de distribuciones ofrece una alternativa coherente a los enfoques basados ​​en la teoría de la información y constituye un marco que no solo engloba muchos métodos populares del aprendizaje automático y la estadística como casos especiales, sino que también puede dar lugar a algoritmos de aprendizaje completamente nuevos.

Definiciones

Dejarincógnita{\displaystyle X}denota una variable aleatoria con dominioΩ{\displaystyle \Omega }y distribuciónPAG{\displaystyle P}Dado un núcleo simétrico y definido positivok:Ω×ΩR{\displaystyle k:\Omega \times \Omega \rightarrow \mathbb {R} }El teorema de Moore-Aronszajn afirma la existencia de un único RKHSH{\displaystyle {\mathcal {H}}}enΩ{\displaystyle \Omega }(un espacio de Hilbert de funcionesF:ΩR{\displaystyle f:\Omega \to \mathbb {R} }equipado con un producto interior,H{\displaystyle \langle \cdot ,\cdot \rangle _{\mathcal {H}}}y una normaH{\displaystyle \|\cdot \|_{\mathcal {H}}}) para el cualk{\displaystyle k}es un núcleo reproductor, es decir, en el que el elementok(incógnita,){\displaystyle k(x,\cdot )}satisface la propiedad de reproducción

F,k(incógnita,)H=F(incógnita)FH,incógnitaΩ.{\displaystyle \langle f,k(x,\cdot )\rangle _{\mathcal {H}}=f(x)\qquad \forall f\in {\mathcal {H}},\quad \forall x\in \Omega .}

Alternativamente, se puede considerarincógnitak(incógnita,){\displaystyle x\mapsto k(x,\cdot )}como una asignación de características implícitaφ:ΩH{\displaystyle \varphi :\Omega \rightarrow {\mathcal {H}}} (que por lo tanto también se denomina espacio de características), de modo quek(incógnita,incógnita)=φ(incógnita),φ(incógnita)H{\displaystyle k(x,x')=\langle \varphi (x),\varphi (x')\rangle _{\mathcal {H}}}puede considerarse como una medida de similitud entre puntosincógnita,incógnitaΩ.{\displaystyle x,x'\in \Omega .}Si bien la medida de similitud es lineal en el espacio de características, puede ser altamente no lineal en el espacio original dependiendo de la elección del núcleo.

Incrustación de kernel

La incrustación del núcleo de la distribuciónPAG{\displaystyle P}enH{\displaystyle {\mathcal {H}}}(también llamado media del núcleo o mapa de medias ) viene dado por: [ 1 ]

μincógnita:=mi[k(incógnita,)]=mi[φ(incógnita)]=Ωφ(incógnita) dPAG(incógnita){\displaystyle \mu _{X}:=\mathbb {E} [k(X,\cdot )]=\mathbb {E} [\varphi (X)]=\int _{\Omega }\varphi (x)\ \mathrm {d} P(x)}

SiPAG{\displaystyle P}permite una densidad integrable al cuadradopag{\displaystyle p}, entoncesμincógnita=mikpag{\displaystyle \mu _{X}={\mathcal {E}}_{k}p}, dóndemik{\displaystyle {\mathcal {E}}_{k}}es el operador integral de Hilbert-Schmidt . Un núcleo es característico si la incrustación mediaμ:{familia de distribuciones sobre Ω}H{\displaystyle \mu :\{{\text{familia de distribuciones sobre }}\Omega \}\to {\mathcal {H}}} es inyectiva. [ 7 ] Cada distribución puede, por lo tanto, representarse de forma única en el RKHS y todas las características estadísticas de las distribuciones se conservan mediante la incrustación del núcleo si se utiliza un núcleo característico.

Incrustación de núcleo empírico

Dadonorte{\displaystyle n}ejemplos de capacitación{incógnita1,,incógnitanorte}{\displaystyle \{x_{1},\ldots ,x_{n}\}}extraído de forma independiente e idénticamente distribuida (iid) dePAG,{\displaystyle P,}la incrustación del núcleo dePAG{\displaystyle P}puede estimarse empíricamente como

μ^incógnita=1nortei=1norteφ(incógnitai){\displaystyle {\widehat {\mu }}_{X}={\frac {1}{n}}\sum _{i=1}^{n}\varphi (x_{i})}

incrustación de distribución conjunta

SiY{\displaystyle Y}denota otra variable aleatoria (para simplificar, supongamos el codominio deY{\displaystyle Y}también lo esΩ{\displaystyle \Omega }con el mismo kernelk{\displaystyle k}lo cual satisfaceφ(incógnita)φ(y),φ(incógnita)φ(y)=k(incógnita,incógnita)k(y,y){\displaystyle \langle \varphi (x)\otimes \varphi (y),\varphi (x')\otimes \varphi (y')\rangle =k(x,x')k(y,y')}), entonces la distribución conjuntaPAG(incógnita,y)){\displaystyle P(x,y))}se puede mapear en un espacio de características de producto tensorialHH{\displaystyle {\mathcal {H}}\otimes {\mathcal {H}}}vía [ 2 ]

doincógnitaY=mi[φ(incógnita)φ(Y)]=Ω×Ωφ(incógnita)φ(y) dPAG(incógnita,y){\displaystyle {\mathcal {C}}_{XY}=\mathbb {E} [\varphi (X)\otimes \varphi (Y)]=\int _{\Omega \times \Omega }\varphi (x)\otimes \varphi (y)\ \mathrm {d} P(x,y)}

Debido a la equivalencia entre un tensor y una aplicación lineal , esta incrustación conjunta puede interpretarse como un operador de covarianza cruzada no centrado.doincógnitaY:HH{\displaystyle {\mathcal {C}}_{XY}:{\mathcal {H}}\to {\mathcal {H}}}de la cual la covarianza cruzada de funcionesF,gramoH{\displaystyle f,g\in {\mathcal {H}}}se puede calcular como [ 8 ]

Cov(F(incógnita),gramo(Y)):=mi[F(incógnita)gramo(Y)]mi[F(incógnita)]mi[gramo(Y)]=F,doincógnitaYgramoH=Fgramo,doincógnitaYHH{\displaystyle \operatorname {Cov} (f(X),g(Y)):=\mathbb {E} [f(X)g(Y)]-\mathbb {E} [f(X)]\mathbb {E} [g(Y)]=\langle f,{\mathcal {C}}_{XY}g\rangle _{\mathcal {H}}=\langle f\otimes g,{\mathcal {C}}_{XY}\rangle _{{\mathcal {H}}\otimes {\mathcal {H}}}}

Dadonorte{\displaystyle n}pares de ejemplos de entrenamiento{(incógnita1,y1),,(incógnitanorte,ynorte)}{\displaystyle \{(x_{1},y_{1}),\dots ,(x_{n},y_{n})\}}extraído iid dePAG{\displaystyle P}, también podemos estimar empíricamente la incrustación del núcleo de distribución conjunta mediante

do^incógnitaY=1nortei=1norteφ(incógnitai)φ(yi){\displaystyle {\widehat {\mathcal {C}}}_{XY}={\frac {1}{n}}\sum _{i=1}^{n}\varphi (x_{i})\otimes \varphi (y_{i})}

Incrustación de distribución condicional

Dada una distribución condicionalPAG(yincógnita),{\displaystyle P(y\mid x),}uno puede definir la incrustación RKHS correspondiente como [ 2 ]

μYincógnita=mi[φ(Y)incógnita]=Ωφ(y) dPAG(yincógnita){\displaystyle \mu _{Y\mid x}=\mathbb {E} [\varphi (Y)\mid X]=\int _{\Omega }\varphi (y)\ \mathrm {d} P(y\mid x)}

Tenga en cuenta que la incrustación dePAG(yincógnita){\displaystyle P(y\mid x)}De esta forma se define una familia de puntos en el RKHS indexados por los valoresincógnita{\displaystyle x}tomada por la variable de condicionamientoincógnita{\displaystyle X}. Al arreglarincógnita{\displaystyle X}a un valor particular, obtenemos un único elemento enH{\displaystyle {\mathcal {H}}}y por lo tanto es natural definir el operador

{doYincógnita:HHdoYincógnita=doYincógnitadoincógnitaincógnita1{\displaystyle {\begin{cases}{\mathcal {C}}_{Y\mid X}:{\mathcal {H}}\to {\mathcal {H}}\\{\mathcal {C}}_{Y\mid X}={\mathcal {C}}_{YX}{\mathcal {C}}_{XX}^{-1}\end{cases}}}

lo cual, dado el mapeo de características deincógnita{\displaystyle x}genera la incrustación condicional deY{\displaystyle Y}dadoincógnita=incógnita.{\displaystyle X=x.}Suponiendo que para todosgramoH:mi[gramo(Y)incógnita]H,{\displaystyle g\in {\mathcal {H}}:\mathbb {E} [g(Y)\mid X]\in {\mathcal {H}},}Se puede demostrar que [ 8 ]

μYincógnita=doYincógnitaφ(incógnita){\displaystyle \mu _{Y\mid x}={\mathcal {C}}_{Y\mid X}\varphi (x)}

Esta suposición siempre es cierta para dominios finitos con núcleos característicos, pero puede no ser necesariamente cierta para dominios continuos. [ 2 ] Sin embargo, incluso en los casos en que la suposición falla,doYincógnitaφ(incógnita){\displaystyle {\mathcal {C}}_{Y\mid X}\varphi (x)}aún puede utilizarse para aproximar la incrustación del núcleo condicionalμYincógnita,{\displaystyle \mu _{Y\mid x},}y en la práctica, el operador de inversión se reemplaza por una versión regularizada de sí mismo.(doincógnitaincógnita+λI)1{\displaystyle ({\mathcal {C}}_{XX}+\lambda \mathbf {I} )^{-1}}(dóndeI{\displaystyle \mathbf {I} }denota la matriz identidad ).

Dados los ejemplos de entrenamiento{(incógnita1,y1),,(incógnitanorte,ynorte)},{\displaystyle \{(x_{1},y_{1}),\dots ,(x_{n},y_{n})\},}El operador de incrustación condicional del núcleo empírico puede estimarse como [ 2 ].

do^Yincógnita=Φ(K+λI)1YT{\displaystyle {\widehat {C}}_{Y\mid X}={\boldsymbol {\Phi }}(\mathbf {K} +\lambda \mathbf {I} )^{-1}{\boldsymbol {\Upsilon }}^{T}}

dóndeΦ=(φ(y1),,φ(ynorte)),Y=(φ(incógnita1),,φ(incógnitanorte)){\displaystyle {\boldsymbol {\Phi }}=\left(\varphi (y_{1}),\dots ,\varphi (y_{n})\right),{\boldsymbol {\Upsilon }}=\left(\varphi (x_{1}),\dots ,\varphi (x_{n})\right)}son matrices de características formadas implícitamente,K=YTY{\displaystyle \mathbf {K} ={\boldsymbol {\Upsilon }}^{T}{\boldsymbol {\Upsilon }}}es la matriz de Gram para muestras deincógnita{\displaystyle X}, yλ{\displaystyle \lambda }es un parámetro de regularización necesario para evitar el sobreajuste .

Por lo tanto, la estimación empírica de la incrustación condicional del núcleo viene dada por una suma ponderada de muestras deY{\displaystyle Y}en el espacio de características:

μ^Yincógnita=i=1norteβi(incógnita)φ(yi)=Φβ(incógnita){\displaystyle {\widehat {\mu }}_{Y\mid x}=\sum _{i=1}^{n}\beta _{i}(x)\varphi (y_{i})={\boldsymbol {\Phi }}{\boldsymbol {\beta }}(x)}

dóndeβ(incógnita)=(K+λI)1Kincógnita{\displaystyle {\boldsymbol {\beta }}(x)=(\mathbf {K} +\lambda \mathbf {I} )^{-1}\mathbf {K} _{x}}yKincógnita=(k(incógnita1,incógnita),,k(incógnitanorte,incógnita))T{\displaystyle \mathbf {K} _{x}=\left(k(x_{1},x),\dots ,k(x_{n},x)\right)^{T}}

Propiedades

  • La expectativa de cualquier funciónF{\displaystyle f}En el RKHS se puede calcular como un producto interno con la incrustación del núcleo:
mi[F(incógnita)]=F,μincógnitaH{\displaystyle \mathbb {E} [f(X)]=\langle f,\mu _{X}\rangle _{\mathcal {H}}}
  • En presencia de grandes tamaños de muestra, manipulaciones de lanorte×norte{\displaystyle n\times n}La matriz de Gram puede ser computacionalmente exigente. Mediante el uso de una aproximación de bajo rango de la matriz de Gram (como la factorización de Cholesky incompleta ), el tiempo de ejecución y los requisitos de memoria de los algoritmos de aprendizaje basados ​​en incrustaciones de kernel se pueden reducir drásticamente sin sufrir una gran pérdida en la precisión de la aproximación. [ 2 ]

Convergencia de la media del núcleo empírico a la verdadera incrustación de la distribución

  • Sik{\displaystyle k}se define de tal manera queF{\displaystyle f}toma valores en[0,1]{\displaystyle [0,1]}a pesar deFH{\displaystyle f\in {\mathcal {H}}}conFH1{\displaystyle \|f\|_{\mathcal {H}}\leq 1}(como es el caso de los núcleos de funciones de base radial ampliamente utilizados ), entonces con una probabilidad al menos1δ{\displaystyle 1-\delta }: [ 6 ]
μincógnitaμ^incógnitaH=sorberFB(0,1)|mi[F(incógnita)]1nortei=1norteF(incógnitai)|2nortemi[trK]+registro(2/δ)2norte{\displaystyle \|\mu _{X}-{\widehat {\mu }}_{X}\|_{\mathcal {H}}=\sup _{f\in {\mathcal {B}}(0,1)}\left|\mathbb {E} [f(X)]-{\frac {1}{n}}\sum _{i=1}^{n}f(x_{i})\right|\leq {\frac {2}{n}}\mathbb {E} \left[{\sqrt {\operatorname {tr} K}}\right]+{\sqrt {\frac {\log(2/\delta )}{2n}}}}
dóndeB(0,1){\displaystyle {\mathcal {B}}(0,1)}denota la bola de la unidad enH{\displaystyle {\mathcal {H}}}yK=(kij){\displaystyle \mathbf {K} =(k_{ij})}es la matriz de Gram conkij=k(incógnitai,incógnitaj).{\displaystyle k_{ij}=k(x_{i},x_{j}).}
  • La tasa de convergencia (en norma RKHS) de la incrustación del núcleo empírico a su contraparte de distribución esO(norte1/2){\displaystyle O(n^{-1/2})}y no depende de la dimensión deincógnita{\displaystyle X}.
  • Las estadísticas basadas en incrustaciones de núcleo evitan así la maldición de la dimensionalidad , y aunque la verdadera distribución subyacente es desconocida en la práctica, se puede (con alta probabilidad) obtener una aproximación dentro deO(norte1/2){\displaystyle O(n^{-1/2})}de la verdadera incrustación del núcleo basada en una muestra finita de tamañonorte{\displaystyle n}.
  • Para la incrustación de distribuciones condicionales, la estimación empírica puede verse como un promedio ponderado de asignaciones de características (donde los pesosβi(incógnita){\displaystyle \beta _{i}(x)}depende del valor de la variable de condicionamiento y captura el efecto del condicionamiento en la incrustación del núcleo). En este caso, la estimación empírica converge a la incrustación RKHS de distribución condicional con tasaO(norte1/4){\displaystyle O\left(n^{-1/4}\right)}si el parámetro de regularizaciónλ{\displaystyle \lambda }se reduce a medida queO(norte1/2),{\displaystyle O\left(n^{-1/2}\right),}aunque se pueden lograr tasas de convergencia más rápidas al establecer supuestos adicionales sobre la distribución conjunta. [ 2 ]

núcleos universales

  • DejarincógnitaRb{\displaystyle {\mathcal {X}}\subseteq \mathbb {R} ^{b}}ser un espacio métrico compacto ydo(incógnita){\displaystyle C({\mathcal {X}})}el conjunto de funciones continuas . El núcleo reproductork:incógnita×incógnitaR{\displaystyle k:{\mathcal {X}}\times {\mathcal {X}}\rightarrow \mathbb {R} } Se denomina universal si y solo si el RKHSH{\displaystyle {\mathcal {H}}}dek{\displaystyle k}es denso endo(incógnita){\displaystyle C({\mathcal {X}})}, es decir, para cualquiergramodo(incógnita){\displaystyle g\in C({\mathcal {X}})}y todo ε>0{\displaystyle \varepsilon >0}existe unFH{\displaystyle f\in {\mathcal {H}}}de tal manera queFgramoε{\displaystyle \|f-g\|_{\infty }\leq \varepsilon }. [ 9 ] Todos los núcleos universales definidos en un espacio compacto son núcleos característicos, pero lo contrario no siempre es cierto. [ 10 ]
  • Dejark{\displaystyle k}ser un núcleo continuo invariante a la traslaciónk(incógnita,incógnita)=h(incógnitaincógnita){\displaystyle k(x,x')=h(x-x')}conincógnitaRb{\displaystyle x\in \mathbb {R} ^{b}}Entonces, el teorema de Bochner garantiza la existencia de una medida de Borel finita única.μ{\displaystyle \mu }(llamada medida espectral ) enRb{\displaystyle \mathbb {R} ^{b}}de tal manera que
h(t)=Rbmiit,ωdμ(ω),tRb.{\displaystyle h(t)=\int _{\mathbb {R} ^{b}}e^{-i\langle t,\omega \rangle }d\mu (\omega ),\quad \forall t\in \mathbb {R} ^{b}.}
Parak{\displaystyle k}para ser universal basta con que la parte continua deμ{\displaystyle \mu }en su singular descomposición de Lebesgueμ=μdo+μs{\displaystyle \mu =\mu _{c}+\mu _{s}}es distinto de cero. Además, si
dμdo(ω)=s(ω)dω,{\displaystyle d\mu _{c}(\omega )=s(\omega )d\omega ,}
entoncess{\displaystyle s}es la densidad espectral de frecuenciasω{\displaystyle \omega }enRb{\displaystyle \mathbb {R} ^{b}}yh{\displaystyle h}es la transformada de Fourier des{\displaystyle s}. Si el apoyo deμ{\displaystyle \mu }es todo deRb{\displaystyle \mathbb {R} ^{b}}, entoncesk{\displaystyle k}es también un núcleo característico. [ 11 ] [ 12 ] [ 13 ]
  • Sik{\displaystyle k}Si induce una matriz de núcleo estrictamente definida positiva para cualquier conjunto de puntos distintos, entonces es un núcleo universal. [ 6 ] Por ejemplo, el núcleo RBF gaussiano ampliamente utilizado
k(incógnita,incógnita)=exp(12σ2incógnitaincógnita2){\displaystyle k(x,x')=\exp \left(-{\frac {1}{2\sigma ^{2}}}\|x-x'\|^{2}\right)}
en subconjuntos compactos deRb{\displaystyle \mathbb {R} ^{b}}es universal.

Selección de parámetros para incrustaciones de núcleos de distribución condicional

  • El operador de incrustación de distribución condicional del núcleo empíricodo^Y|incógnita{\displaystyle {\widehat {\mathcal {C}}}_{Y|X}}Alternativamente, puede verse como la solución del siguiente problema de regresión de mínimos cuadrados regularizados (con valores de función) [ 14 ].
mindo:HHi=1norteφ(yi)doφ(incógnitai)H2+λdoHS2{\displaystyle \min _{{\mathcal {C}}:{\mathcal {H}}\to {\mathcal {H}}}\sum _{i=1}^{n}\left\|\varphi (y_{i})-{\mathcal {C}}\varphi (x_{i})\right\|_{\mathcal {H}}^{2}+\lambda \|{\mathcal {C}}\|_{HS}^{2}}
dóndeHS{\displaystyle \|\cdot \|_{HS}}es la norma de Hilbert-Schmidt .
  • De este modo, se puede seleccionar el parámetro de regularización.λ{\displaystyle \lambda }mediante la realización de una validación cruzada basada en la función de pérdida al cuadrado del problema de regresión.

Reglas de probabilidad como operaciones en el RKHS

Esta sección ilustra cómo las reglas probabilísticas básicas pueden reformularse como operaciones algebraicas (multi)lineales en el marco de incrustación de núcleos y se basa principalmente en el trabajo de Song et al. [ 2 ] [ 8 ] Se adopta la siguiente notación:

  • PAG(incógnita,Y)={\displaystyle P(X,Y)=}distribución conjunta sobre variables aleatoriasincógnita,Y{\displaystyle X,Y}
  • PAG(incógnita)=ΩPAG(incógnita,dy)={\displaystyle P(X)=\int _{\Omega }P(X,\mathrm {d} y)=}distribución marginal deincógnita{\displaystyle X};PAG(Y)={\displaystyle P(Y)=}distribución marginal deY{\displaystyle Y}
  • PAG(Yincógnita)=PAG(incógnita,Y)PAG(incógnita)={\displaystyle P(Y\mid X)={\frac {P(X,Y)}{P(X)}}=}distribución condicional deY{\displaystyle Y}dadoincógnita{\displaystyle X}con el operador de incrustación condicional correspondientedoYincógnita{\displaystyle {\mathcal {C}}_{Y\mid X}}
  • π(Y)={\displaystyle \pi (Y)=}distribución previa sobreY{\displaystyle Y}
  • Q{\displaystyle Q}se utiliza para distinguir las distribuciones que incorporan la distribución a priori de las distribucionesPAG{\displaystyle P}que no dependen de lo anterior

En la práctica, todas las incrustaciones se estiman empíricamente a partir de datos.{(incógnita1,y1),,(incógnitanorte,ynorte)}{\displaystyle \{(x_{1},y_{1}),\dots ,(x_{n},y_{n})\}}y asumió que un conjunto de muestras{y~1,,y~norte~}{\displaystyle \{{\widetilde {y}}_{1},\ldots ,{\widetilde {y}}_{\widetilde {n}}\}}puede utilizarse para estimar la incrustación del núcleo de la distribución previaπ(Y){\displaystyle \pi (Y)}.

Regla de suma del núcleo

En teoría de la probabilidad , la distribución marginal deincógnita{\displaystyle X}se puede calcular integrandoY{\displaystyle Y}de la densidad conjunta (incluida la distribución previa enY{\displaystyle Y})

Q(incógnita)=ΩPAG(incógnitaY)dπ(Y){\displaystyle Q(X)=\int _{\Omega }P(X\mid Y)\,\mathrm {d} \pi (Y)}

El análogo de esta regla en el marco de incrustación de kernel establece queμincógnitaπ,{\displaystyle \mu _{X}^{\pi },}la incrustación RKHS deQ(incógnita){\displaystyle Q(X)}, se puede calcular mediante

μincógnitaπ=mi[doincógnitaYφ(Y)]=doincógnitaYmi[φ(Y)]=doincógnitaYμYπ{\displaystyle \mu _{X}^{\pi }=\mathbb {E} [{\mathcal {C}}_{X\mid Y}\varphi (Y)]={\mathcal {C}}_{X\mid Y}\mathbb {E} [\varphi (Y)]={\mathcal {C}}_{X\mid Y}\mu _{Y}^{\pi }}

dóndeμYπ{\displaystyle \mu _{Y}^{\pi }}es la incrustación del núcleo deπ(Y).{\displaystyle \pi (Y).}En las implementaciones prácticas, la regla de suma del núcleo toma la siguiente forma:

μ^incógnitaπ=do^incógnitaYμ^Yπ=Y(GRAMO+λI)1GRAMO~α{\displaystyle {\widehat {\mu }}_{X}^{\pi }={\widehat {\mathcal {C}}}_{X\mid Y}{\widehat {\mu }}_{Y}^{\pi }={\boldsymbol {\Upsilon }}(\mathbf {G} +\lambda \mathbf {I} )^{-1}{\widetilde {\mathbf {G} }}{\boldsymbol {\alpha }}}

dónde

μYπ=i=1norte~αiφ(y~i){\displaystyle \mu _{Y}^{\pi }=\sum _{i=1}^{\widetilde {n}}\alpha _{i}\varphi ({\widetilde {y}}_{i})}

es la incrustación del núcleo empírico de la distribución previa,α=(α1,,αnorte~)T,{\displaystyle {\boldsymbol {\alpha }}=(\alpha _{1},\ldots ,\alpha _{\widetilde {n}})^{T},}Y=(φ(incógnita1),,φ(incógnitanorte)){\displaystyle {\boldsymbol {\Upsilon }}=\left(\varphi (x_{1}),\ldots ,\varphi (x_{n})\right)}, yGRAMO,GRAMO~{\displaystyle \mathbf {G} ,{\widetilde {\mathbf {G} }}}son matrices de Gram con entradasGRAMOij=k(yi,yj),GRAMO~ij=k(yi,y~j){\displaystyle \mathbf {G} _{ij}=k(y_{i},y_{j}),{\widetilde {\mathbf {G} }}_{ij}=k(y_{i},{\widetilde {y}}_{j})}respectivamente.

Regla de la cadena del kernel

En teoría de la probabilidad, una distribución conjunta puede factorizarse en un producto entre distribuciones condicionales y marginales.

Q(incógnita,Y)=PAG(incógnitaY)π(Y){\displaystyle Q(X,Y)=P(X\mid Y)\pi (Y)}

El análogo de esta regla en el marco de incrustación de kernel establece quedoincógnitaYπ,{\displaystyle {\mathcal {C}}_{XY}^{\pi },}la incrustación conjunta deQ(incógnita,Y),{\displaystyle Q(X,Y),}puede factorizarse como una composición del operador de incrustación condicional con el operador de autocovarianza asociado conπ(Y){\displaystyle \pi (Y)}

doincógnitaYπ=doincógnitaYdoYYπ{\displaystyle {\mathcal {C}}_{XY}^{\pi }={\mathcal {C}}_{X\mid Y}{\mathcal {C}}_{YY}^{\pi }}

dónde

doincógnitaYπ=mi[φ(incógnita)φ(Y)],{\displaystyle {\mathcal {C}}_{XY}^{\pi }=\mathbb {E} [\varphi (X)\otimes \varphi (Y)],}
doYYπ=mi[φ(Y)φ(Y)].{\displaystyle {\mathcal {C}}_{YY}^{\pi }=\mathbb {E} [\varphi (Y)\otimes \varphi (Y)].}

En las implementaciones prácticas, la regla de la cadena del kernel toma la siguiente forma:

do^incógnitaYπ=do^incógnitaYdo^YYπ=Y(GRAMO+λI)1GRAMO~diagnóstico(α)Φ~T{\displaystyle {\widehat {\mathcal {C}}}_{XY}^{\pi }={\widehat {\mathcal {C}}}_{X\mid Y}{\widehat {\mathcal {C}}}_{YY}^{\pi }={\boldsymbol {\Upsilon }}(\mathbf {G} +\lambda \mathbf {I} )^{-1}{\widetilde {\mathbf {G} }}\operatorname {diag} ({\boldsymbol {\alpha }}){\boldsymbol {\widetilde {\Phi }}}^{T}}

Regla de Bayes del núcleo

En teoría de la probabilidad, una distribución posterior puede expresarse en términos de una distribución previa y una función de verosimilitud como

Q(Yincógnita)=PAG(incógnitaY)π(Y)Q(incógnita){\displaystyle Q(Y\mid x)={\frac {P(x\mid Y)\pi (Y)}{Q(x)}}}dóndeQ(incógnita)=ΩPAG(incógnitay)dπ(y){\displaystyle Q(x)=\int _{\Omega }P(x\mid y)\,\mathrm {d} \pi (y)}

El análogo de esta regla en el marco de incrustación de núcleo expresa la incrustación de núcleo de la distribución condicional en términos de operadores de incrustación condicional que son modificados por la distribución previa.

μYincógnitaπ=doYincógnitaπφ(incógnita)=doYincógnitaπ(doincógnitaincógnitaπ)1φ(incógnita){\displaystyle \mu _{Y\mid x}^{\pi }={\mathcal {C}}_{Y\mid X}^{\pi }\varphi (x)={\mathcal {C}}_{YX}^{\pi }\left({\mathcal {C}}_{XX}^{\pi }\right)^{-1}\varphi (x)}

de donde proviene la regla de la cadena:

doYincógnitaπ=(doincógnitaYdoYYπ)T.{\displaystyle {\mathcal {C}}_{YX}^{\pi }=\left({\mathcal {C}}_{X\mid Y}{\mathcal {C}}_{YY}^{\pi }\right)^{T}.}

En las implementaciones prácticas, la regla de Bayes del núcleo toma la siguiente forma:

μ^Yincógnitaπ=do^Yincógnitaπ((do^incógnitaincógnita)2+λ~I)1do^incógnitaincógnitaπφ(incógnita)=Φ~ΛT((DK)2+λ~I)1KDKincógnita{\displaystyle {\widehat {\mu }}_{Y\mid x}^{\pi }={\widehat {\mathcal {C}}}_{YX}^{\pi }\left(\left({\widehat {\mathcal {C}}}_{XX}\right)^{2}+{\widetilde {\lambda }}\mathbf {I} \right)^{-1}{\widehat {\mathcal {C}}}_{XX}^{\pi }\varphi (x)={\widetilde {\boldsymbol {\Phi }}}{\boldsymbol {\Lambda }}^{T}\left((\mathbf {D} \mathbf {K} )^{2}+{\widetilde {\lambda }}\mathbf {I} \right)^{-1}\mathbf {K} \mathbf {D} \mathbf {K} _{x}}

dónde

Λ=(GRAMO+λ~I)1GRAMO~diagnóstico(α),D=diagnóstico((GRAMO+λ~I)1GRAMO~α).{\displaystyle {\boldsymbol {\Lambda }}=\left(\mathbf {G} +{\widetilde {\lambda }}\mathbf {I} \right)^{-1}{\widetilde {\mathbf {G} }}\operatorname {diag} ({\boldsymbol {\alpha }}),\qquad \mathbf {D} =\operatorname {diag} \left(\left(\mathbf {G} +{\widetilde {\lambda }}\mathbf {I} \right)^{-1}{\widetilde {\mathbf {G} }}{\boldsymbol {\alpha }}\right).}

En este marco se utilizan dos parámetros de regularización:λ{\displaystyle \lambda }para la estimación dedo^Yincógnitaπ,do^incógnitaincógnitaπ=YDYT{\displaystyle {\widehat {\mathcal {C}}}_{YX}^{\pi },{\widehat {\mathcal {C}}}_{XX}^{\pi }={\boldsymbol {\Upsilon }}\mathbf {D} {\boldsymbol {\Upsilon }}^{T}}yλ~{\displaystyle {\widetilde {\lambda }}}para la estimación del operador de incrustación condicional final

do^Yincógnitaπ=do^Yincógnitaπ((do^incógnitaincógnitaπ)2+λ~I)1do^incógnitaincógnitaπ.{\displaystyle {\widehat {\mathcal {C}}}_{Y\mid X}^{\pi }={\widehat {\mathcal {C}}}_{YX}^{\pi }\left(\left({\widehat {\mathcal {C}}}_{XX}^{\pi }\right)^{2}+{\widetilde {\lambda }}\mathbf {I} \right)^{-1}{\widehat {\mathcal {C}}}_{XX}^{\pi }.}

Esta última regularización se realiza sobre el cuadrado dedo^incógnitaincógnitaπ{\displaystyle {\widehat {\mathcal {C}}}_{XX}^{\pi }}porqueD{\displaystyle D}puede que no sea positivo definido .

Aplicaciones

Medición de la distancia entre distribuciones

La discrepancia media máxima (DMM) es una medida de distancia entre distribuciones.PAG(incógnita){\displaystyle P(X)}yQ(Y){\displaystyle Q(Y)}que se define como la distancia entre sus incrustaciones en el RKHS [ 6 ]

MMD(PAG,Q)=μincógnitaμYH.{\displaystyle {\text{MMD}}(P,Q)=\left\|\mu _{X}-\mu _{Y}\right\|_{\mathcal {H}}.}

Si bien la mayoría de las medidas de distancia entre distribuciones, como la divergencia de Kullback-Leibler, ampliamente utilizada , requieren estimación de densidad (paramétrica o no paramétrica) o estrategias de partición espacial/corrección de sesgo, [ 6 ] la MMD se estima fácilmente como una media empírica que se concentra alrededor del valor verdadero de la MMD. La caracterización de esta distancia como la discrepancia media máxima se refiere al hecho de que calcular la MMD es equivalente a encontrar la función RKHS que maximiza la diferencia en las expectativas entre las dos distribuciones de probabilidad.

MMD(PAG,Q)=sorberFH1(mi[F(incógnita)]mi[F(Y)]),{\displaystyle {\text{MMD}}(P,Q)=\sup _{\|f\|_{\mathcal {H}}\leq 1}\left(\mathbb {E} [f(X)]-\mathbb {E} [f(Y)]\right),}

una forma de métrica de probabilidad integral .

Prueba de dos muestras del núcleo

Dados n ejemplos de entrenamiento dePAG(incógnita){\displaystyle P(X)}y m muestras deQ(Y){\displaystyle Q(Y)}Se puede formular un estadístico de prueba basado en la estimación empírica de la MMD.

MMD^(PAG,Q)=1nortei=1norteφ(incógnitai)1metroi=1metroφ(yi)H2=1norte2i=1nortej=1nortek(incógnitai,incógnitaj)+1metro2i=1metroj=1metrok(yi,yj)2nortemetroi=1nortej=1metrok(incógnitai,yj){\displaystyle {\begin{aligned}{\widehat {\text{MMD}}}(P,Q)&=\left\|{\frac {1}{n}}\sum _{i=1}^{n}\varphi (x_{i})-{\frac {1}{m}}\sum _{i=1}^{m}\varphi (y_{i})\right\|_{\mathcal {H}}^{2}\\[5pt]&={\frac {1}{n^{2}}}\sum _{i=1}^{n}\sum _{j=1}^{n}k(x_{i},x_{j})+{\frac {1}{m^{2}}}\sum _{i=1}^{m}\sum _{j=1}^{m}k(y_{i},y_{j})-{\frac {2}{nm}}\sum _{i=1}^{n}\sum _{j=1}^{m}k(x_{i},y_{j})\end{aligned}}}

para obtener una prueba de dos muestras [ 15 ] de la hipótesis nula de que ambas muestras provienen de la misma distribución (es decir,PAG=Q{\displaystyle P=Q}) frente a la alternativa ampliaPAGQ{\displaystyle P\neq Q}. Una prueba basada en MMD fue la primera prueba que demostró ser asintóticamente óptima para pruebas de hipótesis de dos muestras. [ 16 ]

Estimación de densidad mediante incrustaciones de núcleo

Aunque los algoritmos de aprendizaje en el marco de incrustación de kernel evitan la necesidad de una estimación de densidad intermedia, no obstante se puede utilizar la incrustación empírica para realizar una estimación de densidad basada en n muestras extraídas de una distribución subyacente.PAGincógnita{\displaystyle P_{X}^{*}}Esto se puede hacer resolviendo el siguiente problema de optimización [ 6 ] [ 17 ]

máximoPAGincógnitaH(PAGincógnita){\displaystyle \max _{P_{X}}H(P_{X})}sujeto aμ^incógnitaμincógnita[PAGincógnita]Hε{\displaystyle \|{\widehat {\mu }}_{X}-\mu _{X}[P_{X}]\|_{\mathcal {H}}\leq \varepsilon }

donde la maximización se realiza sobre todo el espacio de distribuciones enΩ.{\displaystyle \Omega .}Aquí,μincógnita[PAGincógnita]{\displaystyle \mu _{X}[P_{X}]}es la incrustación del núcleo de la densidad propuestaPAGincógnita{\displaystyle P_{X}}yH{\displaystyle H}es una magnitud similar a la entropía (por ejemplo, entropía , divergencia KL , divergencia de Bregman ). La distribución que resuelve esta optimización puede interpretarse como un compromiso entre ajustar bien las medias del núcleo empírico de las muestras, al tiempo que se asigna una porción sustancial de la masa de probabilidad a todas las regiones del espacio de probabilidad (muchas de las cuales pueden no estar representadas en los ejemplos de entrenamiento). En la práctica, se puede encontrar una buena solución aproximada de la difícil optimización restringiendo el espacio de densidades candidatas a una mezcla de M distribuciones candidatas con proporciones de mezcla regularizadas. Se pueden establecer conexiones entre las ideas subyacentes a los procesos gaussianos y los campos aleatorios condicionales con la estimación de distribuciones de probabilidad condicionales de esta manera, si se consideran las asignaciones de características asociadas con el núcleo como estadísticas suficientes en familias exponenciales generalizadas (posiblemente de dimensión infinita) . [ 6 ]

Medición de la dependencia de variables aleatorias

Una medida de la dependencia estadística entre variables aleatoriasincógnita{\displaystyle X}yY{\displaystyle Y}(de cualquier dominio en el que se puedan definir núcleos sensatos) se pueden formular basándose en el Criterio de Independencia de Hilbert-Schmidt [ 18 ].

HSIC(incógnita,Y)=doincógnitaYμincógnitaμYHH2{\displaystyle {\text{HSIC}}(X,Y)=\left\|{\mathcal {C}}_{XY}-\mu _{X}\otimes \mu _{Y}\right\|_{{\mathcal {H}}\otimes {\mathcal {H}}}^{2}}

y puede utilizarse como un reemplazo basado en principios para la información mutua , la correlación de Pearson o cualquier otra medida de dependencia utilizada en algoritmos de aprendizaje. En particular, HSIC puede detectar dependencias arbitrarias (cuando se utiliza un núcleo característico en las incrustaciones, HSIC es cero si y solo si las variables son independientes ), y puede utilizarse para medir la dependencia entre diferentes tipos de datos (por ejemplo, imágenes y subtítulos de texto). Dados n muestras i.i.d. de cada variable aleatoria, se puede calcular un estimador simple, insesgado y sin parámetros de HSIC que muestra concentración alrededor del valor verdadero.O(norte(dF2+dgramo2)){\displaystyle O(n(d_{f}^{2}+d_{g}^{2}))}tiempo, [ 6 ] donde las matrices de Gram de los dos conjuntos de datos se aproximan usandoAAT,BBT{\displaystyle \mathbf {A} \mathbf {A} ^{T},\mathbf {B} \mathbf {B} ^{T}}conARnorte×dF,BRnorte×dgramo{\displaystyle \mathbf {A} \in \mathbb {R} ^{n\times d_{f}},\mathbf {B} \in \mathbb {R} ^{n\times d_{g}}}Las propiedades deseables de HSIC han llevado a la formulación de numerosos algoritmos que utilizan esta medida de dependencia para una variedad de tareas comunes de aprendizaje automático, tales como: selección de características (BAHSIC [ 19 ] ), agrupamiento (CLUHSIC [ 20 ] ) y reducción de dimensionalidad (MUHSIC [ 21 ] ).

HSIC puede extenderse para medir la dependencia de múltiples variables aleatorias. La cuestión de cuándo HSIC captura la independencia en este caso se ha estudiado recientemente: [ 22 ] para más de dos variables

  • enRd{\displaystyle \mathbb {R} ^{d}}: la propiedad característica de los núcleos individuales sigue siendo una condición equivalente.
  • En dominios generales: la propiedad característica de los componentes del núcleo es necesaria pero no suficiente .

Propagación de creencias del núcleo

La propagación de creencias es un algoritmo fundamental para la inferencia en modelos gráficos en el que los nodos se envían y reciben repetidamente mensajes correspondientes a la evaluación de expectativas condicionales. En el marco de incrustación de kernel, los mensajes pueden representarse como funciones RKHS y las incrustaciones de distribución condicional pueden aplicarse para calcular eficientemente las actualizaciones de mensajes. Dados n muestras de variables aleatorias representadas por nodos en un campo aleatorio de Markov , el mensaje entrante al nodo t desde el nodo u puede expresarse como

metrot()=i=1norteβtiφ(incógnitati){\displaystyle m_{ut}(\cdot )=\sum _{i=1}^{n}\beta _{ut}^{i}\varphi (x_{t}^{i})}

si se supone que está en el RKHS. El mensaje de actualización de propagación de creencias del núcleo de t al nodo s viene dado por [ 2 ]

metro^ts=(norte(t)sKtβt)T(Ks+λI)1YsTφ(incógnitas){\displaystyle {\widehat {m}}_{ts}=\left(\odot _{u\in N(t)\backslash s}\mathbf {K} _{t}{\boldsymbol {\beta }}_{ut}\right)^{T}(\mathbf {K} _{s}+\lambda \mathbf {I} )^{-1}{\boldsymbol {\Upsilon }}_{s}^{T}\varphi (x_{s})}

dónde{\displaystyle \odot }denota el producto vectorial elemento a elemento,norte(t)s{\displaystyle N(t)\backslash s}es el conjunto de nodos conectados a t excluyendo el nodo s ,βt=(βt1,,βtnorte){\displaystyle {\boldsymbol {\beta }}_{ut}=\left(\beta _{ut}^{1},\dots ,\beta _{ut}^{n}\right)},Kt,Ks{\displaystyle \mathbf {K} _{t},\mathbf {K} _{s}}son las matrices de Gram de las muestras de variablesincógnitat,incógnitas{\displaystyle X_{t},X_{s}}, respectivamente, yYs=(φ(incógnitas1),,φ(incógnitasnorte)){\displaystyle {\boldsymbol {\Upsilon }}_{s}=\left(\varphi (x_{s}^{1}),\dots ,\varphi (x_{s}^{n})\right)}es la matriz de características para las muestras deincógnitas{\displaystyle X_{s}}.

Por lo tanto, si los mensajes entrantes al nodo t son combinaciones lineales de muestras mapeadas de características deincógnitat{\displaystyle X_{t}}, entonces el mensaje saliente de este nodo también es una combinación lineal de muestras mapeadas de características deincógnitas{\displaystyle X_{s}}Esta representación de la función RKHS de las actualizaciones de paso de mensajes produce, por lo tanto, un algoritmo eficiente de propagación de creencias en el que los potenciales son funciones no paramétricas inferidas a partir de los datos, de modo que se pueden modelar relaciones estadísticas arbitrarias. [ 2 ]

Filtrado no paramétrico en modelos ocultos de Markov

En el modelo oculto de Markov (HMM), dos cantidades clave de interés son las probabilidades de transición entre estados ocultos.PAG(StSt1){\displaystyle P(S^{t}\mid S^{t-1})}y las probabilidades de emisiónPAG(OtSt){\displaystyle P(O^{t}\mid S^{t})}para observaciones. Utilizando el marco de incrustación de distribución condicional de kernel, estas cantidades pueden expresarse en términos de muestras del HMM. Una limitación importante de los métodos de incrustación en este dominio es la necesidad de muestras de entrenamiento que contengan estados ocultos, ya que de lo contrario no es posible realizar inferencias con distribuciones arbitrarias en el HMM.

Un uso común de los HMM es el filtrado, cuyo objetivo es estimar la distribución posterior sobre el estado oculto.st{\displaystyle s^{t}}en el paso de tiempo t dado un historial de observaciones previasht=(o1,,ot){\displaystyle h^{t}=(o^{1},\dots ,o^{t})}del sistema. En el filtrado, un estado de creenciaPAG(St+1ht+1){\displaystyle P(S^{t+1}\mid h^{t+1})}se mantiene recursivamente a través de un paso de predicción (donde se actualizaPAG(St+1ht)=mi[PAG(St+1St)ht]{\displaystyle P(S^{t+1}\mid h^{t})=\mathbb {E} [P(S^{t+1}\mid S^{t})\mid h^{t}]}se calculan marginalizando el estado oculto anterior) seguido de un paso de condicionamiento (donde las actualizacionesPAG(St+1ht,ot+1)PAG(ot+1St+1)PAG(St+1ht){\displaystyle P(S^{t+1}\mid h^{t},o^{t+1})\propto P(o^{t+1}\mid S^{t+1})P(S^{t+1}\mid h^{t})}se calculan aplicando la regla de Bayes a una condición sobre una nueva observación). [ 2 ] La incrustación RKHS del estado de creencia en el tiempo t+1 se puede expresar recursivamente como

μSt+1ht+1=doSt+1Ot+1π(doOt+1Ot+1π)1φ(ot+1){\displaystyle \mu _{S^{t+1}\mid h^{t+1}}={\mathcal {C}}_{S^{t+1}O^{t+1}}^{\pi }\left({\mathcal {C}}_{O^{t+1}O^{t+1}}^{\pi }\right)^{-1}\varphi (o^{t+1})}

calculando las incrustaciones del paso de predicción mediante la regla de suma del kernel y la incrustación del paso de condicionamiento mediante la regla de Bayes del kernel . Suponiendo una muestra de entrenamiento(s~1,,s~T,o~1,,o~T){\displaystyle ({\widetilde {s}}^{1},\dots ,{\widetilde {s}}^{T},{\widetilde {o}}^{1},\dots ,{\widetilde {o}}^{T})}Si se da, en la práctica se puede estimar

μ^St+1ht+1=i=1Tαitφ(s~t){\displaystyle {\widehat {\mu }}_{S^{t+1}\mid h^{t+1}}=\sum _{i=1}^{T}\alpha _{i}^{t}\varphi ({\widetilde {s}}^{t})}

y el filtrado con incrustaciones de kernel se implementa de manera recursiva utilizando las siguientes actualizaciones para los pesosα=(α1,,αT){\displaystyle {\boldsymbol {\alpha }}=(\alpha _{1},\dots ,\alpha _{T})}[ 2 ]

Dt+1=diagnóstico((GRAMO+λI)1GRAMO~αt){\displaystyle \mathbf {D} ^{t+1}=\operatorname {diag} \left((G+\lambda \mathbf {I} )^{-1}{\widetilde {G}}{\boldsymbol {\alpha }}^{t}\right)}
αt+1=Dt+1K((Dt+1K)2+λ~I)1Dt+1Kot+1{\displaystyle {\boldsymbol {\alpha }}^{t+1}=\mathbf {D} ^{t+1}\mathbf {K} \left((\mathbf {D} ^{t+1}K)^{2}+{\widetilde {\lambda }}\mathbf {I} \right)^{-1}\mathbf {D} ^{t+1}\mathbf {K} _{o^{t+1}}}

dóndeGRAMO,K{\displaystyle \mathbf {G} ,\mathbf {K} }denotemos las matrices de Gram des~1,,s~T{\displaystyle {\widetilde {s}}^{1},\dots ,{\widetilde {s}}^{T}}yo~1,,o~T{\displaystyle {\widetilde {o}}^{1},\dots ,{\widetilde {o}}^{T}}respectivamente,GRAMO~{\displaystyle {\widetilde {\mathbf {G} }}}es una matriz de Gram de transferencia definida comoGRAMO~ij=k(s~i,s~j+1),{\displaystyle {\widetilde {\mathbf {G} }}_{ij}=k({\widetilde {s}}_{i},{\widetilde {s}}_{j+1}),}yKot+1=(k(o~1,ot+1),,k(o~T,ot+1))T.{\displaystyle \mathbf {K} _{o^{t+1}}=(k({\widetilde {o}}^{1},o^{t+1}),\dots ,k({\widetilde {o}}^{T},o^{t+1}))^{T}.}

Máquinas de medición de soporte

La máquina de medidas de soporte (SMM) es una generalización de la máquina de vectores de soporte (SVM) en la que los ejemplos de entrenamiento son distribuciones de probabilidad emparejadas con etiquetas.{PAGi,yi}i=1norte, yi{+1,1}{\displaystyle \{P_{i},y_{i}\}_{i=1}^{n},\ y_{i}\in \{+1,-1\}}. [ 23 ] Los SMM resuelven el problema de optimización dual estándar de SVM utilizando el siguiente kernel esperado

K(PAG(incógnita),Q(Z))=μincógnita,μZH=mi[k(incógnita,z)]{\displaystyle K\left(P(X),Q(Z)\right)=\langle \mu _{X},\mu _{Z}\rangle _{\mathcal {H}}=\mathbb {E} [k(x,z)]}

que se puede calcular en forma cerrada para muchas distribuciones específicas comunes.PAGi{\displaystyle P_{i}}(como la distribución gaussiana) combinada con núcleos de incrustación popularesk{\displaystyle k}(por ejemplo, el núcleo gaussiano o el núcleo polinómico), o pueden estimarse empíricamente con precisión a partir de muestras i.i.d.{incógnitai}i=1nortePAG(incógnita),{zj}j=1metroQ(Z){\displaystyle \{x_{i}\}_{i=1}^{n}\sim P(X),\{z_{j}\}_{j=1}^{m}\sim Q(Z)}a través de

K^(incógnita,Z)=1nortemetroi=1nortej=1metrok(incógnitai,zj){\displaystyle {\widehat {K}}(X,Z)={\frac {1}{nm}}\sum _{i=1}^{n}\sum _{j=1}^{m}k(x_{i},z_{j})}

Bajo ciertas elecciones del núcleo de incrustaciónk{\displaystyle k}, el SMM aplicado a ejemplos de entrenamiento{PAGi,yi}i=1norte{\displaystyle \{P_{i},y_{i}\}_{i=1}^{n}}es equivalente a una SVM entrenada en muestras{incógnitai,yi}i=1norte{\displaystyle \{x_{i},y_{i}\}_{i=1}^{n}}y, por lo tanto, el SMM puede considerarse como un SVM flexible en el que un núcleo diferente dependiente de los datos (especificado por la forma supuesta de la distribución)PAGi{\displaystyle P_{i}}) se pueden colocar en cada punto de entrenamiento. [ 23 ]

Adaptación de dominio bajo cambio de covariable, objetivo y condicional

El objetivo de la adaptación de dominio es la formulación de algoritmos de aprendizaje que se generalicen bien cuando los datos de entrenamiento y de prueba tengan distribuciones diferentes. Dados los ejemplos de entrenamiento{(incógnitaitr,yitr)}i=1norte{\displaystyle \{(x_{i}^{\text{tr}},y_{i}^{\text{tr}})\}_{i=1}^{n}}y un conjunto de prueba{(incógnitajte,yjte)}j=1metro{\displaystyle \{(x_{j}^{\text{te}},y_{j}^{\text{te}})\}_{j=1}^{m}}donde elyjte{\displaystyle y_{j}^{\text{te}}}Se desconocen tres tipos de diferencias comúnmente asumidas entre la distribución de los ejemplos de entrenamiento.PAGtr(incógnita,Y){\displaystyle P^{\text{tr}}(X,Y)}y la distribución de la pruebaPAGte(incógnita,Y){\displaystyle P^{\text{te}}(X,Y)}: [ 24 ] [ 25 ]

  1. Cambio de covariables en el que la distribución marginal de las covariables cambia entre dominios:PAGtr(incógnita)PAGte(incógnita){\displaystyle P^{\text{tr}}(X)\neq P^{\text{te}}(X)}
  2. Cambio de objetivo en el que la distribución marginal de los resultados cambia entre dominios:PAGtr(Y)PAGte(Y){\displaystyle P^{\text{tr}}(Y)\neq P^{\text{te}}(Y)}
  3. Cambio condicional en el quePAG(Y){\displaystyle P(Y)}permanece igual en todos los dominios, pero las distribuciones condicionales difieren:PAGtr(incógnitaY)PAGte(incógnitaY){\displaystyle P^{\text{tr}}(X\mid Y)\neq P^{\text{te}}(X\mid Y)}En general, la presencia de un cambio condicional conduce a un problema mal planteado , y la suposición adicional de quePAG(incógnitaY){\displaystyle P(X\mid Y)}cambios únicamente bajo transformaciones de ubicación - escala (LS) enincógnita{\displaystyle X}Se suele imponer para que el problema sea manejable.

Al utilizar la incrustación de núcleo de distribuciones marginales y condicionales, se pueden formular enfoques prácticos para abordar la presencia de este tipo de diferencias entre los dominios de entrenamiento y prueba. El cambio de covariable se puede tener en cuenta reponderando los ejemplos a través de estimaciones de la razónPAGte(incógnita)/PAGtr(incógnita){\displaystyle P^{\text{te}}(X)/P^{\text{tr}}(X)}obtenido directamente de las incrustaciones del núcleo de las distribuciones marginales deincógnita{\displaystyle X}en cada dominio sin necesidad de estimación explícita de las distribuciones. [ 25 ] Desplazamiento del objetivo, que no se puede tratar de manera similar ya que no hay muestras deY{\displaystyle Y}están disponibles en el dominio de prueba, se tiene en cuenta ponderando los ejemplos de entrenamiento usando el vectorβ(ytr){\displaystyle {\boldsymbol {\beta }}^{*}(\mathbf {y} ^{\text{tr}})}que resuelve el siguiente problema de optimización (donde en la práctica se deben utilizar aproximaciones empíricas) [ 24 ]

minβ(y)do(incógnitaY)trmi[β(y)φ(ytr)]μincógnitateH2{\displaystyle \min _{{\boldsymbol {\beta }}(y)}\left\|{\mathcal {C}}_{{(X\mid Y)}^{\text{tr}}}\mathbb {E} [{\boldsymbol {\beta }}(y)\varphi (y^{\text{tr}})]-\mu _{X^{\text{te}}}\right\|_{\mathcal {H}}^{2}}sujeto aβ(y)0,mi[β(ytr)]=1{\displaystyle {\boldsymbol {\beta }}(y)\geq 0,\mathbb {E} [{\boldsymbol {\beta }}(y^{\text{tr}})]=1}

Para abordar el cambio condicional de escala de ubicación, se puede realizar una transformación LS de los puntos de entrenamiento para obtener nuevos datos de entrenamiento transformados.incógnitanuevo=incógnitatrW+B{\displaystyle \mathbf {X} ^{\text{new}}=\mathbf {X} ^{\text{tr}}\odot \mathbf {W} +\mathbf {B} }(dónde{\displaystyle \odot }denota el producto vectorial elemento a elemento). Para asegurar distribuciones similares entre las nuevas muestras de entrenamiento transformadas y los datos de prueba,W,B{\displaystyle \mathbf {W} ,\mathbf {B} }se estiman minimizando la siguiente distancia de incrustación de núcleo empírica [ 24 ]

μ^incógnitanuevoμ^incógnitateH2=do^(incógnitaY)nuevoμ^Ytrμ^incógnitateH2{\displaystyle \left\|{\widehat {\mu }}_{X^{\text{new}}}-{\widehat {\mu }}_{X^{\text{te}}}\right\|_{\mathcal {H}}^{2}=\left\|{\widehat {\mathcal {C}}}_{(X\mid Y)^{\text{new}}}{\widehat {\mu }}_{Y^{\text{tr}}}-{\widehat {\mu }}_{X^{\text{te}}}\right\|_{\mathcal {H}}^{2}}

En general, los métodos de incrustación de núcleo para tratar el desplazamiento condicional de LS y el desplazamiento del objetivo se pueden combinar para encontrar una transformación ponderada de los datos de entrenamiento que imite la distribución de prueba, y estos métodos pueden funcionar bien incluso en presencia de desplazamientos condicionales distintos de los cambios de ubicación y escala. [ 24 ]

Generalización de dominio mediante representación de características invariantes

Dados N conjuntos de ejemplos de entrenamiento muestreados i.i.d. de distribucionesPAG(1)(incógnita,Y),PAG(2)(incógnita,Y),,PAG(norte)(incógnita,Y){\displaystyle P^{(1)}(X,Y),P^{(2)}(X,Y),\ldots ,P^{(N)}(X,Y)}El objetivo de la generalización de dominio es formular algoritmos de aprendizaje que funcionen bien en ejemplos de prueba muestreados de un dominio previamente no visto.PAG(incógnita,Y){\displaystyle P^{*}(X,Y)}donde no hay datos del dominio de prueba disponibles en el momento del entrenamiento. Si las distribuciones condicionalesPAG(Yincógnita){\displaystyle P(Y\mid X)}Se supone que son relativamente similares en todos los dominios, entonces un aprendiz capaz de generalizar el dominio debe estimar una relación funcional entre las variables que sea robusta a los cambios en los marginales.PAG(incógnita){\displaystyle P(X)}Basado en incrustaciones de núcleo de estas distribuciones, el Análisis de Componentes Invariantes de Dominio (DICA) es un método que determina la transformación de los datos de entrenamiento que minimiza la diferencia entre las distribuciones marginales, preservando al mismo tiempo una distribución condicional común compartida entre todos los dominios de entrenamiento. [ 26 ] DICA extrae así invariantes , características que se transfieren entre dominios, y puede considerarse una generalización de muchos métodos populares de reducción de dimensionalidad, como el análisis de componentes principales de núcleo , el análisis de componentes de transferencia y la regresión inversa del operador de covarianza. [ 26 ]

Definición de una distribución de probabilidadPAG{\displaystyle {\mathcal {P}}}en el RKHSH{\displaystyle {\mathcal {H}}}con

PAG(μincógnita(i)Y(i))=1norte para i=1,,norte,{\displaystyle {\mathcal {P}}\left(\mu _{X^{(i)}Y^{(i)}}\right)={\frac {1}{N}}\qquad {\text{ for }}i=1,\dots ,N,}

DICA mide la disimilitud entre dominios a través de la varianza de distribución que se calcula como

VH(PAG)=1nortetr(GRAMO)1norte2i,j=1norteGRAMOij{\displaystyle V_{\mathcal {H}}({\mathcal {P}})={\frac {1}{N}}\operatorname {tr} (\mathbf {G} )-{\frac {1}{N^{2}}}\sum _{i,j=1}^{N}\mathbf {G} _{ij}}

dónde

GRAMOij=μincógnita(i),μincógnita(j)H{\displaystyle \mathbf {G} _{ij}=\left\langle \mu _{X^{(i)}},\mu _{X^{(j)}}\right\rangle _{\mathcal {H}}}

entoncesGRAMO{\displaystyle \mathbf {G} }es unnorte×norte{\displaystyle N\times N}Matriz de Gram sobre las distribuciones de las cuales se muestrean los datos de entrenamiento. Al encontrar una transformación ortogonal sobre un subespacio de baja dimensión B (en el espacio de características) que minimiza la varianza de la distribución, DICA asegura simultáneamente que B se alinee con las bases de un subespacio central C para el cualY{\displaystyle Y}se vuelve independiente deincógnita{\displaystyle X}dadodoTincógnita{\displaystyle C^{T}X}en todos los dominios. En ausencia de valores objetivoY{\displaystyle Y}, se puede formular una versión no supervisada de DICA que encuentra un subespacio de baja dimensión que minimiza la varianza de la distribución mientras maximiza simultáneamente la varianza deincógnita{\displaystyle X}(en el espacio de características) en todos los dominios (en lugar de preservar un subespacio central). [ 26 ]

regresión de distribución

En la regresión de distribución, el objetivo es regresar de distribuciones de probabilidad a números reales (o vectores). Muchas tareas importantes de aprendizaje automático y estadística se ajustan a este marco, incluyendo el aprendizaje multiinstancia y los problemas de estimación puntual sin solución analítica (como la estimación de hiperparámetros o entropía ). En la práctica, solo se pueden observar muestras de distribuciones muestreadas, y las estimaciones deben basarse en similitudes calculadas entre conjuntos de puntos . La regresión de distribución se ha aplicado con éxito, por ejemplo, en el aprendizaje supervisado de entropía y en la predicción de aerosoles utilizando imágenes satelitales multiespectrales. [ 27 ]

Dado({incógnitai,norte}norte=1nortei,yi)i=1{\displaystyle {\left(\{X_{i,n}\}_{n=1}^{N_{i}},y_{i}\right)}_{i=1}^{\ell }}datos de entrenamiento, donde elincógnitai^:={incógnitai,norte}norte=1nortei{\displaystyle {\hat {X_{i}}}:=\{X_{i,n}\}_{n=1}^{N_{i}}}La bolsa contiene muestras de una distribución de probabilidad.incógnitai{\displaystyle X_{i}}y eliel{\displaystyle i^{\text{th}}}La etiqueta de salida esyiR{\displaystyle y_{i}\in \mathbb {R} }Se puede abordar la tarea de regresión de distribución tomando las incrustaciones de las distribuciones y aprendiendo el regresor a partir de las incrustaciones para las salidas. En otras palabras, se puede considerar el siguiente problema de regresión de cresta de núcleo.(λ>0){\displaystyle (\lambda >0)}

J(F)=1i=1[F(μincógnitai^)yi]2+λFH(K)2minFH(K),{\displaystyle J(f)={\frac {1}{\ell }}\sum _{i=1}^{\ell }\left[f\left(\mu _{\hat {X_{i}}}\right)-y_{i}\right]^{2}+\lambda \|f\|_{{\mathcal {H}}(K)}^{2}\to \min _{f\in {\mathcal {H}}(K)},}

dónde

μincógnita^i=Ωk(,)dincógnita^i()=1norteinorte=1norteik(,incógnitai,norte){\displaystyle \mu _{{\hat {X}}_{i}}=\int _{\Omega }k(\cdot ,u)\,\mathrm {d} {\hat {X}}_{i}(u)={\frac {1}{N_{i}}}\sum _{n=1}^{N_{i}}k(\cdot ,X_{i,n})}

con unk{\displaystyle k}núcleo en el dominio deincógnitai{\displaystyle X_{i}}-s(k:Ω×ΩR){\displaystyle (k:\Omega \times \Omega \to \mathbb {R} )},K{\displaystyle K}es un núcleo en las distribuciones integradas yH(K){\displaystyle {\mathcal {H}}(K)}es el RKHS determinado porK{\displaystyle K}Ejemplos deK{\displaystyle K}incluir el núcleo lineal[K(μPAG,μQ)=μPAG,μQH(k)]{\displaystyle \left[K(\mu _{P},\mu _{Q})=\langle \mu _{P},\mu _{Q}\rangle _{{\mathcal {H}}(k)}\right]}, el núcleo gaussiano[K(μPAG,μQ)=miμPAGμQH(k)2/(2σ2)]{\displaystyle \left[K(\mu _{P},\mu _{Q})=e^{-\left\|\mu _{P}-\mu _{Q}\right\|_{H(k)}^{2}/(2\sigma ^{2})}\right]}, el núcleo exponencial[K(μPAG,μQ)=miμPAGμQH(k)/(2σ2)]{\displaystyle \left[K(\mu _{P},\mu _{Q})=e^{-\left\|\mu _{P}-\mu _{Q}\right\|_{H(k)}/(2\sigma ^{2})}\right]}, el núcleo de Cauchy[K(μPAG,μQ)=(1+μPAGμQH(k)2/σ2)1]{\displaystyle \left[K(\mu _{P},\mu _{Q})=\left(1+\left\|\mu _{P}-\mu _{Q}\right\|_{H(k)}^{2}/\sigma ^{2}\right)^{-1}\right]}, el núcleo t-estudiante generalizado[K(μPAG,μQ)=(1+μPAGμQH(k)σ)1,(σ2)]{\displaystyle \left[K(\mu _{P},\mu _{Q})=\left(1+\left\|\mu _{P}-\mu _{Q}\right\|_{H(k)}^{\sigma }\right)^{-1},(\sigma \leq 2)\right]}o el núcleo de multicuadráticas inversas[K(μPAG,μQ)=(μPAGμQH(k)2+σ2)12]{\displaystyle \left[K(\mu _{P},\mu _{Q})=\left(\left\|\mu _{P}-\mu _{Q}\right\|_{H(k)}^{2}+\sigma ^{2}\right)^{-{\frac {1}{2}}}\right]}.

La predicción sobre una nueva distribución(incógnita^){\displaystyle ({\hat {X}})}adopta la forma simple y analítica

y^(incógnita^)=k[GRAMO+λ]1y,{\displaystyle {\hat {y}}{\big (}{\hat {X}}{\big )}=\mathbf {k} [\mathbf {G} +\lambda \ell ]^{-1}\mathbf {y} ,}

dóndek=[K(μincógnita^i,μincógnita^)]R1×{\displaystyle \mathbf {k} ={\big [}K{\big (}\mu _{{\hat {X}}_{i}},\mu _{\hat {X}}{\big )}{\big ]}\in \mathbb {R} ^{1\times \ell }},GRAMO=[GRAMOij]R×{\displaystyle \mathbf {G} =[G_{ij}]\in \mathbb {R} ^{\ell \times \ell }},GRAMOij=K(μincógnita^i,μincógnita^j)R{\displaystyle G_{ij}=K{\big (}\mu _{{\hat {X}}_{i}},\mu _{{\hat {X}}_{j}}{\big )}\in \mathbb {R} },y=[y1;;y]R{\displaystyle \mathbf {y} =[y_{1};\ldots ;y_{\ell }]\in \mathbb {R} ^{\ell }}Bajo condiciones de regularidad leves, se puede demostrar que este estimador es consistente y puede lograr el muestreo de una etapa (como si se tuviera acceso al verdaderoincógnitai{\displaystyle X_{i}}-s) tasa óptima minimax . [ 27 ] En elJ{\displaystyle J}función objetivoyi{\displaystyle y_{i}}-s son números reales; los resultados también pueden extenderse al caso en queyi{\displaystyle y_{i}}-s sond{\displaystyle d}vectores de dimensión , o más generalmente elementos de un espacio de Hilbert separable usando operadores con valoresK{\displaystyle K}granos.

Ejemplo

En este sencillo ejemplo, que se toma de Song et al., [ 2 ]incógnita,Y{\displaystyle X,Y}Se supone que son variables aleatorias discretas que toman valores en el conjunto{1,,K}{\displaystyle \{1,\ldots ,K\}}y el núcleo se elige como la función delta de Kronecker , por lo quek(incógnita,incógnita)=δ(incógnita,incógnita){\displaystyle k(x,x')=\delta (x,x')}El mapa de características correspondiente a este núcleo es el vector base estándar .φ(incógnita)=miincógnita{\displaystyle \varphi (x)=\mathbf {e} _{x}}. Las incrustaciones del núcleo de tales distribuciones son, por lo tanto, vectores de probabilidades marginales, mientras que las incrustaciones de distribuciones conjuntas en este contexto sonK×K{\displaystyle K\times K}matrices que especifican tablas de probabilidad conjuntas, y la forma explícita de estas incrustaciones es

μincógnita=mi[miincógnita]=(PAG(incógnita=1)PAG(incógnita=K)){\displaystyle \mu _{X}=\mathbb {E} [\mathbf {e} _{X}]={\begin{pmatrix}P(X=1)\\\vdots \\P(X=K)\\\end{pmatrix}}}
doincógnitaY=mi[miincógnitamiY]=(PAG(incógnita=s,Y=t))s,t{1,,K}{\displaystyle {\mathcal {C}}_{XY}=\mathbb {E} [\mathbf {e} _{X}\otimes \mathbf {e} _{Y}]=(P(X=s,Y=t))_{s,t\in \{1,\ldots ,K\}}}

CuandoPAG(incógnita=s)>0{\displaystyle P(X=s)>0}, para todoss{1,,K}{\displaystyle s\in \{1,\ldots ,K\}}, el operador de incrustación de distribución condicional,

doYincógnita=doYincógnitadoincógnitaincógnita1,{\displaystyle {\mathcal {C}}_{Y\mid X}={\mathcal {C}}_{YX}{\mathcal {C}}_{XX}^{-1},}

¿Es en este contexto una tabla de probabilidad condicional?

doYincógnita=(PAG(Y=sincógnita=t))s,t{1,,K}{\displaystyle {\mathcal {C}}_{Y\mid X}=(P(Y=s\mid X=t))_{s,t\in \{1,\dots ,K\}}}

y

doincógnitaincógnita=(PAG(incógnita=1)00PAG(incógnita=K)){\displaystyle {\mathcal {C}}_{XX}={\begin{pmatrix}P(X=1)&\dots &0\\\vdots &\ddots &\vdots \\0&\dots &P(X=K)\\\end{pmatrix}}}

Por lo tanto, las incrustaciones de la distribución condicional bajo un valor fijo deincógnita{\displaystyle X}puede calcularse como

μYincógnita=doYincógnitaφ(incógnita)=(PAG(Y=1incógnita=incógnita)PAG(Y=Kincógnita=incógnita)){\displaystyle \mu _{Y\mid x}={\mathcal {C}}_{Y\mid X}\varphi (x)={\begin{pmatrix}P(Y=1\mid X=x)\\\vdots \\P(Y=K\mid X=x)\\\end{pmatrix}}}

En este entorno de valores discretos con el núcleo delta de Kronecker, la regla de suma del núcleo se convierte en:

(PAG(incógnita=1)PAG(incógnita=norte))μincógnitaπ=(PAG(incógnita=sY=t))doincógnitaY(π(Y=1)π(Y=norte))μYπ{\displaystyle \underbrace {\begin{pmatrix}P(X=1)\\\vdots \\P(X=N)\\\end{pmatrix}} _{\mu _{X}^{\pi }}=\underbrace {\begin{pmatrix}\\P(X=s\mid Y=t)\\\\\end{pmatrix}} _{{\mathcal {C}}_{X\mid Y}}\underbrace {\begin{pmatrix}\pi (Y=1)\\\vdots \\\pi (Y=N)\\\end{pmatrix}} _{\mu _{Y}^{\pi }}}

La regla de la cadena del núcleo en este caso viene dada por

(PAG(incógnita=s,Y=t))doincógnitaYπ=(PAG(incógnita=sY=t))doincógnitaY(π(Y=1)00π(Y=K))doYYπ{\displaystyle \underbrace {\begin{pmatrix}\\P(X=s,Y=t)\\\\\end{pmatrix}} _{{\mathcal {C}}_{XY}^{\pi }}=\underbrace {\begin{pmatrix}\\P(X=s\mid Y=t)\\\\\end{pmatrix}} _{{\mathcal {C}}_{X\mid Y}}\underbrace {\begin{pmatrix}\pi (Y=1)&\dots &0\\\vdots &\ddots &\vdots \\0&\dots &\pi (Y=K)\\\end{pmatrix}} _{{\mathcal {C}}_{YY}^{\pi }}}

Referencias

  1. 1 2 A. Smola, A. Gretton, L. Song, B. Schölkopf. (2007). Un incrustamiento de espacio de Hilbert para distribuciones. Archivado el 15/12/2013 en Wayback Machine . Teoría del aprendizaje algorítmico: 18.ª Conferencia Internacional . Springer: 13–31.
  2. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 L. Song, K. Fukumizu, F. Dinuzzo, A. Gretton (2013). Incrustaciones de núcleo de distribuciones condicionales: un marco de núcleo unificado para la inferencia no paramétrica en modelos gráficos . IEEE Signal Processing Magazine 30 : 98–111.
  3. J. Shawe-Taylor, N. Christianini. (2004). Métodos de núcleo para el análisis de patrones . Cambridge University Press, Cambridge, Reino Unido.
  4. T. Hofmann, B. Schölkopf, A. Smola. (2008). Métodos de kernel en aprendizaje automático . The Annals of Statistics 36 (3):1171–1220.
  5. Muandet, Krikamol; Fukumizu, Kenji; Sriperumbudur, Bharath; Schölkopf, Bernhard (2017-06-28). "Kernel Mean Incedding of Distributions: A Review and Beyond". Foundations and Trends in Machine Learning . 10 ( 1– 2): 1– 141. arXiv : 1605.09522 . doi : 10.1561/2200000060 . ISSN 1935-8237 . 
  6. 1 2 3 4 5 6 7 8 9 L. Song. (2008) Aprendizaje mediante incrustación de distribuciones en el espacio de Hilbert . Tesis doctoral, Universidad de Sídney.
  7. K. Fukumizu, A. Gretton, X. Sun y B. Schölkopf (2008). Medidas de núcleo de independencia condicional . Advances in Neural Information Processing Systems 20 , MIT Press, Cambridge, MA.
  8. 1 2 3 L. Song, J. Huang, AJ Smola, K. Fukumizu. (2009). Incrustaciones en el espacio de Hilbert de distribuciones condicionales. Archivado el 15 de diciembre de 2013 en Wayback Machine . Actas de la Conferencia Internacional sobre Aprendizaje Automático . Montreal, Canadá: 961–968.
    • Steinwart, Ingo; Christmann, Andreas (2008). Máquinas de vectores de soporte . Nueva York: Springer. ISBN 978-0-387-77241-7.
  9. Sriperumbudur, BK; Fukumizu, K.; Lanckriet, GRG (2011). "Universalidad, núcleos característicos e incrustación RKHS de medidas". Journal of Machine Learning Research . 12 (70).
  10. Liang, Percy (2016), CS229T/STAT231: Teoría del aprendizaje estadístico (PDF) , apuntes de clase de Stanford
  11. Sriperumbudur, BK; Fukumizu, K.; Lanckriet, GRG (2010). Sobre la relación entre universalidad, núcleos característicos e incrustación RKHS de medidas . Actas de la Decimotercera Conferencia Internacional sobre Inteligencia Artificial y Estadística. Italia.
  12. Micchelli, CA; Xu, Y.; Zhang, H. (2006). "Universal Kernels" . Journal of Machine Learning Research . 7 (95): 2651– 2667.
  13. S. Grunewalder, G. Lever, L. Baldassarre, S. Patterson, A. Gretton, M. Pontil. (2012). Incrustaciones de media condicional como regresores . Actas de la Conferencia Internacional sobre Aprendizaje Automático : 1823–1830.
  14. A. Gretton, K. Borgwardt, M. Rasch, B. Schölkopf, A. Smola. (2012). Una prueba de dos muestras con kernel . Journal of Machine Learning Research , 13 : 723–773.
  15. Zhu, Shengyu; Chen, Biao; Chen, Zhitang; Yang, Pengfei (2021). "Pruebas asintóticamente óptimas de una y dos muestras con núcleos" . IEEE Transactions on Information Theory . 67 (4): 2074–2092 . arXiv : 1908.10037 . doi : 10.1109/TIT.2021.3059267 . ISSN 1557-9654 . 
  16. M. Dudík, SJ Phillips, RE Schapire. (2007). Estimación de la distribución de entropía máxima con regularización generalizada y una aplicación al modelado de la distribución de especies. Archivado el 15 de diciembre de 2013 en Wayback Machine . Journal of Machine Learning Research , 8 : 1217–1260.
  17. A. Gretton, O. Bousquet, A. Smola, B. Schölkopf. (2005). Medición de la dependencia estadística con normas de Hilbert-Schmidt . Actas de la Conferencia Internacional sobre Teoría del Aprendizaje Algorítmico : 63-78.
  18. L. Song, A. Smola, A. Gretton, K. Borgwardt, J. Bedo. (2007). Selección de características supervisada mediante estimación de dependencia . Actas de la Conferencia Internacional sobre Aprendizaje Automático , Omnipress: 823–830.
  19. L. Song, A. Smola, A. Gretton, K. Borgwardt. (2007). Una perspectiva de maximización de la dependencia en la agrupación . Actas de la Conferencia Internacional sobre Aprendizaje Automático . Omnipress: 815–822.
  20. L. Song, A. Smola, K. Borgwardt, A. Gretton. (2007). Colored maximum variance unfolding Archivado el 15-12-2013 en Wayback Machine . Neural Information Processing Systems .
  21. Zoltán Szabó, Bharath K. Sriperumbudur. Núcleos de producto tensorial característicos y universales . Journal of Machine Learning Research , 19:1–29, 2018.
  22. 1 2 K. Muandet, K. Fukumizu, F. Dinuzzo, B. Schölkopf. (2012). Aprendizaje a partir de distribuciones mediante máquinas de medidas de soporte. Archivado el 15 de diciembre de 2013 en Wayback Machine . Avances en sistemas de procesamiento de información neuronal : 10–18.
  23. 1 2 3 4 K. Zhang, B. Schölkopf, K. Muandet, Z. Wang. (2013). Adaptación de dominio bajo cambio de objetivo y condicional . Archivado el 23-10-2013 en Wayback Machine . Journal of Machine Learning Research , 28 (3): 819–827.
  24. 1 2 A. Gretton, A. Smola, J. Huang, M. Schmittfull, K. Borgwardt, B. Schölkopf. (2008). Cambio de covariables y aprendizaje local mediante ajuste de distribución. En J. Quinonero-Candela, M. Sugiyama, A. Schwaighofer, N. Lawrence (eds.). Cambio de conjunto de datos en aprendizaje automático , MIT Press, Cambridge, MA: 131–160.
  25. 1 2 3 K. Muandet, D. Balduzzi, B. Schölkopf. (2013). Generalización de dominio mediante representación de características invariantes Archivado el 23-10-2013 en Wayback Machine . 30.ª Conferencia Internacional sobre Aprendizaje Automático .
  26. 1 2 Z. Szabó, B. Sriperumbudur, B. Póczos, A. Gretton. Teoría del aprendizaje para la regresión de distribución . Journal of Machine Learning Research , 17(152):1–40, 2016.
  • Caja de herramientas de estimadores basados ​​en la teoría de la información (demostración de regresión de distribución).