En el aprendizaje automático , la incrustación de kernel de distribuciones (también llamada media de kernel o mapa de media ) comprende una clase de métodos no paramétricos en los que una distribución de probabilidad se representa como un elemento de un espacio de Hilbert de kernel reproductor (RKHS). [ 1 ] Una generalización del mapeo de características de puntos de datos individuales realizado en los métodos de kernel clásicos , la incrustación de distribuciones en espacios de características de dimensión infinita puede preservar todas las características estadísticas de distribuciones arbitrarias, al tiempo que permite comparar y manipular distribuciones utilizando operaciones de espacio de Hilbert tales como productos internos , distancias, proyecciones , transformaciones lineales y análisis espectral . [ 2 ] Este marco de aprendizaje es muy general y se puede aplicar a distribuciones sobre cualquier espaciosobre la cual una función de núcleo sensata (que mide la similitud entre elementos de) se puede definir. Por ejemplo, se han propuesto varios núcleos para aprender de los datos que son: vectores en, clases/categorías discretas, cadenas , grafos / redes , imágenes, series temporales , variedades , sistemas dinámicos y otros objetos estructurados. [ 3 ] [ 4 ] La teoría detrás de las incrustaciones de núcleo de distribuciones ha sido desarrollada principalmente por Alex Smola, Le Song, Arthur Gretton y Bernhard Schölkopf . Una revisión de trabajos recientes sobre incrustaciones de núcleo de distribuciones se puede encontrar en. [ 5 ]
El análisis de distribuciones es fundamental en el aprendizaje automático y la estadística , y muchos algoritmos en estos campos se basan en enfoques de la teoría de la información, como la entropía , la información mutua o la divergencia de Kullback-Leibler . Sin embargo, para estimar estas cantidades, primero se debe realizar una estimación de densidad o emplear estrategias sofisticadas de partición espacial/corrección de sesgo, que suelen ser inviables para datos de alta dimensión. [ 6 ] Comúnmente, los métodos para modelar distribuciones complejas se basan en supuestos paramétricos que pueden ser infundados o computacionalmente difíciles (por ejemplo, modelos de mezcla gaussiana ), mientras que los métodos no paramétricos como la estimación de densidad de kernel (Nota: los kernels de suavizado en este contexto tienen una interpretación diferente a la de los kernels aquí discutidos) o la representación de la función característica (a través de la transformada de Fourier de la distribución) fallan en entornos de alta dimensión. [ 2 ]
Los métodos basados en la incrustación de núcleos de distribuciones evitan estos problemas y también poseen las siguientes ventajas: [ 6 ]
- Los datos pueden modelarse sin supuestos restrictivos sobre la forma de las distribuciones y las relaciones entre variables.
- No se necesita una estimación de densidad intermedia.
- Los profesionales pueden especificar las propiedades de la distribución más relevantes para su problema (incorporando conocimientos previos mediante la elección del núcleo).
- Si se utiliza un núcleo característico , la incrustación puede preservar de forma única toda la información sobre una distribución, gracias al truco del núcleo , mientras que los cálculos en el RKHS de dimensión potencialmente infinita pueden implementarse en la práctica como simples operaciones de matriz de Gram.
- Se pueden demostrar tasas de convergencia independientes de la dimensionalidad para la media del núcleo empírico (estimada utilizando muestras de la distribución) hacia la incrustación del núcleo de la verdadera distribución subyacente.
- Los algoritmos de aprendizaje basados en este marco exhiben una buena capacidad de generalización y convergencia de muestra finita, a la vez que suelen ser más simples y efectivos que los métodos basados en la teoría de la información.
Por lo tanto, el aprendizaje mediante la incrustación de núcleos de distribuciones ofrece una alternativa coherente a los enfoques basados en la teoría de la información y constituye un marco que no solo engloba muchos métodos populares del aprendizaje automático y la estadística como casos especiales, sino que también puede dar lugar a algoritmos de aprendizaje completamente nuevos.
Definiciones
Dejardenota una variable aleatoria con dominioy distribuciónDado un núcleo simétrico y definido positivoEl teorema de Moore-Aronszajn afirma la existencia de un único RKHSen(un espacio de Hilbert de funcionesequipado con un producto interiory una norma) para el cuales un núcleo reproductor, es decir, en el que el elementosatisface la propiedad de reproducción
Alternativamente, se puede considerarcomo una asignación de características implícita :\Omega \rightarrow {\mathcal {H}}} (que por lo tanto también se denomina espacio de características), de modo quepuede considerarse como una medida de similitud entre puntosSi bien la medida de similitud es lineal en el espacio de características, puede ser altamente no lineal en el espacio original dependiendo de la elección del núcleo.
Incrustación de kernel
La incrustación del núcleo de la distribuciónen(también llamado media del núcleo o mapa de medias ) viene dado por: [ 1 ]
Sipermite una densidad integrable al cuadrado, entonces, dóndees el operador integral de Hilbert-Schmidt . Un núcleo es característico si la incrustación media :\{{\text{familia de distribuciones sobre }}\Omega \}\to {\mathcal {H}}} es inyectiva. [ 7 ] Cada distribución puede, por lo tanto, representarse de forma única en el RKHS y todas las características estadísticas de las distribuciones se conservan mediante la incrustación del núcleo si se utiliza un núcleo característico.
Incrustación de núcleo empírico
Dadoejemplos de capacitaciónextraído de forma independiente e idénticamente distribuida (iid) dela incrustación del núcleo depuede estimarse empíricamente como
incrustación de distribución conjunta
Sidenota otra variable aleatoria (para simplificar, supongamos el codominio detambién lo escon el mismo kernello cual satisface), entonces la distribución conjuntase puede mapear en un espacio de características de producto tensorialvía [ 2 ]
Debido a la equivalencia entre un tensor y una aplicación lineal , esta incrustación conjunta puede interpretarse como un operador de covarianza cruzada no centrado.de la cual la covarianza cruzada de funcionesse puede calcular como [ 8 ]
Dadopares de ejemplos de entrenamientoextraído iid de, también podemos estimar empíricamente la incrustación del núcleo de distribución conjunta mediante
Incrustación de distribución condicional
Dada una distribución condicionaluno puede definir la incrustación RKHS correspondiente como [ 2 ]
Tenga en cuenta que la incrustación deDe esta forma se define una familia de puntos en el RKHS indexados por los valorestomada por la variable de condicionamiento. Al arreglara un valor particular, obtenemos un único elemento eny por lo tanto es natural definir el operador
lo cual, dado el mapeo de características degenera la incrustación condicional dedadoSuponiendo que para todosSe puede demostrar que [ 8 ]
Esta suposición siempre es cierta para dominios finitos con núcleos característicos, pero puede no ser necesariamente cierta para dominios continuos. [ 2 ] Sin embargo, incluso en los casos en que la suposición falla,aún puede utilizarse para aproximar la incrustación del núcleo condicionaly en la práctica, el operador de inversión se reemplaza por una versión regularizada de sí mismo.(dóndedenota la matriz identidad ).
Dados los ejemplos de entrenamientoEl operador de incrustación condicional del núcleo empírico puede estimarse como [ 2 ].
dóndeson matrices de características formadas implícitamente,es la matriz de Gram para muestras de, yes un parámetro de regularización necesario para evitar el sobreajuste .
Por lo tanto, la estimación empírica de la incrustación condicional del núcleo viene dada por una suma ponderada de muestras deen el espacio de características:
dóndey
Propiedades
- La expectativa de cualquier funciónEn el RKHS se puede calcular como un producto interno con la incrustación del núcleo:
- En presencia de grandes tamaños de muestra, manipulaciones de laLa matriz de Gram puede ser computacionalmente exigente. Mediante el uso de una aproximación de bajo rango de la matriz de Gram (como la factorización de Cholesky incompleta ), el tiempo de ejecución y los requisitos de memoria de los algoritmos de aprendizaje basados en incrustaciones de kernel se pueden reducir drásticamente sin sufrir una gran pérdida en la precisión de la aproximación. [ 2 ]
Convergencia de la media del núcleo empírico a la verdadera incrustación de la distribución
- Sise define de tal manera quetoma valores ena pesar decon(como es el caso de los núcleos de funciones de base radial ampliamente utilizados ), entonces con una probabilidad al menos: [ 6 ]
- dóndedenota la bola de la unidad enyes la matriz de Gram con
- La tasa de convergencia (en norma RKHS) de la incrustación del núcleo empírico a su contraparte de distribución esy no depende de la dimensión de.
- Las estadísticas basadas en incrustaciones de núcleo evitan así la maldición de la dimensionalidad , y aunque la verdadera distribución subyacente es desconocida en la práctica, se puede (con alta probabilidad) obtener una aproximación dentro dede la verdadera incrustación del núcleo basada en una muestra finita de tamaño.
- Para la incrustación de distribuciones condicionales, la estimación empírica puede verse como un promedio ponderado de asignaciones de características (donde los pesosdepende del valor de la variable de condicionamiento y captura el efecto del condicionamiento en la incrustación del núcleo). En este caso, la estimación empírica converge a la incrustación RKHS de distribución condicional con tasasi el parámetro de regularizaciónse reduce a medida queaunque se pueden lograr tasas de convergencia más rápidas al establecer supuestos adicionales sobre la distribución conjunta. [ 2 ]
núcleos universales
- Dejarser un espacio métrico compacto yel conjunto de funciones continuas . El núcleo reproductor Se denomina universal si y solo si el RKHSdees denso en, es decir, para cualquiery todo existe unde tal manera que. [ 9 ] Todos los núcleos universales definidos en un espacio compacto son núcleos característicos, pero lo contrario no siempre es cierto. [ 10 ]
- Dejarser un núcleo continuo invariante a la traslaciónconEntonces, el teorema de Bochner garantiza la existencia de una medida de Borel finita única.(llamada medida espectral ) ende tal manera que
- Parapara ser universal basta con que la parte continua deen su singular descomposición de Lebesguees distinto de cero. Además, si
- entonceses la densidad espectral de frecuenciasenyes la transformada de Fourier de. Si el apoyo dees todo de, entonceses también un núcleo característico. [ 11 ] [ 12 ] [ 13 ]
- SiSi induce una matriz de núcleo estrictamente definida positiva para cualquier conjunto de puntos distintos, entonces es un núcleo universal. [ 6 ] Por ejemplo, el núcleo RBF gaussiano ampliamente utilizado
- en subconjuntos compactos dees universal.
Selección de parámetros para incrustaciones de núcleos de distribución condicional
- El operador de incrustación de distribución condicional del núcleo empíricoAlternativamente, puede verse como la solución del siguiente problema de regresión de mínimos cuadrados regularizados (con valores de función) [ 14 ].
- dóndees la norma de Hilbert-Schmidt .
- De este modo, se puede seleccionar el parámetro de regularización.mediante la realización de una validación cruzada basada en la función de pérdida al cuadrado del problema de regresión.
Reglas de probabilidad como operaciones en el RKHS
Esta sección ilustra cómo las reglas probabilísticas básicas pueden reformularse como operaciones algebraicas (multi)lineales en el marco de incrustación de núcleos y se basa principalmente en el trabajo de Song et al. [ 2 ] [ 8 ] Se adopta la siguiente notación:
- distribución conjunta sobre variables aleatorias
- distribución marginal de;distribución marginal de
- distribución condicional dedadocon el operador de incrustación condicional correspondiente
- distribución previa sobre
- se utiliza para distinguir las distribuciones que incorporan la distribución a priori de las distribucionesque no dependen de lo anterior
En la práctica, todas las incrustaciones se estiman empíricamente a partir de datos.y asumió que un conjunto de muestraspuede utilizarse para estimar la incrustación del núcleo de la distribución previa.
Regla de suma del núcleo
En teoría de la probabilidad , la distribución marginal dese puede calcular integrandode la densidad conjunta (incluida la distribución previa en)
El análogo de esta regla en el marco de incrustación de kernel establece quela incrustación RKHS de, se puede calcular mediante
dóndees la incrustación del núcleo deEn las implementaciones prácticas, la regla de suma del núcleo toma la siguiente forma:
dónde
es la incrustación del núcleo empírico de la distribución previa,, yson matrices de Gram con entradasrespectivamente.
Regla de la cadena del kernel
En teoría de la probabilidad, una distribución conjunta puede factorizarse en un producto entre distribuciones condicionales y marginales.
El análogo de esta regla en el marco de incrustación de kernel establece quela incrustación conjunta depuede factorizarse como una composición del operador de incrustación condicional con el operador de autocovarianza asociado con
dónde
En las implementaciones prácticas, la regla de la cadena del kernel toma la siguiente forma:
Regla de Bayes del núcleo
En teoría de la probabilidad, una distribución posterior puede expresarse en términos de una distribución previa y una función de verosimilitud como
- dónde
El análogo de esta regla en el marco de incrustación de núcleo expresa la incrustación de núcleo de la distribución condicional en términos de operadores de incrustación condicional que son modificados por la distribución previa.
de donde proviene la regla de la cadena:
En las implementaciones prácticas, la regla de Bayes del núcleo toma la siguiente forma:
dónde
En este marco se utilizan dos parámetros de regularización:para la estimación deypara la estimación del operador de incrustación condicional final
Esta última regularización se realiza sobre el cuadrado deporquepuede que no sea positivo definido .
Aplicaciones
Medición de la distancia entre distribuciones
La discrepancia media máxima (DMM) es una medida de distancia entre distribuciones.yque se define como la distancia entre sus incrustaciones en el RKHS [ 6 ]
Si bien la mayoría de las medidas de distancia entre distribuciones, como la divergencia de Kullback-Leibler, ampliamente utilizada , requieren estimación de densidad (paramétrica o no paramétrica) o estrategias de partición espacial/corrección de sesgo, [ 6 ] la MMD se estima fácilmente como una media empírica que se concentra alrededor del valor verdadero de la MMD. La caracterización de esta distancia como la discrepancia media máxima se refiere al hecho de que calcular la MMD es equivalente a encontrar la función RKHS que maximiza la diferencia en las expectativas entre las dos distribuciones de probabilidad.
una forma de métrica de probabilidad integral .
Prueba de dos muestras del núcleo
Dados n ejemplos de entrenamiento dey m muestras deSe puede formular un estadístico de prueba basado en la estimación empírica de la MMD.
para obtener una prueba de dos muestras [ 15 ] de la hipótesis nula de que ambas muestras provienen de la misma distribución (es decir,) frente a la alternativa amplia. Una prueba basada en MMD fue la primera prueba que demostró ser asintóticamente óptima para pruebas de hipótesis de dos muestras. [ 16 ]
Estimación de densidad mediante incrustaciones de núcleo
Aunque los algoritmos de aprendizaje en el marco de incrustación de kernel evitan la necesidad de una estimación de densidad intermedia, no obstante se puede utilizar la incrustación empírica para realizar una estimación de densidad basada en n muestras extraídas de una distribución subyacente.Esto se puede hacer resolviendo el siguiente problema de optimización [ 6 ] [ 17 ]
- sujeto a
donde la maximización se realiza sobre todo el espacio de distribuciones enAquí,es la incrustación del núcleo de la densidad propuestayes una magnitud similar a la entropía (por ejemplo, entropía , divergencia KL , divergencia de Bregman ). La distribución que resuelve esta optimización puede interpretarse como un compromiso entre ajustar bien las medias del núcleo empírico de las muestras, al tiempo que se asigna una porción sustancial de la masa de probabilidad a todas las regiones del espacio de probabilidad (muchas de las cuales pueden no estar representadas en los ejemplos de entrenamiento). En la práctica, se puede encontrar una buena solución aproximada de la difícil optimización restringiendo el espacio de densidades candidatas a una mezcla de M distribuciones candidatas con proporciones de mezcla regularizadas. Se pueden establecer conexiones entre las ideas subyacentes a los procesos gaussianos y los campos aleatorios condicionales con la estimación de distribuciones de probabilidad condicionales de esta manera, si se consideran las asignaciones de características asociadas con el núcleo como estadísticas suficientes en familias exponenciales generalizadas (posiblemente de dimensión infinita) . [ 6 ]
Medición de la dependencia de variables aleatorias
Una medida de la dependencia estadística entre variables aleatoriasy(de cualquier dominio en el que se puedan definir núcleos sensatos) se pueden formular basándose en el Criterio de Independencia de Hilbert-Schmidt [ 18 ].
y puede utilizarse como un reemplazo basado en principios para la información mutua , la correlación de Pearson o cualquier otra medida de dependencia utilizada en algoritmos de aprendizaje. En particular, HSIC puede detectar dependencias arbitrarias (cuando se utiliza un núcleo característico en las incrustaciones, HSIC es cero si y solo si las variables son independientes ), y puede utilizarse para medir la dependencia entre diferentes tipos de datos (por ejemplo, imágenes y subtítulos de texto). Dados n muestras i.i.d. de cada variable aleatoria, se puede calcular un estimador simple, insesgado y sin parámetros de HSIC que muestra concentración alrededor del valor verdadero.tiempo, [ 6 ] donde las matrices de Gram de los dos conjuntos de datos se aproximan usandoconLas propiedades deseables de HSIC han llevado a la formulación de numerosos algoritmos que utilizan esta medida de dependencia para una variedad de tareas comunes de aprendizaje automático, tales como: selección de características (BAHSIC [ 19 ] ), agrupamiento (CLUHSIC [ 20 ] ) y reducción de dimensionalidad (MUHSIC [ 21 ] ).
HSIC puede extenderse para medir la dependencia de múltiples variables aleatorias. La cuestión de cuándo HSIC captura la independencia en este caso se ha estudiado recientemente: [ 22 ] para más de dos variables
- en: la propiedad característica de los núcleos individuales sigue siendo una condición equivalente.
- En dominios generales: la propiedad característica de los componentes del núcleo es necesaria pero no suficiente .
Propagación de creencias del núcleo
La propagación de creencias es un algoritmo fundamental para la inferencia en modelos gráficos en el que los nodos se envían y reciben repetidamente mensajes correspondientes a la evaluación de expectativas condicionales. En el marco de incrustación de kernel, los mensajes pueden representarse como funciones RKHS y las incrustaciones de distribución condicional pueden aplicarse para calcular eficientemente las actualizaciones de mensajes. Dados n muestras de variables aleatorias representadas por nodos en un campo aleatorio de Markov , el mensaje entrante al nodo t desde el nodo u puede expresarse como
si se supone que está en el RKHS. El mensaje de actualización de propagación de creencias del núcleo de t al nodo s viene dado por [ 2 ]
dóndedenota el producto vectorial elemento a elemento,es el conjunto de nodos conectados a t excluyendo el nodo s ,,son las matrices de Gram de las muestras de variables, respectivamente, yes la matriz de características para las muestras de.
Por lo tanto, si los mensajes entrantes al nodo t son combinaciones lineales de muestras mapeadas de características de, entonces el mensaje saliente de este nodo también es una combinación lineal de muestras mapeadas de características deEsta representación de la función RKHS de las actualizaciones de paso de mensajes produce, por lo tanto, un algoritmo eficiente de propagación de creencias en el que los potenciales son funciones no paramétricas inferidas a partir de los datos, de modo que se pueden modelar relaciones estadísticas arbitrarias. [ 2 ]
Filtrado no paramétrico en modelos ocultos de Markov
En el modelo oculto de Markov (HMM), dos cantidades clave de interés son las probabilidades de transición entre estados ocultos.y las probabilidades de emisiónpara observaciones. Utilizando el marco de incrustación de distribución condicional de kernel, estas cantidades pueden expresarse en términos de muestras del HMM. Una limitación importante de los métodos de incrustación en este dominio es la necesidad de muestras de entrenamiento que contengan estados ocultos, ya que de lo contrario no es posible realizar inferencias con distribuciones arbitrarias en el HMM.
Un uso común de los HMM es el filtrado, cuyo objetivo es estimar la distribución posterior sobre el estado oculto.en el paso de tiempo t dado un historial de observaciones previasdel sistema. En el filtrado, un estado de creenciase mantiene recursivamente a través de un paso de predicción (donde se actualizase calculan marginalizando el estado oculto anterior) seguido de un paso de condicionamiento (donde las actualizacionesse calculan aplicando la regla de Bayes a una condición sobre una nueva observación). [ 2 ] La incrustación RKHS del estado de creencia en el tiempo t+1 se puede expresar recursivamente como
calculando las incrustaciones del paso de predicción mediante la regla de suma del kernel y la incrustación del paso de condicionamiento mediante la regla de Bayes del kernel . Suponiendo una muestra de entrenamientoSi se da, en la práctica se puede estimar
y el filtrado con incrustaciones de kernel se implementa de manera recursiva utilizando las siguientes actualizaciones para los pesos[ 2 ]
dóndedenotemos las matrices de Gram deyrespectivamente,es una matriz de Gram de transferencia definida comoy
Máquinas de medición de soporte
La máquina de medidas de soporte (SMM) es una generalización de la máquina de vectores de soporte (SVM) en la que los ejemplos de entrenamiento son distribuciones de probabilidad emparejadas con etiquetas.. [ 23 ] Los SMM resuelven el problema de optimización dual estándar de SVM utilizando el siguiente kernel esperado
que se puede calcular en forma cerrada para muchas distribuciones específicas comunes.(como la distribución gaussiana) combinada con núcleos de incrustación populares(por ejemplo, el núcleo gaussiano o el núcleo polinómico), o pueden estimarse empíricamente con precisión a partir de muestras i.i.d.a través de
Bajo ciertas elecciones del núcleo de incrustación, el SMM aplicado a ejemplos de entrenamientoes equivalente a una SVM entrenada en muestrasy, por lo tanto, el SMM puede considerarse como un SVM flexible en el que un núcleo diferente dependiente de los datos (especificado por la forma supuesta de la distribución)) se pueden colocar en cada punto de entrenamiento. [ 23 ]
Adaptación de dominio bajo cambio de covariable, objetivo y condicional
El objetivo de la adaptación de dominio es la formulación de algoritmos de aprendizaje que se generalicen bien cuando los datos de entrenamiento y de prueba tengan distribuciones diferentes. Dados los ejemplos de entrenamientoy un conjunto de pruebadonde elSe desconocen tres tipos de diferencias comúnmente asumidas entre la distribución de los ejemplos de entrenamiento.y la distribución de la prueba: [ 24 ] [ 25 ]
- Cambio de covariables en el que la distribución marginal de las covariables cambia entre dominios:
- Cambio de objetivo en el que la distribución marginal de los resultados cambia entre dominios:
- Cambio condicional en el quepermanece igual en todos los dominios, pero las distribuciones condicionales difieren:En general, la presencia de un cambio condicional conduce a un problema mal planteado , y la suposición adicional de quecambios únicamente bajo transformaciones de ubicación - escala (LS) enSe suele imponer para que el problema sea manejable.
Al utilizar la incrustación de núcleo de distribuciones marginales y condicionales, se pueden formular enfoques prácticos para abordar la presencia de este tipo de diferencias entre los dominios de entrenamiento y prueba. El cambio de covariable se puede tener en cuenta reponderando los ejemplos a través de estimaciones de la razónobtenido directamente de las incrustaciones del núcleo de las distribuciones marginales deen cada dominio sin necesidad de estimación explícita de las distribuciones. [ 25 ] Desplazamiento del objetivo, que no se puede tratar de manera similar ya que no hay muestras deestán disponibles en el dominio de prueba, se tiene en cuenta ponderando los ejemplos de entrenamiento usando el vectorque resuelve el siguiente problema de optimización (donde en la práctica se deben utilizar aproximaciones empíricas) [ 24 ]
- sujeto a
Para abordar el cambio condicional de escala de ubicación, se puede realizar una transformación LS de los puntos de entrenamiento para obtener nuevos datos de entrenamiento transformados.(dóndedenota el producto vectorial elemento a elemento). Para asegurar distribuciones similares entre las nuevas muestras de entrenamiento transformadas y los datos de prueba,se estiman minimizando la siguiente distancia de incrustación de núcleo empírica [ 24 ]
En general, los métodos de incrustación de núcleo para tratar el desplazamiento condicional de LS y el desplazamiento del objetivo se pueden combinar para encontrar una transformación ponderada de los datos de entrenamiento que imite la distribución de prueba, y estos métodos pueden funcionar bien incluso en presencia de desplazamientos condicionales distintos de los cambios de ubicación y escala. [ 24 ]
Generalización de dominio mediante representación de características invariantes
Dados N conjuntos de ejemplos de entrenamiento muestreados i.i.d. de distribucionesEl objetivo de la generalización de dominio es formular algoritmos de aprendizaje que funcionen bien en ejemplos de prueba muestreados de un dominio previamente no visto.donde no hay datos del dominio de prueba disponibles en el momento del entrenamiento. Si las distribuciones condicionalesSe supone que son relativamente similares en todos los dominios, entonces un aprendiz capaz de generalizar el dominio debe estimar una relación funcional entre las variables que sea robusta a los cambios en los marginales.Basado en incrustaciones de núcleo de estas distribuciones, el Análisis de Componentes Invariantes de Dominio (DICA) es un método que determina la transformación de los datos de entrenamiento que minimiza la diferencia entre las distribuciones marginales, preservando al mismo tiempo una distribución condicional común compartida entre todos los dominios de entrenamiento. [ 26 ] DICA extrae así invariantes , características que se transfieren entre dominios, y puede considerarse una generalización de muchos métodos populares de reducción de dimensionalidad, como el análisis de componentes principales de núcleo , el análisis de componentes de transferencia y la regresión inversa del operador de covarianza. [ 26 ]
Definición de una distribución de probabilidaden el RKHScon
DICA mide la disimilitud entre dominios a través de la varianza de distribución que se calcula como
dónde
entonceses unMatriz de Gram sobre las distribuciones de las cuales se muestrean los datos de entrenamiento. Al encontrar una transformación ortogonal sobre un subespacio de baja dimensión B (en el espacio de características) que minimiza la varianza de la distribución, DICA asegura simultáneamente que B se alinee con las bases de un subespacio central C para el cualse vuelve independiente dedadoen todos los dominios. En ausencia de valores objetivo, se puede formular una versión no supervisada de DICA que encuentra un subespacio de baja dimensión que minimiza la varianza de la distribución mientras maximiza simultáneamente la varianza de(en el espacio de características) en todos los dominios (en lugar de preservar un subespacio central). [ 26 ]
regresión de distribución
En la regresión de distribución, el objetivo es regresar de distribuciones de probabilidad a números reales (o vectores). Muchas tareas importantes de aprendizaje automático y estadística se ajustan a este marco, incluyendo el aprendizaje multiinstancia y los problemas de estimación puntual sin solución analítica (como la estimación de hiperparámetros o entropía ). En la práctica, solo se pueden observar muestras de distribuciones muestreadas, y las estimaciones deben basarse en similitudes calculadas entre conjuntos de puntos . La regresión de distribución se ha aplicado con éxito, por ejemplo, en el aprendizaje supervisado de entropía y en la predicción de aerosoles utilizando imágenes satelitales multiespectrales. [ 27 ]
Dadodatos de entrenamiento, donde elLa bolsa contiene muestras de una distribución de probabilidad.y elLa etiqueta de salida esSe puede abordar la tarea de regresión de distribución tomando las incrustaciones de las distribuciones y aprendiendo el regresor a partir de las incrustaciones para las salidas. En otras palabras, se puede considerar el siguiente problema de regresión de cresta de núcleo.
dónde
con unnúcleo en el dominio de-s,es un núcleo en las distribuciones integradas yes el RKHS determinado porEjemplos deincluir el núcleo lineal, el núcleo gaussiano, el núcleo exponencial, el núcleo de Cauchy, el núcleo t-estudiante generalizadoo el núcleo de multicuadráticas inversas.
La predicción sobre una nueva distribuciónadopta la forma simple y analítica
dónde,,,Bajo condiciones de regularidad leves, se puede demostrar que este estimador es consistente y puede lograr el muestreo de una etapa (como si se tuviera acceso al verdadero-s) tasa óptima minimax . [ 27 ] En elfunción objetivo-s son números reales; los resultados también pueden extenderse al caso en que-s sonvectores de dimensión , o más generalmente elementos de un espacio de Hilbert separable usando operadores con valoresgranos.
Ejemplo
En este sencillo ejemplo, que se toma de Song et al., [ 2 ]Se supone que son variables aleatorias discretas que toman valores en el conjuntoy el núcleo se elige como la función delta de Kronecker , por lo queEl mapa de características correspondiente a este núcleo es el vector base estándar .. Las incrustaciones del núcleo de tales distribuciones son, por lo tanto, vectores de probabilidades marginales, mientras que las incrustaciones de distribuciones conjuntas en este contexto sonmatrices que especifican tablas de probabilidad conjuntas, y la forma explícita de estas incrustaciones es
Cuando, para todos, el operador de incrustación de distribución condicional,
¿Es en este contexto una tabla de probabilidad condicional?
y
Por lo tanto, las incrustaciones de la distribución condicional bajo un valor fijo depuede calcularse como
En este entorno de valores discretos con el núcleo delta de Kronecker, la regla de suma del núcleo se convierte en:
La regla de la cadena del núcleo en este caso viene dada por
Referencias
- 1 2 A. Smola, A. Gretton, L. Song, B. Schölkopf. (2007). Un incrustamiento de espacio de Hilbert para distribuciones. Archivado el 15/12/2013 en Wayback Machine . Teoría del aprendizaje algorítmico: 18.ª Conferencia Internacional . Springer: 13–31.
- 1 2 3 4 5 6 7 8 9 10 11 12 13 14 L. Song, K. Fukumizu, F. Dinuzzo, A. Gretton (2013). Incrustaciones de núcleo de distribuciones condicionales: un marco de núcleo unificado para la inferencia no paramétrica en modelos gráficos . IEEE Signal Processing Magazine 30 : 98–111.
- ↑ J. Shawe-Taylor, N. Christianini. (2004). Métodos de núcleo para el análisis de patrones . Cambridge University Press, Cambridge, Reino Unido.
- ↑ T. Hofmann, B. Schölkopf, A. Smola. (2008). Métodos de kernel en aprendizaje automático . The Annals of Statistics 36 (3):1171–1220.
- ↑ Muandet, Krikamol; Fukumizu, Kenji; Sriperumbudur, Bharath; Schölkopf, Bernhard (2017-06-28). "Kernel Mean Incedding of Distributions: A Review and Beyond". Foundations and Trends in Machine Learning . 10 ( 1– 2): 1– 141. arXiv : 1605.09522 . doi : 10.1561/2200000060 . ISSN 1935-8237 .
- 1 2 3 4 5 6 7 8 9 L. Song. (2008) Aprendizaje mediante incrustación de distribuciones en el espacio de Hilbert . Tesis doctoral, Universidad de Sídney.
- ↑ K. Fukumizu, A. Gretton, X. Sun y B. Schölkopf (2008). Medidas de núcleo de independencia condicional . Advances in Neural Information Processing Systems 20 , MIT Press, Cambridge, MA.
- 1 2 3 L. Song, J. Huang, AJ Smola, K. Fukumizu. (2009). Incrustaciones en el espacio de Hilbert de distribuciones condicionales. Archivado el 15 de diciembre de 2013 en Wayback Machine . Actas de la Conferencia Internacional sobre Aprendizaje Automático . Montreal, Canadá: 961–968.
- ↑
- Steinwart, Ingo; Christmann, Andreas (2008). Máquinas de vectores de soporte . Nueva York: Springer. ISBN 978-0-387-77241-7.
- ↑ Sriperumbudur, BK; Fukumizu, K.; Lanckriet, GRG (2011). "Universalidad, núcleos característicos e incrustación RKHS de medidas". Journal of Machine Learning Research . 12 (70).
- ↑ Liang, Percy (2016), CS229T/STAT231: Teoría del aprendizaje estadístico (PDF) , apuntes de clase de Stanford
- ↑ Sriperumbudur, BK; Fukumizu, K.; Lanckriet, GRG (2010). Sobre la relación entre universalidad, núcleos característicos e incrustación RKHS de medidas . Actas de la Decimotercera Conferencia Internacional sobre Inteligencia Artificial y Estadística. Italia.
- ↑ Micchelli, CA; Xu, Y.; Zhang, H. (2006). "Universal Kernels" . Journal of Machine Learning Research . 7 (95): 2651– 2667.
- ↑ S. Grunewalder, G. Lever, L. Baldassarre, S. Patterson, A. Gretton, M. Pontil. (2012). Incrustaciones de media condicional como regresores . Actas de la Conferencia Internacional sobre Aprendizaje Automático : 1823–1830.
- ↑ A. Gretton, K. Borgwardt, M. Rasch, B. Schölkopf, A. Smola. (2012). Una prueba de dos muestras con kernel . Journal of Machine Learning Research , 13 : 723–773.
- ↑ Zhu, Shengyu; Chen, Biao; Chen, Zhitang; Yang, Pengfei (2021). "Pruebas asintóticamente óptimas de una y dos muestras con núcleos" . IEEE Transactions on Information Theory . 67 (4): 2074–2092 . arXiv : 1908.10037 . doi : 10.1109/TIT.2021.3059267 . ISSN 1557-9654 .
- ↑ M. Dudík, SJ Phillips, RE Schapire. (2007). Estimación de la distribución de entropía máxima con regularización generalizada y una aplicación al modelado de la distribución de especies. Archivado el 15 de diciembre de 2013 en Wayback Machine . Journal of Machine Learning Research , 8 : 1217–1260.
- ↑ A. Gretton, O. Bousquet, A. Smola, B. Schölkopf. (2005). Medición de la dependencia estadística con normas de Hilbert-Schmidt . Actas de la Conferencia Internacional sobre Teoría del Aprendizaje Algorítmico : 63-78.
- ↑ L. Song, A. Smola, A. Gretton, K. Borgwardt, J. Bedo. (2007). Selección de características supervisada mediante estimación de dependencia . Actas de la Conferencia Internacional sobre Aprendizaje Automático , Omnipress: 823–830.
- ↑ L. Song, A. Smola, A. Gretton, K. Borgwardt. (2007). Una perspectiva de maximización de la dependencia en la agrupación . Actas de la Conferencia Internacional sobre Aprendizaje Automático . Omnipress: 815–822.
- ↑ L. Song, A. Smola, K. Borgwardt, A. Gretton. (2007). Colored maximum variance unfolding Archivado el 15-12-2013 en Wayback Machine . Neural Information Processing Systems .
- ↑ Zoltán Szabó, Bharath K. Sriperumbudur. Núcleos de producto tensorial característicos y universales . Journal of Machine Learning Research , 19:1–29, 2018.
- 1 2 K. Muandet, K. Fukumizu, F. Dinuzzo, B. Schölkopf. (2012). Aprendizaje a partir de distribuciones mediante máquinas de medidas de soporte. Archivado el 15 de diciembre de 2013 en Wayback Machine . Avances en sistemas de procesamiento de información neuronal : 10–18.
- 1 2 3 4 K. Zhang, B. Schölkopf, K. Muandet, Z. Wang. (2013). Adaptación de dominio bajo cambio de objetivo y condicional . Archivado el 23-10-2013 en Wayback Machine . Journal of Machine Learning Research , 28 (3): 819–827.
- 1 2 A. Gretton, A. Smola, J. Huang, M. Schmittfull, K. Borgwardt, B. Schölkopf. (2008). Cambio de covariables y aprendizaje local mediante ajuste de distribución. En J. Quinonero-Candela, M. Sugiyama, A. Schwaighofer, N. Lawrence (eds.). Cambio de conjunto de datos en aprendizaje automático , MIT Press, Cambridge, MA: 131–160.
- 1 2 3 K. Muandet, D. Balduzzi, B. Schölkopf. (2013). Generalización de dominio mediante representación de características invariantes Archivado el 23-10-2013 en Wayback Machine . 30.ª Conferencia Internacional sobre Aprendizaje Automático .
- 1 2 Z. Szabó, B. Sriperumbudur, B. Póczos, A. Gretton. Teoría del aprendizaje para la regresión de distribución . Journal of Machine Learning Research , 17(152):1–40, 2016.
Enlaces externos
- Caja de herramientas de estimadores basados en la teoría de la información (demostración de regresión de distribución).
- Aprendizaje automático
- Teoría de las distribuciones de probabilidad