Articulo de referencia

Autoencoder

Esquema de un autoencoder . Un autoencoder tiene dos partes principales: un codificador que asigna el mensaje a un código y un decodificador que reconstruye el mensaje a partir ...

Esquema de un autoencoder . Un autoencoder tiene dos partes principales: un codificador que asigna el mensaje a un código y un decodificador que reconstruye el mensaje a partir del código.

Un autoencoder es un tipo de red neuronal artificial que se utiliza para aprender codificaciones eficientes de datos sin etiquetar ( aprendizaje no supervisado ). Un autoencoder aprende dos funciones: una función de codificación que transforma los datos de entrada y una función de decodificación que recrea los datos de entrada a partir de la representación codificada. El autoencoder aprende una representación (codificación) eficiente para un conjunto de datos, generalmente para la reducción de dimensionalidad , con el fin de generar incrustaciones de menor dimensión para su uso posterior por otros algoritmos de aprendizaje automático . [ 1 ]

Existen variantes que buscan que las representaciones aprendidas asuman propiedades útiles. [ 2 ] Ejemplos de ello son los autoencoders regularizados ( autoencoders dispersos , de eliminación de ruido y contractivos ), que son eficaces para aprender representaciones para tareas de clasificación posteriores, [ 3 ] y los autoencoders variacionales , que pueden utilizarse como modelos generativos . [ 4 ] Los autoencoders se aplican a muchos problemas, incluyendo el reconocimiento facial , [ 5 ] la detección de características , [ 6 ] la detección de anomalías y el aprendizaje del significado de las palabras . [ 7 ] [ 8 ] En términos de síntesis de datos , los autoencoders también pueden utilizarse para generar aleatoriamente nuevos datos similares a los datos de entrada (entrenamiento). [ 6 ]

Principios matemáticos

Definición

Un autoencoder se define mediante los siguientes componentes:

Dos conjuntos: el espacio de mensajes codificadosZ{\displaystyle {\mathcal {Z}}}; el espacio de mensajes decodificadosincógnita{\displaystyle {\mathcal {X}}}. Normalmenteincógnita{\displaystyle {\mathcal {X}}}yZ{\displaystyle {\mathcal {Z}}}son espacios euclidianos , es decir,incógnita=Rmetro,Z=Rnorte{\displaystyle {\mathcal {X}}=\mathbb {R} ^{m},{\mathcal {Z}}=\mathbb {R} ^{n}}conmetro>norte.{\displaystyle m>n.}

Dos familias de funciones parametrizadas : la familia de codificadores.miϕ:incógnitaZ{\displaystyle E_{\phi }:{\mathcal {X}}\rightarrow {\mathcal {Z}}}, parametrizado porϕ{\displaystyle \phi }; la familia de decodificadoresDθ:Zincógnita{\displaystyle D_{\theta }:{\mathcal {Z}}\rightarrow {\mathcal {X}}}, parametrizado porθ{\displaystyle \theta }.

Para cualquierincógnitaincógnita{\displaystyle x\in {\mathcal {X}}}, solemos escribirz=miϕ(incógnita){\displaystyle z=E_{\phi}(x)}y referirse a él como el código, la variable latente , la representación latente, el vector latente, etc. Por el contrario, para cualquierzZ{\displaystyle z\in {\mathcal {Z}}}, solemos escribirincógnita=Dθ(z){\displaystyle x'=D_{\theta }(z)}y referirnos a él como el mensaje (decodificado).

Por lo general, tanto el codificador como el decodificador se definen como perceptrones multicapa (MLP). Por ejemplo, un codificador MLP de una capamiϕ{\displaystyle E_{\phi }}es:

miϕ(incógnita)=σ(Wincógnita+b){\displaystyle E_{\phi }(\mathbf {x} )=\sigma (Wx+b)}

dóndeσ{\displaystyle \sigma }es una función de activación elemento a elemento ,W{\displaystyle W}es una matriz de "pesos" yb{\displaystyle b}es un vector de "sesgo".

Entrenamiento de un autoencoder

Un autoencoder, por sí mismo, es simplemente una tupla de dos funciones. Para evaluar su calidad , necesitamos una tarea . Una tarea se define mediante una distribución de probabilidad de referencia.μrmiF{\displaystyle \mu _{ref}}encimaincógnita{\displaystyle {\mathcal {X}}}y una función de "calidad de reconstrucción"d:incógnita×incógnita[0,]{\displaystyle d:{\mathcal {X}}\times {\mathcal {X}}\to [0,\infty ]}, de tal manera qued(incógnita,incógnita){\displaystyle d(x,x')}mide cuántoincógnita{\displaystyle x'}difiere deincógnita{\displaystyle x}.

Con estos, podemos definir la función de pérdida para el autoencoder comoL(θ,ϕ):=miincógnitaμrmiF[d(incógnita,Dθ(miϕ(incógnita)))]{\displaystyle L(\theta ,\phi ):=\mathbb {\mathbb {E} } _{x\sim \mu _ {ref}}[d(x,D_{\theta }(E_{\phi }(x)))]}El autoencoder óptimo para la tarea dada(μrmiF,d){\displaystyle (\mu _{ref},d)}es entoncesargminθ,ϕL(θ,ϕ){\displaystyle \arg \min _ {\theta,\phi}L(\theta,\phi)}La búsqueda del autoencoder óptimo puede realizarse mediante cualquier técnica de optimización matemática, pero generalmente mediante el descenso de gradiente . Este proceso de búsqueda se conoce como "entrenamiento del autoencoder".

En la mayoría de las situaciones, la distribución de referencia es simplemente la distribución empírica dada por un conjunto de datos.{incógnita1,...,incógnitanorte}incógnita{\displaystyle \{x_{1},...,x_{N}\}\subset {\mathcal {X}}}, de modo queμrmiF=1nortei=1norteδincógnitai{\displaystyle \mu _{ref}={\frac {1}{N}}\sum _{i=1}^{N}\delta _{x_{i}}}

dóndeδincógnitai{\displaystyle \delta _{x_{i}}}es la medida de Dirac , la función de calidad es simplementeL2{\displaystyle L^{2}}pérdida:d(incógnita,incógnita)=incógnitaincógnita22{\displaystyle d(x,x')=\|xx'\|_{2}^{2}}, y2{\displaystyle \|\cdot \|_{2}}es la norma euclidiana . Entonces, el problema de buscar el autoencoder óptimo es simplemente una optimización por mínimos cuadrados :minθ,ϕL(θ,ϕ),dónde L(θ,ϕ)=1nortei=1norteincógnitaiDθ(miϕ(incógnitai))22{\displaystyle \min _{\theta ,\phi }L(\theta ,\phi ),\qquad {\text{dónde }}L(\theta ,\phi )={\frac {1}{N}}\sum _ {i=1}^{N}\|x_{i}-D_{\theta }(E_{\phi }(x_{i}))\|_{2}^{2}}

Interpretación

Un autoencoder tiene dos partes principales: un codificador que asigna el mensaje a un código y un decodificador que reconstruye el mensaje a partir del código. Un autoencoder óptimo realizaría una reconstrucción lo más cercana posible a la perfección, donde "cercana a la perfección" se define mediante la función de calidad de reconstrucción.d{\displaystyle d}.

La forma más sencilla de realizar la tarea de copiado a la perfección sería duplicar la señal. Para suprimir este comportamiento, el espacio de códigoZ{\displaystyle {\mathcal {Z}}}generalmente tiene menos dimensiones que el espacio de mensajesincógnita{\displaystyle {\mathcal {X}}}.

Este tipo de autoencoder se denomina subcompleto . Puede interpretarse como una compresión del mensaje o una reducción de su dimensionalidad . [ 9 ] [ 10 ]

En el límite de un autoencoder subcompleto ideal, cada posible códigoz{\displaystyle z}en el espacio de código se utiliza para codificar un mensajeincógnita{\displaystyle x}que realmente aparece en la distribuciónμrmiF{\displaystyle \mu _{ref}}y el decodificador también es perfecto:Dθ(miϕ(incógnita))=incógnita{\displaystyle D_{\theta }(E_{\phi }(x))=x}Este autoencoder ideal puede utilizarse para generar mensajes indistinguibles de los mensajes reales, alimentando su decodificador con código arbitrario.z{\displaystyle z}y obtenerDθ(z){\displaystyle D_{\theta}(z)}, que es un mensaje que realmente aparece en la distribuciónμrmiF{\displaystyle \mu _{ref}}.

Si el espacio de códigoZ{\displaystyle {\mathcal {Z}}}tiene una dimensión mayor que ( sobrecompletado ) o igual al espacio de mensajesincógnita{\displaystyle {\mathcal {X}}}o si las unidades ocultas tienen suficiente capacidad, un autoencoder puede aprender la función identidad y volverse inútil. Sin embargo, los resultados experimentales encontraron que los autoencoders sobrecompletos aún podrían aprender características útiles . [ 11 ]

En el escenario ideal, la dimensión del código y la capacidad del modelo podrían establecerse en función de la complejidad de la distribución de datos que se va a modelar. Una forma estándar de hacerlo es añadir modificaciones al autoencoder básico, que se detallarán más adelante. [ 2 ]

Variaciones

Autoencoder variacional (VAE)

Esquema básico de un autoencoder variacional. El modelo recibeincógnita{\displaystyle x}como entrada. El codificador lo comprime en el espacio latente. El decodificador recibe como entrada la información muestreada del espacio latente y produceincógnita{\displaystyle {x'}}lo más parecido posible aincógnita{\displaystyle x}.

Los autoencoders variacionales (VAE) pertenecen a la familia de métodos bayesianos variacionales . A pesar de las similitudes arquitectónicas con los autoencoders básicos, los VAE se diseñan con objetivos diferentes y poseen una formulación matemática distinta. En este caso, el espacio latente se compone de una mezcla de distribuciones en lugar de vectores fijos.

Dado un conjunto de datos de entradaincógnita{\displaystyle x}caracterizada por una función de probabilidad desconocidaPAG(incógnita){\displaystyle P(x)}y un vector de codificación latente multivariadoz{\displaystyle z}El objetivo es modelar los datos como una distribución.pagθ(incógnita){\displaystyle p_{\theta }(x)}, conθ{\displaystyle \theta }definido como el conjunto de parámetros de red de modo quepagθ(incógnita)=zpagθ(incógnita,z)dz{\displaystyle p_{\theta }(x)=\int _ {z}p_{\theta }(x,z)dz}.

Autoencoder disperso (SAE)

Inspirados por la hipótesis de codificación dispersa en neurociencia, los autoencoders dispersos (SAE) son variantes de los autoencoders, de tal manera que los códigosmiϕ(incógnita){\displaystyle E_{\phi }(x)}porque los mensajes tienden a ser códigos dispersos , es decir,miϕ(incógnita){\displaystyle E_{\phi }(x)}es cercano a cero en la mayoría de las entradas. Los autoencoders dispersos pueden incluir más (en lugar de menos) unidades ocultas que entradas, pero solo se permite que un pequeño número de unidades ocultas estén activas al mismo tiempo. [ 12 ] Fomentar la dispersión mejora el rendimiento en tareas de clasificación. [ 13 ]

Esquema simple de un autoencoder disperso de una sola capa. Los nodos ocultos en amarillo brillante están activados, mientras que los de color amarillo claro están inactivos. La activación depende de la entrada.

Hay dos formas principales de imponer la escasez. Una forma es simplemente limitar a cero todas las activaciones del código latente excepto las k más altas. Este es el autoencoder k-escaso . [ 13 ]

El autoencoder k-disperso inserta la siguiente "función k-dispersa" en la capa latente de un autoencoder estándar:Fk(incógnita1,...,incógnitanorte)=(incógnita1b1,...,incógnitanortebnorte){\displaystyle f_{k}(x_{1},...,x_{n})=(x_{1}b_{1},...,x_{n}b_{n})}dóndebi=1{\displaystyle b_{i}=1}si|incógnitai|{\displaystyle |x_{i}|}ocupa los primeros k puestos, y 0 en caso contrario.

Retropropagación a través deFk{\displaystyle f_{k}}es simple: establezca el gradiente en 0 parabi=0{\displaystyle b_{i}=0}entradas y mantener gradiente parabi=1{\displaystyle b_{i}=1}entradas. Esta es esencialmente una función ReLU generalizada . [ 13 ]

La otra forma es una versión relajada del autoencoder k-disperso. En lugar de forzar la dispersión, agregamos una pérdida de regularización de dispersión y luego optimizamos paraminθ,ϕL(θ,ϕ)+λLescaso(θ,ϕ){\displaystyle \min _{\theta ,\phi }L(\theta ,\phi )+\lambda L_{\text{sparse}}(\theta ,\phi )}dóndeλ>0{\displaystyle \lambda >0}mide cuánta escasez queremos imponer. [ 14 ]

Dejemos que la arquitectura del autoencoder tengaK{\displaystyle K}capas. Para definir una pérdida de regularización de escasez, necesitamos una escasez "deseada".ρ^k{\displaystyle {\hat {\rho }}_{k}}para cada capa, un pesowk{\displaystyle w_{k}}para cuánto imponer cada escasez y una funcións:[0,1]×[0,1][0,]{\displaystyle s:[0,1]\times [0,1]\to [0,\infty ]}para medir cuánto difieren dos niveles de escasez.

Para cada entradaincógnita{\displaystyle x}, sea la escasez real de activación en cada capak{\displaystyle k}serρk(incógnita)=1nortei=1norteak,i(incógnita){\displaystyle \rho _{k}(x)={\frac {1}{n}}\sum _{i=1}^{n}a_{k,i}(x)}dóndeak,i(incógnita){\displaystyle a_{k,i}(x)}es la activación en eli{\displaystyle i}-la neurona de lak{\displaystyle k}-capa sobre la entradaincógnita{\displaystyle x}.

La pérdida de escasez al ingresarincógnita{\displaystyle x}para una capa ess(ρ^k,ρk(incógnita)){\displaystyle s({\hat {\rho }}_{k},\rho _{k}(x))}y la pérdida de regularización de escasez para todo el autoencoder es la suma ponderada esperada de las pérdidas de escasez:Lescaso(θ,ϕ)=miincógnitaμincógnita[k1:Kwks(ρ^k,ρk(incógnita))]{\displaystyle L_{\text{sparse}}(\theta ,\phi )=\mathbb {\mathbb {E} } _{x\sim \mu _{X}}\left[\sum _{k\in 1:K}w_{k}s({\hat {\rho }}_{k},\rho _{k}(x))\right]}Normalmente, la funcións{\displaystyle s}es la divergencia de Kullback-Leibler (KL) , como [ 13 ] [ 14 ] [ 15 ] [ 16 ]

s(ρ,ρ^)=KL(ρ||ρ^)=ρregistroρρ^+(1ρ)registro1ρ1ρ^{\displaystyle s(\rho ,{\hat {\rho }})=KL(\rho ||{\hat {\rho }})=\rho \log {\frac {\rho }{\hat {\rho }}}+(1-\rho )\log {\frac {1-\rho }{1-{\hat {\rho }}}}}

o la pérdida L1, comos(ρ,ρ^)=|ρρ^|{\displaystyle s(\rho ,{\hat {\rho }})=|\rho -{\hat {\rho }}|}, o la pérdida L2, comos(ρ,ρ^)=|ρρ^|2{\displaystyle s(\rho ,{\hat {\rho }})=|\rho -{\hat {\rho }}|^{2}}.

Alternativamente, la pérdida de regularización de escasez puede definirse sin referencia a ninguna "escasez deseada", sino simplemente forzando la mayor escasez posible. En este caso, se puede definir la pérdida de regularización de escasez comoLescaso(θ,ϕ)=miincógnitaμincógnita[k1:Kwkhk]{\displaystyle L_{\text{sparse}}(\theta ,\phi )=\mathbb {\mathbb {E} } _{x\sim \mu _{X}}\left[\sum _{k\in 1:K}w_{k}\|h_{k}\|\right]}dóndehk{\displaystyle h_{k}}es el vector de activación en elk{\displaystyle k}-ésima capa del autoencoder. La norma{\displaystyle \|\cdot \|}Por lo general, se utiliza la norma L1 (que da como resultado el autoencoder disperso L1) o la norma L2 (que da como resultado el autoencoder disperso L2).

Autoencoder de eliminación de ruido (DAE)

Un esquema de un codificador automático de eliminación de ruido.

Los autoencoders de eliminación de ruido (DAE) intentan lograr una buena representación cambiando el criterio de reconstrucción . [ 2 ] [ 3 ]

Un DAE, originalmente llamado "red autoasociativa robusta" por Mark A. Kramer, [ 17 ] se entrena corrompiendo intencionalmente las entradas de un autoencoder estándar durante el entrenamiento. Un proceso de ruido se define mediante una distribución de probabilidad.μT{\displaystyle \mu _{T}}sobre funcionesT:incógnitaincógnita{\displaystyle T:{\mathcal {X}}\to {\mathcal {X}}}. Es decir, la funciónT{\displaystyle T}toma un mensajeincógnitaincógnita{\displaystyle x\in {\mathcal {X}}}y lo corrompe hasta convertirlo en una versión ruidosa.T(incógnita){\displaystyle T(x)}. La funciónT{\displaystyle T}se selecciona aleatoriamente, con una distribución de probabilidadμT{\displaystyle \mu _{T}}.

Dada una tarea(μárbitro,d){\displaystyle (\mu _{\text{ref}},d)}El problema de entrenar un DAE es el problema de optimización:minθ,ϕL(θ,ϕ)=miincógnitaμincógnita,TμT[d(incógnita,(DθmiϕT)(incógnita))]{\displaystyle \min _{\theta ,\phi }L(\theta ,\phi )=\mathbb {\mathbb {E} } _{x\sim \mu _{X},T\sim \mu _{T}}[d(x,(D_{\theta }\circ E_{\phi }\circ T)(x))]}Es decir, el DAE óptimo debería tomar cualquier mensaje ruidoso e intentar recuperar el mensaje original sin ruido, de ahí el nombre de "eliminación de ruido" .

Por lo general, el proceso de ruidoT{\displaystyle T}Se aplica únicamente durante la formación y las pruebas, no durante su uso posterior.

El uso de DAE depende de dos supuestos:

  • Existen representaciones de los mensajes que son relativamente estables y robustas frente al tipo de ruido que probablemente encontraremos;
  • Dichas representaciones capturan estructuras en la distribución de entrada que son útiles para nuestros propósitos. [ 3 ]

Algunos ejemplos de procesos que generan ruido son:

  • ruido gaussiano isotrópico aditivo ,
  • Ruido de enmascaramiento (una fracción de la entrada se elige aleatoriamente y se establece en 0).
  • Ruido de sal y pimienta (una fracción de la entrada se elige aleatoriamente y se establece aleatoriamente en su valor mínimo o máximo). [ 3 ]

Autoencoder contractivo (CAE)

Un autoencoder contractivo (CAE) añade la pérdida de regularización contractiva a la pérdida estándar del autoencoder:minθ,ϕL(θ,ϕ)+λLcontinuación(θ,ϕ){\displaystyle \min _{\theta ,\phi }L(\theta ,\phi )+\lambda L_{\text{cont}}(\theta ,\phi )}dóndeλ>0{\displaystyle \lambda >0}mide cuánta contractividad queremos imponer. La pérdida de regularización contractiva se define como el cuadrado esperado de la norma de Frobenius de la matriz jacobiana de las activaciones del codificador con respecto a la entrada:Lcontinuación(θ,ϕ)=miincógnitaμrmiFincógnitamiϕ(incógnita)F2{\displaystyle L_{\text{cont}}(\theta ,\phi )=\mathbb {E} _{x\sim \mu _{ref}}\|\nabla _{x}E_{\phi }(x)\|_{F}^{2}}Para entender quéLcontinuación{\displaystyle L_{\text{cont}}}medidas, tenga en cuenta el hechomiϕ(incógnita+δincógnita)miϕ(incógnita)2incógnitamiϕ(incógnita)Fδincógnita2{\displaystyle \|E_{\phi }(x+\delta x)-E_{\phi }(x)\|_{2}\leq \|\nabla _{x}E_{\phi }(x)\|_{F}\|\delta x\|_{2}}para cualquier mensajeincógnitaincógnita{\displaystyle x\in {\mathcal {X}}}y pequeña variaciónδincógnita{\displaystyle \delta x}en él. Por lo tanto, siincógnitamiϕ(incógnita)F2{\displaystyle \|\nabla _{x}E_{\phi }(x)\|_{F}^{2}}Es pequeño, lo que significa que un pequeño vecindario del mensaje se corresponde con un pequeño vecindario de su código. Esta es una propiedad deseada, ya que implica que una pequeña variación en el mensaje conlleva una variación pequeña, o incluso nula, en su código, como cuando dos imágenes pueden parecer iguales aunque no lo sean exactamente.

El DAE puede entenderse como un límite infinitesimal del CAE: en el límite de ruido de entrada gaussiano pequeño, los DAE hacen que la función de reconstrucción resista perturbaciones de entrada pequeñas pero de tamaño finito, mientras que los CAE hacen que las características extraídas resistan perturbaciones de entrada infinitesimales.

Autoencoder de longitud de descripción mínima (MDL-AE)

Un autoencoder de longitud de descripción mínima (MDL-AE) es una variante avanzada del autoencoder tradicional que aprovecha principios de la teoría de la información, específicamente el principio de longitud de descripción mínima (MDL) . El principio MDL postula que el mejor modelo para un conjunto de datos es aquel que proporciona la codificación combinada más corta del modelo y los datos. En el contexto de los autoencoders , este principio se aplica para garantizar que la representación aprendida no solo sea compacta, sino también interpretable y eficiente para la reconstrucción.

El MDL-AE busca minimizar la longitud total de la descripción de los datos, que incluye el tamaño de la representación latente (longitud del código) y el error en la reconstrucción de los datos originales. El objetivo se puede expresar como Lcódigo+Lerror{\displaystyle L_{\text{code}}+L_{\text{error}}}, dóndeLcódigo{\displaystyle L_{\text{code}}}representa la longitud de la representación latente comprimida yLerror{\displaystyle L_{\text{error}}}denota el error de reconstrucción. [ 18 ]

Autoencoder de hormigón (CAE)

El autoencoder concreto está diseñado para la selección discreta de características. [ 19 ] Un autoencoder concreto obliga al espacio latente a constar únicamente de un número de características especificado por el usuario. El autoencoder concreto utiliza una relajación continua de la distribución categórica para permitir que los gradientes atraviesen la capa de selección de características, lo que posibilita el uso de la retropropagación estándar para aprender un subconjunto óptimo de características de entrada que minimicen la pérdida de reconstrucción.

Ventajas de la profundidad

Esquema de la estructura de un autoencoder con 3 capas ocultas totalmente conectadas. El código (z o h, según se indica en el texto) es la capa más interna.

Los autoencoders suelen entrenarse con un codificador de una sola capa y un decodificador de una sola capa, pero el uso de codificadores y decodificadores de muchas capas (profundos) ofrece muchas ventajas. [ 2 ]

  • La profundidad puede reducir exponencialmente el coste computacional de representar algunas funciones.
  • La profundidad puede disminuir exponencialmente la cantidad de datos de entrenamiento necesarios para aprender algunas funciones.
  • Experimentalmente, los autoencoders profundos producen una mejor compresión en comparación con los autoencoders superficiales o lineales. [ 10 ]
  • La profundidad permite ventajas sobre los métodos tradicionales, ya que se puede demostrar que, después del entrenamiento, los autoencoders lineales de una sola capa tienen un espacio latente cuyos vectores abarcan el mismo subespacio que los autovectores encontrados en el análisis de componentes principales . [ 20 ]

Capacitación

Geoffrey Hinton desarrolló la técnica de redes de creencias profundas para entrenar autoencoders profundos de múltiples capas. Su método consiste en tratar cada conjunto vecino de dos capas como una máquina de Boltzmann restringida , de modo que el preentrenamiento se aproxime a una buena solución, y luego utilizar la retropropagación para ajustar los resultados. [ 10 ]

Los investigadores han debatido si el entrenamiento conjunto (es decir, entrenar toda la arquitectura junto con un único objetivo de reconstrucción global para optimizar) sería mejor para los autoencoders profundos. [ 21 ] Un estudio de 2015 mostró que el entrenamiento conjunto aprende mejores modelos de datos junto con características más representativas para la clasificación en comparación con el método por capas. [ 21 ] Sin embargo, sus experimentos mostraron que el éxito del entrenamiento conjunto depende en gran medida de las estrategias de regularización adoptadas. [ 21 ] [ 22 ]

Historia

(Oja, 1982) [ 23 ] observaron que PCA es equivalente a una red neuronal con una capa oculta con función de activación de identidad. En el lenguaje de la autocodificación, el módulo de entrada a la capa oculta es el codificador, y el módulo de la capa oculta a la salida es el decodificador. Posteriormente, en (Baldi y Hornik, 1989) [ 24 ] y (Kramer, 1991) [ 9 ] generalizaron PCA a autocodificadores, una técnica que denominaron "PCA no lineal".

Inmediatamente después del resurgimiento de las redes neuronales en la década de 1980, se sugirió en 1986 [ 25 ] que una red neuronal se pusiera en "modo de autoasociación". Esto se implementó posteriormente en (Harrison, 1987) [ 26 ] y (Elman, Zipser, 1988) [ 27 ] para el habla y en (Cottrell, Munro, Zipser, 1987) [ 28 ] para imágenes. [ 29 ] En (Hinton, Salakhutdinov, 2006), [ 30 ] se desarrollaron redes de creencias profundas . Estas entrenan un par de máquinas de Boltzmann restringidas como pares codificador-decodificador, luego entrenan otro par en la representación latente del primer par, y así sucesivamente. [ 31 ]

Las primeras aplicaciones de AE ​​datan de principios de la década de 1990. [ 2 ] [ 32 ] [ 18 ] Su aplicación más tradicional fue la reducción de dimensionalidad o el aprendizaje de características , pero el concepto se generalizó para aprender modelos generativos de datos. [ 33 ] [ 34 ] Algunas de las IA más potentes de la década de 2010 involucraron módulos autoencoder como un componente de sistemas de IA más grandes, como VAE en Stable Diffusion , VAE discreto en generadores de imágenes basados ​​en Transformer como DALL-E 1 , etc.

En los primeros tiempos, cuando la terminología era incierta, el autoencoder también se ha denominado mapeo de identidad, [ 24 ] [ 9 ] autoasociativo, [ 35 ] retropropagación autosupervisada , [ 9 ] o red Diabolo. [ 36 ] [ 11 ]

Aplicaciones

Las dos principales aplicaciones de los autoencoders son la reducción de dimensionalidad y la recuperación de información (o memoria asociativa ), [ 2 ] pero se han aplicado variaciones modernas a otras tareas.

Reducción de dimensionalidad

Gráfico de los dos primeros componentes principales (izquierda) y una capa oculta bidimensional de un autoencoder lineal (derecha) aplicado al conjunto de datos Fashion MNIST . [ 37 ] Ambos modelos, al ser lineales, aprenden a abarcar el mismo subespacio. La proyección de los puntos de datos es idéntica, salvo la rotación del subespacio. Mientras que el PCA selecciona una orientación específica, salvo reflexiones en el caso general, la función de coste de un autoencoder simple es invariante a las rotaciones del espacio latente.

La reducción de dimensionalidad fue una de las primeras aplicaciones del aprendizaje profundo . [ 2 ]

Para el estudio de Hinton de 2006, [ 10 ] preentrenó un autoencoder multicapa con una pila de RBM y luego usó sus pesos para inicializar un autoencoder profundo con capas ocultas gradualmente más pequeñas hasta alcanzar un cuello de botella de 30 neuronas. Las 30 dimensiones resultantes del código produjeron un error de reconstrucción menor en comparación con los primeros 30 componentes de un análisis de componentes principales (PCA), y aprendió una representación que era cualitativamente más fácil de interpretar, separando claramente los grupos de datos. [ 2 ] [ 10 ]

La reducción de dimensiones puede mejorar el rendimiento en tareas como la clasificación. [ 2 ] De hecho, la característica distintiva de la reducción de dimensionalidad es colocar ejemplos semánticamente relacionados cerca unos de otros. [ 38 ]

Análisis de componentes principales

Reconstrucción de imágenes de 28x28 píxeles mediante un autoencoder con un tamaño de código de dos (capa oculta de dos unidades) y la reconstrucción a partir de los dos primeros componentes principales del PCA. Las imágenes provienen del conjunto de datos Fashion MNIST . [ 37 ]

Si se utilizan activaciones lineales, o solo una única capa oculta sigmoide, entonces la solución óptima para un autoencoder está fuertemente relacionada con el análisis de componentes principales (PCA). [ 29 ] [ 39 ] Los pesos de un autoencoder con una única capa oculta de tamañopag{\displaystyle p}(dóndepag{\displaystyle p}es menor que el tamaño de la entrada) abarcan el mismo subespacio vectorial que el abarcado por el primeropag{\displaystyle p}componentes principales, y la salida del autoencoder es una proyección ortogonal sobre este subespacio. Los pesos del autoencoder no son iguales a los componentes principales, y generalmente no son ortogonales, sin embargo, los componentes principales pueden recuperarse a partir de ellos utilizando la descomposición en valores singulares . [ 40 ]

Sin embargo, el potencial de los autoencoders reside en su no linealidad, lo que permite que el modelo aprenda generalizaciones más potentes en comparación con PCA y que reconstruya la entrada con una pérdida de información significativamente menor. [ 10 ]

Recuperación de información

La recuperación de información se beneficia particularmente de la reducción de dimensionalidad, ya que la búsqueda puede volverse más eficiente en ciertos tipos de espacios de baja dimensión. De hecho, los autoencoders se aplicaron al hash semántico, propuesto por Salakhutdinov y Hinton en 2007. [ 38 ] Al entrenar el algoritmo para producir un código binario de baja dimensión, todas las entradas de la base de datos podrían almacenarse en una tabla hash que mapea vectores de código binario a entradas. Esta tabla luego admitiría la recuperación de información al devolver todas las entradas con el mismo código binario que la consulta, o entradas ligeramente menos similares al invertir algunos bits de la codificación de la consulta.

Detección de anomalías

Otra aplicación para los autoencoders es la detección de anomalías . [ 17 ] [ 41 ] [ 42 ] [ 43 ] [ 44 ] [ 45 ] Al aprender a replicar las características más destacadas en los datos de entrenamiento bajo algunas de las restricciones descritas anteriormente, se anima al modelo a aprender a reproducir con precisión las características observadas con mayor frecuencia. Cuando se enfrenta a anomalías, el modelo debería empeorar su rendimiento de reconstrucción. En la mayoría de los casos, solo se utilizan datos con instancias normales para entrenar el autoencoder; en otros, la frecuencia de anomalías es pequeña en comparación con el conjunto de observaciones, por lo que su contribución a la representación aprendida podría ignorarse. Después del entrenamiento, el autoencoder reconstruirá con precisión los datos "normales", mientras que fallará al hacerlo con datos anómalos desconocidos. [ 43 ] El error de reconstrucción (el error entre los datos originales y su reconstrucción de baja dimensión) se utiliza como una puntuación de anomalía para detectar anomalías. [ 43 ] Normalmente, esto significa que en un conjunto de validación se registra la distribución empírica de los errores de reconstrucción y luego (por ejemplo) el percentil 95 empíricoincógnitapag{\displaystyle x_{p}}se toma como umbralt:=incógnitapag{\displaystyle t:=x_{p}}para marcar puntos de datos anómalos:pérdida(incógnita,reconstrucción(incógnita))>tanomalía{\displaystyle {\text{loss}}(x,{\text{reconstruction}}(x))>t\implies {\text{anomaly}}}Dado que el umbral es una estimación de cuantil empírico , existe una dificultad inherente para establecer este umbral "correctamente": en muchos casos, la distribución del cuantil empírico es asintóticamente una distribución normal.cuantil p empíriconorte(μ=pag,σ2=pag(1pag)norteF(incógnitapag)2),{\displaystyle {\text{empirical p-quantile}}\sim {\mathcal {N}}\left(\mu =p,\sigma ^{2}={\frac {p(1-p)}{nf(x_{p})^{2}}}\right),}conF(incógnitapag){\displaystyle f(x_{p})}la densidad de probabilidad en el cuantil. Esto significa que la varianza crece si se considera un cuantil extremo (porqueF(incógnitapag){\displaystyle f(x_{p})}es pequeño allí). Esto significa que existe una incertidumbre potencialmente grande sobre cuál es la elección correcta para el umbral ya que se estima a partir de un conjunto de validación.

Sin embargo, la literatura reciente ha demostrado que ciertos modelos de autoencoders pueden, contraintuitivamente, ser muy buenos reconstruyendo ejemplos anómalos y, en consecuencia, no ser capaces de realizar una detección de anomalías fiable. [ 46 ] [ 47 ] Intuitivamente, esto se puede entender considerando aquellos autoencoders de una capa que están relacionados con PCA; también en este caso puede haber reconstrucciones perfectas para puntos que están lejos de la región de datos pero que se encuentran en un eje de componentes principales.

Lo mejor es analizar si las anomalías señaladas por el autoencoder son realmente anomalías. En este sentido, se pueden considerar todas las métricas de evaluación de clasificadores binarios . El principal desafío del aprendizaje no supervisado (autosupervisado) radica en que no existen etiquetas para eventos raros (en cuyo caso primero hay que recopilarlas, lo que provoca un desequilibrio en el conjunto de datos) o bien las etiquetas que indican anomalías son muy raras, lo que introduce intervalos de confianza más amplios para estas estimaciones de rendimiento.

Procesamiento de imágenes

Las características de los autoencoders son útiles en el procesamiento de imágenes.

Un ejemplo se puede encontrar en la compresión de imágenes con pérdida , donde los autoencoders superaron a otros enfoques y demostraron ser competitivos frente a JPEG 2000. [ 48 ] [ 49 ]

Otra aplicación útil de los autoencoders en el preprocesamiento de imágenes es la eliminación de ruido en las imágenes . [ 50 ] [ 51 ] [ 52 ]

Los autoencoders se han utilizado en contextos más exigentes, como la imagen médica, donde se han empleado para la reducción de ruido en imágenes [ 53 ] y para la superresolución [ 54 ] [ 55 ] . En el diagnóstico asistido por imágenes, se han aplicado autoencoders en experimentos para la detección del cáncer de mama [ 56 ] y para modelar la relación entre el deterioro cognitivo de la enfermedad de Alzheimer y las características latentes de un autoencoder entrenado con resonancia magnética [ 57 ] .

descubrimiento de fármacos

En 2019, las moléculas generadas con autoencoders variacionales fueron validadas experimentalmente en ratones. [ 58 ] [ 59 ]

Predicción de popularidad

Recientemente, un marco de autoencoder apilado produjo resultados prometedores en la predicción de la popularidad de las publicaciones en redes sociales, [ 60 ] lo cual es útil para las estrategias de publicidad en línea.

Traducción automática

Los autoencoders se han aplicado a la traducción automática , que generalmente se denomina traducción automática neuronal (NMT). [ 61 ] [ 62 ] A diferencia de los autoencoders tradicionales, la salida no coincide con la entrada: está en otro idioma. En NMT, los textos se tratan como secuencias que se codifican en el procedimiento de aprendizaje, mientras que en el lado del decodificador se generan secuencias en el idioma o idiomas de destino. Los autoencoders específicos de cada idioma incorporan características lingüísticas adicionales en el procedimiento de aprendizaje, como las características de descomposición del chino. [ 63 ] La traducción automática rara vez se realiza con autoencoders, debido a la disponibilidad de redes transformadoras más efectivas .

Sistemas de comunicación

Los autoencoders en los sistemas de comunicación son importantes porque ayudan a codificar los datos en una representación más robusta ante las deficiencias del canal, lo cual es crucial para transmitir información minimizando los errores. Además, los sistemas basados ​​en AE pueden optimizar el rendimiento de la comunicación de extremo a extremo. Este enfoque puede resolver varias limitaciones del diseño de sistemas de comunicación, como la dificultad inherente para modelar con precisión el comportamiento complejo de los canales del mundo real. [ 64 ]

Véase también

Lecturas adicionales

  • Bank, Dor; Koenigstein, Noam; Giryes, Raja (2023). «Autoencoders». Machine Learning for Data Science Handbook . Cham: Springer International Publishing. doi : 10.1007/978-3-031-24628-9_16 . ISBN 978-3-031-24627-2.
  • Goodfellow, Ian; Bengio, Yoshua; Courville, Aaron (2016). «14. Autoencoders» . Aprendizaje profundo . Computación adaptativa y aprendizaje automático. Cambridge, Mass: The MIT Press. ISBN 978-0-262-03561-3.

Referencias

  1. Bank, Dor; Koenigstein, Noam; Giryes, Raja (2023). "Autoencoders" . En Rokach, Lior; Maimon, Oded; Shmueli, Erez (eds.). Machine learning for data science handbook . pp. 353–374 . doi : 10.1007/978-3-031-24628-9_16 . ISBN  978-3-031-24627-2.
  2. 1 2 3 4 5 6 7 8 9 Goodfellow, Ian; Bengio, Yoshua; Courville, Aaron (2016). Aprendizaje profundo . MIT Press. ISBN 978-0262035613.
  3. 1 2 3 4 Vincent, Pascal; Larochelle, Hugo (2010). "Autoencoders de eliminación de ruido apilados: aprendizaje de representaciones útiles en una red profunda con un criterio de eliminación de ruido local". Journal of Machine Learning Research . 11 : 3371–3408 .
  4. Welling, Max; Kingma, Diederik P. (2019). "Una introducción a los autoencoders variacionales". Fundamentos y tendencias en aprendizaje automático . 12 (4): 307– 392. arXiv : 1906.02691 . Bibcode : 2019arXiv190602691K . doi : 10.1561/2200000056 . S2CID 174802445 . 
  5. Hinton GE, Krizhevsky A, Wang SD. Transformación de autoencoders. En Conferencia Internacional sobre Redes Neuronales Artificiales 2011, 14 de junio (págs. 44-51). Springer, Berlín, Heidelberg.
  6. 1 2 Géron, Aurélien (2019). Aprendizaje automático práctico con Scikit-Learn, Keras y TensorFlow . Canadá: O'Reilly Media, Inc. págs. 739–740 . 
  7. ^ Liou, Cheng-Yuan; Huang, Jau-Chi; Yang, Wen-Chie (2008). "Modelado de la percepción de palabras utilizando la red Elman" . Neurocomputación . 71 ( 16-18 ): 3150. doi : 10.1016/j.neucom.2008.04.030 .
  8. ^ Liou, Cheng-Yuan; Cheng, Wei-Chen; Liou, Jiun-Wei; Liou, Daw Ran (2014). "Codificador automático de palabras". Neurocomputación . 139 : 84– 96. doi : 10.1016/j.neucom.2013.09.055 .
  9. 1 2 3 4 Kramer, Mark A. (1991). "Análisis de componentes principales no lineales mediante redes neuronales autoasociativas" (PDF) . AIChE Journal . 37 (2): 233– 243. Bibcode : 1991AIChE..37..233K . doi : 10.1002/aic.690370209 .
  10. 1 2 3 4 5 6 Hinton, GE; Salakhutdinov, RR (2006-07-28). "Reducción de la dimensionalidad de los datos con redes neuronales". Science . 313 (5786): 504– 507. Bibcode : 2006Sci...313..504H . doi : 10.1126/science.1127647 . PMID 16873662 . S2CID 1658773 .  
  11. 1 2 Bengio, Y. (2009). "Learning Deep Architectures for AI" (PDF) . Foundations and Trends in Machine Learning . 2 (8): 1795– 7. CiteSeerX 10.1.1.701.9550 . doi : 10.1561/2200000006 . PMID 23946944. S2CID 207178999 .   
  12. Domingos, Pedro (2015). "4". El algoritmo maestro: Cómo la búsqueda de la máquina de aprendizaje definitiva transformará nuestro mundo . Basic Books. Subsección "Profundizando en el cerebro". ISBN 978-046506192-1.
  13. 1 2 3 4 Makhzani, Alireza; Frey, Brendan (2013). "Codificadores automáticos K-Sparse". arXiv : 1312.5663 [ cs.LG ].
  14. 1 2 Ng, A. (2011). Autoencoder disperso . CS294A Notas de clase , 72 (2011), 1-19.
  15. Nair, Vinod; Hinton, Geoffrey E. (2009). "Reconocimiento de objetos 3D con redes neuronales profundas" . Actas de la 22.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal . NIPS'09. EE. UU.: Curran Associates Inc.: 1339–1347 . ISBN 9781615679119.
  16. Zeng, Nianyin; Zhang, Hong; Song, Baoye; Liu, Weibo; Li, Yurong; Dobaie, Abdullah M. (2018-01-17). "Reconocimiento de expresiones faciales mediante el aprendizaje de autoencoders dispersos profundos". Neurocomputing . 273 : 643–649 . doi : 10.1016/j.neucom.2017.08.043 . ISSN 0925-2312 . 
  17. 1 2 Kramer, MA (1992-04-01). "Redes neuronales autoasociativas" . Computers & Chemical Engineering . Aplicaciones de redes neuronales en ingeniería química. 16 (4): 313– 328. doi : 10.1016/0098-1354(92)80051-A . ISSN 0098-1354 . 
  18. 1 2 Hinton, Geoffrey E; Zemel, Richard (1993). "Autoencoders, Minimum Description Length and Helmholtz Free Energy" . Advances in Neural Information Processing Systems . 6. Morgan-Kaufmann.
  19. Abid, Abubakar; Balin, Muhammad Fatih; Zou, James (27-01-2019). "Autoencoders concretos para la selección y reconstrucción de características diferenciables". arXiv : 1901.09346 [ cs.LG ].
  20. Plaut, Elad (2018-12-28), De subespacios principales a componentes principales con autoencoders lineales , arXiv : 1804.10253
  21. 1 2 3 Zhou, Yingbo; Arpit, Devansh; Nwogu, Ifeoma; Govindaraju, Venu (2014). "¿Es mejor el entrenamiento conjunto para los autoencoders profundos?". arXiv : 1405.1380 [ stat.ML ].
  22. R. Salakhutdinov y GE Hinton, “Máquinas de Boltzmann profundas”, en AISTATS, 2009, págs. 448–455.
  23. Oja, Erkki (1982-11-01). "Modelo neuronal simplificado como analizador de componentes principales" . Journal of Mathematical Biology . 15 (3): 267– 273. doi : 10.1007/BF00275687 . ISSN 1432-1416 . PMID 7153672 .  
  24. 1 2 Baldi, Pierre; Hornik, Kurt (1989-01-01). "Redes neuronales y análisis de componentes principales: aprendizaje a partir de ejemplos sin mínimos locales" . Redes neuronales . 2 (1): 53– 58. doi : 10.1016/0893-6080(89)90014-2 . ISSN 0893-6080 . 
  25. Rumelhart, David E.; McClelland, James L.; AU (1986). "2. Un marco general para el procesamiento distribuido en paralelo". Procesamiento distribuido en paralelo: Exploraciones en la microestructura de la cognición: Fundamentos . The MIT Press. doi : 10.7551/mitpress/5236.001.0001 . ISBN 978-0-262-29140-8.
  26. Harrison TD (1987) Un marco conexionista para el reconocimiento continuo del habla. Tesis doctoral de la Universidad de Cambridge.
  27. Elman, Jeffrey L.; Zipser, David (1988-04-01). "Aprendiendo la estructura oculta del habla" . The Journal of the Acoustical Society of America . 83 (4): 1615– 1626. Bibcode : 1988ASAJ...83.1615E . doi : 10.1121/1.395916 . ISSN 0001-4966 . PMID 3372872 .  
  28. Cottrell, Garrison W.; Munro, Paul; Zipser, David (1987). "Aprendizaje de la representación interna a partir de imágenes en escala de grises: un ejemplo de programación extensional" . Actas de la reunión anual de la Sociedad de Ciencias Cognitivas . 9 .
  29. 1 2 Bourlard, H.; Kamp, Y. (1988). "Autoasociación por perceptrones multicapa y descomposición en valores singulares" . Cibernética Biológica . 59 ( 4–5 ): 291–294 . doi : 10.1007/BF00332918 . PMID 3196773. S2CID 206775335 .  
  30. Hinton, GE; Salakhutdinov, RR (2006-07-28). "Reducción de la dimensionalidad de los datos con redes neuronales". Science . 313 (5786): 504– 507. Bibcode : 2006Sci...313..504H . doi : 10.1126/science.1127647 . PMID 16873662 . S2CID 1658773 .  
  31. Hinton G (2009). "Redes de creencias profundas" . Scholarpedia . 4 (5): 5947. Bibcode : 2009SchpJ...4.5947H . doi : 10.4249/scholarpedia.5947 .
  32. Schmidhuber, Jürgen (enero de 2015). " Aprendizaje profundo en redes neuronales: una visión general". Redes neuronales . 61 : 85–117 . arXiv : 1404.7828 . doi : 10.1016/j.neunet.2014.09.003 . PMID 25462637. S2CID 11715509 .  
  33. Diederik P. Kingma; Bien, Max (2013). "Bayes variacionales de codificación automática". arXiv : 1312.6114 [ estad.ML ].
  34. ↑ Generación de rostros con Torch, Boesen A., Larsen L. y Sonderby SK , 2015 torch.ch/blog/2015/11/13/gan.html
  35. Ackley, D; Hinton, G; Sejnowski, T (marzo de 1985). "Un algoritmo de aprendizaje para máquinas de Boltzmann" . Cognitive Science . 9 (1): 147– 169. doi : 10.1016/S0364-0213(85)80012-4 .
  36. Schwenk, Holger; Bengio, Yoshua (1997). "Métodos de entrenamiento para el impulso adaptativo de redes neuronales" . Avances en sistemas de procesamiento de información neuronal . 10. MIT Press.
  37. 1 2 "Moda MNIST" . GitHub . 12 de julio de 2019.
  38. 1 2 Salakhutdinov, Ruslan; Hinton, Geoffrey (2009-07-01). "Hashing semántico" . International Journal of Approximate Reasoning . Sección especial sobre modelos gráficos y recuperación de información. 50 (7): 969– 978. doi : 10.1016/j.ijar.2008.11.006 . ISSN 0888-613X . 
  39. Chicco, Davide; Sadowski, Peter; Baldi, Pierre (2014). "Redes neuronales autoencoder profundas para predicciones de anotaciones de ontología genética". Actas de la 5.ª Conferencia ACM sobre Bioinformática, Biología Computacional e Informática de la Salud - BCB '14 . p. 533. doi : 10.1145/2649387.2649442 . hdl : 11311/964622 . ISBN  9781450328944. S2CID 207217210 . 
  40. Plaut, E (2018). "De subespacios principales a componentes principales con autoencoders lineales". arXiv : 1804.10253 [ stat.ML ].
  41. Morales-Forero, A.; Bassetto, S. (diciembre de 2019). «Estudio de caso: una metodología semisupervisada para la detección y el diagnóstico de anomalías». 2019 IEEE International Conference on Industrial Engineering and Engineering Management (IEEM) . Macao, Macao: IEEE. pp. 1031–1037 . doi : 10.1109/IEEM44572.2019.8978509 . ISBN  978-1-7281-3804-6. S2CID 211027131 . 
  42. Sakurada, Mayu; Yairi, Takehisa (diciembre de 2014). "Detección de anomalías mediante autoencoders con reducción de dimensionalidad no lineal" . Actas del segundo taller de MLSDA 2014 sobre aprendizaje automático para el análisis de datos sensoriales . Gold Coast, Queensland, Australia: ACM Press. págs. 4-11 . doi : 10.1145/2689746.2689747 . ISBN  978-1-4503-3159-3. S2CID 14613395 . 
  43. 1 2 3 An, J., & Cho, S. (2015). Detección de anomalías basada en autoencoder variacional utilizando probabilidad de reconstrucción . Conferencia especial sobre IE , 2 , 1-18.
  44. Zhou, Chong; Paffenroth, Randy C. (4 de agosto de 2017). «Detección de anomalías con autoencoders profundos robustos» . Actas de la 23.ª Conferencia Internacional ACM SIGKDD sobre Descubrimiento de Conocimiento y Minería de Datos . ACM. págs. 665–674 . doi : 10.1145/3097983.3098052 . ISBN  978-1-4503-4887-4. S2CID 207557733 . 
  45. Ribeiro, Manasés; Lazzaretti, André Eugenio; Lopes, Heitor Silvério (2018). "Un estudio de codificadores automáticos convolucionales profundos para la detección de anomalías en vídeos". Letras de reconocimiento de patrones . 105 : 13– 22. Código Bib : 2018PaReL.105...13R . doi : 10.1016/j.patrec.2017.07.016 .
  46. Nalisnick, Eric; Matsukawa, Akihiro; Teh, Yee Whye; Gorur, Dilan; Lakshminarayanan, Balaji (2019-02-24). "¿Saben los modelos generativos profundos lo que no saben?". arXiv : 1810.09136 [ stat.ML ].
  47. Xiao, Zhisheng; Yan, Qing; Amit, Yali (2020). "Arrepentimiento de verosimilitud: una puntuación de detección fuera de distribución para un autoencoder variacional" . Advances in Neural Information Processing Systems . 33. arXiv : 2003.02977 .
  48. Theis, Lucas; Shi, Wenzhe; Cunningham, Andrew; Huszár, Ferenc (2017). "Compresión de imágenes con pérdida mediante autoencoders compresivos". arXiv : 1703.00395 [ stat.ML ].
  49. Balle, J; Laparra, V; Simoncelli, EP (abril de 2017). "Compresión de imágenes optimizada de extremo a extremo". Conferencia Internacional sobre Representaciones de Aprendizaje . arXiv : 1611.01704 .
  50. Cho, K. (2013, febrero). La simple esparsificación mejora los autoencoders de eliminación de ruido dispersos en la eliminación de ruido en imágenes altamente corruptas. En Conferencia Internacional sobre Aprendizaje Automático (págs. 432-440).
  51. Cho, Kyunghyun (2013). "Máquinas de Boltzmann y autocodificadores de eliminación de ruido para la eliminación de ruido en imágenes". arXiv : 1301.3468 [ stat.ML ].
  52. Buades, A.; Coll, B.; Morel, JM (2005). "Una revisión de algoritmos de eliminación de ruido de imágenes, con uno nuevo" . Multiscale Modeling & Simulation . 4 (2): 490– 530. doi : 10.1137/040616024 . S2CID 218466166 . 
  53. Gondara, Lovedeep (diciembre de 2016). "Eliminación de ruido en imágenes médicas mediante autoencoders convolucionales". 2016 IEEE 16th International Conference on Data Mining Workshops (ICDMW) . Barcelona, ​​España: IEEE. pp. 241–246 . arXiv : 1608.04667 . Bibcode : 2016arXiv160804667G . doi : 10.1109/ICDMW.2016.0041 . ISBN  9781509059102. S2CID 14354973 . 
  54. Zeng, Kun; Yu, Jun; Wang, Ruxin; Li, Cuihua; Tao, Dacheng (enero de 2017). "Autoencoder profundo acoplado para superresolución de imagen única". IEEE Transactions on Cybernetics . 47 (1): 27– 37. Bibcode : 2017ITCyb..47...27Z . doi : 10.1109/TCYB.2015.2501373 . ISSN 2168-2267 . PMID 26625442 . S2CID 20787612 .   
  55. Tzu-Hsi, Song; Sanchez, Victor; Hesham, EIDaly; Nasir M., Rajpoot (2017). "Autoencoder profundo híbrido con gaussiana de curvatura para la detección de varios tipos de células en imágenes de biopsias de médula ósea". 2017 IEEE 14th International Symposium on Biomedical Imaging (ISBI 2017) . pp. 1040–1043 . doi : 10.1109/ISBI.2017.7950694 . ISBN  978-1-5090-1172-8. S2CID 7433130 . 
  56. Xu, Jun; Xiang, Lei; Liu, Qingshan; Gilmore, Hannah; Wu, Jianzhong; Tang, Jinghai; Madabhushi, Anant (enero de 2016). "Autoencoder disperso apilado (SSAE) para la detección de núcleos en imágenes de histopatología de cáncer de mama" . IEEE Transactions on Medical Imaging . 35 (1): 119– 130. Bibcode : 2016ITMI...35..119X . doi : 10.1109/TMI.2015.2458702 . PMC 4729702. PMID 26208307 .  
  57. Martínez-Murcia, Francisco J.; Ortiz, Andrés; Gorriz, Juan M.; Ramírez, Javier; Castillo-Barnes, Diego (2020). "Estudio de la estructura de variedad de la enfermedad de Alzheimer: un enfoque de aprendizaje profundo utilizando autoencoders convolucionales" . IEEE Journal of Biomedical and Health Informatics . 24 (1): 17– 26. Bibcode : 2020IJBHI..24...17M . doi : 10.1109/JBHI.2019.2914970 . hdl : 10630/28806 . PMID 31217131. S2CID 195187846 .  
  58. Zhavoronkov, Alex (2019). "El aprendizaje profundo permite la identificación rápida de potentes inhibidores de la quinasa DDR1". Nature Biotechnology . 37 (9): 1038– 1040. doi : 10.1038/s41587-019-0224-x . PMID 31477924 . S2CID 201716327 .  
  59. Gregory, Barber. "Una molécula diseñada por IA exhibe cualidades 'similares a las de un fármaco'" . Wired .
  60. De, Shaunak; Maity, Abhishek; Goel, Vritti; Shitole, Sanjay; Bhattacharya, Avik (2017). "Predicción de la popularidad de las publicaciones de Instagram para una revista de estilo de vida mediante aprendizaje profundo". 2017 2nd IEEE International Conference on Communication Systems, Computing and IT Applications (CSCITA) . pp. 174–177 . doi : 10.1109/CSCITA.2017.8066548 . ISBN  978-1-5090-4381-1. S2CID 35350962 . 
  61. Cho, Kyunghyun; Bart van Merrienboer; Bahdanau, Dzmitry; Bengio, Yoshua (2014). "Sobre las propiedades de la traducción automática neuronal: enfoques codificador-decodificador". arXiv : 1409.1259 [ cs.CL ].
  62. Sutskever, Ilya; Vinyals, Oriol; Le, Quoc V. (2014). "Aprendizaje secuencia a secuencia con redes neuronales". arXiv : 1409.3215 [ cs.CL ].
  63. Han, Lifeng; Kuang, Shaohui (2018). "Incorporación de radicales chinos en la traducción automática neuronal: más allá del nivel de caracteres". arXiv : 1805.01565 [ cs.CL ].
  64. Alnaseri, Omar; Alzubaidi, Laith; Himeur, Yassine; Timmermann, Jens (2024). "Una revisión sobre el autoencoder de aprendizaje profundo en el diseño de sistemas de comunicación de próxima generación". arXiv : 2412.13843 [ eess.SP ].