El aprendizaje con un solo ejemplo (one-shot learning) es un problema de aprendizaje automático que utiliza un único ejemplo para la clasificación . Su origen se remonta al campo de la visión artificial, donde se empleaba para la categorización de objetos . Mientras que la mayoría de los métodos de clasificación de aprendizaje automático requieren entrenamiento con cientos o miles de ejemplos, el aprendizaje con un solo ejemplo busca clasificar objetos a partir de un único ejemplo. El aprendizaje con pocos ejemplos (few-shot learning) se utiliza para métodos similares que emplean más de un ejemplo para la clasificación.
Motivación
Se ha demostrado en humanos la capacidad de aprender categorías de objetos a partir de pocos ejemplos y a un ritmo rápido. [ 1 ] [ 2 ] Se estima que un niño aprende casi todas las 10 ~ 30 mil categorías de objetos del mundo a los seis años. [ 3 ] Esto se debe no solo al poder computacional de la mente humana, sino también a su capacidad para sintetizar y aprender nuevas categorías de objetos a partir de información existente sobre diferentes categorías aprendidas previamente. Dados dos ejemplos de dos categorías de objetos: uno, un objeto desconocido compuesto de formas familiares, el segundo, una forma amorfa desconocida; a los humanos les resulta mucho más fácil reconocer el primero que el segundo, lo que sugiere que los humanos utilizan categorías aprendidas previamente al aprender otras nuevas. La motivación clave para resolver el aprendizaje de una sola vez es que los sistemas, al igual que los humanos, pueden usar el conocimiento sobre categorías de objetos para clasificar nuevos objetos. [ 4 ] [ 5 ]
Fondo
Al igual que la mayoría de los esquemas de clasificación , el aprendizaje de una sola muestra implica tres desafíos principales:
- Representación: ¿Cómo deben describirse los objetos y las categorías?
- Aprendizaje: ¿Cómo se pueden crear este tipo de descripciones?
- Reconocimiento: ¿Cómo se puede filtrar un objeto conocido del desorden circundante, independientemente de la oclusión, el punto de vista y la iluminación? [ 6 ]
El aprendizaje de una sola muestra se diferencia del reconocimiento de objetos individuales y de los algoritmos estándar de reconocimiento de categorías en su énfasis en la transferencia de conocimiento, que hace uso de categorías aprendidas previamente.
- Parámetros del modelo: Reutiliza los parámetros del modelo, basándose en la similitud entre categorías antiguas y nuevas. Las categorías se aprenden primero con numerosos ejemplos de entrenamiento, y luego se aprenden nuevas categorías utilizando transformaciones de los parámetros del modelo a partir de esas categorías iniciales o seleccionando parámetros relevantes para un clasificador. [ 7 ]
- Compartición de características: Comparte partes o características de objetos entre categorías. Un algoritmo extrae "información diagnóstica" de parches de categorías ya aprendidas maximizando la información mutua de los parches y luego aplica estas características al aprendizaje de una nueva categoría. Por ejemplo, una categoría de perro puede aprenderse de una sola vez a partir del conocimiento previo de las categorías de caballo y vaca, porque los objetos de perro pueden contener parches distintivos similares. [ 8 ]
- Información contextual: Se basa en el conocimiento global de la escena en la que aparece el objeto. Esta información global puede utilizarse como distribuciones de frecuencia en un marco de campo aleatorio condicional para el reconocimiento de objetos. [ 9 ] Alternativamente, el contexto puede considerar la altura de la cámara y la geometría de la escena. [ 10 ] Los algoritmos de este tipo tienen dos ventajas. Primero, aprenden categorías de objetos relativamente disímiles; y segundo, funcionan bien en situaciones ad hoc donde una imagen no ha sido recortada y alineada manualmente. [ 11 ]
Teoría
El algoritmo de aprendizaje bayesiano de una sola muestra representa el primer plano y el fondo de las imágenes como parametrizados por una mezcla de modelos de constelación. [ 12 ] Durante la fase de aprendizaje, los parámetros de estos modelos se aprenden utilizando un parámetro de densidad conjugada posterior y la expectativa-maximización bayesiana variacional (VBEM). [ 13 ] En esta etapa, las categorías de objetos aprendidas previamente informan la elección de los parámetros del modelo a través de la transferencia por información contextual. Para el reconocimiento de objetos en nuevas imágenes, la distribución posterior obtenida durante la fase de aprendizaje se utiliza en un marco de decisión bayesiano para estimar la razón de p(objeto | prueba, entrenamiento) a p(ruido de fondo | prueba, entrenamiento), donde p es la probabilidad del resultado. [ 14 ]
Marco bayesiano
Dada la tarea de encontrar un objeto específico en una imagen de consulta, el objetivo general del algoritmo de aprendizaje bayesiano de una sola muestra es comparar la probabilidad de que el objeto esté presente con la probabilidad de que solo haya ruido de fondo. Si la primera probabilidad es mayor, el algoritmo indica la presencia del objeto; de lo contrario, indica su ausencia. Para calcular estas probabilidades, la clase de objeto debe modelarse a partir de un conjunto de (1 a 5) imágenes de entrenamiento que contengan ejemplos.
Para formalizar estas ideas, dejemossea la imagen de consulta, que contiene un ejemplo de la categoría de primer planoo simplemente desorden de fondo de una categoría de fondo genérica. También dejaser el conjunto de imágenes de entrenamiento utilizadas como categoría de primer plano. La decisión de sicontiene un objeto de la categoría de primer plano, o solo desorden de la categoría de fondo es:
donde las posteriores de la claseyhan sido ampliados por el teorema de Bayes , lo que produce una razón de probabilidades y una razón de probabilidades a priori de la categoría del objeto . Decidimos que la imagencontiene un objeto de la clase de primer plano sisupera cierto umbralA continuación, introducimos modelos paramétricos para las categorías de primer plano y fondo con parámetrosyrespectivamente. Este modelo paramétrico de primer plano se aprende durante la etapa de aprendizaje a partir de, así como información previa de categorías aprendidas. El modelo de fondo que asumimos es uniforme en todas las imágenes. Omitiendo la proporción constante de priors de categoría,y parametrizando sobreyrendimientos
- habiéndose simplificadoyay
La distribución posterior de los parámetros del modelo dadas las imágenes de entrenamiento,se estima en la fase de aprendizaje. En esta estimación, el aprendizaje de una sola vez difiere marcadamente de los modelos de estimación bayesiana más tradicionales que aproximan la integral comoEn cambio, utiliza un enfoque variacional que emplea información previa de categorías aprendidas con anterioridad. Sin embargo, para el modelo de fondo y las categorías aprendidas previamente mediante entrenamiento, se utiliza la estimación tradicional de máxima verosimilitud de los parámetros del modelo. [ 15 ]
modelo de categoría de objeto
Para cada imagen de consultaimágenes de entrenamiento, se utiliza un modelo de constelación para la representación. [ 12 ] [ 16 ] [ 17 ] Para obtener este modelo para una imagen dada, primero se detecta un conjunto de N regiones interesantes en la imagen utilizando el detector de prominencia de Kadir-Brady . [ 18 ] Cada región seleccionada está representada por una ubicación en la imagen,y una descripción de su aspecto,AlquileryyLas representaciones análogas para las imágenes de entrenamiento, la expresión para R se convierte en:
Las probabilidadesyse representan como mezclas de modelos de constelación. Un modelo de constelación típico tiene P (3 ~ 7) partes, con N (~100) regiones de interés. Por lo tanto, un vector h de P dimensiones asigna una región de interés (de entre N regiones) a cada parte del modelo (para P partes). Así, h denota una hipótesis (una asignación de regiones de interés a las partes del modelo) para el modelo y un modelo de constelación completo se representa sumando sobre todas las hipótesis posibles h en el espacio de hipótesis.Finalmente, se escribe la probabilidad.
Los diferentesLas s representan diferentes configuraciones de partes, mientras que las diferentes hipótesis h representan diferentes asignaciones de regiones a las partes, dado un modelo de partes.. La suposición de que la forma del modelo (tal como está representada porLa colección de ubicaciones de las partes y la apariencia son independientes, lo que permite considerar la expresión de probabilidad.como dos probabilidades separadas de apariencia y forma. [ 19 ]
Apariencia
La apariencia de cada característica está representada por un punto en el espacio de apariencia (que se analiza más adelante en la implementación). "Cada parteEn el modelo de constelación, existe una densidad gaussiana dentro de este espacio con parámetros de media y precisión.." A partir de estos, la probabilidad de aparición descrita anteriormente se calcula como un producto de gaussianas sobre las partes del modelo para una hipótesis h y un componente de mezcla dados.. [ 20 ]
Forma
La forma del modelo para un componente de mezcla dadoy la hipótesis h se representa como una densidad gaussiana conjunta de las ubicaciones de las características. Estas características se transforman en un espacio invariante a escala y traslación antes de modelar la ubicación relativa de las partes mediante una gaussiana 2(P - 1) dimensional. A partir de esto, obtenemos la probabilidad de forma, completando nuestra representación dePara reducir el número de hipótesis en el espacio de hipótesis, solo se consideran aquellas hipótesis que satisfacen la restricción de ordenación de que la coordenada x de cada parte es monótonamente creciente. Esto eliminahipótesis de. [ 20 ]
Densidades conjugadas
Para calcular, la integraldebe evaluarse, pero es analíticamente intratable. El modelo de categoría de objetos anterior proporciona información sobre, por lo tanto, lo que queda es examinar, la parte posterior dey encontrar una aproximación suficiente para que la integral sea manejable. Trabajos anteriores aproximan la distribución posterior mediante unafunción centrada en, colapsando la integral en cuestión en. Estenormalmente se estima utilizando una máxima verosimilitud () o máxima a posteriori () procedimiento. Sin embargo, debido a que en el aprendizaje de una sola vez se utilizan pocos ejemplos de entrenamiento, la distribución no tendrá un pico bien definido, como se supone en unaproximación de función. Por lo tanto, en lugar de esta aproximación tradicional, el algoritmo de aprendizaje bayesiano de una sola vez busca "encontrar una forma paramétrica dede tal manera que el aprendizaje dees factible". El algoritmo emplea una distribución Normal - Wishart como distribución a priori conjugada dey en la fase de aprendizaje, se utilizan métodos bayesianos variacionales con la misma complejidad computacional que los métodos de máxima verosimilitud para aprender los hiperparámetros de la distribución. Luego, dado quees un producto de gaussianas, como se eligió en el modelo de categoría de objetos, la integral se reduce a una distribución t de Student multivariada , que puede evaluarse. [ 21 ]
Implementación
Detección y representación de características
Para detectar características en una imagen de modo que pueda representarse mediante un modelo de constelación, se utiliza el detector de prominencia de Kadir-Brady en imágenes en escala de grises, encontrando regiones prominentes de la imagen. Estas regiones se agrupan, lo que produce una serie de características (los grupos) y el parámetro de forma., compuesto por los centros de los cúmulos. Se eligió el detector Kadir-Brady porque produce menos regiones, pero más prominentes, a diferencia de los detectores de características como el Harris multiescala, que produce numerosas regiones menos significativas.
Luego, las regiones se toman de la imagen y se reescalan a un pequeño parche de 11 × 11 píxeles, lo que permite que cada parche se represente en un espacio de 121 dimensiones. Esta dimensionalidad se reduce utilizando el análisis de componentes principales y, el parámetro de apariencia, se forma a partir de los primeros 10 componentes principales de cada parche. [ 22 ]
Aprendiendo
Para obtener información previa sobre la forma y la apariencia, se aprenden tres categorías (gatos manchados, caras y aviones) mediante la estimación de máxima verosimilitud. Estos parámetros del modelo de categoría de objetos se utilizan posteriormente para estimar los hiperparámetros de la información previa deseada.
Dado un conjunto de ejemplos de entrenamiento, el algoritmo ejecuta el detector de características en estas imágenes y determina los parámetros del modelo a partir de las regiones más relevantes. El índice de hipótesis h que asigna características a las partes impide una solución analítica del modelo lineal, por lo que la distribución posteriorse estima mediante el algoritmo variacional bayesiano de expectativa-maximización, que se ejecuta hasta la convergencia de parámetros después de aproximadamente 100 iteraciones. Aprender una categoría de esta manera lleva menos de un minuto en una máquina de 2,8 GHz con un modelo de 4 partes y < 10 imágenes de entrenamiento. [ 23 ]
Resultados experimentales
Ejemplo de motocicleta
Para conocer la categoría de motocicletas:
- Se seleccionan seis imágenes de entrenamiento de la categoría de motocicletas del conjunto de datos Caltech 4 y se aplica el detector Kadir-Brady, lo que da como resultadoy a través de PCA ,.
- A continuación, se calculan los parámetros del modelo previo a partir de 30 modelos., 10 de cada una de las tres categorías aprendidas: gatos manchados, caras y aviones. Este conocimiento previo codifica la idea de que "los modelos que carecen de consistencia visual [es decir, desorden de fondo] ocupan una parte diferente del espacio de parámetros [que] los modelos coherentes".
- En el aprendizaje, que se realiza a continuación, el conocimiento previo influye en el conocimiento posterior.hacia partes del espacio de parámetros correspondientes a modelos coherentes. Solo se utiliza un componente de la mezcla, lo que permiteLa estimación de la distribución posterior se muestra a continuación.
- Finalmente, las figuras que se muestran a continuación ilustran el modelo de motocicleta estudiado, con la forma y el aspecto de sus partes, y las características correspondientes.
- Para las pruebas de reconocimiento, el modelo anterior se aplica a 50 imágenes que contienen motocicletas y 50 que no. La imagen inferior muestra una curva ROC, que mide la probabilidad de detección frente a la probabilidad de falsos positivos, así como algunos ejemplos reconocidos.
Densidades compartidas en transformaciones
Otro algoritmo utiliza la transferencia de conocimiento mediante parámetros del modelo para aprender una nueva categoría de objeto que es similar en apariencia a categorías aprendidas previamente. Una imagen se representa como una textura y forma, o como una imagen latente que ha sido transformada, denotada por.
Una red neuronal siamesa trabaja en tándem sobre dos vectores de entrada diferentes para calcular vectores de salida comparables. [ 24 ]
Coagulación
En este contexto, la coagulación es "la vectorización simultánea de cada una de las imágenes de un conjunto entre sí". Para un conjunto de imágenes de entrenamiento de una determinada categoría, la coagulación transforma iterativamente cada imagen para minimizar las entropías conjuntas de píxeles E de las imágenes, donde
"dóndees la variable aleatoria binaria definida por los valores de un píxel particular p en todas las imágenes,es la función de entropía discreta de esa variable, yes el conjunto de índices de píxeles de la imagen."
El algoritmo de coagulación comienza con un conjunto de imágenes.y una matriz de transformación correspondiente, que al final del algoritmo representará la transformación deen su latente. Estos latentesminimizar las entropías conjuntas a nivel de píxel. Por lo tanto, la tarea del algoritmo de coagulación es estimar las transformaciones.
Esquema del algoritmo:
- Inicializara la identidad.
- Calcula las entropías conjuntas píxel a píxel del conjunto actual de imágenes.
- Para cada imageniterar a través de todas las transformaciones afines posibles(rotación, traslación en x, traslación en y, escala en x, escala en y, cizallamiento en x, cizallamiento en y) y prueba sidisminuye las entropías conjuntas por píxel. Si es así, configure.
- Repita el paso anterior hasta que converja.
Al final del algoritmo,, ytransforma la imagen latente de nuevo en la imagen observada originalmente. [ 25 ]
Clasificación
Para utilizar este modelo para la clasificación, debe estimarse con la probabilidad posterior máxima dada una imagen observada.. Aplicando la regla de Bayes ay parametrización por la transformaciónda una integral difícil que debe aproximarse, y luego la mejor transformaciónSe debe encontrar (aquello que mapea la imagen de prueba a su imagen latente). Una vez que se encuentra esta transformación, la imagen de prueba se puede transformar en su latente, y un clasificador de vecino más cercano basado en la distancia de Hausdorff entre imágenes puede clasificar la latente (y por lo tanto la imagen de prueba) como perteneciente a una clase particular..
Para encontrarLa imagen de prueba I se inserta en el conjunto de entrenamiento para el proceso de coagulación. Dado que la imagen de prueba se extrae de una de las categorías, la coagulación proporciona una correspondienteque mapea I a su latente. El latente puede entonces ser clasificado. [ 26 ]
Clasificación de ejemplo único
Dado un conjunto de transformacionesobtenido al coagular muchas imágenes de una determinada categoría, el clasificador se puede extender al caso en el que solo se entrenaejemplo de una nueva categoríaEstá permitido. Aplicando todas las transformacionessecuencialmente acrea un conjunto de entrenamiento artificial paraEste conjunto de datos artificiales se puede ampliar tomando prestadas transformaciones de muchas categorías ya conocidas. Una vez obtenido este conjunto de datos,, una instancia de prueba de, se puede clasificar como en el procedimiento de clasificación normal. El supuesto clave es que las categorías son lo suficientemente similares como para que las transformaciones de una se puedan aplicar a otra. [ 27 ]
Véase también
Citas
- ↑ Li, Fergus y Perona 2002. Error de sfn: no hay destino: CITEREFLiFergusPerona2002 ( ayuda )
- ^ Thorpe, Fize y Marlot 1996 .
- ↑ Biederman 1987 .
- ^ Li, Fergus y Perona 2006 , Sección 1.
- ↑ Li 2006 , Sección 1.
- ^ Li, Fergus y Perona 2006 , Sección 2.
- ↑ Fink 2004 .
- ↑ Bart y Ullman 2005 .
- ↑ Murphy y otros 2004. Error de sfn: no hay destino: CITEREFMurphyet_al2004 ( ayuda )
- ↑ Hoiem, Efros y Herbert 2005 .
- ↑ Li 2006 , Sección 2.
- 1 2 Burl y otros 1996 . sfn error: no hay destino: CITEREFBurlet_al1996 ( ayuda )
- ↑ Attias 1999 .
- ^ Li y et al 2006 . Error sfn: sin destino: CITEREFLiet_al2006 ( ayuda )
- ^ Li, Fergus y Perona 2006 , Sección 3.1.
- ↑ Weber, Welling y Perona 2000 .
- ^ Fergus, Perona y Zisserman 2003 .
- ↑ Kadir y Brady 2001 .
- ^ Li, Fergus y Perona 2006 , Sección 3.2.
- ^ Li , Fergus y Perona 2006 , Sección 3.2.1.
- ^ Li, Fergus y Perona 2006 , Sección 3.4.3.
- ^ Li, Fergus y Perona 2006 , Sección 5.1.
- ^ Li, Fergus y Perona 2006 , Secciones 4, 5.2.
- ↑ Aprendizaje con pocos ejemplos (2/3): Redes siamesas . YouTube . Archivado del original el 10/12/2021.
- ↑ Miller et al .
- ^ Miller, Matsakis y Viola 2000 , Sección 4.
- ^ Miller, Matsakis y Viola 2000 , Sección 7.
Referencias
- Li, Fei Fei (2006). "Transferencia de conocimiento en el aprendizaje para reconocer clases de objetos visuales" (PDF) . Conferencia Internacional sobre Desarrollo y Aprendizaje (ICDL) .
- Li, Fei Fei; Fergus, R.; Perona, P. (2006). "Aprendizaje de categorías de objetos con una sola muestra" ( PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 28 (4): 594– 611. doi : 10.1109/TPAMI.2006.79 . PMID 16566508. S2CID 6953475 .
- Miller; Matsakis; Viola (2000). "Aprendizaje a partir de un ejemplo mediante densidades compartidas en transformaciones" (PDF) . Actas de Visión por Computadora y Reconocimiento de Patrones .
- Li, FF; VanRullen, R.; Coch, C.; Perona, P. (2002). "Categoría rápida de escenas naturales en casi ausencia de atención" . PNAS . 99 ( 14): 9596– 9601. Bibcode : 2002PNAS...99.9596L . doi : 10.1073/pnas.092277599 . PMC 123186. PMID 12077298 .
- Thorpe, S.; Fize, D.; Marlot, C. (1996). "Velocidad de procesamiento en el sistema visual humano" ( PDF) . Nature . 381 (6582): 520– 522, 1996. Bibcode : 1996Natur.381..520T . doi : 10.1038/381520a0 . PMID 8632824. S2CID 4303570 .
- Biederman, I. (1987). "Reconocimiento por componentes: una teoría de la comprensión humana" (PDF) . Psychological Review . 94 (2): 115– 147. doi : 10.1037/0033-295X.94.2.115 . PMID 3575582. Archivado del original (PDF) el 29/11/2022 . Consultado el 21/11/2021 .
- Fink, M. (2004). "Clasificación de objetos a partir de un solo ejemplo utilizando pseudométricas de relevancia de clase". NIPS . CiteSeerX 10.1.1.91.7461 .
- Bart; Ullman (2005). "Generalización cruzada: aprendizaje de clases novedosas a partir de un solo ejemplo mediante reemplazo de características" (PDF) . CVPR . Archivado del original (PDF) el 6 de diciembre de 2022. Recuperado el 21 de noviembre de 2021 .
- Murphy, K.; Torralba, A.; Freeman, WT (2004). "Usando el bosque para ver los árboles: un modelo gráfico que relaciona características, objetos y escenas" (PDF) . NIPS .
- Hoiem, D.; Efros, AA; Herbert, M. (2005). "Contexto geométrico a partir de una sola imagen" (PDF) . ICCV .
- Attias, H. (1999). "Inferencia de parámetros y estructura de modelos de variables latentes mediante Bayes variacional". Actas de la 15.ª Conferencia sobre Incertidumbre en Inteligencia Artificial : 21–30 . arXiv : 1301.6676 .
- Burl, M.; Weber, M.; Perona, P. (1996). "Un enfoque probabilístico para el reconocimiento de objetos mediante fotometría local y geometría global" (PDF) . Actas de la Conferencia Europea de Visión por Computadora . Lecture Notes in Computer Science. 1407 : 628–641 . doi : 10.1007/BFb0054769 . ISBN 978-3-540-64613-6.
- Fergus, R.; Perona, P.; Zisserman, A. (2003). "Reconocimiento de clases de objetos mediante aprendizaje no supervisado invariante a escala" (PDF) . Actas de Visión por Computadora y Reconocimiento de Patrones : 264–271 .
- Weber, M.; Welling, M.; Perona, P. (2000). «Aprendizaje no supervisado de modelos para el reconocimiento» (PDF) . Actas de la Conferencia Europea de Visión por Computadora . Lecture Notes in Computer Science. 1842 : 101–108 . doi : 10.1007/3-540-45054-8_2 . ISBN 978-3-540-67685-0.
- Kadir, T.; Brady, M. (2001). "Escala, prominencia y descripción de imágenes" . Revista Internacional de Visión por Computadora . 45 (2): 83– 105. doi : 10.1023/A:1012460413855 . S2CID 825395 .
- visión por computadora
- algoritmos de aprendizaje automático