
El aprendizaje de cero disparos ( ZSL , por sus siglas en inglés ) es un problema planteado en el aprendizaje automático donde, durante la fase de prueba, un algoritmo observa muestras de clases que no se observaron durante el entrenamiento y necesita predecir su clase. El nombre es un juego de palabras basado en el concepto anterior de aprendizaje de un solo disparo en visión artificial , en el que la clasificación se aprende a partir de un solo ejemplo.
Los métodos de aprendizaje de cero disparos generalmente funcionan asociando clases observadas y no observadas a través de información auxiliar que codifica propiedades distintivas observables de los objetos. [ 1 ] Por ejemplo, dado un conjunto de imágenes de animales para clasificar, junto con descripciones textuales auxiliares de cómo se ven los animales, un modelo que ha sido entrenado para reconocer caballos, pero que nunca ha visto una cebra, aún puede reconocer una cebra cuando también sabe que las cebras se parecen a los caballos rayados. Este problema se estudia ampliamente en visión por computadora , procesamiento del lenguaje natural y percepción automática . [ 2 ]
Antecedentes e historia
El primer artículo sobre aprendizaje de cero disparos en procesamiento del lenguaje natural apareció en un artículo de 2008 de Chang, Ratinov, Roth y Srikumar, en la AAAI'08 , pero el nombre que se le dio al paradigma de aprendizaje allí fue clasificación sin datos . [ 3 ] El primer artículo sobre aprendizaje de cero disparos en visión por computadora apareció en la misma conferencia, bajo el nombre de aprendizaje de cero datos . [ 4 ] El término aprendizaje de cero disparos en sí apareció por primera vez en la literatura en un artículo de 2009 de Palatucci, Hinton, Pomerleau y Mitchell en NIPS'09 . [ 5 ] Esta terminología se repitió más tarde en otro artículo de visión por computadora [ 6 ] y el término aprendizaje de cero disparos se popularizó, como una derivación del aprendizaje de un solo disparo que se introdujo en visión por computadora años antes. [ 7 ]
En visión artificial, los modelos de aprendizaje de cero disparos aprenden parámetros para las clases vistas junto con sus representaciones de clase y se basan en la similitud de representación entre las etiquetas de clase para que, durante la inferencia, las instancias puedan clasificarse en nuevas clases.
In natural language processing, the key technical direction developed builds on the ability to "understand the labels"—represent the labels in the same semantic space as that of the documents to be classified. This supports the classification of a single example without observing any annotated data, the purest form of zero-shot classification. The original paper[3] made use of the Explicit Semantic Analysis (ESA) representation but later papers made use of other representations, including dense representations. This approach was also extended to multilingual domains,[8][9] fine entity typing[10] and other problems. Moreover, beyond relying solely on representations, the computational approach has been extended to depend on transfer from other tasks, such as textual entailment[11] and question answering.[12]
The original paper[3] also points out that, beyond the ability to classify a single example, when a collection of examples is given, with the assumption that they come from the same distribution, it is possible to bootstrap the performance in a semi-supervised like manner (or transductive learning).
Unlike standard generalization in machine learning, where classifiers are expected to correctly classify new samples to classes they have already observed during training, in ZSL, no samples from the classes have been given during training the classifier. It can therefore be viewed as an extreme case of domain adaptation.
Prerequisite information for zero-shot classes
Naturally, some form of auxiliary information has to be given about these zero-shot classes, and this type of information can be of several types.
- Learning with attributes: classes are accompanied by pre-defined structured description. For example, for bird descriptions, this could include "red head", "long beak".[6][13] These attributes are often organized in a structured compositional way, and taking that structure into account improves learning.[14] While this approach was used mostly in computer vision, there are some examples for it also in natural language processing.[15]
- Learning from textual description. As pointed out above, this has been the key direction pursued in natural language processing. Here class labels are taken to have a meaning and are often augmented with definitions or free-text natural-language description. This could include for example a Wikipedia description of the class.[10][16][17]
- Class-class similarity. Here, classes are embedded in a continuous space. A zero-shot classifier can predict that a sample corresponds to some position in that space, and the nearest embedded class is used as a predicted class, even if no such samples were observed during training.[18]
Generalized zero-shot learning
The above ZSL setup assumes that at test time, only zero-shot samples are given, namely, samples from new unseen classes. In generalized zero-shot learning, samples from both new and known classes may appear at test time. This poses new challenges for classifiers at test time, because it is very challenging to estimate if a given sample is new or known. Some approaches to handle this include:
- a gating module, which is first trained to decide if a given sample comes from a new class or from an old one, and then, at inference time, outputs either a hard decision,[19] or a soft probabilistic decision[20]
- a generative module, which is trained to generate feature representations of the unseen classes—a standard classifier can then be trained on samples from all classes, seen and unseen.[21]
Domains of application
Zero shot learning has been applied to the following fields:
See also
References
- ↑Xian, Yongqin; Lampert, Christoph H.; Schiele, Bernt; Akata, Zeynep (2019-09-01). "Zero-Shot Learning—A Comprehensive Evaluation of the Good, the Bad and the Ugly". IEEE Transactions on Pattern Analysis and Machine Intelligence. 41 (9): 2251–2265. Bibcode:2019ITPAM..41.2251X. doi:10.1109/TPAMI.2018.2857768. ISSN 0162-8828. PMID 30028691.
- ↑ Xian, Yongqin; Schiele, Bernt; Akata, Zeynep (2017). "Aprendizaje de cero disparos: lo bueno, lo malo y lo feo". Conferencia IEEE de 2017 sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) . págs. 3077–3086 . arXiv : 1703.04394 . Bibcode : 2017cvpr.conf..328X . doi : 10.1109/CVPR.2017.328 . ISBN 978-1-5386-0457-1.
- 1 2 3 Chang, MW (2008). "Importancia de la representación semántica: clasificación sin datos" . AAAI .
- ↑ Larochelle, Hugo (2008). "Aprendizaje de nuevas tareas sin datos previos" (PDF) .
- ↑ Palatucci, Mark (2009). "Aprendizaje de cero disparos con códigos de salida semánticos" (PDF) . NIPS .
- 1 2 Lampert, CH (2009). "Aprendizaje para detectar clases de objetos no vistas mediante transferencia de atributos entre clases" . Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones : 951–958 . CiteSeerX 10.1.1.165.9750 .
- ↑ Miller, EG (2000). "Aprendizaje a partir de un ejemplo mediante densidades compartidas en transformaciones" (PDF) . Actas de la Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones. CVPR 2000 (Cat. No. PR00662) . Vol. 1. pág. 120. Bibcode : 2000cvpr....1..120M . doi : 10.1109/CVPR.2000.855856 . ISBN 0-7695-0662-3.
- ↑ Song, Yangqiu (2019). "Hacia la clasificación temática de documentos textuales sin entrenamiento previo en cualquier idioma" . Inteligencia Artificial . 274 : 133–150 . doi : 10.1016/j.artint.2019.02.002 .
- ↑ Song, Yangqiu (2016). "Clasificación sin datos interlingüística para muchos idiomas" (PDF) . IJCAI .
- 1 2 Zhou, Ben (2018). "Zero-Shot Open Entity Typing as Type-Compatible Grounding" (PDF) . EMNLP . arXiv : 1907.03228 .
- ↑ Yin, Wenpeng (2019). "Benchmarking Zero-shot Text Classification: Datasets, Evaluation and Entailment Approach" (PDF) . EMNLP . arXiv : 1909.00161 .
- ↑ Levy, Omer (2017). "Extracción de relaciones sin datos previos mediante comprensión lectora" (PDF) . CoNLL . arXiv : 1706.04115 .
- ↑ Romera-Paredes, Bernardino; Torr, Phillip (2015). "Un enfoque sorprendentemente simple para el aprendizaje de cero disparos" (PDF) . Conferencia Internacional sobre Aprendizaje Automático : 2152–2161 . Archivado del original (PDF) el 13 de marzo de 2017. Consultado el 11 de junio de 2020 .
- ↑ Atzmon, Yuval; Chechik, Gal (2018). "Agrupación probabilística de atributos AND-OR para aprendizaje de cero disparos" (PDF) . Incertidumbre en inteligencia artificial . arXiv : 1806.02664 . Bibcode : 2018arXiv180602664A .
- ↑ Roth, Dan (2009). "Categorización de texto guiada por aspectos con etiquetas no observadas" . ICDM . Bibcode : 2009icdm.conf..128R . CiteSeerX 10.1.1.148.9946 .
- ↑ Hu, R Lily; Xiong, Caiming; Socher, Richard (2018). "Clasificación de imágenes sin entrenamiento guiado por descripciones de clases en lenguaje natural: un enfoque de metaaprendizaje" (PDF) . NeurIPS .
- ↑ Srivastava, Shashank; Labutov, Igor; Mitchelle, Tom (2018). "Aprendizaje de clasificadores sin entrenamiento previo a partir de la cuantificación del lenguaje natural". Actas de la 56.ª Reunión Anual de la Asociación de Lingüística Computacional (Volumen 1: Artículos extensos) . pp. 306–316 . doi : 10.18653/v1/P18-1029 .
- ↑ Frome, Andrea; et, al (2013). "Devise: Un modelo de incrustación visual-semántica profunda" (PDF) . Advances in Neural Information Processing Systems : 2121–2129 .
- ↑ Socher, R; Ganjoo, M; Manning, CD; Ng, A. (2013). "Aprendizaje de cero disparos mediante transferencia intermodal". Neural Information Processing Systems . arXiv : 1301.3666 . Bibcode : 2013arXiv1301.3666S .
- ↑ Atzmon, Yuval (2019). "Adaptive Confidence Smoothing for Generalized Zero-Shot Learning". The IEEE Conference on Computer Vision and Pattern Recognition : 11671–11680 . arXiv : 1812.09903 . Bibcode : 2018arXiv181209903A .
- ↑ Felix, R; et, al (2018). "Aprendizaje generalizado de cero disparos con consistencia cíclica multimodal". Actas de la Conferencia Europea sobre Visión por Computadora : 21–37 . arXiv : 1808.00136 . Bibcode : 2018arXiv180800136F .
- ↑ Wittmann, Bruce J.; Yue, Yisong; Arnold, Frances H. (2021). "El diseño informado del conjunto de entrenamiento permite una evolución dirigida de proteínas asistida por aprendizaje automático eficiente". Cell Systems . 12 (11): 1026–1045.e7. bioRxiv 10.1101/2020.12.04.408955 . doi : 10.1016/j.cels.2021.07.008 . PMID 34416172 .
- ↑ Barak, Tomer; Loewenstein, Yonatan (2024-11-08). "Las redes neuronales no entrenadas pueden demostrar razonamiento abstracto independiente de la memorización" . Scientific Reports . 14 (1): 27249. arXiv : 2407.17791 . Bibcode : 2024NatSR..1427249B . doi : 10.1038/ s41598-024-78530 -z . PMC 11549345. PMID 39516540 .
- algoritmos de aprendizaje automático
- visión por computadora
- Procesamiento del lenguaje natural
- Inteligencia artificial