Articulo de referencia

Incrustaciones de palabras

Ilustración de la representación vectorial de palabras. Cada palabra es un punto en un espacio determinado. Esta representación permite a un procesador realizar operaciones semá...

Ilustración de la representación vectorial de palabras. Cada palabra es un punto en un espacio determinado. Esta representación permite a un procesador realizar operaciones semánticas, como obtener la capital de un país.

En el procesamiento del lenguaje natural , una incrustación de palabra es una representación de una palabra. La incrustación se utiliza en el análisis de texto . Normalmente, la representación es un vector de valores reales que codifica el significado de la palabra de tal manera que se espera que las palabras que están más cerca en el espacio vectorial tengan significados similares. [ 1 ] Las incrustaciones de palabras se pueden obtener utilizando técnicas de modelado del lenguaje y aprendizaje de características , donde las palabras o frases del vocabulario se asignan a vectores de números reales .

Los métodos para generar este mapeo incluyen redes neuronales , [ 2 ] reducción de dimensionalidad en la matriz de coocurrencia de palabras , [ 3 ] [ 4 ] [ 5 ] modelos probabilísticos, [ 6 ] método de base de conocimiento explicable, [ 7 ] y representación explícita en términos del contexto en el que aparecen las palabras. [ 8 ]

Se ha demostrado que las incrustaciones de palabras y frases, cuando se utilizan como representación de entrada subyacente, mejoran el rendimiento en tareas de PLN como el análisis sintáctico [ 9 ] y el análisis de sentimientos . [ 10 ]

Desarrollo e historia del enfoque

En la semántica distribucional , un enfoque metodológico cuantitativo para comprender el significado en el lenguaje observado, los modelos de incrustación de palabras o de espacio de características semánticas se han utilizado como representación del conocimiento durante algún tiempo. [ 11 ] Dichos modelos buscan cuantificar y categorizar las similitudes semánticas entre elementos lingüísticos basándose en sus propiedades distribucionales en grandes muestras de datos lingüísticos. La idea subyacente de que "una palabra se caracteriza por la compañía que frecuenta" fue propuesta en un artículo de 1957 por John Rupert Firth , [ 12 ] pero también tiene raíces en el trabajo contemporáneo sobre sistemas de búsqueda [ 13 ] y en la psicología cognitiva. [ 14 ]

La noción de un espacio semántico con elementos léxicos (palabras o términos multipalabra) representados como vectores o incrustaciones se basa en los desafíos computacionales de capturar características distribucionales y utilizarlas para la aplicación práctica para medir la similitud entre palabras, frases o documentos completos. La primera generación de modelos de espacio semántico es el modelo de espacio vectorial para la recuperación de información. [ 15 ] [ 16 ] [ 17 ] Estos modelos de espacio vectorial para palabras y sus datos distribucionales implementados en su forma más simple dan como resultado un espacio vectorial muy disperso de alta dimensionalidad (cf. maldición de la dimensionalidad ). La reducción del número de dimensiones utilizando métodos algebraicos lineales como la descomposición en valores singulares condujo a la introducción del análisis semántico latente a finales de la década de 1980 y el enfoque de indexación aleatoria para recopilar contextos de coocurrencia de palabras. [ 18 ] [ 19 ] [ 20 ] [ 21 ] En 2000, Bengio et al. proporcionado en una serie de artículos titulados "Modelos de lenguaje probabilísticos neuronales" para reducir la alta dimensionalidad de las representaciones de palabras en contextos mediante "el aprendizaje de una representación distribuida para las palabras". [ 22 ] [ 23 ] [ 24 ]

Un estudio publicado en NeurIPS (NIPS) 2002 introdujo el uso de incrustaciones de palabras y documentos aplicando el método de CCA de kernel a corpus bilingües (y multilingües), proporcionando también un ejemplo temprano de aprendizaje autosupervisado de incrustaciones de palabras. [ 25 ]

Las incrustaciones de palabras vienen en dos estilos diferentes, uno en el que las palabras se expresan como vectores de palabras que coocurren, y otro en el que las palabras se expresan como vectores de contextos lingüísticos en los que aparecen; estos diferentes estilos se estudian en Lavelli et al., 2004. [ 26 ] Roweis y Saul publicaron en Science cómo usar la " incrustación lineal local " (LLE) para descubrir representaciones de estructuras de datos de alta dimensión. [ 27 ] La mayoría de las nuevas técnicas de incrustación de palabras después de aproximadamente 2005 se basan en una arquitectura de red neuronal en lugar de modelos más probabilísticos y algebraicos, después del trabajo fundamental realizado por Yoshua Bengio [ 28 ] y colegas. [ 29 ] [ 30 ]

Este enfoque ha sido adoptado por muchos grupos de investigación tras los avances teóricos realizados en 2010 sobre la calidad de los vectores y la velocidad de entrenamiento del modelo, así como después de que los avances en hardware permitieran explorar un espacio de parámetros más amplio de forma rentable. En 2013, un equipo de Google liderado por Tomas Mikolov creó word2vec , un conjunto de herramientas de incrustación de palabras que puede entrenar modelos de espacio vectorial más rápido que los enfoques anteriores. El enfoque word2vec se ha utilizado ampliamente en experimentación y fue fundamental para despertar el interés por las incrustaciones de palabras como tecnología, desplazando la línea de investigación de la investigación especializada a la experimentación más amplia y, finalmente, allanando el camino para la aplicación práctica. [ 31 ]

Polisemia y homonimia

Históricamente, una de las principales limitaciones de los modelos de incrustaciones de palabras estáticas o de espacio vectorial de palabras es que las palabras con múltiples significados se fusionan en una sola representación (un solo vector en el espacio semántico). En otras palabras, la polisemia y la homonimia no se manejan adecuadamente. Por ejemplo, en la oración "¡El club que probé ayer fue genial!", no está claro si el término " club" se relaciona con el significado de " sándwich club" , "casa club " , " palo de golf" o cualquier otro significado que pueda tener. La necesidad de acomodar múltiples significados por palabra en diferentes vectores (incrustaciones multisensoriales) es la motivación de varias contribuciones en PLN para dividir las incrustaciones monosensoriales en multisensoriales. [ 32 ] [ 33 ]

La mayoría de los enfoques que producen incrustaciones multisentido se pueden dividir en dos categorías principales para su representación del sentido de las palabras, es decir, no supervisadas y basadas en el conocimiento. [ 34 ] Basado en word2vec skip-gram, Multi-Sense Skip-Gram (MSSG) [ 35 ] realiza discriminación de sentido de palabra e incrustación simultáneamente, mejorando su tiempo de entrenamiento, mientras asume un número específico de sentidos para cada palabra. En Non-Parametric Multi-Sense Skip-Gram (NP-MSSG) este número puede variar dependiendo de cada palabra. Combinando el conocimiento previo de bases de datos léxicas (por ejemplo, WordNet , ConceptNet , BabelNet ), incrustaciones de palabras y desambiguación de sentido de palabra , Most Suitable Sense Annotation (MSSA) [ 36 ] etiqueta los sentidos de las palabras a través de un enfoque no supervisado y basado en el conocimiento, considerando el contexto de una palabra en una ventana deslizante predefinida. Una vez desambiguadas las palabras, se pueden utilizar en una técnica estándar de incrustación de palabras, lo que produce incrustaciones multisentimentales. La arquitectura MSSA permite que el proceso de desambiguación y anotación se realice de forma recurrente y con auto-mejora. [ 37 ]

Se sabe que el uso de incrustaciones multisensoriales mejora el rendimiento en varias tareas de PLN, como el etiquetado de partes del discurso , la identificación de relaciones semánticas, la relación semántica , el reconocimiento de entidades nombradas y el análisis de sentimientos. [ 38 ] [ 39 ]

A finales de la década de 2010, se desarrollaron incrustaciones contextualmente significativas como ELMo y BERT . [ 40 ] A diferencia de las incrustaciones de palabras estáticas, estas incrustaciones se encuentran a nivel de token, ya que cada ocurrencia de una palabra tiene su propia incrustación. Estas incrustaciones reflejan mejor la naturaleza multisensorial de las palabras, porque las ocurrencias de una palabra en contextos similares se sitúan en regiones similares del espacio de incrustación de BERT. [ 41 ] [ 42 ]

Para secuencias biológicas: BioVectors

Asgari y Mofrad propusieron incrustaciones de palabras para n- gramas en secuencias biológicas (por ejemplo, ADN , ARN y proteínas ) para aplicaciones bioinformáticas . [ 43 ] Denominadas biovectores (BioVec) para referirse a secuencias biológicas en general, con vectores de proteínas (ProtVec) para proteínas (secuencias de aminoácidos) y vectores de genes (GeneVec) para secuencias de genes, esta representación puede utilizarse ampliamente en aplicaciones de aprendizaje profundo en proteómica y genómica . Los resultados presentados por Asgari y Mofrad [ 43 ] sugieren que los BioVectores pueden caracterizar secuencias biológicas en términos de interpretaciones bioquímicas y biofísicas de los patrones subyacentes.

Diseño de juegos

Rabii y Cook [ 44 ] propusieron el uso de incrustaciones de palabras con aplicaciones en el diseño de juegos como una forma de descubrir mecánicas de juego emergentes a partir de registros de datos de juego. El proceso requiere transcribir las acciones que ocurren durante un juego en un lenguaje formal y luego usar el texto resultante para crear incrustaciones de palabras. Los resultados presentados por Rabii y Cook [ 44 ] sugieren que los vectores resultantes pueden capturar el conocimiento experto sobre juegos como el ajedrez que no está explícitamente indicado en las reglas del juego.

Incrustaciones de oraciones

La idea se ha extendido a incrustaciones de oraciones completas o incluso documentos, por ejemplo, en forma del concepto de vectores de pensamiento . En 2015, algunos investigadores sugirieron los "vectores de pensamiento omitido" como un medio para mejorar la calidad de la traducción automática . [ 45 ] Un enfoque más reciente y popular para representar oraciones es Sentence-BERT, o SentenceTransformers, que modifica BERT preentrenado con el uso de estructuras de red siamesa y triplete. [ 46 ]

Software

El software para entrenar y usar incrustaciones de palabras incluye Word2vec de Tomáš Mikolov , GloVe de la Universidad de Stanford , [ 47 ] GN-GloVe, [ 48 ] incrustaciones de Flair, [ 38 ] ELMo de AllenNLP , [ 49 ] BERT , [ 50 ] fastText , Gensim , [ 51 ] Indra, [ 52 ] y Deeplearning4j . El análisis de componentes principales (PCA), la aproximación y proyección de variedades uniformes (UMAP) y la incrustación estocástica de vecinos distribuidos en T (t-SNE) se utilizan para reducir la dimensionalidad de los espacios vectoriales de palabras y visualizar incrustaciones y clústeres de palabras . [ 53 ] [ 54 ]

Ejemplos de aplicación

Por ejemplo, fastText también se utiliza para calcular incrustaciones de palabras para corpus de texto en Sketch Engine que están disponibles en línea. [ 55 ]

Implicaciones éticas

Las incrustaciones de palabras pueden contener los sesgos y estereotipos presentes en el conjunto de datos de entrenamiento, como señalan Bolukbasi et al. en el artículo de 2016 «¿Hombre es a programador informático como mujer es a ama de casa? Eliminando el sesgo de las incrustaciones de palabras», donde una incrustación word2vec disponible públicamente (y popular), entrenada con textos de Google News (un corpus de datos de uso común) que consiste en textos escritos por periodistas profesionales, aún muestra asociaciones de palabras desproporcionadas que reflejan sesgos de género y raciales al extraer analogías de palabras. [ 56 ] Por ejemplo, una de las analogías generadas utilizando la incrustación de palabras mencionada es «hombre es a programador informático como mujer es a ama de casa». [ 57 ] [ 58 ]

Las investigaciones realizadas por Jieyu Zhao et al. demuestran que la aplicación de estas incrustaciones de palabras entrenadas sin una supervisión cuidadosa probablemente perpetúa los sesgos existentes en la sociedad, los cuales se introducen a través de datos de entrenamiento sin modificar. Además, las incrustaciones de palabras pueden incluso amplificar estos sesgos. [ 59 ] [ 60 ]

Véase también

Referencias

  1. Jurafsky, Daniel; H. James, Martin (2000). Procesamiento del habla y del lenguaje: una introducción al procesamiento del lenguaje natural, la lingüística computacional y el reconocimiento del habla . Upper Saddle River, NJ: Prentice Hall. ISBN 978-0-13-095069-7.
  2. Mikolov, Tomas; Sutskever, Ilya; Chen, Kai; Corrado, Greg; Dean, Jeffrey (2013). "Representaciones distribuidas de palabras y frases y su composicionalidad". arXiv : 1310.4546 [ cs.CL ].
  3. Lebret, Rémi; Collobert, Ronan (2013). "Inserciones de palabras mediante PCA de Hellinger". Conferencia del Capítulo Europeo de la Asociación de Lingüística Computacional (EACL) . Vol. 2014. arXiv : 1312.5542 . 
  4. Levy, Omer; Goldberg, Yoav (2014). Neural Word Incedding as Implicit Matrix Factorization (PDF) . NIPS.
  5. Li, Yitan; Xu, Linli (2015). Word Embedding Revisited: A New Representation Learning and Explicit Matrix Factorization Perspective (PDF) . Int'l J. Conf. on Artificial Intelligence (IJCAI).
  6. Globerson, Amir (2007). "Euclidean Incedding of Co-occurrence Data" (PDF) . Journal of Machine Learning Research .
  7. Qureshi, M. Atif; Greene, Derek (2018-06-04). "EVE: técnica de incrustación basada en vectores explicables usando Wikipedia". Journal of Intelligent Information Systems . 53 : 137– 165. arXiv : 1702.06891 . doi : 10.1007/s10844-018-0511-x . ISSN 0925-9902 . S2CID 10656055 .  
  8. Levy, Omer; Goldberg, Yoav (2014). Regularidades lingüísticas en representaciones de palabras dispersas y explícitas (PDF) . CoNLL. págs. 171–180 . 
  9. Socher, Richard; Bauer, John; Manning, Christopher; Ng, Andrew (2013). Análisis sintáctico con gramáticas vectoriales composicionales (PDF) . Actas de la Conferencia ACL. Archivado del original (PDF) el 11 de agosto de 2016. Consultado el 14 de agosto de 2014 .
  10. Socher, Richard; Perelygin, Alex; Wu, Jean; Chuang, Jason; Manning, Chris; Ng, Andrew; Potts, Chris (2013). Modelos profundos recursivos para la composicionalidad semántica sobre un banco de árboles de sentimiento (PDF) . EMNLP.
  11. Sahlgren, Magnus. "Una breve historia de las incrustaciones de palabras" .
  12. Firth, JR (1957). "Una sinopsis de la teoría lingüística 1930–1955". Estudios de análisis lingüístico : 1–32 .Reimpreso en FR Palmer, ed. (1968). Selected Papers of JR Firth 1952–1959 . Londres: Longman.{{cite book}}: CS1 mantenimiento: ubicación del editor ( enlace )
  13. Luhn, HP (1953). "Un nuevo método para registrar y buscar información". American Documentation . 4 : 14–16 . doi : 10.1002/asi.5090040104 .
  14. Osgood, CE; Suci, GJ; Tannenbaum, PH (1957). La medición del significado . University of Illinois Press.
  15. Salton, Gerard (1962). «Algunos experimentos en la generación de asociaciones de palabras y documentos». Actas de la conferencia conjunta de informática de otoño del 4 al 6 de diciembre de 1962 - AFIPS '62 (Otoño) . págs. 234–250 . doi : 10.1145/1461518.1461544 . ISBN  978-1-4503-7879-6. S2CID 9937095 . {{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda )
  16. Salton, Gerard; Wong, A; Yang, CS (1975). "Un modelo de espacio vectorial para la indexación automática". Communications of the ACM . 18 (11): 613– 620. doi : 10.1145/361219.361220 . hdl : 1813/6057 . S2CID 6473756 . 
  17. Dubin, David (2004). "El artículo más influyente que Gerard Salton nunca escribió" . Archivado del original el 18 de octubre de 2020. Recuperado el 18 de octubre de 2020 .
  18. Kanerva, Pentti, Kristoferson, Jan y Holst, Anders (2000): Indexación aleatoria de muestras de texto para el análisis semántico latente , Actas de la 22.ª Conferencia Anual de la Sociedad de Ciencias Cognitivas, pág. 1036. Mahwah, Nueva Jersey: Erlbaum, 2000.
  19. Karlgren, Jussi; Sahlgren, Magnus (2001). Uesaka, Yoshinori; Kanerva, Pentti; Asoh, Hideki (eds.). "De las palabras al entendimiento". Fundamentos de la inteligencia del mundo real . Publicaciones CSLI: 294– 308.
  20. Sahlgren, Magnus (2005) Introducción a la indexación aleatoria , Actas del taller sobre métodos y aplicaciones de la indexación semántica en la 7.ª Conferencia Internacional sobre Terminología e Ingeniería del Conocimiento, TKE 2005, 16 de agosto, Copenhague, Dinamarca
  21. Sahlgren, Magnus, Holst, Anders y Pentti Kanerva (2008) Permutaciones como medio para codificar el orden en el espacio de palabras , En Actas de la 30.ª Conferencia Anual de la Sociedad de Ciencias Cognitivas: 1300–1305.
  22. Bengio, Yoshua; Réjean, Ducharme; Pascal, Vincent (2000). "Un modelo de lenguaje probabilístico neuronal" (PDF) . NeurIPS .
  23. Bengio, Yoshua ; Ducharme, Réjean; Vincent, Pascal; Jauvin, Christian (2003). "Un modelo de lenguaje probabilístico neuronal" (PDF) . Journal of Machine Learning Research . 3 : 1137–1155 .
  24. ^ Bengio, Yoshua; Schwenk, Holger; Senécal, Jean-Sébastien; Morin, Federico; Gauvain, Jean-Luc (2006). "Un modelo de lenguaje probabilístico neuronal". Estudios en Borrosidad y Computación Blanda . vol. 194. Saltador. págs. 137–186 . doi : 10.1007/3-540-33486-6_6 . ISBN   978-3-540-30609-2.
  25. Vinkourov, Alexei; Cristianini, Nello; Shawe-Taylor, John (2002). Inferencia de una representación semántica de texto mediante análisis de correlación entre idiomas (PDF) . Avances en sistemas de procesamiento de información neuronal. Vol. 15. 
  26. Lavelli, Alberto; Sebastiani, Fabrizio; Zanoli, Roberto (2004). Representaciones de términos distribucionales: una comparación experimental . 13.ª Conferencia Internacional ACM sobre Gestión de Información y Conocimiento. pp. 615–624 . doi : 10.1145/1031171.1031284 . 
  27. Roweis, Sam T.; Saul, Lawrence K. (2000). "Reducción de dimensionalidad no lineal mediante incrustación lineal local". Science . 290 (5500): 2323– 6. Bibcode : 2000Sci...290.2323R . CiteSeerX 10.1.1.111.3313 . doi : 10.1126/science.290.5500.2323 . PMID 11125150 . S2CID 5987139 .   
  28. él:יהושע בנג'יו
  29. Morin, Fredric; Bengio, Yoshua (2005). "Modelo de lenguaje de red neuronal probabilística jerárquica" (PDF) . En Cowell, Robert G.; Ghahramani, Zoubin (eds.). Actas del Décimo Taller Internacional sobre Inteligencia Artificial y Estadística . Actas de Investigación en Aprendizaje Automático. Vol. R5. págs. 246–252 .  
  30. Mnih, Andriy; Hinton, Geoffrey (2009). "Un modelo de lenguaje distribuido jerárquico escalable" . Advances in Neural Information Processing Systems . 21 (NIPS 2008). Curran Associates, Inc.: 1081–1088 .
  31. "word2vec" . Archivo de código de Google . Consultado el 23 de julio de 2021 .
  32. Reisinger, Joseph; Mooney, Raymond J. (2010). Modelos de espacio vectorial multiprototipo del significado de las palabras . Vol. Tecnologías del lenguaje humano: Conferencia anual de 2010 del capítulo norteamericano de la Asociación de Lingüística Computacional. Los Ángeles, California: Asociación de Lingüística Computacional. pp. 109–117 . ISBN   978-1-932432-65-7. Consultado el 25 de octubre de 2019 .
  33. Huang, Eric. (2012). Mejora de las representaciones de palabras mediante contexto global y prototipos de palabras múltiples . OCLC 857900050 . 
  34. Camacho-Collados, Jose; Pilehvar, Mohammad Taher (2018). "From Word to Sense Embeddings: A Survey on Vector Representations of Meaning". arXiv : 1805.04032 [ cs.CL ].
  35. Neelakantan, Arvind; Shankar, Jeevan; Passos, Alexandre; McCallum, Andrew (2014). "Estimación no paramétrica eficiente de múltiples incrustaciones por palabra en el espacio vectorial". Actas de la Conferencia de 2014 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural (EMNLP) . Stroudsburg, PA, EE. UU.: Asociación para la Lingüística Computacional. págs. 1059–1069 . arXiv : 1504.06654 . doi : 10.3115/v1/d14-1113 . S2CID 15251438 .  
  36. Ruas, Terry; Grosky, William; Aizawa, Akiko (2019-12-01). "Incrustaciones multisensoriales a través de un proceso de desambiguación del sentido de las palabras". Expert Systems with Applications . 136 : 288– 303. arXiv : 2101.08700 . doi : 10.1016/j.eswa.2019.06.026 . hdl : 2027.42/145475 . ISSN 0957-4174 . S2CID 52225306 .  
  37. Agre, Gennady; Petrov, Daniel; Keskinova, Simona (2019-03-01). "Word Sense Disambiguation Studio: A Flexible System for WSD Feature Extraction" . Information . 10 (3): 97. doi : 10.3390/info10030097 . ISSN 2078-2489 . 
  38. 1 2 Akbik, Alan; Blythe, Duncan; Vollgraf, Roland (2018). "Incrustaciones de cadenas contextuales para el etiquetado de secuencias" . Actas de la 27.ª Conferencia Internacional sobre Lingüística Computacional . Santa Fe, Nuevo México, EE. UU.: Asociación de Lingüística Computacional: 1638–1649 .
  39. Li, Jiwei; Jurafsky, Dan (2015). "¿Mejoran las incrustaciones multisensoriales la comprensión del lenguaje natural?". Actas de la Conferencia de 2015 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural . Stroudsburg, PA, EE. UU.: Asociación de Lingüística Computacional. págs. 1722–1732 . arXiv : 1506.01070 . doi : 10.18653/v1/d15-1200 . S2CID 6222768 .  
  40. Devlin, Jacob; Chang, Ming-Wei; Lee, Kenton; Toutanova, Kristina (junio de 2019). "Actas de la Conferencia del Norte de 2019" . Actas de la Conferencia de 2019 del Capítulo Norteamericano de la Asociación de Lingüística Computacional: Tecnologías del Lenguaje Humano, Volumen 1 (Artículos largos y cortos) . Asociación de Lingüística Computacional: 4171–4186 . doi : 10.18653/v1/N19-1423 . S2CID 52967399 . 
  41. Lucy, Li y David Bamman. «Caracterización de la variación del inglés en comunidades de redes sociales con BERT». Transactions of the Association for Computational Linguistics 9 (2021): 538-556.
  42. Reif, Emily, Ann Yuan, Martin Wattenberg, Fernanda B. Viegas, Andy Coenen, Adam Pearce y Been Kim. "Visualización y medición de la geometría de BERT". Advances in Neural Information Processing Systems 32 (2019).
  43. 1 2 Asgari, Ehsaneddin; Mofrad, Mohammad RK (2015). "Representación distribuida continua de secuencias biológicas para proteómica y genómica profunda" . PLOS ONE . 10 (11) e0141287. arXiv : 1503.05140 . Bibcode : 2015PLoSO..1041287A . doi : 10.1371/journal.pone.0141287 . PMC 4640716. PMID 26555596 .  
  44. 1 2 Rabii, Younès; Cook, Michael (2021-10-04). "Revelando la dinámica del juego mediante incrustaciones de palabras de datos de juego" . Actas de la Conferencia AAAI sobre Inteligencia Artificial y Entretenimiento Digital Interactivo . 17 (1): 187– 194. doi : 10.1609/aiide.v17i1.18907 . ISSN 2334-0924 . S2CID 248175634 .  
  45. ^ Kiros, Ryan; Zhu, Yukun; Salakhutdinov, Ruslan; Zemel, Richard S.; Torralba, Antonio; Urtasún, Raquel; Fidler, Sanja (2015). "vectores de omisión de pensamiento". arXiv : 1506.06726 [ cs.CL ].
  46. Reimers, Nils e Iryna Gurevych. «Sentence-BERT: Incrustaciones de oraciones mediante redes BERT siamesas». En Actas de la Conferencia de 2019 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural y la 9.ª Conferencia Internacional Conjunta sobre Procesamiento del Lenguaje Natural (EMNLP-IJCNLP), págs. 3982-3992. 2019.
  47. "GloVe" .
  48. ^ Zhao, Jieyu; et al. (2018) (2018). "Aprendizaje de incrustaciones de palabras neutrales al género". arXiv : 1809.01496 [ cs.CL ]. 
  49. "Elmo" . 16 de octubre de 2024.
  50. Pires, Telmo; Schlinger, Eva; Garrette, Dan (2019-06-04). "¿Qué tan multilingüe es Multilingual BERT?". arXiv : 1906.01502 [ cs.CL ].
  51. "Gensim" .
  52. «Indra» . GitHub . 2018-10-25.
  53. Ghassemi, Mohammad; Mark, Roger; Nemati, Shamim (2015). "Visualización de la evolución del sentimiento clínico mediante representaciones vectoriales de notas clínicas" (PDF) . Conferencia de Informática en Cardiología de 2015 (CinC) . Vol. 2015. págs. 629–632 . doi : 10.1109/CIC.2015.7410989 . ISBN   978-1-5090-0685-4. PMC 5070922 . PMID 27774487 .  
  54. McInnes, Leland; Healy, John; Melville, James (2020-09-18). "UMAP: Aproximación y proyección de variedades uniformes para la reducción de dimensión". arXiv : 1802.03426 [ stat.ML ].
  55. "Visor de incrustaciones" . Visor de incrustaciones . Computación léxica. Archivado del original el 8 de febrero de 2018. Recuperado el 7 de febrero de 2018 .
  56. Bolukbasi, Tolga; Chang, Kai-Wei; Zou, James; Saligrama, Venkatesh; Kalai, Adam (2016). "¿El hombre es al programador informático como la mujer es al ama de casa? Eliminando el sesgo de las incrustaciones de palabras". arXiv : 1607.06520 [ cs.CL ].
  57. Bolukbasi, Tolga; Chang, Kai-Wei; Zou, James; Saligrama, Venkatesh; Kalai, Adam (2016-07-21). "¿El hombre es al programador informático como la mujer es al ama de casa? Eliminando el sesgo de las incrustaciones de palabras". arXiv : 1607.06520 [ cs.CL ].
  58. Dieng, Adji B.; Ruiz, Francisco JR; Blei, David M. (2020). "Modelado de temas en espacios de incrustación" . Transactions of the Association for Computational Linguistics . 8 : 439–453 . arXiv : 1907.04907 . doi : 10.1162/tacl_a_00325 .
  59. Zhao, Jieyu; Wang, Tianlu; Yatskar, Mark; Ordonez, Vicente; Chang, Kai-Wei (2017). "A los hombres también les gusta ir de compras: reducción de la amplificación del sesgo de género mediante restricciones a nivel de corpus" . Actas de la Conferencia de 2017 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural . págs. 2979–2989 . doi : 10.18653/v1/D17-1323 . 
  60. Petreski, Davor; Hashim, Ibrahim C. (26 de mayo de 2022). "Las incrustaciones de palabras están sesgadas. ¿Pero el sesgo de quién reflejan?" . AI & Society . 38 (2): 975– 982. doi : 10.1007/s00146-022-01443-w . ISSN 1435-5655 . S2CID 249112516 .