Articulo de referencia

Reconocimiento de entidades nombradas

El reconocimiento de entidades nombradas ( NER ) (también conocido como identificación de entidades (nombradas) , segmentación de entidades y extracción de entidades ) es una su...

El reconocimiento de entidades nombradas ( NER ) (también conocido como identificación de entidades (nombradas) , segmentación de entidades y extracción de entidades ) es una subtarea de la extracción de información que busca localizar y clasificar entidades nombradas mencionadas en texto no estructurado en categorías predefinidas como nombres de personas (PER), organizaciones (ORG), ubicaciones (LOC), entidades geopolíticas (GPE), vehículos (VEH), códigos médicos , expresiones de tiempo, cantidades, valores monetarios, porcentajes, etc.

La mayoría de las investigaciones sobre sistemas NER/NEE se han estructurado tomando un bloque de texto sin anotar, como por ejemplo transducir :

Jim compró 300 acciones de Acme Corp. en 2006.

en un bloque de texto anotado que resalta los nombres de las entidades:

[Jim] Person compró 300 acciones de [Acme Corp.] Organization en [2006] Time .

En este ejemplo, se ha detectado y clasificado un nombre de persona compuesto por un token, un nombre de empresa compuesto por dos tokens y una expresión temporal.

Problema

Definición

En la expresión entidad nombrada , la palabra «nombrada» restringe la tarea a aquellas entidades para las cuales una o varias cadenas, como palabras o frases, representan (de manera bastante) consistente algún referente. Esto está estrechamente relacionado con los designadores rígidos , tal como los define Saul Kripke , [ 1 ] [ 2 ] aunque en la práctica el NER se ocupa de muchos nombres y referentes que no son filosóficamente «rígidos». Por ejemplo, la compañía automotriz creada por Henry Ford en 1903 puede denominarse Ford o Ford Motor Company , aunque «Ford» también puede referirse a muchas otras entidades (véase Ford ). Los designadores rígidos incluyen nombres propios, así como términos para ciertas especies y sustancias biológicas, [ 3 ] pero excluyen los pronombres (como «it»; véase resolución de correferencia ), las descripciones que seleccionan un referente por sus propiedades (véase también De dicto y de re ), y los nombres para tipos de cosas en contraposición a individuos (por ejemplo, «Bank»).

El reconocimiento completo de entidades nombradas a menudo se divide, conceptualmente y posiblemente también en implementaciones, [ 4 ] como dos problemas distintos: detección de nombres y clasificación de los nombres por el tipo de entidad a la que se refieren (por ejemplo, persona, organización o ubicación). [ 5 ] La primera fase se simplifica típicamente a un problema de segmentación: los nombres se definen como tramos contiguos de tokens, sin anidamiento, de modo que "Bank of America" ​​es un solo nombre, sin tener en cuenta el hecho de que dentro de este nombre, la subcadena "America" ​​es en sí misma un nombre. Este problema de segmentación es formalmente similar a la fragmentación . La segunda fase requiere elegir una ontología mediante la cual organizar las categorías de cosas.

Las expresiones temporales y algunas expresiones numéricas (p. ej., dinero, porcentajes, etc.) también pueden considerarse entidades nombradas en el contexto de la tarea de reconocimiento de entidades nombradas (NER). Si bien algunos ejemplos de este tipo son buenos ejemplos de designadores rígidos (p. ej., el año 2001), también existen muchos ejemplos inválidos (p. ej., me tomo mis vacaciones en "junio"). En el primer caso, el año 2001 se refiere al año 2001 del calendario gregoriano . En el segundo caso, el mes de junio puede referirse al mes de un año indefinido ( junio pasado , junio próximo , todos los junios , etc.). Es discutible que la definición de entidad nombrada se flexibilice en estos casos por razones prácticas. Por lo tanto, la definición del término entidad nombrada no es estricta y a menudo debe explicarse en el contexto en el que se utiliza. [ 6 ]

En la literatura se han propuesto ciertas jerarquías de tipos de entidades nombradas. Las categorías BBN , propuestas en 2002, se utilizan para responder preguntas y constan de 29 tipos y 64 subtipos. [ 7 ] La jerarquía extendida de Sekine, propuesta en 2002, está compuesta por 200 subtipos. [ 8 ] Más recientemente, en 2011, Ritter utilizó una jerarquía basada en tipos de entidades comunes de Freebase en experimentos innovadores sobre NER en textos de redes sociales . [ 9 ]

Dificultades

El reconocimiento de entidades nombradas (NER) puede presentar ambigüedades en la resolución de referencias, donde un mismo nombre puede referirse a diferentes entidades del mismo tipo. Por ejemplo, "JFK" puede referirse al expresidente de los Estados Unidos o a su hijo .

El mismo nombre puede referirse a tipos completamente diferentes. "JFK" podría referirse al aeropuerto de Nueva York . "IRA" puede referirse a Cuenta Individual de Jubilación , Asociación Internacional de Lectura o Ejército Republicano Irlandés .

Esto puede deberse a la metonimia . Por ejemplo, "La Casa Blanca" puede referirse a una organización en lugar de a un lugar .

Evaluación formal

Para evaluar la calidad de la salida de un sistema NER, se han definido varias métricas. Las más comunes son la precisión, la exhaustividad y la puntuación F1 . Sin embargo, aún existen dudas sobre cómo calcular estos valores.

Estas medidas estadísticas funcionan razonablemente bien para los casos obvios de encontrar o no encontrar una entidad real con exactitud, y para encontrar una no entidad. Sin embargo, el reconocimiento de entidades nombradas (NER) puede fallar de muchas otras maneras, muchas de las cuales podrían considerarse "parcialmente correctas" y no deberían considerarse como un éxito o fracaso total. Por ejemplo, identificar una entidad real, pero:

  • con menos tokens de los deseados (por ejemplo, falta el último token de "John Smith, MD")
  • con más tokens de los deseados (por ejemplo, incluyendo la primera palabra de "La Universidad de MD")
  • dividiendo las entidades adyacentes de manera diferente (por ejemplo, tratando a "Smith, Jones Robinson" como 2 entidades en lugar de 3).
  • asignarle un tipo completamente erróneo (por ejemplo, llamar organización a un nombre personal).
  • asignándole un tipo relacionado pero inexacto (por ejemplo, "sustancia" frente a "droga", o "escuela" frente a "organización").
  • Identificar correctamente una entidad, cuando lo que el usuario buscaba era una entidad de menor o mayor alcance (por ejemplo, identificar "James Madison" como un nombre propio, cuando forma parte de la "Universidad James Madison"). Algunos sistemas de reconocimiento de entidades nombradas imponen la restricción de que las entidades nunca pueden superponerse ni anidarse, lo que significa que, en algunos casos, hay que tomar decisiones arbitrarias o específicas para la tarea.

Un método demasiado simple para medir la precisión consiste simplemente en contar qué fracción de todos los tokens del texto se identificaron correcta o incorrectamente como parte de referencias a entidades (o como entidades del tipo correcto). Esto presenta al menos dos problemas: primero, la gran mayoría de los tokens en textos reales no forman parte de nombres de entidades, por lo que la precisión de referencia (predecir siempre "no es una entidad") es exageradamente alta, generalmente >90%; y segundo, predecir erróneamente el nombre completo de una entidad no se penaliza adecuadamente (encontrar solo el nombre de pila de una persona cuando le sigue su apellido podría puntuarse como ½ de precisión).

En conferencias académicas como CoNLL, se ha definido una variante de la puntuación F1 de la siguiente manera: [ 5 ]

  • La precisión es el número de segmentos de nombres de entidades predichos que coinciden exactamente con los segmentos de los datos de evaluación de referencia . Por ejemplo, cuando se predice [ Persona Hans] [ Persona Blick] pero se requería [ Persona Hans Blick], la precisión del nombre predicho es cero. La precisión se calcula promediando todos los nombres de entidades predichos.
  • De manera similar, la exhaustividad es el número de nombres del patrón de referencia que aparecen exactamente en la misma posición en las predicciones.
  • La puntuación F1 es la media armónica de estas dos.

De la definición anterior se desprende que cualquier predicción que omita un solo token, incluya un token erróneo o tenga la clase incorrecta, constituye un error grave y no contribuye positivamente ni a la precisión ni a la exhaustividad. Por lo tanto, esta medida puede considerarse pesimista: es posible que muchos "errores" sean casi correctos y resulten adecuados para un propósito determinado. Por ejemplo, un sistema podría omitir siempre títulos como "Sra." o "Doctorado", pero compararse con un sistema o datos de referencia que espera que se incluyan los títulos. En ese caso, cada nombre de este tipo se considera un error. Debido a estas cuestiones, es importante analizar los tipos de errores y determinar su importancia en función de los objetivos y requisitos.

Se han propuesto modelos de evaluación basados ​​en la comparación token por token. [ 10 ] Dichos modelos pueden recibir crédito parcial por coincidencias superpuestas (como el criterio de Intersección sobre Unión ). Permiten una evaluación y comparación más precisa de los sistemas de extracción.

Aproches

Se han creado sistemas de reconocimiento de entidades nombradas (NER) que utilizan técnicas basadas en la gramática lingüística , así como modelos estadísticos como el aprendizaje automático . Los sistemas más avanzados pueden incorporar múltiples enfoques.

  • GATE admite el reconocimiento de entidades nombradas (NER) en muchos idiomas y dominios de forma predeterminada, y se puede utilizar a través de una interfaz gráfica y una API de Java .
  • OpenNLP incluye el reconocimiento de entidades nombradas basado en reglas y en estadísticas.
  • spaCy ofrece un rápido reconocimiento estadístico de entidades nombradas (NER), así como un visualizador de entidades nombradas de código abierto.

Los sistemas gramaticales elaborados manualmente suelen obtener una mayor precisión, pero a costa de una menor exhaustividad y meses de trabajo por parte de lingüistas computacionales experimentados . [ 11 ]

Los sistemas estadísticos de reconocimiento de entidades nombradas (NER) suelen requerir una gran cantidad de datos de entrenamiento anotados manualmente. Se han sugerido enfoques semisupervisados ​​para evitar parte del esfuerzo de anotación. [ 12 ] [ 13 ]

En la era del aprendizaje estadístico, el NER generalmente se realizaba aprendiendo un modelo de regresión lineal simple sobre características diseñadas , luego decodificado por un algoritmo de Viterbi bidireccional . Algunas características comúnmente utilizadas incluyen: [ 14 ]

  • Elementos léxicos: El token en sí debe estar etiquetado.
  • Elementos léxicos con raíz .
  • Forma: El patrón ortográfico de la palabra objetivo. Por ejemplo, todo en minúsculas, todo en mayúsculas, mayúscula inicial, mayúsculas y minúsculas combinadas, mayúsculas seguidas de un punto (que suele indicar un segundo nombre), contiene un guion, etc.
  • Sufijos de la palabra objetivo y de las palabras circundantes.
  • Parte de la oración de la palabra.
  • Si la palabra aparece en una o más listas de entidades nombradas (nomenclátores).
  • Palabras y/o n-gramas que aparecen en el contexto circundante.

Un nomenclátor es una lista de nombres y sus tipos, como "General Electric". Puede utilizarse para complementar cualquier sistema de reconocimiento de entidades nombradas (NER). Se utilizaban con frecuencia en la era del aprendizaje automático estadístico. [ 15 ] [ 16 ]

Se han utilizado muchos tipos diferentes de clasificadores para realizar NER mediante aprendizaje automático, siendo los campos aleatorios condicionales una opción típica. [ 17 ] Transformers presenta clasificación de tokens utilizando modelos de aprendizaje profundo. [ 18 ]

Historia

Los primeros trabajos sobre sistemas NER en la década de 1990 se centraron principalmente en la extracción de artículos periodísticos. Posteriormente, la atención se dirigió al procesamiento de despachos e informes militares. Las etapas posteriores de la evaluación de la extracción automática de contenido (ACE) también incluyeron varios tipos de estilos de texto informales, como blogs y transcripciones de conversaciones telefónicas. Desde aproximadamente 1998, ha habido un gran interés en la identificación de entidades en las comunidades de biología molecular , bioinformática y procesamiento del lenguaje natural médico . La entidad de interés más común en ese dominio han sido los nombres de genes y productos génicos. También ha habido un interés considerable en el reconocimiento de entidades químicas y fármacos en el contexto de la competición CHEMDNER, con 27 equipos participando en esta tarea. [ 19 ]

En 2001, una investigación indicó que incluso los sistemas NER más avanzados eran frágiles, lo que significa que los sistemas NER desarrollados para un dominio no solían funcionar bien en otros dominios. [ 20 ] Se requiere un esfuerzo considerable para ajustar los sistemas NER para que funcionen bien en un nuevo dominio; esto es cierto tanto para los sistemas estadísticos basados ​​en reglas como para los sistemas entrenables.

En 2007, los sistemas NER de última generación para el inglés producían un rendimiento casi humano. Por ejemplo, el mejor sistema que participó en MUC-7 obtuvo una puntuación del 93,39 % en la medida F, mientras que los anotadores humanos obtuvieron puntuaciones del 97,60 % y del 96,95 %. [ 21 ] [ 22 ]

Desafíos actuales

A pesar de los altos valores F1 reportados en el conjunto de datos MUC-7, el problema del reconocimiento de entidades nombradas está lejos de estar resuelto. Los esfuerzos principales se dirigen a reducir el trabajo de anotaciones empleando aprendizaje semisupervisado , [ 12 ] [ 23 ] un rendimiento robusto en diferentes dominios [ 24 ] [ 25 ] y escalando a tipos de entidades de grano fino. [ 8 ] [ 26 ] En los últimos años, muchos proyectos han recurrido al crowdsourcing , que es una solución prometedora para obtener juicios humanos agregados de alta calidad para enfoques de aprendizaje automático supervisado y semisupervisado para NER. [ 27 ] Otra tarea desafiante es diseñar modelos para manejar contextos lingüísticamente complejos como Twitter y consultas de búsqueda. [ 28 ]

Algunos investigadores realizaron comparaciones sobre el rendimiento del reconocimiento de entidades nombradas (NER) con diferentes modelos estadísticos como HMM ( modelo oculto de Markov ), ME ( entropía máxima ) y CRF ( campos aleatorios condicionales ), y conjuntos de características. [ 29 ] Recientemente, algunos investigadores propusieron un modelo de aprendizaje semisupervisado basado en grafos para tareas de NER específicas del lenguaje. [ 30 ]

Una tarea que ha surgido recientemente, consistente en identificar "expresiones importantes" en un texto y vincularlas a Wikipedia [ 31 ] [ 32 ] [ 33 ], puede considerarse un ejemplo de reconocimiento de entidades nombradas extremadamente preciso, donde los tipos son las páginas reales de Wikipedia que describen los conceptos (potencialmente ambiguos). A continuación se muestra un ejemplo de la salida de un sistema de wikifacción:

<ENTITY url= "https://en.wikipedia.org/wiki/Michael_I._Jordan" > Michael Jordan </ENTITY> es profesor en <ENTITY url = "https://en.wikipedia.org/wiki/University_of_California,_Berkeley" > Berkeley </ENTITY>

Otro campo que ha experimentado progresos pero que sigue siendo un desafío es la aplicación del NER a Twitter y otros microblogs, considerados "ruidosos" debido a la ortografía no estándar, la brevedad y la informalidad de los textos. [ 34 ] [ 35 ] Las comunidades de investigación han organizado desafíos de NER en tweets en inglés para comparar el rendimiento de varios enfoques, como LSTM bidireccionales , aprendizaje para la búsqueda o CRF. [ 36 ] [ 37 ] [ 38 ]

Véase también

Referencias

  1. Kripke, Saul (1971). "Identidad y necesidad". En MK Munitz (ed.). Identidad e individuación . Ciudad de Nueva York: New York University Press. pp. 135–64 . 
  2. LaPorte, Joseph (2018). "Designadores rígidos" . La enciclopedia de filosofía de Stanford .
  3. Nadeau, David; Sekine, Satoshi (2007). Un estudio sobre el reconocimiento y la clasificación de entidades nombradas (PDF) . Lingvisticae Investigationes.
  4. Carreras, Xavier; Márquez, Lluís; Padró, Lluís (2003). Un extractor de entidades con nombre simple que utiliza AdaBoost (PDF) . CONLL.
  5. 1 2 Tjong Kim Sang, Erik F.; De Meulder, Fien (2003). Introducción a la tarea compartida CoNLL-2003: reconocimiento de entidades nombradas independiente del idioma . CoNLL.
  6. Definición de entidad nombrada . Webknox.com. Consultado el 21 de julio de 2013.
  7. Brunstein, Ada. "Directrices de anotación para tipos de respuesta" . Catálogo LDC . Consorcio de Datos Lingüísticos. Archivado del original el 16 de abril de 2016. Recuperado el 21 de julio de 2013 .
  8. 1 2 Jerarquía extendida de entidades nombradas de Sekine . Nlp.cs.nyu.edu. Consultado el 21 de julio de 2013.
  9. Ritter, A.; Clark, S.; Mausam; Etzioni., O. (2011). Reconocimiento de entidades nombradas en tweets: un estudio experimental (PDF) . Actas de Métodos empíricos en procesamiento del lenguaje natural.
  10. Esuli, Andrea; Sebastiani, Fabrizio (2010). Evaluación de la extracción de información (PDF) . Foro de evaluación multilingüe (CLEF). págs. 100–111 . 
  11. ^ Kapetanos, Epaminondas; tártaro, doina; Sacarea, cristiano (14 de noviembre de 2013). Procesamiento del lenguaje natural: aspectos semánticos . Prensa CRC. pag. 298.ISBN  9781466584969.
  12. 1 2 Lin, Dekang; Wu, Xiaoyun (2009). Agrupación de frases para el aprendizaje discriminativo (PDF) . Reunión anual de la ACL e IJCNLP. pp. 1030–1038 . 
  13. Nothman, Joel; et al. (2013). "Aprendizaje del reconocimiento de entidades nombradas multilingües a partir de Wikipedia" . Inteligencia Artificial . 194 : 151–175 . doi : 10.1016/j.artint.2012.03.006 . 
  14. Jurafsky, Dan; Martin, James H. (2009). "22.1. Reconocimiento de entidades nombradas". Procesamiento del habla y del lenguaje: una introducción al procesamiento del lenguaje natural, la lingüística computacional y el reconocimiento del habla . Serie Prentice Hall en inteligencia artificial (2.ª ed.). Upper Saddle River, NJ: Pearson Prentice Hall. ISBN  978-0-13-187321-6OCLC 213375806 
  15. Mikheev, Andrei; Moens, Marc; Grover, Claire (junio de 1999). Thompson, Henry S.; Lascarides, Alex (eds.). «Reconocimiento de entidades nombradas sin diccionarios geográficos» . Novena Conferencia del Capítulo Europeo de la Asociación de Lingüística Computacional . Bergen, Noruega: Asociación de Lingüística Computacional: 1–8 .
  16. Nadeau, David; Turney, Peter D.; Matwin, Stan (2006). "Reconocimiento no supervisado de entidades nombradas: Generación de diccionarios y resolución de ambigüedades" . En Lamontagne, Luc; Marchand, Mario (eds.). Avances en inteligencia artificial . Lecture Notes in Computer Science. Vol. 3060. Berlín, Heidelberg: Springer. pp. 266–277 . doi : 10.1007/11766247_23 . ISBN   978-3-540-34630-2.
  17. Jenny Rose Finkel; Trond Grenager; Christopher Manning (2005). Incorporación de información no local en sistemas de extracción de información mediante muestreo de Gibbs (PDF) . 43.ª Reunión Anual de la Asociación de Lingüística Computacional . págs. 363–370 . 
  18. Wolf; Debut, Lysandre; Sanh, Victor; Chaumond, Julien; Delangue, Clement; Moi, Anthony; Cistac, Pierric; Rault, Tim; Louf, Remi; Funtowicz, Morgan; Davison, Joe; Shleifer, Sam; von Platen, Patrick; Ma, Clara; Jernite, Yacine; Plu, Julien; Xu, Canwen; Le Scao, Teven; Gugger, Sylvain; Drame, Mariama; Lhoest, Quentin; Wolf, Thomas; Rush, Alexander (2020). Transformers: Procesamiento del lenguaje natural de última generación . Actas de la Conferencia de 2020 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural: Demostraciones de Sistemas . págs. 38–45 . 
  19. Krallinger, M; Leitner, F; Rabal, O; Vazquez, M; Oyarzabal, J; Valencia, A (2013). "Descripción general de la tarea de reconocimiento de nombres de compuestos químicos y fármacos (CHEMDNER)". Actas del Cuarto Taller de Evaluación del Desafío BioCreativo, vol. 2. págs. 6–37 . CiteSeerX 10.1.1.684.4118 .  
  20. Poibeau, Thierry; Kosseim, Leila (2001). «Extracción de nombres propios de textos no periodísticos» (PDF) . Lingüística computacional en los Países Bajos 2000. Lenguaje y computadoras. Vol. 37. pp. 144–157 . doi : 10.1163/9789004333901_011 . ISBN   978-90-04-33390-1. S2CID 12591786 . Archivado del original (PDF) el 30-07-2019. 
  21. Elaine Marsh, Dennis Perzanowski, "Evaluación de la tecnología IE mediante MUC-7: Resumen de resultados", 29 de abril de 1998 PDF
  22. Actas de MUC-07 (Tareas de entidades nombradas)
  23. Turian, J., Ratinov, L., & Bengio, Y. (2010, julio). Representaciones de palabras: un método simple y general para el aprendizaje semisupervisado. En Actas de la 48.ª Reunión Anual de la Asociación de Lingüística Computacional (págs. 384–394). Asociación de Lingüística Computacional. PDF
  24. Ratinov, L., & Roth, D. (2009, junio). Desafíos de diseño y conceptos erróneos en el reconocimiento de entidades nombradas. En Actas de la Decimotercera Conferencia sobre Aprendizaje Computacional del Lenguaje Natural (págs. 147–155). Asociación de Lingüística Computacional.
  25. "Adaptación de dominio frustrantemente fácil" (PDF) . Archivado del original (PDF) el 13 de junio de 2010. Consultado el 5 de abril de 2012 .
  26. Lee, Changki; Hwang, Yi-Gyu; Oh, Hyo-Jung; Lim, Soojong; Heo, Jeong; Lee, Chung-Hee; Kim, Hyeon-Jin; Wang, Ji-Hyun; Jang, Myung-Gil (2006). "Reconocimiento de entidades nombradas de grano fino mediante campos aleatorios condicionales para la respuesta a preguntas" . Information Retrieval Technology . Lecture Notes in Computer Science. Vol. 4182. pp. 581–587 . doi : 10.1007/11880592_49 . ISBN   978-3-540-45780-0.
  27. Crowdsourcing basado en Web 2.0 para el desarrollo de estándares de oro de alta calidad en el procesamiento del lenguaje natural clínico
  28. Eiselt, Andreas; Figueroa, Alejandro (2013). Un reconocedor de entidades nombradas en dos pasos para consultas de búsqueda de dominio abierto . IJCNLP. pp. 829–833 . 
  29. Han, Li-Feng Aaron, Wong, Fai, Chao, Lidia Sam. (2013). Reconocimiento de entidades nombradas chinas con campos aleatorios condicionales a la luz de las características chinas. Actas de la Conferencia Internacional de Procesamiento del Lenguaje y Sistemas de Información Inteligentes. MA Klopotek et al. (Eds.): IIS 2013, LNCS Vol. 7912, pp. 57–68
  30. Han, Li-Feng Aaron, Wong, Zeng, Xiaodong, Derek Fai, Chao, Lidia Sam. (2015). Reconocimiento de entidades nombradas chinas con un modelo de aprendizaje semisupervisado basado en grafos. En Actas del taller SIGHAN en ACL-IJCNLP. 2015.
  31. Vinculación de documentos con el conocimiento enciclopédico.
  32. "Aprender a enlazar con Wikipedia" (PDF) . Archivado del original (PDF) el 25/01/2019 . Consultado el 21/07/2014 .
  33. Algoritmos locales y globales para la desambiguación en Wikipedia.
  34. Derczynski, Leon y Diana Maynard , Giuseppe Rizzo, Marieke van Erp, Genevieve Gorrell, Raphael Troncy, Johann Petrak y Kalian Botcheva (2014). “Análisis del reconocimiento y la vinculación de entidades nombradas para tweets”. Information Processing and Management 51(2) : páginas 32–49.
  35. Baldwin, Timothy; de Marneffe, Marie Catherine; Han, Bo; Kim, Young-Bum; Ritter, Alan; Xu, Wei (julio de 2015). "Tareas compartidas del Taller de 2015 sobre texto generado por el usuario con ruido: normalización léxica de Twitter y reconocimiento de entidades nombradas" . Actas del Taller sobre texto generado por el usuario con ruido . Pekín, China: Asociación de Lingüística Computacional: 126–135 . doi : 10.18653/v1/W15-4319 . hdl : 2078.1/284718 . S2CID 14500933 . 
  36. "Taller COLING 2016 sobre texto ruidoso generado por el usuario (W-NUT)" . noisy-text.github.io . Consultado el 13 de agosto de 2022 .
  37. Partalas, Ioannis; Lopez, Cédric; Derbas, Nadia; Kalitvianski, Ruslan (diciembre de 2016). "Aprendizaje para la búsqueda y el reconocimiento de entidades nombradas en Twitter" . Actas del 2.º Taller sobre texto generado por el usuario con ruido (WNUT) . Osaka, Japón: Comité Organizador de COLING 2016: 171–177 .
  38. Limsopatham, Nut; Collier, Nigel (diciembre de 2016). "LSTM bidireccional para el reconocimiento de entidades nombradas en mensajes de Twitter" . Actas del 2.º Taller sobre texto generado por el usuario con ruido (WNUT) . Osaka, Japón: Comité Organizador de COLING 2016: 145–152 .
  • Jurafsky, Daniel; Martin, James H. (2008). "13.5 Análisis Parcial". Procesamiento del Habla y del Lenguaje (2.ª  ed.). Upper Saddle River, NJ: Prentice Hall. ISBN 978-0131873216.
  • Jurafsky, Daniel; Martin, James H. (2008). «22.1. Reconocimiento de entidades nombradas». Procesamiento del habla y del lenguaje (2.ª  ed.). Upper Saddle River, NJ: Prentice Hall. ISBN 978-0131873216.