La desambiguación del sentido de las palabras , o simplemente desambiguación , es el proceso de identificar a qué sentido se refiere una palabra en una oración u otro segmento de contexto . En el procesamiento del lenguaje y la cognición humana , suele ser subconsciente.
Dado que el lenguaje natural requiere un reflejo de la realidad neurológica, moldeada por las capacidades que proporcionan las redes neuronales del cerebro , la informática ha tenido un desafío a largo plazo para desarrollar la capacidad de las computadoras para realizar el procesamiento del lenguaje natural y el aprendizaje automático .
Se han investigado numerosas técnicas, entre ellas métodos basados en diccionarios que utilizan el conocimiento codificado en recursos léxicos, métodos de aprendizaje automático supervisado en los que se entrena un clasificador para cada palabra distinta en un corpus de ejemplos con anotaciones manuales de sentido, y métodos completamente no supervisados que agrupan las ocurrencias de palabras, induciendo así sus sentidos. De entre todos ellos, los enfoques de aprendizaje supervisado han sido los algoritmos más exitosos hasta la fecha.
Es difícil determinar la precisión de los algoritmos actuales sin tener en cuenta numerosas salvedades. En inglés, la precisión a nivel de homógrafos suele superar el 90 % (a partir de 2009), y algunos métodos en homógrafos específicos alcanzan más del 96 %. En distinciones de sentido más sutiles, se han reportado precisiones máximas de entre el 59,1 % y el 69,0 % en ejercicios de evaluación (SemEval-2007, Senseval-2), donde la precisión base del algoritmo más simple posible, que consiste en elegir siempre el sentido más frecuente, fue del 51,4 % y del 57 %, respectivamente.
Variantes
La desambiguación requiere dos entradas estrictas: un diccionario para especificar los sentidos que se van a desambiguar y un corpus de datos lingüísticos para desambiguar (en algunos métodos, también se requiere un corpus de entrenamiento con ejemplos lingüísticos). La tarea de desambiguación de sentidos (WSD) tiene dos variantes: "muestra léxica" (desambiguar las ocurrencias de una pequeña muestra de palabras objetivo previamente seleccionadas) y "todas las palabras" (desambiguación de todas las palabras en un texto continuo). La tarea "Todas las palabras" se considera generalmente una forma de evaluación más realista, pero el corpus es más costoso de producir porque los anotadores humanos tienen que leer las definiciones de cada palabra en la secuencia cada vez que necesitan emitir un juicio de etiquetado, en lugar de una sola vez para un bloque de instancias de la misma palabra objetivo.
Historia
El problema de la diferenciación del mundo (WSD, por sus siglas en inglés) se formuló por primera vez como una tarea computacional distinta durante los inicios de la traducción automática en la década de 1940, lo que lo convierte en uno de los problemas más antiguos de la lingüística computacional. Warren Weaver introdujo el problema por primera vez en un contexto computacional en su memorándum de 1949 sobre traducción. [ 1 ] Posteriormente, Bar-Hillel (1960) argumentó [ 2 ] que el WSD no podía resolverse mediante una "computadora electrónica" debido a la necesidad general de modelar todo el conocimiento del mundo.
En la década de 1970, la decodificación de palabras (WSD, por sus siglas en inglés) era una subtarea de los sistemas de interpretación semántica desarrollados en el campo de la inteligencia artificial, comenzando con la semántica de preferencias de Wilks . Sin embargo, dado que en aquel entonces los sistemas WSD se basaban en gran medida en reglas y se programaban manualmente, eran propensos a sufrir un cuello de botella en la adquisición de conocimiento.
En la década de 1980, se pusieron a disposición recursos léxicos a gran escala, como el Oxford Advanced Learner's Dictionary of Current English (OALD): la codificación manual fue reemplazada por el conocimiento extraído automáticamente de estos recursos, pero la desambiguación seguía basándose en el conocimiento o en el diccionario.
En la década de 1990, la revolución estadística impulsó la lingüística computacional, y el problema de la separación de palabras se convirtió en un problema paradigmático al que aplicar técnicas de aprendizaje automático supervisado.
En la década de 2000, las técnicas supervisadas alcanzaron un punto de estancamiento en su precisión, por lo que la atención se ha desplazado hacia análisis más generales, la adaptación de dominios , los sistemas basados en corpus semisupervisados y no supervisados, las combinaciones de diferentes métodos y el retorno de los sistemas basados en el conocimiento mediante métodos basados en grafos. Aun así, los sistemas supervisados siguen ofreciendo el mejor rendimiento.
Dificultades
Diferencias entre diccionarios
Un problema con la desambiguación del sentido de las palabras es determinar cuáles son esos sentidos, ya que diferentes diccionarios y tesauros ofrecen distintas divisiones de las palabras en sentidos. Algunos investigadores han sugerido elegir un diccionario en particular y usar su conjunto de sentidos para abordar este problema. Sin embargo, en general, los resultados de las investigaciones que utilizan distinciones amplias en los sentidos han sido mucho mejores que los que utilizan distinciones más específicas. [ 3 ] [ 4 ] La mayoría de los investigadores continúan trabajando en la desambiguación del sentido de las palabras con mayor precisión .
La mayor parte de la investigación en el campo de la desambiguación de significados se realiza utilizando WordNet como inventario de referencia para el inglés. WordNet es un léxico computacional que codifica conceptos como conjuntos de sinónimos (por ejemplo, el concepto de coche se codifica como {car, auto, automobile, machine, motorcar}). Otros recursos utilizados para la desambiguación incluyen el Tesauro de Roget [ 5 ] y Wikipedia [ 6 ] . Más recientemente, BabelNet , un diccionario enciclopédico multilingüe, se ha utilizado para la desambiguación de significados en varios idiomas [ 7 ] .
Etiquetado de partes de la oración
En cualquier prueba real, el etiquetado de partes de la oración y el etiquetado de sentidos han demostrado estar estrechamente relacionados, pudiendo cada uno imponer restricciones al otro. La cuestión de si estas tareas deben mantenerse juntas o separadas aún no se ha resuelto unánimemente, pero recientemente los científicos se inclinan por probarlas por separado (por ejemplo, en las competiciones Senseval/ SemEval , las partes de la oración se proporcionan como entrada para que el texto las desambigüe).
Tanto la desambiguación del sentido de las palabras (WSD) como el etiquetado de partes de la oración implican la desambiguación o el etiquetado con palabras. Sin embargo, los algoritmos utilizados para una no suelen funcionar bien para la otra, principalmente porque la parte de la oración de una palabra se determina principalmente por las una a tres palabras inmediatamente adyacentes, mientras que el sentido de una palabra puede estar determinado por palabras más alejadas. La tasa de éxito de los algoritmos de etiquetado de partes de la oración es actualmente mucho mayor que la de la WSD, con una precisión de alrededor del 96 % [ 8 ] o superior, en comparación con una precisión inferior al 75 % en la desambiguación del sentido de las palabras con aprendizaje supervisado . Estas cifras son típicas del inglés y pueden ser muy diferentes de las de otros idiomas.
Variabilidad entre jueces
Otro problema es la varianza entre jueces . Los sistemas WSD normalmente se prueban comparando sus resultados en una tarea con los de un humano. Sin embargo, si bien es relativamente fácil asignar partes de la oración a un texto, entrenar a las personas para etiquetar los sentidos ha demostrado ser mucho más difícil. [ 9 ] Si bien los usuarios pueden memorizar todas las posibles partes de la oración que puede tomar una palabra, a menudo es imposible para las personas memorizar todos los sentidos que puede tomar una palabra. Además, los humanos no se ponen de acuerdo en la tarea en cuestión: dado una lista de sentidos y oraciones, los humanos no siempre estarán de acuerdo en qué palabra pertenece a qué sentido. [ 10 ]
Dado que el rendimiento humano sirve como estándar, constituye un límite superior para el rendimiento informático. Sin embargo, el rendimiento humano es mucho mejor en distinciones de grano grueso que en distinciones de grano fino , razón por la cual la investigación sobre distinciones de grano grueso [ 11 ] [ 12 ] se ha puesto a prueba en ejercicios recientes de evaluación de WSD. [ 3 ] [ 4 ]
Inventario de sentidos y dependencia de la tarea de los algoritmos
Un inventario de sentidos independiente de la tarea no es un concepto coherente: [ 13 ] cada tarea requiere su propia división del significado de las palabras en sentidos relevantes para la tarea. Además, diferentes aplicaciones podrían requerir algoritmos completamente diferentes. En la traducción automática, el problema toma la forma de selección de palabras objetivo. Los "sentidos" son palabras en el idioma objetivo, que a menudo corresponden a distinciones de significado significativas en el idioma de origen ("bank" podría traducirse al francés banque – es decir, 'banco financiero' o rive – es decir, 'borde del río'). En la recuperación de información, un inventario de sentidos no es necesariamente requerido, porque es suficiente saber que una palabra se usa con el mismo sentido en la consulta y en un documento recuperado; qué sentido es, es irrelevante.
Discreción de los sentidos
Finalmente, la noción misma de " sentido de la palabra " es resbaladiza y controvertida. La mayoría de las personas pueden estar de acuerdo en las distinciones a nivel de homógrafos de grano grueso (por ejemplo, pluma como instrumento de escritura o recinto), pero al descender un nivel a la polisemia de grano fino , surgen desacuerdos. Por ejemplo, en Senseval-2, que utilizó distinciones de sentido de grano fino, los anotadores humanos coincidieron en solo el 85% de las ocurrencias de palabras. [ 14 ] El significado de la palabra es, en principio, infinitamente variable y sensible al contexto. No se divide fácilmente en subsignificados distintos o discretos. [ 15 ] Los lexicógrafos frecuentemente descubren en los corpus significados de palabras vagos y superpuestos, y significados estándar o convencionales extendidos, modulados y explotados de una desconcertante variedad de maneras. El arte de la lexicografía es generalizar a partir del corpus a definiciones que evocan y explican todo el rango de significado de una palabra, haciendo que parezca que las palabras se comportan bien semánticamente. Sin embargo, no está nada claro si estas mismas distinciones de significado son aplicables en aplicaciones computacionales , ya que las decisiones de los lexicógrafos suelen estar motivadas por otras consideraciones. En 2009, se propuso una tarea —denominada sustitución léxica— como posible solución al problema de la discreción de sentidos. [ 16 ] La tarea consiste en proporcionar un sustituto para una palabra en contexto que preserve el significado de la palabra original (potencialmente, los sustitutos pueden elegirse del léxico completo de la lengua de destino, superando así la discreción).
Enfoques y métodos
Existen dos enfoques principales para el desarrollo de software: los enfoques profundos y los enfoques superficiales.
Los enfoques profundos presuponen el acceso a un cuerpo integral de conocimiento del mundo . Estos enfoques generalmente no se consideran muy exitosos en la práctica, principalmente porque dicho cuerpo de conocimiento no existe en un formato legible por computadora, fuera de dominios muy limitados. [ 17 ] Además, debido a la larga tradición en lingüística computacional de intentar tales enfoques en términos de conocimiento codificado y, en algunos casos, puede ser difícil distinguir entre el conocimiento involucrado en el conocimiento lingüístico o el conocimiento del mundo. El primer intento fue el de Margaret Masterman y sus colegas, en la Unidad de Investigación Lingüística de Cambridge en Inglaterra, en la década de 1950. Este intento usó como datos una versión de tarjeta perforada del Tesauro de Roget y sus "cabezas" numeradas, como indicador de temas y buscó repeticiones en el texto, usando un algoritmo de intersección de conjuntos. No fue muy exitoso, [ 18 ] pero tuvo fuertes relaciones con trabajos posteriores, especialmente la optimización de aprendizaje automático de Yarowsky de un método de tesauro en la década de 1990.
Los enfoques superficiales no intentan comprender el texto, sino que consideran las palabras que lo rodean. Estas reglas pueden ser derivadas automáticamente por la computadora, utilizando un corpus de entrenamiento con palabras etiquetadas según sus significados. Este enfoque, si bien teóricamente no es tan potente como los enfoques profundos, ofrece mejores resultados en la práctica, debido al conocimiento limitado del mundo por parte de la computadora.
Existen cuatro enfoques convencionales para el diseño de sistemas de escritura:
- Métodos basados en diccionarios y en el conocimiento: Estos se basan principalmente en diccionarios, tesauros y bases de conocimiento léxico , sin utilizar ninguna evidencia de corpus.
- Métodos semisupervisados o mínimamente supervisados : Estos métodos utilizan una fuente de conocimiento secundaria, como un pequeño corpus anotado como datos iniciales en un proceso de remuestreo, o un corpus bilingüe alineado por palabras.
- Métodos supervisados : Estos métodos utilizan corpus anotados por sentido para el entrenamiento.
- Métodos no supervisados : Estos métodos prescinden (casi) por completo de información externa y trabajan directamente con corpus sin anotar. Estos métodos también se conocen como discriminación del sentido de las palabras .
Casi todos estos enfoques funcionan definiendo una ventana de n palabras de contenido alrededor de cada palabra que se va a desambiguar en el corpus, y analizando estadísticamente esas n palabras circundantes. Dos enfoques sencillos utilizados para entrenar y luego desambiguar son los clasificadores Naïve Bayes y los árboles de decisión . En investigaciones recientes, los métodos basados en kernels , como las máquinas de vectores de soporte, han demostrado un rendimiento superior en el aprendizaje supervisado . Los enfoques basados en grafos también han captado mucha atención de la comunidad investigadora y actualmente alcanzan un rendimiento cercano al de vanguardia.
Métodos basados en diccionarios y conocimientos
El algoritmo de Lesk [ 19 ] es el método seminal basado en diccionarios. Se basa en la hipótesis de que las palabras usadas juntas en un texto están relacionadas entre sí y que esta relación puede observarse en las definiciones de las palabras y sus sentidos. Dos (o más) palabras se desambiguan al encontrar el par de sentidos del diccionario con la mayor superposición de palabras en sus definiciones. Por ejemplo, al desambiguar las palabras en "pine cone", las definiciones de los sentidos apropiados incluyen las palabras "evergreen" y "tree" (al menos en un diccionario). Un enfoque similar [ 20 ] busca el camino más corto entre dos palabras: la segunda palabra se busca iterativamente entre las definiciones de cada variante semántica de la primera palabra, luego entre las definiciones de cada variante semántica de cada palabra en las definiciones anteriores, y así sucesivamente. Finalmente, la primera palabra se desambigua seleccionando la variante semántica que minimiza la distancia de la primera a la segunda palabra.
Una alternativa al uso de las definiciones es considerar la relación general entre los sentidos de las palabras y calcular la similitud semántica de cada par de sentidos de palabras basándose en una base de conocimiento léxico dada, como WordNet . Se han aplicado con cierto éxito métodos basados en grafos que recuerdan a la investigación de activación propagada de los primeros días de la investigación en IA. Se ha demostrado que los enfoques basados en grafos más complejos funcionan casi tan bien como los métodos supervisados [ 21 ] o incluso los superan en dominios específicos. [ 3 ] [ 22 ] Recientemente, se ha informado que medidas simples de conectividad de grafos , como el grado , realizan WSD de vanguardia en presencia de una base de conocimiento léxico suficientemente rica. [ 23 ] Además, se ha demostrado que la transferencia automática de conocimiento en forma de relaciones semánticas de Wikipedia a WordNet impulsa los métodos simples basados en conocimiento, permitiéndoles rivalizar con los mejores sistemas supervisados e incluso superarlos en un entorno específico de dominio. [ 24 ]
El uso de preferencias de selección (o restricciones de selección) también es útil; por ejemplo, sabiendo que uno normalmente cocina alimentos, se puede desambiguar la palabra bajo en "Estoy cocinando bajos" (es decir, no es un instrumento musical).
Métodos supervisados
Los métodos supervisados se basan en la suposición de que el contexto puede proporcionar suficiente evidencia por sí solo para desambiguar palabras (por lo tanto, el sentido común y el razonamiento se consideran innecesarios). Probablemente todos los algoritmos de aprendizaje automático existentes se han aplicado a la desambiguación de palabras, incluidas técnicas asociadas como la selección de características , la optimización de parámetros y el aprendizaje de conjuntos . Las máquinas de vectores de soporte y el aprendizaje basado en memoria han demostrado ser los enfoques más exitosos hasta la fecha, probablemente porque pueden manejar la alta dimensionalidad del espacio de características. Sin embargo, estos métodos supervisados están sujetos a un nuevo cuello de botella en la adquisición de conocimiento, ya que dependen de grandes cantidades de corpus etiquetados manualmente para el entrenamiento, cuya creación es laboriosa y costosa.
Métodos semisupervisados
Debido a la falta de datos de entrenamiento, muchos algoritmos de desambiguación del sentido de las palabras utilizan aprendizaje semisupervisado , que admite datos etiquetados y no etiquetados. El algoritmo de Yarowsky fue un ejemplo temprano de este tipo de algoritmo. [ 25 ] Utiliza las propiedades de "Un sentido por colocación" y "Un sentido por discurso" de los lenguajes humanos para la desambiguación del sentido de las palabras. Según las observaciones, las palabras tienden a presentar un solo sentido en la mayoría de los discursos y en una colocación dada. [ 26 ]
El método de remuestreo (bootstrapping) parte de una pequeña cantidad de datos semilla para cada palabra: ejemplos de entrenamiento etiquetados manualmente o un pequeño número de reglas de decisión infalibles (por ejemplo, "play" en el contexto de "bass" casi siempre indica el instrumento musical). Estas semillas se utilizan para entrenar un clasificador inicial mediante cualquier método supervisado. Este clasificador se aplica a la parte no etiquetada del corpus para extraer un conjunto de entrenamiento más amplio, que incluye solo las clasificaciones más fiables. El proceso se repite, entrenando cada nuevo clasificador con un corpus de entrenamiento sucesivamente mayor, hasta que se consume todo el corpus o se alcanza un número máximo de iteraciones.
Otras técnicas semisupervisadas utilizan grandes cantidades de corpus sin etiquetar para proporcionar información de coocurrencia que complementa los corpus etiquetados. Estas técnicas tienen el potencial de ayudar en la adaptación de modelos supervisados a diferentes dominios.
Asimismo, una palabra ambigua en un idioma suele traducirse de forma diferente en otro idioma, dependiendo de su significado. Se han utilizado corpus bilingües alineados por palabras para inferir distinciones de sentido entre idiomas, un tipo de sistema semisupervisado.
Métodos no supervisados
El aprendizaje no supervisado es el mayor desafío para los investigadores de WSD. La suposición subyacente es que los sentidos similares ocurren en contextos similares, y por lo tanto, los sentidos pueden inferirse a partir del texto agrupando las ocurrencias de palabras usando alguna medida de similitud de contexto, [ 27 ] una tarea conocida como inducción o discriminación de sentidos de palabras. Luego, las nuevas ocurrencias de la palabra pueden clasificarse en los grupos/sentidos inducidos más cercanos. El rendimiento ha sido menor que para los otros métodos descritos anteriormente, pero las comparaciones son difíciles ya que los sentidos inducidos deben mapearse a un diccionario conocido de sentidos de palabras. Si no se desea un mapeo a un conjunto de sentidos de diccionario, se pueden realizar evaluaciones basadas en clústeres (incluidas medidas de entropía y pureza). Alternativamente, los métodos de inducción de sentidos de palabras pueden probarse y compararse dentro de una aplicación. Por ejemplo, se ha demostrado que la inducción de sentidos de palabras mejora el agrupamiento de resultados de búsqueda web al aumentar la calidad de los clústeres de resultados y el grado de diversificación de las listas de resultados. [ 28 ] [ 29 ] Se espera que el aprendizaje no supervisado supere el cuello de botella de la adquisición de conocimiento porque no depende del esfuerzo manual.
La representación de palabras considerando su contexto a través de vectores densos de tamaño fijo ( incrustaciones de palabras ) se ha convertido en uno de los bloques más fundamentales en varios sistemas de PLN. [ 30 ] [ 31 ] [ 32 ] Aunque la mayoría de las técnicas tradicionales de incrustación de palabras fusionan palabras con múltiples significados en una única representación vectorial, aún pueden usarse para mejorar WSD. [ 33 ] Un enfoque simple para emplear incrustaciones de palabras precalculadas para representar los sentidos de las palabras es calcular los centroides de los clústeres de sentidos. [ 34 ] [ 35 ] Además de las técnicas de incrustación de palabras, las bases de datos léxicas (por ejemplo, WordNet , ConceptNet , BabelNet ) también pueden ayudar a los sistemas no supervisados a mapear palabras y sus sentidos como diccionarios. Algunas técnicas que combinan bases de datos léxicas e incrustaciones de palabras se presentan en AutoExtend [ 36 ] [ 37 ] y Most Suitable Sense Annotation (MSSA). [ 38 ] En AutoExtend, [ 37 ] presentan un método que desacopla la representación de entrada de un objeto en sus propiedades, como palabras y sus sentidos. AutoExtend utiliza una estructura de grafo para mapear palabras (por ejemplo, texto) y objetos que no son palabras (por ejemplo, synsets en WordNet ) como nodos y la relación entre nodos como aristas. Las relaciones (aristas) en AutoExtend pueden expresar la suma o la similitud entre sus nodos. La primera captura la intuición detrás del cálculo de desplazamiento, [ 30 ] mientras que la segunda define la similitud entre dos nodos. En MSSA, [ 38 ] un sistema de desambiguación no supervisado utiliza la similitud entre sentidos de palabras en una ventana de contexto fija para seleccionar el sentido de palabra más adecuado utilizando un modelo de incrustación de palabras preentrenado y WordNet . Para cada ventana de contexto, MSSA calcula el centroide de cada definición de sentido de palabra promediando los vectores de palabras de sus palabras en las glosas de WordNet.(es decir, una breve definición y uno o más ejemplos de uso) utilizando un modelo de incrustación de palabras preentrenado. Estos centroides se utilizan posteriormente para seleccionar el sentido de la palabra con la mayor similitud de una palabra objetivo con sus vecinas inmediatamente adyacentes (es decir, palabras predecesoras y sucesoras). Una vez que todas las palabras están anotadas y desambiguadas, pueden utilizarse como corpus de entrenamiento en cualquier técnica estándar de incrustación de palabras. En su versión mejorada, MSSA puede utilizar incrustaciones de sentido de palabra para repetir su proceso de desambiguación de forma iterativa.
Otros enfoques
Otros enfoques pueden variar de manera diferente en sus métodos:
- Desambiguación basada en el dominio; [ 39 ] [ 40 ]
- Identificación de los sentidos dominantes de las palabras; [ 41 ] [ 42 ] [ 43 ]
- WSD utilizando evidencia translingüística. [ 44 ] [ 45 ]
- Solución WSD en el sistema de procesamiento del lenguaje natural (PLN) independiente del idioma de John Ball , que combina la teoría de Patom y la gramática de roles y referencia (RRG).
- Inferencia de tipos en gramáticas basadas en restricciones [ 46 ]
Otros idiomas
- Hindi : La falta de recursos léxicos en hindi ha obstaculizado el rendimiento de los modelos supervisados de WSD, mientras que los modelos no supervisados sufren debido a la extensa morfología. Una posible solución a este problema es el diseño de un modelo WSD mediante corpus paralelos . [ 47 ] [ 48 ] La creación de Hindi WordNet ha allanado el camino para varios métodos supervisados que han demostrado producir una mayor precisión en la desambiguación de sustantivos. [ 49 ]
Obstáculos locales y resumen
El cuello de botella en la adquisición de conocimiento es quizás el principal impedimento para resolver el problema de la acepción de palabras. Los métodos no supervisados se basan en el conocimiento de los sentidos de las palabras, que solo se encuentra escasamente documentado en diccionarios y bases de datos léxicas. Los métodos supervisados dependen fundamentalmente de la existencia de ejemplos anotados manualmente para cada sentido de palabra, un requisito que hasta ahora solo se puede cumplir para un número limitado de palabras con fines de prueba, como se hace en los ejercicios de Senseval .
Una de las tendencias más prometedoras en la investigación de WSD es el uso del corpus más grande jamás accesible, la World Wide Web , para adquirir información léxica automáticamente. [ 50 ] Tradicionalmente, WSD se ha entendido como una tecnología intermedia de ingeniería del lenguaje que podría mejorar aplicaciones como la recuperación de información (RI). En este caso, sin embargo, lo contrario también es cierto: los motores de búsqueda web implementan técnicas de RI simples y robustas que pueden extraer con éxito de la Web información para usar en WSD. La histórica falta de datos de entrenamiento ha provocado la aparición de algunos algoritmos y técnicas nuevos, como se describe en Adquisición automática de corpus etiquetados por sentido .
Fuentes de conocimiento externas
El conocimiento es un componente fundamental de la WSD. Las fuentes de conocimiento proporcionan datos esenciales para asociar sentidos con palabras. Pueden variar desde corpus de textos, ya sean sin etiquetar o anotados con sentidos de las palabras, hasta diccionarios legibles por máquina, tesauros, glosarios, ontologías, etc. Se pueden [ 51 ] [ 52 ] clasificar de la siguiente manera:
Estructurado:
No estructurado:
- Recursos de colocación
- Otros recursos (como listas de frecuencia de palabras , listas de palabras vacías , etiquetas de dominio, [ 53 ] etc.)
- Corpus : corpus sin procesar y corpus con anotaciones semánticas
Evaluación
Comparar y evaluar diferentes sistemas de detección de significados es extremadamente difícil debido a las distintas series de datos de prueba, inventarios de significados y recursos de conocimiento empleados. Antes de la organización de campañas de evaluación específicas, la mayoría de los sistemas se evaluaban con conjuntos de datos internos, a menudo de pequeña escala . Para probar un algoritmo, los desarrolladores debían dedicar tiempo a anotar todas las ocurrencias de palabras. Además, comparar métodos, incluso con el mismo corpus, resulta imposible si existen diferentes inventarios de significados.
Para definir conjuntos de datos y procedimientos de evaluación comunes, se han organizado campañas de evaluación pública. Senseval ( ahora llamado SemEval ) es una competición internacional de desambiguación de sentidos de palabras que se celebra cada tres años desde 1998: Senseval -1 ( 1998 ), Senseval-2 (2001), Senseval-3 (2004) y su sucesor, SemEval (2007). El objetivo de la competición es organizar distintas conferencias, preparar y anotar manualmente corpus para probar sistemas, realizar una evaluación comparativa de sistemas WSD en varios tipos de tareas, incluyendo WSD de todas las palabras y de muestras léxicas para diferentes idiomas y, más recientemente, nuevas tareas como el etiquetado de roles semánticos , WSD de glosas, sustitución léxica , etc. Los sistemas presentados para su evaluación en estas competiciones suelen integrar diferentes técnicas y a menudo combinan métodos supervisados y basados en el conocimiento (especialmente para evitar un mal rendimiento debido a la falta de ejemplos de entrenamiento).
En los últimos años (2007-2012) , las opciones de tareas de evaluación de WSD han aumentado y el criterio para evaluar WSD ha cambiado drásticamente según la variante de la tarea de evaluación de WSD. A continuación se enumeran las diversas tareas de WSD:
Opciones de diseño de tareas
A medida que la tecnología evoluciona, las tareas de desambiguación del sentido de las palabras (WSD, por sus siglas en inglés) se desarrollan en diferentes variantes, orientándose hacia diversas líneas de investigación y abarcando más idiomas:
- Las tareas clásicas de evaluación monolingüe de WSD utilizan WordNet como inventario de sentidos y se basan en gran medida en la clasificación supervisada / semisupervisada con los corpus anotados manualmente en cuanto a sentidos: [ 54 ]
- El sistema WSD de inglés clásico utiliza Princeton WordNet como inventario de sentidos y la entrada de clasificación principal se basa normalmente en el corpus SemCor.
- La WSD clásica para otros idiomas utiliza sus respectivos WordNet como inventarios de sentidos y corpus anotados por sentidos etiquetados en sus respectivos idiomas. A menudo, los investigadores también recurren al corpus SemCor y a los bitextos alineados con el inglés como idioma de origen .
- La tarea de evaluación de WSD interlingüe también se centra en WSD en dos o más idiomas simultáneamente. A diferencia de las tareas de WSD multilingües, en lugar de proporcionar ejemplos anotados manualmente para cada sentido de un sustantivo polisémico, el inventario de sentidos se construye a partir de corpus paralelos, por ejemplo, el corpus Europarl. [ 55 ]
- Las tareas de evaluación de WSD multilingües se centraron en WSD en dos o más idiomas simultáneamente, utilizando sus respectivos WordNets como inventarios de sentidos o BabelNet como inventario de sentidos multilingüe. [ 56 ] Evolucionó a partir de las tareas de evaluación de WSD de traducción que tuvieron lugar en Senseval-2. Un enfoque popular es realizar WSD monolingüe y luego mapear los sentidos del idioma de origen a las traducciones de palabras correspondientes del idioma de destino. [ 57 ]
- La tarea de inducción y desambiguación del sentido de las palabras es una evaluación de tareas combinadas donde el inventario de sentidos se induce primero a partir de un conjunto de datos de entrenamiento fijo , que consiste en palabras polisémicas y la oración en la que aparecen, luego se realiza la desambiguación del sentido de las palabras en un conjunto de datos de prueba diferente . [ 58 ]
Software
- Babelfy, [ 59 ] un sistema unificado de última generación para la desambiguación del sentido de las palabras y la vinculación de entidades en varios idiomas
- BabelNet API, [ 60 ] una API de Java para la desambiguación del sentido de las palabras multilingüe basada en el conocimiento en 6 idiomas diferentes utilizando la red semántica BabelNet
- WordNet::SenseRelate, [ 61 ] un proyecto que incluye sistemas gratuitos y de código abierto para la desambiguación del sentido de las palabras y la desambiguación del sentido de las muestras léxicas.
- UKB: Graph Base WSD, [ 62 ] una colección de programas para realizar desambiguación del sentido de las palabras basada en grafos y similitud/relación léxica utilizando una base de conocimiento léxico preexistente [ 63 ]
- pyWSD, [ 64 ] implementaciones en Python de tecnologías de desambiguación del sentido de las palabras (WSD)
Véase también
Referencias
- ↑ Weaver 1949 .
- ↑ Bar-Hillel 1964 , págs. 174–179.
- ^ Pradhan y col. 2007 , págs. 87–92.
- ↑ Yarowsky 1992 , págs. 454–460.
- ↑ Mihalcea 2007 .
- ↑ A. Moro; A. Raganato; R. Navigli. La vinculación de entidades se encuentra con la desambiguación del sentido de las palabras: un enfoque unificado . Archivado el 8 de agosto de 2014 en Wayback Machine . Transactions of the Association for Computational Linguistics (TACL). 2. págs. 231–244. 2014.
- ↑ Martínez, Ángel R. (enero de 2012). "Etiquetado de partes del discurso: etiquetado de partes del discurso" . Wiley Interdisciplinary Reviews: Computational Statistics . 4 (1): 107– 113. doi : 10.1002/wics.195 . S2CID 62672734. Archivado del original el 15 de julio de 2023. Recuperado el 1 de abril de 2021 .
- ↑ Fellbaum 1997 .
- ↑ Snyder y Palmer 2004 , págs. 41–43.
- ↑ Snow et al. 2007 , págs. 1005–1014.
- ^ Palmer, Babko-Malaya y Dang 2004 , págs .
- ↑ Edmonds 2000 .
- ↑ Kilgarrif 1997 , págs. 91–113. sfn error: no target: CITEREFKilgarrif1997 ( ayuda )
- ↑ Lenat y Guha 1989 .
- ↑ Wilks, Slator y Guthrie 1996 .
- ↑ Lesk 1986 , págs. 24–26.
- ↑ Diamantini, C.; Mircoli, A.; Potena, D.; Storti, E. (1 de junio de 2015). «Desambiguación semántica en un sistema de descubrimiento de información social». Conferencia Internacional de 2015 sobre Tecnologías y Sistemas de Colaboración (CTS) . págs. 326–333 . doi : 10.1109/CTS.2015.7210442 . ISBN 978-1-4673-7647-1. S2CID 13260353 .
- ↑ Agirre, López de Lacalle & Soroa 2009 , págs .
- ↑ Yarowsky 1995 , págs. 189–196.
- ↑ Mitkov, Ruslan (2004). "13.5.3 Dos afirmaciones sobre los sentidos" . The Oxford Handbook of Computational Linguistics . OUP. p. 257. ISBN 978-0-19-927634-9Archivado del original el 22/02/2022 . Consultado el 22/02/2022 .
- ↑ Schütze 1998 , págs. 97-123.
- 1 2 Mikolov, Tomas; Chen, Kai; Corrado, Greg; Dean, Jeffrey (2013-01-16). "Estimación eficiente de representaciones de palabras en el espacio vectorial". arXiv : 1301.3781 [ cs.CL ].
- ↑ Pennington, Jeffrey; Socher, Richard; Manning, Christopher (2014). "Glove: Vectores globales para la representación de palabras". Actas de la Conferencia de 2014 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural (EMNLP) . Stroudsburg, PA, EE. UU.: Asociación de Lingüística Computacional. págs. 1532–1543 . doi : 10.3115/v1/d14-1162 . S2CID 1957433 .
- ↑ Bojanowski, Piotr; Grave, Edouard; Joulin, Armand; Mikolov, Tomas (diciembre de 2017). "Enriquecimiento de vectores de palabras con información de subpalabras" . Transactions of the Association for Computational Linguistics . 5 : 135–146 . arXiv : 1607.04606 . doi : 10.1162/tacl_a_00051 . ISSN 2307-387X .
- ↑ Iacobacci, Ignacio; Pilehvar, Mohammad Taher; Navigli, Roberto (2016). "Embeddings for Word Sense Disambiguation: An Evaluation Study" . Actas de la 54.ª Reunión Anual de la Asociación de Lingüística Computacional (Volumen 1: Artículos extensos) . Berlín, Alemania: Asociación de Lingüística Computacional: 897–907 . doi : 10.18653/v1/P16-1085 . hdl : 11573/936571 . Archivado del original el 28 de octubre de 2019. Recuperado el 28 de octubre de 2019 .
- ↑ Bhingardive, Sudha; Singh, Dhirendra; V, Rudramurthy; Redkar, Hanumant; Bhattacharyya, Pushpak (2015). "Detección no supervisada del sentido más frecuente mediante incrustaciones de palabras" . Actas de la Conferencia de 2015 del Capítulo Norteamericano de la Asociación de Lingüística Computacional: Tecnologías del Lenguaje Humano . Denver, Colorado: Asociación de Lingüística Computacional. pp. 1238–1243 . doi : 10.3115/v1/N15-1132 . S2CID 10778029. Archivado del original el 21-01-2023 . Recuperado el 21-01-2023 .
- ↑ Butnaru, Andrei; Ionescu, Radu Tudor; Hristea, Florentina (2017). "ShotgunWSD: Un algoritmo no supervisado para la desambiguación global del sentido de las palabras inspirado en la secuenciación del ADN" . Actas de la 15.ª Conferencia del Capítulo Europeo de la Asociación de Lingüística Computacional : 916–926 . arXiv : 1707.08084 . Archivado del original el 21 de enero de 2023. Recuperado el 21 de enero de 2023 .
- ↑ Rothe, Sascha; Schütze, Hinrich (2015). "AutoExtend: Extending Word Embeddings to Embeddings for Synsets and Lexemes". Volumen 1: Artículos largos . Asociación de Lingüística Computacional y la Conferencia Conjunta Internacional sobre Procesamiento del Lenguaje Natural. Actas de la 53.ª Reunión Anual de la Asociación de Lingüística Computacional y la 7.ª Conferencia Conjunta Internacional sobre Procesamiento del Lenguaje Natural . Stroudsburg, Pensilvania, EE. UU.: Asociación de Lingüística Computacional. págs. 1793–1803 . arXiv : 1507.01127 . Bibcode : 2015arXiv150701127R . doi : 10.3115/v1/p15-1173 . S2CID 15687295 .
- 1 2 Rothe, Sascha; Schütze, Hinrich (septiembre de 2017). "AutoExtend: Combinando incrustaciones de palabras con recursos semánticos" . Lingüística Computacional . 43 (3): 593– 617. doi : 10.1162/coli_a_00294 . ISSN 0891-2017 .
- 1 2 Ruas, Terry; Grosky, William; Aizawa, Akiko (diciembre de 2019). "Incrustaciones multisensoriales a través de un proceso de desambiguación del sentido de las palabras". Expert Systems with Applications . 136 : 288–303 . arXiv : 2101.08700 . doi : 10.1016/j.eswa.2019.06.026 . hdl : 2027.42/145475 . S2CID 52225306 .
- ^ Gliozzo, Magnini y Strapparava 2004 , págs. 380–387.
- ^ Buitelaar y col. 2006 , págs. 275–298.
- ↑ McCarthy et al. 2007 , págs. 553–590.
- ↑ Mohammad y Hirst 2006 , págs. 121–128.
- ^ Lapata y Keller 2007 , págs .
- ^ Ide, Erjavec y Tufis 2002 , págs .
- ^ Chan y Ng 2005 , págs. 1037-1042.
- ↑ Shieber, Stuart M. (1992). Formalismos gramaticales basados en restricciones: análisis sintáctico e inferencia de tipos para lenguajes naturales y de computación . Massachusetts: MIT Press. ISBN 978-0-262-19324-5Archivado del original el 15/07/2023 . Consultado el 23/12/2018 .
- ↑ Bhattacharya, Indrajit, Lise Getoor y Yoshua Bengio. Desambiguación de sentidos no supervisada mediante modelos probabilísticos bilingües. Archivado el 9 de enero de 2016 en Wayback Machine . Actas de la 42.ª Reunión Anual de la Asociación de Lingüística Computacional. Asociación de Lingüística Computacional, 2004.
- ↑ Diab, Mona y Philip Resnik. Un método no supervisado para el etiquetado de sentidos de palabras utilizando corpus paralelos. Archivado el 4 de marzo de 2016 en Wayback Machine . Actas de la 40.ª Reunión Anual de la Asociación de Lingüística Computacional. Asociación de Lingüística Computacional, 2002.
- ↑ Manish Sinha, Mahesh Kumar, Prabhakar Pande, Laxmi Kashyap y Pushpak Bhattacharyya. Desambiguación del sentido de las palabras en hindi. Archivado el 4 de marzo de 2016 en Wayback Machine . En Simposio Internacional sobre Traducción Automática, Procesamiento del Lenguaje Natural y Sistemas de Apoyo a la Traducción, Delhi, India, 2004.
- ↑ Kilgarrif y Grefenstette 2003 , págs. 333–347. sfn error: no target: CITEREFKilgarrifGrefenstette2003 ( ayuda )
- ^ Litkowski 2005 , págs. 753–761.
- ^ Agirre y Stevenson 2007 , págs .
- ↑ Magnini y Cavaglià 2000 , págs. 1413-1418.
- ↑ Lucia Specia, Maria das Gracas Volpe Nunes, Gabriela Castelo Branco Ribeiro y Mark Stevenson. WSD multilingüe versus monolingüe. Archivado el 10 de abril de 2012 en Wayback Machine . En EACL-2006 Workshop on Making Sense of Sense: Bringing Psycholinguistics and Computational Linguistics Together, páginas 33–40, Trento, Italia, abril de 2006.
- ↑ Els Lefever y Veronique Hoste. Tarea 3 de SemEval-2010: desambiguación del sentido de las palabras entre idiomas. Archivado el 16 de junio de 2010 en Wayback Machine . Actas del Taller sobre Evaluaciones Semánticas: Logros Recientes y Direcciones Futuras. 4 de junio de 2009, Boulder, Colorado.
- ↑ R. Navigli, DA Jurgens, D. Vannella. SemEval-2013 Tarea 12: Desambiguación del sentido de las palabras multilingües Archivado el 8 de agosto de 2014 en Wayback Machine . Actas del séptimo Taller Internacional sobre Evaluación Semántica (SemEval), en la Segunda Conferencia Conjunta sobre Semántica Léxica y Computacional (*SEM 2013), Atlanta, EE. UU., 14-15 de junio de 2013, págs. 222-231.
- ↑ Lucia Specia, Maria das Gracas Volpe Nunes, Gabriela Castelo Branco Ribeiro y Mark Stevenson. WSD multilingüe versus monolingüe. Archivado el 10 de abril de 2012 en Wayback Machine . En EACL-2006 Workshop on Making Sense of Sense: Bringing Psycholinguistics and Computational Linguistics Together, páginas 33–40, Trento, Italia, abril de 2006.
- ↑ Eneko Agirre y Aitor Soroa. Tarea 02 de Semeval-2007: evaluación de sistemas de inducción y discriminación del sentido de las palabras. Archivado el 28 de febrero de 2013 en Wayback Machine . Actas del 4.º Taller Internacional sobre Evaluaciones Semánticas, págs. 7-12, 23-24 de junio de 2007, Praga, República Checa.
- ↑ "Babelfy" . Babelfy. Archivado del original el 8 de agosto de 2014. Consultado el 22 de marzo de 2018 .
- ↑ "API de BabelNet" . Babelnet.org. Archivado del original el 22 de marzo de 2018. Consultado el 22 de marzo de 2018 .
- ↑ "WordNet::SenseRelate" . Senserelate.sourceforge.net. Archivado del original el 21 de marzo de 2018. Consultado el 22 de marzo de 2018 .
- ↑ "UKB: Graph Base WSD" . Ixa2.si.ehu.es. Archivado del original el 12 de marzo de 2018. Consultado el 22 de marzo de 2018 .
- ↑ "Base de conocimiento léxico (LKB)" . Moin.delph-in.net. 5 de febrero de 2018. Archivado del original el 9 de marzo de 2018. Consultado el 22 de marzo de 2018 .
- ↑ alvations. "pyWSD" . Github.com. Archivado del original el 11 de junio de 2018. Consultado el 22 de marzo de 2018 .
Obras citadas
- Agirre, E.; Lopez de Lacalle, A.; Soroa, A. (2009). "WSD basado en conocimiento en dominios específicos: mejor rendimiento que WSD supervisado genérico" (PDF) . Actas de IJCAI . Archivado (PDF) del original el 24 de julio de 2011. Consultado el 17 de enero de 2010 .
- Agirre, E.; Stevenson, M. (2007). «Fuentes de conocimiento para la desambiguación del sentido de las palabras». En Agirre, E.; Edmonds, P. (eds.). Desambiguación del sentido de las palabras: algoritmos y aplicaciones . Nueva York: Springer. ISBN 978-1402068706.
- Bar-Hillel, Y. (1964). Lenguaje e información . Reading, MA: Addison-Wesley.
- Buitelaar, P.; Magnini, B.; Strapparava, C.; Vossen, P. (2006). "Desambiguación del sentido de las palabras específica del dominio". En Agirre, E.; Edmonds, P. (eds.). Desambiguación del sentido de las palabras: algoritmos y aplicaciones . Nueva York: Springer.
- Chan, YS; Ng, HT (2005). Ampliación de la desambiguación del sentido de las palabras mediante textos paralelos . Actas de la 20.ª Conferencia Nacional sobre Inteligencia Artificial. Pittsburgh: AAAI.
- Di Marco, A.; Navigli, R. (2013). "Agrupación y diversificación de resultados de búsqueda web con inducción de sentido de palabras basada en grafos" . Lingüística Computacional . 39 (3). MIT Press: 709– 754. doi : 10.1162/COLI_a_00148 . S2CID 1775181 .
- Edmonds, P. (2000). "Diseño de una tarea para SENSEVAL-2" (Nota técnica). Brighton, Reino Unido: Universidad de Brighton. Archivado del original el 28 de septiembre de 2011. Recuperado el 6 de enero de 2010 .
- Fellbaum, Christiane (1997). «Análisis de una tarea de escritura a mano». Actas del Taller ANLP-97 sobre Etiquetado de Texto con Semántica Léxica: ¿Por qué, Qué y Cómo? Washington D.C.
{{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace ) - Gliozzo, A.; Magnini, B.; Strapparava, C. (2004). Estimación no supervisada de la relevancia del dominio para la desambiguación del sentido de las palabras (PDF) . Actas de la Conferencia de 2004 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural. Barcelona, España: EMNLP.
- Ide, N.; Erjavec, T.; Tufis, D. (2002). Discriminación de sentidos con corpus paralelos (PDF) . Actas del Taller de la ACL sobre Desambiguación del Sentido de las Palabras: Éxitos Recientes y Direcciones Futuras. Filadelfia.
- Lapata, M.; Keller, F. (2007). Un enfoque de recuperación de información para la clasificación de sentidos (PDF) . Actas de la Conferencia de Tecnología del Lenguaje Humano del Capítulo Norteamericano de la Asociación de Lingüística Computacional. Rochester, Nueva York: HLT-NAACL.
- Lenat, D.; Guha, RV (1989). Building Large Knowledge-Based Systems . Addison-Wesley.
- Lesk, M. (1986). Desambiguación automática de sentidos mediante diccionarios legibles por máquina: Cómo distinguir una piña de un cono de helado (PDF) . Actas de SIGDOC-86: 5.ª Conferencia Internacional sobre Documentación de Sistemas. Toronto, Canadá. Archivado del original (PDF) el 3 de agosto de 2010. Consultado el 5 de enero de 2010 .
- Litkowski, KC (2005). «Léxicos y diccionarios computacionales». En Brown, KR (ed.). Enciclopedia del lenguaje y la lingüística (2.ª ed.). Oxford: Elsevier Publishers.
- Magnini, B.; Cavaglià, G. (2000). Integrating subject field codes into WordNet . Proceedings of the 2nd Conference on Language Resources and Evaluation. Atenas, Grecia: LREC.
- McCarthy, D.; Koeling, R.; Weeds, J.; Carroll, J. (2007). "Adquisición no supervisada de sentidos predominantes de las palabras" (PDF) . Lingüística Computacional . 33 (4): 553– 590. doi : 10.1162/coli.2007.33.4.553 .
- McCarthy, D.; Navigli, R. (2009). "The English Lexical Substitution Task" (PDF) . Language Resources and Evaluation . 43 (2). Springer: 139–159 . doi : 10.1007/s10579-009-9084-1 . S2CID 16888516. Archivado (PDF) del original el 9 de julio de 2009. Consultado el 6 de enero de 2010 .
- Mihalcea, R. (abril de 2007). Uso de Wikipedia para la desambiguación automática del sentido de las palabras (PDF) . Actas del capítulo norteamericano de la Asociación de Lingüística Computacional. Rochester, Nueva York: NAACL. Archivado del original (PDF) el 24 de julio de 2008.
- Mohammad, S.; Hirst, G. (2006). Determinación del predominio del sentido de las palabras mediante un tesauro (PDF) . Actas de la 11.ª Conferencia del capítulo europeo de la Asociación de Lingüística Computacional. Trento, Italia: EACL. Archivado (PDF) del original el 7 de agosto de 2011. Consultado el 26 de junio de 2010 .
- Navigli, R. (2006). La agrupación significativa de sentidos ayuda a mejorar el rendimiento de la desambiguación de sentidos de palabras (PDF) . Actas de la 44.ª Reunión Anual de la Asociación de Lingüística Computacional, en conjunto con la 21.ª Conferencia Internacional sobre Lingüística Computacional. Sídney, Australia: COLING-ACL. Archivado del original (PDF) el 29 de junio de 2011.
- Navigli, R.; Crisafulli, G. (2010). Inducción de sentidos de palabras para mejorar la agrupación de resultados de búsqueda web (PDF) . Actas de la Conferencia de 2010 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural. MIT Stata Center, Massachusetts, EE. UU.: EMNLP.
- Navigli, R.; Lapata, M. (2010). "Un estudio experimental de la conectividad de grafos para la desambiguación no supervisada del sentido de las palabras" ( PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 32 ( 4). IEEE Press: 678– 692. Bibcode : 2010ITPAM..32..678N . doi : 10.1109/TPAMI.2009.36 . PMID 20224123. S2CID 1454904. Archivado (PDF) del original el 14 de diciembre de 2010. Recuperado el 20 de marzo de 2010 .
- Navigli, R.; Litkowski, K.; Hargraves, O. (2007). SemEval-2007 Task 07: Coarse-Grained English All-Words Task (PDF) . Proc. of Semeval-2007 Workshop ( SemEval ), in the 45th Annual Meeting of the Association for Computational Linguistics. Praga, Czech Republic: ACL. Archived (PDF) from the original on 2012-03-18 . Retrieve 2010-01-05 .
- Navigli, R.; Velardi, P. (2005). "Interconexiones semánticas estructurales: un enfoque basado en el conocimiento para la desambiguación del sentido de las palabras" ( PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 27 (7): 1075– 1086. Bibcode : 2005ITPAM..27.1075N . doi : 10.1109/TPAMI.2005.149 . PMID 16013755. S2CID 12898695. Archivado (PDF) del original el 9 de julio de 2009. Recuperado el 5 de enero de 2010 .
- Palmer, M.; Babko-Malaya, O.; Dang, HT (2004). Diferentes granularidades de sentido para diferentes aplicaciones (PDF) . Actas del 2.º Taller sobre Sistemas Escalables de Comprensión del Lenguaje Natural en HLT/NAACL. Boston. Archivado (PDF) del original el 30 de septiembre de 2011. Recuperado el 26 de junio de 2010 .
- Ponzetto, SP; Navigli, R. (2010). Desambiguación del sentido de las palabras con gran cantidad de conocimiento que rivaliza con los sistemas supervisados (PDF) . Actas de la 48.ª Reunión Anual de la Asociación de Lingüística Computacional. ACL. Archivado del original (PDF) el 30 de septiembre de 2011.
- Pradhan, S.; Loper, E.; Dligach, D.; Palmer, M. (2007). SemEval-2007 Tarea 17: Muestra léxica en inglés, SRL y todas las palabras (PDF) . Actas del Taller Semeval-2007 (SEMEVAL), en la 45.ª Reunión Anual de la Asociación de Lingüística Computacional. Praga, República Checa: ACL. Archivado (PDF) del original el 18 de marzo de 2012. Recuperado el 5 de enero de 2010 .
- Schütze, H. (1998). "Discriminación automática del sentido de las palabras" (PDF) . Lingüística Computacional . 24 (1): 97–123 . Archivado (PDF) del original el 18 de marzo de 2012. Recuperado el 5 de enero de 2010 .
- Snow, R.; Prakash, S.; Jurafsky, D.; Ng, AY (2007). Aprendizaje para fusionar sentidos de palabras (PDF) . Actas de la Conferencia Conjunta de 2007 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural y Aprendizaje Computacional del Lenguaje Natural. EMNLP-CoNLL.
- Snyder, B.; Palmer, M. (2004). La tarea de análisis de todas las palabras en inglés . Actas del 3er Taller Internacional sobre la Evaluación de Sistemas para el Análisis Semántico de Textos (Senseval-3). Barcelona, España. Archivado del original el 29 de junio de 2011.
- Weaver, Warren (1949). «Traducción» (PDF) . En Locke, WN; Booth, AD (eds.). Traducción automática de idiomas: catorce ensayos . Cambridge, MA: MIT Press. Archivado del original (PDF) el 24 de julio de 2011. Consultado el 5 de enero de 2010 .
- Wilks, Y.; Slator, B.; Guthrie, L. (1996). Palabras eléctricas: diccionarios, computadoras y significados . Cambridge, Massachusetts: MIT Press.
- Yarowsky, D. (1992). Desambiguación del sentido de las palabras mediante modelos estadísticos de las categorías de Roget entrenados en grandes corpus . Actas de la 14.ª conferencia sobre lingüística computacional. COLING.
- Yarowsky, D. (1995). Desambiguación del sentido de las palabras sin supervisión que rivaliza con los métodos supervisados . Actas de la 33.ª Reunión Anual de la Asociación de Lingüística Computacional. Archivado del original el 7 de junio de 2010. Consultado el 15 de diciembre de 2009 .
Lecturas adicionales
- Agirre, Eneko; Edmonds, Philip, eds. (2007). Desambiguación del sentido de las palabras: algoritmos y aplicaciones . Springer. ISBN 978-1402068706.
- Edmonds, Philip; Kilgarriff, Adam (2002). "Introducción al número especial sobre la evaluación de sistemas de desambiguación del sentido de las palabras". Journal of Natural Language Engineering . 8 (4): 279– 291. doi : 10.1017/S1351324902002966 . S2CID 17866880 .
- Ide, Nancy; Véronis, Jean (1998). "Desambiguación del sentido de las palabras: estado del arte" (PDF) . Lingüística Computacional . 24 (1): 1– 40. Archivado (PDF) del original el 18 de mayo de 2013. Recuperado el 26 de marzo de 2013 .
- Jurafsky, Daniel; Martin, James H. (2000). Procesamiento del habla y del lenguaje . Nueva Jersey, EE. UU.: Prentice Hall.
- Kilgarriff, A. (1997). "No creo en los sentidos de las palabras" (PDF) . Comput. Human . 31 (2): 91– 113. doi : 10.1023/A:1000583911091 . S2CID 3265361. Archivado (PDF) del original el 24 de julio de 2011. Recuperado el 7 de enero de 2010 .
- Kilgarriff, A.; Grefenstette, G. (2003). "Introducción al número especial sobre la Web como corpus" (PDF) . Lingüística Computacional . 29 (3): 333– 347. doi : 10.1162/089120103322711569 . S2CID 2649448 .
- Manning, Christopher D.; Schütze, Hinrich (1999). Fundamentos del procesamiento estadístico del lenguaje natural . Cambridge, Massachusetts: MIT Press.
- Navigli, Roberto (2009). "Desambiguación del sentido de las palabras: una revisión" (PDF) . ACM Computing Surveys . 41 (2): 1– 69. doi : 10.1145/1459352.1459355 . S2CID 461624 .
- Resnik, Philip; Yarowsky, David (2000). "Distinguir sistemas y distinguir sentidos: nuevos métodos de evaluación para la desambiguación del sentido de las palabras" . Ingeniería del lenguaje natural . 5 (2): 113– 133. doi : 10.1017/S1351324999002211 . S2CID 19915022 .
- Yarowsky, David (2001). "Desambiguación del sentido de las palabras". En Dale et al. (eds.). Manual de procesamiento del lenguaje natural . Nueva York: Marcel Dekker. pp. 629–654 .
Enlaces externos
- Número especial de Lingüística Computacional sobre la desambiguación del sentido de las palabras (1998)
- Tutorial sobre la desambiguación del sentido de las palabras, por Rada Mihalcea y Ted Pedersen (2005).
- Desambiguación del sentido de las palabras
- Ambigüedad
- Lingüística computacional
- semántica léxica
- Procesamiento del lenguaje natural
- Semántica