Las tareas clásicas de evaluación de desambiguación del sentido de las palabras monolingües utilizan WordNet como su inventario de sentidos y se basan en gran medida en la clasificación supervisada / semisupervisada con corpus anotados manualmente en el sentido: [ 1 ]
- El sistema WSD de inglés clásico utiliza Princeton WordNet como inventario de sentidos y la entrada de clasificación principal normalmente se basa en el corpus SemCor .
- La WSD clásica para otros idiomas utiliza sus respectivos WordNet como inventarios de sentidos y corpus anotados de sentidos etiquetados en sus respectivos idiomas. A menudo, los investigadores también recurren al corpus SemCor y alinean los bitextos con el inglés como idioma de origen .
Inventarios sensoriales
Durante el primer taller de Senseval se adoptó el inventario de sentidos HECTOR. La razón para adoptar un inventario de sentidos previamente desconocido fue principalmente evitar el uso de inventarios de sentidos de palabras populares y detallados (como WordNet), que podrían hacer que los experimentos fueran injustos o sesgados. Sin embargo, dada la falta de cobertura de dichos inventarios, desde el segundo taller de Senseval se ha adoptado el inventario de sentidos WordNet. Los ejercicios de desambiguación de sentidos de palabras (WSD) requieren un diccionario para especificar los sentidos de las palabras que se van a desambiguar y un corpus de datos lingüísticos para desambiguar. WordNet es el ejemplo más popular de inventario de sentidos. La razón para adoptar la base de datos HECTOR durante Senseval-1 fue que el inventario WordNet ya estaba disponible públicamente. [ 2 ]
Descripción de la tarea
La comparación de métodos se puede dividir en 2 grupos según la cantidad de palabras a analizar. La diferencia radica en la cantidad de análisis y procesamiento:
- La tarea de desambiguar todas las palabras implica desambiguar todas las palabras del texto.
- La muestra léxica consiste en desambiguar algunas palabras objetivo previamente elegidas.
Se asume que la primera ofrece una evaluación más realista, aunque requiere pruebas de resultados muy laboriosas. Inicialmente, solo se utilizó la segunda en la evaluación, pero posteriormente se incluyó la primera.
Los organizadores de las muestras léxicas debían elegir aquellas en las que se probarían los sistemas. Una crítica a las primeras incursiones en la evaluación de la discriminación de palabras con muestras léxicas es que la muestra léxica se había elegido según el criterio del experimentador (o para que coincidiera con las selecciones de experimentadores anteriores). Para English Senseval, se diseñó un marco de muestreo en el que las palabras se clasificaron según su frecuencia (en el BNC) y su nivel de polisemia (en WordNet). Además, se debatió el problema del etiquetado de partes de la oración de inclusión y se decidió que las muestras debían ser palabras con una categoría gramatical conocida y algunos indeterminados (por ejemplo, 15 tareas de sustantivos, 13 tareas de verbos, 8 adjetivos y 5 indeterminados).
Para fines comparativos, se utilizan algoritmos conocidos, aunque sencillos, denominados algoritmos de referencia. Estos incluyen diferentes variantes del algoritmo de Lesk o del algoritmo de sentido más frecuente .
Medidas de evaluación
Durante la evaluación de los sistemas WSD se utilizan dos medidas de rendimiento principales:
- Precisión : la fracción de asignaciones del sistema realizadas que son correctas.
- Recuperación : la fracción del total de instancias de palabras asignadas correctamente por un sistema.
Si un sistema asigna un valor a cada palabra, entonces la precisión y la exhaustividad son iguales y se pueden denominar exactitud . Este modelo se ha ampliado para tener en cuenta sistemas que devuelven un conjunto de significados con ponderaciones para cada ocurrencia.
Véase también
Referencias
- ↑ Lucia Specia, Maria das Gracas Volpe Nunes, Gabriela Castelo Branco Ribeiro y Mark Stevenson. WSD multilingüe versus monolingüe. Archivado el 10 de abril de 2012 en Wayback Machine . En EACL-2006 Workshop on Making Sense of Sense: Bringing Psycholinguistics and Computational Linguistics Together, páginas 33–40, Trento, Italia, abril de 2006.
- ↑ Adam Kilgarriff y Joseph Rosenzweig. 2000. Marco y resultados en inglés . Computers and the Humanities 34 (1-2), Número especial sobre SENSEVAL.
- Lingüística computacional
- Procesamiento del lenguaje natural
- Semántica