Articulo de referencia

Alineación de palabras del bitexto

La alineación de palabras en dos textos encuentra las palabras correspondientes en dos textos. La alineación de palabras en un bitexto , o simplemente alineación de palabras, es...

La alineación de palabras en dos textos encuentra las palabras correspondientes en dos textos.

La alineación de palabras en un bitexto , o simplemente alineación de palabras, es una tarea de procesamiento del lenguaje natural que consiste en identificar relaciones de traducción entre las palabras (o, más raramente, unidades multipalabra) de un bitexto . Esto da como resultado un grafo bipartito entre los dos lados del bitexto, con un arco entre dos palabras si y solo si son traducciones una de la otra. La alineación de palabras se suele realizar después de que la alineación de oraciones ya haya identificado pares de oraciones que son traducciones entre sí.

La alineación de palabras en bitextos es una tarea de apoyo importante para la mayoría de los métodos de traducción automática estadística . Los parámetros de los modelos de traducción automática estadística se estiman típicamente observando bitextos alineados [ 1 ] y, a la inversa, la alineación automática de palabras se realiza típicamente eligiendo la alineación que mejor se ajusta a un modelo de traducción automática estadística. La aplicación circular de estas dos ideas da como resultado una instancia del algoritmo de maximización de la expectativa [ 2 ] .

Este enfoque de entrenamiento es un ejemplo de aprendizaje no supervisado , ya que al sistema no se le proporcionan ejemplos del tipo de salida deseada, sino que intenta encontrar valores para el modelo no observado y alineaciones que mejor expliquen el bitexto observado. Trabajos recientes han comenzado a explorar métodos supervisados ​​que se basan en presentar al sistema un número (generalmente pequeño) de oraciones alineadas manualmente. [ 3 ] Además del beneficio de la información adicional proporcionada por la supervisión, estos modelos también suelen ser capaces de aprovechar más fácilmente la combinación de muchas características de los datos, como el contexto, la estructura sintáctica , la categoría gramatical o la información del léxico de traducción , que son difíciles de integrar en los modelos estadísticos generativos utilizados tradicionalmente.

Además del entrenamiento de sistemas de traducción automática, otras aplicaciones de la alineación de palabras incluyen la inducción de léxicos de traducción , el descubrimiento del sentido de las palabras , la desambiguación del sentido de las palabras y la proyección interlingüística de información lingüística.

Capacitación

Modelos de IBM

Los modelos de IBM [ 4 ] se utilizan en la traducción automática estadística para entrenar un modelo de traducción y un modelo de alineación. Son una instancia del algoritmo de Expectación-maximización : en el paso de expectativa se calculan las probabilidades de traducción dentro de cada oración, y en el paso de maximización se acumulan para obtener probabilidades de traducción globales. Características:

  • Modelo 1 de IBM: probabilidades de alineación léxica
  • Modelo IBM 2: posiciones absolutas
  • IBM Model 3: fertilidad (admite inserciones)
  • Modelo IBM 4: posiciones relativas
  • IBM Model 5: corrige deficiencias (garantiza que no haya dos palabras alineadas en la misma posición).

MMM

Vogel et al. [ 5 ] desarrollaron un enfoque que presenta probabilidades de traducción léxica y alineación relativa mapeando el problema a un modelo oculto de Markov . Los estados y las observaciones representan las palabras de origen y destino respectivamente. Las probabilidades de transición modelan las probabilidades de alineación. En el entrenamiento, las probabilidades de traducción y alineación se pueden obtener deγt(i){\displaystyle \gamma _{t}(i)}yξt(i,j){\displaystyle \xi _{t}(i,j)}en el algoritmo de avance-retroceso .

Software

  • GIZA++ (software libre bajo licencia GPL)
    • El conjunto de herramientas de alineación más utilizado, que implementa los famosos modelos de IBM con diversas mejoras.
  • El alineador de palabras de Berkeley (software libre bajo licencia GPL)
    • Otro alineador ampliamente utilizado implementa la alineación por acuerdo y modelos discriminativos para la alineación.
  • Nilo (software libre bajo licencia GPL)
    • Un alineador de palabras supervisado que puede utilizar información sintáctica tanto del origen como del destino.
  • pialign (software libre bajo la Licencia Pública Común)
    • Un alineador que alinea tanto palabras como frases utilizando aprendizaje bayesiano y gramáticas de transducción por inversión.
  • Herramientas de alineación Natura (NATools, software libre bajo licencia GPL)
  • Alineador UNL (software libre bajo licencia Creative Commons Attribution 3.0 Unported)
  • Mapeo y alineación geométrica (GMA) (software libre bajo licencia GPL)
  • HunAlign (software libre bajo licencia LGPL-2.1)
  • Anymalign (software libre bajo licencia GPL)

Referencias

  1. PF Brown et al. 1993. The Mathematics of Statistical Machine Translation: Parameter Estimation Archived April 24, 2009, at the Wayback Machine . Computational Linguistics, 19(2):263–311.
  2. Och, FJ y Tillmann, C. y Ney, H. y otros 1999, Modelos de alineación mejorados para la traducción automática estadística , Actas de la Conferencia Conjunta SIGDAT sobre Métodos Empíricos en Procesamiento del Lenguaje Natural y Corpus Muy Grandes
  3. ACL 2005: Creación y uso de textos paralelos para lenguas con recursos escasos. Archivado el 9 de mayo de 2009 en Wayback Machine .
  4. Philipp Koehn (2009). Traducción automática estadística . Cambridge University Press. pág.  86 y ss. ISBN 978-0521874151Consultado el 21 de octubre de 2015 .
  5. S. Vogel, H. Ney y C. Tillmann. 1996. Alineación de palabras basada en HMM en traducción estadística. Archivado el 2 de marzo de 2018 en Wayback Machine . En COLING '96: 16.ª Conferencia Internacional sobre Lingüística Computacional, págs. 836-841, Copenhague, Dinamarca.
Obtenido de " https://en.wikipedia.org/w/index.php?title=Bitext_word_alignment&oldid=1188269969 "