Articulo de referencia

Machine translation software usability

The sections below give objective criteria for evaluating the usability of machine translation software output. Stationarity or canonical form Do repeated translations converge ...

The sections below give objective criteria for evaluating the usability of machine translation software output.

Stationarity or canonical form

Do repeated translations converge on a single expression in both languages? I.e. does the translation method show stationarity or produce a canonical form? Does the translation become stationary without losing the original meaning? This metric has been criticized as not being well correlated with BLEU (BiLingual Evaluation Understudy) scores.[1]

Adaptive to colloquialism, argot or slang

Is the system adaptive to colloquialism, argot or slang? The French language has many rules for creating words in the speech and writing of popular culture. Two such rules are: (a) The reverse spelling of words such as femme to meuf. (This is called verlan.) (b) The attachment of the suffix -ard to a noun or verb to form a proper noun. For example, the noun faluche means "student hat". The word faluchard formed from faluche colloquially can mean, depending on context, "a group of students", "a gathering of students" and "behavior typical of a student". The Google translator as of 28 December 2006 doesn't derive the constructed words as for example from rule (b), as shown here:

Il y a une chorale falucharde mercredi, venez nombreux, les faluchards chantent des paillardes! ==> There is a choral society falucharde Wednesday, come many, the faluchards sing loose-living women!

French argot has three levels of usage:[2]

  1. familier or friendly, acceptable among friends, family and peers but not at work
  2. grossier or swear words, acceptable among friends and peers but not at work or in family
  3. verlan or ghetto slang, acceptable among lower classes but not among middle or upper classes

The United States National Institute of Standards and Technology conducts annual evaluations Archived 2009-03-22 at the Wayback Machine of machine translation systems based on the BLEU-4 criterion . A combined method called IQmt which incorporates BLEU and additional metrics NIST, GTM, ROUGE and METEOR has been implemented by Gimenez and Amigo .

Well-formed output

¿La salida es gramatical o está bien formada en el idioma de destino? El uso de una interlingua debería ser útil en este sentido, ya que con una interlingua fija se debería poder escribir una correspondencia gramatical entre la interlingua y el idioma de destino. Considere el siguiente texto en árabe y el resultado de la traducción al inglés del traductor de Google del 27 de diciembre de 2006.Esta salida del traductor de Google no se analiza utilizando una gramática inglesa razonable :

وعن حوادث التدافع عند شعيرة رمي الجمرات -التي كثيرا ما يسقط فيها العديد من الضحايا- أشار الأمير نايف إلى إدخال "تحسينات كثيرة في جسر الجمرات ستمنع بإذن الله حدوث أي تزاحم". ==> Y los incidentes en el ritual de lanzamiento de carbuncos, que a menudo cae donde muchas de las víctimas - el príncipe Nayef señaló la introducción de "muchas mejoras en el puente. Los carbuncos Dios detendría la aparición de cualquier competencia".

preservación semántica

¿Las retraducciones repetidas conservan la semántica de la oración original? Por ejemplo, consideremos el siguiente texto en inglés que se tradujo varias veces al francés y se volvió a traducir utilizando el traductor de Google el 27 de diciembre de 2006:

Mejor un día antes que un día después.

Mejorar un día plus tôt qu'un día tard. ==>

Mejorar un día antes que un día después. ==>

Pour améliorer un jour plus tôt qu'un jour tard. ==>

Mejorar un día antes que un día después.

Como se señaló anteriormente y en [ 1 ] este tipo de traducción de ida y vuelta es un método de evaluación muy poco fiable.

Confiabilidad y seguridad

Una peculiaridad interesante de Google Translate a fecha de 24 de enero de 2008 (corregida a fecha de 25 de enero de 2008) es el siguiente resultado al traducir del inglés al español, que muestra un chiste incrustado en el diccionario inglés-español que tiene un significado adicional dados los acontecimientos recientes:

Heath Ledger ha muerto ==>

Tom Cruise está muerto

Esto plantea la cuestión de la fiabilidad al confiar en un sistema de traducción automática integrado en un sistema crítico para la vida, en el que dicho sistema interviene en un proceso de toma de decisiones crítico para la seguridad . Asimismo, plantea la cuestión de si, en un uso determinado, el software del sistema de traducción automática es seguro frente a los piratas informáticos .

Se desconoce si esta función de Google Translate fue el resultado de una broma o un error informático, o quizás una consecuencia no intencionada del uso de un método como la traducción automática estadística . El 24 de enero de 2008, periodistas de CNET Networks solicitaron una explicación a Google; Google solo declaró que se trataba de un "problema interno de Google Translate". [ 3 ] La traducción errónea fue objeto de mucha hilaridad y especulación en internet. [ 4 ] [ 5 ]

Si se trata de una consecuencia no intencionada del uso de un método como la traducción automática estadística , y no de una broma o un truco, entonces este suceso demuestra una posible fuente de falta de fiabilidad crítica en el método de traducción automática estadística.

En las traducciones humanas, en particular por parte de los intérpretes , a menudo se comenta la selectividad del traductor al realizar una traducción cuando una de las dos partes a las que sirve el intérprete conoce ambos idiomas.

Esto nos lleva a la cuestión de si una traducción en particular podría considerarse verificable . En este caso, una traducción de ida y vuelta convergente sería una forma de verificación.

Véase también

Notas

  1. 1 2 Somers, Harold (2005). "Traducción de ida y vuelta: ¿Para qué sirve?" . Actas del Taller Australasiático de Tecnología Lingüística ALTW 2005. Sídney: 127–133 .
  2. "La agonía de Argot", Chitlins & Camembert, 28 de octubre de 2005
  3. "Un error de Google Translate confunde a Heath Ledger con Tom Cruise", por Caroline McCarthy , CNET Networks , 24 de enero de 2008
  4. «"Tom Cruise" es la versión en español de "Heath Ledger"», gawker.com, 24 de enero de 2008. Archivado el 28 de enero de 2008 en Wayback Machine .
  5. "Tom Cruise está muerto", Ray Leon Blog Project, 24 de enero de 2008. Archivado el 29 de octubre de 2008 en Wayback Machine .

Referencias

  • Giménez, Jesús y Enrique Amigo. (2005) IQmt: Un marco para la evaluación de la traducción automática .
  • NIST. Evaluaciones anuales del sistema de traducción automática y plan de evaluación .
  • Papineni, Kishore, Salim Roukos, Todd Ward y Wei-Jing Zhu. (2002) BLEU: Un método para la evaluación automática de la traducción automática. Actas de la 40.ª Reunión Anual de la ACL, julio de 2002, págs.  311-318.