Un texto paralelo es un texto colocado junto a su traducción o traducciones. [ 1 ] [ 2 ] La alineación de textos paralelos es la identificación de las oraciones correspondientes en ambas mitades del texto paralelo. La Biblioteca Clásica Loeb y la Biblioteca Sánscrita Clay son dos ejemplos de series de textos bilingües. Las Biblias de referencia pueden contener los idiomas originales y una traducción, o varias traducciones por sí mismas, para facilitar la comparación y el estudio; la Hexapla de Orígenes (griego para "séxtuple") colocó seis versiones del Antiguo Testamento una al lado de la otra. Un ejemplo famoso es la Piedra Rosetta , cuyo descubrimiento permitió comenzar a descifrar el idioma del Antiguo Egipto .
Las grandes colecciones de textos paralelos se denominan corpus paralelos (véase corpus textual ). La alineación de corpus paralelos a nivel de oración es un requisito previo para muchas áreas de la investigación lingüística . Durante la traducción, el traductor puede dividir, fusionar, eliminar, insertar o reordenar oraciones. Esto convierte la alineación en una tarea compleja.
Los textos paralelos pueden utilizarse en la enseñanza de idiomas . [ 3 ]
Tipos de corpus paralelos
Los corpus paralelos se pueden clasificar en cuatro categorías principales:
- Un corpus paralelo contiene traducciones del mismo documento en dos o más idiomas, alineadas al menos a nivel de oración. Estos suelen ser menos frecuentes que los corpus menos comparables.
- Un corpus paralelo con errores gramaticales contiene oraciones bilingües que no están perfectamente alineadas o cuyas traducciones son de baja calidad. Sin embargo, la mayor parte de su contenido son traducciones bilingües de un documento específico.
- Se ha creado un corpus comparable a partir de documentos bilingües sin traducir y no alineados por frases, pero en este caso los documentos están alineados por tema.
- Un corpus casi comparable incluye documentos bilingües muy heterogéneos y no paralelos que pueden o no estar alineados temáticamente.
Ruido en los corpus
Los grandes corpus que se utilizan como conjuntos de entrenamiento para algoritmos de traducción automática suelen extraerse de grandes conjuntos de fuentes similares, como bases de datos de artículos de noticias escritos en el primer y segundo idioma que describen eventos similares.
Sin embargo, los fragmentos extraídos pueden ser ruidosos, con elementos adicionales insertados en cada corpus. Las técnicas de extracción pueden diferenciar entre elementos bilingües representados en ambos corpus y elementos monolingües representados en un solo corpus para extraer fragmentos paralelos más limpios de elementos bilingües. Los corpus comparables se utilizan para obtener directamente conocimiento para fines de traducción. Sin embargo, es difícil obtener datos paralelos de alta calidad, especialmente para lenguas con pocos recursos. [ 4 ]
Bitext
En el campo de los estudios de traducción, un bitexto es un documento fusionado compuesto por versiones de un texto determinado tanto en la lengua de origen como en la lengua meta.
Los bitextos se generan mediante un programa informático llamado herramienta de alineación o herramienta de bitextos , que alinea automáticamente las versiones original y traducida de un mismo texto. La herramienta suele comparar estos dos textos frase por frase. Una colección de bitextos se denomina base de datos de bitextos o corpus bilingüe , y se puede consultar mediante una herramienta de búsqueda.
Bitextos y memorias de traducción
Los bitextos presentan algunas similitudes con las memorias de traducción. La diferencia más notable radica en que una memoria de traducción pierde el contexto original, mientras que un bitexto conserva el orden original de las oraciones. Sin embargo, algunas implementaciones de memorias de traducción, como Translation Memory eXchange (TMX), un formato XML estándar para el intercambio de memorias de traducción entre programas de traducción asistida por ordenador (TAO), permiten preservar el orden original de las oraciones.
Los bitextos están diseñados para ser consultados por un traductor humano , no por una máquina. Por lo tanto, los pequeños errores de alineación o las discrepancias menores que provocarían un fallo en la memoria de traducción carecen de importancia.
En su artículo original de 1988, Harris también postuló que el bitexto representa cómo los traductores mantienen juntos sus textos fuente y meta en su memoria de trabajo mental a medida que avanzan. Sin embargo, esta hipótesis no ha sido retomada. [ 5 ]
Los bitextos en línea y las memorias de traducción también pueden denominarseConcordancias bilingües en línea. Varias están disponibles en la web pública, incluyendo Linguée , Reverso y Tradooit. [ 6 ] [ 7 ] [ 8 ]
Véase también
Referencias
- ↑ Chan, Sin-Wai (2015). Routledge Encyclopedia of Translation Technology . Londres: Routledge. ISBN 978-1-315-74912-9.
- ↑ Williams, Philip; Sennrich, Rico; Post, Matt; Koehn, Philipp (2016). Traducción automática estadística basada en sintaxis . Morgan & Claypool. ISBN 978-1-62705-502-4.
- ↑ Abdallah, A. (2021). Impacto del uso de la estrategia de texto paralelo en la enseñanza de la lectura a estudiantes de nivel intermedio II. International Journal on Social and Education Sciences (IJonSES), 3(1), 95-108. https://doi.org/10.46328/ijonses.48
- ↑ Wołk, Krzysztof (2015). "Metodología de filtrado de corpus comparables y paralelos ruidosos para la extracción de datos equivalentes bilingües a nivel de oración" . Ciencias de la Computación . 16 (2): 169– 184. arXiv : 1510.04500 . Bibcode : 2015arXiv151004500W . doi : 10.7494/csci.2015.16.2.169 . S2CID 12860633 .
- ↑ Harris, B. (marzo de 1988). «Bitexto, un nuevo concepto en la teoría de la traducción» (PDF) . Language Monthly . 54 : 8–10 . Archivado del original (PDF) el 2 de marzo de 2018.
- ↑ Genette, Marie (2016). ¿Qué tan confiables son los concordantes bilingües en línea? Una investigación de Linguee , TradooIT , WeBiText y ReversoContext y su confiabilidad a través de un análisis contrastivo de preposiciones complejas del francés al inglés (tesis de maestría). Université catholique de Louvain & Universitetet i Oslo. hdl : 10852/51577 .
- ↑ «TradooIT – Concordancia bilingüe» .
- ↑ Désilets, Alain; Farley, Benoît; Stojanović, Marta; Patenaude, Geneviève (2008). WeBiText: Construyendo grandes memorias de traducción heterogéneas a partir de contenido web paralelo . Actas de Translating and the Computer. Vol. 30. pp. 27– 28. S2CID 14586900 .
Enlaces externos
corpus paralelos
- El corpus paralelo multilingüe JRC-Acquis del conjunto del derecho de la Unión Europea (UE): Acquis Communautaire con 231 pares de idiomas. [ 1 ]
- Corpus paralelo de las actas del Parlamento Europeo 1996-2011
- El proyecto Opus tiene como objetivo recopilar corpus paralelos disponibles libremente. Archivado el 14 de diciembre de 2013 en la Wayback Machine.
- Corpus bilingüe japonés-inglés de los artículos de Wikipedia sobre Kioto archivado el 22 de agosto de 2012 en Wayback Machine.
- COMPARA – Corpus paralelos portugués/inglés
- INVESTIGACIÓN DE TÉRMINOS – Corpus paralelos en inglés, ruso y francés (principales tratados, convenciones, acuerdos internacionales, etc.).
- TradooIT – Inglés/Francés/Español – Herramientas online gratuitas
- Nunavut Hansard - corpus paralelo inglés/inuktitut
- ParaSol – Un corpus paralelo de lenguas eslavas y otras lenguas
- Glosbe: Corpus paralelos multilingües. Archivado el 27/05/2013 en Wayback Machine con interfaz de búsqueda en línea.
- InterCorp: Un corpus paralelo multilingüe de 40 idiomas alineado con el checo, con interfaz de búsqueda en línea.
- myCAT – Olanto , concordanciador (código abierto AGPL) con búsqueda en línea en los corpus JCR y UNO.
- TAUS , con interfaz de búsqueda en línea.
- Linguatools: corpus paralelos multilingües, interfaz de búsqueda en línea.
- Corpus EUR-Lex: corpus creado a partir de la base de datos EUR-Lex que consta de legislación de la Unión Europea y otros documentos públicos de la Unión Europea.
Documentación
- Bibliografía sobre procesamiento de texto paralelo de J. Veronis y M.-D. Mahimon
- Actas del Taller de 2003 sobre la Creación y el Uso de Textos Paralelos
- Actas del Taller de 2005 sobre la Creación y el Uso de Textos Paralelos
Herramientas de alineación
- Herramienta de alineación GIZA++ (1999)
- Uplug – herramientas para el procesamiento de corpus paralelos (2003)
- Implementación del algoritmo de alineación de oraciones de Gale y Church (2005)
- El alineador de oraciones Hunalign (2005)
- Champollion (2006)
- mALIGNa (2008–2020)
- Alineador de oraciones Gargantua (2010)
- Bleualign – alineación de oraciones basada en traducción automática (2010)
- YASA (2013)
- Herramienta de alineación jerárquica (HAT) (2018) Archivada el 5 de julio de 2020 en Wayback Machine
- Algoritmo de alineación de oraciones Vecalign (2019)
- Herramienta de alineación web en la Universidad de Grenoble
- ↑ Ralf, Ralf Steinberger; Pouliquén, Bruno; Widiger, Anna; Ignat, Camelia; Erjavec, Tomaž; Tufiş, Dan; Varga, Daniel (2006). "El JRC-Acquis: un corpus paralelo alineado multilingüe con más de 20 idiomas" . Actas de la Quinta Conferencia Internacional sobre Evaluación y Recursos Lingüísticos (LREC'2006). Génova, Italia, 24 a 26 de mayo de 2006 .
- bases de datos de traducción
- Adquisición del lenguaje
- Lingüística de corpus