La paráfrasis en lingüística computacional es la tarea de procesamiento del lenguaje natural que consiste en detectar y generar paráfrasis . Las aplicaciones de la paráfrasis son variadas e incluyen la recuperación de información , la respuesta a preguntas , la generación de resúmenes de texto y la detección de plagio . [ 1 ] La paráfrasis también es útil en la evaluación de la traducción automática , [ 2 ] así como en el análisis semántico [ 3 ] y la generación [ 4 ] de nuevas muestras para ampliar los corpus existentes . [ 5 ]
Generación de paráfrasis
Alineamiento de secuencias múltiples
Barzilay y Lee [ 5 ] propusieron un método para generar paráfrasis mediante el uso de corpus paralelos monolingües , es decir, artículos de noticias que cubren el mismo evento en el mismo día. El entrenamiento consiste en utilizar la alineación de secuencias múltiples para generar paráfrasis a nivel de oración a partir de un corpus sin anotar. Esto se hace mediante
- encontrar patrones recurrentes en cada corpus individual, es decir " X (lesionados/heridos) Y personas, Z gravemente", donde X, Y, Z son variables
- encontrar emparejamientos entre tales patrones que representan paráfrasis, es decir " X (herido/lesionado) a Y personas, Z gravemente" y " Y fueron (heridos/lesionados) por X , entre ellos Z estaban en estado grave"
Esto se logra agrupando primero oraciones similares mediante la superposición de n-gramas . Se encuentran patrones recurrentes dentro de los grupos mediante la alineación de secuencias múltiples. Luego, se determina la posición de las palabras clave al encontrar áreas de alta variabilidad dentro de cada grupo, es decir, entre palabras compartidas por más del 50 % de las oraciones del grupo. Posteriormente, se encuentran emparejamientos entre patrones comparando palabras variables similares entre diferentes corpus. Finalmente, se pueden generar nuevas paráfrasis seleccionando un grupo que coincida con una oración de origen y luego sustituyendo el argumento de la oración de origen en cualquier número de patrones dentro del grupo.
Traducción automática basada en frases
La paráfrasis también puede generarse mediante la traducción basada en frases, como propusieron Bannard y Callison-Burch. [ 6 ] El concepto principal consiste en alinear frases en un idioma de referencia para producir posibles paráfrasis en el idioma original. Por ejemplo, la frase "under control" en una oración en inglés se alinea con la frase "unter kontrolle" en su equivalente en alemán. La frase "unter kontrolle" se encuentra luego en otra oración en alemán, siendo la frase en inglés alineada "in check", una paráfrasis de "under control".
La distribución de probabilidad se puede modelar como, la frase de probabilidades una paráfrasis de, lo cual es equivalente aresumido sobre todo, una posible traducción de frase en el idioma pivote. Además, la oraciónse agrega como un prior para agregar contexto a la paráfrasis. Por lo tanto, la paráfrasis óptima,puede modelarse como:
yse pueden aproximar simplemente tomando sus frecuencias. Añadiendocomo una distribución a priori se modela calculando la probabilidad de formar lacuandose sustituye por.
Memoria a corto y largo plazo
Se ha logrado el éxito utilizando modelos de memoria a corto y largo plazo (LSTM) para generar paráfrasis. [ 7 ] En resumen, el modelo consta de un componente codificador y un decodificador, ambos implementados mediante variaciones de una LSTM residual apilada. Primero, la LSTM de codificación toma como entrada una codificación one-hot de todas las palabras de una oración y produce un vector oculto final, que puede representar la oración de entrada. La LSTM de decodificación toma como entrada el vector oculto y genera una nueva oración, que termina en un token de fin de oración. El codificador y el decodificador se entrenan para tomar una frase y reproducir la distribución one-hot de una paráfrasis correspondiente minimizando la perplejidad mediante un descenso de gradiente estocástico simple . Se generan nuevas paráfrasis al introducir una nueva frase en el codificador y pasar la salida al decodificador.
Transformers
Con la introducción de los modelos Transformer , los enfoques de generación de paráfrasis mejoraron su capacidad para generar texto al escalar los parámetros de la red neuronal y paralelizar fuertemente el entrenamiento a través de capas de alimentación directa . [ 8 ] Estos modelos son tan fluidos en la generación de texto que los expertos humanos no pueden identificar si un ejemplo fue escrito por un humano o generado por una máquina. [ 9 ] La generación de paráfrasis basada en Transformer se basa en métodos de autoencoder , autorregresivos o de secuencia a secuencia . Los modelos de autoencoder predicen candidatos de reemplazo de palabras con una distribución one-hot sobre el vocabulario, mientras que los modelos autorregresivos y seq2seq generan texto nuevo basado en la fuente prediciendo una palabra a la vez. [ 10 ] [ 11 ] También existen esfuerzos más avanzados para hacer que la paráfrasis sea controlable de acuerdo con dimensiones de calidad predefinidas, como la preservación semántica o la diversidad léxica. [ 12 ] Muchos métodos de generación de paráfrasis basados en Transformer se basan en el aprendizaje no supervisado para aprovechar grandes cantidades de datos de entrenamiento y escalar sus métodos. [ 13 ] [ 14 ]
Reconocimiento de paráfrasis
Autoencoders recursivos
Socher et al. [ 1 ] intentaron el reconocimiento de paráfrasis mediante el uso de autoencoders recursivos . El concepto principal consiste en generar una representación vectorial de una oración y sus componentes utilizando un autoencoder de forma recursiva. Las representaciones vectoriales de las paráfrasis deben ser similares; se procesan y se introducen como entrada en una red neuronal para su clasificación.
Dada una oraciónconpalabras, el autoencoder está diseñado para tomar 2incrustaciones de palabras de -dimensiones como entrada y producen unaVector de dimensión como salida. El mismo autoencoder se aplica a cada par de palabras enproducirEl autoencoder se aplica recursivamente con los nuevos vectores como entradas hasta obtener un único vector. Si el número de entradas es impar, el primer vector se pasa tal cual al siguiente nivel de recursión. El autoencoder se entrena para reproducir todos los vectores del árbol de recursión completo, incluyendo las incrustaciones de palabras iniciales.
Dadas dos oracionesyde longitud 4 y 3 respectivamente, los autoencoders producirían 7 y 5 representaciones vectoriales incluyendo las incrustaciones de palabras iniciales. Luego se toma la distancia euclidiana entre cada combinación de vectores enypara producir una matriz de similitud.Luego se somete a una capa de min-pooling dinámica para producir un tamaño fijo.matriz. Desdeno son uniformes en tamaño entre todas las oraciones posibles,se divide ensecciones aproximadamente iguales. La salida se normaliza para tener una media de 0 y una desviación estándar de 1, y se introduce en una capa totalmente conectada con una salida softmax . El modelo de agrupación dinámica a softmax se entrena utilizando pares de paráfrasis conocidas.
Vectores de pensamiento omitido
Los vectores de salto de pensamiento son un intento de crear una representación vectorial del significado semántico de una oración, de manera similar al modelo skip-gram . [ 15 ] Los vectores de salto de pensamiento se producen mediante el uso de un modelo de salto de pensamiento que consta de tres componentes clave: un codificador y dos decodificadores. Dado un corpus de documentos, el modelo de salto de pensamiento se entrena para tomar una oración como entrada y codificarla en un vector de salto de pensamiento. El vector de salto de pensamiento se utiliza como entrada para ambos decodificadores; uno intenta reproducir la oración anterior y el otro la oración siguiente en su totalidad. El codificador y el decodificador pueden implementarse mediante el uso de una red neuronal recursiva (RNN) o una LSTM .
Dado que las paráfrasis comparten el mismo significado semántico, deberían tener vectores de pensamiento omitido similares. Por lo tanto, se puede entrenar una regresión logística simple con buenos resultados utilizando como entrada la diferencia absoluta y el producto componente a componente de dos vectores de pensamiento omitido.
Transformers
De forma similar a como los modelos Transformer influyeron en la generación de paráfrasis, su aplicación en la identificación de paráfrasis demostró un gran éxito. Modelos como BERT pueden adaptarse con una capa de clasificación binaria y entrenarse de extremo a extremo en tareas de identificación. [ 16 ] [ 17 ] Los Transformers logran resultados sólidos al transferir entre dominios y técnicas de parafraseo en comparación con métodos de aprendizaje automático más tradicionales como la regresión logística . Otros métodos exitosos basados en la arquitectura Transformer incluyen el uso de aprendizaje adversario y metaaprendizaje . [ 18 ] [ 19 ]
Evaluación
Se pueden utilizar varios métodos para evaluar las paráfrasis. Dado que el reconocimiento de paráfrasis puede plantearse como un problema de clasificación, la mayoría de las métricas de evaluación estándar, como la precisión , la puntuación F1 o la curva ROC , funcionan relativamente bien. Sin embargo, existe dificultad para calcular las puntuaciones F1 debido a la dificultad de generar una lista completa de paráfrasis para una frase dada y al hecho de que las buenas paráfrasis dependen del contexto. Una métrica diseñada para contrarrestar estos problemas es ParaMetric. [ 20 ] ParaMetric tiene como objetivo calcular la precisión y la exhaustividad de un sistema de paráfrasis automático comparando la alineación automática de paráfrasis con una alineación manual de frases similares. Dado que ParaMetric simplemente califica la calidad de la alineación de frases, puede utilizarse para calificar sistemas de generación de paráfrasis, siempre que utilicen la alineación de frases como parte de su proceso de generación. Una desventaja notable de ParaMetric es el conjunto grande y exhaustivo de alineaciones manuales que deben crearse inicialmente antes de poder producir una calificación.
La evaluación de la generación de paráfrasis presenta dificultades similares a las de la evaluación de la traducción automática . La calidad de una paráfrasis depende de su contexto, de si se utiliza como resumen y de cómo se genera, entre otros factores. Además, una buena paráfrasis suele ser léxicamente distinta de la frase original. El método más sencillo para evaluar la generación de paráfrasis sería mediante la evaluación por parte de expertos humanos. Desafortunadamente, esta evaluación suele ser laboriosa. Los enfoques automatizados de evaluación resultan complejos, ya que se trata esencialmente de un problema tan difícil como el reconocimiento de paráfrasis. Si bien se utilizó originalmente para evaluar traducciones automáticas, el método BLEU (Bilingual Evaluation Understudy ) también se ha empleado con éxito para evaluar modelos de generación de paráfrasis. Sin embargo, las paráfrasis suelen tener varias soluciones léxicamente diferentes pero igualmente válidas, lo que perjudica a BLEU y otras métricas de evaluación similares. [ 21 ]
Las métricas diseñadas específicamente para evaluar la generación de paráfrasis incluyen la paráfrasis en cambio de n-gramas (PINC) [ 21 ] y la métrica de evaluación de paráfrasis (PEM) [ 22 ] junto con la ParaMetric mencionada anteriormente. PINC está diseñada para usarse con BLEU y ayudar a cubrir sus deficiencias. Dado que BLEU tiene dificultades para medir la disimilitud léxica, PINC es una medida de la falta de superposición de n-gramas entre una oración de origen y una paráfrasis candidata. Esencialmente, es la distancia de Jaccard entre la oración, excluyendo los n-gramas que aparecen en la oración de origen para mantener cierta equivalencia semántica. PEM, por otro lado, intenta evaluar la "adecuación, fluidez y disimilitud léxica" de las paráfrasis devolviendo una heurística de valor único calculada usando la superposición de n-gramas en un idioma pivote. Sin embargo, una gran desventaja de PEM es que debe entrenarse usando grandes corpus paralelos del dominio y jueces humanos. [ 21 ] Es equivalente a entrenar un sistema de reconocimiento de paráfrasis para evaluar un sistema de generación de paráfrasis.
El conjunto de datos Quora Question Pairs, que contiene cientos de miles de preguntas duplicadas, se ha convertido en un conjunto de datos común para la evaluación de detectores de paráfrasis. [ 23 ] Todos los detectores de paráfrasis consistentemente fiables han utilizado la arquitectura Transformer y todos se han basado en grandes cantidades de preentrenamiento con datos más generales antes del ajuste fino con los pares de preguntas.
Véase también
- Traducción de ida y vuelta
- Simplificación de texto : proceso automatizado
- Normalización de texto : proceso de transformación de un texto en una única forma canónica.
Referencias
- 1 2 Socher, Richard; Huang, Eric; Pennington, Jeffrey; Ng, Andrew; Manning, Christopher (2011), "Advances in Neural Information Processing Systems 24" , Dynamic Pooling and Unfolding Recursive Autoencoders for Paraphrase Detection , archivado del original el 6 de enero de 2018 , recuperado el 29 de diciembre de 2017
- ↑ Callison-Burch, Chris (25-27 de octubre de 2008). Restricciones sintácticas en paráfrasis extraídas de corpus paralelos . Actas de EMNLP '08, Conferencia sobre Métodos Empíricos en Procesamiento del Lenguaje Natural. Honolulu, Hawái. págs. 196-205 .
- ↑ Berant, Jonathan y Percy Liang. « Análisis semántico mediante paráfrasis ». Actas de la 52.ª Reunión Anual de la Asociación de Lingüística Computacional (Volumen 1: Artículos extensos). Vol. 1. 2014.
- ↑ Wahle, Jan Philip; Ruas, Terry; Kirstein, Frederic; Gipp, Bela (2022). "Cómo los grandes modelos de lenguaje están transformando el plagio por paráfrasis automática". Actas de la Conferencia de 2022 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural . En línea y en Abu Dabi, Emiratos Árabes Unidos. pp. 952–963 . arXiv : 2210.03568 . doi : 10.18653/v1/2022.emnlp-main.62 .
{{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace ) - 1 2 Barzilay, Regina; Lee, Lillian (mayo-junio de 2003). Aprender a parafrasear: un enfoque no supervisado mediante alineación de secuencias múltiples . Actas de HLT-NAACL 2003.
- ↑ Bannard, Colin; Callison-Burch, Chris (2005). Parafraseo de corpus paralelos bilingües . Actas de la 43.ª Reunión Anual de la ACL. Ann Arbor, Michigan. págs. 597–604 .
- ^ Prakash, Aaditya; Hasan, Sadid A.; Lee, Kathy; Datla, Vivek; Qadir, Ashequl; Liu, Joey; Farri, Oladimeji (2016), Generación de paráfrasis neuronal con redes LSTM residuales estacadas , arXiv : 1610.03098 , Bibcode : 2016arXiv161003098P
- ↑ Zhou, Jianing; Bhat, Suma (2021). "Generación de paráfrasis: una revisión del estado del arte" . Actas de la Conferencia de 2021 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural . En línea y Punta Cana, República Dominicana: Asociación de Lingüística Computacional. pp. 5075–5086 . doi : 10.18653/v1/2021.emnlp-main.414 . S2CID 243865349 .
- ↑ Dou, Yao; Forbes, Maxwell; Koncel-Kedziorski, Rik; Smith, Noah; Choi, Yejin (2022). "¿Es el texto de GPT-3 indistinguible del texto humano? Scarecrow: un marco para examinar el texto de las máquinas" . Actas de la 60.ª Reunión Anual de la Asociación de Lingüística Computacional (Volumen 1: Artículos largos) . Dublín, Irlanda: Asociación de Lingüística Computacional: 7250–7274 . arXiv : 2107.01294 . doi : 10.18653/v1/2022.acl-long.501 . S2CID 247315430 .
- ↑ Liu, Xianggen; Mou, Lili; Meng, Fandong; Zhou, Hao; Zhou, Jie; Song, Sen (2020). "Parafraseo no supervisado mediante recocido simulado" . Actas de la 58.ª Reunión Anual de la Asociación de Lingüística Computacional . En línea: Asociación de Lingüística Computacional: 302–312 . arXiv : 1909.03588 . doi : 10.18653/v1/2020.acl-main.28 . S2CID 202537332 .
- ↑ Wahle, Jan Philip; Ruas, Terry; Meuschke, Norman; Gipp, Bela (2021). "¿Son los modelos de lenguaje neuronales buenos plagiadores? Un punto de referencia para la detección de paráfrasis neuronales". 2021 ACM/IEEE Joint Conference on Digital Libraries (JCDL) . Champaign, IL, EE. UU.: IEEE. págs. 226–229 . arXiv : 2103.12450 . doi : 10.1109/JCDL52503.2021.00065 . ISBN 978-1-6654-1770-9. S2CID 232320374 .
- ↑ Bandel, Elron; Aharonov, Ranit; Shmueli-Scheuer, Michal; Shnayderman, Ilya; Slonim, Noam; Ein-Dor, Liat (2022). "Generación de paráfrasis con control de calidad" . Actas de la 60.ª Reunión Anual de la Asociación de Lingüística Computacional (Volumen 1: Artículos extensos) . Dublín, Irlanda: Asociación de Lingüística Computacional: 596–609 . arXiv : 2203.10940 . doi : 10.18653/v1/2022.acl-long.45 .
- ↑ Lee, John Sie Yuen; Lim, Ho Hung; Carol Webster, Carol (2022). "Predicción de parafrasabilidad no supervisada para nominalizaciones compuestas" . Actas de la Conferencia de 2022 del Capítulo Norteamericano de la Asociación de Lingüística Computacional: Tecnologías del lenguaje humano . Seattle, Estados Unidos: Asociación de Lingüística Computacional. pp. 3254–3263 . doi : 10.18653/v1/2022.naacl-main.237 . S2CID 250390695 .
- ↑ Niu, Tong; Yavuz, Semih; Zhou, Yingbo; Keskar, Nitish Shirish; Wang, Huan; Xiong, Caiming (2021). "Parafraseo no supervisado con modelos de lenguaje preentrenados" . Actas de la Conferencia de 2021 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural . En línea y Punta Cana, República Dominicana: Asociación de Lingüística Computacional. pp. 5136–5150 . doi : 10.18653/v1/2021.emnlp-main.417 . S2CID 237497412 .
- ^ Kiros, Ryan; Zhu, Yukun; Salakhutdinov, Ruslan; Zemel, Richard; Torralba, Antonio; Urtasún, Raquel; Fidler, Sanja (2015), Vectores de omisión de pensamiento , arXiv : 1506.06726 , Bibcode : 2015arXiv150606726K
- ↑ Devlin, Jacob; Chang, Ming-Wei; Lee, Kenton; Toutanova, Kristina (2019). "Actas de la Conferencia del Norte de 2019" . Minneapolis, Minnesota: Asociación de Lingüística Computacional: 4171–4186 . doi : 10.18653/v1/N19-1423 . S2CID 52967399 .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ Wahle, Jan Philip; Ruas, Terry; Foltýnek, Tomáš; Meuschke, Norman; Gipp, Bela (2022), "Identifying Machine-Paraphrased Plagiarism" , en Smits, Malte (ed.), Information for a Better World: Shaping the Global Future , vol. 13192, Cham: Springer International Publishing, pp. 393–413 , arXiv : 2103.11909 , doi : 10.1007/978-3-030-96957-8_34 , ISBN 978-3-030-96956-1, S2CID 232307572 , consultado el 06-10-2022
- ↑ Nighojkar, Animesh; Licato, John (2021). "Mejora de la detección de paráfrasis con la tarea de parafraseo adversarial" . Actas de la 59.ª Reunión Anual de la Asociación de Lingüística Computacional y la 11.ª Conferencia Internacional Conjunta sobre Procesamiento del Lenguaje Natural (Volumen 1: Artículos largos) . En línea: Asociación de Lingüística Computacional. págs. 7106–7116 . doi : 10.18653/v1/2021.acl-long.552 . S2CID 235436269 .
- ↑ Dopierre, Thomas; Gravier, Christophe; Logerais, Wilfried (2021). "ProtAugment: Metaaprendizaje de detección de intenciones mediante parafraseo diverso no supervisado" . Actas de la 59.ª Reunión Anual de la Asociación de Lingüística Computacional y la 11.ª Conferencia Internacional Conjunta sobre Procesamiento del Lenguaje Natural (Volumen 1: Artículos extensos) . En línea: Asociación de Lingüística Computacional. págs. 2454–2466 . doi : 10.18653/v1/2021.acl-long.191 . S2CID 236460333 .
- ↑ Callison-Burch, Chris; Cohn, Trevor; Lapata, Mirella (2008). ParaMetric: Una métrica de evaluación automática para la paráfrasis . Actas de la 22.ª Conferencia Internacional sobre Lingüística Computacional. Manchester. pp. 97–104 . doi : 10.3115/1599081.1599094 . S2CID 837398 .
- 1 2 3 Chen, David; Dolan, William (2008). Recopilación de datos altamente paralelos para la evaluación de paráfrasis . Actas de la 49.ª Reunión Anual de la Asociación de Lingüística Computacional: Tecnologías del Lenguaje Humano. Portland, Oregón. págs. 190–200 .
- ↑ Liu, Chang; Dahlmeier, Daniel; Ng, Hwee Tou (2010). PEM: Una métrica de evaluación de paráfrasis que aprovecha los textos paralelos . Actas de la Conferencia de 2010 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural. MIT, Massachusetts. págs. 923–932 .
- ↑ "Identificación de paráfrasis en pares de preguntas de Quora" . Artículos con código .
Enlaces externos
- Corpus de paráfrasis de Microsoft Research : un conjunto de datos que consta de 5800 pares de oraciones extraídas de artículos de noticias, anotadas para indicar si un par captura la equivalencia semántica.
- Base de datos de paráfrasis (PPDB) : una base de datos consultable que contiene millones de paráfrasis en 16 idiomas diferentes.
- Lingüística computacional
- Aprendizaje automático