La normalización de texto es el proceso de transformar un texto en una única forma canónica que podría no haber tenido antes. Normalizar el texto antes de almacenarlo o procesarlo permite la separación de responsabilidades , ya que se garantiza la coherencia de la entrada antes de realizar cualquier operación sobre ella. La normalización de texto requiere conocer qué tipo de texto se va a normalizar y cómo se procesará posteriormente; no existe un procedimiento de normalización universal. [ 1 ]
Aplicaciones
La normalización de texto se usa frecuentemente al convertir texto a voz . Los números , las fechas , los acrónimos y las abreviaturas son "palabras" no estándar que deben pronunciarse de manera diferente según el contexto. [ 2 ] Por ejemplo:
- "$200" se pronunciaría como "doscientos dólares" en inglés, pero como "lua selau tālā" en samoano. [ 3 ]
- "vi" podría pronunciarse como " vie ", " vee " o " the sixth " dependiendo de las palabras que lo rodean. [ 4 ]
El texto también se puede normalizar para su almacenamiento y búsqueda en una base de datos. Por ejemplo, si se busca "resume" para que coincida con la palabra "résumé", el texto se normalizaría eliminando los signos diacríticos ; y si se busca "john" para que coincida con "John", el texto se convertiría a una sola mayúscula . Para preparar el texto para la búsqueda, también se puede aplicar lematización (por ejemplo, convertir "flew" y "flying" en "fly"), canonicalizar (por ejemplo, usar consistentemente la ortografía del inglés americano o británico ) o eliminar las palabras vacías .
Técnicas
Para una normalización simple e independiente del contexto, como la eliminación de caracteres no alfanuméricos o signos diacríticos , bastarían las expresiones regulares . Por ejemplo, el script sed normalizaría secuencias de espacios en blanco en un solo espacio. Una normalización más compleja requiere algoritmos igualmente complejos, incluyendo el conocimiento del dominio del idioma y el vocabulario que se está normalizando. Entre otros enfoques, la normalización de texto se ha modelado como un problema de tokenización y etiquetado de flujos de texto [ 5 ] y como un caso especial de traducción automática. [ 6 ] [ 7 ]sed ‑e "s/\s+/ /g" inputfile
Investigación textual
En el ámbito de la crítica textual y la edición de textos históricos, el término «normalización» implica un grado de modernización y estandarización, por ejemplo, en la extensión de las abreviaturas de los escribas y la transliteración de los glifos arcaicos típicos de los manuscritos y las primeras fuentes impresas. Por lo tanto, una edición normalizada se distingue de una edición diplomática (o semidiplomática ), en la que se intenta preservar estas características. El objetivo es lograr un equilibrio adecuado entre, por un lado, la fidelidad rigurosa al texto original (incluida, por ejemplo, la conservación de elementos enigmáticos y ambiguos) y, por otro, la producción de un nuevo texto comprensible y accesible para el lector moderno. El grado de normalización queda, por consiguiente, a discreción del editor y varía. Algunos editores, por ejemplo, optan por modernizar la ortografía y la puntuación arcaicas, mientras que otros no. [ 8 ]
Una edición de un texto puede normalizarse según criterios internos, donde la ortografía se estandariza de acuerdo con el idioma del original, o según criterios externos, donde se aplican las normas de un período de tiempo diferente. [ 9 ] Como ejemplo de esto último, una edición publicada de un manuscrito islandés medieval podría normalizarse según las convenciones del islandés moderno, o bien según el islandés antiguo clásico . [ 9 ] Los estándares de normalización varían según el idioma de la edición, así como las convenciones específicas del editor.
Véase también
- Parafraseo automatizado : generación o reconocimiento automático de texto parafraseado. Páginas que muestran descripciones breves de los destinos de redireccionamiento.
- Canonización : Proceso para convertir datos a una forma "estándar", "normal" o canónica.
- Simplificación de texto : proceso automatizado
- Equivalencia Unicode : un aspecto del estándar Unicode.
Referencias
- ↑ Richard Sproat y Steven Bedrick (septiembre de 2011). "CS506/606: Txt Nrmlztn" . Consultado el 2 de octubre de 2012 .
- ↑ Sproat, R.; Black, A.; Chen, S.; Kumar, S.; Ostendorf, M.; Richards, C. (2001). "Normalización de palabras no estándar." Computer Speech and Language 15 ; 287–333. doi : 10.1006/csla.2001.0169 .
- ↑ "Números samoanos" . MyLanguages.org . Consultado el 2 de octubre de 2012 .
- ↑ "Normalización de texto en motores de conversión de texto a voz" . MSDN . Consultado el 2 de octubre de 2012 .
- ↑ Zhu, C.; Tang, J.; Li, H.; Ng, H.; Zhao, T. (2007). "Un enfoque de etiquetado unificado para la normalización de textos." Actas de la 45.ª Reunión Anual de la Asociación de Lingüística Computacional ; 688–695. doi : 10.1.1.72.8138 .
- ↑ Filip, G.; Krzysztof, J.; Agnieszka, W.; Mikołaj, W. (2006). "Normalización de texto como un caso especial de traducción automática." Actas de la Multiconferencia Internacional sobre Ciencias de la Computación y Tecnologías de la Información 1 ; 51–56.
- ↑ Mosquera, A.; Lloret, E.; Moreda, P. (2012). "Hacia la facilitación de la accesibilidad de los textos web 2.0 mediante la normalización del texto". Actas del taller LREC: Procesamiento del lenguaje natural para mejorar la accesibilidad textual (NLP4ITA) ; 9-14
- ↑ Harvey, PDA (2001). Edición de registros históricos . Londres: Biblioteca Británica. págs. 40–46 . ISBN 0-7123-4684-8.
- ^ Bernharðsson , Haraldur; Haugen, Odd Einar; Berg, Ivar (12 de diciembre de 2019). "Manual Menota 3.0, Capítulo 10. Normalización" . Archivo de textos nórdicos medievales . Consultado el 18 de noviembre de 2025 .
- Procesamiento del lenguaje natural