Los trigramas son un caso especial de los n -gramas , donde n es 3. Se utilizan frecuentemente en el procesamiento del lenguaje natural para realizar análisis estadísticos de textos y en criptografía para el control y uso de cifrados y códigos . Véanse los resultados del análisis de " Frecuencias de letras en el idioma inglés ".
Frecuencia
El contexto es muy importante; se pueden obtener fácilmente diferentes clasificaciones y porcentajes de análisis a partir de diferentes tamaños de muestra, diferentes autores o diferentes tipos de documentos: poesía, ciencia ficción, documentación tecnológica; y niveles de escritura: cuentos para niños frente a adultos, órdenes militares y recetas.
El análisis de frecuencia criptoanalítica típico encuentra que los 16 trigramas a nivel de caracteres más comunes en inglés son: [ 1 ] [ 2 ]
Debido a que los mensajes cifrados enviados por telégrafo suelen omitir la puntuación y los espacios, el análisis de frecuencia criptográfica de dichos mensajes incluye trigramas que se encuentran entre palabras. Esto provoca que trigramas como "edt" aparezcan con frecuencia, aunque nunca aparezcan en ninguna palabra de esos mensajes.
Ejemplos
La oración "el rápido zorro rojo salta sobre el perro marrón perezoso" tiene los siguientes trigramas a nivel de palabra:
el rápido rojo zorro rojo rápido El zorro rojo salta El zorro salta salta sobre el sobre el perezoso el marrón perezoso perro marrón perezoso
Y el trigrama a nivel de palabra "the quick red" tiene los siguientes trigramas a nivel de carácter (donde un guion bajo "_" marca un espacio):
el él_ e_q _qu que uic asco ck_ k_r _re rojo
Referencias
- 1 2 Lewand, Robert (2000). Matemáticas criptológicas . The Mathematical Association of America . p. 37. ISBN 978-0-88385-719-9.
- ↑ Linton, Tom (2001). "Frecuencias relativas de letras en texto plano en inglés general" . Central College . Criptografía ( edición de primavera). Archivado del original el 22 de enero de 2007.
- ↑ "Frecuencias de letras en inglés" . Criptografía práctica .
- Procesamiento del lenguaje natural
- Lingüística computacional
- Reconocimiento de voz