Articulo de referencia

Frecuencia de letras

La frecuencia de las letras es el número de veces que aparecen, en promedio, las letras del alfabeto en el lenguaje escrito . El análisis de la frecuencia de las letras se remon...

La frecuencia de las letras es el número de veces que aparecen, en promedio, las letras del alfabeto en el lenguaje escrito . El análisis de la frecuencia de las letras se remonta al matemático árabe Al-Kindi (c. 801-873 d. C.), quien desarrolló formalmente el método para descifrar códigos . Este análisis cobró importancia en Europa con el desarrollo de la imprenta de tipos móviles en 1450 d. C., donde era necesario estimar la cantidad de caracteres requerida para cada letra . Los lingüistas utilizan el análisis de la frecuencia de las letras como una técnica rudimentaria para la identificación de idiomas , donde resulta particularmente eficaz para determinar si un sistema de escritura desconocido es alfabético, silábico o logográfico .

El uso de frecuencias de letras y el análisis de frecuencias desempeñan un papel fundamental en los criptogramas y en varios juegos de palabras, como el ahorcado , el Scrabble , el Wordle [ 2 ] y el programa de televisión La Ruleta de la Fortuna . Una de las primeras descripciones en la literatura clásica de la aplicación del conocimiento de la frecuencia de las letras inglesas para resolver un criptograma se encuentra en el famoso relato de Edgar Allan Poe , « El escarabajo de oro », donde el método se aplica con éxito para descifrar un mensaje que revela la ubicación de un tesoro escondido por el Capitán Kidd . [ 3 ]

Herbert S. Zim , en su texto clásico de introducción a la criptografía, Códigos y escritura secreta , da la secuencia de frecuencia de letras en inglés como " ETAON RISHD LFCMU GYPWB VKJXZQ ", los pares de letras más comunes como "TH HE AN RE ER IN ON AT ND ST ES EN OF TE ED OR TI HI AS TO", y las letras duplicadas más comunes como "LL EE SS OO TT FF RR NN PP CC". [ 4 ] Diferentes formas de contar pueden producir órdenes algo diferentes.

La frecuencia de las letras también influye notablemente en el diseño de algunos teclados . Las letras más frecuentes se ubican en la fila principal de la máquina de escribir Blickensderfer , el teclado Dvorak , Colemak y otros teclados optimizados para la escritura en inglés, mientras que el teclado QWERTY, de uso común, se optimizó para la transcripción de telégrafos. [ 5 ]

Fondo

La caja de impresión California Job Case era una caja compartimentada para imprimir en el siglo XIX, con tamaños que correspondían a la frecuencia de las letras.

La frecuencia de las letras en un texto se ha estudiado para su uso en criptoanálisis , y en particular en análisis de frecuencia , remontándose al matemático árabe al-Kindi (c.  801-873 d. C.  ), quien desarrolló formalmente el método (los cifrados que se pueden descifrar con esta técnica se remontan al menos al cifrado César utilizado por Julio César , por lo que este método podría haberse explorado en la antigüedad clásica). El análisis de frecuencia de letras adquirió mayor importancia en Europa con el desarrollo de la imprenta de tipos móviles en 1450 d. C., donde era necesario estimar la cantidad de caracteres requerida para cada forma de letra, como lo demuestran las variaciones en el tamaño de los compartimentos de las letras en las cajas de tipos de los tipógrafos.

No existe una distribución exacta de frecuencia de letras que subyace a un idioma dado, ya que todos los escritores escriben de forma ligeramente diferente. Sin embargo, la mayoría de los idiomas tienen una distribución característica que se hace muy evidente en textos más largos. Incluso cambios lingüísticos tan extremos como del inglés antiguo al inglés moderno (considerados mutuamente ininteligibles) muestran fuertes tendencias en las frecuencias de letras relacionadas: en una pequeña muestra de pasajes bíblicos, de la más frecuente a la menos frecuente, enaid sorhm tgþlwu æcfy ðbpxz del inglés antiguo se compara con eotha sinrd luymw fgcbp kvjqxz del inglés moderno, sin que se compartan las diferencias más extremas en cuanto a las formas de las letras. [ 6 ]

Las máquinas Linotype para el idioma inglés asumieron que el orden de las letras, de la más a la menos común, era etaoin shrdlu cmfwyp vbgkqj xz, basándose en la experiencia y la costumbre de los tipógrafos manuales. El equivalente para el idioma francés era elaoin sdrétu cmfhyp vbgwqj xz .

Al organizar el alfabeto en Morse en grupos de letras que requieren la misma cantidad de tiempo para transmitirse, y luego ordenar estos grupos en orden ascendente, se obtiene e it san hurdm wgvlfbk opxcz jyq . [ a ] ​​La frecuencia de las letras fue utilizada por otros sistemas telegráficos, como el Código Murray .

Ideas similares se utilizan en técnicas modernas de compresión de datos, como la codificación Huffman .

La frecuencia de las letras, al igual que la de las palabras , tiende a variar según el autor y el tema. Por ejemplo, la letra ⟨d⟩ aparece con mayor frecuencia en la ficción, ya que la mayoría de las obras de ficción se escriben en pasado y, por lo tanto , la mayoría de los verbos terminan en el sufijo flexivo -ed/-d . No se puede escribir un ensayo sobre rayos X sin usar ⟨x⟩ con frecuencia , y el ensayo tendrá una frecuencia de letras idiosincrásica si trata, por ejemplo, sobre la reina Zelda de Zanzíbar solicitando rayos X a Qatar para examinar la hipoxia en las cebras . Los distintos autores tienen hábitos que se reflejan en su uso de las letras. El estilo de escritura de Hemingway , por ejemplo, es visiblemente diferente al de Faulkner . La frecuencia de letras, bigramas , trigramas y palabras, así como la longitud de las palabras y de las oraciones, se pueden calcular para autores específicos y utilizarse para probar o refutar la autoría de los textos, incluso para autores cuyos estilos no son tan divergentes.

Las frecuencias promedio de las letras solo pueden obtenerse analizando una gran cantidad de texto representativo. Gracias a la disponibilidad de la informática moderna y de grandes corpus de texto , estos cálculos se realizan fácilmente. Se pueden extraer ejemplos de diversas fuentes (noticias de prensa, textos religiosos, textos científicos y ficción en general), y existen diferencias, especialmente en la ficción general, en la posición de h e i , siendo h más frecuente.

Los distintos dialectos de un idioma también influyen en la frecuencia de una letra. Por ejemplo, un autor estadounidense produciría un texto en el que la letra ⟨z⟩ sería más común que un autor británico que escribiera sobre el mismo tema: palabras como «analyze», «apologize» y «recognize» contienen la letra en inglés americano, mientras que las mismas palabras se escriben «analyse», «apologise» y «recognise» en inglés británico. Esto afectaría considerablemente la frecuencia de la letra ⟨z⟩ , ya que los escritores británicos rara vez la utilizan en inglés. [ 7 ]

Las doce letras más frecuentes constituyen aproximadamente el 80% del uso total. Las ocho letras más frecuentes constituyen aproximadamente el 65% del uso total. La frecuencia de las letras en función del rango se puede ajustar bien mediante varias funciones de rango, siendo la función de rango Cocho/Beta de dos parámetros la mejor. [ 8 ] Otra función de rango sin parámetro libre ajustable también se ajusta razonablemente bien a la distribución de frecuencia de las letras [ 9 ] (la misma función se ha utilizado para ajustar la frecuencia de aminoácidos en secuencias de proteínas. [ 10 ] ) Un espía que utiliza el cifrado VIC u otro cifrado basado en un tablero de ajedrez a caballo suele utilizar una mnemotecnia como "a sin to err" (omitiendo la segunda "r") [ 11 ] [ 12 ] o "at one sir" [ 13 ] para recordar los ocho caracteres más frecuentes.

Frecuencias relativas de las letras en el idioma inglés

Teclado usado durante un largo período por un hablante de inglés: las letras E, O, T, H, A, S, I, N y R muestran un desgaste considerable; se aprecia cierto desgaste en D, L, U, Y, M, W, F, G, C, B y P; y se observa poco o ningún desgaste en K, V, J, Q, X o Z.

Hay tres maneras de contar la frecuencia de las letras que dan como resultado gráficos muy diferentes para las letras comunes. El primer método, utilizado en el gráfico a continuación, es contar la frecuencia de las letras en los lemas de un diccionario. El lema es la palabra en su forma canónica. El segundo método es incluir todas las variantes de la palabra al contar, como "abstracts", "abstracted" y "abstracting", y no solo el lema de "abstract". Este segundo método hace que letras como ⟨s⟩ aparezcan con mucha más frecuencia, como cuando se cuentan las letras de las listas de las palabras en inglés más usadas en Internet. ⟨s⟩ es especialmente común en palabras flexionadas (formas que no son lemas) porque se añade para formar plurales y verbos en tercera persona del singular del presente. Un método final consiste en contar las letras según su frecuencia de uso en textos reales, lo que da como resultado que ciertas combinaciones de letras como th se vuelvan más comunes debido al uso frecuente de palabras comunes como "the", "then", "both", "this", etc. Medidas de frecuencia de uso absolutas como esta se utilizan al crear diseños de teclado o frecuencias de letras en imprentas antiguas.

Un análisis de las entradas en el diccionario Concise Oxford, sin tener en cuenta la frecuencia de uso de las palabras, da como resultado el orden "EARIOTNSLCUDPMHGBFYWKVXZJQ". [ 14 ]

La tabla de frecuencia de letras anterior está tomada del sitio web de Pavel Mička, que cita el libro Cryptological Mathematics de Robert Lewand . [ 15 ]

Según Lewand, ordenadas de la más a la menos común en aparición, las letras son: etaoinshrdlcumwfgypbvkjxqz . El orden de Lewand difiere ligeramente de otros, como el Proyecto Math Explorer de la Universidad de Cornell, que produjo una tabla después de medir 40 000  palabras. [ 16 ]

En inglés, el carácter de espacio aparece casi el doble de veces que la letra superior ( e ) [ 17 ] y los caracteres no alfabéticos (dígitos, puntuación, etc.) ocupan colectivamente la cuarta posición (incluyendo ya el espacio) entre t y a . [ 18 ]

Frecuencias relativas de las primeras letras de una palabra en inglés.

La frecuencia de las primeras letras de palabras o nombres es útil para preasignar espacio en archivos físicos e índices. [ 19 ] Dado 26 cajones de archivador , en lugar de una asignación 1:1 de un cajón a una letra del alfabeto, a menudo es útil usar un código de letras de frecuencia más igual asignando varias letras de baja frecuencia al mismo cajón (a menudo un cajón se etiqueta como VWXYZ), y dividir las letras iniciales más frecuentes ( s, a, c ) en varios cajones (a menudo 6 cajones Aa-An, Ao-Az, Ca-Cj, Ck-Cz, Sa-Si, Sj-Sz). El mismo sistema se usa en algunas obras de varios volúmenes, como algunas enciclopedias . Los números Cutter , otro mapeo de nombres a un código de frecuencia más igual, se usan en algunas bibliotecas.  

Tanto la distribución general de letras como la distribución de letras iniciales de palabra coinciden aproximadamente con la distribución de Zipf e incluso coinciden más estrechamente con la distribución de Yule . [ 20 ]

A menudo, la distribución de frecuencia del primer dígito en cada dato es significativamente diferente de la frecuencia general de todos los dígitos en un conjunto de datos numéricos, una observación conocida como la ley de Benford .

Un análisis realizado por Peter Norvig sobre palabras que aparecen 100.000 veces o más en datos de Google Books transcritos mediante reconocimiento óptico de caracteres (OCR) determinó la frecuencia de las primeras letras de las palabras en inglés, entre otras cosas. [ 21 ]

Frecuencias relativas de letras en otros idiomas

* Ver İ y İ sin punto .

La siguiente figura ilustra la distribución de frecuencias de las 26  letras latinas más comunes en algunos idiomas. Todos estos idiomas utilizan un  alfabeto similar de más de 25 caracteres.

Según estas tablas, el equivalente de ' etaoin shrdlu ' para cada idioma es el siguiente:

  • Francés: ' esaitn ruoldc '; (Indoeuropeo: Romance; tradicionalmente se usa 'esartinulop', en parte por su facilidad de pronunciación [ 36 ] )
  • Español: ' eaosrn idltcm '; (Indoeuropeo: Romance)
  • Portugués: ' aeosri dmntcu ' (Indoeuropeo: Romance)
  • Italiano: ' eaionl rtscdu '; (Indoeuropeo: Romance)
  • Alemán: ' ensria tdhulg '; (Indoeuropeo: Germánico)
  • Sueco: ' eanrts ildomk '; (Indoeuropeo: Germánico)
  • Turco: ' aeinrl ıdkmyt '; (Turco: Oghuz)
  • Neerlandés: ' enatir odslgv '; (Indoeuropeo: Germánico) [ 30 ]
  • Polaco: ' aioezn rwstcy '; (Indoeuropeo: eslavo)
  • Danés: ' erntai dslogk '; (Indoeuropeo: Germánico)
  • Islandés: ' arnies tulðgm '; (Indoeuropeo: Germánico)
  • Finlandés: ' aintes loukäm '; (Urálico: Finnic)
  • Checo: ' aeonit vsrldk '; (Indoeuropeo: eslavo)
  • húngaro: ' eatlsn kizroá '; (Urálico: ugrico)
  • Galés: ' ayneir odwgldd ; (Indoeuropeo: celta)

Véase también

Notas explicativas

  1. El código Morse estadounidense fue desarrollado en la década de 1830 por Alfred Vail , basándose en la frecuencia de las letras del idioma inglés, para codificar las letras más frecuentes con los símbolos más cortos. Parte de su eficiencia se perdió en la versión reformada que se usa actualmente: el código Morse internacional.

Referencias

  1. Lewand, Robert (2000). Matemáticas criptológicas . Asociación Matemática de América . pág.  36. ISBN 978-0883857199.y "frecuencias de letras en inglés" . Archivado del original el 8 de julio de 2008. Consultado el 25 de junio de 2008 .
  2. Guinness, Harry. "Las mejores palabras iniciales para ganar en Wordle" . Wired . ISSN 1059-1028 . Consultado el 12 de febrero de 2022 . 
  3. Poe, Edgar Allan. "Las obras de Edgar Allan Poe en cinco volúmenes" . Proyecto Gutenberg.
  4. Zim, Herbert Spencer (1961). Códigos y escritura secreta: abreviación autorizada . Scholastic Book Services. OCLC 317853773 . 
  5. Wexler, Jimmy Stamp, Ellen (3 de mayo de 2013). "El teclado QWERTY nunca morirá. ¿De dónde surgió este diseño de 150 años de antigüedad?" . Revista Smithsonian . Consultado el 3 de junio de 2026 .{{cite web}}: CS1 maint: varios nombres: lista de autores ( enlace )
  6. Moreno, Marsha Lynn (Primavera de 2005). "Análisis de frecuencia a la luz de la innovación lingüística" (PDF) . Matemáticas. Universidad de California – San Diego . Recuperado el 19 de febrero de 2015 .
  7. "Ortografía británica y americana - Diccionarios Oxford" . Diccionarios Oxford - Inglés . Archivado del original el 28 de diciembre de 2011. Consultado el 18 de abril de 2018 .
  8. Li, Wentian; Miramontes, Pedro (2011). "Ajuste de la distribución de frecuencia de letras en inglés y español clasificadas en los discursos presidenciales de EE. UU. y México". Journal of Quantitative Linguistics . 18 (4): 359. arXiv : 1103.2950 . doi : 10.1080/09296174.2011.608606 . S2CID 1716455 . 
  9. Gusein-Zade, SM (1988). "Distribución de frecuencia de las letras en el idioma ruso". Probl. Peredachi Inf . 24 (4): 102– 107.
  10. Gamow, George; Ycas, Martynas (1955). "Correlación estadística de la composición de proteínas y ácido ribonucleico" . Proc. Natl. Acad. Sci . 41 (12): 1011– 1019. Bibcode : 1955PNAS...41.1011G . doi : 10.1073 /pnas.41.12.1011 . PMC 528190. PMID 16589789 .  
  11. Bauer, Friedrich L. (2006). Secretos descifrados: Métodos y máximas de criptología . Springer. pág. 57. ISBN  9783540481218 vía Google Libros.
  12. Goebel, Greg (2009). El auge de los cifrados de campo: a caballo entre los cifrados de tablero de ajedrez . Archivado del original el 5 de diciembre de 2005.
  13. Rijmenants, Dirk. "Bloc de notas de un solo uso" .
  14. "¿Cuál es la frecuencia de las letras del alfabeto en inglés?" . Oxford Dictionary . Oxford University Press. Archivado del original el 24 de diciembre de 2011. Consultado el 29 de diciembre de 2012 .
  15. Mička, Pavel. "Frecuencia de letras (inglés)" . Algoritmy.net. Archivado del original el 4 de marzo de 2021. Consultado el 15 de agosto de 2012 .
  16. "Frecuencia de letras en inglés (basada en una muestra de 40.000 palabras)" . cornell.edu . Consultado el 24 de enero de 2021 .
  17. "Distribuciones estadísticas de texto en inglés" . data-compression.com . Archivado del original el 18 de septiembre de 2017.
  18. Lee, E. Stewart. "Ensayos sobre seguridad informática" (PDF) . Laboratorio de Informática de la Universidad de Cambridge. pág. 181. 
  19. Ohlman, Herbert Marvin (1959). Frecuencias de letras entre sujeto y palabra con aplicaciones a la codificación superpuesta . Actas de la Conferencia Internacional sobre Información Científica. doi : 10.17226/10866 . ISBN 978-0-309-57421-1.{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda )
  20. Pande, Hemlata; Dhami, HS "Modelado matemático de la ocurrencia de letras e iniciales de palabras en textos del idioma hindi" (PDF) . JTL . 16 .
  21. "Recuentos de frecuencia de letras en inglés: Mayzner revisitado o ETAOIN SRHLDCU" . norvig.com . Consultado el 18 de abril de 2018 .
  22. "Corpus de Thomas Tempé" . Archivado del original el 30 de septiembre de 2007. Consultado el 15 de junio de 2007 .
  23. Beutelspacher, Albrecht (2005). Kryptologie (7 ed.). Wiesbaden: Vieweg. pag. 10.ISBN   3-8348-0014-7.
  24. Pratt, Fletcher (1942). Secreto y urgente: La historia de los códigos y cifrados . Garden City, NY: Blue Ribbon Books. págs. 254–5 . OCLC 795065 .  
  25. «Frequência da ocorrência de letras no Português» . Archivado desde el original el 3 de agosto de 2009 . Consultado el 16 de junio de 2009 .
  26. ^ Singh, Simón; Galli, Stefano (1999). Codici e Segreti (en italiano). Milán: Rizzoli. ISBN 978-8-817-86213-4OCLC 535461359 
  27. Serengil, Sefik Ilkin; Akin, Murat (20–22 de febrero de 2011). Ataque a textos turcos cifrados mediante cifrado homofónico (PDF) . Actas de la 10.ª Conferencia Internacional WSEAS sobre Electrónica, Hardware, Comunicaciones Inalámbricas y Ópticas. Cambridge, Reino Unido. págs. 123–126 . 
  28. "Criptografía práctica" . Consultado el 30 de octubre de 2013 .
  29. "Frekwencja liter w polskich tekstach - Poradnia językowa PWN" .
  30. ^ "Frecuencias de letras " . Genootschap OnzeTaal . Consultado el 17 de mayo de 2009 .
  31. "Frecuencias de letras danesas" . Criptografía práctica . Consultado el 24 de octubre de 2013 .
  32. "Frecuencias de letras islandesas" . Criptografía práctica . Consultado el 24 de octubre de 2013 .
  33. "Frecuencias de letras finlandesas" . Criptografía práctica . Consultado el 24 de octubre de 2013 .
  34. "Frecuencias de caracteres húngaros" . Sitio web de Wolfram Alpha . Consultado el 25 de marzo de 2023 .
  35. "He creado un software…" . 27 de abril de 2023.
  36. ^ Perec, Georges; Alfabetos ; Ediciones Galilée, 1976
  • Frecuencias de letras
  • Lewand, Robert Edward. "Matemáticas criptográficas" . pages.central.edu. Archivado del original el 2 de abril de 2007.
  • "Algunos ejemplos de clasificaciones de frecuencia de letras en algunos idiomas comunes" . www.bckelk.org.uk.
  • "Visualización de mapa de calor en JavaScript que muestra la frecuencia de las letras en textos con diferentes distribuciones de teclado" . www.patrick-wied.at.
  • Norvig, Peter. "Una versión actualizada del trabajo de Mayzner utilizando el conjunto de datos Ngrams de Google Books" . norvig.com.
  • Frecuencia de letras —simia.net

Tablas útiles

Tablas útiles para frecuencias de letras individuales, digramas, trigramas, tetragramas y pentagramas basadas en 20.000  palabras que tienen en cuenta combinaciones de longitud de palabra y posición de letra para palabras de 3 a 7  letras de longitud:

  • Mayzner, MS; Tresselt, ME; Wolin, BR (1965). "Tablas de recuentos de frecuencia de letras individuales y digramas para diversas combinaciones de longitud de palabra y posición de letra". Psychonomic Monograph Supplements . 1 (2): 13– 32. OCLC 639975358 . 
  • Mayzner, MS; Tresselt, ME; Wolin, BR (1965). "Tablas de recuentos de frecuencia de trigramas para diversas combinaciones de longitud de palabra y posición de letra". Psychonomic Monograph Supplements . 1 (3): 33– 78.
  • Mayzner, MS; Tresselt, ME; Wolin, BR (1965). "Tablas de recuentos de frecuencia de tetragramas para diversas combinaciones de longitud de palabra y posición de letra". Psychonomic Monograph Supplements . 1 (4): 79– 143.
  • Mayzner, MS; Tresselt, ME; Wolin, BR (1965). "Tablas de recuentos de frecuencia de pentagramas para diversas combinaciones de longitud de palabra y posición de letra". Psychonomic Monograph Supplements . 1 (5): 144– 190.