
La ley de Zipf ( / z ɪ f / ) es una ley empírica que establece que cuando un conjunto de valores medidos se ordena en orden descendente, el valor de la n -ésima entrada suele ser aproximadamente inversamente proporcional a n .
El ejemplo más conocido de la ley de Zipf se aplica a la distribución de frecuencia de las palabras en un texto o corpus de lenguaje natural :
Generalmente se observa que la palabra más común aparece aproximadamente el doble de veces que la siguiente más común, el triple de veces que la tercera más común, y así sucesivamente. Por ejemplo, en el Corpus Brown de textos en inglés americano, la palabra " the " es la más frecuente y, por sí sola, representa casi el 7% de todas las apariciones de palabras (69.971 de poco más de 1 millón). De acuerdo con la ley de Zipf, la segunda palabra más frecuente, " of ", representa poco más del 3,5% de las palabras (36.411 apariciones), seguida de " and " (28.852). [ 1 ] A menudo se utiliza en la siguiente forma, denominada ley de Zipf-Mandelbrot :
dóndeyson parámetros ajustados, con, y. [ 2 ]
Esta ley recibe su nombre del lingüista estadounidense George Kingsley Zipf [ 3 ] [ 4 ] [ 5 ] y sigue siendo un concepto importante en la lingüística cuantitativa . Se ha comprobado que se aplica a muchos otros tipos de datos estudiados en las ciencias físicas y sociales .
En estadística matemática , el concepto se ha formalizado como la distribución zipfiana : una familia de distribuciones de probabilidad discretas relacionadas cuya distribución de frecuencia de rango es una relación de ley de potencia inversa . Están relacionadas con la ley de Benford y la distribución de Pareto .
Algunos conjuntos de datos empíricos dependientes del tiempo se desvían ligeramente de la ley de Zipf. Se dice que dichas distribuciones empíricas son cuasi-zipfianas .
Historia
En 1913, el físico alemán Felix Auerbach observó una proporcionalidad inversa entre el tamaño de la población de las ciudades y su posición en el ranking cuando se ordenan en orden descendente según esa variable. [ 6 ]
La ley de Zipf había sido descubierta antes que Zipf, [ a ] primero por el taquígrafo francés Jean-Baptiste Estoup en 1916, [ 8 ] [ 7 ] y también por G. Dewey en 1923, [ 9 ] y por E. Condon en 1928. [ 10 ]
George Zipf observó la misma relación para las frecuencias de palabras en textos en lenguaje natural en 1932, [ 4 ] pero nunca afirmó haberla originado. De hecho, a Zipf no le gustaban las matemáticas. En su publicación de 1932, [ 11 ] el autor habla con desdén sobre la participación de las matemáticas en la lingüística, ao ibidem , p. 21:
- ... permítanme decir aquí, por el bien de cualquier matemático que pueda planear formular los datos subsiguientes con mayor exactitud, que la capacidad del positivo altamente intenso de convertirse en el negativo altamente intenso, en mi opinión, introduce al diablo en la fórmula en forma de
La única expresión matemática que usó Zipf se parece a ab 2 = constante, que "tomó prestada" de la publicación de Alfred J. Lotka de 1926. [ 12 ]
Se encontró que la misma relación se presenta en muchos otros contextos y para otras variables además de la frecuencia. [ 2 ] Por ejemplo, cuando las corporaciones se clasifican por tamaño descendente, se encuentra que sus tamaños son inversamente proporcionales al rango. [ 13 ] La misma relación se encuentra para los ingresos personales (donde se llama principio de Pareto [ 14 ] ), la cantidad de personas que ven el mismo canal de televisión, [ 15 ] las notas en la música, [ 16 ] los transcriptomas celulares , [ 17 ] [ 18 ] y más.
En 1957, George A. Miller propuso que una ley de potencias emerge incluso en textos generados aleatoriamente. [ 19 ] y en 1992, el bioinformático Wentian Li publicó una prueba [ 20 ] de que la forma de ley de potencias de la ley de Zipf era un subproducto de ordenar las palabras por rango. [ 21 ]
Definición formal
Formalmente, la distribución de Zipf sobre N elementos asigna al elemento de rango k (contando desde 1) la probabilidad:
donde H N es una constante de normalización: El N -ésimo número armónico :
La distribución a veces se generaliza a una ley de potencia inversa con exponente s en lugar de 1. [ 22 ] Es decir ,
donde H N , s es un número armónico generalizado
La distribución de Zipf generalizada se puede extender a infinitos elementos ( N = ∞) solo si el exponente s excede 1. En ese caso, la constante de normalización H N , s se convierte en la función zeta de Riemann .
El caso de elementos infinitos se caracteriza por la distribución zeta y se denomina ley de Lotka . Si el exponente s es 1 o menor, la constante de normalización H N , s diverge cuando N tiende a infinito.
Pruebas empíricas
Empíricamente, se puede probar un conjunto de datos para ver si se aplica la ley de Zipf comprobando la bondad de ajuste de una distribución empírica a la distribución de ley de potencias hipotética con una prueba de Kolmogorov-Smirnov , y luego comparando la razón de verosimilitud (logarítmica) de la distribución de ley de potencias con distribuciones alternativas como una distribución exponencial o una distribución lognormal. [ 23 ]
La ley de Zipf se puede visualizar representando gráficamente los datos de frecuencia de los ítems en un gráfico logarítmico doble , donde los ejes son el logaritmo del orden de clasificación y el logaritmo de la frecuencia. Los datos se ajustan a la ley de Zipf con exponente s en la medida en que la gráfica se aproxima a una función lineal (más precisamente, afín ) con pendiente −s . Para exponente s = 1 , también se puede representar gráficamente el recíproco de la frecuencia (intervalo medio entre palabras) frente al rango, o el recíproco del rango frente a la frecuencia, y comparar el resultado con la línea que pasa por el origen con pendiente 1. [ 3 ]
Explicaciones estadísticas
Aunque la ley de Zipf se cumple para la mayoría de las lenguas naturales, e incluso para algunas artificiales como el esperanto [ 24 ] y el toki pona [ 25 ] , la razón aún no se comprende del todo [ 26 ] . Entre las revisiones recientes de procesos generativos para la ley de Zipf se incluyen Mitzenmacher , «Una breve historia de los modelos generativos para las distribuciones de ley de potencias y lognormales» [ 27 ] y Simkin, «Reinventando a Willis» [ 28 ] .
Sin embargo, esto puede explicarse en parte mediante el análisis estadístico de textos generados aleatoriamente. Wentian Li ha demostrado que en un documento en el que cada carácter se ha elegido aleatoriamente de una distribución uniforme de todas las letras (más un espacio), las "palabras" de diferentes longitudes siguen la tendencia general de la ley de Zipf (las palabras más probables son las más cortas y tienen igual probabilidad). [ 20 ] En 1959, Vitold Belevitch observó que si cualquiera de una gran clase de distribuciones estadísticas bien comportadas (no solo la distribución normal ) se expresa en términos de rango y se expande en una serie de Taylor , la truncación de primer orden de la serie da como resultado la ley de Zipf. Además, una truncación de segundo orden de la serie de Taylor dio como resultado la ley de Mandelbrot . [ 29 ] [ 30 ]
El principio del mínimo esfuerzo es otra posible explicación: el propio Zipf propuso que ni los hablantes ni los oyentes que utilizan un idioma determinado desean esforzarse más de lo necesario para alcanzar la comprensión, y el proceso que resulta en una distribución aproximadamente igual del esfuerzo conduce a la distribución de Zipf observada. [ 5 ] [ 31 ]
Una explicación mínima supone que las palabras son generadas por monos que teclean al azar . Si el lenguaje es generado por un solo mono que teclea al azar, con una probabilidad fija y distinta de cero de pulsar cada tecla de letra o espacio en blanco, entonces las palabras (cadenas de letras separadas por espacios en blanco) producidas por el mono siguen la ley de Zipf. [ 32 ]
Otra posible causa de la distribución de Zipf es un proceso de apego preferencial , en el que el valor x de un elemento tiende a crecer a una tasa proporcional a x (intuitivamente, " los ricos se hacen más ricos " o "el éxito engendra éxito"). Este proceso de crecimiento da como resultado la distribución de Yule-Simon , que ha demostrado ajustarse mejor a la frecuencia de las palabras frente al rango en el lenguaje [ 33 ] y a la población frente al rango de las ciudades [ 34 ] que la ley de Zipf. Fue derivada originalmente por Yule para explicar la población frente al rango en las especies, y aplicada a las ciudades por Simon.
Una explicación similar se basa en los modelos Atlas, sistemas de procesos de difusión intercambiables de valor positivo con parámetros de deriva y varianza que dependen únicamente del rango del proceso. Se ha demostrado matemáticamente que la ley de Zipf se cumple para los modelos Atlas que satisfacen ciertas condiciones de regularidad natural. [ 35 ] [ 36 ]
Leyes relacionadas
Una generalización de la ley de Zipf es la ley de Zipf-Mandelbrot , propuesta por Benoit Mandelbrot , cuyas frecuencias son:
La constante C es la función zeta de Hurwitz evaluada en s .
Las distribuciones zipfianas se pueden obtener a partir de las distribuciones de Pareto mediante un intercambio de variables. [ 22 ]
La distribución de Zipf a veces se denomina distribución de Pareto discreta [ 37 ] porque es análoga a la distribución de Pareto continua de la misma manera que la distribución uniforme discreta es análoga a la distribución uniforme continua .
Las frecuencias de cola de la distribución de Yule-Simon son aproximadamente
para cualquier elección de ρ > 0 .
En la distribución fractal parabólica , el logaritmo de la frecuencia es un polinomio cuadrático del logaritmo del rango. Esto puede mejorar notablemente el ajuste en comparación con una simple relación de ley de potencias. [ 38 ] Al igual que la dimensión fractal, es posible calcular la dimensión de Zipf, que es un parámetro útil en el análisis de textos. [ 39 ]
Se ha argumentado que la ley de Benford es un caso acotado especial de la ley de Zipf, [ 38 ] y la conexión entre estas dos leyes se explica por el hecho de que ambas se originan en relaciones funcionales invariantes de escala de la física estadística y los fenómenos críticos. [ 40 ] Las razones de probabilidades en la ley de Benford no son constantes. Los dígitos principales de los datos que satisfacen la ley de Zipf con s = 1 , satisfacen la ley de Benford.
Ocurrencias
Tamaños de las ciudades
Tras la observación de Auerbach en 1913, se ha examinado exhaustivamente la ley de Zipf para el tamaño de las ciudades. [ 41 ] Sin embargo, estudios empíricos [ 42 ] [ 43 ] y teóricos [ 44 ] más recientes han cuestionado la relevancia de la ley de Zipf para las ciudades.
Frecuencias de palabras en lenguas naturales

En muchos textos en lenguas humanas, las frecuencias de las palabras siguen aproximadamente una distribución de Zipf con un exponente s cercano a 1; es decir, la palabra más común aparece aproximadamente n veces la n -ésima palabra más común.
El gráfico de frecuencia de rango real de un texto en lenguaje natural se desvía en cierta medida de la distribución de Zipf ideal, especialmente en los dos extremos del rango. Las desviaciones pueden depender del idioma, del tema del texto, del autor, de si el texto fue traducido de otro idioma y de las reglas ortográficas utilizadas. [ 45 ] Cierta desviación es inevitable debido al error de muestreo .
En el extremo de baja frecuencia, donde el rango se aproxima a N , el gráfico adquiere una forma de escalera, porque cada palabra solo puede aparecer un número entero de veces.
- La ley de Zipf se aplica a varios idiomas.



Los cinco primeros libros del Antiguo Testamento (la Torá ) en hebreo, con vocales.
Los cinco primeros libros del Antiguo Testamento (el Pentateuco ) en la versión de la Vulgata latina.
Los primeros cuatro libros del Nuevo Testamento (los Evangelios ) en la versión de la Vulgata latina.

En algunas lenguas romances , las frecuencias de la docena de palabras más frecuentes se desvían significativamente de la distribución ideal de Zipf, porque esas palabras incluyen artículos con flexión de género y número gramatical .
En muchas lenguas de Asia Oriental, como el chino , el tibetano y el vietnamita , cada morfema (palabra o fragmento de palabra) consta de una sola sílaba ; una palabra en inglés suele traducirse como un compuesto de dos de estas sílabas. La tabla de frecuencia de rango para estos morfemas se desvía significativamente de la ley de Zipf ideal, tanto en los extremos del rango como en los extremos.
Incluso en inglés, las desviaciones de la ley de Zipf ideal se hacen más evidentes al examinar grandes colecciones de textos. El análisis de un corpus de 30 000 textos en inglés mostró que solo alrededor del 15 % de los textos se ajustan bien a la ley de Zipf. Ligeros cambios en la definición de la ley de Zipf pueden aumentar este porcentaje hasta cerca del 50 %. [ 48 ]
En estos casos, la relación frecuencia-rango observada puede modelarse con mayor precisión mediante distribuciones de leyes de Zipf-Mandelbrot separadas para diferentes subconjuntos o subtipos de palabras. Este es el caso del gráfico frecuencia-rango de los primeros 10 millones de palabras de la Wikipedia en inglés. En particular, las frecuencias de la clase cerrada de palabras funcionales en inglés se describen mejor con s menor que 1, mientras que el crecimiento del vocabulario abierto con el tamaño del documento y el tamaño del corpus requiere s mayor que 1 para la convergencia de la Serie Armónica Generalizada . [ 3 ]

Cuando un texto se cifra de tal manera que cada aparición de cada palabra distinta del texto original se asigna siempre a la misma palabra cifrada (como en el caso de los cifrados de sustitución simples , como los cifrados César , o los cifrados de libro de códigos simples ), la distribución de frecuencia-rango no se ve afectada. Por otro lado, si distintas apariciones de la misma palabra pueden asignarse a dos o más palabras diferentes (como ocurre con el cifrado Vigenère ), la distribución de Zipf normalmente tendrá una parte plana en el extremo de alta frecuencia.
Aplicaciones
La ley de Zipf se ha utilizado para extraer fragmentos paralelos de textos de corpus comparables. [ 49 ] Laurance Doyle y otros han sugerido la aplicación de la ley de Zipf para la detección de lenguaje alienígena en la búsqueda de inteligencia extraterrestre . [ 50 ] [ 51 ]
La distribución de frecuencia de las palabras suele ser característica del autor y cambia poco con el tiempo. Esta característica se ha utilizado en el análisis de textos para la atribución de autoría. [ 52 ] [ 53 ]
Se ha comprobado que los grupos de signos similares a palabras del manuscrito Voynich, un códice del siglo XV, cumplen la ley de Zipf, lo que sugiere que lo más probable es que el texto no sea un engaño, sino que esté escrito en un idioma oscuro o cifrado. [ 54 ] [ 55 ]
Véase también
- Regla del 1% : Hipótesis de que más personas permanecerán en una comunidad virtual sin participar activamente.
- Ley de Benford : Observación de que en muchos conjuntos de datos de la vida real, es probable que el primer dígito sea pequeño.
- Ley de Bradford : Patrón de referencias en revistas científicas
- Derecho de la brevedad – Derecho lingüístico
- Gravedad demográfica – Efecto social
- Lista de palabras : lista simple de las palabras de un idioma en lingüística de corpus.
- Ley de Gibrat – Principio económico
- Hapax legomenon – Palabra que aparece solo una vez en un texto o registro
- Ley de Heaps : heurística para palabras distintas en un documento. Páginas que muestran descripciones breves de los destinos de redireccionamiento.
- Hipótesis de Hilberg : crecimiento de la entropía del lenguaje según una ley de potencias o un proceso estocástico.
- Recurrencia histórica : repetición de eventos similares en la historia.
- Efecto King : fenómeno estadístico en el que los datos mejor clasificados son valores atípicos.
- Cola larga : característica de algunas distribuciones estadísticas.
- Curva de Lorenz : gráfica de la distribución de la riqueza o los ingresos.
- Ley de Lotka : Aplicación de la ley de Zipf a las publicaciones por campo.
- Ley de Menzerath – Ley lingüística
- Distribución de Pareto – Distribución de probabilidad
- Principio de Pareto : principio estadístico sobre la relación entre efectos y causas.
- Ley de Price – Hipótesis bibliométrica
- Principio del mínimo esfuerzo : idea de que los agentes prefieren hacer lo más fácil.
- Distribución rango-tamaño – Distribución estadística
- Ley de epónimo de Stigler : Observación de que ningún descubrimiento científico recibe el nombre de su descubridor.
- Frecuencia de letras
- Palabras más comunes en inglés
Notas
Referencias
- ↑ Fagan, Stephen; Gençay, Ramazan (2010). «Una introducción a la econometría textual». En Ullah, Aman; Giles, David EA (eds.). Manual de economía y finanzas empíricas . CRC Press. pp. 133–153 , esp.&nbps, 139. ISBN 978-1-4200-7036-1Por ejemplo ,
en el Corpus Brown, que consta de más de un millón de palabras, la mitad del volumen de palabras consiste en el uso repetido de tan solo 135 palabras.
- 1 2 Piantadosi, Steven (25 de marzo de 2014). "La ley de frecuencia de palabras de Zipf en el lenguaje natural: una revisión crítica y direcciones futuras" . Psychon Bull Rev. 21 ( 5): 1112– 1130. doi : 10.3758/s13423-014-0585-6 . PMC 4176592. PMID 24664880 .
- 1 2 3 Powers, David MW (1998). Aplicaciones y explicaciones de la ley de Zipf . Conferencia conjunta sobre nuevos métodos en procesamiento del lenguaje y aprendizaje computacional del lenguaje natural. Asociación de Lingüística Computacional. pp. 151–160 . Archivado del original el 10 de septiembre de 2015. Recuperado el 2 de febrero de 2015 a través de aclweb.org.
- 1 2 Zipf, GK (1935). La psicobiología del lenguaje . Nueva York, NY: Houghton-Mifflin.
- 1 2 3 Zipf, George K. (1949). Comportamiento humano y el principio del mínimo esfuerzo . Cambridge, MA: Addison-Wesley. pág. 1 – vía archive.org.
- ^ Auerbach, F. (1913). "Das Gesetz der Bevölkerungskonzentration". Geographische Mitteilungen de Petermann (en alemán). 59 : 74-76 .
- ^ Manning , Christopher D.; Schütze, Hinrich (1999). Fundamentos del procesamiento estadístico del lenguaje natural . Prensa del MIT. pag. 24.ISBN 978-0-262-13360-9.
- ^ Estoup, J.-B. (1916). Juegos Stenographiques (4ª ed.). Citado en Manning y Schütze (1999) . [ 7 ]
- ↑ Dewey, Godfrey (1923). Frecuencia relativa de los sonidos del habla inglesa . Harvard University Press – vía Internet Archive.
- ↑ Condon, EU (1928). "Estadísticas del vocabulario" . Science . 67 (1733): 300. Bibcode : 1928Sci....67..300C . doi : 10.1126/science.67.1733.300 . hdl : 11858/00-001M-0000-002B-0DF6-B . PMID 17782935 .
- ↑ Zipf, GK (1932). Estudios selectos sobre el principio de frecuencia relativa en el lenguaje . Harvard, MA: Harvard University Press.
- ↑ Zipf, George Kingsley (1942). "La unidad de la naturaleza, la acción mínima y la ciencia social natural". Sociometry . 5 (1): 48– 62. doi : 10.2307/2784953 . JSTOR 2784953 .
- ↑ Axtell, Robert L. (7 de septiembre de 2001). "Distribución Zipf de los tamaños de las empresas estadounidenses". Science . 293 (5536): 1818– 1820. Bibcode : 2001Sci...293.1818A . doi : 10.1126/science.1062081 . PMID 11546870 .
- ↑ Sandmo, Agnar (2015). El problema principal en economía política . Manual de distribución del ingreso. Vol. 2. pp. 3–65 . doi : 10.1016/B978-0-444-59428-0.00002-3 . ISBN 978-0-444-59430-3.
- ↑ Eriksson, Magnus; Rahman, SM Hasibur; Fraile, Francisco; Sjostrom, Marten (2013). "Multidifusión interactiva eficiente sobre DVB-T2: utilización de SFNS y PARPS dinámicos" . Simposio Internacional IEEE de 2013 sobre Sistemas Multimedia de Banda Ancha y Radiodifusión (BMSB) . págs. 1-7 . doi : 10.1109/BMSB.2013.6621700 . ISBN 978-1-4673-6047-0.
- ↑ Zanette, Damián H. (7 de junio de 2004). "La ley de Zipf y la creación de contexto musical". arXiv : cs/0406015 .
- ↑ Lazzardi, Silvia; Valle, Filippo; Mazzolini, Andrea; Scialdone, Antonio; Caselle, Michele; Osella, Matteo (27 de abril de 2023). "Leyes estadísticas emergentes en datos transcriptómicos unicelulares" . Revisión física E. 107 (4) 044403. Código bibliográfico : 2023PhRvE.107d4403L . doi : 10.1103/PhysRevE.107.044403 . PMID 37198814 .
- ↑ Chenna, Ramu; Gibson, Toby (2011). Evaluación de la idoneidad de un modelo de brecha zipfiana para el alineamiento de secuencias por pares (PDF) . Conferencia Internacional sobre Bioinformática y Biología Computacional. BIC 4329. Archivado del original (PDF) el 6 de marzo de 2014.
- ↑ Miller, George A. (1957). " Algunos efectos del silencio intermitente" . The American Journal of Psychology . 70 (2): 311– 314. doi : 10.2307/1419346 . ISSN 0002-9556 . JSTOR 1419346. PMID 13424784 .
- 1 2 Li, Wentian (1992). "Los textos aleatorios exhiben una distribución de frecuencia de palabras similar a la ley de Zipf". IEEE Transactions on Information Theory . 38 (6): 1842– 1845. Bibcode : 1992ITIT...38.1842L . doi : 10.1109/18.165464 .
- ↑ Newman, Mej (septiembre de 2005). "Leyes de potencia, distribuciones de Pareto y ley de Zipf" . Contemporary Physics . 46 (5): 323– 351. arXiv : cond-mat/0412004 . Bibcode : 2005ConPh..46..323N . doi : 10.1080/00107510500052444 . ISSN 0010-7514 .
- 1 2 Adamic, Lada A. (2000). Zipf, leyes de potencia y Pareto: un tutorial de clasificación (Informe) (edición reimpresa ). Hewlett-Packard Company. Archivado del original el 1 de abril de 2023. Recuperado el 12 de octubre de 2023 . "Publicación original" . www.parc.xerox.com . Xerox Corporation . Archivado del original el 7 de noviembre de 2001. Consultado el 23 de febrero de 2016 .
- ↑ Clauset, A.; Shalizi, CR; Newman, MEJ (2009). "Distribuciones de ley de potencias en datos empíricos". SIAM Review . 51 (4): 661– 703. arXiv : 0706.1062 . Bibcode : 2009SIAMR..51..661C . doi : 10.1137/070710111 .
- ↑ Manaris, Bill; Pellicoro, Luca; Pothering, George; Hodges, Harland (13 de febrero de 2006). Investigación de las proporciones estadísticas del esperanto en relación con otros idiomas mediante redes neuronales y la ley de Zipf (PDF) . Inteligencia Artificial y Aplicaciones. Innsbruck, Austria. pp. 102–108 . Archivado del original (PDF) el 5 de marzo de 2016 – vía cs.cofc.edu.
- ↑ Skotarek, Dariusz (12–14 de octubre de 2020). La ley de Zipf en Toki Pona (PDF) . ExLing 2020: 11.ª Conferencia Internacional de Lingüística Experimental. Atenas, Grecia: ExLing Society. doi : 10.36505/ExLing-2020/11/0047/000462 . ISBN 978-618-84585-1-2– vía exlingsociety.com.
- ^ Brillouin, León (2004) [1959, 1988]. La science et la théorie de l'information [ La ciencia y la teoría de la información ] (en francés).
réédité en 1988, traducción inglesa rééditée en 2004
- ↑ Mitzenmacher, Michael (enero de 2004). "Una breve historia de los modelos generativos para las distribuciones de ley de potencias y lognormales" . Internet Mathematics . 1 (2): 226– 251. doi : 10.1080/15427951.2004.10129088 .
- ↑ Simkin, MV; Roychowdhury, VP (diciembre de 2010). "Reinventando a Willis". Physics Reports . arXiv : physics/0601192 . doi : 10.1016/j.physrep.2010.12.004 .
- ^ Belevitch, V. (18 de diciembre de 1959). "Sobre las leyes estadísticas de las distribuciones lingüísticas" (PDF) . Annales de la Société Scientifique de Bruselas . 73 : 310– 326. Archivado (PDF) desde el original el 15 de diciembre de 2020 . Consultado el 24 de abril de 2020 .
- ↑ Neumann, PG (c. 2022). Metalingüística estadística y Zipf / Pareto / Mandelbrot (Informe). Laboratorio de Ciencias de la Computación. Vol. 12A. Menlo Park, CA: SRI International . Archivado del original el 5 de junio de 2011. Recuperado el 29 de mayo de 2011 a través de sri.com.
- ↑ Ferrer i Cancho, Ramon & Sole, Ricard V. (2003). "El mínimo esfuerzo y los orígenes de la escala en el lenguaje humano" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 100 (3): 788– 791. Bibcode : 2003PNAS..100..788C . doi : 10.1073/pnas.0335980100 . PMC 298679. PMID 12540826 .
- ↑ Conrad, B.; Mitzenmacher, M. (julio de 2004). "Leyes de potencia para monos que escriben aleatoriamente: el caso de probabilidades desiguales". IEEE Transactions on Information Theory . 50 (7): 1403– 1414. Bibcode : 2004ITIT...50.1403C . doi : 10.1109/TIT.2004.830752 .
- ↑ Lin, Ruokuang; Ma, Qianli DY; Bian, Chunhua (2014). "Leyes de escala en el habla humana, aparición decreciente de nuevas palabras y un modelo generalizado". arXiv : 1412.4846 [ cs.CL ].
- ↑ Vitanov, Nikolay K.; Ausloos, Marcel (2 de diciembre de 2015). "Prueba de dos hipótesis que explican el tamaño de las poblaciones en un sistema de ciudades". Journal of Applied Statistics . 42 (12): 2686– 2693. arXiv : 1506.08535 . Bibcode : 2015JApSt..42.2686V . doi : 10.1080/02664763.2015.1047744 .
- ^ Fernholz, Ricardo T.; Fernholz, Robert (diciembre de 2020). "Ley de Zipf para modelos de atlas". Revista de probabilidad aplicada . 57 (4): 1276–1297 . arXiv : 1707.04285 . doi : 10.1017/jpr.2020.64 .
- ^ Tao, Terence (julio de 2012). «E pluribus unum: De la Complejidad, a la Universalidad» . Dédalo . 141 (3): 23– 34. doi : 10.1162/DAED_a_00158 .
- ↑ Johnson, NL; Kotz, S. y Kemp, AW (1992). Distribuciones discretas univariadas (segunda ed.). Nueva York: John Wiley & Sons, Inc. pág. 466. ISBN 978-0-471-54897-3.
- 1 2 van der Galien, Johan Gerard (8 de noviembre de 2003). "Aleatoriedad factorial: Las leyes de Benford y Zipf con respecto a la distribución del primer dígito de la secuencia factorial de los números naturales" . zonnet.nl . Archivado del original el 5 de marzo de 2007. Recuperado el 8 de julio de 2016 .
- ↑ Eftekhari, Ali (2006). "Geometría fractal de textos: una aplicación inicial a las obras de Shakespeare". Journal of Quantitative Linguistic . 13 ( 2– 3): 177– 193. doi : 10.1080/09296170600850106 .
- ↑ Pietronero, L.; Tosatti, E.; Tosatti, V.; Vespignani, A. (2001). "Explicando la distribución desigual de los números en la naturaleza: Las leyes de Benford y Zipf". Physica A . 293 ( 1– 2): 297– 304. arXiv : cond-mat/9808305 . Bibcode : 2001PhyA..293..297P . doi : 10.1016/S0378-4371(00)00633-6 .
- ↑ Gabaix, Xavier (1999). "La ley de Zipf para las ciudades: una explicación". The Quarterly Journal of Economics . 114 (3): 739– 767. doi : 10.1162/003355399556133 . JSTOR 2586883 .
- ↑ Arshad, Sidra; Hu, Shougeng; Ashraf, Badar Nadeem (febrero de 2018). "Ley de Zipf y distribución del tamaño de las ciudades: una revisión de la literatura y agenda de investigación futura" (PDF) . Physica A: Mecánica estadística y sus aplicaciones . 492 : 75–92 . Bibcode : 2018PhyA..492...75A . doi : 10.1016/j.physa.2017.10.005 . Archivado del original (PDF) el 26 de noviembre de 2024. Recuperado el 19 de noviembre de 2024 .
- ↑ Gan, Li; Li, Dong; Song, Shunfeng (agosto de 2006). "¿Es espuria la ley de Zipf para explicar las distribuciones del tamaño de las ciudades?". Economics Letters . 92 (2): 256– 262. doi : 10.1016/j.econlet.2006.03.004 .
- ↑ Verbavatz, Vincent; Barthelemy, Marc (19 de noviembre de 2020). "La ecuación de crecimiento de las ciudades". Nature . 587 (7834): 397– 401. arXiv : 2011.09403 . Bibcode : 2020Natur.587..397V . doi : 10.1038/s41586-020-2900-x . PMID 33208958 .
- ↑ Rosillo-Rodes, Pablo; San Miguel, Maxi; Sánchez, David (14 de julio de 2025). "Entropía y relación tipo-token en corpus de gigapalabras". Physical Review Research . 7 (3) 033054. arXiv : 2411.10227 . Bibcode : 2025PhRvR...7c3054R . doi : 10.1103/rxxz-lk3n .
- ↑ Ferrer Cancho, Ramon; Solé, Ricard V. (diciembre de 2001). "Dos regímenes en la frecuencia de las palabras y los orígenes de los léxicos complejos: la ley de Zipf revisitada". Journal of Quantitative Linguistics . 8 (3): 165– 173. doi : 10.1076/jqul.8.3.165.4101 . hdl : 2117/180381 .
- ↑ Dorogovtsev, SN; Mendes, JFF (22 de diciembre de 2001). "El lenguaje como una red de palabras en evolución" . Actas de la Royal Society de Londres. Serie B: Ciencias Biológicas . 268 (1485): 2603–2606 . doi : 10.1098/rspb.2001.1824 . PMC 1088922. PMID 11749717 .
- ↑ Moreno-Sánchez, I.; Font-Clos, F.; Corral, A. (2016). "Análisis a gran escala de la Ley de Zipf en textos en inglés" . PLOS ONE . 11 (1) e0147073. arXiv : 1509.04486 . Bibcode : 2016PLoSO..1147073M . doi : 10.1371/journal.pone.0147073 . PMC 4723055. PMID 26800025 .
- ↑ Mohammadi, Mehdi (2016). "Identificación paralela de documentos mediante la ley de Zipf" (PDF) . Actas del Noveno Taller sobre la Creación y el Uso de Corpus Comparables . LREC 2016. Portorož, Eslovenia. pp. 21–25 . Archivado (PDF) del original el 23 de marzo de 2018.
- ↑ Doyle, LR (18 de noviembre de 2016). «Por qué un lenguaje alienígena destacaría entre todo el ruido del universo» . Nautilus Quarterly . Archivado del original el 29 de julio de 2020. Recuperado el 30 de agosto de 2020 .
- ↑ Kershenbaum, Arik (16 de marzo de 2021). La guía del zoólogo a la galaxia: lo que los animales de la Tierra revelan sobre los extraterrestres y sobre nosotros mismos . Penguin. págs. 251–256 . ISBN 978-1-9848-8197-7OCLC 1242873084
- ↑ van Droogenbroeck, Frans J. (2016). Manejo de la distribución Zipf en la atribución computarizada de autoría (Informe). Archivado del original el 4 de octubre de 2023 – vía academia.edu.
- ↑ van Droogenbroeck, Frans J. (2019). Una reformulación esencial de la ley de Zipf-Mandelbrot para resolver aplicaciones de atribución de autoría mediante estadística gaussiana (Informe). Archivado del original el 30 de septiembre de 2023 – vía academia.edu.
- ↑ Boyle, Rebecca (22 de septiembre de 2016). "Los patrones similares al lenguaje del texto misterioso podrían ser un elaborado engaño" . New Scientist . Archivado del original el 18 de mayo de 2022. Recuperado el 25 de febrero de 2022 .
- ↑ Montemurro, Marcelo A.; Zanette, Damián H. (21 de junio de 2013). "Palabras clave y patrones de coocurrencia en el manuscrito Voynich: un análisis basado en la teoría de la información" . PLOS ONE . 8 (6) e66344. Bibcode : 2013PLoSO...866344M . doi : 10.1371/journal.pone.0066344 . PMC 3689824. PMID 23805215 .
Lecturas adicionales
- Gelbukh, Alexander; Sidorov, Grigori (2001). "Los coeficientes de las leyes de Zipf y Heaps dependen del idioma". Lingüística computacional y procesamiento inteligente de texto . Notas de clase en ciencias de la computación. Vol. 2004. pp. 332–335 . doi : 10.1007/3-540-44686-9_33 . ISBN 978-3-540-41687-6.
- Kali, Raja (15 de septiembre de 2003). "La ciudad como un componente gigante: un enfoque de grafo aleatorio para la ley de Zipf". Applied Economics Letters . 10 (11): 717– 720. doi : 10.1080/1350485032000139006 .
- Shyklo, Alexandra Elizabeth (2017). Explicación simple del misterio de Zipf a través de una nueva distribución de rango-participación, derivada de la combinatoria del proceso de clasificación (Informe). SSRN 2918642 .
- Moskowitz, Clara; Ford, Ni-ka; Christiansen, Jen (enero de 2024). "Células por recuento y tamaño". Scientific American . 330 (1): 94. doi : 10.1038/scientificamerican0124-94 . PMID 39017389 .
Enlaces externos
- Strogatz, Steven (29 de mayo de 2009). "Columna invitada: Matemáticas y la ciudad" . The New York Times . Archivado del original el 27 de septiembre de 2015. Recuperado el 29 de mayo de 2009 .—Un artículo sobre la ley de Zipf aplicada a las poblaciones urbanas
- Anticipándose a los acontecimientos (Las sociedades artificiales ponen en tela de juicio la ley de Zipf)
- Artículo de PlanetMath sobre la ley de Zipf
- Distributions de type "fractal parabolique" dans la Nature (French, with English summary) Archived 2004-10-24 at the Wayback Machine
- Un análisis de la distribución del ingreso
- Lista de palabras francesas de Zipf. Archivada el 23 de junio de 2007 en la Wayback Machine.
- Lista Zipf para inglés, francés, español, italiano, sueco, islandés, latín, portugués y finlandés del Proyecto Gutenberg y calculadora en línea para clasificar palabras en textos. Archivado el 8 de abril de 2011 en Wayback Machine.
- Silagadze, ZK (1999). "Citas y la ley de Zipf-Mandelbrot". arXiv : physics/9901035 .
- Ejemplos y modelización de la Ley de Zipf (1985)
- Adamic, Lada (2011). "Desenredando la ley de Zipf" . Nature . 474 (7350): 164– 165. Bibcode : 2011Natur.474..164A . doi : 10.1038/474164a . PMID 21654791 .
- La ley de Benford, la ley de Zipf y la distribución de Pareto de Terence Tao .
- "Ley de Zipf" , Enciclopedia de Matemáticas , EMS Press , 2001 [1994]
- Distribuciones discretas
- Lingüística computacional
- Leyes de potencia
- Leyes estadísticas
- Leyes empíricas
- Reglas epónimas
- Colas de las distribuciones de probabilidad
- Lingüística cuantitativa
- Bibliometría
- Lingüística de corpus
- Presentaciones de 1949