Articulo de referencia

Ley de Heaps

Verificación de la ley de Heaps sobre Guerra y Paz , así como una versión aleatoria de la misma. Ambos casos se ajustan bien a la ley de Heaps con exponentes β muy similares , p...

Verificación de la ley de Heaps sobre Guerra y Paz , así como una versión aleatoria de la misma. Ambos casos se ajustan bien a la ley de Heaps con exponentes β muy similares , pero K diferentes .
Un diagrama esquemático de la ley de Heaps. El eje x representa el tamaño del texto y el eje y representa la cantidad de elementos de vocabulario distintos presentes en el texto. Compare los valores de ambos ejes.

En lingüística , la ley de Heaps (a veces escrita como ley de Heaps ), también llamada ley de Herdan , es una ley empírica que describe el número de palabras distintas en un documento (o conjunto de documentos) en función de la longitud del documento (la llamada relación tipo-token). Se puede formular como

VR(norte)=Knorteβ{\displaystyle V_{R}(n)=Kn^{\beta }}

donde V R es el número de palabras distintas en un texto de instancia de tamaño n . K y β son parámetros libres determinados empíricamente. Con los corpus de texto en inglés , normalmente K está entre 10 y 100, y β está entre 0,4 y 0,6. [ 1 ]

La ley se atribuye frecuentemente a Harold Stanley Heaps , pero fue descubierta originalmente por Gustav Herdan ( 1960 ) . [ 2 ] Bajo supuestos moderados, la ley de Herdan-Heaps es asintóticamente equivalente a la ley de Zipf con respecto a las frecuencias de palabras individuales dentro de un texto. [ 3 ] Esto es consecuencia del hecho de que la relación tipo-token (en general) de un texto homogéneo puede derivarse de la distribución de sus tipos. [ 4 ] 

Empíricamente, la ley de Heaps se conserva incluso cuando el documento se baraja aleatoriamente, [ 5 ] lo que significa que no depende del orden de las palabras, sino solo de su frecuencia. [ 6 ] Esto se utiliza como evidencia para derivar la ley de Heaps de la ley de Zipf. [ 5 ]

La ley de Heaps implica que, a medida que se recopila más texto de ejemplo, habrá rendimientos decrecientes en términos de descubrimiento del vocabulario completo del que se extraen los términos distintos.

Se han identificado desviaciones de la ley de Heaps, como se observa típicamente en los corpus de texto en inglés, en corpus generados con grandes modelos de lenguaje. [ 7 ]

La ley de Heaps también se aplica a situaciones en las que el "vocabulario" es simplemente un conjunto de tipos distintos que son atributos de una colección de objetos. Por ejemplo, los objetos podrían ser personas y los tipos podrían ser el país de origen de la persona. Si las personas se seleccionan al azar (es decir, no se seleccionan en función del país de origen), entonces la ley de Heaps indica que rápidamente tendremos representantes de la mayoría de los países (en proporción a su población), pero será cada vez más difícil cubrir el conjunto completo de países si continuamos con este método de muestreo. La ley de Heaps también se ha observado en transcriptomas de células individuales [ 8 ] considerando los genes como los objetos distintos en el "vocabulario".

Véase también

Referencias

Citas

  1. Rosillo-Rodes, Pablo; San Miguel, Maxi; Sánchez, David (2025-07-14). "Entropía y relación tipo-token en corpus de gigapalabras" . Physical Review Research . 7 (3) 033054. Bibcode : 2025PhRvR...7c3054R . doi : 10.1103/rxxz-lk3n . ISSN 2643-1564 . 
  2. Egghe (2007) : "La ley de Herdan en lingüística y la ley de Heaps en recuperación de información son formulaciones diferentes del mismo fenómeno".
  3. Kornai (1999) ; Baeza-Yates y Navarro (2000) ; van Leijenhorst y van der Weide (2005) .
  4. Milička (2009)
  5. 1 2 Sano, Yukie; Takayasu, Hideki; Takayasu, Misako (2012). "La ley de Zipf y la ley de Heaps pueden predecir el tamaño de las palabras potenciales" . Progress of Theoretical Physics Supplement . 194 : 202–209 . Bibcode : 2012PThPS.194..202S . doi : 10.1143/PTPS.194.202 . ISSN 0375-9687 . 
  6. Najafi, Elham; Darooneh, Amir H. (2015-06-19). Esteban, Francisco J. (ed.). "Los patrones fractales de las palabras en un texto: un método para la extracción automática de palabras clave" . PLOS ONE . 10 (6) e0130617. Bibcode : 2015PLoSO..1030617N . doi : 10.1371/journal.pone.0130617 . ISSN 1932-6203 . PMC 4474631. PMID 26091207 .   
  7. Lai, Uyen; Randhawa, Gurjit; Sheridan, Paul (12 de diciembre de 2023). "Ley de montículos en corpus emulados de modelos de lenguaje grandes GPT-Neo" . Actas del Décimo Taller Internacional sobre Evaluación del Acceso a la Información (EVIA 2023), un taller satélite de la Conferencia NTCIR-17 . Tokio, Japón. págs. 20–23 . doi : 10.20736/0002001352 . 
  8. Lazzardi, Silvia; Valle, Filippo; Mazzolini, Andrea; Scialdone, Antonio; Caselle, Michele; Osella, Matteo (2023). "Leyes estadísticas emergentes en datos transcriptómicos unicelulares". Revisión física E. 107 (4) 044403: 2021–16.06.448706. bioRxiv 10.1101/2021.06.16.448706 . doi : 10.1103/PhysRevE.107.044403 . PMID 37198814 .  

Fuentes

  • Baeza-Yates, Ricardo; Navarro, Gonzalo (2000), "Índices de direccionamiento de bloques para la recuperación aproximada de texto", Journal of the American Society for Information Science , 51 (1): 69–82 , CiteSeerX 10.1.1.31.4832 , doi : 10.1002/(sici)1097-4571(2000)51:1 < 69::aid-asi10 > 3.0.co ; 2-c .
  • Egghe, L. (2007), "Desentrañando la ley de Herdan y la ley de Heaps: argumentos matemáticos e informétricos", Journal of the American Society for Information Science and Technology , 58 (5): 702–709 , doi : 10.1002/asi.20524.
  • Heaps, Harold Stanley (1978), Recuperación de información: aspectos computacionales y teóricos , Academic PressLa ley de Heaps se propone en la Sección 7.5 (págs.  206-208).
  • Herdan, Gustav (1960), Matemáticas de tokens de tipo , La Haya: Mouton.
  • Kornai, Andras (1999), "La ley de Zipf fuera del rango medio", en Rogers, James (ed.), Actas de la Sexta Reunión sobre Matemáticas del Lenguaje , Universidad de Florida Central, págs. 347–356 .
  • Milička, Jiří (2009), "Relación tipo-token y hapax-token: un modelo combinatorio", Glottotheory. International Journal of Theoretical Linguistics , 1 (2): 99– 110, doi : 10.1515/glot-2009-0009 , S2CID 124490442 .
  • van Leijenhorst, DC; van der Weide, Th. P. (2005), "Una derivación formal de la ley de Heaps", Ciencias de la información , 170 ( 2– 4): 263– 272, doi : 10.1016/j.ins.2004.03.006.
  • Este artículo incorpora material de la ley de Heaps en PlanetMath , que está bajo la licencia Creative Commons Attribution/Share-Alike License .
  • Logotipo de Wikimedia CommonsContenido multimedia relacionado con la ley de Heaps en Wikimedia Commons.