El Proyecto Moby es una colección de recursos léxicos de dominio público creada por Grady Ward . Los recursos fueron dedicados al dominio público y ahora están replicados en el Proyecto Gutenberg . A partir de 2007, contiene la base de datos fonética gratuita más grande, con 177.267 palabras y sus pronunciaciones correspondientes. [ 1 ]
Guionizador
El Moby Hyphenator II contiene la división silábica de 187.175 palabras y frases (incluidas 9.752 entradas sin división silábica, como through y avoir ). La codificación de caracteres parece ser MacRoman , y la división silábica se indica con un punto ( ⟨ • ⟩ , valor del carácter 165 en decimal o A5 en hexadecimal). Sin embargo, algunas entradas tienen una combinación de guiones reales y el carácter 165, como " bar•ber-sur•geon ".
Hay poca o ninguna documentación sobre las opciones de guionización utilizadas; los siguientes ejemplos podrían dar una idea del estilo de guionización empleado: at•mos•phere; at•tend•ant; ca•pac•i•ty; un•col•or•a•ble .
Idiomas
Moby Language II contiene listas de palabras de cinco idiomas: francés , alemán , italiano , japonés y español . Sus estadísticas son:
Sin embargo, algunas de las listas están contaminadas: por ejemplo, la lista japonesa contiene palabras en inglés como abnormal y pseudopalabras como abcdefgh y m,./ . También existen peculiaridades inusuales en la clasificación de estas listas, ya que la lista francesa contiene una simple lista alfabética, mientras que la lista alemana contiene una lista alfabética de palabras escritas tradicionalmente con mayúscula y, a continuación, una lista alfabética de palabras escritas tradicionalmente con minúscula. La lista de palabras italianas, en cambio, no contiene ninguna palabra en mayúscula.
Las listas no utilizan caracteres acentuados, por lo que " e^tre " es como un usuario buscaría la palabra francesa être ("ser").
Categoría gramatical
Moby Part-of-Speech contiene 233.356 palabras descritas completamente por su(s) categoría(s) gramatical(es) , listadas en orden de prioridad. El formato del archivo es palabra\categoría-gramatical , y se identifican las siguientes categorías gramaticales:
Pronunciador
El Moby Pronunciator II contiene 177.267 entradas con pronunciaciones correspondientes. La mayoría de las entradas describen una sola palabra, pero aproximadamente 79.000 [ 2 ] contienen frases con guion o de varias palabras, nombres o lexemas . La distribución del Proyecto Gutenberg también contiene una copia del cmudict v0.3. El archivo contiene líneas con el formato palabra[/parte de la oración] pronunciación . Cada línea termina con el carácter de retorno de carro ASCII (CR, '\r', 0x0D, 13 en decimal).
El campo de palabras puede incluir apóstrofes (p. ej., isn't ), guiones (p. ej. , able-bodied ) y varias palabras separadas por guiones bajos (p. ej., monkey_wrench ). Las palabras que no son en inglés generalmente se muestran, como se indica en la documentación, sin acentos ni otros signos diacríticos. Sin embargo, en 36 entradas (p. ej., São_Miguel ), algunos caracteres acentuados que no son ASCII permanecen, representados mediante la codificación romana de Mac OS .
El campo de categoría gramatical se utiliza para desambiguar 770 palabras que tienen pronunciaciones diferentes según su categoría gramatical. Por ejemplo, para las palabras escritas como «close», el verbo tiene la pronunciación / ˈ k l oʊ z / , mientras que el adjetivo es / ˈ k l oʊ s / . A las categorías gramaticales se les han asignado los siguientes códigos:
A continuación se presenta la pronunciación. Se muestran varios símbolos especiales:
El resto de los símbolos se utilizan para representar caracteres del Alfabeto Fonético Internacional (AFI) . Las pronunciaciones son generalmente consistentes con un dialecto del inglés americano general , que presenta fusión de father-bother , Hurry-furry y Lot-cloth , pero no presenta fusión de cot-caught ni Wine-whine . Cada fonema está representado por una secuencia de uno o más caracteres. Algunas de las secuencias están delimitadas por una barra inclinada "/", como se muestra en la siguiente tabla, pero tenga en cuenta que la secuencia para / ɔɪ / está delimitada por dos barras inclinadas en cada extremo:
A esta colección se le añaden varias secuencias adicionales que representan fonemas de otros idiomas. Estas se utilizan para codificar las palabras, frases y nombres que no están en inglés y que se incluyen en la base de datos. La siguiente tabla contiene estos fonemas adicionales, pero cabe señalar que no está claro hasta qué punto algunos de ellos pueden existir debido a errores de codificación.
Shakespeare
Moby Shakespeare contiene las obras completas e íntegras de Shakespeare . Este recurso específico no está disponible en el Proyecto Gutenberg, pero sí en una versión de 1993 en la web. [ 3 ]
Tesauro
El diccionario de sinónimos Moby II contiene 30 260 palabras raíz, con 2 520 264 sinónimos y términos relacionados, lo que representa un promedio de 83,3 por palabra raíz. Cada línea consta de una lista de valores separados por comas , donde el primer término es la palabra raíz y todos los términos siguientes son términos relacionados.
Grady Ward puso este tesauro en el dominio público en 1996. También está disponible como paquete Debian, aunque el paquete se ha descontinuado a partir de Bullseye . [ 4 ]
Palabras
Moby Words II es la lista de palabras más grande del mundo. [ 1 ] La distribución consta de los siguientes 16 archivos:
Referencias
- 1 2 "Enlaces de recursos ACL SIGLEX" . Grupo de Interés Especial sobre el Léxico de la Asociación de Lingüística Computacional. 13 de agosto de 2004. Archivado del original el 15 de diciembre de 2018. Consultado el 9 de mayo de 2022.
Moby Words: más de 610 000 palabras y frases. La lista de palabras más grande del mundo
. - ↑ Obtenido al ejecutar el comando UNIX grep '.*[-_].* .*' mobypron.unc | wc -l después de convertir los finales de línea y corregir algunos errores de codificación.
- ↑ mobyshak.txt versión de 1993
- ↑ Tosi, Sandro (13 de julio de 2020). "RM: dict-moby-thesaurus -- RoQA; proyecto principal inactivo (más de 10 años); solo para Python 2; sin dependencias externas [ sic ] ; consumo de recursos extremadamente bajo" . Registros de informes de errores de Debian . Consultado el 10 de mayo de 2022 .
Enlaces externos
- Antiguo sitio del Proyecto Moby (icon.shef.ac.uk/Moby/) – Ya no está disponible. Vea una copia hecha por Wayback Machine , tal como estaba el 30 de septiembre de 2017. ("Última modificación: 24 de octubre de 2000") Sitio de descarga en funcionamiento .
- Descargas del Proyecto Gutenberg
- Buscando rimas con Perl ; código correspondiente
- Wikcionario:Apéndice:Tesauro de Moby II
- http://digital.library.upenn.edu/webbin/gutbook/lookup?num=3201
- Bases de datos de dominio público
- Cuerpos
- Investigación lingüística