
El Google Books Ngram Viewer es un motor de búsqueda en línea que grafica las frecuencias de cualquier conjunto de cadenas de búsqueda utilizando un recuento anual de n -gramas encontrados en fuentes impresas publicadas entre 1500 y 2022 [ 1 ] [ 2 ] [ 3 ] [ 4 ] en los corpus de texto de Google en inglés, chino (simplificado), francés, alemán, hebreo, italiano, ruso o español. [ 1 ] [ 2 ] [ 5 ] También existen algunos corpus especializados en inglés, como inglés americano, inglés británico e inglés de ficción. [ 6 ]
El programa puede buscar una palabra o una frase. [ 5 ] Los n -gramas se comparan con el texto dentro del corpus seleccionado y, si se encuentran en 40 o más libros, se muestran como un gráfico. [ 6 ] El programa admite búsquedas de partes de la oración y comodines . [ 6 ] Se utiliza habitualmente en la investigación. [ 7 ] [ 8 ]
Historia
El Ngram Viewer fue creado por los ingenieros de software de Google Will Brockman y Jon Orwant [ 9 ] , quienes se asociaron con los investigadores de Harvard Jean-Baptiste Michel y Erez Lieberman Aiden . El servicio se lanzó el 16 de diciembre de 2010. [ 2 ] [ 10 ] Antes del lanzamiento, era difícil cuantificar la tasa de cambio lingüístico debido a la ausencia de una base de datos diseñada para este propósito, dijo Steven Pinker , [ 11 ] un conocido lingüista que fue uno de los coautores del artículo de Science publicado el mismo día. [ 1 ] El Google Books Ngram Viewer se desarrolló con la esperanza de abrir una nueva ventana a la investigación cuantitativa en el campo de las humanidades, y la base de datos contenía 500 mil millones de palabras de 5,2 millones de libros disponibles públicamente desde el principio. [ 2 ] [ 3 ] [ 10 ]
El público objetivo era académico, pero el Google Books Ngram Viewer permitió que cualquier persona con una computadora viera fácilmente un gráfico que representa el cambio diacrónico del uso de palabras y frases. Lieberman declaró a The New York Times que los desarrolladores pretendían brindar incluso a los niños la capacidad de explorar las tendencias culturales a lo largo de la historia. [ 10 ] En el artículo de Science , Lieberman y sus colaboradores denominaron al método de análisis de datos de alto volumen en textos digitalizados " culturomics ". [ 1 ] [ 10 ]
Uso
Las comas delimitan los términos de búsqueda introducidos por el usuario, donde cada término separado por comas se busca en la base de datos como un n- grama (por ejemplo, "escuela infantil" es un 2-grama o bigrama). [ 6 ] El visor de n-gramas devuelve entonces un gráfico de líneas . Debido a las limitaciones en el tamaño de la base de datos de n-gramas, solo se indexan las coincidencias encontradas en al menos 40 libros. [ 6 ]
Limitaciones
Los conjuntos de datos del Ngram Viewer han sido criticados por su dependencia de un reconocimiento óptico de caracteres (OCR) impreciso y por incluir una gran cantidad de textos con fechas y categorías incorrectas. [ 12 ] Debido a estos errores, y a que no se controlan los sesgos [ 13 ] (como la creciente cantidad de literatura científica, que hace que otros términos parezcan perder popularidad), se debe tener cuidado al usar los corpus para estudiar el lenguaje o probar teorías. [ 14 ] Además, los conjuntos de datos pueden no reflejar el cambio lingüístico o cultural general y solo pueden sugerir dicho efecto porque no incluyen metadatos como fecha de publicación, autor, longitud o género, para evitar posibles infracciones de derechos de autor . [ 15 ]
Los errores sistémicos, como la confusión entre s y f en textos anteriores al siglo XIX (debido al uso de ſ , la s larga , que es similar en apariencia a f ), pueden causar sesgo sistémico. [ 14 ] Aunque el equipo de Google Books afirma que los resultados son fiables desde 1800 en adelante, el deficiente OCR y la insuficiencia de datos implican que las frecuencias dadas para idiomas como el chino solo pueden ser precisas a partir de 1970, con partes anteriores del corpus que no muestran ningún resultado para términos comunes, y datos de algunos años que contienen más del 50 % de ruido. [ 16 ] [ 17 ]
Se han propuesto directrices para realizar investigaciones con datos de Google Ngram que intentan abordar algunos de los problemas mencionados anteriormente. [ 18 ]
Véase también
Referencias
- 1 2 3 4 Michael, Jean-Baptiste; Shen, Yuan K.; Aiden, Aviva P.; Veres, Adrian; Gray, Matthew K.; El equipo de Google Books; Pickett, Joseph P.; Hoiberg, Dale ; Clancy, Dan; Norvig, Peter ; Orwant, Jon; Pinker, Steven ; Nowak, Martin A.; Aiden, Erez L. (2010). "Análisis cuantitativo de la cultura utilizando millones de libros digitalizados" . Science . 331 ( 6014): 176– 182. doi : 10.1126/science.1199644 . PMC 3279742. PMID 21163965 .
- 1 2 3 4 Bosker, Bianca (17 de diciembre de 2010). "La base de datos de Ngram de Google rastrea la popularidad de 500 mil millones de palabras" . The Huffington Post . Recuperado el 31 de mayo de 2012 .
- 1 2 Lance Whitney (17 de diciembre de 2010). "Google's Ngram Viewer: Una máquina del tiempo para juegos de palabras" . Cnet.com. Archivado del original el 23 de enero de 2014. Recuperado el 31 de mayo de 2012 .
- ↑ @searchliaison (13 de julio de 2020). "El visor de Ngram de Google Books se ha actualizado con datos recientes hasta 2019" ( Tweet ) . Recuperado el 11 de agosto de 2020 – vía Twitter .
- 1 2 "Google Books Ngram Viewer - Bibliotecas de la Universidad de Buffalo" . Lib.Buffalo.edu. 22 de agosto de 2011. Archivado del original el 2 de julio de 2013. Recuperado el 31 de mayo de 2012 .
- 1 2 3 4 5 "Google Books Ngram Viewer - Información" . Consultado el 1 de junio de 2024 .
- ↑ Greenfield, Patricia M. (2013). "La psicología cambiante de la cultura desde 1800 hasta 2000" . Psychological Science . 24 (9): 1722– 1731. doi : 10.1177/0956797613479387 . ISSN 0956-7976 . PMID 23925305. S2CID 6123553 .
- ↑ Younes, Nadja; Reips, Ulf-Dietrich (2018). "La psicología cambiante de la cultura en los países de habla alemana: un estudio de Google Ngram" . Revista Internacional de Psicología . 53 : 53–62 . doi : 10.1002/ijop.12428 . PMID 28474338. S2CID 7440938 .
- ↑ "Mejora de la búsqueda lingüística con el visor de ngramas de Google Books" .
- 1 2 3 4 "En 500 mil millones de palabras, una nueva ventana a la cultura" . The New York Times . 16 de diciembre de 2010. Consultado el 1 de junio de 2024 .
- ↑ "Steven Pinker – La materia del pensamiento: El lenguaje como ventana a la naturaleza humana" . Royal Society of Arts . 4 de febrero de 2010. Consultado el 2 de junio de 2024 a través de YouTube.
- ↑ Nunberg, Geoff (16 de diciembre de 2010). "Investigación en humanidades con el corpus de Google Books" . Archivado del original el 10 de marzo de 2016. Consultado el 19 de abril de 2015 .
- ↑ Pechenick, Eitan Adam; Danforth, Christopher M.; Dodds, Peter Sheridan; Barrat, Alain (2015-10-07). "Caracterización del corpus de Google Books: fuertes límites a las inferencias de la evolución sociocultural y lingüística" . PLOS One . 10 (10) e0137041. arXiv : 1501.00960 . Bibcode : 2015PLoSO..1037041P . doi : 10.1371/journal.pone.0137041 . PMC 4596490. PMID 26445406 .
- 1 2 Zhang, Sarah. "Los escollos del uso de Google Ngram para estudiar el lenguaje" . WIRED . Recuperado el 24 de mayo de 2017 .
- ↑ Koplenig, Alexander (2 de septiembre de 2015). "El impacto de la falta de metadatos para la medición del cambio cultural y lingüístico utilizando los conjuntos de datos de Google Ngram: reconstrucción de la composición del corpus alemán en tiempos de la Segunda Guerra Mundial" . Digital Scholarship in the Humanities . 32 (1). Oxford Academic (publicado el 1 de abril de 2017): 169–188 . doi : 10.1093/llc/fqv037 . ISSN 2055-7671 .
- ↑ "Google n -gramas y chino premoderno" . digitalsinology.org . Consultado el 19 de abril de 2015 .
- ↑ "Cuando los n -gramas se vuelven malos" . digitalsinology.org . Consultado el 19 de abril de 2015 .
- ↑ Younes, Nadja; Reips, Ulf-Dietrich (22 de marzo de 2019). "Guía para mejorar la fiabilidad de los estudios de Google Ngram: evidencia de términos religiosos" . PLOS One . 14 (3) e0213554. Bibcode : 2019PLoSO..1413554Y . doi : 10.1371/journal.pone.0213554 . ISSN 1932-6203 . PMC 6430395. PMID 30901329 .
Bibliografía
- Lin, Yuri; et al. (julio de 2012). "Anotaciones sintácticas para el corpus de n-gramas de Google Books" (PDF) . Actas de la 50.ª Reunión Anual . Documentos de demostración. 2. Jeju, República de Corea: Asociación de Lingüística Computacional: 169–174 . 2390499.
Libro blanco que presenta la edición de 2012 del corpus de n-gramas de Google Books.
Enlaces externos
- Sitio web oficial
- Servicios de Google
- Software de Google
- Software de 2010
- Procesamiento del lenguaje natural
- Lingüística computacional
- Lingüística de corpus