Articulo de referencia

CiteSeerX

"},"owner":{"wt":"[[Pennsylvania State University]] College of Information Sciences and Technology"},"launch_date":{"wt":"{{start date and age|2008}}/{{start date and age|1997}}...

CiteSeerX (a menudo estilizado como CiteSeer X ; anteriormente llamado CiteSeer ) era un motor de búsqueda público y una biblioteca digital de artículos científicos y académicos, principalmente en los campos de la informática y las ciencias de la información .

El objetivo de CiteSeer es mejorar la difusión y el acceso a la literatura académica y científica. Como servicio sin ánimo de lucro de libre uso, se considera parte del movimiento de acceso abierto que busca transformar la publicación académica y científica para facilitar un mayor acceso a la literatura científica. CiteSeer proporciona gratuitamente metadatos de la Open Archives Initiative de todos los documentos indexados y, cuando es posible, enlaza dichos documentos con otras fuentes de metadatos como DBLP y el Portal ACM . Para promover los datos abiertos , CiteSeerX comparte sus datos con fines no comerciales bajo una licencia Creative Commons . [ 1 ]

CiteSeer se considera un precursor de herramientas de búsqueda académica como Google Scholar y Microsoft Academic Search . [ 2 ] Los motores y archivos similares a CiteSeer generalmente solo recopilan documentos de sitios web de acceso público y no rastrean los sitios web de las editoriales. Por esta razón, es más probable que los autores cuyos documentos están disponibles gratuitamente estén representados en el índice.

CiteSeer cambió su nombre a ResearchIndex en un momento dado y luego lo volvió a cambiar. [ 3 ]

Historia

CiteSeer y CiteSeer.IST

CiteSeer fue creado por los investigadores Lee Giles , Kurt Bollacker y Steve Lawrence en 1997 mientras trabajaban en el NEC Research Institute (ahora NEC Labs ), en Princeton, Nueva Jersey , EE. UU. El objetivo de CiteSeer era rastrear y recopilar activamente documentos académicos y científicos en la web y utilizar la indexación autónoma de citas para permitir consultas por cita o por documento, clasificándolos según su impacto . En un principio, se llamó ResearchIndex.

CiteSeer se lanzó al público en 1998 y contaba con muchas características nuevas que no estaban disponibles en los motores de búsqueda académicos de aquel entonces. Estas incluían:

  • El sistema de indexación autónoma de citas creó automáticamente un índice de citas que puede utilizarse para la búsqueda y evaluación de la literatura.
  • Se calcularon las estadísticas de citas y los documentos relacionados para todos los artículos citados en la base de datos, no solo para los artículos indexados.
  • Enlaces de referencia, que permiten navegar por la base de datos mediante enlaces de citas.
  • El contexto de las citas mostraba el contexto de las referencias a un artículo determinado, lo que permitía al investigador ver de forma rápida y sencilla lo que otros investigadores opinaban sobre un artículo de interés.
  • Se muestran los documentos relacionados mediante medidas basadas en citas y palabras, y se presenta una bibliografía activa y actualizada continuamente para cada documento.

CiteSeer obtuvo la patente estadounidense n.°  6289342, titulada " Indexación autónoma de citas y búsqueda de literatura mediante el contexto de las citas " , el 11 de septiembre de 2001. La solicitud de patente se presentó el 20 de mayo de 1998 y tiene prioridad hasta el 5 de enero de 1998. Una solicitud de patente complementaria (patente estadounidense n.°  6738780) se presentó el 16 de mayo de 2001 y se concedió el 18 de mayo de 2004.

Tras NEC, en 2004 se alojó como CiteSeer.IST en la World Wide Web , en la Facultad de Ciencias de la Información y Tecnología de la Universidad Estatal de Pensilvania , y contaba con más de 700 000 documentos. Para mejorar el acceso, el rendimiento y la investigación, se implementaron versiones similares de CiteSeer en universidades como el Instituto Tecnológico de Massachusetts , la Universidad de Zúrich y la Universidad Nacional de Singapur . Sin embargo, estas versiones resultaron difíciles de mantener y ya no están disponibles. Dado que CiteSeer solo indexa artículos de libre acceso en la web y no tiene acceso a los metadatos de los editores, arroja menos resultados de citas que sitios como Google Scholar , que sí disponen de metadatos de los editores.

CiteSeer no se había actualizado completamente desde 2005 debido a limitaciones en su arquitectura. Si bien incluía una muestra representativa de documentos de investigación en informática y ciencias de la información, su cobertura era limitada, ya que se restringía a artículos de acceso público, generalmente disponibles en la página web del autor, o a aquellos enviados por este. Para superar algunas de estas limitaciones, se diseñó una arquitectura modular y de código abierto para CiteSeer : CiteSeerX. 

CiteSeerX

CiteSeerX reemplazó a CiteSeer y todas las consultas a CiteSeer fueron redirigidas. CiteSeerX [ 4 ] es un motor de búsqueda público y una biblioteca digital y repositorio de artículos científicos y académicos, principalmente con un enfoque en ciencias de la computación e información . [ 4 ] Sin embargo, recientemente CiteSeerX se ha expandido a otros dominios académicos como economía, física y otros. Lanzado en 2008, se basó libremente en el motor de búsqueda y biblioteca digital anterior CiteSeer y está construido con una nueva infraestructura de código abierto , SeerSuite, y nuevos algoritmos y sus implementaciones. Fue desarrollado por los investigadores Isaac Councill y C. Lee Giles en la Facultad de Ciencias de la Información y Tecnología , Universidad Estatal de Pensilvania . Continúa apoyando los objetivos delineados por CiteSeer de rastrear y recopilar activamente documentos académicos y científicos en la web pública y para utilizar una consulta de citas por citas y clasificación de documentos según el impacto de las citas. Actualmente, Lee Giles, Prasenjit Mitra, Susan Gauch, Min-Yen Kan, Pradeep Teregowda, Juan Pablo Fernández Ramírez, Pucktada Treeratpituk, Jian Wu, Hung-Hsuan Chen, Madian Khabsa, Kyle Williams, Douglas Jordan, Steve Carman, Jack Carroll, Jim Jansen y Shuyi Zheng participan o han participado activamente en su desarrollo. Recientemente, se introdujo una función de búsqueda en tabla. [ 5 ] Ha sido financiado por la National Science Foundation , la NASA y Microsoft Research .

CiteSeerX sigue siendo considerado uno de los principales repositorios del mundo, y fue clasificado como el número 1 en julio de 2010. [ 6 ] Actualmente tiene más de 6 millones de documentos con casi 6 millones de autores únicos y 120 millones de citas.

CiteSeerX también comparte su software, datos, bases de datos y metadatos con otros investigadores, actualmente a través de Amazon S3 y rsync . [ 7 ] Su nueva arquitectura modular de código abierto y su software (disponible anteriormente en SourceForge pero ahora en GitHub ) se basan en Apache Solr y otras herramientas de Apache y de código abierto, lo que le permite ser un banco de pruebas para nuevos algoritmos en la recolección, clasificación, indexación y extracción de información de documentos.

CiteSeerX almacena en caché algunos archivos PDF que ha escaneado. Por lo tanto, cada página incluye un enlace DMCA que se puede utilizar para denunciar infracciones de derechos de autor. [ 8 ]

Características actuales

Extracción automatizada de información

CiteSeerX utiliza herramientas automatizadas de extracción de información , generalmente basadas en métodos de aprendizaje automático como ParsCit, para extraer metadatos de documentos académicos como título, autores, resumen, citas, etc. Por lo tanto, en ocasiones se producen errores en los autores y títulos. Otros motores de búsqueda académicos presentan errores similares.

Gateo enfocado

CiteSeerX rastrea documentos académicos disponibles públicamente, principalmente desde las páginas web de los autores y otros recursos abiertos, y no tiene acceso a los metadatos de las editoriales. Por lo tanto, el número de citas en CiteSeerX suele ser menor que en Google Scholar y Microsoft Academic Search, que sí tienen acceso a los metadatos de las editoriales.

Uso

CiteSeerX cuenta con casi un millón de usuarios en todo el mundo, según sus direcciones IP únicas, y recibe millones de visitas diarias. En 2015, las descargas anuales de documentos en formato PDF alcanzaron casi los 200 millones. CiteSeerX ha cerrado debido a la falta de financiación y apoyo de Penn State. Sus datos se almacenan actualmente en Internet Archive y AWS.

Datos

Los datos de CiteSeerX se han compartido periódicamente bajo una licencia Creative Commons BY-NC-SA con investigadores de todo el mundo y se han utilizado y se siguen utilizando en numerosos experimentos y competiciones.

Gracias a su punto final OAI-PMH , [ 9 ] CiteSeerX es un archivo abierto y su contenido se indexa como un repositorio institucional en motores de búsqueda académicos , por ejemplo, consumidores de BASE y Unpaywall .

Otros motores de búsqueda basados ​​en SeerSuite

El modelo CiteSeer se había ampliado para incluir documentos académicos en el ámbito empresarial con SmealSearch y en el comercio electrónico con eBizSearch . Sin embargo, sus patrocinadores no les daban soporte. Una versión anterior de ambas herramientas se podía encontrar en BizSeer.IST , pero ya no está en funcionamiento.

Se han desarrollado otros sistemas de búsqueda y repositorio similares a Seer para química ( ChemXSeer ) y arqueología (ArchSeer). También se creó BotSeer para la búsqueda en archivos robots.txt . Todos ellos se basan en la herramienta de código abierto SeerSuite , que utiliza el indexador de código abierto Lucene .

Véase también

Referencias

  1. 1 2 "Política de datos de CiteSeerX" . Archivado del original el 5 de enero de 2012. Consultado el 10 de noviembre de 2015 .
  2. Kodakateri Pudhiyaveetil, Ajith; Gauch, Susan; Luong, Hiep; Eno, Josh (2009). "Sistema de recomendación conceptual para CiteSeerX". Actas de la tercera conferencia ACM sobre sistemas de recomendación . Nueva York: ACM Press. pág. 241. doi : 10.1145/1639714.1639758 . ISBN  978-1-60558-435-5. S2CID 13900679 . 
  3. Lawrence, Steve (2001). "ResearchIndex: Dentro del mayor índice gratuito de texto completo de literatura científica del mundo". Actas de la conferencia internacional sobre captura de conocimiento - K-CAP 2001. pág. 3. doi : 10.1145/500737.500740 . ISBN  1-58113-380-4. S2CID 19592721 . 
  4. 1 2 "Acerca de CiteSeerX" . Archivado del original el 22 de julio de 2010. Consultado el 7 de mayo de 2010 .
  5. "El equipo de CiteSeerX" . Universidad Estatal de Pensilvania. Archivado del original el 26 de julio de 2018. Consultado el 1 de mayo de 2018 .
  6. "Clasificación de la Web de Repositorios Mundiales: Los 800 principales repositorios" . Cybermetrics Lab. Julio de 2010. Archivado del original el 24 de julio de 2010. Consultado el 24 de julio de 2010 .
  7. "Acerca de los datos de CiteSeerX" . Universidad Estatal de Pensilvania. Archivado del original el 5 de enero de 2012. Consultado el 25 de enero de 2012 .
  8. Por ejemplo, "CiteSeerx – Aviso DMCA" . CiteSeerX 10.1.1.604.4916 . Archivado del original el 18/03/2022. El documento con el identificador "10.1.1.604.4916" se ha eliminado debido a una notificación de retirada por infracción de derechos de autor (DMCA). Si cree que la eliminación ha sido un error, póngase en contacto con nosotros a través de la página de comentarios, indicando el identificador mencionado en esta página. 
  9. Hirst, Tony (2011-12-08). "Uso de OAI-PMH como interfaz de consulta a nivel de registro único para Citeseer" . Archivado del original el 24-11-2020 . Recuperado el 25-04-2020 .

Lecturas adicionales

  • Giles, C. Lee; Bollacker, Kurt D.; Lawrence, Steve (1998). «CiteSeer: un sistema automático de indexación de citas». Actas de la Tercera Conferencia ACM sobre Bibliotecas Digitales . págs. 89–98 . CiteSeerX 10.1.1.30.6847 . doi : 10.1145/276675.276685 . ISBN   978-0-89791-965-4. S2CID 514080 . 
  • Sitio web oficialEdita esto en Wikidata