El archivado web es el proceso de recopilar, preservar y proporcionar acceso a material de la World Wide Web . El objetivo es garantizar que la información se conserve en un formato de archivo para la investigación y el público. [ 1 ] El proceso de convertir los archivos en plataformas, digitalizando los registros históricos a través de interfaces basadas en plataformas de redes sociales, puede remodelar la memoria colectiva al privilegiar el contenido que se alinea con la lógica de las redes sociales, como la popularidad, la conectividad y la programabilidad. [ 2 ]
Los archivistas web suelen emplear rastreadores web automatizados para capturar la enorme cantidad de información que hay en la web. Un servicio de archivo web muy conocido es Wayback Machine , gestionado por Internet Archive .
La creciente proporción de cultura humana creada y registrada en la web hace inevitable que cada vez más bibliotecas y archivos tengan que afrontar los retos del archivado web. [ 3 ] Las bibliotecas nacionales , los archivos nacionales y diversos consorcios de organizaciones también participan en el archivado de contenido web para evitar su pérdida.
También existen programas y servicios comerciales de archivo web disponibles para organizaciones que necesitan archivar su propio contenido web con fines de patrimonio corporativo, normativos o legales.
Historia y desarrollo
Aunque la curación y organización de la web ha sido frecuente desde mediados o finales de la década de 1990, uno de los primeros proyectos de archivo web a gran escala fue Internet Archive , una organización sin ánimo de lucro creada por Brewster Kahle en 1996. [ 4 ] Internet Archive lanzó su propio motor de búsqueda para visualizar contenido web archivado, Wayback Machine , en 2001. [ 4 ] En 2018, Internet Archive albergaba 40 petabytes de datos. [ 5 ] Internet Archive también desarrolló muchas de sus propias herramientas para recopilar y almacenar sus datos, incluyendo PetaBox para almacenar grandes cantidades de datos de forma eficiente y segura, y Heritrix , un rastreador web desarrollado en colaboración con las bibliotecas nacionales nórdicas. [ 4 ] Otros proyectos lanzados por la misma época incluyeron un proyecto de archivo web de la Biblioteca Nacional de Canadá , Pandora de Australia , archivos web de Tasmania y Kulturarw3 de Suecia. [ 6 ] [ 7 ]
De 2001 a 2010, el Taller Internacional de Archivo Web (IWAW) proporcionó una plataforma para compartir experiencias e intercambiar ideas. [ 8 ] [ 9 ] El Consorcio Internacional para la Preservación de Internet (IIPC), establecido en 2003, ha facilitado la colaboración internacional en el desarrollo de estándares y herramientas de código abierto para la creación de archivos web. [ 10 ]
La ahora desaparecida Internet Memory Foundation fue fundada en 2004 por la Comisión Europea con el fin de archivar la web en Europa. [ 4 ] Este proyecto desarrolló y publicó muchas herramientas de código abierto, como la captura de contenido multimedia enriquecido, el análisis de coherencia temporal, la evaluación de spam y la detección de la evolución de la terminología. [ 4 ] Los datos de la fundación se encuentran ahora en Internet Archive, pero actualmente no son accesibles al público. [ 11 ]
A pesar de que no existe una responsabilidad centralizada para su preservación, el contenido web se está convirtiendo rápidamente en el registro oficial. Por ejemplo, en 2017, el Departamento de Justicia de Estados Unidos afirmó que el gobierno trata los tuits del presidente como declaraciones oficiales. [ 12 ]
Métodos de recolección
Los archivistas web suelen archivar diversos tipos de contenido web, como páginas HTML , hojas de estilo , JavaScript , imágenes y vídeos . También archivan metadatos sobre los recursos recopilados, como la fecha y hora de acceso, el tipo MIME y la longitud del contenido. Estos metadatos son útiles para establecer la autenticidad y la procedencia de la colección archivada.
Archivo transaccional
El archivado transaccional es un enfoque basado en eventos que recopila las transacciones reales que tienen lugar entre un servidor web y un navegador web . Se utiliza principalmente para preservar la evidencia del contenido que se visualizó en un sitio web específico en una fecha determinada. Esto puede ser particularmente importante para las organizaciones que necesitan cumplir con los requisitos legales o reglamentarios de divulgación y retención de información. [ 13 ]
Un sistema de archivo transaccional normalmente funciona interceptando cada solicitud HTTP que se envía al servidor web, así como cada respuesta que recibe de él, filtrando cada respuesta para eliminar el contenido duplicado y almacenando permanentemente las respuestas como flujos de bits.
Dificultades y limitaciones
orugas
Los archivos web que dependen del rastreo web como su principal medio para recopilar la web se ven afectados por las dificultades del rastreo web:
- El protocolo de exclusión de robots puede solicitar a los rastreadores que no accedan a ciertas partes de un sitio web. Algunos archivadores web pueden ignorar la solicitud y rastrear esas partes de todos modos.
- Es posible que gran parte de un sitio web esté oculta en la Deep Web . Por ejemplo, la página de resultados de un formulario web puede encontrarse en la Deep Web si los rastreadores no pueden seguir un enlace a dicha página.
- Las trampas para rastreadores (por ejemplo, los calendarios) pueden provocar que un rastreador descargue un número infinito de páginas, por lo que los rastreadores suelen configurarse para limitar el número de páginas dinámicas que rastrean.
- La mayoría de las herramientas de archivado no capturan la página tal como está. Se ha observado que, a menudo, los banners publicitarios y las imágenes no se archivan correctamente.
Sin embargo, un archivo web en formato nativo, es decir, un archivo web totalmente navegable, con enlaces, contenido multimedia, etc. que funcionen, solo es realmente posible utilizando tecnología de rastreo web.
La web es tan extensa que rastrear una parte significativa de ella requiere una gran cantidad de recursos técnicos. Además, la web cambia tan rápido que algunas secciones de un sitio web pueden sufrir modificaciones incluso antes de que el rastreador haya terminado de analizarlo.
Limitaciones generales
Algunos servidores web están configurados para devolver páginas diferentes a las solicitudes de archivado web que las que devolverían a las solicitudes normales de los navegadores. Esto se suele hacer para engañar a los motores de búsqueda y dirigir más tráfico de usuarios a un sitio web, y a menudo para evitar responsabilidades o para proporcionar contenido mejorado solo a los navegadores que pueden mostrarlo.
Los archivistas web no solo deben lidiar con los desafíos técnicos del archivado web, sino también con las leyes de propiedad intelectual. Peter Lyman [ 14 ] afirma que "aunque la web se considera popularmente un recurso de dominio público , está protegida por derechos de autor ; por lo tanto, los archivistas no tienen derecho legal a copiarla". Sin embargo, las bibliotecas nacionales de algunos países [ 15 ] tienen derecho legal a copiar partes de la web en virtud de una extensión de un depósito legal .
Algunos archivos web privados sin ánimo de lucro, accesibles al público, como WebCite , Internet Archive o Internet Memory Foundation, permiten a los propietarios del contenido ocultar o eliminar el contenido archivado al que no desean que el público tenga acceso. Otros archivos web solo son accesibles desde ciertas ubicaciones o tienen un uso regulado. WebCite cita una demanda reciente contra el almacenamiento en caché de Google, que Google ganó. [ 16 ]
Leyes
En 2017, la Autoridad Reguladora de la Industria Financiera, Inc. (FINRA), una organización reguladora financiera de los Estados Unidos, publicó un aviso que indicaba que todas las empresas que realizan comunicaciones digitales están obligadas a mantener un registro. Esto incluye datos de sitios web, publicaciones en redes sociales y mensajes. [ 17 ] Algunas leyes de derechos de autor pueden inhibir el archivo web. Por ejemplo, el archivo académico de Sci-Hub queda fuera del alcance de la ley de derechos de autor actual. El sitio proporciona acceso permanente a obras académicas, incluidas aquellas que no tienen una licencia de acceso abierto , y por lo tanto contribuye al archivo de la investigación científica que de otro modo podría perderse. [ 18 ] [ 19 ]
Véase también
- Archivo de Anna
- Sitio de archivo
- Equipo de archivo
- archive.today (anteriormente archive.is)
- Memoria colectiva
- Rastreo común
- Vallas publicitarias digitales
- Preservación digital
- Biblioteca digital
- Archivo de fantasmas
- Caché de Google
- Lista de iniciativas de archivo web
- Proyecto Memento
- Iniciativa Minerva
- Sitio web espejo
- Programa Nacional de Infraestructura y Preservación de la Información Digital (NDIIPP)
- Programa Nacional de Bibliotecas Digitales (NDLP)
- PADICAT
- PageFreezer
- Archivo Pandora
- Archivo web del Reino Unido
- artefacto virtual
- Máquina del tiempo
- Rastreo web
- WebCite
- grabadora web
Bibliografía general
- Brown, A. (2006). Archiving Websites: A Practical Guide for Information Management Professionals . Londres: Facet Publishing. ISBN 978-1-85604-553-7.
- Brügger, N. (2005). Archivamiento de sitios web. Consideraciones generales y estrategias . Aarhus: Centro de Investigación de Internet. ISBN 978-87-990507-0-3Archivado del original el 29 de enero de 2009.
- Day, M. (2003). «Preservando el tejido de nuestras vidas: Un estudio de las iniciativas de preservación web» (PDF) . Investigación y tecnología avanzada para bibliotecas digitales . Notas de clase en informática. Vol. 2769. pp. 461–472 . doi : 10.1007/978-3-540-45175-4_42 . ISBN 978-3-540-40726-3. Archivado (PDF) del original el 29 de octubre de 2023 . Recuperado el 16 de noviembre de 2023 .
- Eysenbach, G. y Trudel, M. (2005). "Siguiendo, siguiendo, aún ahí: uso del servicio WebCite para archivar permanentemente páginas web citadas" . Journal of Medical Internet Research . 7 (5) e60. doi : 10.2196/jmir.7.5.e60 . PMC 1550686. PMID 16403724 .
- Fitch, Kent (2003). "Archivo de sitios web: un enfoque para registrar cada respuesta materialmente diferente producida por un sitio web" . Ausweb 03. Archivado del original el 20 de julio de 2003. Recuperado el 27 de septiembre de 2006 .
- Jacoby, Robert (19 de agosto de 2010). "Archivar una página web" . seoq.com . Archivado del original el 3 de enero de 2011. Recuperado el 23 de octubre de 2010 .
- Lyman, Peter (2002). «Archivado de la World Wide Web» . Construyendo una estrategia nacional para la preservación: Cuestiones en el archivo de medios digitales (PDF) . Consejo de Bibliotecas y Recursos de Información . págs. 38–51 . ISBN 978-1-887334-91-4.
- Masanès, J., ed. (2006). Archivo web . Berlín: Springer-Verlag . ISBN 978-3-540-23338-1.
- Pennock, Maureen (2013). Archivo web . Informes de DPC Technology Watch. Gran Bretaña: Digital Preservation Coalition . doi : 10.7207/twr13-01 . ISSN 2048-7916 .
- Toyoda, M.; Kitsuregawa, M. (2012). "La historia del archivado web" . Actas del IEEE . 100 (número especial del centenario): 1441–1443 . doi : 10.1109/JPROC.2012.2189920 .
Referencias
- ↑ "Archivo web" . Netpreserve - Consorcio Internacional para la Preservación de Internet . 14 de agosto de 2024. Archivado del original el 12 de julio de 2024.
- ^ Ringel, Sharon; Ribak, Rivka (1 de enero de 2024). "Plataformar el pasado: la lógica de las redes sociales de la digitalización de archivos" . Redes Sociales + Sociedad . 10 (1) 20563051241228596.doi : 10.1177/ 20563051241228596 . ISSN 2056-3051 .
- ↑ Truman, Gail (2016). "Análisis del entorno del archivo web" . Biblioteca de Harvard .
- 1 2 3 4 5 Toyoda, M.; Kitsuregawa, M. (mayo de 2012). "La historia del archivo web" . Actas del IEEE . 100 (número especial del centenario): 1441–1443 . doi : 10.1109/JPROC.2012.2189920 . ISSN 0018-9219 .
- ↑ Crockett, Zachary (28 de septiembre de 2018). "Dentro de Wayback Machine, la cápsula del tiempo de internet" . The Hustle . seg. Wayyyy back. Archivado del original el 2 de octubre de 2018. Recuperado el 21 de julio de 2020 .
- ↑ Costa, Miguel; Gómez, Daniel; Silva, Mário J. (septiembre de 2017). "La evolución del archivo web". Revista Internacional de Bibliotecas Digitales . 18 (3): 191– 205. doi : 10.1007/s00799-016-0171-9 . S2CID 24303455 .
- ↑ Consalvo, Mia; Ess, Charles, eds. (abril de 2011). «Archivo web: entre el pasado, el presente y el futuro» . Manual de estudios de Internet (1.ª ed.). Wiley. págs. 24–42 . doi : 10.1002/9781444314861 . ISBN 978-1-4051-8588-2Archivado del original el 10 de septiembre de 2022. Consultado el 11 de septiembre de 2022 .
- ↑ "IWAW 2010: El 10.º Taller Internacional de Archivo Web" . WikiCFP . Archivado del original el 12 de noviembre de 2020. Recuperado el 19 de agosto de 2019 .
- ↑ "IWAW - Talleres Internacionales de Archivo Web" . bibnum.bnf.fr . Archivado del original el 20 de noviembre de 2012. Consultado el 19 de agosto de 2019 .
- ↑ "Acerca del IIPC" . IIPC . Consultado el 17 de abril de 2022 .
- ↑ "Internet Memory Foundation: Web gratuita: Descarga, préstamo y transmisión gratuitos" . archive.org . Internet Archive . Consultado el 21 de julio de 2020 .
- ↑ Regis, Camille (4 de junio de 2019). «Archivo web: ¿Crees que la web es permanente? Piénsalo de nuevo» . History Associates. Archivado del original el 15 de julio de 2019. Recuperado el 14 de julio de 2019 .
- ↑ Brown, Adrian (10 de enero de 2016). Archivar sitios web: una guía práctica para profesionales de la gestión de la información . Facet. ISBN 978-1-78330-053-2OCLC 1064574312
- ↑ Lyman (2002)
- ↑ "Depósito legal | IIPC" . netpreserve.org . Archivado del original el 16 de marzo de 2017. Consultado el 31 de enero de 2017 .
- ↑ "Preguntas frecuentes sobre WebCite" . Webcitation.org . Consultado el 20 de septiembre de 2018 .
- ↑ "Redes sociales y comunicaciones digitales" (PDF) . finra.org . FINRA.
- ↑ Claburn, Thomas (10 de septiembre de 2020). «Las revistas de acceso abierto están desapareciendo de la web; Internet Archive está listo para llenar los vacíos» . The Register . Archivado del original el 29 de octubre de 2021. Recuperado el 22 de octubre de 2020 .
- ↑ Laakso, Mikael; Matthias, Lisa; Jahn, Najko (2021). "Lo abierto no es para siempre: Un estudio de revistas de acceso abierto desaparecidas". Journal of the Association for Information Science and Technology . 72 (9): 1099– 1112. arXiv : 2008.11933 . doi : 10.1002/ASI.24460 . S2CID 221340749 .
Enlaces externos
- Consorcio Internacional para la Preservación de Internet (IIPC) : consorcio internacional cuya misión es adquirir, preservar y hacer accesibles el conocimiento y la información de Internet para las generaciones futuras.
- Biblioteca Nacional de Australia, Preservación del Acceso a la Información Digital (PADI)
- Biblioteca del Congreso: Archivo web
- Organización sin fines de lucro de acumulación de datos
- Archivo web
- Proyectos de Internet Archive
- Cuidado de colecciones
- Propiedades de Internet establecidas en 1996
- Conservación y restauración del patrimonio cultural
- Preservación digital
- Biblioteca del Congreso
- Museología