Articulo de referencia

Escaneo de libros

Escáner de libros Scribe del Archivo de Internet en 2011 Escáner de libros de Internet Archive La digitalización de libros (también conocida como escaneo de revistas ) es el pro...

Escáner de libros Scribe del Archivo de Internet en 2011
Escáner de libros de Internet Archive

La digitalización de libros (también conocida como escaneo de revistas ) es el proceso de convertir libros y revistas físicos en medios digitales como imágenes , texto electrónico o libros electrónicos (e-books) mediante un escáner de imágenes . Los proyectos de digitalización de libros a gran escala han hecho que muchos libros estén disponibles en línea. Los libros digitales se pueden distribuir, reproducir y leer fácilmente en pantalla . Los escáneres de imágenes pueden ser manuales o automáticos. Después del escaneo, el software ajusta las imágenes del documento alineándolas, recortándolas, editándolas y convirtiéndolas a texto y al formato final de libro electrónico. La resolución de escaneo para la digitalización de libros varía según el propósito y la naturaleza del material. Los escáneres de alta gama capaces de procesar miles de páginas por hora pueden costar miles de dólares. Proyectos como Project Gutenberg , Million Book Project , Google Books y Open Content Alliance digitalizan libros a gran escala. Los escáneres de imágenes pueden ser manuales o automáticos.

Descripción

El escaneo de libros es el proceso de convertir libros y revistas físicos en medios digitales , como imágenes , texto electrónico o libros electrónicos (e-books), mediante el uso de un escáner de imágenes . [ 1 ] Los proyectos de escaneo de libros a gran escala han hecho que muchos libros estén disponibles en línea. [ 2 ]

Usar

Los libros digitales se pueden distribuir, reproducir y leer fácilmente en pantalla . Los formatos de archivo comunes son DjVu , PDF ( Portable Document Format ) y TIFF ( Tag Image File Format ). Para convertir las imágenes originales, se utiliza el reconocimiento óptico de caracteres (OCR) [ 1 ] para transformar las páginas del libro en un formato de texto digital como ASCII u otro formato similar, lo que reduce el tamaño del archivo y permite que el texto se reformatee, se busque o se procese mediante otras aplicaciones. [ 1 ]

Los escáneres de imágenes pueden ser manuales o automáticos. En un escáner de imágenes comercial convencional, el libro se coloca sobre una placa de vidrio plana (o platina), y un conjunto de luz y lentes se desplaza sobre el libro debajo del vidrio. En los escáneres de libros manuales, la placa de vidrio se extiende hasta el borde del escáner, lo que facilita la alineación del lomo del libro. [ 1 ] [ 2 ]

Software

Tras el escaneo, el software ajusta las imágenes del documento alineándolas, recortándolas, editándolas y convirtiéndolas a texto y formato de libro electrónico. Los correctores humanos suelen revisar el resultado para detectar errores.

Resolución

La resolución de escaneo para la digitalización de libros varía según el propósito y la naturaleza del material. Si bien 300 ppp ( 118 puntos/centímetro ) suele ser suficiente para la conversión de texto, las instituciones archivísticas recomiendan resoluciones más altas para la preservación y los materiales raros. Los Archivos Nacionales de Australia sugieren 400 ppp para libros encuadernados y 600 ppp para documentos raros o significativos, [ 3 ] mientras que la Iniciativa de Directrices de Digitalización de Agencias Federales (FADGI) [ 4 ] recomienda un mínimo de 400 ppp para materiales de archivo. [ 5 ]

Estas resoluciones más altas garantizan la captura de detalles finos y apoyan los esfuerzos de preservación a largo plazo, mientras que un enfoque escalonado equilibra la calidad con limitaciones prácticas como la capacidad de almacenamiento y las limitaciones de recursos. Esta estrategia permite a las instituciones optimizar los esfuerzos de digitalización, aplicando resoluciones más altas de forma selectiva a materiales raros o significativos y utilizando resoluciones estándar para documentos más comunes. [ 6 ]

Escáneres de libros

El escáner de libros CZUR M3000 cuenta con una base en forma de V que protege los libros durante el escaneo, garantizando así su conservación.
Escáner de libros CZUR M3000
Boceto de un escáner de libros manual típico

Los escáneres de alta gama capaces de procesar miles de páginas por hora pueden costar miles de dólares, pero se han construido escáneres de libros manuales caseros (DIY) capaces de procesar 1200 páginas por hora por US$300 . [ 7 ]

Escáneres de libros comerciales

Los escáneres de libros comerciales , que evolucionaron a partir de simples soportes para copias o cámaras de documentos , no se parecen a los escáneres convencionales. Una variante casera o de fabricación amateur podría usar dos cámaras con trayectorias ópticas cruzadas, de modo que cada una apunte perpendicularmente a una página del libro. La cámara izquierda capturaría la página derecha, mientras que la derecha capturaría simultáneamente la izquierda, tomando imágenes de forma independiente que posteriormente el operador reorganizaría en un único volumen digital. Un escáner de libros comercial moderno cuenta con una sola cámara digital de muy alta calidad , con fuentes de luz a ambos lados, montada en un marco para facilitar el acceso de una persona o máquina para hojear las páginas del libro. Algunos modelos incorporan soportes en forma de V que sujetan los lomos de los libros y centran automáticamente su posición, mientras que los algoritmos de imagen corrigen la curvatura natural de una página abierta. La ventaja de un escáner de libros en comparación con un escáner plano o un alimentador automático de documentos (ADF) es que el proceso de captura puede ser muy rápido, en comparación con la productividad de los escáneres de techo, especialmente porque ambas páginas se pueden capturar en una sola operación, a menudo con la ayuda de un botón de obturador accionado con pedal .

Proyectos a gran escala

Proyectos como el Proyecto Gutenberg (est. 1971), [ 8 ] el Proyecto del Millón de Libros (est. alrededor de 2001), Google Books (est. 2004) y la Open Content Alliance (est. 2005) escanean libros a gran escala. [ 9 ] [ 10 ]

Uno de los principales desafíos es el enorme volumen de libros que deben escanearse. En 2010, se estimó que el número total de obras publicadas como libros en la historia de la humanidad era de alrededor de 130  millones. [ 11 ] Todos estos deben escanearse y luego ponerse a disposición del público en línea para que funcione como una biblioteca universal . Actualmente, existen tres métodos principales en los que confían las grandes organizaciones: la subcontratación, el escaneo interno mediante escáneres de libros comerciales y el escaneo interno mediante soluciones de escaneo robótico.

As for outsourcing, books are often shipped to be scanned by low-cost sources to India or China. Alternatively, due to convenience, safety and technology improvement, many organizations choose to scan in-house by using either overhead scanners which are time-consuming, or digital camera-based scanning machines which are substantially faster and is a method employed by Internet Archive as well as Google.[10][12] Traditional methods have included cutting off the book's spine and scanning the pages in a scanner with automatic page-feeding capability, with subsequent rebinding of the loose pages.[13]

Once the page is scanned, the data is either entered manually or via OCR, another major cost of the book scanning projects.

Due to copyright issues, most scanned books are those that are out of copyright; however, Google Books is known to scan books still protected under copyright unless the publisher specifically prohibits this.[9][10][12][14]

Collaborative projects

There are many collaborative digitization projects throughout the United States. Two of the earliest projects were the Collaborative Digitization Project in Colorado and NC ECHO – North Carolina Exploring Cultural Heritage Online,[15] based at the State Library of North Carolina.

These projects establish and publish best practices for digitization and work with regional partners to digitize cultural heritage materials. Additional criteria for best practices have more recently been established in the UK, Australia and the European Union.[16]Wisconsin Heritage Online[17] is a collaborative digitization project modeled after the Colorado Collaborative Digitization Project. Wisconsin uses a wiki[18] to build and distribute collaborative documentation. Georgia's collaborative digitization program, the Digital Library of Georgia,[19] presents a seamless virtual library on the state's history and life, including more than a hundred digital collections from 60 institutions and 100 agencies of government. The Digital Library of Georgia is a GALILEO[20] initiative based at the University of Georgia Libraries.

En el siglo XX, el Museo y Biblioteca de Manuscritos Hill fotografió libros en Etiopía que posteriormente fueron destruidos en medio de la violencia política de 1975. Desde entonces, la biblioteca ha trabajado para fotografiar manuscritos en países de Oriente Medio. [ 21 ]

En el sur de Asia, la fundación Nanakshahi está digitalizando manuscritos escritos en escritura Gurmukhī .

En Australia, se han llevado a cabo numerosos proyectos de colaboración entre la Biblioteca Nacional de Australia y las universidades para mejorar la infraestructura del repositorio donde se almacenaría la información digitalizada. [ 22 ] Algunos de estos proyectos incluyen el proyecto ARROW (Australian Research Repositories Online to the World) y el proyecto APSR (Australian Partnership for Sustainable Repository).

Métodos

Los escáneres de imágenes pueden ser manuales o automáticos. En un escáner de imágenes comercial convencional, el libro se coloca sobre una placa de vidrio plana (o platina), y un conjunto de luz y lentes se desplaza sobre el libro debajo del vidrio. En los escáneres de libros manuales, la placa de vidrio se extiende hasta el borde del escáner, lo que facilita la alineación del lomo del libro. [ 1 ] [ 2 ]

Preparación para el escaneo

Un problema al escanear libros encuadernados es que, cuando un libro que no es muy delgado se coloca plano, la parte de la página cercana al lomo (el margen interior) se curva significativamente, distorsionando el texto en esa parte del escaneo. Una solución es separar el libro en páginas individuales cortándolas o desencuadernándolas. Un método no destructivo es sostener el libro en un soporte en forma de V y fotografiarlo, en lugar de colocarlo plano y escanearlo. La curvatura en el margen interior es mucho menos pronunciada de esta manera. [ 23 ] Las páginas se pueden pasar a mano o mediante dispositivos automáticos de transporte de papel. Generalmente se presionan láminas de plástico o vidrio transparentes contra la página para aplanarla.

Métodos de escaneo destructivos

Para escanear libros con un presupuesto ajustado, la forma más económica es cortar la encuadernación. Esto convierte el libro o la revista en un fajo de hojas sueltas que se pueden cargar en un alimentador automático de documentos (ADF) estándar y escanear con tecnología de escaneo común y económica. Este método no es adecuado para libros raros o valiosos. Este proceso presenta dos dificultades técnicas: primero, el corte y, segundo, el escaneo.

Desvinculante

Un método más preciso y menos destructivo que cortar las páginas es desencuadernarlas a mano con las herramientas adecuadas. Esta técnica se ha empleado con éxito en decenas de miles de páginas de papel original de archivo escaneadas para el proyecto de archivo digital de la Biblioteca Riazanov, procedentes de periódicos, revistas y folletos con una antigüedad de entre 50 y 100 años o más, y a menudo compuestas de papel frágil y quebradizo. Si bien el valor monetario para algunos coleccionistas (y para la mayoría de los vendedores de este tipo de material) se pierde al desencuadernar, en muchos casos contribuye enormemente a la conservación de las páginas, haciéndolas más accesibles a los investigadores [ 1 ] y reduciendo la probabilidad de que se dañen durante su posterior examen. Una desventaja es que las pilas de páginas desencuadernadas se esponjan y, por lo tanto, quedan más expuestas al oxígeno del aire, lo que en algunos casos puede acelerar su deterioro. Esto se puede solucionar colocando peso sobre las páginas después de desencuadernarlas y almacenándolas en contenedores adecuados. [ 1 ]

Pasar las páginas entre escaneos

Escáneres robóticos para libros

Vídeo del escáner de libros robótico
Escáner de libros robótico en forma de V

Un escáner de libros robótico o automatizado es un dispositivo que digitaliza libros impresos mediante sistemas robóticos que pasan las páginas y capturan imágenes de cada una sin necesidad de que las manos humanas toquen el libro. El escáner consta de un mecanismo para pasar las páginas automáticamente, una o más cámaras para fotografiar cada página y un software para compilar estas imágenes en un archivo digital. Estos escáneres se utilizan para digitalizar grandes cantidades de libros rápidamente. Algunos modelos permiten la operación manual si un libro es demasiado delicado o complejo para que el robot lo manipule solo. El proceso está diseñado para tratar los libros con cuidado, a menudo utilizando soportes especiales y placas de vidrio para evitar daños durante el escaneo. [ 24 ]

La mayoría de los escáneres robóticos comerciales de alta gama utilizan tecnología de aire y succión para voltear y separar las páginas. Estos escáneres utilizan vacío o succión de aire para levantar suavemente una página de la pila, mientras que una ráfaga de aire se utiliza para voltear la página, lo que permite al dispositivo escanear ambos lados de manera eficiente. [ 25 ] Algunos utilizan enfoques más novedosos, como dedos biónicos para voltear las páginas. Algunos escáneres aprovechan sensores ultrasónicos o fotoeléctricos para detectar páginas dobles y evitar que se salten páginas. [ 1 ] [ 2 ] Con informes de máquinas capaces de escanear hasta 2900 páginas por hora, [ 26 ] los escáneres robóticos de libros están diseñados específicamente para proyectos de digitalización a gran escala. [ 1 ]

La patente 7508978 de Google muestra una tecnología de cámara infrarroja que permite la detección y el ajuste automático de la forma tridimensional de la página. [ 27 ] [ 28 ] Los escáneres robóticos de libros que utilizan tecnología de aire y succión dependen de sistemas especializados para voltear y separar las páginas sin causar daños a los libros frágiles o raros.

Véase también

Referencias

  1. 1 2 3 4 5 6 7 8 9 "6 factores a considerar al digitalizar libros a gran escala" . hurixdigital . 22 de julio de 2019. Archivado del original el 17 de enero de 2022. Recuperado el 17 de octubre de 2022 .
  2. 1 2 3 4 Harman, Mike (23 de marzo de 2021). "Una guía de 8 pasos para la digitalización para editores de libros" . Kitaboo . Archivado del original el 22 de enero de 2022. Recuperado el 17 de octubre de 2022 .
  3. "Estándares de digitalización para la preservación" (PDF) . NAA . Consultado el 28 de febrero de 2025 .
  4. Iniciativa de Directrices para la Digitalización de Agencias Federales (FADGI)
  5. "Directrices técnicas para la digitalización de materiales del patrimonio cultural" (PDF) . FADGI . Consultado el 28 de febrero de 2025 .
  6. "Digitalización del archivo del Museo del Servicio de Ambulancias de Queensland: Preservando la historia para las generaciones futuras" . Avantix. Agosto de 2024. Consultado el 28 de febrero de 2025 .
  7. "Escáner de libros de alta velocidad casero hecho con basura y cámaras baratas" . instructables.com . Consultado el 19 de enero de 2014 .
  8. "Las bibliotecas y los archiveros están digitalizando 480.000 libros publicados en el siglo XX que secretamente son de dominio público" . Open Culture . 27 de septiembre de 2019. Archivado del original el 2 de octubre de 2019. Consultado el 19 de octubre de 2022 .
  9. 1 2 Leetaru, Kalev (2008). "Digitalización masiva de libros: La historia más profunda de Google Books y la Open Content Alliance" . First Monday . doi : 10.5210/fm.v13i10.2101 . Recuperado el 19 de octubre de 2022 .
  10. 1 2 3 Kahle, Brewster (13 de marzo de 2017). "Transformando nuestras bibliotecas de analógicas a digitales: una visión para 2020" . Educause . Archivado del original el 15 de marzo de 2017. Recuperado el 19 de octubre de 2022 .
  11. Taycher, Leonid (5 de agosto de 2010). "Según las estimaciones de Google del 5 de agosto de 2010, existen 129.864.880 libros diferentes en el mundo" . Googleblog.blogspot.co.at . Consultado el 8 de agosto de 2014 .
  12. 1 2 Howard, Jennifer (10 de agosto de 2017). "¿Qué pasó con el esfuerzo de Google por escanear millones de libros de bibliotecas universitarias?" . EdSurge . Archivado del original el 5 de enero de 2022 . Recuperado el 17 de octubre de 2022 .
  13. Hafner, Katie (22 de octubre de 2007). "Las bibliotecas rechazan acuerdos para digitalizar libros" . The New York Times . Consultado el 25 de noviembre de 2025 .
  14. Somers, James (20 de abril de 2017). "Incendiando la Biblioteca de Alejandría moderna" . The Atlantic . Archivado del original el 20 de abril de 2017. Recuperado el 19 de octubre de 2022 .
  15. "North Carolina ECHO : Explorando el patrimonio cultural en línea" . ncecho.org . 
  16. Awre, Chris (30 de abril de 2005). "Bibliotecas digitales: principios y práctica en un entorno global" . Ariadne (43). Archivado del original el 5 de abril de 2022. Recuperado el 19 de octubre de 2022 .
  17. "Recuerdos de Wisconsin" . 29 de noviembre de 2006.
  18. "Patrimonio de Wisconsin en línea [ con licencia solo para uso no comercial ] / Página principal" . pbworks.com .
  19. "Bienvenido a la Biblioteca Digital de Georgia" . usg.edu .
  20. "GALILEO" . usg.edu .
  21. "Códices descifrados". The Economist. 18 de diciembre de 2010. pág. 151. 
  22. Bibliotecas en el siglo XXI: Trazando nuevas direcciones en los servicios de información. Editado por Stuart Ferguson, 2007, pág. 84
  23. JThomas (abril de 2012). "Un escáner para libros con texto MUY cerca del margen" . Escáner de libros casero .
  24. Sinmaz, EK, Kocaseçer, M., & Ayyildiz, M. (2022). El efecto del preacondicionamiento del libro en la tasa de éxito del paso de página durante la digitalización automatizada de libros. Instruments & Experimental Techniques , 65 (5), 826–833. https://doi.org/10.1134/S0020441222050281
  25. mchamberlin (26 de marzo de 2025). "El nuevo ScanRobot de McFarlin protege los libros raros a la vez que aumenta el acceso para estudiantes e investigadores" . Universidad de Tulsa . Consultado el 29 de mayo de 2025 .
  26. Rapp, David. "Product Watch: Library Scanners" . Library Journal . Archivado del original el 12 de mayo de 2014. Recuperado el 11 de mayo de 2014 .
  27. US 7508978 , Lefevere, Francois-Marie y Saric, Marin, "Detección de surcos en imágenes escaneadas", publicada el 24 de marzo de 2009, asignada a Google 
  28. Se revela el secreto de la máquina de escaneo de libros de Google , por Maureen Clements, 30 de abril de 2009.
  • Foro sobre dispositivos escáneres de libros para bricolaje
  • Escáner de libros lineales de código abierto de Google
  • Un video de la Universidad de Stanford muestra cómo se escanean algunos libros.
  • Escáner de alta velocidad de la Universidad de Tokio