La Text Creation Partnership ( TCP ) es una organización sin fines de lucro con sede en la biblioteca de la Universidad de Michigan desde el año 2000.Su propósito es producir recursos electrónicos de texto completo a gran escala (especialmente en humanidades) en nombre tanto de las instituciones miembros (en particular, bibliotecas académicas) como de las editoriales académicas, bajo un acuerdo diseñado para satisfacer las necesidades de ambas partes, y al hacerlo, demostrar el valor de un modelo de negocio que considera a los proveedores de información corporativos y sin fines de lucro como colaboradores potencialmente amistosos en lugar de como vendedores y clientes antagónicos, respectivamente. [ 1 ]
Proyectos
TCP ha patrocinado cuatro proyectos de creación de textos hasta la fecha. El primero y más grande es "EEBO-TCP (Fase I)" (2001-2009), un esfuerzo para producir transcripciones de texto completo con marcado estructural de más de 25 000 de los aproximadamente 125 000 libros que se encuentran en los catálogos de títulos abreviados de Pollard y Redgrave y Wing de libros impresos ingleses antiguos, o entre los Thomason Tracts , es decir, de casi todos los libros, panfletos y hojas sueltas publicados en inglés o en Inglaterra antes de 1700. Los libros fueron seleccionados y transcritos a partir de escaneos digitales producidos por ProQuest Information and Learning, y distribuidos por ellos como un producto basado en la web bajo el nombre " Early English Books Online " (EEBO). Los escaneos a partir de los cuales se transcribieron los textos se hicieron a su vez a partir de las copias en microfilm realizadas a lo largo de los años por ProQuest y sus empresas predecesoras, incluida la original University Microfilms, Inc. [ 2 ] La Fase I de EEBO-TCP concluyó a finales de 2009, habiendo transcrito unos 25.300 títulos, e inmediatamente pasó a la Fase II de EEBO-TCP (2009–), un proyecto secuela dedicado a convertir todas las monografías restantes únicas en inglés (aproximadamente 45.000 títulos adicionales).
El tercer proyecto TCP fue Evans-TCP (2003-2007, con algunos trabajos en curso hasta 2010), un esfuerzo por transcribir 6000 de los 36 000 títulos anteriores a 1800 que figuran en la Bibliografía Americana de Charles Evans, y distribuido, nuevamente como imágenes de páginas escaneadas de copias en microfilm, por Readex , una división de NewsBank, Inc. bajo el nombre de " Archivo de Americana " ("Impresiones Americanas Tempranas, serie I: Evans, 1639-1800"). Evans-TCP ha producido textos electrónicos de casi 5000 libros.
El último proyecto TCP fue ECCO-TCP (2005-2010, con algunos trabajos aún en curso), un esfuerzo por transcribir 10 000 libros del siglo XVIII de entre los 136 000 títulos disponibles en el recurso web de Thomson-Gale , "Eighteenth-Century Collections Online" (ECCO). ECCO-TCP se quedó sin fondos en 2010 después de transcribir unos 3000 títulos (y editar unos 2400).
Puntos en común del proyecto
Los cuatro proyectos de texto TCP son muy similares. En cada caso:
- El TCP genera texto a partir de archivos de imagen comerciales que, a su vez, se han creado a partir de copias en microfilm de libros antiguos.
- Los proveedores de imágenes comerciales reciben lo que en la práctica es un índice de texto completo de su producto de imagen por mucho menos de lo que les costaría producirlo ellos mismos: un valor añadido a su producto.
- Las bibliotecas asociadas son propietarias de los textos resultantes, en lugar de simplemente tener una licencia, y tienen la libertad (sujeta a ciertas condiciones) de montar los textos en el sistema que deseen o utilizarlos internamente como herramienta de investigación y enseñanza.
- Los textos se crean de acuerdo con los estándares establecidos por la biblioteca, son uniformes en múltiples conjuntos de datos y potencialmente permiten realizar búsquedas cruzadas.
- Debido a que se crean de forma colaborativa, los textos son relativamente económicos (por ejemplar) y su precio aumenta con cada biblioteca que se une a la asociación.
- Los textos acabarán estando disponibles gratuitamente para el público en general.
- La selección de textos para convertir, si bien difiere de un proyecto a otro, sigue en todos los casos principios similares: variedad, relevancia, calidad representativa y evitar la duplicación; además, generalmente se atienden las solicitudes específicas del profesorado o de las iniciativas académicas de las instituciones miembros.
- Hasta ahora, TCP se ha centrado principalmente en la creación de textos, no en la creación de un "producto". Si bien los textos de los tres proyectos están o estarán alojados en servidores de la biblioteca de la Universidad de Michigan, el sitio de Michigan no es el sitio oficial de TCP: cualquier biblioteca asociada con los recursos y las medidas de seguridad adecuadas puede hacer lo mismo. Los textos de EEBO-TCP, por ejemplo, están disponibles en Michigan, ProQuest, la Biblioteca Digital de la Universidad de Oxford y la Universidad de Chicago.
Organización
El TCP está supervisado por una Junta Directiva, integrada principalmente por administradores bibliotecarios sénior de las instituciones asociadas, representantes de las empresas colaboradoras y el Consejo de Recursos Bibliotecarios y de Información (CLIR). La Junta recibe asesoramiento académico, integrado por profesores de estudios ingleses y estadounidenses de la época moderna temprana, en materia de selección y becas.
El TCP mantiene vínculos informales con varios proyectos académicos universitarios, especialmente al proporcionarles textos fuente para su trabajo. Entre las instituciones representadas se encuentran la Universidad Northwestern , la Universidad de Oxford , la Universidad de Washington en San Luis , la Universidad de Sídney , la Universidad de Toronto y la Universidad de Victoria . El TCP también ha colaborado con estudiantes patrocinando un concurso anual de ensayos para estudiantes de pregrado, organizando grupos de trabajo sobre el uso de los textos del TCP en la pedagogía y solicitando ideas a académicos y estudiantes sobre la selección y el uso de dichos textos.
La producción de textos se gestiona a través del Servicio de Producción de Bibliotecas Digitales (DLPS) de la Universidad de Michigan , que cuenta con una amplia experiencia en la producción de textos electrónicos codificados en SGML/XML. El DLPS recibe asistencia de los Sistemas y Servicios de Bibliotecas Digitales Bodleian (BDLSS) de la Universidad de Oxford, entre ellos el fallecido Sebastian Rahtz . También se han puesto en marcha pequeñas operaciones de producción a tiempo parcial en otras dos bibliotecas: el Centro de Estudios de la Reforma y el Renacimiento en la Biblioteca Pratt (Universidad Victoria de la Universidad de Toronto), especializado en libros en latín; y la Biblioteca Nacional de Gales (Llyfrgell Genedlaethol Cymru) en Aberystwyth, especializada en libros en galés.
Estándares
Los cuatro proyectos de texto TCP se producen de la misma manera y con los mismos estándares, que están documentados, al menos en parte, en el sitio web de TCP. [ 3 ]
- Precisión. El TCP se esfuerza por producir textos transcritos con la mayor precisión posible, con una tasa de precisión general especificada del 99,995 % o superior (es decir, un error o menos por cada 20 000 caracteres).
- Introducción de datos. Dada la naturaleza del material, el único método que se ha encontrado para lograr tal precisión de manera económica ha sido que las empresas de conversión de datos, bajo contrato, introduzcan los datos en los libros.
- Control de calidad. La exactitud de la transcripción y la idoneidad del formato son evaluadas en todos los casos por un grupo de correctores y revisores de la biblioteca, gestionados por el DLPS de la Universidad de Michigan.
- Codificación. Todos los archivos de texto resultantes se marcan en SGML o XML válidos (SGML se archiva, XML se exporta) conforme a una "Descripción de tipo de documento" (DTD) propietaria derivada de la versión P3/P4 del estándar Text Encoding Initiative (TEI).
- Marcado con propósito. En comparación con el TEI completo, el DTD TCP es muy simple y está diseñado para capturar solo las características más útiles para una visualización inteligible, una navegación inteligente y una búsqueda productiva. La práctica de TCP consiste en capturar, en la medida de lo posible, la estructura jerárquica general de cada libro (partes, secciones, capítulos, etc.); las características que tienden a marcar el principio y el final de las divisiones (encabezados, explícitos, saludos, despedidas, fechas, firmas, epígrafes, etc.); los elementos más significativos del discurso y la organización (párrafos en prosa, versos y estrofas en poesía, discursos, oradores y acotaciones escénicas en teatro, notas, citas en bloque, numeraciones secuenciales de todo tipo); y solo los aspectos más esenciales del formato físico (saltos de página, listas, tablas, cambios de fuente).
- Fidelidad al original. En cada caso, el texto pretende representar el libro tal como se imprimió originalmente, en la medida de lo posible. Se conservan los errores de imprenta, se ignoran las correcciones manuscritas, se omiten los escaneos duplicados, las imágenes desordenadas se transcriben en el orden previsto y se conservan la mayoría de los caracteres especiales del original.
- Facilidad de lectura y búsqueda. Al mismo tiempo, aunque las transcripciones se realizan carácter por carácter, TCP, partiendo de la premisa de que toda transcripción es una especie de traducción de un sistema simbólico a otro, tiende a definir los caracteres más en función de su significado que de su forma, y a asignar equivalentes modernos y significativos a las formas de letras poco convencionales, generalmente de acuerdo con la definición de "carácter" de Unicode.
- Idiomas. Si bien la mayoría de los textos del TCP están en inglés, muchos no lo están. Los libros y las secciones de libros que no están en inglés están etiquetados con el código de idioma correspondiente, pero no se distinguen de ninguna otra manera.
- Material omitido. El TCP genera texto en alfabeto latino . El material no textual, como la notación musical, las fórmulas matemáticas y las ilustraciones (excepto el texto que puedan contener), se omite y su ubicación se marca con una etiqueta especial. El texto extenso en alfabetos no latinos (griego, hebreo, persa, etc.) también se omite.
Logros y perspectivas
En abril de 2011, el TCP había creado cerca de 40 000 transcripciones de texto completo, con capacidad de búsqueda y navegación, de libros antiguos; una base de datos de alcance, escala y utilidad sin precedentes para estudiantes de diversas disciplinas. Su capacidad para producir los 38 000 textos restantes incluidos en sus ambiciosos planes recientes (para la Fase II del EEBO-TCP) dependerá de la validez de su visión original, basada en la teoría de que las bibliotecas podrían y deberían cooperar para convertirse en productoras y creadoras de estándares, en lugar de consumidoras; y que las universidades y las empresas comerciales, a pesar de sus ciclos de vida, limitaciones y motivaciones muy diferentes, podrían establecer alianzas duraderas que beneficien a todas las partes.
Desde el 1 de enero de 2015, el texto completo de la fase I del EEBO se ha publicado bajo una licencia Creative Commons y puede descargarse y distribuirse libremente.
En 2014, había 28.466 títulos disponibles a través de la Fase II. A partir de julio de 2015, ProQuest tuvo el derecho exclusivo durante cinco años para distribuir la colección EEBO-TCP Fase II. En 2020, los textos se pusieron a disposición del público de forma gratuita. [ 4 ]
Véase también
Referencias
- ↑ Blumenstyk, Goldie (10 de agosto de 2001). "Un proyecto busca digitalizar miles de textos ingleses antiguos" . Chronicle of Higher Education : A47. Archivado del original el 10 de diciembre de 2006. Recuperado el 4 de enero de 2007 .
- ↑ Beamish, Rita (29 de julio de 1999). "Un archivo en línea preservará los primeros libros en inglés" . New York Times . Consultado el 4 de enero de 2007 .
- ↑ "Archivos de producción" . Asociación para la Creación de Textos . Consultado el 12 de marzo de 2020 .
- ↑ "Preguntas frecuentes" . Asociación para la Creación de Textos . Biblioteca de la Universidad de Michigan . Consultado el 1 de mayo de 2024 .
- 2000 establecimientos en Michigan
- Organizaciones educativas fundadas en 2000
- Organizaciones sin fines de lucro con sede en Michigan
- Organizaciones de ciencias bibliotecarias
- Proyectos de bibliotecas digitales
- Bases de datos e índices bibliográficos
- Bases de datos de imprenta de principios de la Edad Moderna
- Investigación textual
- Universidad de Michigan
- Universidad Northwestern
- Organizaciones asociadas a la Universidad de Oxford
- Universidad de Washington en San Luis
- Universidad de Sídney
- Universidad de Toronto
- Universidad de Victoria