Articulo de referencia

Análisis de página y elementos de verdad fundamental

Page Analysis and Ground Truth Elements ( PAGE ) es un estándar XML para codificar documentos digitalizados. [ 1 ] Comparable a Analyzed Layout and Text Object (ALTO), permite d...

Page Analysis and Ground Truth Elements ( PAGE ) es un estándar XML para codificar documentos digitalizados. [ 1 ] Comparable a Analyzed Layout and Text Object (ALTO), permite describir la organización y estructura de una página y su contenido.

PAGE XML se puede utilizar para describir:

  • Contenido de la página (regiones, líneas de texto, palabras, glifos, orden de lectura, contenido del texto, ...)
  • la evaluación del análisis de diseño (perfiles de evaluación, resultados de la evaluación, ...)
  • el recorte de la imagen del documento (rejillas de recorte)

El formato ha sido desarrollado por el Laboratorio de Reconocimiento de Patrones y Análisis de Imágenes (PRIMA) de la Universidad de Salford en Manchester.

Fue diseñado para usarse junto con técnicas de segmentación y transcripción automáticas ( reconocimiento óptico de caracteres (OCR) y reconocimiento de texto manuscrito (HTR)): de hecho, PAGE pretende dar soporte a cada uno de los diferentes pasos de la cadena de procesamiento para el análisis de documentos de imagen (desde la mejora de la imagen hasta el análisis de la maquetación y el OCR).

El esquema XML PAGE se utiliza como formato de exportación e importación por software de transcripción automática como eScriptorium [ 2 ] y Transkribus [ 3 ] . También es un formato de exportación utilizado por Kraken, un sistema OCR llave en mano optimizado para documentos en escrituras históricas y no latinas [ 4 ] y por el software OCR Tesseract [ 5 ] .

Referencias

  1. "PAGE-XML" . 12 de julio de 2022 vía GitHub.
  2. "eScripta – Herramientas y técnicas digitales para el estudio de la escritura antigua" .
  3. "Cómo exportar documentos desde Transkribus" . READ-COOP .
  4. Kiessling, Benjamin (5 de abril de 2022). "El sistema OCR Kraken" vía GitHub.
  5. "Motor OCR de código abierto Tesseract" . GitHub . Consultado el 7 de julio de 2025 .
  • Documentación
  • Ejemplo de codificación
  • Documentación del formato XML PAGE para el contenido de páginas en el proyecto OCR-D , financiado por la Deutsche Forschungsgemeinschaft .
  • Documentación "Contenido de la página: Verificación y almacenamiento"
  • Documentación "Evaluación - Metadatos, Perfil y Resultados"
  • Documentación "Corrección de distorsión: Verificación de referencia y almacenamiento"