Articulo de referencia

Reconocimiento óptico de caracteres

Vídeo del proceso de escaneo y reconocimiento óptico de caracteres (OCR) en tiempo real con un escáner portátil. El reconocimiento óptico de caracteres ( OCR ) o lector óptico d...

Vídeo del proceso de escaneo y reconocimiento óptico de caracteres (OCR) en tiempo real con un escáner portátil.

El reconocimiento óptico de caracteres ( OCR ) o lector óptico de caracteres es la conversión electrónica o mecánica de imágenes de texto mecanografiado, manuscrito o impreso en texto codificado por máquina, ya sea a partir de un documento escaneado, una foto de un documento, una foto de una escena (por ejemplo, el texto de letreros y vallas publicitarias en una foto de paisaje) o de texto de subtítulos superpuesto a una imagen (por ejemplo, de una transmisión de televisión). [ 1 ]

Ampliamente utilizado como forma de entrada de datos a partir de registros impresos en papel ( ya sean documentos de pasaporte, facturas, extractos bancarios , recibos informatizados, tarjetas de visita, correo, datos impresos o cualquier documentación adecuada ), es un método común para digitalizar textos impresos de modo que puedan editarse electrónicamente, buscarse, almacenarse de forma más compacta, visualizarse en línea y utilizarse en procesos de máquina como computación cognitiva , traducción automática , conversión de texto a voz (extraído) , datos clave y minería de texto . El OCR es un campo de investigación en reconocimiento de patrones , inteligencia artificial y visión por computadora .  

Las primeras versiones requerían entrenamiento con imágenes de cada carácter y procesaban una fuente a la vez. Actualmente, son comunes los sistemas avanzados capaces de producir un alto grado de precisión para la mayoría de las fuentes, y admiten una variedad de formatos de archivo de imagen . [ 2 ] Algunos sistemas pueden reproducir una salida formateada que se aproxima mucho a la página original, incluyendo imágenes, columnas y otros componentes no textuales.

Historia

Los primeros sistemas de reconocimiento óptico de caracteres se remontan a tecnologías relacionadas con la telegrafía y la creación de dispositivos de lectura para personas ciegas. [ 3 ] En 1914, Emanuel Goldberg desarrolló una máquina que leía caracteres y los convertía en código telegráfico estándar. [ 4 ] Simultáneamente, Edmund Fournier d'Albe desarrolló el Optophone , un escáner portátil que, al moverse sobre una página impresa, producía tonos que correspondían a letras o caracteres específicos. [ 5 ]

A finales de la década de 1920 y principios de la de 1930, Emanuel Goldberg desarrolló lo que denominó una "Máquina Estadística" para la búsqueda en archivos de microfilmes mediante un sistema de reconocimiento de códigos ópticos. En 1931, se le concedió la patente estadounidense número 1.838.389 por dicho invento. [ 6 ] La patente fue adquirida por IBM . [ 7 ]

En 1974, Ray Kurzweil fundó la empresa Kurzweil Computer Products, Inc. y continuó el desarrollo del OCR omnifuente , capaz de reconocer texto impreso en prácticamente cualquier fuente. (A menudo se le atribuye a Kurzweil la invención del OCR omnifuente, pero ya era utilizado por empresas como CompuScan a finales de la década de 1960 y durante la de 1970. [ 3 ] [ 8 ] ) Kurzweil empleó esta tecnología para crear un dispositivo de lectura para personas ciegas que permitía a un ordenador leerles texto en voz alta. El dispositivo incluía un escáner plano CCD y un sintetizador de texto a voz. El 13 de enero de 1976, el producto final se presentó en una rueda de prensa ampliamente difundida, encabezada por Kurzweil y los líderes de la Federación Nacional de Ciegos . En 1978, Kurzweil Computer Products comenzó a comercializar una versión del programa informático de reconocimiento óptico de caracteres. LexisNexis fue uno de los primeros clientes y compró el programa para subir documentos legales y noticias a sus incipientes bases de datos en línea. Dos años después, Kurzweil vendió su empresa a Xerox , que finalmente la escindió como Scansoft , la cual se fusionó con Nuance Communications .

En la década de 2000, el OCR se hizo disponible como servicios en línea y basados ​​en la nube [ 9 ] , y en aplicaciones móviles como la traducción en tiempo real de letreros en idiomas extranjeros en un teléfono inteligente . [ 10 ] Con la llegada de los teléfonos inteligentes y las gafas inteligentes , el OCR se puede utilizar en aplicaciones de dispositivos móviles conectados a Internet que extraen texto capturado con la cámara del dispositivo. [ 11 ] [ 12 ]

Aplicaciones

Los motores OCR se han convertido en aplicaciones de software especializadas en diversos temas, como recibos, facturas, cheques y documentos de facturación legal.

El software se puede utilizar para:

Existen diversos sistemas OCR comerciales y de código abierto disponibles para la mayoría de los sistemas de escritura comunes , incluidos los caracteres latinos, cirílicos, árabes, hebreos, índicos, bengalíes (bangla), devanagari, tamiles, chinos, japoneses y coreanos;

Tipos

El OCR es generalmente un proceso fuera de línea que analiza un documento estático. Existen servicios en la nube que proporcionan una API de OCR en línea. El análisis del movimiento de la escritura a mano puede utilizarse como entrada para el reconocimiento de escritura a mano . [ 24 ] En lugar de utilizar únicamente las formas de los glifos y las palabras, esta técnica es capaz de capturar el movimiento, como el orden en que se dibujan los segmentos , la dirección y el patrón de apoyar y levantar el bolígrafo. Esta información adicional puede hacer que el proceso sea más preciso. Esta tecnología también se conoce como "reconocimiento de caracteres en línea", "reconocimiento de caracteres dinámico", "reconocimiento de caracteres en tiempo real" y "reconocimiento de caracteres inteligente".

Técnicas

Preprocesamiento

El software OCR a menudo preprocesa las imágenes para mejorar las posibilidades de un reconocimiento exitoso. Las técnicas incluyen: [ 25 ]

  • Corrección de la inclinación : si el documento no estaba alineado correctamente al escanearlo, puede que sea necesario inclinarlo unos pocos grados en el sentido de las agujas del reloj o en sentido contrario para que las líneas de texto queden perfectamente horizontales o verticales. 
  • Eliminación de motas : eliminación de puntos positivos y negativos, suavizado de bordes. 
  • Binarización : conversión de una imagen de color o escala de grises a blanco y negro (denominada imagen binaria porque contiene dos colores). Esta tarea se realiza como una forma sencilla de separar el texto (o cualquier otro componente de imagen deseado) del fondo. [ 26 ] La binarización es necesaria, ya que la mayoría de los algoritmos de reconocimiento comerciales solo funcionan con imágenes binarias, por ser más sencillo. [ 27 ] Además, la eficacia de la binarización influye significativamente en la calidad del reconocimiento de caracteres, por lo que se toman decisiones cuidadosas al elegir el método de binarización empleado para un tipo de imagen de entrada determinado; dado que la calidad del método utilizado para obtener el resultado binario depende del tipo de imagen (documento escaneado, imagen de texto de una escena , documento histórico degradado, etc.). [ 28 ] [ 29 ] 
  • Eliminación de líneas : limpieza de cuadros y líneas que no son glifos. 
  • Análisis de diseño o zonificación : identificación de columnas, párrafos, títulos, etc., como bloques distintos. Especialmente importante en diseños de varias columnas y tablas . 
  • Detección de líneas y palabras : Establecimiento de una línea base para las formas de palabras y caracteres, separando las palabras según sea necesario. 
  • Reconocimiento de escritura : en documentos multilingües, la escritura puede cambiar a nivel de palabras y, por lo tanto, es necesario identificar la escritura antes de poder invocar el OCR adecuado para procesar la escritura específica. [ 30 ] 
  • Aislamiento o segmentación de caracteres : para el OCR carácter por carácter, los caracteres múltiples que estén conectados debido a artefactos de la imagen deben separarse; los caracteres individuales que estén divididos en múltiples partes debido a artefactos deben conectarse. 
  • Normalización de la relación de aspecto y la escala [ 31 ]

La segmentación de fuentes de paso fijo se logra de forma relativamente sencilla alineando la imagen a una cuadrícula uniforme según los puntos donde las líneas verticales de la cuadrícula intersecten con menor frecuencia las áreas negras. Para las fuentes proporcionales , se necesitan técnicas más sofisticadas, ya que el espacio en blanco entre letras a veces puede ser mayor que el que hay entre palabras, y las líneas verticales pueden intersectar más de un carácter. [ 32 ]

Reconocimiento de texto

Existen dos tipos básicos de algoritmos OCR centrales, que pueden producir una lista clasificada de caracteres candidatos. [ 33 ]

  • La comparación matricial consiste en comparar una imagen con un glifo almacenado píxel a píxel; también se conoce como coincidencia de patrones , reconocimiento de patrones o correlación de imágenes . Esto requiere que el glifo de entrada esté correctamente aislado del resto de la imagen y que el glifo almacenado tenga una fuente similar y esté a la misma escala. Esta técnica funciona mejor con texto mecanografiado y no es eficaz con fuentes nuevas. Esta es la técnica que implementaron directamente los primeros sistemas OCR basados ​​en fotocélulas físicas.
  • La extracción de características descompone los glifos en "características" como líneas, bucles cerrados, dirección de línea e intersecciones de líneas. Las características extraídas reducen la dimensionalidad de la representación y hacen que el proceso de reconocimiento sea computacionalmente eficiente. Estas características se comparan con una representación vectorial abstracta de un carácter, que puede reducirse a uno o más prototipos de glifos. Las técnicas generales de detección de características en visión artificial son aplicables a este tipo de OCR, que se ve comúnmente en el reconocimiento de escritura a mano "inteligente" y en la mayoría del software OCR moderno. [ 34 ] Los clasificadores de vecinos más cercanos, como el algoritmo de k vecinos más cercanos, se utilizan para comparar las características de la imagen con las características de glifos almacenadas y elegir la coincidencia más cercana. [ 35 ] [ 36 ]

Software como Cuneiform y Tesseract utilizan un enfoque de dos pasadas para el reconocimiento de caracteres. La segunda pasada se conoce como reconocimiento adaptativo y utiliza las formas de las letras reconocidas con alta confianza en la primera pasada para reconocer mejor las letras restantes en la segunda. Esto resulta ventajoso para fuentes poco comunes o escaneos de baja calidad donde la fuente está distorsionada (por ejemplo, borrosa o descolorida). [ 32 ]

A partir de 2024El software OCR moderno incluye Google Docs OCR, ABBYY FineReader , Transym y motores de código abierto como Tesseract 5 (que introdujo un motor de reconocimiento basado en LSTM) [ 37 ] , PaddleOCR (un kit de herramientas OCR multilingüe que admite más de 80 idiomas) [ 38 ] y TrOCR (un modelo basado en transformadores desarrollado por Microsoft para el reconocimiento de texto manuscrito e impreso) [ 39 ] . [ 40 ] Otros, como OCRopus y Tesseract, utilizan redes neuronales que se entrenan para reconocer líneas completas de texto en lugar de centrarse en caracteres individuales.

Una técnica conocida como OCR iterativo divide automáticamente un documento en secciones según el diseño de la página. A continuación, se realiza el OCR en cada sección individualmente, utilizando umbrales de nivel de confianza de caracteres variables para maximizar la precisión del OCR a nivel de página. La Oficina de Patentes de los Estados Unidos ha concedido una patente para este método. [ 41 ]

El resultado del OCR se puede almacenar en el formato estandarizado ALTO , un esquema XML específico mantenido por la Biblioteca del Congreso de los Estados Unidos . Otros formatos comunes incluyen hOCR y PAGE XML .

Para obtener una lista de software de reconocimiento óptico de caracteres, consulte la sección Comparación de software de reconocimiento óptico de caracteres .

Procesamiento posterior

La precisión del OCR puede mejorarse si la salida se limita mediante un léxico , una lista de palabras permitidas en un documento. [ 25 ] Este podría ser, por ejemplo, todas las palabras del idioma inglés o un léxico más técnico para un campo específico. Esta técnica puede ser problemática si el documento contiene palabras que no están en el léxico, como nombres propios . Tesseract utiliza su diccionario para influir en el paso de segmentación de caracteres y así mejorar la precisión. [ 32 ] 

El flujo de salida puede ser un flujo de texto plano o un archivo de caracteres, pero los sistemas OCR más sofisticados pueden conservar el diseño original de la página y producir, por ejemplo, un PDF anotado que incluya tanto la imagen original de la página como una representación textual que permita realizar búsquedas.

El análisis de vecinos cercanos puede utilizar las frecuencias de coocurrencia para corregir errores, al observar que ciertas palabras se ven juntas con frecuencia. [ 42 ] Por ejemplo, "Washington, DC" es generalmente mucho más común en inglés que "Washington DOC".

El conocimiento de la gramática del idioma que se está analizando también puede ayudar a determinar si una palabra es probablemente un verbo o un sustantivo, por ejemplo, lo que permite una mayor precisión.

El algoritmo de distancia de Levenshtein también se ha utilizado en el posprocesamiento de OCR para optimizar aún más los resultados de una API de OCR. [ 43 ]

Optimizaciones específicas para cada aplicación

En los últimos años, los principales proveedores de tecnología OCR han comenzado a optimizar sus sistemas para procesar de forma más eficiente tipos específicos de datos. Además de un léxico específico para cada aplicación, se puede lograr un mejor rendimiento teniendo en cuenta reglas de negocio, expresiones estándar o información detallada contenida en imágenes en color. Esta estrategia se denomina "OCR orientado a la aplicación" u "OCR personalizado" y se ha aplicado al OCR de matrículas , facturas , capturas de pantalla , tarjetas de identificación , permisos de conducir y documentos de fabricación de automóviles .

El New York Times ha adaptado la tecnología OCR en una herramienta propia llamada Document Helper , que permite a su equipo de noticias interactivas acelerar el procesamiento de documentos que necesitan ser revisados. Señalan que les permite procesar hasta 5400 páginas por hora para que los reporteros revisen el contenido. [ 44 ]

Soluciones alternativas

Existen diversas técnicas para resolver el problema del reconocimiento de caracteres mediante métodos distintos a los algoritmos OCR mejorados.

Forzar una mejor entrada

Las fuentes especiales como OCR-A , OCR-B o MICR , con un tamaño, espaciado y formas de caracteres distintivas especificadas con precisión, permiten una mayor tasa de exactitud durante la transcripción en el procesamiento de cheques bancarios. Varios motores OCR destacados fueron diseñados para capturar texto en fuentes populares como Arial o Times New Roman, y son incapaces de capturar texto en fuentes especializadas y muy diferentes de las fuentes de uso común. Dado que Google Tesseract puede entrenarse para reconocer nuevas fuentes, puede reconocer fuentes OCR-A, OCR-B y MICR. [ 45 ]

Códigos postales soviéticos

Los campos de peine son casillas preimpresas que animan a los humanos a escribir con mayor legibilidad : un glifo por casilla. [ 42 ] Suelen imprimirse en un color de exclusión que el sistema OCR puede eliminar fácilmente. [ 42 ] Esta técnica se utilizaba en la antigua Unión Soviética, que tenía códigos postales numéricos y casillas estandarizadas en la parte inferior de todos los sobres donde el usuario imprimía los dígitos uniendo los puntos. [ 46 ] 

Palm OS utilizaba un conjunto especial de glifos, conocido como Graffiti , similares a los caracteres ingleses impresos, pero simplificados o modificados para facilitar su reconocimiento en el hardware de la plataforma, cuya capacidad de procesamiento era limitada. Los usuarios debían aprender a escribir estos glifos especiales.

El OCR basado en zonas restringe la imagen a una parte específica de un documento. Esto se conoce a menudo como OCR basado en plantillas .

Crowdsourcing

El crowdsourcing humano para realizar el reconocimiento de caracteres puede procesar imágenes rápidamente como el OCR impulsado por computadora, pero con mayor precisión en el reconocimiento de imágenes que la obtenida mediante computadoras. Los sistemas prácticos incluyen Amazon Mechanical Turk y reCAPTCHA . La Biblioteca Nacional de Finlandia ha desarrollado una interfaz en línea para que los usuarios corrijan textos OCR en el formato estandarizado ALTO. [ 47 ] El crowdsourcing también se ha utilizado no para realizar el reconocimiento de caracteres directamente, sino para invitar a desarrolladores de software a desarrollar algoritmos de procesamiento de imágenes, por ejemplo, mediante el uso de torneos de orden de clasificación . [ 48 ]

Exactitud

Frecuencia de "laft" y "last" en la base de datos de n-gramas de Google , en documentos en inglés desde 1700 hasta 1900, según escaneos OCR del corpus "English 2009".
Ocurrencia de laft y last en la base de datos de n-gramas de Google , basada en escaneos OCR para el corpus "English 2012" [ 49 ]
La búsqueda de palabras con una S larga en inglés de 2012 o posterior se normaliza a una S.

Encargado por el Departamento de Energía de los Estados Unidos (DOE), el Instituto de Investigación de Ciencias de la Información (ISRI) tenía la misión de fomentar la mejora de las tecnologías automatizadas para la comprensión de documentos impresos a máquina, y llevó a cabo la prueba anual más autorizada de precisión de OCR desde 1992 hasta 1996. [ 50 ]

El reconocimiento de texto mecanografiado en escritura latina aún no es 100% preciso incluso cuando se dispone de imágenes claras. Un estudio basado en el reconocimiento de páginas de periódicos de los siglos XIX y principios del XX concluyó que la precisión del OCR carácter por carácter para el software OCR comercial variaba del 81% al 99%; [ 51 ] la precisión total se puede lograr mediante revisión humana o autenticación del diccionario de datos. Otras áreas , incluido el reconocimiento de escritura a mano, escritura cursiva y texto impreso en otros alfabetos (especialmente aquellos caracteres de lenguas de Asia Oriental que tienen muchos trazos para un solo carácter) , siguen siendo objeto de investigación activa. La base de datos MNIST se utiliza comúnmente para probar la capacidad de los sistemas para reconocer dígitos escritos a mano.  

Las tasas de precisión se pueden medir de varias maneras, y la forma en que se miden puede afectar significativamente la tasa de precisión reportada. Por ejemplo, si no se utiliza el contexto de la palabra (un léxico de palabras) para corregir el software que encuentra palabras inexistentes, una tasa de error de caracteres del 1 % (99 % de precisión) puede resultar en una tasa de error del 5 % o peor si la medición se basa en si cada palabra completa se reconoció sin letras incorrectas. [ 52 ] El uso de un conjunto de datos suficientemente grande es importante en las soluciones de reconocimiento de escritura a mano basadas en redes neuronales. Por otro lado, producir conjuntos de datos naturales es muy complicado y requiere mucho tiempo. [ 53 ]

Un ejemplo de las dificultades inherentes a la digitalización de textos antiguos es la incapacidad del OCR para diferenciar entre los caracteres " s larga " y "f". [ 54 ] [ 49 ]

El reconocimiento de texto cursivo tiene tasas de reconocimiento incluso inferiores a las del texto manuscrito . Es probable que no se puedan alcanzar tasas de reconocimiento más altas de la escritura cursiva en general sin el uso de información contextual o gramatical. Por ejemplo, reconocer palabras completas de un diccionario es más fácil que intentar analizar caracteres individuales de la escritura. Leer la línea de importe de un cheque (que siempre es un número escrito a mano) es un ejemplo donde el uso de un diccionario más pequeño puede aumentar considerablemente las tasas de reconocimiento. Las formas de los caracteres cursivos individuales simplemente no contienen suficiente información para reconocer con precisión (más del 98 %) toda la escritura cursiva manuscrita.

La mayoría de los programas permiten a los usuarios establecer "niveles de confianza". Esto significa que, si el software no alcanza el nivel de precisión deseado, se puede notificar al usuario para que realice una revisión manual.

Un error introducido por el escaneo OCR a veces se denomina scanno (por analogía con el término typo ). [ 55 ] [ 56 ]

Unicode

Los caracteres compatibles con el reconocimiento óptico de caracteres (OCR) se añadieron al estándar Unicode en junio de 1993, con el lanzamiento de la versión 1.1.

Algunos de estos caracteres se obtienen a partir de fuentes específicas para MICR , OCR-A u OCR-B .

Véase también

Referencias

  1. "Documento OCR" . Haven OnDemand . Archivado del original el 15 de abril de 2016.
  2. "Formatos de medios compatibles" . Haven OnDemand . Archivado del original el 19 de abril de 2016.
  3. 1 2 Schantz, Herbert F. (1982). La historia del OCR, reconocimiento óptico de caracteres . [Manchester Center, Vt.]: Recognition Technologies Users Association. ISBN 9780943072012.
  4. ^ Dhavale, Sunita Vikrant (2017). Técnicas avanzadas de filtrado y detección de spam basadas en imágenes . Hershey, Pensilvania: IGI Global. pag. 91.ISBN  9781683180142.
  5. d'Albe, EEF (1 de julio de 1914). "Sobre un optófono de lectura de tipos" . Actas de la Royal Society A: Ciencias Matemáticas, Físicas y de Ingeniería . 90 (619): 373–375 . Bibcode : 1914RSPSA..90..373D . doi : 10.1098/rspa.1914.0061 .
  6. US1838389A , Emanuel, Goldberg, "Máquina estadística", publicada el 29 de diciembre de 1931 
  7. "Sala de prensa de IBM - 28 de julio de 2009. IBM adquirirá SPSS Inc. para ofrecer a sus clientes capacidades de análisis predictivo - Estados Unidos" . www-03.ibm.com . 28 de julio de 2009. Archivado del original el 31 de julio de 2009. Consultado el 9 de enero de 2026 .
  8. "La historia del OCR". Revista de Procesamiento de Datos . 12 : 46. 1970.
  9. "¿Qué es el reconocimiento óptico de caracteres (OCR)?" . IBM . Archivado del original el 2 de marzo de 2026 . Consultado el 7 de julio de 2026 .
  10. "WordLens traduce texto en tiempo real" . CBS News . 3 de junio de 2014. Consultado el 7 de julio de 2026 .
  11. "Extracción de texto de imágenes mediante OCR en Android" . 27 de junio de 2015. Archivado del original el 15 de marzo de 2016.
  12. " [ Tutorial ] OCR en Google Glass" . 23 de octubre de 2014. Archivado del original el 5 de marzo de 2016.
  13. Singh, Richa; Sharma, Vikrant; Kashyap, Rekha; Manwal, Manika (14 de marzo de 2024). "Clasificación automatizada de documentos multipágina y extracción de información para aplicaciones de seguros mediante técnicas de aprendizaje profundo". 11.ª Conferencia Internacional de 2024 sobre Fiabilidad, Tecnologías de la Información y Optimización (Tendencias y Direcciones Futuras) (ICRITO) . IEEE. págs. 1-7 . Bibcode : 2024icri.confQ..96S . doi : 10.1109/ICRITO61523.2024.10522111 . ISBN  979-8-3503-5035-7.
  14. Doss, Yasmine; Boubaker, Olfa (1 de enero de 2026), «Extracción de información clave de documentos de seguros médicos: un estudio comparativo de técnicas basadas en reconocimiento óptico de caracteres y técnicas sin reconocimiento óptico de caracteres» , AI and Data Science in Healthcare 5.0 , Academic Press, pp. 145–159 , doi : 10.1016/B978-0-443-36556-0.00013-3 , ISBN  978-0-443-36556-0Consultado el 23 de junio de 2026 .{{citation}}: CS1 mantenimiento: parámetro de trabajo con ISBN ( enlace )
  15. Arora, Shraddha; Pandey, Mrinal; Arora, Mamta; Gupta, Komal; Sharma, Vineet; Nagpal, Lakshay (1 de enero de 2024). "Digitalización de documentos de seguro médico para la liquidación de reclamaciones sin efectivo mediante un sistema inteligente de gestión documental" . Procedia Computer Science . Conferencia Internacional sobre Aprendizaje Automático e Ingeniería de Datos (ICMLDE 2023). 235 : 1319–1331 . doi : 10.1016/j.procs.2024.04.125 . ISSN 1877-0509 . 
  16. Zeng, Qing-An (2015). Comunicaciones inalámbricas, redes y aplicaciones: Actas de WCNA 2014. Springer. ISBN 978-81-322-2580-5.
  17. " [ javascript ] Uso de OCR y extracción de entidades para la búsqueda de empresas en LinkedIn" . 22 de julio de 2014. Archivado del original el 17 de abril de 2016.
  18. "Cómo descifrar captchas" . andrewt.net. 28 de junio de 2006. Consultado el 16 de junio de 2013 .
  19. "Rompiendo un CAPTCHA visual" . Cs.sfu.ca. 10 de diciembre de 2002. Consultado el 16 de junio de 2013 .
  20. Resig, John (23 de enero de 2009). "John Resig – OCR y redes neuronales en JavaScript" . Ejohn.org . Consultado el 16 de junio de 2013 .
  21. Ignat, Oana; Maillard, Jean; Chaudhary, Vishrav; Guzmán, Francisco (2022). "OCR mejora la traducción automática para lenguas con pocos recursos" . Hallazgos de la Asociación de Lingüística Computacional . Asociación de Lingüística Computacional: 1164–1174 . doi : 10.18653/v1/2022.findings-acl.92 .
  22. Ramiah, Sathiapriya; Liong, Tan Yu; Jayabalan, Manoj (2015). "Detección de imágenes basadas en texto con reconocimiento óptico de caracteres para traducción y voz en inglés usando Android". 2015 IEEE Student Conference on Research and Development (SCOReD) . IEEE. pp. 272–277 . Bibcode : 2015scor.conf...42R . doi : 10.1109/SCORED.2015.7449339 . ISBN  978-1-4673-9572-4.
  23. Afli, Haithem; Way, Andy (2016). Hinrichs, Erhard; Hinrichs, Marie; Trippel, Thorsten (eds.). «Integración del reconocimiento óptico de caracteres y la traducción automática de documentos históricos» . Actas del Taller sobre Recursos y Herramientas de Tecnología Lingüística para las Humanidades Digitales (LT4DH) . Osaka, Japón: Comité Organizador de COLING 2016: 109–116 .
  24. Tappert, CC; Suen, CY; Wakahara, T. (1990). "El estado del arte en el reconocimiento de escritura a mano en línea". IEEE Transactions on Pattern Analysis and Machine Intelligence . 12 (8): 787. Bibcode : 1990ITPAM..12..787T . doi : 10.1109/34.57669 . S2CID 42920826 . 
  25. 1 2 "Reconocimiento óptico de caracteres (OCR) – Cómo funciona" . Nicomsoft.com . Consultado el 16 de junio de 2013 .
  26. Sezgin, Mehmet; Sankur, Bulent (2004). "Revisión de técnicas de umbralización de imágenes y evaluación cuantitativa del rendimiento" (PDF) . Journal of Electronic Imaging . 13 (1): 146. Bibcode : 2004JEI....13..146S . doi : 10.1117/1.1631315 . Archivado del original (PDF) el 16 de octubre de 2015. Recuperado el 2 de mayo de 2015 .
  27. Gupta, Maya R.; Jacobson, Nathaniel P.; Garcia, Eric K. (2007). "Binarización OCR y preprocesamiento de imágenes para la búsqueda de documentos históricos" (PDF) . Pattern Recognition . 40 (2): 389. Bibcode : 2007PatRe..40..389G . doi : 10.1016/j.patcog.2006.04.043 . Archivado del original (PDF) el 16 de octubre de 2015. Recuperado el 2 de mayo de 2015 .
  28. Trier, Oeivind Due; Jain, Anil K. (1995). "Evaluación dirigida por objetivos de métodos de binarización" (PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 17 (12): 1191– 1201. Bibcode : 1995ITPAM..17.1191T . doi : 10.1109/34.476511 . Archivado (PDF) del original el 16 de octubre de 2015. Recuperado el 2 de mayo de 2015 .
  29. Milyaev, Sergey; Barinova, Olga; Novikova, Tatiana; Kohli, Pushmeet; Lempitsky, Victor (2013). "Binarización de imágenes para la comprensión de texto de extremo a extremo en imágenes naturales". 12.ª Conferencia Internacional sobre Análisis y Reconocimiento de Documentos (PDF) de 2013. pp. 128–132 . doi : 10.1109/ICDAR.2013.33 . ISBN  978-0-7695-4999-6. S2CID 8947361 . Archivado (PDF) del original el 13 de noviembre de 2017 . Recuperado el 2 de mayo de 2015 . 
  30. Pati, PB; Ramakrishnan, AG (29 de mayo de 1987). "Identificación multiescritura a nivel de palabra". Pattern Recognition Letters . 29 (9): 1218– 1229. Bibcode : 2008PaReL..29.1218P . doi : 10.1016/j.patrec.2008.01.027 .
  31. "OCR básico en OpenCV | Damiles" . Blog.damiles.com. 20 de noviembre de 2008. Consultado el 16 de junio de 2013 .
  32. 1 2 3 Smith, Ray (2007). "Una descripción general del motor OCR Tesseract" (PDF) . Archivado del original (PDF) el 28 de septiembre de 2010. Recuperado el 23 de mayo de 2013 .
  33. "Introducción al OCR" . Dataid.com . Consultado el 16 de junio de 2013 .
  34. "Cómo funciona el software OCR" . OCRWizard. Archivado del original el 16 de agosto de 2009. Consultado el 16 de junio de 2013 .
  35. Hazra, Tapan Kumar; Singh, Dhirendra Pratap; Daga, Nikunj (2017). "Reconocimiento óptico de caracteres mediante KNN en un conjunto de datos de imágenes personalizado". 2017 8th Annual Industrial Automation and Electromechanical Engineering Conference (IEMECON) . IEEE. pp. 110–114 . doi : 10.1109/IEMECON.2017.8079572 . ISBN  978-1-5386-2215-5.
  36. Ong, Veronica; Suhartono, Derwin (1 de marzo de 2016). "Uso del algoritmo K-vecinos más cercanos en el reconocimiento óptico de caracteres" . ComTech: Aplicaciones informáticas, matemáticas y de ingeniería . 7 (1): 53. doi : 10.21512/comtech.v7i1.2223 . ISSN 2476-907X . 
  37. tesseract-ocr/tesseract , tesseract-ocr, 27 de marzo de 2026 , consultado el 27 de marzo de 2026
  38. PaddlePaddle/PaddleOCR , PaddlePaddle, 27 de marzo de 2026 , consultado el 27 de marzo de 2026
  39. ^ Li, Minghao; Lv, Tengchao; Chen, Jingye; Cui, Lei; Lu, Yijuan; Florencio, Dinei; Zhang, Cha; Li, Zhoujun; Wei, Furu (6 de septiembre de 2022), TrOCR: reconocimiento óptico de caracteres basado en transformador con modelos previamente entrenados , arXiv : 2109.10282
  40. Assefi, Mehdi (diciembre de 2016). "OCR como servicio: una evaluación experimental de Google Docs OCR, Tesseract, ABBYY FineReader y Transym" . ResearchGate .
  41. "Cómo la mejor tecnología OCR captura el 99,91% de los datos" . www.bisok.com . Consultado el 27 de mayo de 2021 .
  42. 1 2 3 Woodford, Chris (30 de enero de 2012). "¿Cómo funciona el escaneo de documentos OCR?" . Explain that Stuff . Recuperado el 16 de junio de 2013 .
  43. "¿Cómo optimizar los resultados de la API de OCR al extraer texto de una imagen? - Comunidad de desarrolladores de Haven OnDemand" . Archivado del original el 22 de marzo de 2016.
  44. Fehr, Tiff (26 de marzo de 2019). "Cómo revisamos 900 páginas de documentos de Cohen en menos de 10 minutos" . The New York Times . ISSN 0362-4331 . Consultado el 16 de junio de 2023 . 
  45. "Entrena tu Teseracto" . Entrena tu Teseracto . 20 de septiembre de 2018. Consultado el 20 de septiembre de 2018 .
  46. Wilks, Yorik (2019). Inteligencia artificial: ¿magia moderna o futuro peligroso? Londres, Inglaterra. pág. 98. ISBN  9781785-78-516-0.{{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace )
  47. "¿Cuál es la utilidad de un editor de texto OCR interactivo en línea? - Fenno-Ugrica" . 21 de febrero de 2014.
  48. Riedl, C.; Zanibbi, R.; Hearst, MA; Zhu, S.; Menietti, M.; Crusan, J.; Metelsky, I.; Lakhani, K. (20 de febrero de 2016). "Detección de figuras y etiquetas de partes en patentes: desarrollo de algoritmos de procesamiento de imágenes basado en competencia". Revista internacional sobre análisis y reconocimiento de documentos . 19 (2): 155. arXiv : 1410.6751 . doi : 10.1007/s10032-016-0260-8 . S2CID 11873638 . 
  49. 1 2 "Google Books Ngram Viewer" . books.google.com . Consultado el 20 de julio de 2023. Cuando generamos los corpus originales de Ngram Viewer en 2009, nuestro OCR no era tan bueno […]. Esto era especialmente evidente en el inglés anterior al siglo XIX, donde la s medial alargada (ſ) a menudo se interpretaba como una f, […]. Aquí hay evidencia de las mejoras que hemos realizado desde entonces, utilizando el operador de corpus para comparar las versiones de 2009, 2012 y 2019 […]
  50. "Código y datos para evaluar la precisión del OCR, originalmente de UNLV/ISRI" . Archivo de código de Google.
  51. Holley, Rose (abril de 2009). "¿Hasta dónde puede llegar la mejora? Análisis y mejora de la precisión del OCR en programas de digitalización de periódicos históricos a gran escala" . Revista D-Lib . Consultado el 5 de enero de 2014 .
  52. Suen, CY; Plamondon, R.; Tappert, A.; Thomassen, A.; Ward, JR; Yamamoto, K. (29 de mayo de 1987). Futuros desafíos en la escritura a mano y las aplicaciones informáticas . 3er Simposio Internacional sobre Escritura a Mano y Aplicaciones Informáticas, Montreal, 29 de mayo de 1987. Recuperado el 3 de octubre de 2008 .
  53. Mohseni, Maedeh Haji Agha; Azmi, Reza; Layeghi, Kamran; Maleki, Sajad (2019). Comparación de conjuntos de datos sintéticos y naturales en soluciones de escritura a mano basadas en redes neuronales . ITCT vía Civilica.
  54. Kapidakis, Sarantos; Mazurek, Cezary; Werla, Marcin (2015). Investigación y tecnología avanzada para bibliotecas digitales (PDF) . Springer. pág. 257. doi : 10.1007/978-3-319-24592-8 . ISBN  9783319245928Archivado del original el 3 de noviembre de 2025.
  55. Atkinson, Kristine H. (2015). "Reinventando la literatura no patentable para la patentación farmacéutica". Pharmaceutical Patent Analyst . 4 (5): 371– 375. doi : 10.4155/ppa.15.21 . PMID 26389649 . 
  56. «escanear» . Abubillas . Mayo de 2001.
  •  Reconocimiento óptico de caracteres Unicode (OCR) Rango hexadecimal: 2440-245F
  • Bibliografía comentada de referencias sobre reconocimiento de caracteres manuscritos y computación con lápiz óptico