Articulo de referencia

Procesamiento de documentos

El procesamiento de documentos es un campo de investigación y un conjunto de procesos de producción destinados a digitalizar documentos analógicos . Este procesamiento no se lim...

El procesamiento de documentos es un campo de investigación y un conjunto de procesos de producción destinados a digitalizar documentos analógicos . Este procesamiento no se limita a fotografiar o escanear un documento para obtener una imagen digital , sino que también busca hacerlo digitalmente inteligible. Esto incluye la extracción de la estructura o el diseño del documento y, posteriormente, del contenido, que puede presentarse en forma de texto o imágenes. El proceso puede implicar algoritmos tradicionales de visión artificial , redes neuronales convolucionales o trabajo manual. Los problemas abordados están relacionados con la segmentación semántica , la detección de objetos , el reconocimiento óptico de caracteres (OCR) , el reconocimiento de texto manuscrito (HTR) y, en términos más generales, la transcripción , ya sea automática o no. [ 1 ] El término también puede incluir la fase de digitalización del documento mediante un escáner y la fase de interpretación del mismo, por ejemplo, mediante el procesamiento del lenguaje natural (PLN) o tecnologías de clasificación de imágenes . Se aplica en numerosos campos industriales y científicos para la optimización de procesos administrativos, el procesamiento de correo y la digitalización de archivos analógicos y documentos históricos.

Fondo

El procesamiento de documentos fue inicialmente, y en cierta medida aún lo es, una especie de trabajo en cadena de producción que se ocupa del tratamiento de documentos , como cartas y paquetes, con el objetivo de clasificar, extraer o extraer masivamente datos. Este trabajo podía realizarse internamente o mediante la subcontratación de procesos de negocio . [ 2 ] [ 3 ] El procesamiento de documentos puede, de hecho, implicar algún tipo de trabajo manual externalizado, como Mechanical Turk .

Como ejemplo de procesamiento manual de documentos, tan recientemente como en 2007, [ 4 ] el procesamiento de documentos para "millones de solicitudes de visa y ciudadanía" implicaba el uso de "aproximadamente 1.000 trabajadores contratados" que se encargaban de "gestionar la sala de correo y la entrada de datos ".

Si bien el procesamiento de documentos implicaba la entrada de datos mediante teclado mucho antes del uso del ratón o el escáner , un artículo de 1990 en The New York Times sobre lo que denominó la " oficina sin papel " afirmaba que "el procesamiento de documentos comienza con el escáner". [ 5 ] En este contexto, un ex vicepresidente de Xerox , Paul Strassmann , expresó una opinión crítica, diciendo que las computadoras aumentan en lugar de reducir el volumen de papel en una oficina. [ 5 ] Se decía que los documentos de ingeniería y mantenimiento de un avión pesaban "más que el propio avión".

Procesamiento automático de documentos

A medida que avanzaba el estado de la técnica , el procesamiento de documentos pasó a manejar "componentes de documentos... como entidades de base de datos". [ 6 ]

Una tecnología denominada procesamiento automático de documentos o, a veces, procesamiento inteligente de documentos (IDP) surgió como una forma específica de automatización inteligente de procesos (IPA), que combina inteligencia artificial como aprendizaje automático (ML), procesamiento del lenguaje natural (NLP) o reconocimiento inteligente de caracteres (ICE) para extraer datos de varios tipos de documentos. [ 7 ] [ 8 ] Los avances en el procesamiento automático de documentos, también llamado procesamiento inteligente de documentos, mejoran la capacidad de procesar datos no estructurados con menos excepciones y mayor velocidad. [ 9 ]

Aplicaciones

El procesamiento automático de documentos se aplica a una amplia gama de documentos, estructurados o no. Por ejemplo, en el mundo empresarial y financiero, se pueden utilizar tecnologías para procesar facturas, formularios, órdenes de compra, contratos y letras de cambio en papel. [ 10 ] Las instituciones financieras utilizan el procesamiento inteligente de documentos para procesar grandes volúmenes de formularios, como formularios reglamentarios o documentos de préstamos. La identificación de documentos utiliza IA para extraer y clasificar datos de los documentos, reemplazando la entrada manual de datos. [ 11 ]

En medicina, se han desarrollado métodos de procesamiento de documentos para facilitar el seguimiento de los pacientes y agilizar los procedimientos administrativos, en particular mediante la digitalización de informes de análisis médicos o de laboratorio. El objetivo es también estandarizar las bases de datos médicas. [ 12 ] Los algoritmos también se utilizan directamente para ayudar a los médicos en el diagnóstico, por ejemplo, mediante el análisis de imágenes de resonancia magnética [ 13 ] [ 14 ] o imágenes microscópicas . [ 15 ]

El procesamiento de documentos también se utiliza ampliamente en las humanidades y las humanidades digitales para extraer grandes cantidades de datos históricos de archivos o colecciones patrimoniales. Se han desarrollado enfoques específicos para diversas fuentes, incluidos documentos textuales, como archivos de periódicos, [ 16 ] pero también imágenes, [ 17 ] o mapas. [ 18 ] [ 19 ]

Tecnologías

Si bien desde la década de 1980 los algoritmos tradicionales de visión artificial se utilizaron ampliamente para resolver problemas de procesamiento de documentos, [ 20 ] [ 21 ] estos fueron reemplazados gradualmente por tecnologías de redes neuronales en la década de 2010. [ 22 ] Sin embargo, las tecnologías tradicionales de visión artificial todavía se utilizan, a veces en combinación con redes neuronales, en algunos sectores.

Numerosas tecnologías facilitan el desarrollo del procesamiento de documentos, en particular el reconocimiento óptico de caracteres (OCR) y el reconocimiento de texto manuscrito (HTR), que permiten la transcripción automática del texto. Los segmentos de texto se identifican mediante algoritmos de detección de instancias u objetos , que en ocasiones también se utilizan para detectar la estructura del documento. Para resolver este último problema, a veces se emplean algoritmos de segmentación semántica .

Estas tecnologías suelen constituir el núcleo del procesamiento de documentos. Sin embargo, otros algoritmos pueden intervenir antes o después de estos procesos. De hecho, también intervienen tecnologías de digitalización de documentos , ya sea mediante escaneo clásico o tridimensional. [ 23 ] La digitalización de documentos 3D puede recurrir, en particular, a derivados de la fotogrametría . En ocasiones, también es necesario desarrollar escáneres 2D específicos para adaptarlos al tamaño de los documentos o por razones de ergonomía del escaneo. [ 17 ] El procesamiento de documentos también depende de la codificación digital de los documentos en un formato de archivo adecuado . Además, el procesamiento de bases de datos heterogéneas puede basarse en tecnologías de clasificación de imágenes .

En el otro extremo de la cadena se encuentran diversos algoritmos de reconstrucción de imágenes, extrapolación o limpieza de datos. Para documentos de texto, la interpretación puede utilizar tecnologías de procesamiento del lenguaje natural (PLN).

Véase también

Referencias

  1. ^ Len Asprey; Michael Middleton (2003). Gestión integral de documentos y contenido: Estrategias para explotar el conocimiento empresarial . Idea Group Inc (IGI). ISBN 9781591400554.
  2. ^ Vinod V. Sople (25 de mayo de 2009). Subcontratación de procesos de negocio: una cadena de suministro de conocimientos especializados . PHI Learning Pvt. Ltd. ISBN 978-8120338159.
  3. ^ Mark Kobayashi-Hillary (5 de diciembre de 2005). Subcontratación en India: La ventaja de la externalización . Springer Science & Business Media. ISBN 9783540247944.
  4. ^ Julia Preston (2 de diciembre de 2007). "Contratista de inmigración recorta salarios" . The New York Times .
  5. ^ a b Lawrence M. Fisher (7 de julio de 1990). "El papel, una vez descartado, conserva un lugar en la oficina" . The New York Times .
  6. ^ Al Young; Dayle Woolstein; Jay Johnson (febrero de 1996). "Título desconocido". Object Magazine . pág. 51.
  7. ^ "Procesamiento inteligente de documentos" (PDF) . Departamento de Ciencias de la Computación – Universidad de Bari . 7 de abril de 2005. Consultado el 8 de septiembre de 2018 .
  8. ^ Floriana Esposito , Stefano Ferilli, Teresa MA Basile, Nicola Di Mauro (2005-04-01). "Procesamiento inteligente de documentos" en Actas. Octava Conferencia Internacional sobre Análisis y Reconocimiento de Documentos, Seúl, Corea del Sur, 2005 pp. 1100-1104. doi: 10.1109/ICDAR.2005.144 . doi : 10.1109/ICDAR.2005.144 . S2CID 17302169 . {{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace )
  9. ^ "Procesamiento inteligente de documentos (IDP)" . keymarkinc.com . Consultado el 12 de julio de 2024 .
  10. ^ Patente estadounidense activa US7873576B2 , John E. Jones; William J. Jones y Frank M. Csultis, "Sistema de procesamiento de documentos financieros", publicado el 18 de enero de 2011, emitido el 18 de enero de 2011. 
  11. ^ Bridgwater, Adrian. "Appian agrega la inteligencia de Google Cloud a la mezcla de automatización de bajo código" . Forbes . Recuperado el 21 de abril de 2021 .
  12. ^ Adamo, Francisco; Attivissimo, Filippo; Di Nisio, Attilio; Spadavecchia, Maurizio (febrero de 2015). "Un sistema automático de procesamiento de documentos para la extracción de datos médicos" . Medición . 61 : 88– 99. Bibcode : 2015Medidas...61...88A . doi : 10.1016/j.medición.2014.10.032 . Consultado el 31 de enero de 2021 .
  13. ^ Changwan, Kim; Seong-Il, Lee; Won Joon, Cho (septiembre de 2020). "Evaluación volumétrica de la extrusión en desgarros de la raíz posterior del menisco medial mediante segmentación semiautomática en imágenes de resonancia magnética de 3 teslas" . Orthopaedics & Traumatology: Surgery & Research . 101 (5): 963– 968. doi : 10.1016/j.rcot.2020.06.003 . S2CID 225215597. Recuperado el 31 de enero de 2021 . 
  14. ^ Despotović, Ivana; Bart, Goossens; Wilfried, Philips (1 de marzo de 2015). "Segmentación por resonancia magnética del cerebro humano: desafíos, métodos y aplicaciones" . Técnicas de inteligencia computacional en medicina . 2015 : 963–968 . doi : 10.1155/2015/450341 . PMC 4402572. PMID 25945121 .  
  15. ^Putzua, Lorenzo; Caocci, Giovanni; Di Rubertoa, Cecilia (November 2014). "Leucocyte classification for leukaemia detection using image processing techniques". Artificial Intelligence in Medicine. 63 (3): 179–191. doi:10.1016/j.artmed.2014.09.002. hdl:11584/94592. PMID 25241903.
  16. ^Ehrmann, Maud; Romanello, Matteo; Clematide, Simon; Ströbel, Phillip; Barman, Raphaël (2020). "Language Resources for Historical Newspapers: the Impresso Collection". Proceedings of the 12th Language Resources and Evaluation Conference. Marseille, France. pp. 958–968.
  17. ^ abSeguin, Benoit; Costiner, Lisandra; di Lenardo, Isabella; Kaplan, Frédéric (April 1, 2018). "New Techniques for the Digitization of Art Historical Photographic Archives - the Case of the Cini Foundation in Venice". Archiving 2018 Final Program and Proceedings. Society for Imaging Science and Technology. pp. 1–5. doi:10.2352/issn.2168-3204.2018.1.0.2.
  18. ^Ares Oliveira, Sofia; di Lenardo, Isabella; Tourenc, Bastien; Kaplan, Frédéric (11 July 2019). A deep learning approach to Cadastral Computing. Digital Humanities Conference. Utrecht, Netherlands.
  19. ^Petitpierre, Rémi (July 2020). Neural networks for semantic segmentation of historical city maps: Cross-cultural performance and the impact of figurative diversity (MSc). arXiv:2101.12478. doi:10.13140/RG.2.2.10973.64484.
  20. ^Fujisawa, H.; Nakano, Y.; Kurino, K. (July 1992). "Segmentation methods for character recognition: from segmentation to document structure analysis". Proceedings of the IEEE. 80 (7): 1079–1092. doi:10.1109/5.156471.
  21. ^Tang, Yuan Y.; Lee, Seong-Whan; Suen, Ching Y. (1996). "Automatic document processing: a survey". Pattern Recognition. 29 (12): 1931–1952. Bibcode:1996PatRe..29.1931T. doi:10.1016/S0031-3203(96)00044-1. Retrieved 3 February 2021.
  22. ^ Ares Oliveira, Sofia; Seguin, Benoit; Kaplan, Frederic (5–8 de agosto de 2018). dhSegment: Un enfoque genérico de aprendizaje profundo para la segmentación de documentos . 2018 16.ª Conferencia Internacional sobre Fronteras en el Reconocimiento de Escritura a Mano (ICFHR). Niagara Falls, NY, EE. UU.: IEEE. arXiv : 1804.10371 . doi : 10.1109/ICFHR-2018.2018.00011 .
  23. ^ "Tecnología de escaneo revolucionaria para el arte" . Artmyn . Consultado el 3 de febrero de 2021 .
Obtenido de " https://en.wikipedia.org/w/index.php?title=Document_processing&oldid=1315804365 "