Articulo de referencia

Apache OODT

{{cite web|url=https://lists.apache.org/thread/yp88pd09d68ptp0byhcr2hfsvqftzocc|title=[ANNOUNCE] Apache OODT 1.9.1 released|access-date=27 September 2022}} "},"latest preview ve...

Apache Object Oriented Data Technology (OODT) es un marco de sistema de gestión de datos de código abierto administrado por la Apache Software Foundation . OODT se desarrolló originalmente en el Laboratorio de Propulsión a Chorro de la NASA para apoyar la captura, el procesamiento y el intercambio de datos para los archivos científicos de la NASA. El proyecto se retiró en abril de 2023 [ 2 ].

Historia

El proyecto comenzó como un proyecto interno del Laboratorio de Propulsión a Chorro de la NASA, iniciado por Daniel J. Crichton, Sean Kelly y Steve Hughes. El enfoque inicial del esfuerzo fue la integración y búsqueda de información mediante XML, como se describe en el artículo de Crichton et al. presentado en la reunión de CODATA en 2000. [ 3 ]

Tras la implementación de OODT en el Sistema de Datos Planetarios y en el proyecto EDRN (Red de Investigación para la Detección Temprana ) del Instituto Nacional del Cáncer , en 2005 OODT se adentró en la era del procesamiento y la gestión de datos a gran escala mediante el proyecto Orbiting Carbon Observatory (OCO) de la NASA . El papel de OODT en OCO consistió en introducir un nuevo marco de procesamiento de datos que, en lugar de decenas de trabajos diarios y decenas de gigabytes de datos, gestionaría 10 000 trabajos diarios y cientos de terabytes de datos. Esto requirió una revisión completa de OODT para dar soporte a estos nuevos requisitos. El Dr. Chris Mattmann, del JPL de la NASA, dirigió un equipo de 3 a 4 desarrolladores entre 2005 y 2009 y rediseñó por completo OODT para satisfacer estas nuevas necesidades.

Influenciado por los avances en Apache Nutch y Hadoop , en los que Mattmann participó, OODT fue renovado para adaptarse mejor a proyectos como los de la Apache Software Foundation. Además, Mattmann mantenía una estrecha relación con el Dr. Justin Erenkrantz , entonces presidente de la Apache Software Foundation, y así surgió la idea de integrar OODT a la fundación. En 2009, Mattmann y su equipo recibieron la aprobación de la NASA y del JPL para integrar OODT a Apache, convirtiéndose así en el primer proyecto de la NASA gestionado por la fundación. Siete años después, el proyecto lanzó la versión 1.0.

Características

OODT se centra en dos casos de uso canónicos: el procesamiento de Big Data y la integración de información . Ambos fueron descritos en los artículos de Mattmann para ICSE 2006 [ 4 ] y SMC-IT 2009 [ 5 ] . Proporciona tres servicios principales.

Gestor de archivos

Un administrador de archivos es responsable de rastrear la ubicación de los archivos, sus metadatos y de transferir archivos desde un área de almacenamiento temporal a un almacenamiento de acceso controlado.

Gestor de flujos de trabajo

Un gestor de flujos de trabajo captura el flujo de control y el flujo de datos para procesos complejos, y permite la reproducibilidad y la construcción de flujos de trabajo científicos.

Gestor de recursos

Un administrador de recursos se encarga de la asignación de tareas de flujo de trabajo y otros trabajos a los recursos subyacentes; por ejemplo, los trabajos de Python se envían a los nodos que tienen Python instalado, y los trabajos que requieren un disco o una CPU de gran capacidad se envían correctamente a los nodos que cumplen con esos requisitos.

Además de los tres servicios principales, OODT proporciona tres marcos de trabajo orientados al cliente que se basan en estos servicios.

Rastreador de archivos

Un rastreador de archivos extrae automáticamente los metadatos y utiliza Apache Tika para identificar los tipos de archivo e incorporar la información asociada al administrador de archivos.

Marco de rastreo de catálogos y archivos

Un sistema de procesamiento Push/Pull adquiere archivos remotos y los pone a disposición del sistema.

Ejecutivo de Generación de Producción del Servicio de Catálogo y Archivo (CAS-PGE)

Un envoltorio para algoritmos científicos (denominado CAS-PGE, por Catalog and Archive Service Production Generation Executive) encapsula códigos científicos y permite su ejecución independientemente del entorno, capturando al mismo tiempo la procedencia y facilitando la integración de los algoritmos en un sistema de producción.

Servicios RESTful de CAS

Un conjunto de API RESTful que expone las capacidades de los componentes Administrador de archivos, Administrador de flujo de trabajo y Administrador de recursos.

Panel de control del monitor OPSUI

Aplicación web para exponer servicios del producto/flujo de trabajo/sistemas de control de gestión de recursos OODT subyacentes mediante la especificación JAX-RS . En esta etapa, se está desarrollando utilizando componentes de Apache Wicket .

La motivación general para la reestructuración de OODT fue descrita en un artículo publicado en Nature (revista) en 2013 por Mattmann titulado A Vision for Data Science. [ 6 ]

OODT está escrito en Java y, a través de su API REST [ 7 ], se utiliza en otros lenguajes, incluido Python (lenguaje de programación) .

Usos notables

Recientemente, OODT ha sido destacado por su contribución a misiones de la NASA, incluyendo Soil Moisture Active Passive [ 8 ] y New Horizons [ 9 ] . OODT también contribuye a la alimentación del telescopio Square Kilometre Array [ 10 ], ampliando su ámbito de uso a las ciencias de la Tierra, las ciencias planetarias, la radioastronomía y otros sectores. OODT también se utiliza en bioinformática y forma parte de la plataforma Knowledgent Big Data [ 11 ] .

Referencias

  1. " [ ANUNCIO ] Apache OODT 1.9.1 lanzado" . Consultado el 27 de septiembre de 2022 .
  2. "OODT" . El ático apache . Consultado el 26 de junio de 2026 .
  3. Crichton, Daniel; Hughes, John; Hyon, Jason; Kelly, Sean (2000). "Búsqueda y recuperación científica mediante XML". Segunda Conferencia Nacional sobre Datos Científicos y Técnicos, Comité Nacional de EE. UU. para CODATA, Consejo Nacional de Investigación .
  4. Mattmann, Chris A.; Crichton, Daniel J.; Medvidovic, Nenad; Hughes, Steve (1 de enero de 2006). «Un marco basado en arquitectura de software para aplicaciones científicas altamente distribuidas y con gran cantidad de datos». Actas de la 28.ª conferencia internacional sobre ingeniería de software . ICSE '06. Nueva York, NY, EE. UU.: ACM. págs. 721–730 . doi : 10.1145/1134285.1134400 . ISBN  978-1595933751. S2CID 7699385 . 
  5. Mattmann, CA; Freeborn, D.; Crichton, D.; Foster, B.; Hart, A.; Woollard, D.; Hardman, S.; Ramirez, P.; Kelly, S. (1 de julio de 2009). "Un marco de sistema de control de procesos reutilizable para las misiones Orbiting Carbon Observatory y NPP Sounder PEATE". Tercera Conferencia Internacional IEEE de 2009 sobre Desafíos de las Misiones Espaciales para la Tecnología de la Información . págs. 165–172 . doi : 10.1109/SMC-IT.2009.27 . ISBN  978-0-7695-3637-8. S2CID 705732 . 
  6. Mattmann, Chris A. (24 de enero de 2013). "Computación: una visión para la ciencia de datos" . Nature . 493 (7433): 473– 475. Bibcode : 2013Natur.493..473M . doi : 10.1038/493473a . ISSN 0028-0836 . PMID 23344342 .  
  7. "API de Apache OODT - OODT - Apache Software Foundation" . cwiki.apache.org . Consultado el 27 de junio de 2016 .
  8. "Apache - La ASF en Twitter" . Consultado el 27 de junio de 2016 .
  9. "Apache - La ASF en Twitter" . Consultado el 27 de junio de 2016 .
  10. "Apache - La ASF en Twitter" . Consultado el 27 de junio de 2016 .
  11. "Preguntas y respuestas sobre las ventajas de OODT - Tecnología de datos orientada a objetos - Perspectivas de Knowledgent" . 30 de julio de 2014. Archivado del original el 14 de abril de 2015. Consultado el 27 de junio de 2016 .
  • http://oodt.apache.org