Articulo de referencia

minería de flujos de datos

La minería de flujos de datos (también conocida como aprendizaje de flujos ) es el proceso de extraer estructuras de conocimiento a partir de registros de datos continuos y rápi...

La minería de flujos de datos (también conocida como aprendizaje de flujos ) es el proceso de extraer estructuras de conocimiento a partir de registros de datos continuos y rápidos. Un flujo de datos es una secuencia ordenada de instancias que, en muchas aplicaciones de minería de flujos de datos, se pueden leer solo una vez o un número reducido de veces utilizando capacidades limitadas de computación y almacenamiento. [ 1 ]

En muchas aplicaciones de minería de flujos de datos, el objetivo es predecir la clase o el valor de nuevas instancias en el flujo de datos a partir de cierto conocimiento sobre la pertenencia a clases o los valores de instancias anteriores en el flujo de datos. [ 2 ] Las técnicas de aprendizaje automático se pueden utilizar para aprender esta tarea de predicción a partir de ejemplos etiquetados de forma automatizada. A menudo, se aplican conceptos del campo del aprendizaje incremental para hacer frente a cambios estructurales, aprendizaje en línea y demandas en tiempo real. En muchas aplicaciones, especialmente las que operan en entornos no estacionarios, la distribución subyacente de las instancias o las reglas subyacentes a su etiquetado pueden cambiar con el tiempo, es decir, el objetivo de la predicción, la clase a predecir o el valor objetivo a predecir, puede cambiar con el tiempo. [ 3 ] Este problema se conoce como deriva conceptual . Detectar la deriva conceptual es un problema central para la minería de flujos de datos. [ 4 ] [ 5 ] Otros desafíos [ 6 ] que surgen al aplicar el aprendizaje automático a datos en flujo incluyen: datos etiquetados parcial y retardado, [ 7 ] [ 8 ] recuperación de derivas conceptuales, [ 1 ] y dependencias temporales. [ 9 ]

Ejemplos de flujos de datos incluyen el tráfico de redes informáticas, conversaciones telefónicas, transacciones en cajeros automáticos, búsquedas web y datos de sensores. La minería de flujos de datos puede considerarse un subcampo de la minería de datos , el aprendizaje automático y el descubrimiento de conocimiento .

Software para minería de flujos de datos

  • MOA (Massive Online Analysis) : software libre de código abierto específico para la minería de flujos de datos con deriva conceptual, desarrollado en Java. Cuenta con varios algoritmos de aprendizaje automático ( clasificación , regresión , agrupamiento , detección de valores atípicos y sistemas de recomendación ). Además, incluye un método de evaluación presecuencial, los métodos de deriva conceptual EDDM, un lector de conjuntos de datos reales ARFF y generadores de flujos artificiales como conceptos SEA, STAGGER, hiperplano rotatorio , árbol aleatorio y funciones basadas en radio aleatorio . MOA admite la interacción bidireccional con Weka (aprendizaje automático) .
  • scikit-multiflow : Un marco de aprendizaje automático para datos de flujo y de múltiples salidas/etiquetas implementado en Python. [ 10 ] scikit-multiflow contiene generadores de flujo, métodos de aprendizaje de flujo para un solo objetivo y múltiples objetivos, detectores de deriva conceptual, métodos de evaluación y visualización. (Este software está descontinuado) [ 11 ]
  • StreamDM : StreamDM es un marco de código abierto para la minería de flujos de big data que utiliza la extensión Spark Streaming [ 12 ] de la API principal de Spark. Una ventaja de StreamDM en comparación con los marcos existentes es que se beneficia directamente de la API Spark Streaming, que gestiona gran parte de los problemas complejos de las fuentes de datos subyacentes, como los datos desordenados y la recuperación ante fallos.
  • RapidMiner : software comercial para el descubrimiento de conocimiento, minería de datos y aprendizaje automático que también incluye minería de flujos de datos, aprendizaje de conceptos que varían con el tiempo y seguimiento de conceptos que cambian de rumbo (si se usa en combinación con su complemento de minería de flujos de datos (anteriormente: complemento Concept Drift)).
  • RiverML : River es una biblioteca de Python para aprendizaje automático en línea. Es el resultado de la fusión entre creme y scikit-multiflow. La ambición de River es convertirse en la biblioteca de referencia para el aprendizaje automático en datos en tiempo real. [ 13 ]
  • GAENARI : Árbol de decisión incremental en C++. Realiza inserciones y actualizaciones continuas de conjuntos de datos divididos en fragmentos. Ofrece soporte para la reconstrucción en caso de problemas de deriva conceptual.

Eventos

  • Taller internacional sobre minería de datos ubicua, archivado el 23 de febrero de 2013 en Wayback Machine, celebrado conjuntamente con la Conferencia Internacional Conjunta sobre Inteligencia Artificial (IJCAI) en Pekín, China, del 3 al 5 de agosto de 2013.
  • Taller internacional sobre descubrimiento de conocimiento a partir de flujos de datos ubicuos, archivado el 16 de febrero de 2012 en Wayback Machine, celebrado conjuntamente con la 18.ª Conferencia Europea sobre Aprendizaje Automático (ECML) y la 11.ª Conferencia Europea sobre Principios y Práctica del Descubrimiento de Conocimiento en Bases de Datos (PKDD) en Varsovia, Polonia, en septiembre de 2007.
  • La sesión sobre flujos de datos del Simposio ACM sobre Computación Aplicada se celebró conjuntamente con el Simposio ACM de Computación Aplicada de 2007 (SAC-2007) en Seúl , Corea , en marzo de 2007.
  • El Taller Internacional de la IEEE sobre Minería de Datos Evolutivos y en Tiempo Real (IWMESD 2006) se celebrará conjuntamente con la Conferencia Internacional de la IEEE sobre Minería de Datos de 2006 (ICDM-2006) en Hong Kong en diciembre de 2006.
  • El Cuarto Taller Internacional sobre Descubrimiento de Conocimiento a partir de Flujos de Datos (IWKDDS) se celebrará conjuntamente con la 17ª Conferencia Europea sobre Aprendizaje Automático (ECML) y la 10ª Conferencia Europea sobre Principios y Práctica del Descubrimiento de Conocimiento en Bases de Datos (PKDD) (ECML/PKDD-2006) en Berlín , Alemania , en septiembre de 2006.

Véase también

Libros

  • Bifet, Albert; Gavaldà, Ricard; Holmes, Geoff; Pfahringer, Bernhard (2018). Aprendizaje automático para flujos de datos con ejemplos prácticos en MOA . Computación adaptativa y aprendizaje automático. MIT Press. pág.  288. ISBN 9780262037792.
  • Gama, João; Gaber, Mohamed Medhat, eds. (2007). Aprendizaje a partir de flujos de datos: técnicas de procesamiento en redes de sensores . Springer. p.  244. doi : 10.1007/3-540-73679-4 . ISBN 9783540736783.
  • Ganguly, Auroop R.; Gama, João; Omitaomu, Olufemi A.; Gaber, Mohamed M.; Vatsavai, Ranga R., eds. (2008). Descubrimiento de conocimiento a partir de datos de sensores . Innovación industrial. CRC Press. pág.  215. ISBN 9781420082326.
  • Gama, João (2010). Descubrimiento de conocimiento a partir de flujos de datos . Minería de datos y descubrimiento de conocimiento. Chapman and Hall. pág.  255. ISBN 9781439826119.
  • Lughofer, Edwin (2011). Sistemas difusos en evolución: metodologías, conceptos avanzados y aplicaciones . Estudios en lógica difusa y computación blanda. Vol.  266. Heidelberg: Springer. p.  456. doi : 10.1007/978-3-642-18087-3 . ISBN 9783642180866.
  • Sayed-Mouchaweh, Moamar; Lughofer, Edwin, eds. (2012). Aprendizaje en entornos no estacionarios: métodos y aplicaciones . Nueva York: Springer. pág.  440. CiteSeerX 10.1.1.709.437 . doi : 10.1007/978-1-4419-8020-5 . ISBN  9781441980199.

Referencias

  1. 1 2 Gomes, Heitor M.; Bifet, Albert; Read, Jesse; Barddal, Jean Paul; Enembreck, Fabrício; Pfharinger, Bernhard; Holmes, Geoff; Abdessalem, Talel (2017-10-01). "Bosques aleatorios adaptativos para la clasificación de flujos de datos evolutivos" . Machine Learning . 106 (9): 1469– 1495. doi : 10.1007/s10994-017-5642-8 . hdl : 10289/11231 . ISSN 1573-0565 . 
  2. Medhat, Mohamed; Zaslavsky; Krishnaswamy (1 de junio de 2005). "Minería de flujos de datos". ACM SIGMOD Record . 34 (2): 18– 26. doi : 10.1145/1083784.1083789 . S2CID 705946 . 
  3. Lemaire, Vincent; Salperwyck, Christophe; Bondu, Alexis (2015), "A Survey on Supervised Classification on Data Streams", en Zimányi, Esteban; Kutsche, Ralf-Detlef (eds.), Business Intelligence: 4th European Summer School, eBISS 2014, Berlín, Alemania, 6–11 de julio de 2014, Tutorial Lectures , Lecture Notes in Business Information Processing, Springer International Publishing, pp. 88–125 , doi : 10.1007/978-3-319-17551-5_4 , ISBN  978-3-319-17551-5
  4. Webb, Geoffrey I.; Lee, Loong Kuan; Petitjean, François; Goethals, Bart (2017-04-02). "Understanding Concept Drift". arXiv : 1704.00362 [ cs.LG ].
  5. Gama, João; Žliobaitė; Bifet; Pechenizkiy; Bouchachia (2014-03-01). "Una revisión sobre la adaptación a la deriva conceptual" (PDF) . ACM Computing Surveys . 46 (4): 1– 37. doi : 10.1145/2523813 . S2CID 207208264 . 
  6. Gomes, Heitor Murilo; Read; Bifet; Barddal; Gama (26 de noviembre de 2019). "Aprendizaje automático para datos en tiempo real". Boletín informativo de ACM SIGKDD Explorations . 21 (2): 6– 22. doi : 10.1145/3373464.3373470 . S2CID 208607941 . 
  7. Gomes, Heitor Murilo; Grzenda, Maciej; Mello, Rodrigo; Read, Jesse; Le Nguyen, Minh Huong; Bifet, Albert (2022-02-28). "Una revisión sobre el aprendizaje semisupervisado para flujos de datos parcialmente etiquetados con retraso" . ACM Computing Surveys . 55 (4): 1– 42. arXiv : 2106.09170 . doi : 10.1145/3523055 . ISSN 0360-0300 . 
  8. Grzenda, Maciej; Gomes, Heitor Murilo; Bifet, Albert (2019-11-16). "Evaluación de etiquetado diferido para flujos de datos" . Minería de datos y descubrimiento de conocimiento . 34 (5): 1237– 1266. doi : 10.1007/s10618-019-00654-y . ISSN 1573-756X . 
  9. Žliobaitė, Indrė; Bifet, Albert; Read, Jesse; Pfahringer, Bernhard; Holmes, Geoff (2015-03-01). "Métodos de evaluación y teoría de la decisión para la clasificación de datos en tiempo real con dependencia temporal" . Machine Learning . 98 (3): 455– 482. doi : 10.1007/s10994-014-5441-4 . hdl : 10289/8954 . ISSN 1573-0565 . 
  10. Montiel, Jacob; Read, Jesse; Bifet, Albert; Abdessalem, Talel (2018). "Scikit-Multiflow: Un marco de transmisión de salida múltiple" . Journal of Machine Learning Research . 19 (72): 1– 5. arXiv : 1807.04662 . Bibcode : 2018arXiv180704662M . ISSN 1533-7928 . 
  11. Características , scikit-multiflow, 09/10/2021 , consultado el 11/10/2021
  12. Zaharia, Matei; Das, Tathagata; Li, Haoyuan; Hunter, Timothy; Shenker, Scott; Stoica, Ion (2013). «Discretized streams». Actas del Vigésimo Cuarto Simposio ACM sobre Principios de Sistemas Operativos . Nueva York, Nueva York, EE. UU.: ACM Press. págs. 423–438 . doi : 10.1145/2517349.2522737 . ISBN  978-1-4503-2388-8.
  13. online-ml/river , OnlineML, 11/10/2021 , consultado el 11/10/2021