La minería de datos , el proceso de descubrir patrones en grandes conjuntos de datos , se ha utilizado en numerosas aplicaciones.
Agricultura
El monitoreo con drones y las imágenes satelitales son algunos de los métodos utilizados para recopilar datos sobre la salud del suelo , los patrones climáticos , el crecimiento de los cultivos, la actividad de las plagas y otros factores. Los conjuntos de datos se analizan para mejorar la eficiencia agrícola , identificar patrones y tendencias, y minimizar las pérdidas potenciales. [ 1 ]
- Las técnicas de minería de datos se pueden aplicar a datos visuales en la agricultura para extraer patrones, tendencias y asociaciones significativas. Esta información puede mejorar los algoritmos que detectan defectos en frutas y verduras cosechadas . Por ejemplo, se han aplicado métodos avanzados de recopilación de datos visuales , sistemas de visión artificial y procesamiento de imágenes para clasificar frutas y verduras según numerosos defectos superficiales. [ 2 ] Además, estos datos se pueden analizar para investigar las posibles causas de los defectos. Gran parte de este conocimiento se basa en evidencia anecdótica en lugar de métodos de recopilación de datos cualitativos y cuantitativos. Sin embargo, se están realizando esfuerzos para integrar las técnicas de minería de datos en la investigación hortícola . [ 3 ] Antes de ser enviadas al mercado, las manzanas se inspeccionan y se retiran las que tienen defectos. Sin embargo, los defectos invisibles pueden afectar el sabor y la apariencia de una manzana. Un ejemplo de ello es el corazón acuoso, un trastorno interno que puede afectar la vida útil de la fruta. Las manzanas con un ligero corazón acuoso son más dulces, pero aquellas con un corazón acuoso moderado a severo tienen un potencial de almacenamiento reducido en comparación con las manzanas normales. Además, unas pocas frutas con corazones acuosos severos podrían arruinar todo un lote. Por este motivo, se está estudiando un sistema computacional que captura imágenes de rayos X de las manzanas mientras se desplazan por cintas transportadoras . El sistema analiza las imágenes mediante algoritmos de aprendizaje automático para predecir la probabilidad de que la fruta contenga agua en el centro.
- Las transformaciones metabólicas durante la fermentación impactan la calidad del vino producido y la productividad de las industrias vitivinícolas. Se han utilizado técnicas de ciencia de datos , como el agrupamiento k-means y las técnicas de clasificación basadas en biclustering , para estudiar estos procesos metabólicos, prediciendo con éxito los resultados de la fermentación en tan solo tres días. Estos métodos permiten clasificar el vino según el perfil de metabolitos de la fermentación, diferenciándolo de los sistemas de clasificación de vinos tradicionales. [ 4 ]
- Se utilizó una red tipo GMDH (Group Method of Data Handling), combinada con un algoritmo genético , para predecir la energía metabolizable de la harina de plumas y la harina de vísceras de aves de corral en función de su contenido de proteínas, grasas y cenizas. Se recopilaron muestras de datos de la literatura publicada y se utilizaron para entrenar un modelo de red tipo GMDH. Este enfoque permite predecir la energía metabolizable de muestras de alimento para aves de corral en función de su composición química. [ 5 ] La red tipo GMDH también puede estimar con precisión el rendimiento de las aves de corral a partir de nutrientes dietéticos como la energía metabolizable, las proteínas y los aminoácidos . [ 6 ]
- La detección temprana de enfermedades animales puede mejorar la productividad de las granjas, ya que permite a los ganaderos tratar y aislar a los animales afectados en cuanto aparecen los síntomas, reduciendo así la propagación de la enfermedad. Por ejemplo, los sonidos que emiten los cerdos , como la tos, pueden analizarse para detectar enfermedades. Se está desarrollando un sistema computacional para monitorizar y diferenciar los sonidos de los cerdos mediante micrófonos instalados en la granja.
- Se utilizó la PCR - SSCP ( polimorfismo de conformación de cadena simple ) para determinar el polimorfismo de la hormona del crecimiento (GH), la leptina , la calpaína y la calpastatina en ovejas macho Balochi iraníes . Se desarrolló un modelo de red neuronal artificial (RNA) para predecir la ganancia diaria promedio (GDP) en corderos utilizando como parámetros de entrada el polimorfismo de GH, leptina, calpaína y calpastatina, el peso al nacer y el tipo de parto. Los resultados revelaron que el modelo de RNA es una herramienta apropiada para identificar patrones de datos y predecir el crecimiento de los corderos en términos de GDP, dado el polimorfismo genético específico, el peso al nacer y el tipo de parto. El enfoque PCR-SSCP y los análisis del modelo basado en RNA pueden utilizarse en programas de mejoramiento genético asistido por marcadores moleculares para mejorar la eficacia de la producción ovina. [ 7 ]
- Estudios recientes realizados por investigadores agrícolas en Pakistán demostraron que las políticas estatales que favorecen el uso de plaguicidas han contribuido a su elevado uso en los cultivos de algodón, y reportaron una correlación negativa entre el uso de plaguicidas y el rendimiento de la cosecha. El uso excesivo de plaguicidas está generando un impacto financiero, ambiental y social en los agricultores. El análisis de datos en la industria algodonera, mediante el uso de datos sobre plagas y registros meteorológicos, muestra cómo se puede optimizar el uso de plaguicidas.
- Se utilizó una plataforma de modelos basados en redes neuronales artificiales (RNA) combinada con análisis de sensibilidad y algoritmos de optimización para integrar datos publicados sobre las respuestas de pollos de engorde a la treonina . Los análisis de los modelos RNA para la ganancia de peso y la eficiencia alimenticia sugirieron que la concentración de proteína en la dieta era más importante que la concentración de treonina. Los resultados revelaron que una dieta con un 18,69 % de proteína y un 0,73 % de treonina puede conducir a una ganancia de peso óptima, mientras que la eficiencia alimenticia óptima se puede lograr con una dieta con un 18,71 % de proteína y un 0,75 % de treonina. [ 8 ]
Negocio
En el ámbito empresarial, la minería de datos consiste en el análisis de las actividades comerciales históricas, almacenadas como datos estáticos en bases de datos de almacenes de datos . El objetivo es revelar patrones y tendencias ocultos. El software de minería de datos utiliza algoritmos avanzados de reconocimiento de patrones para examinar grandes cantidades de datos y ayudar a descubrir información estratégica empresarial previamente desconocida. Algunos ejemplos de cómo las empresas utilizan la minería de datos incluyen realizar análisis de mercado para identificar nuevos paquetes de productos, encontrar la causa raíz de los problemas de fabricación, prevenir la pérdida de clientes y adquirir nuevos clientes, realizar ventas cruzadas a clientes existentes y perfilar a los clientes con mayor precisión. [ 9 ]
- En el mundo actual, las empresas recopilan datos brutos a un ritmo vertiginoso. Por ejemplo, Walmart procesa más de 20 millones de transacciones en puntos de venta cada día. Esta información se almacena en una base de datos centralizada, pero sería inútil sin algún tipo de software de minería de datos para analizarla. Si Walmart analizara sus datos de puntos de venta con técnicas de minería de datos, podría determinar las tendencias de ventas, desarrollar campañas de marketing y predecir con mayor precisión la fidelización de los clientes. [ 10 ] [ 11 ]
- La categorización de los artículos disponibles en un sitio de comercio electrónico es un problema fundamental. Un sistema de categorización correcto es esencial para la experiencia del usuario, ya que ayuda a determinar los artículos relevantes para su búsqueda y navegación. La categorización de artículos puede formularse como un problema de clasificación supervisada en minería de datos, donde las categorías son las clases objetivo y las características son las palabras que componen la descripción textual de los artículos. Un enfoque consiste en encontrar inicialmente grupos similares y agruparlos en un grupo latente. Luego, dado un nuevo artículo, se clasifica primero en un grupo latente, lo que se denomina clasificación de nivel grueso. Posteriormente, se realiza una segunda ronda de clasificación para determinar la categoría a la que pertenece el artículo. [ 12 ]
- Cada vez que se utiliza una tarjeta de crédito o una tarjeta de fidelización de una tienda, o se rellena una tarjeta de garantía, se recopilan datos sobre el comportamiento del usuario. A muchas personas les resulta inquietante la cantidad de información que empresas como Google , Facebook y Amazon almacenan sobre nosotros , y les preocupa su privacidad. Si bien existe la posibilidad de que nuestros datos personales se utilicen de forma perjudicial o no deseada, también se utilizan para mejorar nuestras vidas. Por ejemplo, Ford y Audi esperan algún día recopilar información sobre los hábitos de conducción de sus clientes para poder recomendar rutas más seguras y advertir a los conductores sobre condiciones peligrosas en la carretera. [ 13 ]
- La minería de datos en las aplicaciones de gestión de relaciones con el cliente puede contribuir significativamente a los resultados. En lugar de contactar aleatoriamente a un cliente potencial o actual a través de un centro de llamadas o mediante correo postal, una empresa puede concentrar sus esfuerzos en aquellos con mayor probabilidad de responder a una oferta. Se pueden utilizar métodos más sofisticados para optimizar los recursos en las campañas, de modo que se pueda predecir a qué canal y a qué oferta es más probable que responda una persona (entre todas las ofertas potenciales). Además, se pueden utilizar aplicaciones sofisticadas para automatizar el envío de correos. Una vez determinados los resultados de la minería de datos (cliente potencial y canal/oferta), esta aplicación puede enviar automáticamente un correo electrónico o correo postal. Finalmente, en los casos en que muchas personas realizan una acción sin recibir una oferta, se puede utilizar el modelado de impacto para determinar qué personas experimentan el mayor aumento en la respuesta si se les ofrece una oferta. De esta manera, el modelado de impacto permite a los profesionales del marketing centrar los envíos y las ofertas en personas susceptibles de ser persuadidas, y no enviar ofertas a quienes comprarán el producto sin recibir ninguna oferta. La agrupación de datos también puede utilizarse para descubrir automáticamente los segmentos o grupos dentro de un conjunto de datos de clientes.
- Las empresas que emplean minería de datos pueden obtener un retorno de la inversión, pero también reconocen que la cantidad de modelos predictivos puede aumentar rápidamente. Por ejemplo, en lugar de usar un solo modelo para predecir cuántos clientes se darán de baja , una empresa puede optar por crear un modelo independiente para cada región y tipo de cliente. En situaciones donde se requiere mantener una gran cantidad de modelos, algunas empresas recurren a metodologías de minería de datos más automatizadas.
- La minería de datos puede ser útil para los departamentos de recursos humanos (RR. HH.) a la hora de identificar las características de sus empleados más exitosos. La información obtenida, como las universidades a las que asistieron los empleados de alto rendimiento, puede ayudar a RR. HH. a enfocar sus esfuerzos de reclutamiento de manera más eficaz. Además, las aplicaciones de gestión estratégica empresarial ayudan a una empresa a traducir los objetivos corporativos, como las metas de beneficios y margen de beneficio, en decisiones operativas, como los planes de producción y los niveles de plantilla. [ 14 ]
- La minería de datos puede ser útil para las organizaciones. La minería de datos organizacionales (ODM) se define como el aprovechamiento de herramientas y tecnologías de minería de datos (DM) para mejorar el proceso de toma de decisiones organizacionales, transformando los datos en conocimiento valioso y práctico para obtener una ventaja competitiva estratégica y empresarial. Los datos obtenidos, como las tasas de rotación de empleados, pueden ayudar a las organizaciones a enfocar sus esfuerzos de retención de manera adecuada. Además, las aplicaciones de minería de datos y análisis para la gestión del desempeño organizacional ayudan a las empresas a traducir los objetivos a nivel de empresa, como las metas de ganancias y ventas, en decisiones operativas, como los KPI de los trabajadores y los niveles de esfuerzo medidos requeridos. [ 15 ]
- El análisis de la cesta de la compra se ha utilizado para identificar los patrones de compra del consumidor alfa . El análisis de los datos recopilados sobre este tipo de usuario ha permitido a las empresas predecir las tendencias de compra futuras y pronosticar la demanda de la oferta.
- La minería de datos es una herramienta muy eficaz en el sector del marketing por catálogo. Las empresas de venta por catálogo disponen de una extensa base de datos con el historial de transacciones de millones de clientes, que se remonta a varios años atrás. Las herramientas de minería de datos permiten identificar patrones entre los clientes y ayudan a determinar quiénes tienen más probabilidades de responder a las próximas campañas de correo.
- La minería de datos para aplicaciones empresariales puede integrarse en un proceso complejo de modelado y toma de decisiones. [ 16 ] LIONsolver utiliza inteligencia empresarial reactiva (RBI) para promover un enfoque "holístico" que integra minería de datos, modelado y visualización interactiva en un proceso integral de descubrimiento e innovación continua impulsado por el aprendizaje humano y automatizado. [ 17 ]
- En el ámbito de la toma de decisiones , el enfoque RBI se ha utilizado para extraer conocimiento que se adquiere progresivamente del responsable de la toma de decisiones y, posteriormente, ajustar el método de decisión en consecuencia. [ 18 ] La relación entre la calidad de un sistema de minería de datos y la cantidad de inversión que el responsable de la toma de decisiones está dispuesto a realizar se formalizó al proporcionar una perspectiva económica sobre el valor del "conocimiento extraído" en términos de su beneficio para la organización. [ 16 ] Este marco de clasificación de la teoría de la decisión [ 16 ] se aplicó a una línea de fabricación de obleas de semiconductores del mundo real, donde se desarrollaron reglas de decisión para supervisar y controlar eficazmente la línea de fabricación de obleas de semiconductores. [ 19 ]
- Un ejemplo de minería de datos relacionado con una línea de producción de circuitos integrados (CI) se describe en el artículo "Mining IC Test Data to Optimize VLSI Testing" [ 20 ] . En este artículo, se describe la aplicación de la minería de datos y el análisis de decisiones al problema de las pruebas funcionales a nivel de chip. Los experimentos mencionados demuestran la capacidad de aplicar un sistema de minería de datos históricos de pruebas de chips para crear un modelo probabilístico de patrones de fallas de chips. Estos patrones se utilizan luego para decidir, en tiempo real, qué chip probar a continuación y cuándo detener las pruebas. Se ha demostrado, con base en experimentos con datos históricos de pruebas, que este sistema tiene el potencial de mejorar las ganancias en productos de CI maduros. Otros ejemplos [ 21 ] [ 22 ] de la aplicación de metodologías de minería de datos en entornos de fabricación de semiconductores sugieren que estas metodologías pueden ser particularmente útiles cuando los datos son escasos y los diversos parámetros físicos y químicos que afectan el proceso exhiben interacciones altamente complejas. Otra implicación es que el monitoreo en línea del proceso de fabricación de semiconductores mediante minería de datos puede ser altamente efectivo.
Ciencia e ingeniería
En los últimos años, la minería de datos se ha utilizado ampliamente en áreas de la ciencia y la ingeniería, como la bioinformática , la genética , la medicina , la educación y la ingeniería eléctrica .
- En el estudio de la genética humana, la minería de secuencias ayuda a abordar el importante objetivo de comprender la relación entre las variaciones interindividuales en la secuencia de ADN humano y la variabilidad en la susceptibilidad a las enfermedades. En términos sencillos, busca descubrir cómo los cambios en la secuencia de ADN de un individuo afectan los riesgos de desarrollar enfermedades comunes como el cáncer , lo cual es de gran importancia para mejorar los métodos de diagnóstico, prevención y tratamiento de estas enfermedades. Un método de minería de datos que se utiliza para realizar esta tarea se conoce como reducción de dimensionalidad multifactorial . [ 23 ]
- En el ámbito de la ingeniería eléctrica, los métodos de minería de datos se han utilizado ampliamente para el monitoreo de la condición de equipos eléctricos de alta tensión. El objetivo del monitoreo de la condición es obtener información valiosa sobre, por ejemplo, el estado del aislamiento (u otros parámetros importantes relacionados con la seguridad). Las técnicas de agrupamiento de datos , como el mapa autoorganizado (SOM), se han aplicado al monitoreo y análisis de vibraciones de cambiadores de tomas bajo carga (OLTCS) de transformadores. Mediante el monitoreo de vibraciones, se puede observar que cada operación de cambio de toma genera una señal que contiene información sobre la condición de los contactos del cambiador de tomas y los mecanismos de accionamiento. Obviamente, diferentes posiciones de toma generarán diferentes señales. Sin embargo, existía una variabilidad considerable entre las señales de condición normal para una misma posición de toma. El SOM se ha aplicado para detectar condiciones anormales y formular hipótesis sobre la naturaleza de las anomalías. [ 24 ]
- Se han aplicado métodos de minería de datos al análisis de gases disueltos (AGD) en transformadores de potencia . El AGD, como método de diagnóstico para transformadores de potencia, está disponible desde hace muchos años. Métodos como SOM se han aplicado para analizar los datos generados y determinar tendencias que no son evidentes con los métodos estándar de relación de AGD (como el Triángulo de Duval). [ 24 ]
- En la investigación educativa, donde la minería de datos se ha utilizado para estudiar los factores que llevan a los estudiantes a elegir participar en comportamientos que reducen su aprendizaje, [ 25 ] y para comprender los factores que influyen en la retención de estudiantes universitarios. [ 26 ] Un ejemplo similar de aplicación social de la minería de datos es su uso en sistemas de búsqueda de expertos , donde se extraen, normalizan y clasifican descriptores de la experiencia humana para facilitar la búsqueda de expertos, particularmente en campos científicos y técnicos. De esta manera, la minería de datos puede facilitar la memoria institucional .
- Métodos de minería de datos biomédicos facilitados por ontologías de dominio , [ 27 ] minería de datos de ensayos clínicos, [ 28 ] y análisis de tráfico utilizando SOM. [ 29 ]
- En la vigilancia de reacciones adversas a medicamentos, el Centro de Monitoreo de Uppsala ha utilizado, desde 1998, métodos de minería de datos para examinar de forma rutinaria patrones de notificación que indiquen problemas emergentes de seguridad de medicamentos en la base de datos mundial de la OMS de 4,6 millones de incidentes sospechosos de reacciones adversas a medicamentos . [ 30 ] Recientemente, se ha desarrollado una metodología similar para extraer de grandes colecciones de registros electrónicos de salud patrones temporales que asocien prescripciones de medicamentos con diagnósticos médicos. [ 31 ]
- La minería de datos se ha aplicado a artefactos de software dentro del ámbito de la ingeniería de software : Minería de repositorios de software .
- En el campo de la microbiología, se han utilizado métodos de minería de datos para predecir el comportamiento poblacional de las bacterias en los alimentos. [ 32 ]
Derechos humanos
La minería de datos de los registros gubernamentales, en particular los del sistema judicial (es decir, tribunales, prisiones), permite descubrir violaciones sistemáticas de los derechos humanos relacionadas con la generación y publicación de registros legales inválidos o fraudulentos por parte de diversas agencias gubernamentales. [ 33 ] [ 34 ]
minería de datos médicos
Algunos algoritmos de aprendizaje automático pueden aplicarse en el campo médico como herramientas de diagnóstico de segunda opinión y como herramientas para la fase de extracción de conocimiento en el proceso de descubrimiento de conocimiento en bases de datos . Uno de estos clasificadores (llamado clasificador de aprendizaje de prototipos ( PEL-C )) [ 35 ] es capaz de descubrir síndromes, así como casos clínicos atípicos.
Un campo médico actual que utiliza el proceso de minería de datos es la metabolómica , que consiste en la investigación y el estudio de las moléculas biológicas y cómo se caracteriza su interacción con fluidos corporales, células, tejidos, etc. [ 36 ] La metabolómica es un campo que maneja una gran cantidad de datos y a menudo implica examinar enormes cantidades de datos irrelevantes antes de llegar a conclusiones. La minería de datos ha permitido que este campo relativamente nuevo de la investigación médica crezca considerablemente en la última década y probablemente será el método para encontrar nuevas investigaciones en este campo. [ 36 ]
En 2011, el caso Sorrell v. IMS Health, Inc. , resuelto por la Corte Suprema de los Estados Unidos , dictaminó que las farmacias pueden compartir información con empresas externas. Esta práctica fue autorizada por la Primera Enmienda de la Constitución , que protege la "libertad de expresión". [ 37 ] Sin embargo, la aprobación de la Ley de Tecnología de la Información Sanitaria para la Salud Económica y Clínica (Ley HITECH) contribuyó a la adopción del registro electrónico de salud (EHR) y la tecnología de apoyo en los Estados Unidos. [ 38 ] La Ley HITECH se promulgó el 17 de febrero de 2009, como parte de la Ley de Recuperación y Reinversión Estadounidense (ARRA), y ayudó a abrir la puerta a la minería de datos médicos. [ 39 ] Antes de la promulgación de esta ley, se estimaba que solo el 20 % de los médicos estadounidenses utilizaban registros electrónicos de pacientes. [ 38 ] Søren Brunak señala que "el registro del paciente se vuelve lo más rico en información posible" y, por lo tanto, "maximiza las oportunidades de minería de datos". [ 38 ] Por lo tanto, los registros electrónicos de pacientes amplían aún más las posibilidades en lo que respecta a la minería de datos médicos, abriendo así la puerta a una vasta fuente de análisis de datos médicos.
minería de datos espaciales
La minería de datos espaciales consiste en la aplicación de métodos de minería de datos a datos espaciales. Su objetivo final es encontrar patrones geográficos en los datos. Hasta ahora, la minería de datos y los Sistemas de Información Geográfica (SIG) se han considerado dos tecnologías independientes, cada una con sus propios métodos, tradiciones y enfoques para la visualización y el análisis de datos. En particular, la mayoría de los SIG actuales solo cuentan con funcionalidades básicas de análisis espacial. La enorme proliferación de datos georreferenciados, impulsada por los avances en tecnologías de la información, cartografía digital, teledetección y la difusión global de los SIG, subraya la importancia de desarrollar enfoques inductivos basados en datos para el análisis y la modelización geográfica.
La minería de datos ofrece grandes beneficios potenciales para la toma de decisiones aplicadas basadas en SIG. Recientemente, la tarea de integrar estas dos tecnologías ha adquirido una importancia crítica, especialmente a medida que diversas organizaciones de los sectores público y privado que poseen enormes bases de datos con información temática y georreferenciada comienzan a darse cuenta del enorme potencial de la información que contienen. Entre esas organizaciones se encuentran:
- Oficinas que requieren análisis o difusión de datos estadísticos georreferenciados
- Los servicios de salud pública buscan explicaciones para la agrupación de enfermedades.
- Agencias ambientales que evalúan el impacto de los cambios en los patrones de uso de la tierra sobre el cambio climático.
- Empresas de geomarketing que realizan segmentación de clientes en función de la ubicación geográfica.
Desafíos en la minería espacial: Los repositorios de datos geoespaciales tienden a ser muy grandes. Además, los conjuntos de datos SIG existentes a menudo se dividen en componentes de características y atributos que se archivan convencionalmente en sistemas de gestión de datos híbridos. Los requisitos algorítmicos difieren sustancialmente para la gestión de datos relacionales (atributos) y para la gestión de datos topológicos (características). [ 40 ] Relacionado con esto está el rango y la diversidad de formatos de datos geográficos, que presentan desafíos únicos. La revolución de los datos geográficos digitales está creando nuevos tipos de formatos de datos más allá de los formatos tradicionales "vectoriales" y "ráster". Los repositorios de datos geográficos incluyen cada vez más datos mal estructurados, como imágenes y multimedia georreferenciada. [ 41 ]
Existen varios desafíos de investigación críticos en el descubrimiento de conocimiento geográfico y la minería de datos. Miller y Han [ 42 ] ofrecen la siguiente lista de temas de investigación emergentes en el campo:
- Desarrollo y soporte de almacenes de datos geográficos (GDW) : En los almacenes de datos convencionales, las propiedades espaciales suelen reducirse a simples atributos no espaciales . La creación de un GDW integrado requiere resolver problemas de interoperabilidad de datos espaciales y temporales, incluyendo diferencias en semántica, sistemas de referencia, geometría, precisión y posición.
- Mejores representaciones espaciotemporales en el descubrimiento de conocimiento geográfico : Los métodos actuales de descubrimiento de conocimiento geográfico (GKD) suelen utilizar representaciones muy simples de objetos geográficos y relaciones espaciales. Los métodos de minería de datos geográficos deberían reconocer objetos geográficos más complejos (como líneas y polígonos) y relaciones (como distancias no euclidianas, dirección, conectividad e interacción a través de espacios geográficos con atributos, como el terreno). Además, es necesario integrar de forma más completa la dimensión temporal en estas representaciones y relaciones geográficas.
- Descubrimiento de conocimiento geográfico mediante diversos tipos de datos : Se deben desarrollar métodos de descubrimiento de conocimiento geográfico (GKD) que puedan manejar diversos tipos de datos más allá de los modelos tradicionales de ráster y vector, incluyendo imágenes y multimedia georreferenciada, así como tipos de datos dinámicos (transmisiones de vídeo, animaciones).
Minería de datos temporales
Los datos pueden contener atributos generados y registrados en diferentes momentos. En este caso, para encontrar relaciones significativas en los datos, puede ser necesario considerar el orden temporal de los atributos. Una relación temporal puede indicar una relación causal o, simplemente, una asociación.
minería de datos de sensores
Las redes de sensores inalámbricos pueden utilizarse para facilitar la recopilación de datos para la minería de datos espaciales en diversas aplicaciones, como la monitorización de la contaminación atmosférica. [ 43 ] Una característica de estas redes es que los nodos de sensores cercanos que monitorizan una característica ambiental suelen registrar valores similares. Este tipo de redundancia de datos, debida a la correlación espacial entre las observaciones de los sensores, inspira las técnicas de agregación y minería de datos en red. Al medir la correlación espacial entre los datos muestreados por diferentes sensores, se puede desarrollar una amplia gama de algoritmos especializados para crear algoritmos de minería de datos espaciales más eficientes. [ 44 ]
minería de datos visuales
En el proceso de transición de lo analógico a lo digital, se han generado, recopilado y almacenado grandes conjuntos de datos, descubriendo patrones estadísticos, tendencias e información oculta en ellos, con el fin de construir modelos predictivos. Los estudios sugieren que la minería de datos visual es más rápida y mucho más intuitiva que la minería de datos tradicional. [ 45 ] [ 46 ] [ 47 ] Véase también Visión por computadora .
minería de datos musicales
Se han utilizado técnicas de minería de datos, y en particular el análisis de coocurrencia , para descubrir similitudes relevantes entre corpus musicales (listas de radio, bases de datos de CD) con fines que incluyen la clasificación de la música en géneros de una manera más objetiva. [ 48 ]
Vigilancia
El gobierno de EE. UU. ha utilizado la minería de datos. Entre los programas se incluyen el programa Total Information Awareness (TIA), Secure Flight (anteriormente conocido como Computer-Assisted Passenger Prescreening System ( CAPPS II )), Analysis, Dissemination, Visualization, Insight, Semantic Enhancement ( ADVISE ) [ 49 ] y Multi-state Anti-Terrorism Information Exchange ( MATRIX ) [ 50 ] . Estos programas se han suspendido debido a la controversia sobre si violan la Cuarta Enmienda de la Constitución de los Estados Unidos, aunque muchos programas creados bajo ellos siguen siendo financiados por diferentes organizaciones o bajo otros nombres [ 51 ] .
En el contexto de la lucha contra el terrorismo , dos métodos particularmente plausibles de minería de datos son la "minería de patrones" y la "minería de datos basada en sujetos".
Minería de patrones
La minería de patrones es un método de minería de datos que consiste en encontrar patrones existentes en los datos. En este contexto, los patrones suelen referirse a reglas de asociación . La motivación original para buscar reglas de asociación surgió del deseo de analizar los datos de transacciones de supermercados, es decir, examinar el comportamiento del cliente en función de los productos adquiridos. Por ejemplo, una regla de asociación "cerveza ⇒ patatas fritas (80%)" indica que cuatro de cada cinco clientes que compraron cerveza también compraron patatas fritas.
En el contexto de la minería de patrones como herramienta para identificar la actividad terrorista, el Consejo Nacional de Investigación proporciona la siguiente definición: "La minería de datos basada en patrones busca patrones (incluidos patrones de datos anómalos) que podrían estar asociados con la actividad terrorista ; estos patrones podrían considerarse como pequeñas señales en un gran océano de ruido". [ 52 ] [ 53 ] [ 54 ] La minería de patrones incluye nuevas áreas como la recuperación de información musical (MIR), donde los patrones vistos tanto en los dominios temporales como no temporales se importan a los métodos clásicos de búsqueda de descubrimiento de conocimiento.
minería de datos basada en temas
La "minería de datos basada en sujetos" es un método de minería de datos que implica la búsqueda de asociaciones entre individuos en los datos. En el contexto de la lucha contra el terrorismo, el Consejo Nacional de Investigación proporciona la siguiente definición: "La minería de datos basada en sujetos utiliza un individuo inicial u otro dato que se considera, con base en otra información, de gran interés, y el objetivo es determinar qué otras personas, transacciones financieras o movimientos, etc., están relacionados con ese dato inicial". [ 53 ]
Cuadrícula de conocimiento
Knowledge discovery "On the Grid" generally refers to conducting knowledge discovery in an open environment using grid computing concepts, allowing users to integrate data from various online data sources, as well make use of remote resources, for executing their data mining tasks. The earliest example was the Discovery Net,[55][56] developed at Imperial College London, which won the "Most Innovative Data-Intensive Application Award" at the ACM SC02 (Supercomputing 2002) conference and exhibition, based on a demonstration of a fully interactive distributed knowledge discovery application for a bioinformatics application. Other examples include work conducted by researchers at the University of Calabria, who developed a Knowledge Grid architecture for distributed knowledge discovery, based on grid computing.[57][58]
References
- ↑Ait Issad, Hassina (October 2019). "A comprehensive review of Data Mining techniques in smart agriculture". Engineering in Agriculture, Environment and Food. 12 (4): 511–525. Bibcode:2019EAEF...12..511A. doi:10.1016/j.eaef.2019.11.003.
- ↑Firouz, Mahmoud Soltani (2022). "Defect Detection in Fruit and Vegetables by Using Machine Vision Systems and Image Processing". Springer Nature Link. 14 (3): 353–379. doi:10.1007/s12393-022-09307-1.
- ↑Hill, M. G.; Connolly, P. G.; Reutemann, P.; Fletcher, D. (2014-10-01). "The use of data mining to assist crop protection decisions on kiwifruit in New Zealand". Computers and Electronics in Agriculture. 108: 250–257. Bibcode:2014CEAgr.108..250H. doi:10.1016/j.compag.2014.08.011.
- ↑Urtubia, Alejandra; Pérez-Correa, J. Ricardo; Soto, Alvaro; Pszczólkowski, Philippo (2007-12-01). "Using data mining techniques to predict industrial wine problem fermentations". Food Control. 18 (12): 1512–1517. doi:10.1016/j.foodcont.2006.09.010. ISSN 0956-7135.
- ↑Ahmadi, H.; Golian, A.; Mottaghitalab, M.; Nariman-Zadeh, N. (2008-09-01). "Prediction Model for True Metabolizable Energy of Feather Meal and Poultry Offal Meal Using Group Method of Data Handling-Type Neural Network". Poultry Science. 87 (9): 1909–1912. doi:10.3382/ps.2007-00507. ISSN 0032-5791. PMID 18753461.
- ↑Ahmadi, Dr H.; Mottaghitalab, M.; Nariman-Zadeh, N.; Golian, A. (2008-05-01). "Predicting performance of broiler chickens from dietary nutrients using group method of data handling-type neural networks". British Poultry Science. 49 (3): 315–320. doi:10.1080/00071660802136908. ISSN 0007-1668. PMID 18568756. S2CID 205399055.
- ↑Mojtaba, Tahmoorespur; Hamed, Ahmadi (2012-01-01). "neural network model to describe weight gain of sheep from genes polymorphism, birth weight and birth type". Livestock Science. ISSN 1871-1413.
- ↑Ahmadi, H.; Golian, A. (2010-11-01). "The integration of broiler chicken threonine responses data into neural network models". Poultry Science. 89 (11): 2535–2541. doi:10.3382/ps.2010-00884. ISSN 0032-5791. PMID 20952719.
- ↑O'Brien, J. A., & Marakas, G. M. (2011). Management Information Systems. New York, NY: McGraw-Hill/Irwin.
- ↑Alexander, Doug. "Data Mining". The University of Texas at Austin: College of Liberal Arts.
- ↑"Daniele Medri: Big Data & Business: An on-going revolution". Statistics Views. 21 Oct 2013. Archived from the original on 17 June 2015. Retrieved 21 September 2015.
- ↑"Large Scale Item Categorization"(PDF). Archived from the original(PDF) on 2015-10-05.
- ↑ Goss, S. (10 de abril de 2013). Minería de datos y nuestra privacidad personal. Recuperado de The Telegraph: "Minería de datos y nuestra privacidad personal | The Sun News | Macon.com" . Archivado del original el 5 de julio de 2014. Recuperado el 21 de septiembre de 2015 .
- ↑ Monk, Ellen; Wagner, Bret (2006). Conceptos de planificación de recursos empresariales, segunda edición . Boston, MA: Thomson Course Technology. ISBN 978-0-619-21663-4OCLC 224465825
- ↑ Chalutz-Ben Gal, H. (2023). Rokach, L.; Maimon, O.; Shmueli, E. (eds.). "Minería de datos organizacionales basada en recursos humanos (HRODM): temas, tendencias, enfoque, futuro" (PDF) . Springer. pp. 833–866 .
- 1 2 3 Elovici, Yuval; Braha, Dan (2003). "Un enfoque de teoría de decisiones para la minería de datos" (PDF) . IEEE Transactions on Systems, Man, and Cybernetics - Part A: Systems and Humans . 33 (1): 42– 51. Bibcode : 2003ITSMA..33...42E . doi : 10.1109/TSMCA.2003.812596 . hdl : 10150/105859 .
- ↑ Battiti, Roberto; y Brunato, Mauro; Inteligencia empresarial reactiva. De los datos a los modelos y a la información , Reactive Search Srl, Italia, febrero de 2011. ISBN 978-88-905795-0-9.
- ↑ Battiti, Roberto; Passerini, Andrea (2010). "Optimización multiobjetivo evolutiva cerebro-computadora (BC-EMO): un algoritmo genético que se adapta al responsable de la toma de decisiones" (PDF) . IEEE Transactions on Evolutionary Computation . 14 (15): 671– 687. doi : 10.1109/TEVC.2010.2058118 . S2CID 2182650 .
- ↑ Braha, Dan; Elovici, Yuval; Last, Mark (2007). "Teoría de la minería de datos procesables con aplicación al control de la fabricación de semiconductores" (PDF) . International Journal of Production Research . 45 (13): 3059– 3084. CiteSeerX 10.1.1.127.1472 . doi : 10.1080/00207540600654475 . S2CID 2299178 .
- ↑ Fountain, Tony; Dietterich, Thomas; y Sudyka, Bill (2000); Minería de datos de pruebas de circuitos integrados para optimizar las pruebas VLSI , en Actas de la Sexta Conferencia Internacional ACM SIGKDD sobre Descubrimiento de Conocimiento y Minería de Datos, ACM Press, págs. 18–25
- ↑ Braha, Dan; Shmilovici, Armin (2002). "Minería de datos para mejorar un proceso de limpieza en la industria de semiconductores" (PDF) . IEEE Transactions on Semiconductor Manufacturing . 15 (1): 91– 101. Bibcode : 2002ITSM...15...91B . CiteSeerX 10.1.1.10.7921 . doi : 10.1109/66.983448 .
- ↑ Braha, Dan; Shmilovici, Armin (2003). "Sobre el uso de la inducción de árboles de decisión para el descubrimiento de interacciones en un proceso fotolitográfico" (PDF) . IEEE Transactions on Semiconductor Manufacturing . 16 (4): 644– 652. Bibcode : 2003ITSM...16..644B . doi : 10.1109/TSM.2003.818959 .
- ↑ Zhu, Xingquan; Davidson, Ian (2007). Descubrimiento de conocimiento y minería de datos: desafíos y realidades . Nueva York, NY: Hershey. pág. 18. ISBN 978-1-59904-252-7.
- 1 2 McGrail, Anthony J.; Gulski, Edward; Allan, David; Birtwhistle, David; Blackburn, Trevor R.; Groot, Edwin RS "Técnicas de minería de datos para evaluar el estado de las instalaciones eléctricas de alta tensión". CIGRÉ WG 15.11 del Comité de Estudio 15 .
- ↑ Baker, Ryan SJ d. "¿Es el juego un estado o un rasgo del sistema? Minería de datos educativos a través de la aplicación multicontextual de un modelo de comportamiento validado". Taller sobre minería de datos para el modelado de usuarios 2007 .
- ↑ Superby Aguirre, Juan Francisco; Vandamme, Jean-Philippe; Meskens, Nadine. "Determinación de factores que influyen en el rendimiento de los estudiantes de primer año de universidad mediante métodos de minería de datos". Taller sobre Minería de Datos Educativos 2006 .
- ↑ Zhu, Xingquan; Davidson, Ian (2007). Descubrimiento de conocimiento y minería de datos: desafíos y realidades . Nueva York, NY: Hershey. págs. 163–189 . ISBN 978-1-59904-252-7.
- ↑ Zhu, Xingquan; Davidson, Ian (2007). Descubrimiento de conocimiento y minería de datos: desafíos y realidades . Nueva York, NY: Hershey. págs. 31–48 . ISBN 978-1-59904-252-7.
- ↑ Chen, Yudong; Zhang, Yi; Hu, Jianming; Li, Xiang (2006). "Análisis de datos de tráfico mediante PCA de núcleo y mapa autoorganizado". Simposio IEEE de Vehículos Inteligentes de 2006. págs. 472–477 . doi : 10.1109/IVS.2006.1689673 . ISBN 978-4-901122-86-3. S2CID 16645060 .
- ↑ Bate, Andrew; Lindquist, Marie; Edwards, I. Ralph; Olsson, Sten; Orre, Roland; Lansner, Anders; de Freitas, Rogelio Melhado (junio de 1998). "Un método de red neuronal bayesiana para la generación de señales de reacciones adversas a medicamentos" ( PDF) . European Journal of Clinical Pharmacology . 54 (4): 315–21 . doi : 10.1007/s002280050466 . PMID 9696956. S2CID 25966839 .
- ↑ Norén, G. Niklas; Bate, Andrew; Hopstadius, Johan; Star, Kristina; y Edwards, I. Ralph (2008); Descubrimiento de patrones temporales para tendencias y efectos transitorios: su aplicación a registros de pacientes. Actas de la Decimocuarta Conferencia Internacional sobre Descubrimiento de Conocimiento y Minería de Datos (SIGKDD 2008), Las Vegas, NV , págs. 963–971.
- ↑ Hiura, Satoko; Koseki, Shige; Koyama, Kento (2021-05-19). "Predicción del comportamiento poblacional de Listeria monocytogenes en alimentos utilizando aprendizaje automático y una base de datos de crecimiento y supervivencia microbiana" . Scientific Reports . 11 (1): 10613. Bibcode : 2021NatSR..1110613H . doi : 10.1038/s41598-021-90164-z . ISSN 2045-2322 . PMC 8134468. PMID 34012066 .
- ↑ Zernik, Joseph; La minería de datos como deber cívico: sistemas públicos de registro de presos en línea , Revista internacional sobre redes sociales: monitoreo, medición y minería , 1: 84–96 (2010)
- ↑ Zernik, Joseph; Minería de datos de registros judiciales en línea de los tribunales federales estadounidenses en red , Revista internacional sobre redes sociales: monitoreo, medición y minería , 1:69–83 (2010)
- ↑ Gagliardi, F (2011). "Clasificadores basados en instancias aplicados a bases de datos médicas: Diagnóstico y extracción de conocimiento". Inteligencia Artificial en Medicina . 52 (3): 123– 139. doi : 10.1016/j.artmed.2011.04.002 . PMID 21621400 .
- 1 2 Martínez-Arranz, Ibon; Mayo, Rebeca; Pérez-Cormenzana, Miriam; Mincholé, Itziar; Salazar, Lorena; Alonso, Cristina; Mato, José M. (2015). "Mejora de la investigación metabolómica mediante la minería de datos". Revista de proteómica . 127 (Parte B): 275– 288. doi : 10.1016/j.jprot.2015.01.019 . PMID 25668325 .
- ↑ David G. Savage (24 de junio de 2011). "Industria farmacéutica: la Corte Suprema se pone del lado de la industria farmacéutica en dos decisiones" . Los Angeles Times . Consultado el 7 de noviembre de 2012 .
- 1 2 3 Goth, Gregory (2012). "Análisis de datos médicos". Communications of the ACM . 55 (6): 13. doi : 10.1145/2184319.2184324 .
- ↑ "¿Qué es la Ley HITECH (Tecnología de la Información Sanitaria para la Salud Económica y Clínica) de 2009? | Definición de TechTarget" .
- ↑ Healey, Richard G. (1991); Sistemas de gestión de bases de datos , en Maguire, David J.; Goodchild, Michael F.; y Rhind, David W., (eds.), Sistemas de información geográfica: principios y aplicaciones , Londres, GB: Longman
- ↑ Camara, Antonio S.; y Raper, Jonathan (eds.) (1999); Multimedia espacial y realidad virtual , Londres, GB: Taylor and Francis
- ↑ Miller, Harvey J.; y Han, Jiawei (eds.) (2001); Minería de datos geográficos y descubrimiento de conocimiento , Londres, GB: Taylor & Francis
- ↑ Ma, Y.; Richards, M.; Ghanem, M.; Guo, Y.; Hassard, J. (2008). "Monitoreo y minería de la contaminación del aire basados en una red de sensores en Londres" . Sensors . 8 ( 6): 3601– 3623. Bibcode : 2008Senso...8.3601M . doi : 10.3390/s8063601 . PMC 3714656. PMID 27879895 .
- ↑ Ma, Y.; Guo, Y.; Tian, X.; Ghanem, M. (2011). "Algoritmo de agregación basado en agrupamiento distribuido para redes de sensores espacialmente correlacionadas". IEEE Sensors Journal . 11 (3): 641. Bibcode : 2011ISenJ..11..641M . CiteSeerX 10.1.1.724.1158 . doi : 10.1109/JSEN.2010.2056916 . S2CID 1639100 .
- ↑ Zhao, Kaidi; y Liu, Bing; Tirpark, Thomas M.; y Weimin, Xiao; Un marco de minería de datos visuales para la identificación conveniente de conocimiento útil
- ↑ Keim, Daniel A.; Visualización de la información y minería visual de datos
- ↑ Burch, Michael; Diehl, Stephan; Weißgerber, Peter; Minería de datos visuales en archivos de software
- ↑ Pachet, François; Westermann, Gert; y Laigre, Damien; Minería de datos musicales para la distribución de música electrónica Archivado el 27-03-2014 en Wayback Machine , Actas de la 1.ª Conferencia WedelMusic, Florencia, Italia, 2001, págs. 101–106.
- ↑ Oficina de Responsabilidad Gubernamental, Minería de datos: La atención temprana a la privacidad en el desarrollo de un programa clave del DHS podría reducir los riesgos , GAO-07-293 (febrero de 2007), Washington, DC
- ↑ Informe del programa de vuelos seguros , NBC News
- ↑ "Conciencia total sobre información/terrorismo (TIA): ¿Está realmente muerta?" . Electronic Frontier Foundation (sitio web oficial) . 2003. Archivado del original el 25-03-2009 . Consultado el 15-03-2009 .
- ^ Agrawal, Rakesh; Mannila, Heikki; Srikant, Ramakrishnan; Toivonen, Hannu; y Verkamo, A. Inkeri; Descubrimiento rápido de reglas de asociación , en Avances en el descubrimiento de conocimientos y la minería de datos , MIT Press, 1996, págs. 307–328
- 1 2 Consejo Nacional de Investigación, Protección de la privacidad individual en la lucha contra el terrorismo: un marco para la evaluación de programas , Washington, DC: National Academies Press, 2008
- ↑ Haag, Stephen; Cummings, Maeve; Phillips, Amy (2006). Sistemas de información gerencial para la era de la información . Toronto: McGraw-Hill Ryerson. pág . 28. ISBN 978-0-07-095569-1OCLC 63194770
- ↑ Ghanem, Moustafa; Guo, Yike; Rowe, Anthony; Wendel, Patrick (2002). "Servicios de descubrimiento de conocimiento basados en cuadrículas para informática de alto rendimiento". Actas del 11.º Simposio Internacional IEEE sobre Computación Distribuida de Alto Rendimiento . pág. 416. doi : 10.1109/HPDC.2002.1029946 . ISBN 978-0-7695-1686-8. S2CID 28782519 .
- ↑ Ghanem, Moustafa; Curcin, Vasa; Wendel, Patrick; Guo, Yike (2009). "Construcción y uso de flujos de trabajo analíticos en Discovery Net". Técnicas de minería de datos en entornos de computación en malla . pág. 119. doi : 10.1002/9780470699904.ch8 . ISBN 9780470699904.
- ↑ Cannataro, Mario; Talia, Domenico (enero de 2003). "The Knowledge Grid: An Architecture for Distributed Knowledge Discovery" (PDF) . Communications of the ACM . 46 (1): 89–93 . doi : 10.1145/602421.602425 . S2CID 8709194. Archivado del original (PDF) el 10 de noviembre de 2011. Consultado el 17 de octubre de 2011 .
- ↑ Talia, Domenico; Trunfio, Paolo (julio de 2010). "Cómo las tareas de minería de datos distribuidas pueden prosperar como servicios de conocimiento" (PDF) . Communications of the ACM . 53 (7): 132– 137. CiteSeerX 10.1.1.378.2206 . doi : 10.1145/1785414.1785451 . S2CID 14713292. Archivado del original (PDF) el 27 de octubre de 2011. Recuperado el 17 de octubre de 2011 .
Enlaces externos
- Wikipedia: Minería de datos Wikipedia
- Minería de datos aplicada