La predicción conforme ( PC ) es un algoritmo para la cuantificación de la incertidumbre que produce regiones de predicción estadísticamente válidas ( intervalos de predicción multidimensionales ) para cualquier predictor puntual subyacente (ya sea estadístico, de aprendizaje automático o de aprendizaje profundo ), asumiendo únicamente la intercambiabilidad de los datos. La PC funciona calculando "puntuaciones de no conformidad" en datos previamente etiquetados y utilizándolas para crear conjuntos de predicción en un nuevo punto de datos de prueba (sin etiquetar). Una versión transductiva de la PC fue propuesta por primera vez en 1998 por Gammerman , Vovk y Vapnik [ 1 ] , y desde entonces se han desarrollado varias variantes de predicción conforme con diferentes complejidades computacionales, garantías formales y aplicaciones prácticas [ 2 ] .
La predicción conforme requiere un nivel de significancia especificado por el usuario para el cual el algoritmo debe producir sus predicciones. Este nivel de significancia restringe la frecuencia de errores que el algoritmo puede cometer. Por ejemplo, un nivel de significancia de 0.1 significa que el algoritmo puede realizar como máximo un 10 % de predicciones erróneas. Para cumplir con este requisito, la salida es una predicción de conjunto , en lugar de una predicción puntual producida por los modelos estándar de aprendizaje automático supervisado . Para las tareas de clasificación, esto significa que las predicciones no son una sola clase, por ejemplo 'cat', sino un conjunto como {'cat', 'dog'}. Dependiendo de la calidad del modelo subyacente (qué tan bien puede distinguir entre gatos, perros y otros animales) y del nivel de significancia especificado, estos conjuntos pueden ser más pequeños o más grandes. Para las tareas de regresión, la salida son intervalos de predicción, donde un nivel de significancia menor (menos errores permitidos) produce intervalos más amplios que son menos específicos, y viceversa: más errores permitidos producen intervalos de predicción más ajustados. [ 3 ] [ 4 ] [ 5 ] [ 6 ]
Historia
La predicción conforme surgió por primera vez en una colaboración entre Gammerman, Vovk y Vapnik en 1998; [ 1 ] esta versión inicial de predicción conforme utilizaba lo que ahora se denominan valores E, aunque la versión de predicción conforme más conocida hoy en día utiliza valores p y fue propuesta un año después por Saunders et al. [ 7 ] Vovk, Gammerman y sus estudiantes y colaboradores, en particular Craig Saunders, Harris Papadopoulos y Kostas Proedrou, continuaron desarrollando las ideas de la predicción conforme; los principales desarrollos incluyen la propuesta de predicción conforme inductiva (también conocida como predicción conforme dividida), en 2002. [ 8 ] Vovk y Shafer escribieron un libro sobre el tema en 2005, [ 3 ] y se publicó un tutorial en 2008. [ 9 ]
Teoría
Los datos deben ajustarse a ciertos estándares, como la intercambiabilidad de los datos (una suposición ligeramente menos estricta que la IID estándar impuesta en el aprendizaje automático estándar). Para la predicción conforme, se dice que una región de predicción del n % es válida si la verdad se encuentra en la salida el n % de las veces. [ 3 ] La eficiencia es el tamaño de la salida. Para la clasificación, este tamaño es el número de clases; para la regresión, es la amplitud del intervalo. [ 9 ]
En su forma más pura, la predicción conforme se realiza para una sección en línea (transductiva). Es decir, después de predecir una etiqueta, se conoce su etiqueta verdadera antes de la siguiente predicción. Por lo tanto, el modelo subyacente se puede reentrenar utilizando este nuevo punto de datos y la siguiente predicción se realizará sobre un conjunto de calibración que contiene n + 1 puntos de datos, donde el modelo anterior tenía n puntos de datos. [ 9 ]
Algoritmos de clasificación
El objetivo de los algoritmos de clasificación estándar es clasificar un objeto de prueba en una de varias clases discretas. Los clasificadores conformes, en cambio, calculan y generan el valor p para cada clase disponible, realizando una clasificación de la medida de no conformidad (valor α) del objeto de prueba frente a ejemplos del conjunto de datos de entrenamiento. De forma similar a las pruebas de hipótesis estándar , el valor p , junto con un umbral (denominado nivel de significancia en el campo de la clasificación conforme), se utiliza para determinar si la etiqueta debe estar en el conjunto de predicción. Por ejemplo, para un nivel de significancia de 0,1, todas las clases con un valor p de 0,1 o superior se añaden al conjunto de predicción. Los algoritmos transductivos calculan la puntuación de no conformidad utilizando todos los datos de entrenamiento disponibles, mientras que los algoritmos inductivos la calculan en un subconjunto del conjunto de entrenamiento.
predicción conforme inductiva (ICP)
La predicción conforme inductiva se conoció inicialmente como máquinas de confianza inductivas [ 8 ] , pero posteriormente se reintrodujo como ICP. Ha ganado popularidad en entornos prácticos porque el modelo subyacente no necesita reentrenarse para cada nuevo ejemplo de prueba. Esto la hace interesante para cualquier modelo que requiera un entrenamiento complejo, como las redes neuronales [ 10 ] .
Predicción conforme inductiva de Mondrian (MICP)
En MICP, los valores alfa dependen de la clase (Mondrian) y el modelo subyacente no sigue la configuración en línea original introducida en 2005. [ 4 ]
Algoritmo de entrenamiento:
- Entrenar un modelo de aprendizaje automático
- Ejecute un conjunto de calibración a través del modelo y guarde la salida de la etapa elegida.
- En el aprendizaje profundo, los valores softmax se utilizan con frecuencia.
- Utilice una función de no conformidad para calcular los valores α.
- Un punto de datos en el conjunto de calibración dará como resultado un valor α para su clase verdadera.
Algoritmo de predicción:
- Para un punto de datos de prueba, genere un nuevo valor α.
- Encuentra un valor p para cada clase del punto de datos.
- Si el valor p es mayor que el nivel de significancia, incluya la clase en la salida [ 4 ].
Algoritmos de regresión
La predicción conforme se formuló inicialmente para la tarea de clasificación, pero posteriormente se modificó para la regresión. A diferencia de la clasificación, que genera valores p sin un nivel de significancia definido, la regresión requiere un nivel de significancia fijo en el momento de la predicción para producir intervalos de predicción para un nuevo objeto de prueba. Para la regresión conforme clásica, no existe un algoritmo transductivo . Esto se debe a que es imposible postular todas las etiquetas posibles para un nuevo objeto de prueba, ya que el espacio de etiquetas es continuo. Los algoritmos disponibles se formulan en el marco inductivo , que calcula una regla de predicción una sola vez y la aplica a todas las predicciones futuras.
predicción conforme inductiva (ICP)
Todos los algoritmos inductivos requieren dividir los ejemplos de entrenamiento disponibles en dos conjuntos disjuntos : uno para entrenar el modelo subyacente (el conjunto de entrenamiento propiamente dicho ) y otro para calibrar la predicción (el conjunto de calibración ). En ICP, esta división se realiza una sola vez, entrenando así un único modelo de aprendizaje automático. Si la división se realiza de forma aleatoria y los datos son intercambiables, se demuestra que el modelo ICP es automáticamente válido (es decir, la tasa de error corresponde al nivel de significancia requerido).
Algoritmo de entrenamiento:
- Divida los datos de entrenamiento en un conjunto de entrenamiento y un conjunto de calibración adecuados.
- Entrena el modelo de aprendizaje automático subyacente utilizando el conjunto de entrenamiento adecuado.
- Predice los ejemplos del conjunto de calibración utilizando el modelo ML derivado → valores ŷ
- Opcional: si se utiliza una función de no conformidad normalizada.
- Entrenar el modelo de aprendizaje automático de normalización
- Predecir puntuaciones de normalización → valores 𝜺
- Calcula las medidas de no conformidad ( valores α ) para todos los ejemplos de calibración, utilizando los valores ŷ y 𝜺.
- Clasifique la medida de no conformidad y genere puntuaciones de no conformidad.
- Guardar el modelo ML subyacente, el modelo ML de normalización (si lo hay) y las puntuaciones de no conformidad.
Algoritmo de predicción:
Entrada requerida: nivel de significancia ( s )
- Predice el objeto de prueba usando el modelo ML → ŷ t
- Opcional: si se utiliza una función de no conformidad normalizada.
- Predice el objeto de prueba usando el modelo de normalización → 𝜺 t
- Seleccione la puntuación de no conformidad de la lista de puntuaciones producidas por el conjunto de calibración en entrenamiento, correspondiente al nivel de significancia s → α s
- Calcular la mitad del ancho del intervalo de predicción ( d ) reorganizando la función de no conformidad e introduciendo α s (y opcionalmente 𝜺) → d
- Intervalo de predicción de salida ( ŷ − d , ŷ + d ) para el nivel de significancia dado s
Predicción conforme dividida (SCP)
El SCP, a menudo denominado predictor conforme agregado (ACP), puede considerarse un conjunto de ICP . El SCP suele mejorar la eficiencia de las predicciones (es decir, crea intervalos de predicción más pequeños) en comparación con un único ICP, pero pierde la validez automática de las predicciones generadas.
Un tipo común de SCP es el predictor de conformidad cruzada (CCP), que divide los datos de entrenamiento en conjuntos de entrenamiento y calibración adecuados varias veces en una estrategia similar a la validación cruzada k -fold . Independientemente de la técnica de división, el algoritmo realiza n divisiones y entrena un ICP para cada división. Al predecir un nuevo objeto de prueba, utiliza la mediana ŷ y d de los n ICP para crear el intervalo de predicción final como ( ŷ mediana − d mediana , ŷ mediana + d mediana ).
Aplicaciones
Tipos de modelos de aprendizaje
Se pueden utilizar varios modelos de aprendizaje automático junto con la predicción conforme. Los estudios han demostrado que se puede aplicar, por ejemplo, a redes neuronales convolucionales , [ 11 ] máquinas de vectores de soporte y otras.
Caso de uso
La predicción conforme se utiliza en diversos campos y es un área de investigación activa. Por ejemplo, en biotecnología se ha utilizado para predecir incertidumbres en el cáncer de mama , [ 12 ] riesgos de accidente cerebrovascular , [ 13 ] almacenamiento de datos, [ 14 ] y limpieza de unidades de disco. [ 15 ] En el ámbito de la seguridad del hardware se ha utilizado para detectar troyanos de hardware en evolución. [ 16 ] Dentro de la tecnología del lenguaje, los artículos sobre predicción conforme se presentan habitualmente en el Simposio sobre Predicción Conforme y Probabilística con Aplicaciones (COPA). [ 17 ] La predicción conforme también se ha aplicado al descubrimiento de fármacos de moléculas pequeñas . [ 18 ]
Uso en el manejo de la incertidumbre y la deriva conceptual.
La predicción conforme se utiliza en muchos casos para que los modelos de aprendizaje automático comprendan mejor la incertidumbre en sus resultados. En la predicción conforme, una puntuación de no conformidad mide cuán inusual es un nuevo ejemplo en comparación con los datos de entrenamiento, y estas puntuaciones se utilizan para calcular los valores p que determinan el conjunto de predicción final. En lugar de crear una sola etiqueta, el modelo genera valores p para mostrar cómo se correlaciona cada etiqueta posible con el nuevo punto de datos. Estos valores p se utilizan luego para formar conjuntos de predicción y puntuaciones de credibilidad que indican si las suposiciones en tiempo real del modelo siguen siendo válidas para la entrada que están evaluando.
Dado que la predicción conforme compara patrones aprendidos a partir de datos anteriores con nuevas entradas, puede ayudar a revelar cuándo ha cambiado la distribución subyacente de los datos. Cuando existe una deriva conceptual , los nuevos datos pueden recibir puntuaciones de valor p más bajas, lo que indica que el modelo está encontrando entradas que difieren de su distribución de entrenamiento. Esto hace que la predicción conforme sea útil para evaluar si un modelo sigue siendo fiable a medida que los datos evolucionan naturalmente con el tiempo. [ 19 ]
Los investigadores han aplicado la predicción conforme en ámbitos como la ciberseguridad y la detección de anomalías , donde los datos cambian rápidamente. En el contexto de la clasificación de malware, las puntuaciones y los valores p conformes pueden ayudar a resaltar archivos que se desvían de patrones observados previamente, lo que indica incertidumbre o posible manipulación maliciosa. [ 19 ] Esto hace que la predicción conforme sea valiosa para fortalecer las defensas del aprendizaje automático en entornos donde las amenazas evolucionan continuamente.
Conferencias
La predicción conforme es uno de los temas principales que se debaten anualmente en la conferencia COPA. Tanto la teoría como las aplicaciones de las predicciones conformes son presentadas por expertos en la materia. La conferencia se celebra desde 2012. [ 17 ] Ha tenido lugar en varios países europeos, entre ellos Grecia, Gran Bretaña, Italia y Suecia.
Libros
Entre los libros publicados sobre predicción conforme se incluyen Algorithmic Learning in a Random World, [ 20 ] Conformal Prediction for Reliable Machine Learning: Theory, Adaptations and Applications, [ 21 ] Practical Guide to Applied Conformal Prediction in Python: Learn and Apply the Best Uncertainty Frameworks to Your Industry Applications, [ 22 ] Conformal Prediction: A Gentle Introduction (Foundations and Trends in Machine Learning), [ 23 ] y Conformal Prediction for Inventors. [ 24 ]
Véase también
Referencias
- 1 2 Gammerman, Alexander; Vovk, Vladimir; Vapnik, Vladimir (1998). "Aprendizaje por transducción" . Incertidumbre en la inteligencia artificial . 14 : 148–155 .
- ↑ Angelopoulos, Anastasios; Bates, Stephen (2021). "Una introducción sencilla a la predicción conforme y la cuantificación de la incertidumbre sin distribución". arXiv : 2107.07511 [ cs.LG ].
- 1 2 3 Vovk, Vladimir (2022). Aprendizaje algorítmico en un mundo aleatorio . A. Gammerman, Glenn Shafer. Nueva York: Springer. doi : 10.1007/978-3-031-06649-8 . ISBN 978-3-031-06648-1. S2CID 118783209 .
- 1 2 3 Toccaceli, Paolo; Gammerman, Alexander (2019-03-01). "Combinación de predictores conformes inductivos de Mondrian" . Machine Learning . 108 (3): 489– 510. doi : 10.1007/s10994-018-5754-9 . ISSN 1573-0565 .
- ↑ Norinder, Ulf; Carlsson, Lars; Boyer, Scott; Eklund, Martin (23 de junio de 2014). "Introducción de la predicción conforme en el modelado predictivo. Una alternativa transparente y flexible a la determinación del dominio de aplicabilidad" . Journal of Chemical Information and Modeling . 54 (6): 1596–1603 . doi : 10.1021/ci5001168 . ISSN 1549-9596 . PMID 24797111 .
- ↑ Alvarsson, Jonathan; McShane, Staffan Arvidsson; Norinder, Ulf; Spjuth, Ola (2021-01-01). "Predicción con confianza: uso de la predicción conforme en el descubrimiento de fármacos" . Journal of Pharmaceutical Sciences . 110 (1): 42– 49. Bibcode : 2021JPhmS.110...42A . doi : 10.1016/j.xphs.2020.09.055 . ISSN 0022-3549 . PMID 33075380. S2CID 224809705 .
- ↑ Saunders, Craig; Gammerman, Alexander; Vovk, Vladimir (1999). "Transducción con confianza y credibilidad" . Conferencia Internacional Conjunta sobre Inteligencia Artificial . 16 : 722–726 .
- ^ Papadopoulos , Harris; Proedrou, Kostas; Vovk, Volodia; Gammerman, Alex (2002). "Máquinas de confianza inductiva para la regresión". En Elomaa, Tapio; Mannila, Heikki; Toivonen, Hannu (eds.). Aprendizaje automático: ECML 2002 . Apuntes de conferencias sobre informática. vol. 2430. Berlín, Heidelberg: Springer. págs. 345–356 . doi : 10.1007/3-540-36755-1_29 . ISBN 978-3-540-36755-0.
- 1 2 3 Vovk, Vladimir; Shafer, Glenn (2008-08-03). "Un tutorial sobre predicción conforme" (PDF) . Journal of Machine Learning Research . 9 : 371–421 .
- ↑ Papadopoulos, Harris; Haralambous, Haris (2010). "Redes neuronales: predicción inductiva conforme de regresión y su aplicación a la predicción del contenido total de electrones" . En Diamantaras, Konstantinos; Duch, Wlodek; Iliadis, Lazaros S. (eds.). Redes neuronales artificiales – ICANN 2010. Lecture Notes in Computer Science. Vol. 6352. Berlín, Heidelberg: Springer. pp. 32–41 . doi : 10.1007/978-3-642-15819-3_4 . ISBN 978-3-642-15819-3.
- ↑ Papadopoulos, Harris; Vovk, Volodya; Gammerman, Alex (octubre de 2007). «Predicción conforme con redes neuronales». 19.ª Conferencia Internacional IEEE sobre Herramientas con Inteligencia Artificial (ICTAI 2007) . Vol. 2. págs. 388–395 . doi : 10.1109/ICTAI.2007.47 . ISBN 978-0-7695-3015-4. S2CID 10164217 .
- ↑ Lambrou, A.; Papadopoulos, H.; Gammerman, A. (noviembre de 2009). «Predicción conforme evolutiva para el diagnóstico del cáncer de mama». 9.ª Conferencia Internacional de 2009 sobre Tecnologías de la Información y Aplicaciones en Biomedicina . págs. 1-4 . doi : 10.1109/ITAB.2009.5394447 . ISBN 978-1-4244-5379-5. S2CID 15703490 .
- ↑ Lambrou, Antonis; Papadopoulos, Harris; Kyriacou, Efthyvoulos; Pattichis, Constantinos S.; Pattichis, Marios S.; Gammerman, Alexander; Nicolaides, Andrew (2010), "Evaluación del riesgo de accidente cerebrovascular basada en el análisis morfológico de imágenes de ultrasonido con predicción conforme", en Papadopoulos, Harris; Andreou, Andreas S.; Bramer, Max (eds.), Aplicaciones e innovaciones de inteligencia artificial , IFIP Advances in Information and Communication Technology, vol. 339, Berlín, Heidelberg: Springer Berlin Heidelberg, pp. 146–153 , doi : 10.1007/978-3-642-16239-8_21 , ISBN 978-3-642-16238-1, S2CID 17515625
- ↑ Vishwakarma, Rahul (2019). Nueva perspectiva sobre las predicciones de aprendizaje automático bajo incertidumbre (SDC 2019) . SNIA SDC.
- ↑ Vishwakarma, Rahul; Hedayatipour, Ava; Messoudi, Soundouss; Hwang, Jinha (2021). " Enterprise Disk Drive Scrubbing Based on Mondrian Conformal Predictors" . Proceedings of Machine Learning Research . 204. arXiv : 2306.17169 .
- ↑ Vishwakarma, Rahul; Rezaei, Amin (octubre de 2023). «Marco explicable y consciente del riesgo para garantizar una cobertura total en la detección de troyanos de hardware en evolución». Conferencia Internacional IEEE/ACM de 2023 sobre Diseño Asistido por Computadora (ICCAD) . págs. 01–09 . arXiv : 2312.00009 . doi : 10.1109/ICCAD57390.2023.10323655 . ISBN 979-8-3503-2225-5.
- 1 2 "10º Simposio sobre Predicción Conforme y Probabilística con Aplicaciones (COPA 2021)" . cml.rhul.ac.uk. Consultado el 15 de septiembre de 2021 .
- ↑ Luttens, Andreas; Cabeza de Vaca, Israel; Sparring, Leonard; Brea, José; Martínez, Antón Leandro; Kahlous, Nour Aldin; Radchenko, Dmytro S.; Moroz, Yurii S.; Loza, María Isabel; Norinder, Ulf; Carlsson, Jens (2025-03-13). "Rapid traversal of vast chemical space using machine learning-guided docking screens" . Nature Computational Science . 5 (4): 301– 312. doi : 10.1038/s43588-025-00777-x . ISSN 2662-8457 . PMC 12021657 . PMID 40082701 .
- 1 2 Barbero, Francesco; Pendlebury, Fergus; Pierazzi, Fabio; Cavallaro, Lorenzo (2022). "Trascendiendo TRANSCEND: Revisando la clasificación del malware en presencia de la deriva conceptual". Simposio IEEE de 2022 sobre seguridad y privacidad (SP) . págs. 1182–1199 . arXiv : 2010.03856 . doi : 10.1109/SP46214.2022.9833659 . ISBN 978-1-6654-1316-9.
- ↑ Vovk, Vladimir; Gammerman, Alexander; Shafer, Glenn (2022). Aprendizaje algorítmico en un mundo aleatorio . Vol. 29. Springer. doi : 10.1007/978-3-031-06649-8 . ISBN 978-3-031-06648-1.
- ↑ Balasubramanian, Vineeth (2014). Ho, Shen-Shyang; Vovk, Vladimir (eds.). Predicción conforme para un aprendizaje automático fiable: teoría, adaptaciones y aplicaciones . Newnes. ISBN 978-0-12-398537-8.
- ↑ Manokhin, Valery (2023). Guía práctica para la predicción conforme aplicada en Python: aprenda y aplique los mejores marcos de incertidumbre a sus aplicaciones industriales . Reino Unido: Packt Publishing. ISBN 9781805120919.
- ↑ Angelopoulos, Anastasios N.; Bates, Stephen (2023). "Predicción conforme: una introducción sencilla" . Foundations and Trends in Machine Learning . 16 (4): 494– 591. doi : 10.1561/2200000101 .
- ↑ Vishwakarma, Rahul (24 de agosto de 2024). Predicción conforme para inventores . Yimo. ISBN 978-9334114898.
- estadística computacional