En el aprendizaje automático , un clasificador probabilístico es un clasificador capaz de predecir, a partir de una observación de una entrada, una distribución de probabilidad sobre un conjunto de clases, en lugar de simplemente generar la clase más probable a la que debería pertenecer la observación. Los clasificadores probabilísticos proporcionan una clasificación que puede ser útil por sí misma [ 1 ] o al combinar clasificadores en conjuntos .
Tipos de clasificación
Formalmente, un clasificador "ordinario" es alguna regla o función que asigna a una muestra x una etiqueta de clase ŷ :
Las muestras provienen de un conjunto X (por ejemplo, el conjunto de todos los documentos o el conjunto de todas las imágenes ), mientras que las etiquetas de clase forman un conjunto finito Y definido antes del entrenamiento.
Los clasificadores probabilísticos generalizan esta noción de clasificadores: en lugar de funciones, son distribuciones condicionales ., lo que significa que para un dado, asignan probabilidades a todos(y estas probabilidades suman uno). La clasificación "difícil" se puede realizar entonces utilizando la regla de decisión óptima [ 2 ] : 39–40
o, en español, la clase predicha es aquella que tiene la mayor probabilidad.
En estadística, los clasificadores probabilísticos binarios también se denominan modelos de regresión binaria . En econometría , la clasificación probabilística en general se denomina elección discreta .
Algunos modelos de clasificación, como el clasificador bayesiano ingenuo , la regresión logística y los perceptrones multicapa (cuando se entrenan con una función de pérdida adecuada ), son inherentemente probabilísticos. Otros modelos, como las máquinas de vectores de soporte, no lo son, pero existen métodos para convertirlos en clasificadores probabilísticos.
Entrenamiento generativo y condicional
Algunos modelos, como la regresión logística , se entrenan condicionalmente: optimizan la probabilidad condicional.directamente en un conjunto de entrenamiento (véase minimización del riesgo empírico ). Otros clasificadores, como Naive Bayes , se entrenan de forma generativa : en el momento del entrenamiento, la distribución condicional de la clasey la clase anteriorse encuentran y la distribución condicionalse deriva utilizando la regla de Bayes . [ 2 ] : 43
Calibración de probabilidad
Not all classification models are naturally probabilistic, and some that are, notably naive Bayes classifiers, decision trees and boosting methods, produce distorted class probability distributions.[3] In the case of decision trees, where Pr(y|x) is the proportion of training samples with label y in the leaf where x ends up, these distortions come about because learning algorithms such as C4.5 or CART explicitly aim to produce homogeneous leaves (giving probabilities close to zero or one, and thus high bias) while using few samples to estimate the relevant proportion (high variance).[4]

Calibration can be assessed using a calibration plot (also called a reliability diagram).[3][5] A calibration plot shows the proportion of items in each class for bands of predicted probability or score (such as a distorted probability distribution or the "signed distance to the hyperplane" in a support vector machine). Deviations from the identity function indicate a poorly-calibrated classifier for which the predicted probabilities or scores can not be used as probabilities. In this case one can use a method to turn these scores into properly calibrated class membership probabilities.
For the binary case, a common approach is to apply Platt scaling, which learns a logistic regression model on the scores.[6] An alternative method using isotonic regression[7] is generally superior to Platt's method when sufficient training data is available.[3]
In the multiclass case, one can use a reduction to binary tasks, followed by univariate calibration with an algorithm as described above and further application of the pairwise coupling algorithm by Hastie and Tibshirani.[8]
Evaluating probabilistic classification

Un método utilizado para asignar puntuaciones a pares de probabilidades predichas y resultados discretos reales, de modo que se puedan comparar diferentes métodos predictivos, se denomina regla de puntuación . Las reglas de puntuación se utilizan para comparar la probabilidad predicha con los resultados observados; entre ellas se incluyen, por ejemplo, la pérdida logarítmica , la puntuación de Brier , la puntuación de probabilidad clasificada continua y otras.
Ciertos aspectos como la precisión, la calibración, la nitidez o la dispersión pueden variar de un clasificador probabilístico a otro y pueden ser objeto de una investigación específica.
Las métricas de errores de calibración buscan cuantificar el grado de calibración de las salidas de un clasificador probabilístico . Como lo expresó Philip Dawid , "un pronosticador está bien calibrado si, por ejemplo, de los eventos a los que asigna una probabilidad del 30 por ciento, la proporción a largo plazo que realmente ocurre resulta ser del 30 por ciento". [ 9 ] El trabajo fundamental en el ámbito de la medición del error de calibración es la métrica de Error de Calibración Esperado (ECE). [ 10 ] Trabajos más recientes proponen variantes de ECE que abordan las limitaciones de la métrica ECE que pueden surgir cuando las puntuaciones del clasificador se concentran en un subconjunto estrecho del intervalo [0,1], incluyendo el Error de Calibración Adaptativo (ACE) [ 11 ] y el Error de Calibración Basado en Pruebas (TCE). [ 12 ]
Implementaciones de software
- MoRPE [ 13 ] es un clasificador probabilístico entrenable que utiliza regresión isotónica para la calibración de probabilidad. Resuelve el caso multiclase mediante la reducción a tareas binarias. Es un tipo de máquina de núcleo que utiliza un núcleo polinómico no homogéneo.
Referencias
- ↑ Hastie, Trevor; Tibshirani, Robert; Friedman, Jerome (2009). Los elementos del aprendizaje estadístico . pág. 348. Archivado del original el 26/01/2015.
[E]n las aplicaciones de minería de datos el interés suele estar más en las probabilidades de clase.ellos mismos, en lugar de realizar una tarea de clase.
- 1 2 Bishop, Christopher M. (2006). Reconocimiento de patrones y aprendizaje automático (PDF) . Springer. ISBN 978-0387-31073-2.
- 1 2 3 Niculescu-Mizil, Alexandru; Caruana, Rich (2005). Predicción de buenas probabilidades con aprendizaje supervisado (PDF) . ICML. doi : 10.1145/1102351.1102430 . Archivado del original (PDF) el 11 de marzo de 2014.
- ↑ Zadrozny, Bianca; Elkan, Charles (2001). Obtención de estimaciones de probabilidad calibradas a partir de árboles de decisión y clasificadores bayesianos ingenuos (PDF) . ICML. págs. 609–616 .
- ↑ "Calibración de probabilidad" . jmetzen.github.io . Consultado el 18 de junio de 2019 .
- ↑ Platt, John (1999). "Resultados probabilísticos para máquinas de vectores de soporte y comparaciones con métodos de verosimilitud regularizada" . Advances in Large Margin Classifiers . 10 (3): 61– 74.
- ↑ Zadrozny, Bianca; Elkan, Charles (2002). "Transformación de puntuaciones de clasificadores en estimaciones precisas de probabilidad multiclase" (PDF) . Actas de la octava conferencia internacional ACM SIGKDD sobre descubrimiento de conocimiento y minería de datos - KDD '02 . págs. 694–699 . CiteSeerX 10.1.1.164.8140 . doi : 10.1145/775047.775151 . ISBN 978-1-58113-567-1. S2CID 3349576 . CiteSeerX : 10.1.1.13.7457 .
- ^ Hastie, Trevor; Tibshirani, Robert (1998). "Clasificación por acoplamiento por pares". Los anales de la estadística . 26 (2): 451– 471. CiteSeerX 10.1.1.309.4720 . doi : 10.1214/aos/1028144844 . Zbl 0932.62071 . CiteSeerX : 10.1.1.46.6032 .
- ↑ Dawid, A. P (1982). "El bayesiano bien calibrado". Journal of the American Statistical Association . 77 (379): 605– 610. doi : 10.1080/01621459.1982.10477856 .
- ↑ Naeini, MP; Cooper, G.; Hauskrecht, M. (2015). "Obtención de probabilidades bien calibradas mediante agrupamiento bayesiano" (PDF) . Actas de la Conferencia AAAI sobre Inteligencia Artificial .
- ↑ Nixon, J.; Dusenberry, MW; Zhang, L.; Jerfel, G.; Tran, D. (2019). "Medición de la calibración en el aprendizaje profundo" (PDF) . Talleres CVPR .
- ↑ Matsubara, T.; Tax, N.; Mudd, R.; Guy, I. (2023). "TCE: Un enfoque basado en pruebas para medir el error de calibración". Actas de la Trigésimo Novena Conferencia sobre Incertidumbre en Inteligencia Artificial (UAI) . arXiv : 2306.14343 .
- ↑"MoRPE". GitHub. Retrieved 17 February 2023.
- Probabilistic models
- Statistical classification