
In classification, precision and recall are performance metrics that apply to data retrieved from a collection, corpus or sample space.
Precision (also called positive predictive value) is the fraction of relevant instances among the retrieved instances. Written as a formula:
Recall (also known as sensitivity) is the fraction of relevant instances that were retrieved. Written as a formula:
Both precision and recall are therefore based on relevance.
Consider a computer program for recognizing dogs (the relevant element) in a digital photograph. Upon processing a picture which contains ten cats and twelve dogs, the program identifies eight dogs. Of the eight elements identified as dogs, only five actually are dogs (true positives), while the other three are cats (false positives). Seven dogs were missed (false negatives), and seven cats were correctly excluded (true negatives). The program's precision is then 5/8 (true positives / selected elements) while its recall is 5/12 (true positives / relevant elements).
Adopting a hypothesis-testing approach, where in this case, the null hypothesis is that a given item is irrelevant (not a dog), absence of type I and type II errors (perfect specificity and sensitivity) corresponds respectively to perfect precision (no false positives) and perfect recall (no false negatives).
More generally, recall is simply the complement of the type II error rate (i.e., one minus the type II error rate). Precision is related to the type I error rate, but in a slightly more complicated way, as it also depends upon the prior distribution of seeing a relevant vs. an irrelevant item.
The above cat and dog example contained 8 − 5 = 3 type I errors (false positives) out of 10 total cats (true negatives), for a type I error rate of 3/10, and 12 − 5 = 7 type II errors (false negatives), for a type II error rate of 7/12. Precision can be seen as a measure of quality, and recall as a measure of quantity. Higher precision means that an algorithm returns more relevant results than irrelevant ones, and high recall means that an algorithm returns most of the relevant results (whether or not irrelevant ones are also returned).
Introduction

En una tarea de clasificación , la precisión de una clase se define como el número de verdaderos positivos (es decir, el número de elementos correctamente etiquetados como pertenecientes a la clase positiva) dividido por el número total de elementos etiquetados como pertenecientes a la clase positiva (es decir, la suma de verdaderos positivos y falsos positivos , que son elementos etiquetados incorrectamente como pertenecientes a la clase). La exhaustividad, en este contexto, se define como el número de verdaderos positivos dividido por el número total de elementos que realmente pertenecen a la clase positiva (es decir, la suma de verdaderos positivos y falsos negativos , que son elementos que no fueron etiquetados como pertenecientes a la clase positiva, pero deberían haberlo sido).
La precisión y la exhaustividad no son métricas particularmente útiles cuando se utilizan de forma aislada. Por ejemplo, es posible lograr una exhaustividad perfecta recuperando todos y cada uno de los elementos. Del mismo modo, es posible alcanzar una precisión perfecta seleccionando solo un número muy reducido de elementos extremadamente probables.
En una tarea de clasificación, una puntuación de precisión de 1,0 para la clase C significa que cada elemento etiquetado como perteneciente a la clase C pertenece realmente a la clase C (pero no dice nada sobre la cantidad de elementos de la clase C que no fueron etiquetados correctamente), mientras que una exhaustividad de 1,0 significa que cada elemento de la clase C fue etiquetado como perteneciente a la clase C (pero no dice nada sobre cuántos elementos de otras clases también fueron etiquetados incorrectamente como pertenecientes a la clase C).
A menudo, existe una relación inversa entre precisión y exhaustividad, donde es posible aumentar una a costa de reducir la otra, pero el contexto puede determinar si una es más valiosa que la otra en una situación dada:
Un detector de humo generalmente está diseñado para cometer muchos errores de tipo I (alertar en muchas situaciones donde no hay peligro), porque el costo de un error de tipo II (no activar la alarma durante un incendio importante) es prohibitivo. Por lo tanto, los detectores de humo se diseñan pensando en la memoria (para detectar todo peligro real), incluso restando importancia a las pérdidas de precisión (y generando muchas falsas alarmas). En sentido contrario, la proporción de Blackstone , "Es mejor que diez culpables escapen a que un inocente sufra", enfatiza los costos de un error de tipo I (condenar a una persona inocente). Por consiguiente, el sistema de justicia penal está orientado a la precisión (no a condenar a inocentes), incluso a costa de pérdidas de memoria (dejar en libertad a más culpables).
Un neurocirujano que extirpa un tumor canceroso del cerebro de un paciente también ilustra las ventajas y desventajas: el cirujano debe extirpar todas las células tumorales, ya que cualquier célula cancerosa restante regenerará el tumor. Por otro lado, el cirujano no debe extirpar células cerebrales sanas, ya que esto dejaría al paciente con una función cerebral deteriorada. El cirujano puede ser más permisivo en la zona del cerebro que extirpa para asegurarse de haber extraído todas las células cancerosas. Esta decisión aumenta la exhaustividad, pero reduce la precisión. En cambio, el cirujano puede ser más conservador en las células cerebrales que extirpa para asegurarse de extraer solo células cancerosas. Esta decisión aumenta la precisión, pero reduce la exhaustividad. Es decir, una mayor exhaustividad aumenta las probabilidades de extirpar células sanas (resultado negativo) y aumenta las probabilidades de extirpar todas las células cancerosas (resultado positivo). Una mayor precisión disminuye las probabilidades de extirpar células sanas (resultado positivo), pero también disminuye las probabilidades de extirpar todas las células cancerosas (resultado negativo).
Por lo general, las puntuaciones de precisión y exhaustividad no se analizan de forma aislada. Una curva de precisión-exhaustividad representa la precisión en función de la exhaustividad; normalmente, la precisión disminuye a medida que aumenta la exhaustividad. Alternativamente, se pueden comparar los valores de una medida para un nivel fijo en la otra medida (por ejemplo, precisión a un nivel de exhaustividad de 0,75 ) o se pueden combinar ambas en una sola medida. Ejemplos de medidas que son una combinación de precisión y exhaustividad son la medida F (la media armónica ponderada de precisión y exhaustividad), o el coeficiente de correlación de Matthews , que es una media geométrica de las variantes corregidas por azar: los coeficientes de regresión de Informedness (DeltaP') y Markedness (DeltaP). [ 1 ] [ 2 ] La exactitud es una media aritmética ponderada de Precisión y Precisión Inversa (ponderada por Sesgo) así como una media aritmética ponderada de Exhaustividad y Exhaustividad Inversa (ponderada por Prevalencia). [ 1 ] La precisión inversa y la exhaustividad inversa son simplemente la precisión y la exhaustividad del problema inverso donde se intercambian etiquetas positivas y negativas (tanto para clases reales como para etiquetas de predicción). La tasa de verdaderos positivos y la tasa de falsos positivos , o equivalentemente la exhaustividad y 1 - exhaustividad inversa, se grafican frecuentemente una contra la otra como curvas ROC y proporcionan un mecanismo basado en principios para explorar las compensaciones del punto de operación. Fuera de la recuperación de información, se argumenta que la aplicación de la exhaustividad, la precisión y la medida F es defectuosa, ya que ignoran la celda de verdaderos negativos de la tabla de contingencia y se manipulan fácilmente sesgando las predicciones. [ 1 ] El primer problema se "resuelve" utilizando la exactitud y el segundo problema se "resuelve" descontando el componente de azar y renormalizando al kappa de Cohen , pero esto ya no ofrece la oportunidad de explorar las compensaciones gráficamente. Sin embargo, Informedness y Markedness son renormalizaciones tipo Kappa de Recall y Precision, [ 3 ] y su coeficiente de correlación de Matthews de media geométrica actúa como una medida F dessesgada.
Definición
En las tareas de clasificación, los términos verdaderos positivos , verdaderos negativos , falsos positivos y falsos negativos comparan los resultados del clasificador bajo prueba con juicios externos confiables. Los términos positivo y negativo se refieren a la predicción del clasificador (a veces conocida como expectativa ), y los términos verdadero y falso se refieren a si esa predicción se corresponde con el juicio externo (a veces conocido como observación ).
Definamos un experimento a partir de P casos positivos y N casos negativos para alguna condición. Los cuatro resultados se pueden formular en una tabla de contingencia de 2×2 o matriz de confusión , como sigue:
- ↑ el número de casos positivos reales en los datos
- ↑ Un resultado de prueba que indica correctamente la presencia de una condición o característica.
- ↑ Error de tipo II: Un resultado de prueba que indica erróneamente que una condición o atributo particular está ausente.
- ↑ el número de casos negativos reales en los datos
- ↑ Un resultado de prueba que indica correctamente la ausencia de una condición o característica.
- ↑ Error de tipo I: Un resultado de prueba que indica erróneamente que una condición o atributo particular está presente.
La precisión y la exhaustividad se definen entonces como: [ 12 ]
En este contexto, la exhaustividad también se denomina tasa de verdaderos positivos o sensibilidad , y la precisión también se denomina valor predictivo positivo (VPP); otras medidas relacionadas utilizadas en la clasificación incluyen la tasa de verdaderos negativos y la exactitud . [ 12 ] La tasa de verdaderos negativos también se denomina especificidad .
Precisión frente a exhaustividad
Tanto la precisión como la exhaustividad pueden ser útiles en casos donde existen datos desequilibrados. Sin embargo, puede ser valioso priorizar una métrica sobre la otra cuando el resultado de un falso positivo o un falso negativo es costoso. Por ejemplo, en el diagnóstico médico, una prueba con falso positivo puede llevar a tratamientos y gastos innecesarios. En esta situación, es útil valorar la precisión sobre la exhaustividad. En otros casos, el costo de un falso negativo es alto, y la exhaustividad puede ser una métrica más valiosa. Por ejemplo, el costo de un falso negativo en la detección de fraude es alto, ya que no detectar una transacción fraudulenta puede resultar en una pérdida financiera significativa. [ 13 ]
Definición probabilística
La precisión y la exhaustividad pueden interpretarse como probabilidades condicionales (estimadas) : [ 14 ] La precisión viene dada pormientras que el recuerdo viene dado por, [ 15 ] dondees la clase predicha yes la clase real (es decir,significa que la clase real es positiva). Ambas cantidades están, por lo tanto, conectadas por el teorema de Bayes .
Clasificadores sin habilidades
La interpretación probabilística permite derivar fácilmente cómo se desempeñaría un clasificador sin habilidades. Un clasificador sin habilidades se define por la propiedad de que la probabilidad conjuntaes simplemente el producto de las probabilidades incondicionales ya que la clasificación y la presencia de la clase son independientes .
Por ejemplo, la precisión de un clasificador sin habilidades es simplemente una constante.es decir, determinado por la probabilidad/frecuencia con la que ocurre la clase P.
Se puede esgrimir un argumento similar para la retirada: que es la probabilidad de una clasificación positiva.
Precisión, datos desequilibrados y precisión equilibrada
La precisión se puede expresar como el promedio ponderado de qué tan bien un clasificador identifica los casos positivos y los casos negativos, ponderado por la prevalencia base de la condición (Esta formulación se basa en la sensibilidad (la tasa de verdaderos positivos) y la especificidad (la tasa de verdaderos negativos):
En la terminología del aprendizaje automático, la sensibilidad es equivalente a la recuperación de la clase positiva (a menudo denominada), mientras que la especificidad es equivalente al recuerdo de la clase negativa (a menudo denominada). Debido a que esta ecuación escala las tasas de verdaderos positivos y verdaderos negativos directamente por el número real de casos positivos y negativos disponibles en el conjunto de datos, permanece matemáticamente estrictamente acotada en todos los niveles de prevalencia. [ 16 ]
Alternativamente, la exactitud puede expresarse como dependiente de la precisión (), recordar (, es decir,), y prevalencia (Al expresar la precisión como 1 menos la tasa de error total, la precisión de un clasificador viene dada por:
Para derivar esta fórmula, comenzamos con las definiciones estándar de la matriz de confusión . Searepresentan la población total del conjunto de datos.
Las métricas fundamentales se definen como:
- Prevalencia ():
- Recordar ():
- Precisión ():
Paso 1: Expresar la precisión mediante la tasa de error. La precisión es la proporción total de predicciones correctas. De forma equivalente, es 1 menos la tasa de error total:
Paso 2: Expresar los falsos negativos (FN) usando la recuperación A partir de la definición de recuperación, podemos expresar los verdaderos positivos () y falsos negativos () como fracciones del total de casos positivos reales ():
Paso 3: Expresar los falsos positivos (FP) usando precisión y exhaustividad A partir de la definición de precisión, resolvemos algebraicamente para: Sustituya la expresión pordel paso 2 a esta ecuación:
Paso 4: Combinar los errores Agregar las expresiones parayjuntos para obtener el número total de errores: Excluir los casos positivos reales ():
Paso 5: Dividir por la población total (N) Para hallar la tasa de error general, divida ambos lados de la ecuación por: Porque la prevalencia se define como, podemos sustituiren la ecuación:
Paso 6: Finalizar la ecuación de precisión Sustituya esta tasa de error total en la fórmula de precisión del Paso 1:
En esta forma, la ecuación aísla cómo la precisión se ve penalizada por dos errores distintos escalados por la prevalencia: la tasa a la que se omiten los casos positivos (), y la tasa de falsos positivos colaterales generados al detectarlos (Esta relación explícita resalta cómo los cambios en la precisión y la exhaustividad impactan la exactitud general de manera desproporcionada dependiendo de la prevalencia subyacente en un conjunto de datos desequilibrado.
Sin embargo, dado que la prevalencia, la precisión y la exhaustividad no son variables independientes, esta fórmula está estrictamente limitada por un límite matemático. El número de falsos positivos implícito matemáticamente no puede exceder el número total de casos negativos reales en el conjunto de datos. Por lo tanto, la fórmula de precisión anterior solo es válida sujeta a la siguiente restricción sobre la precisión mínima: [ 17 ]
Debido a lo anterior, la precisión puede ser una métrica limitada o engañosa al comparar conjuntos de datos con diferente prevalencia base (es decir, conjuntos de datos con diferente desequilibrio). Por ejemplo, un método con un 90 % de precisión y un 50 % de exhaustividad daría como resultado una precisión del 83 % o del 50 %, dependiendo de si la prevalencia en el conjunto de datos es del 30 % o del 90 %. Asimismo, si una muestra tiene 95 valores negativos y 5 positivos, clasificar todos los valores como negativos (100 % de exhaustividad y 0 % de precisión) daría una precisión de 0,95.
Hay muchas métricas que no sufren este problema. Por ejemplo, la precisión equilibrada [ 18 ] (bACC) normaliza las predicciones de verdaderos positivos y verdaderos negativos por el número de muestras positivas y negativas, respectivamente, y divide su suma por dos:
En el ejemplo anterior (95 muestras negativas y 5 positivas), clasificar todas como negativas da como resultado una puntuación de precisión equilibrada de 0,5 (la puntuación máxima de bACC es uno), lo que equivale al valor esperado de una suposición aleatoria en un conjunto de datos equilibrado. La precisión equilibrada puede servir como métrica de rendimiento general para un modelo, independientemente de si las etiquetas reales están desequilibradas en los datos, suponiendo que el coste de los falsos negativos sea el mismo que el de los falsos positivos.
La precisión equilibrada es una combinación lineal del estadístico J de Youden .)
El TPR y el FPR son propiedades de un clasificador dado que opera en un umbral específico. Sin embargo, el número total de TP, FP, etc., depende del desequilibrio de clases en los datos a través de la proporción de clases.Como el recuerdo (o TPR) depende solo de los casos positivos, no se ve afectado por, pero la precisión es. Tenemos eso
Por lo tanto, la precisión tiene una dependencia explícita de. [ 19 ] Comenzando con clases equilibradas eny disminuyendo gradualmente, la precisión correspondiente disminuirá, porque el denominador aumenta.
Otra métrica es la tasa de predicción de condición positiva (PPCR, por sus siglas en inglés), que identifica el porcentaje de la población total que se marca como problemática. Por ejemplo, para un motor de búsqueda que devuelve 30 resultados (documentos recuperados) de un total de 1.000.000 de documentos, la PPCR es del 0,003 %.
Según Saito y Rehmsmeier, los gráficos de precisión-exhaustividad son más informativos que los gráficos ROC al evaluar clasificadores binarios en datos desequilibrados. En tales escenarios, los gráficos ROC pueden ser visualmente engañosos con respecto a las conclusiones sobre la fiabilidad del rendimiento de la clasificación. [ 20 ] [ 21 ]
A diferencia de los enfoques anteriores, si se aplica un escalado de desequilibrio directamente ponderando los elementos de la matriz de confusión, las definiciones de métricas estándar siguen siendo válidas incluso en el caso de conjuntos de datos desequilibrados. [ 22 ] El procedimiento de ponderación relaciona los elementos de la matriz de confusión con el conjunto de soporte de cada clase considerada.
Medida F
Una medida que combina precisión y exhaustividad es la media armónica de precisión y exhaustividad, la medida F tradicional o puntuación F equilibrada:
Esta medida es aproximadamente el promedio de los dos cuando están cerca, y es más generalmente la media armónica , que, para el caso de dos números, coincide con el cuadrado de la media geométrica dividido por la media aritmética . Hay varias razones por las que la puntuación F puede ser criticada, en circunstancias particulares, debido a su sesgo como métrica de evaluación. [ 1 ] Esto también se conoce como lamedida, porque la exhaustividad y la precisión tienen el mismo peso.
Es un caso especial del generalmedida (para valores reales no negativos de ):
Otros dos comúnmente utilizadoslas medidas son lasmedida, que pondera la recuperación más que la precisión, y lamedida que pone mayor énfasis en la precisión que en la exhaustividad.
La medida F fue derivada por van Rijsbergen (1979) de modo que"mide la efectividad de la recuperación con respecto a un usuario que adjunta"Tanta importancia para recordar como para la precisión". Se basa en la medida de efectividad de van Rijsbergen., siendo el segundo término la media armónica ponderada de precisión y exhaustividad con ponderacionesSu relación esdónde.
Limitaciones como objetivos
Existen otros parámetros y estrategias para la métrica de rendimiento de los sistemas de recuperación de información, como el área bajo la curva ROC (AUC) [ 23 ] o el pseudo-R cuadrado .
Evaluación multiclase
También se pueden calcular valores de precisión y exhaustividad para problemas de clasificación con más de dos clases. [ 24 ] Para obtener la precisión de una clase determinada, dividimos el número de verdaderos positivos entre el sesgo del clasificador hacia esa clase (número de veces que el clasificador ha predicho la clase). Para calcular la exhaustividad de una clase determinada, dividimos el número de verdaderos positivos entre la prevalencia de esa clase (número de veces que la clase aparece en la muestra de datos).
Los valores de precisión y exhaustividad por clase se pueden combinar en una puntuación de evaluación multiclase general, por ejemplo, utilizando la métrica macro F1 . [ 24 ]
Generalización a distribuciones continuas
Las definiciones clásicas de precisión, exhaustividad y puntuación F se formulan para la clasificación binaria , donde cada instancia es verdadera o falsa. Sin embargo, muchos ámbitos prácticos producen señales inherentemente continuas en lugar de etiquetas discretas. Generalizar estas métricas a distribuciones continuas permite su aplicación directa a dichos datos sin la pérdida de información introducida por el umbral. [ 25 ]
Dos ejemplos ilustrativos muestran las limitaciones de los marcos binarios:
- Finanzas cuantitativas. Un modelo puede generar una señal continua de compra/venta proporcional a su convicción para cada activo en un momento dado. Aplicar un umbral fijo (por ejemplo, señal > 0,1 = compra) descarta la magnitud de la convicción y confunde las señales fuertes con las débiles, lo que limita la capacidad del modelo para distinguir correctamente una compra fuerte de una débil.
- Análisis de metilación del ADN. Las herramientas de secuenciación detectan regiones diferencialmente metiladas cuya señal subyacente es continua, generalmente con valores entre -1 y +1. Forzar esto a un marco binario introduce distorsiones similares al tratar todas las desviaciones positivas como equivalentes, independientemente de su magnitud.
Definiciones
Dejardenotan la señal esperada (verdad fundamental) yla señal observada (predicha) en cada punto de datos. A continuación, la precisión, la exhaustividad y la puntuación F se pueden calcular de la siguiente manera:
Tenga en cuenta que las sumas pueden reemplazarse por integrales para distribuciones continuas que dependen de otras variables continuas (es decir,,,).
Estas definiciones se reducen a las versiones binarias clásicas cuandoSin embargo, las métricas continuas revelan una elegancia matemática más profunda. Consideremos un modelo de aprendizaje automático completamente erróneo con una señal aleatoria. Las métricas binarias tradicionales, que no tienen en cuenta la magnitud ni el signo, aún pueden otorgarle a dicho modelo una precisión, exhaustividad y/o puntuación F positivas (incluso del 25 % o más para señales densas). Las fórmulas continuas, por el contrario, devuelven exactamente 0 para la precisión, la exhaustividad y la puntuación F en esta situación, porque cuando las señales esperadas y observadas no se correlacionan, los términos del numerador se cancelan y dan como resultado cero.
Véase también
Referencias
- 1 2 3 4 Powers, David MW (2011). "Evaluación: De la precisión, la exhaustividad y la medida F a la curva ROC, la información, la marcación y la correlación" (PDF) . Journal of Machine Learning Technologies . 2 (1): 37– 63. Archivado del original (PDF) el 14 de noviembre de 2019.
- ↑ Perruchet, P.; Peereman, R. (2004). "La explotación de la información distribucional en el procesamiento de sílabas" (PDF) . J. Neurolinguistics . 17 ( 2–3 ): 97–119 . doi : 10.1016/s0911-6044(03)00059-9 . S2CID 17104364 .
- ↑ Powers, David MW (2012). "El problema con Kappa" . Conferencia del Capítulo Europeo de la Asociación de Lingüística Computacional (EACL2012) Taller conjunto ROBUS-UNSUP .
- ↑ Fawcett, Tom (2006). "Una introducción al análisis ROC" (PDF) . Pattern Recognition Letters . 27 (8): 861– 874. doi : 10.1016/j.patrec.2005.10.010 . S2CID 2027090 .
- ↑ Provost, Foster; Tom Fawcett (1 de agosto de 2013). "Ciencia de datos para los negocios: lo que necesita saber sobre minería de datos y pensamiento analítico de datos" . O'Reilly Media, Inc.
- ↑ Powers, David MW (2011). "Evaluación: De la precisión, la exhaustividad y la medida F a la curva ROC, la información, la marcación y la correlación" . Journal of Machine Learning Technologies . 2 (1): 37– 63.
- ↑ Ting, Kai Ming (2011). Sammut, Claude; Webb, Geoffrey I. (eds.). Enciclopedia del aprendizaje automático . Springer. doi : 10.1007/978-0-387-30164-8 . ISBN 978-0-387-30164-8.
- ↑ Brooks, Harold; Brown, Barb; Ebert, Beth; Ferro, Chris; Jolliffe, Ian; Koh, Tieh-Yong; Roebber, Paul; Stephenson, David (26 de enero de 2015). "Grupo de trabajo conjunto WWRP/WGNE sobre investigación de verificación de pronósticos" . Colaboración para la investigación meteorológica y climática australiana . Organización Meteorológica Mundial . Consultado el 17 de julio de 2019 .
- ↑ Chicco D, Jurman G (enero de 2020). "Las ventajas del coeficiente de correlación de Matthews (MCC) sobre la puntuación F1 y la precisión en la evaluación de la clasificación binaria" . BMC Genomics . 21 (1): 6-1–6-13. doi : 10.1186/s12864-019-6413-7 . PMC 6941312. PMID 31898477 .
- ↑ Chicco D, Toetsch N, Jurman G (febrero de 2021). "El coeficiente de correlación de Matthews (MCC) es más fiable que la precisión equilibrada, la información del corredor de apuestas y la marcación en la evaluación de matrices de confusión de dos clases" . BioData Mining . 14 (13): 13. doi : 10.1186/s13040-021-00244-z . PMC 7863449. PMID 33541410 .
- ↑ Tharwat A. (agosto de 2018). "Métodos de evaluación de clasificación" . Applied Computing and Informatics . 17 : 168–192 . doi : 10.1016/j.aci.2018.08.003 .
- 1 2 Olson, David L.; y Delen, Dursun (2008); Técnicas avanzadas de minería de datos , Springer, 1.ª edición (1 de febrero de 2008), página 138, ISBN 3-540-76916-1
- ↑ "Precisión vs. Exhaustividad: Diferencias, Casos de Uso y Evaluación" .
- ↑ Fatih Cakir, Kun He, Xide Xia, Brian Kulis, Stan Sclaroff, Aprendizaje métrico profundo para la clasificación , En Actas de la Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones (CVPR), 2019.
- ↑ Roelleke, Thomas (31 de mayo de 2022). Modelos de recuperación de información: fundamentos y relaciones . Springer Nature. ISBN 978-3-031-02328-6.
- ↑ Newman, Thomas B.; Kohn, Michael A. (2009). "2: Pruebas dicotómicas". Diagnóstico basado en la evidencia . Cambridge University Press. ISBN 978-0521875950
La precisión se puede expresar como el promedio ponderado de la sensibilidad y la especificidad en función de la prevalencia de la afección: Precisión = (Prevalencia × Sensibilidad) + ((1 - Prevalencia) × Especificidad)
. - ↑ Williams, Christopher KI (2021-04-01). "El efecto del desequilibrio de clases en las curvas de precisión-exhaustividad". Neural Computation . 33 (4): 853– 857. arXiv : 2007.01905 . doi : 10.1162/neco_a_01362 .
La ecuación 2 demuestra que Precisión = TPR / (TPR + (1/r)FPR). Dado que la tasa máxima de falsos positivos (FPR) es 1, y la relación de desequilibrio de clases r = Prevalencia / (1 - Prevalencia), esto establece un límite inferior estricto para la precisión dada una prevalencia y exhaustividad específicas.
- ↑ Mower, Jeffrey P. (12 de abril de 2005). "PREP-Mt: editor predictivo de ARN para genes mitocondriales de plantas" . BMC Bioinformatics . 6 : 96. doi : 10.1186/1471-2105-6-96 . ISSN 1471-2105 . PMC 1087475. PMID 15826309 .
- ↑ Williams, Christopher KI (2021-04-01). "El efecto del desequilibrio de clases en las curvas de precisión-exhaustividad". Neural Computation . 33 (4): 853– 857. arXiv : 2007.01905 . doi : 10.1162/neco_a_01362 . hdl : 20.500.11820/8a709831-cbfe-4c8e-a65b-aee5429e5b9b . ISSN 0899-7667 .
- ↑ Saito, Takaya; Rehmsmeier, Marc (2015-03-04). Brock, Guy (ed.). "El gráfico de precisión-exhaustividad es más informativo que el gráfico ROC al evaluar clasificadores binarios en conjuntos de datos desequilibrados" . PLOS ONE . 10 (3) e0118432. Bibcode : 2015PLoSO..1018432S . doi : 10.1371/journal.pone.0118432 . ISSN 1932-6203 . PMC 4349800. PMID 25738806 .
- ↑ Suzanne Ekelund (marzo de 2017). "Curvas de precisión-exhaustividad: ¿qué son y cómo se utilizan?" . Pruebas de cuidados intensivos .
- ↑ Tripicchio, Paolo; Camacho-Gonzalez, Gerardo; D'Avella, Salvatore (2020). "Detección de defectos de soldadura: cómo lidiar con artefactos en la línea de producción" . The International Journal of Advanced Manufacturing Technology . 111 (5): 1659– 1669. doi : 10.1007/s00170-020-06146-4 . S2CID 225136860 .
- ↑ Zając, Zygmunt (19 de septiembre de 2013). "Lo que querías saber sobre AUC" . FastML .
- 1 2 Opitz, Juri (2024). "Una mirada más cercana a las métricas de evaluación de clasificación y una reflexión crítica sobre la práctica de evaluación común". Transactions of the Association for Computational Linguistics . 12 : 820– 836. arXiv : 2404.16958 . doi : 10.1162/tacl_a_00675 .
- ↑ Solicitud de patente PCT WO 2026/096670.
- Baeza-Yates, Ricardo; Ribeiro-Neto, Berthier (1999). Recuperación de información moderna . Nueva York, NY: ACM Press, Addison-Wesley, páginas 75 y sigs. ISBN 0-201-39829-X
- Hjørland, Birger (2010); Los fundamentos del concepto de relevancia , Journal of the American Society for Information Science and Technology, 61(2), 217–237
- Makhoul, John ; Kubala, Francis; Schwartz, Richard; y Weischedel, Ralph (1999); Medidas de rendimiento para la extracción de información , en Actas del Taller de Noticias de Radiodifusión de DARPA, Herndon, VA, febrero de 1999.
- van Rijsbergen, Cornelis Joost "Keith" (1979); Recuperación de información , Londres, GB; Boston, MA: Butterworth, segunda edición, ISBN 0-408-70929-4
Enlaces externos
- Recuperación de información - CJ van Rijsbergen 1979
- Cálculo de la precisión y la exhaustividad para un problema de clasificación multiclase.
- evaluación de la recuperación de información
- Ciencias de la información
- Bioinformática