Articulo de referencia

Exactitud y precisión

La exactitud es la proximidad de los resultados de la medición al valor aceptado; la precisión es el grado en que las mediciones repetidas (o reproducibles ) en condiciones inal...

La exactitud es la proximidad de los resultados de la medición al valor aceptado; la precisión es el grado en que las mediciones repetidas (o reproducibles ) en condiciones inalteradas muestran los mismos resultados.

La exactitud y la precisión son medidas del error de observación ; la exactitud indica qué tan cerca está un conjunto dado de mediciones del valor verdadero , y la precisión indica qué tan cerca están las mediciones entre sí.

La Organización Internacional de Normalización (ISO) define una medida relacionada: [ 1 ] veracidad , "la cercanía de la concordancia entre la media aritmética de un gran número de resultados de pruebas y el valor de referencia verdadero o aceptado".

Según la norma ISO 5725-1, la exactitud se compone de veracidad (proximidad de la media de los resultados de la medición al valor verdadero) y precisión (repetibilidad o reproducibilidad de la medición).

Mientras que la precisión es una descripción de errores aleatorios (una medida de variabilidad estadística ), la exactitud tiene dos definiciones diferentes:

  1. Más comúnmente, se refiere a la descripción de errores sistemáticos (una medida del sesgo estadístico de una medida de tendencia central dada , como la media). En esta definición de "exactitud", el concepto es independiente de "precisión", por lo que se puede decir que un conjunto particular de datos es exacto, preciso, ambos o ninguno. Este concepto corresponde a la veracidad de la ISO .
  2. Una combinación de precisión y veracidad, que considera los dos tipos de error de observación (aleatorio y sistemático), de modo que una alta exactitud requiere tanto alta precisión como alta veracidad. Este uso corresponde a la definición de exactitud (veracidad y precisión) de la ISO. [ 2 ]

Definición técnica común

En términos más sencillos, dada una muestra estadística o un conjunto de datos obtenidos a partir de mediciones repetidas de la misma magnitud, se puede decir que la muestra o el conjunto son exactos si su promedio se aproxima al valor real de la magnitud medida, mientras que se puede decir que el conjunto es preciso si su desviación estándar es relativamente pequeña.

En los campos de la ciencia y la ingeniería , la exactitud de un sistema de medición es el grado de proximidad de las mediciones de una magnitud a su valor verdadero . [ 3 ] La precisión de un sistema de medición, relacionada con la reproducibilidad y la repetibilidad , es el grado en que las mediciones repetidas en condiciones inalteradas muestran los mismos resultados . [ 3 ] [ 4 ] Aunque las dos palabras precisión y exactitud pueden ser sinónimas en el uso coloquial , se contrastan deliberadamente en el contexto del método científico .

En el campo de la estadística , donde la interpretación de las mediciones desempeña un papel central, se prefiere utilizar los términos sesgo y variabilidad en lugar de exactitud y precisión: el sesgo es la cantidad de inexactitud y la variabilidad es la cantidad de imprecisión.

Un sistema de medición puede ser exacto pero no preciso, preciso pero no exacto, ninguna de las dos cosas o ambas. Por ejemplo, si un experimento contiene un error sistemático , aumentar el tamaño de la muestra generalmente incrementa la precisión, pero no mejora la exactitud. El resultado sería una serie de resultados consistentes pero inexactos provenientes del experimento defectuoso. Eliminar el error sistemático mejora la exactitud, pero no la precisión.

Un sistema de medición se considera válido si es exacto y preciso . Entre los términos relacionados se incluyen el sesgo (efectos no aleatorios o dirigidos causados ​​por uno o varios factores ajenos a la variable independiente ) y el error (variabilidad aleatoria).

Esta terminología también se aplica a las mediciones indirectas, es decir, a los valores obtenidos mediante un procedimiento computacional a partir de datos observados.

Además de la exactitud y la precisión, las mediciones también pueden tener una resolución de medición , que es el cambio más pequeño en la magnitud física subyacente que produce una respuesta en la medición.

En el análisis numérico , la exactitud también se refiere a la proximidad de un cálculo al valor verdadero; mientras que la precisión es la resolución de la representación, que normalmente se define por el número de dígitos decimales o binarios.

En términos militares, la precisión se refiere principalmente a la exactitud del fuego ( justesse de tir ), la precisión del fuego expresada por la proximidad de un grupo de disparos en el centro del objetivo y sus alrededores. [ 5 ]

Definición ISO (ISO 5725)

Un cambio en el significado de estos términos apareció con la publicación de la serie de normas ISO 5725 en 1994, lo cual también se refleja en la edición de 2008 del Vocabulario Internacional de Metrología (VIM) del BIPM, elementos 2.13 y 2.14. [ 3 ]

Según la norma ISO 5725-1, [ 1 ] el término general «exactitud» se utiliza para describir la proximidad de una medición al valor verdadero. Cuando el término se aplica a conjuntos de mediciones de la misma magnitud , implica un componente de error aleatorio y un componente de error sistemático. En este caso, la veracidad es la proximidad de la media de un conjunto de resultados de medición al valor real (verdadero), es decir, el error sistemático, y la precisión es la concordancia entre un conjunto de resultados, es decir, el error aleatorio.

ISO 5725-1 y VIM también evitan el uso del término " sesgo ", especificado previamente en BS 5497-1, [ 6 ] porque tiene connotaciones diferentes fuera de los campos de la ciencia y la ingeniería, como en la medicina y el derecho.

Cuantificación y aplicaciones

En instrumentación industrial, la precisión es la tolerancia de medición o transmisión del instrumento y define los límites de los errores que se producen cuando el instrumento se utiliza en condiciones normales de funcionamiento. [ 7 ]

Idealmente, un instrumento de medición debe ser exacto y preciso, con mediciones cercanas y agrupadas alrededor del valor verdadero. La exactitud y precisión de un proceso de medición se establecen generalmente mediante la medición repetida de un patrón de referencia trazable . Dichos patrones se definen en el Sistema Internacional de Unidades (SI, por sus siglas en francés: Système international d'unités ) y son mantenidos por organismos nacionales de normalización, como el Instituto Nacional de Estándares y Tecnología (NIST) de Estados Unidos.

Esto también se aplica cuando las mediciones se repiten y se promedian. En ese caso, el término error estándar se aplica correctamente: la precisión del promedio es igual a la desviación estándar conocida del proceso dividida por la raíz cuadrada del número de mediciones promediadas. Además, el teorema del límite central demuestra que la distribución de probabilidad de las mediciones promediadas se aproximará más a una distribución normal que la de las mediciones individuales.

En cuanto a la exactitud podemos distinguir:

  • La diferencia entre la media de las mediciones y el valor de referencia, el sesgo . Establecer y corregir el sesgo es necesario para la calibración .
  • el efecto combinado de eso y la precisión.

En ciencia e ingeniería, es común expresar la exactitud y/o precisión implícitamente mediante cifras significativas . Cuando no se indica explícitamente, se entiende que el margen de error es la mitad del valor de la última cifra significativa. Por ejemplo, un registro de 843,6  m, 843,0  m u 800,0  m implicaría un margen de 0,05  m (la última cifra significativa es la de las décimas), mientras que un registro de 843  m implicaría un margen de error de 0,5  m (las últimas cifras significativas son las unidades).

Una lectura de 8000  m, con ceros finales y sin punto decimal, es ambigua; los ceros finales pueden o no ser cifras significativas. Para evitar esta ambigüedad, el número podría representarse en notación científica: 8,0  ×  10³ m indica que el primer cero es significativo (por lo tanto, un margen de 50 m ) , mientras que 8,000 × 10³ m indica que los tres ceros son significativos, dando un margen de 0,5 m. De manera similar, se puede usar un múltiplo de la unidad de medida básica: 8,0 km es equivalente a 8,0 × 10³ m . Esto indica un margen de 0,05 km (50 m). Sin embargo, confiar en esta convención puede llevar a errores de precisión falsos al aceptar datos de fuentes que no la respetan. Por ejemplo, una fuente que informa un número como 153 753 con una precisión de +/- 5000 parece tener una precisión de +/- 0,5. Según el convenio, se habría redondeado a 150.000.            

Alternativamente, en un contexto científico, si se desea indicar el margen de error con mayor precisión, se puede utilizar una notación como 7,54398(23) × 10 −10 m, lo que significa un rango entre 7,54375 y 7,54421 × 10 −10 m.

La precisión incluye:

  • repetibilidad : la variación que surge cuando se realizan todos los esfuerzos posibles para mantener las condiciones constantes utilizando el mismo instrumento y operador, y repitiendo la prueba durante un corto período de tiempo; y
  • Reproducibilidad : la variación que surge al utilizar el mismo proceso de medición entre diferentes instrumentos y operadores, y durante períodos de tiempo más prolongados.

En ingeniería, la precisión se suele considerar como tres veces la desviación estándar de las mediciones tomadas, lo que representa el rango dentro del cual se encuentra el 99,73 % de las mediciones. [ 8 ] Por ejemplo, un ergonomista que mide el cuerpo humano puede tener la certeza de que el 99,73 % de sus mediciones extraídas se encuentran dentro de ± 0,7  cm (si utiliza el sistema de procesamiento GRYPHON) o ± 13  cm (si utiliza datos sin procesar). [ 9 ]

En la clasificación

En la clasificación binaria

La precisión también se utiliza como medida estadística de la eficacia con la que una prueba de clasificación binaria identifica o excluye correctamente una condición. Es decir, la precisión es la proporción de predicciones correctas (tanto verdaderos positivos como verdaderos negativos ) entre el número total de casos examinados. [ 10 ] De este modo, compara las estimaciones de probabilidad previa y posterior a la prueba . Para aclarar el contexto mediante la semántica, a menudo se la denomina «precisión de Rand» [ 11 ] o « índice de Rand ». [ 12 ] [ 13 ] Es un parámetro de la prueba. La fórmula para cuantificar la precisión binaria es: Exactitud=TPAG+TnorteTPAG+Tnorte+FPAG+Fnorte{\displaystyle {\text{Precisión}}={\frac {TP+TN}{TP+TN+FP+FN}}} donde TP = Verdadero positivo ; FP = Falso positivo ; TN = Verdadero negativo ; FN = Falso negativo

En este contexto, los conceptos de veracidad y precisión, tal como se definen en la norma ISO 5725-1, no son aplicables. Una razón es que no existe un único "valor verdadero" de una magnitud, sino dos posibles valores verdaderos para cada caso, mientras que la exactitud es un promedio de todos los casos y, por lo tanto, tiene en cuenta ambos valores. Sin embargo, el término precisión se utiliza en este contexto para referirse a una métrica diferente que proviene del campo de la recuperación de información (véase §  En sistemas de información ).

En la clasificación multiclase

Al calcular la precisión en la clasificación multiclase, la precisión es simplemente la fracción de clasificaciones correctas: [ 14 ] [ 15 ]Exactitud=clasificaciones correctastodas las clasificaciones{\displaystyle {\text{Precisión}}={\frac {\text{clasificaciones correctas}}{\text{todas las clasificaciones}}}} Normalmente se expresa como un porcentaje. Por ejemplo, si un clasificador realiza diez predicciones y nueve de ellas son correctas, la precisión es del 90 %.

La precisión también se considera a veces una micrométrica , para subrayar que tiende a verse muy afectada por la prevalencia de la clase particular en un conjunto de datos y los sesgos del clasificador. [ 14 ]

Además, también se la denomina precisión top-1 para distinguirla de la precisión top-5, común en la evaluación de redes neuronales convolucionales . Para evaluar la precisión top-5, el clasificador debe proporcionar probabilidades relativas para cada clase. Al ordenarlas, una clasificación se considera correcta si se encuentra entre las cinco primeras predicciones de la red. La precisión top-5 se popularizó gracias al desafío ImageNet . Generalmente es superior a la precisión top-1, ya que las predicciones correctas entre la segunda y la quinta posición no mejoran la puntuación top-1, pero sí la top-5.

En psicometría y psicofísica

En psicometría y psicofísica , el término exactitud se usa indistintamente con validez y error constante . Precisión es sinónimo de fiabilidad y error variable . La validez de un instrumento de medición o prueba psicológica se establece mediante experimentación o correlación con el comportamiento. La fiabilidad se establece con diversas técnicas estadísticas, clásicamente mediante una prueba de consistencia interna como el alfa de Cronbach para asegurar que conjuntos de preguntas relacionadas tengan respuestas relacionadas, y luego comparando esas preguntas relacionadas entre la población de referencia y la población objetivo.

En la simulación lógica

Formas de onda comparativas para valores lógicos, voltajes de circuito y voltajes de medición.

En la simulación lógica , un error común al evaluar modelos precisos es comparar un modelo de simulación lógica con un modelo de simulación de circuito de transistores . Esta comparación se centra en las diferencias de precisión, no de exactitud. La precisión se mide en función del detalle, mientras que la exactitud se mide en función de la realidad. [ 16 ] [ 17 ]

En los sistemas de información

Los sistemas de recuperación de información, como las bases de datos y los motores de búsqueda web , se evalúan mediante diversas métricas , algunas de las cuales se derivan de la matriz de confusión , que divide los resultados en verdaderos positivos (documentos recuperados correctamente), verdaderos negativos (documentos no recuperados correctamente), falsos positivos (documentos recuperados incorrectamente) y falsos negativos (documentos no recuperados incorrectamente). Las métricas más utilizadas incluyen la precisión y la exhaustividad . En este contexto, la precisión se define como la fracción de documentos recuperados correctamente en comparación con los documentos recuperados (verdaderos positivos divididos entre verdaderos positivos más falsos positivos), utilizando un conjunto de resultados relevantes de referencia seleccionados por humanos. La exhaustividad se define como la fracción de documentos recuperados correctamente en comparación con los documentos relevantes (verdaderos positivos divididos entre verdaderos positivos más falsos negativos). Con menos frecuencia, se utiliza la métrica de exactitud, que se define como la fracción de documentos clasificados correctamente en comparación con los documentos (verdaderos positivos más verdaderos negativos divididos entre verdaderos positivos más verdaderos negativos más falsos positivos más falsos negativos).

Ninguna de estas métricas considera la clasificación de los resultados. La clasificación es crucial para los motores de búsqueda web, ya que los usuarios rara vez pasan de la primera página de resultados, y la gran cantidad de documentos en la web impide clasificarlos manualmente para determinar si deben incluirse o excluirse de una búsqueda. Establecer un umbral en un número determinado de resultados permite considerar la clasificación hasta cierto punto. La medida de precisión en k , por ejemplo, evalúa la precisión considerando únicamente los diez primeros resultados (k=10). Métricas más sofisticadas, como la ganancia acumulativa descontada , consideran la clasificación de cada resultado individual y se utilizan con mayor frecuencia cuando este aspecto es importante.

En los sistemas cognitivos

En los sistemas cognitivos, la exactitud y la precisión se utilizan para caracterizar y medir los resultados de un proceso cognitivo realizado por entidades biológicas o artificiales donde un proceso cognitivo es una transformación de datos, información, conocimiento o sabiduría a una forma de mayor valor. ( Pirámide DIKW ) A veces, un proceso cognitivo produce exactamente el resultado previsto o deseado, pero a veces produce un resultado muy alejado del previsto o deseado. Además, las repeticiones de un proceso cognitivo no siempre producen el mismo resultado. La exactitud cognitiva (C A ) es la propensión de un proceso cognitivo a producir el resultado previsto o deseado. La precisión cognitiva (C P ) es la propensión de un proceso cognitivo a producir el mismo resultado. [ 18 ] [ 19 ] [ 20 ] Para medir la cognición aumentada en conjuntos humano/cog, donde uno o más humanos trabajan en colaboración con uno o más sistemas cognitivos (cogs), los aumentos en la exactitud cognitiva y la precisión cognitiva ayudan a medir el grado de aumento cognitivo .

Véase también

Referencias

  1. 1 2 BS ISO 5725-1: "Exactitud (veracidad y precisión) de los métodos y resultados de medición - Parte 1: Principios generales y definiciones.", pág. 1 (1994)
  2. Menditto, Antonio; Patriarca, Marina; Magnusson, Bertil (2007-01-09). "Comprender el significado de exactitud, veracidad y precisión". Acreditación y garantía de calidad . 12 (1): 45– 47. doi : 10.1007/s00769-006-0191-z . ISSN 0949-1775 . 
  3. 1 2 3 JCGM 200:2008 Vocabulario internacional de metrología : conceptos básicos y generales y términos asociados (VIM)
  4. Taylor, John Robert (1999). Introducción al análisis de errores: El estudio de las incertidumbres en las mediciones físicas . University Science Books. págs. 128–129 . ISBN  0-935702-75-X.
  5. Organización del Tratado del Atlántico Norte, Agencia de Normalización de la OTAN AAP-6 – Glosario de términos y definiciones, pág. 43.
  6. BS 5497-1: "Precisión de los métodos de ensayo. Guía para la determinación de la repetibilidad y la reproducibilidad de un método de ensayo estándar." (1979)
  7. Creus, Antonio. Instrumentación Industrial
  8. Black, J. Temple (21 de julio de 2020). Materiales y procesos de fabricación de DeGarmo . John Wiley & Sons. ISBN 978-1-119-72329-5OCLC 1246529321 
  9. Parker, Christopher J.; Gill, Simeon; Harwood, Adrian; Hayes, Steven G.; Ahmed, Maryam (19 de mayo de 2021). "Un método para aumentar la precisión del escaneo corporal 3D: Gryphon y escaneo consecutivo" . Ergonomics . 65 (1): 39–59 . doi : 10.1080/00140139.2021.1931473 . ISSN 0014-0139 . PMID 34006206 .  
  10. Metz, CE (octubre de 1978). "Principios básicos del análisis ROC" (PDF) . Semin Nucl Med . 8 (4): 283–98 . doi : 10.1016/s0001-2998(78)80014-2 . PMID 112681. Archivado (PDF) del original el 4 de junio de 2022 . 
  11. Powers, David M W. "Medidas de evaluación comunes de estadística (ALTS2003: Validación y evaluación – Evaluación L3)" (PDF) . Archivado del original (PDF) el 11 de marzo de 2015. Consultado el 9 de agosto de 2015 .
  12. Powers, David MW (marzo de 2015). "Lo que la medida F no mide" . arXiv : 1503.06410 . Archivado del original el 20 de junio de 2025.
  13. David MW Powers. "El problema con Kappa" (PDF) . Anthology.aclweb.org . Archivado (PDF) del original el 12 de diciembre de 2017. Consultado el 11 de diciembre de 2017 .
  14. 1 2 Opitz, Juri (2024). "Una mirada más cercana a las métricas de evaluación de clasificación y una reflexión crítica sobre la práctica de evaluación común" . Transactions of the Association for Computational Linguistics . 12 : 820–836 . arXiv : 2404.16958 . doi : 10.1162/tacl_a_00675 .
  15. "3.3. Métricas y puntuación: cuantificación de la calidad de las predicciones" . scikit-learn . Consultado el 17 de mayo de 2022 .
  16. Acken, John M. (1997). "ninguno". Enciclopedia de Ciencias de la Computación y Tecnología . 36 : 281–306 .
  17. Glasser, Mark; Mathews, Rob; Acken, John M. (junio de 1990). "Taller de 1990 sobre modelado a nivel lógico para ASIC". Boletín informativo de SIGDA . 20 (1).
  18. Fulbright, Ron (2020). Democratización de la experiencia: Cómo los sistemas cognitivos revolucionarán tu vida (1.ª ed.). Boca Raton, FL: CRC Press. ISBN  978-0367859459.
  19. Fulbright, Ron (2019). "Cálculo de la mejora cognitiva: un estudio de caso" . Cognición aumentada . Lecture Notes in Computer Science. Vol. 11580. Springer Cham. pp. 533–545 . arXiv : 2211.06479 . doi : 10.1007/978-3-030-22419-6_38 . ISBN   978-3-030-22418-9. S2CID 195891648 . 
  20. Fulbright, Ron (2018). «Sobre la medición de la cognición y el aumento cognitivo» . Interfaz humana y gestión de la información. Información en aplicaciones y servicios . Notas de clase en informática. Vol. 10905. Springer Cham. págs. 494–507 . arXiv : 2211.06477 . doi : 10.1007 /978-3-319-92046-7_41 . ISBN   978-3-319-92045-0. S2CID 51603737 . 
  • BIPM - Guías de metrología , Guía para la expresión de la incertidumbre en la medición (GUM) y Vocabulario internacional de metrología (VIM)
  • "Más allá de la trazabilidad del NIST: ¿Qué es lo que realmente genera precisión?" Archivado el 12 de septiembre de 2012 en Wayback Machine , revista Controlled Environments .
  • Precisión y exactitud con tres métodos psicofísicos
  • Apéndice D.1: Terminología , directrices para evaluar y expresar la incertidumbre de los resultados de medición del NIST.
  • Exactitud y precisión
  • Exactitud vs. Precisión : un breve vídeo de Matt Parker
  • ¿Cuál es la diferencia entre exactitud y precisión? por Matt Anticole en TED -Ed