Articulo de referencia

Fiabilidad entre evaluadores

En estadística , la fiabilidad entre evaluadores (también conocida con otros nombres similares, como acuerdo entre evaluadores , concordancia entre evaluadores , fiabilidad entr...

En estadística , la fiabilidad entre evaluadores (también conocida con otros nombres similares, como acuerdo entre evaluadores , concordancia entre evaluadores , fiabilidad entre observadores , fiabilidad entre codificadores , etc.) es el grado de acuerdo entre observadores independientes que califican, codifican o evalúan el mismo fenómeno.

Las herramientas de evaluación que se basan en calificaciones deben mostrar una buena fiabilidad entre evaluadores; de lo contrario, no son pruebas válidas .

Existen diversas estadísticas que pueden utilizarse para determinar la fiabilidad entre evaluadores. Cada tipo de medición requiere una estadística diferente. Algunas opciones son la probabilidad conjunta de acuerdo, como el coeficiente kappa de Cohen , el coeficiente pi de Scott y el coeficiente kappa de Fleiss ; o la correlación entre evaluadores, el coeficiente de correlación de concordancia , la correlación intraclase y el alfa de Krippendorff .

Concepto

Existen varias definiciones operativas de "fiabilidad entre evaluadores", que reflejan diferentes puntos de vista sobre lo que constituye un acuerdo fiable entre evaluadores. [ 1 ] Existen tres definiciones operativas de acuerdo:

  1. Los evaluadores fiables coinciden con la calificación "oficial" de una actuación.
  2. Los evaluadores fiables coinciden entre sí en las calificaciones exactas que deben otorgarse.
  3. Los evaluadores fiables coinciden en qué desempeño es mejor y cuál es peor.

Estas se combinan con dos definiciones operativas de comportamiento:

  1. Los evaluadores confiables son autómatas que se comportan como "máquinas de calificación". Esta categoría incluye la calificación de ensayos por computadora [ 2 ]. Este comportamiento puede evaluarse mediante la teoría de la generalizabilidad .
  2. Los evaluadores fiables se comportan como testigos independientes. Demuestran su independencia al discrepar ligeramente. Este comportamiento puede evaluarse mediante el modelo de Rasch .

Estadística

Probabilidad conjunta de acuerdo

La probabilidad conjunta de acuerdo es la medida más simple y menos robusta. Se estima como el porcentaje de veces que los evaluadores coinciden en un sistema de calificación nominal o categórico. No tiene en cuenta que el acuerdo puede darse únicamente por azar. Existe cierta controversia sobre la necesidad de «corregir» el acuerdo por azar; algunos sugieren que, en cualquier caso, dicho ajuste debería basarse en un modelo explícito de cómo el azar y el error afectan las decisiones de los evaluadores. [ 3 ]

Cuando el número de categorías utilizadas es pequeño (por ejemplo, 2 o 3), la probabilidad de que dos evaluadores coincidan por pura casualidad aumenta drásticamente. Esto se debe a que ambos evaluadores deben limitarse al número reducido de opciones disponibles, lo que afecta al índice de concordancia general, y no necesariamente a su propensión a la concordancia "intrínseca" (una concordancia se considera "intrínseca" si no se debe al azar).

Por lo tanto, la probabilidad conjunta de acuerdo seguirá siendo alta incluso en ausencia de cualquier acuerdo "intrínseco" entre los evaluadores. Se espera que un coeficiente de fiabilidad interevaluador útil (a) sea cercano a 0 cuando no hay acuerdo "intrínseco" y (b) aumente a medida que mejora la tasa de acuerdo "intrínseco". La mayoría de los coeficientes de acuerdo corregidos por azar logran el primer objetivo. Sin embargo, muchas medidas conocidas corregidas por azar no logran el segundo objetivo. [ 4 ]

Estadísticas Kappa

Cuatro conjuntos de recomendaciones para interpretar el nivel de acuerdo entre evaluadores

Kappa es una forma de medir la concordancia o confiabilidad, corrigiendo la frecuencia con la que las calificaciones podrían coincidir por azar. El kappa de Cohen, [ 5 ] que funciona con dos evaluadores, y el kappa de Fleiss, [ 6 ] una adaptación que funciona con cualquier número fijo de evaluadores, mejoran la probabilidad conjunta al tener en cuenta la cantidad de concordancia que podría esperarse por azar. Las versiones originales tenían el mismo problema que la probabilidad conjunta, ya que tratan los datos como nominales y asumen que las calificaciones no tienen un orden natural; si los datos realmente tienen un rango (nivel de medición ordinal), entonces esa información no se considera completamente en las mediciones.

Las extensiones posteriores del enfoque incluyeron versiones que podían manejar "crédito parcial" y escalas ordinales. [ 7 ] Estas extensiones convergen con la familia de correlaciones intraclase (CCI), por lo que hay una forma conceptualmente relacionada de estimar la confiabilidad para cada nivel de medición desde nominal (kappa) a ordinal (kappa ordinal o CCI, ampliando supuestos) a intervalo (CCI, o kappa ordinal, tratando la escala de intervalo como ordinal), y razón (CCI). También hay variantes que pueden examinar el acuerdo entre evaluadores en un conjunto de ítems (por ejemplo, ¿dos entrevistadores coinciden en las puntuaciones de depresión para todos los ítems en la misma entrevista semiestructurada para un caso?) así como evaluadores x casos (por ejemplo, qué tan bien coinciden dos o más evaluadores sobre si 30 casos tienen un diagnóstico de depresión, sí/no, una variable nominal).

El coeficiente Kappa es similar a un coeficiente de correlación, ya que no puede superar +1,0 ni ser inferior a -1,0. Dado que se utiliza como medida de concordancia, en la mayoría de los casos se esperan valores positivos; los valores negativos indicarían un desacuerdo sistemático. Kappa solo puede alcanzar valores muy altos cuando existe una buena concordancia y la tasa de la condición objetivo se acerca al 50 % (porque incluye la tasa base en el cálculo de las probabilidades conjuntas). Diversas autoridades han propuesto "reglas prácticas" para interpretar el nivel de concordancia, muchas de las cuales coinciden en esencia, aunque no estén formuladas con las mismas palabras. [ 8 ] [ 9 ] [ 10 ] [ 11 ]

Coeficientes de correlación

Ya sea Pearson or{\displaystyle r}, el τ de Kendall o el de Spearmanρ{\displaystyle \rho } Se puede utilizar para medir la correlación por pares entre evaluadores utilizando una escala ordenada. Pearson asume que la escala de calificación es continua; las estadísticas de Kendall y Spearman asumen solo que es ordinal. Si se observan más de dos evaluadores, se puede calcular un nivel promedio de acuerdo para el grupo como la media de losr{\displaystyle r}, τ oρ{\displaystyle \rho }valores de cada posible par de evaluadores.

Coeficiente de correlación intraclase

Otra forma de realizar pruebas de fiabilidad es utilizar el coeficiente de correlación intraclase (CCI). [ 12 ] Existen varios tipos de este coeficiente y uno se define como "la proporción de la varianza de una observación debida a la variabilidad entre sujetos en las puntuaciones verdaderas". [ 13 ] El rango del CCI puede estar entre 0,0 y 1,0 (una definición temprana del CCI podría estar entre -1 y +1). El CCI será alto cuando haya poca variación entre las puntuaciones dadas a cada ítem por los evaluadores, por ejemplo, si todos los evaluadores dan puntuaciones iguales o similares a cada uno de los ítems. El CCI es una mejora con respecto al coeficiente de correlación de Pearson.r{\displaystyle r}y Spearmanρ{\displaystyle \rho }, ya que tiene en cuenta las diferencias en las calificaciones de los segmentos individuales, junto con la correlación entre los evaluadores.

Límites del acuerdo

Trama de Bland-Altman

Otro método para evaluar la concordancia (útil cuando solo hay dos evaluadores y la escala es continua) consiste en calcular las diferencias entre cada par de observaciones de ambos evaluadores. La media de estas diferencias se denomina sesgo y el intervalo de referencia (media  ±  1,96  × desviación estándar ) se denomina límites de concordancia . Los límites de concordancia permiten comprender la influencia de la variación aleatoria en las calificaciones. 

Si los evaluadores tienden a coincidir, las diferencias entre sus observaciones serán cercanas a cero. Si un evaluador suele calificar por encima o por debajo del otro de forma consistente, el sesgo será distinto de cero. Si los evaluadores tienden a discrepar, pero sin un patrón consistente de una calificación superior a la otra, la media será cercana a cero. Se pueden calcular intervalos de confianza (generalmente del 95 %) tanto para el sesgo como para cada uno de los límites de concordancia.

Existen varias fórmulas que se pueden utilizar para calcular los límites de concordancia. La fórmula simple, que se presentó en el párrafo anterior y funciona bien para tamaños de muestra mayores de 60, [ 14 ] es

incógnita¯±1,96s{\displaystyle {\bar {x}}\pm 1,96s}

Para tamaños de muestra más pequeños, otra simplificación común [ 15 ] es

incógnita¯±2s{\displaystyle {\bar {x}}\pm 2s}

Sin embargo, la fórmula más precisa (que es aplicable a todos los tamaños de muestra) [ 14 ] es

incógnita¯±t0,05,norte1s1+1norte{\displaystyle {\bar {x}}\pm t_{0.05,n-1}s{\sqrt {1+{\frac {1}{n}}}}}

Bland y Altman [ 15 ] ampliaron esta idea graficando la diferencia de cada punto, la diferencia media y los límites de concordancia en el eje vertical frente al promedio de las dos calificaciones en el eje horizontal. El gráfico de Bland-Altman resultante muestra no solo el grado general de concordancia, sino también si esta se relaciona con el valor subyacente del elemento. Por ejemplo, dos evaluadores podrían coincidir en gran medida al estimar el tamaño de elementos pequeños, pero discrepar sobre elementos más grandes.

Al comparar dos métodos de medición, no solo interesa estimar el sesgo y los límites de concordancia entre ambos (concordancia entre evaluadores), sino también evaluar estas características para cada método individualmente. Es posible que la concordancia entre dos métodos sea baja simplemente porque uno tiene límites de concordancia amplios, mientras que el otro tiene límites estrechos. En este caso, el método con límites de concordancia estrechos sería superior desde un punto de vista estadístico, aunque consideraciones prácticas o de otra índole podrían modificar esta apreciación. Determinar qué constituye límites de concordancia estrechos o amplios, o un sesgo grande o pequeño, es una cuestión de evaluación práctica en cada caso.

El alfa de Krippendorff

El alfa de Krippendorff [ 16 ] [ 17 ] es una estadística versátil que evalúa el grado de concordancia entre observadores que categorizan, evalúan o miden un conjunto determinado de objetos en función de los valores de una variable. Generaliza varios coeficientes de concordancia especializados al aceptar cualquier número de observadores, ser aplicable a niveles de medición nominales, ordinales, de intervalo y de razón, poder manejar datos faltantes y estar corregido para tamaños de muestra pequeños.

Alpha surgió en el análisis de contenido, donde codificadores capacitados categorizan unidades textuales, y se utiliza en asesoramiento e investigación mediante encuestas, donde expertos codifican datos de entrevistas abiertas en términos analizables; en psicometría , donde se prueban atributos individuales mediante múltiples métodos; en estudios observacionales , donde se registran sucesos no estructurados para su posterior análisis; y en lingüística computacional, donde se anotan textos con diversas cualidades sintácticas y semánticas.

Desacuerdo

En cualquier tarea en la que varios evaluadores sean útiles, se espera que estos discrepen sobre el valor observado. Por el contrario, las situaciones que implican mediciones inequívocas, como las tareas de conteo simples (por ejemplo, el número de clientes potenciales que entran en una tienda), a menudo no requieren que más de una persona realice la medición.

Las mediciones que implican ambigüedad en las características de interés del objetivo de evaluación generalmente mejoran con la participación de varios evaluadores capacitados. Estas tareas de medición suelen implicar un juicio subjetivo sobre la calidad. Algunos ejemplos son la evaluación del trato del médico con el paciente, la valoración de la credibilidad de un testigo por parte de un jurado y la habilidad de presentación de un orador.

La variabilidad en los procedimientos de medición entre los evaluadores y la variabilidad en la interpretación de los resultados son dos ejemplos de fuentes de error en las mediciones de calificación. Es necesario contar con directrices claras para la emisión de calificaciones, lo que garantiza la fiabilidad en situaciones de medición ambiguas o complejas.

Sin pautas de puntuación, las calificaciones se ven cada vez más afectadas por el sesgo del experimentador , es decir, una tendencia de los valores de calificación a desviarse hacia lo que espera el evaluador. Durante los procesos que implican mediciones repetidas, la corrección de esta desviación del evaluador puede abordarse mediante una capacitación periódica para garantizar que los evaluadores comprendan las pautas y los objetivos de medición.

Véase también

Referencias

  1. Saal, FE; Downey, RG; Lahey, MA (1980). "Evaluación de las calificaciones: Evaluación de la calidad psicométrica de los datos de calificación" . Psychological Bulletin . 88 (2): 413. doi : 10.1037/0033-2909.88.2.413 .
  2. Page, EB; Petersen, NS (1995). "La computadora se introduce en la calificación de ensayos: Actualizando la antigua prueba" . Phi Delta Kappan . 76 (7): 561.
  3. Uebersax, JS (1987). "Diversidad de modelos de toma de decisiones y medición del acuerdo entre evaluadores" . Psychological Bulletin . 101 (1): 140– 146. doi : 10.1037/0033-2909.101.1.140 . S2CID 39240770 . 
  4. "Corrección de la fiabilidad entre evaluadores para el acuerdo por azar: ¿Por qué?" . www.agreestat.com . Archivado del original el 2 de abril de 2018 . Consultado el 26 de diciembre de 2018 .
  5. Cohen, J. (1960). "Un coeficiente de concordancia para escalas nominales" (PDF) . Educational and Psychological Measurement . 20 (1): 37– 46. doi : 10.1177/001316446002000104 . S2CID 15926286. Archivado del original (PDF) el 24 de marzo de 2023. Recuperado el 29 de diciembre de 2022 . 
  6. Fleiss, JL (1971). "Medición del acuerdo en escala nominal entre muchos evaluadores" . Psychological Bulletin . 76 (5): 378– 382. doi : 10.1037/h0031619 .
  7. Landis, J. Richard; Koch, Gary G. (1977). "La medición del acuerdo entre observadores para datos categóricos" . Biometrics . 33 ( 1 ): 159– 74. doi : 10.2307/2529310 . JSTOR 2529310. PMID 843571. S2CID 11077516 .   
  8. Landis, J. Richard; Koch, Gary G. (1977). "Una aplicación de estadísticas jerárquicas de tipo Kappa en la evaluación del acuerdo mayoritario entre múltiples observadores". Biometrics . 33 ( 2): 363– 74. doi : 10.2307/2529786 . JSTOR 2529786. PMID 884196 .  
  9. Cicchetti, DV; Sparrow, SA (1981). "Desarrollo de criterios para establecer la fiabilidad interevaluador de ítems específicos: aplicaciones a la evaluación del comportamiento adaptativo". American Journal of Mental Deficiency . 86 (2): 127– 137. PMID 7315877 . 
  10. Fleiss, JL (1981-04-21). Métodos estadísticos para tasas y proporciones. 2.ª ed . Wiley. ISBN 0-471-06428-9OCLC 926949980 .​ 
  11. Regier, Darrel A.; Narrow, William E.; Clarke, Diana E.; Kraemer, Helena C.; Kuramoto, S. Janet; Kuhl, Emily A.; Kupfer, David J. (2013). "Ensayos de campo del DSM-5 en Estados Unidos y Canadá, Parte II: Fiabilidad test-retest de diagnósticos categóricos seleccionados". American Journal of Psychiatry . 170 (1): 59– 70. doi : 10.1176/appi.ajp.2012.12070999 . ISSN 0002-953X . PMID 23111466 .  
  12. Shrout, PE; Fleiss, JL (1979). "Correlaciones intraclase: usos en la evaluación de la fiabilidad del evaluador" . Psychological Bulletin . 86 (2): 420– 428. doi : 10.1037/0033-2909.86.2.420 . PMID 18839484. S2CID 13168820 .  
  13. Everitt, BS (1996). Making sense of statistics in psychology: A second-level course . Oxford University Press. ISBN 978-0-19-852365-9.
  14. 1 2 Ludbrook, J. (2010). Confianza en los gráficos de Altman-Bland: una revisión crítica del método de las diferencias. Clinical and Experimental Pharmacology and Physiology, 37 (2), 143-149.
  15. 1 2 Bland, JM, & Altman, D. (1986). Métodos estadísticos para evaluar la concordancia entre dos métodos de medición clínica. The Lancet, 327 (8476), 307-310.
  16. Krippendorff, Klaus (2018). Análisis de contenido : una introducción a su metodología (4.ª ed.). Los Ángeles. ISBN   9781506395661OCLC 1019840156 {{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace )
  17. Hayes, AF; Krippendorff, K. (2007). "Respondiendo al llamado de una medida de confiabilidad estándar para datos de codificación". Métodos y medidas de comunicación . 1 (1): 77– 89. doi : 10.1080/19312450709336664 . S2CID 15408575 . 

Lecturas adicionales

  • Gwet, Kilem L. (2014). Manual de fiabilidad entre evaluadores (4.ª  ed.). Gaithersburg: Advanced Analytics. ISBN 978-0970806284OCLC 891732741 
  • Gwet, KL (2008). "Cálculo de la fiabilidad entre evaluadores y su varianza en presencia de un alto grado de acuerdo" ( PDF) . British Journal of Mathematical and Statistical Psychology . 61 (Pt 1): 29– 48. doi : 10.1348/000711006X126600 . PMID 18482474. S2CID 13915043. Archivado del original (PDF) el 3 de marzo de 2016. Consultado el 16 de junio de 2010 .  
  • Johnson, R.; Penny, J.; Gordon, B. (2009). Evaluación del desempeño: Desarrollo, puntuación y validación de tareas de desempeño . Guilford. ISBN 978-1-59385-988-6.
  • Shoukri, MM (2010). Medidas de concordancia y fiabilidad entre observadores (2.ª  ed.). CRC Press. ISBN 978-1-4398-1080-4OCLC 815928115 
  • AgreeStat 360: análisis de fiabilidad entre evaluadores basado en la nube, kappa de Cohen, AC1/AC2 de Gwet, alfa de Krippendorff, Brennan-Prediger, kappa generalizada de Fleiss, coeficientes de correlación intraclase.
  • Métodos estadísticos para la concordancia entre evaluadores, por John Uebersax
  • Calculadora de fiabilidad entre evaluadores de Medical Education Online
  • Calculadora Kappa en línea (multievaluador) Archivada el 28/02/2009 en Wayback Machine
  • Calculadora en línea para el Acuerdo entre Tasadores. Archivada el 10/04/2016 en Wayback Machine.