El juicio comparativo adaptativo es una técnica proveniente de la psicofísica que permite obtener resultados fiables para la evaluación educativa; por lo tanto, constituye una alternativa a la corrección tradicional de exámenes. En este método, se presentan a los evaluadores pares de trabajos de estudiantes y se les pide que elijan cuál es mejor. Mediante un algoritmo iterativo y adaptativo , se obtiene una distribución ponderada de los trabajos de los estudiantes sin necesidad de criterios preestablecidos.
Introducción
La corrección tradicional de exámenes comenzó en Cambridge en 1792, cuando, con el aumento del número de estudiantes de pregrado, se hizo cada vez más importante la correcta clasificación de los alumnos. Así, en 1792, el nuevo supervisor de exámenes, William Farish, introdujo la corrección, un proceso en el que cada examinador asigna una puntuación numérica a cada respuesta de cada estudiante, y la puntuación total general determina la clasificación final de los alumnos. Francis Galton (1869) observó que, en un año no identificado alrededor de 1863, el alumno con la calificación más alta obtuvo 7634 puntos de un máximo de 17 000, mientras que el segundo alumno obtuvo 4123. (El alumno con la calificación más baja obtuvo solo 237).
Antes de 1792, un equipo de examinadores de Cambridge se reunía a las 5 de la tarde del último día de exámenes, revisaba las 19 pruebas que cada estudiante había realizado y publicaba su clasificación a medianoche. La calificación solucionó los problemas de cantidad y evitó sesgos personales injustos, y su introducción supuso un paso hacia la evaluación objetiva moderna, el formato para el que resulta más adecuada. Sin embargo, la tecnología de evaluación que le siguió, con su gran énfasis en la fiabilidad y la automatización de la calificación, ha resultado incómoda para algunas áreas del rendimiento académico: la evaluación de la escritura o la expresión oral, y otros tipos de desempeño, requieren un enfoque más cualitativo y subjetivo.
La técnica del Juicio Comparativo Adaptativo es una alternativa a la calificación tradicional. Retoma la idea anterior a 1792 de clasificar los trabajos según su calidad, pero conserva la garantía de fiabilidad y equidad. Es, con diferencia, el método más fiable conocido para calificar ensayos o trabajos más complejos . Es mucho más sencillo que la calificación tradicional y ha sido el preferido por casi todos los examinadores que lo han probado. El verdadero atractivo del Juicio Comparativo Adaptativo reside en cómo puede profesionalizar la actividad de la evaluación y reintegrarla al aprendizaje.
Historia
Ley de juicio comparativo de Thurstone
"No existe el juicio absoluto"
— Laming (2004) [ 1 ]
La ciencia del juicio comparativo se originó con Louis Leon Thurstone de la Universidad de Chicago . Pionero de la psicofísica , propuso varias formas de construir escalas para medir la sensación y otras propiedades psicológicas . Una de ellas fue la ley del juicio comparativo , [ 2 ] [ 3 ] [ 4 ] que definió una forma matemática de modelar la probabilidad de que un objeto «supere» a otro en una comparación, dados los valores de la «calidad» de cada uno. Esto es todo lo que se necesita para construir un sistema de medición completo.
Una variación de su modelo (véase Comparación por pares y el modelo BTL) establece que la diferencia entre sus valores de calidad es igual al logaritmo de las probabilidades de que el objeto A supere al objeto B:
Antes de la llegada de las computadoras modernas, las matemáticas necesarias para calcular los "valores" de la calidad de cada objeto limitaban el uso del método a conjuntos pequeños de objetos y restringían su aplicación. Para Thurstone, los objetos solían ser sensaciones, como la intensidad, o actitudes, como la gravedad de los delitos o la expresión de opiniones. Los investigadores sociales continuaron utilizando el método, al igual que los investigadores de mercado, para quienes los objetos podían ser diferentes diseños de habitaciones de hotel o variaciones de una nueva galleta propuesta.
En las décadas de 1970 y 1980, el juicio comparativo surgió, casi por primera vez en la evaluación educativa, como base teórica o precursor de las nuevas teorías de rasgos latentes o de respuesta al ítem (Andrich, 1978). Estos modelos son ahora estándar, especialmente en los bancos de ítems y los sistemas de evaluación adaptativa.
Reintroducción en la educación
El primer artículo publicado que utilizó el Juicio Comparativo en educación fue el de Pollitt y Murray (1994), esencialmente un trabajo de investigación sobre la naturaleza de la escala de competencia en inglés evaluada en la parte oral del examen CPE de Cambridge. Los sujetos de estudio fueron los candidatos, representados por fragmentos de vídeo de dos minutos de sus sesiones de examen, y los jueces fueron estudiantes de posgrado en Lingüística sin formación en evaluación. Los jueces compararon pares de fragmentos de vídeo, simplemente indicando cuál consideraban que era el mejor estudiante, y posteriormente fueron entrevistados clínicamente para obtener las razones de sus decisiones.
Pollitt introdujo entonces el método de Juicio Comparativo en los organismos certificadores del Reino Unido, como método para comparar los estándares de los exámenes A Levels de diferentes juntas examinadoras. El Juicio Comparativo sustituyó al método anterior, que requería la evaluación directa de un examen comparándolo con el estándar oficial de otra junta examinadora. Durante los dos o tres primeros años, Pollitt llevó a cabo todos los análisis para todas las juntas examinadoras, utilizando un programa que había escrito para tal fin. Inmediatamente se convirtió en el único método experimental utilizado para investigar la comparabilidad de los exámenes en el Reino Unido; las aplicaciones para este propósito entre 1996 y 2006 se describen detalladamente en Bramley (2007). [ 5 ]
En 2004, Pollitt presentó una ponencia en la conferencia de la Asociación Internacional para la Evaluación Educativa titulada «Dejemos de calificar los exámenes», y otra en la misma conferencia en 2009 titulada «Abolir el sistema de calificaciones». En ambas ponencias, el objetivo era convencer a la comunidad de evaluadores de las importantes ventajas de utilizar el juicio comparativo en lugar de la calificación para ciertos tipos de evaluación. En 2010, presentó una ponencia en la Asociación para la Evaluación Educativa – Europa, titulada «Cómo evaluar la escritura de forma fiable y válida», en la que se exponía la extraordinaria fiabilidad alcanzada con el juicio comparativo para evaluar la habilidad de los alumnos de primaria en la escritura en inglés como lengua materna.
juicio comparativo adaptativo
El juicio comparativo se convierte en una alternativa viable a la calificación cuando se implementa como un sistema de evaluación adaptativo basado en la web. En este, las "puntuaciones" (el parámetro del modelo para cada objeto) se reestiman después de cada "ronda" de juicios en la que, en promedio, cada objeto ha sido evaluado una vez más. En la siguiente ronda, cada guion se compara solo con otro cuya puntuación estimada actual sea similar, lo que aumenta la cantidad de información estadística contenida en cada juicio. Como resultado, el procedimiento de estimación es más eficiente que el emparejamiento aleatorio o cualquier otro sistema de emparejamiento predeterminado como los utilizados en las aplicaciones clásicas de juicio comparativo. (Pollitt, 2012). [ 6 ] Al igual que con las pruebas adaptativas por computadora, esta adaptabilidad maximiza la eficiencia del procedimiento de estimación, aumentando la separación de las puntuaciones y reduciendo los errores estándar. La ventaja más obvia es que esto produce una confiabilidad significativamente mejorada, en comparación con la evaluación por calificación, sin pérdida de validez.
No está claro si el juicio comparativo adaptativo realmente aumenta la fiabilidad. (Bramley, Vitello, 2016). [ 7 ]
Proyectos actuales de juicio comparativo
RM Compare
RM Compare es el sistema original de juicio comparativo adaptativo. [ 8 ] El sistema, desarrollado originalmente como CompareAssess por la empresa Digital Assess, anteriormente TAG Developments, está diseñado para ejecutar implementaciones a gran escala de juicios comparativos adaptativos y se ha utilizado en todo el mundo en una amplia gama de contextos.
Juicio comparativo
No More Marking ha creado una aplicación en línea para la evaluación comparativa, junto con un repositorio de información útil.
escapar
La primera aplicación del Juicio Comparativo a la evaluación directa de estudiantes se dio en un proyecto llamado e-scape , dirigido por el Prof. Richard Kimbell del Goldsmiths College de la Universidad de Londres (Kimbell y Pollitt, 2008). [ 9 ] El trabajo de desarrollo se llevó a cabo en colaboración con varios organismos certificadores en un curso de Diseño y Tecnología. El equipo de Kimbell desarrolló un proyecto sofisticado y auténtico en el que se requería que los estudiantes desarrollaran, hasta un prototipo, un objeto como un dispensador de pastillas para niños en dos sesiones supervisadas de tres horas.
El sistema de evaluación en línea fue diseñado por Karim Derrick y Declan Lynch de TAG Developments, ahora parte de Digital Assess, y se basa en el sistema original de portafolio de evaluación MAPS (software), ahora conocido como Manage. Goldsmiths, TAG Developments y Pollitt realizaron tres pruebas, aumentando el tamaño de la muestra de 20 a 249 estudiantes y desarrollando tanto el sistema de evaluación como el de calificación. Existen tres proyectos piloto, que incluyen Geografía y Ciencias, además del original en Diseño y Tecnología.
escritura en la escuela primaria
A finales de 2009, TAG Developments y Pollitt pusieron a prueba una nueva versión del sistema para evaluar la escritura. Un equipo de 54 jueces evaluó un total de 1000 trabajos de primaria en un contexto de evaluación nacional simulado. La fiabilidad de las puntuaciones obtenidas tras 16 evaluaciones de cada trabajo fue de 0,96, considerablemente superior a la de cualquier otro estudio publicado sobre evaluación de escritura similar . El desarrollo posterior del sistema ha demostrado que se puede alcanzar una fiabilidad de 0,93 tras aproximadamente 9 evaluaciones de cada trabajo, cuando el sistema no resulta más costoso que la corrección individual, pero sigue siendo mucho más fiable. [ 6 ]
Proyectos adicionales
Actualmente se están desarrollando varios proyectos en Inglaterra, Escocia, Irlanda, Israel, Singapur y Australia. Estos proyectos abarcan desde la educación primaria hasta la universitaria e incluyen evaluaciones formativas y sumativas , desde la escritura hasta las matemáticas. El sistema web básico ya está disponible comercialmente a través de TAG Assessment ( http://www.tagassessment.com ) y puede modificarse para adaptarse a necesidades específicas.
Desde 2009, Seery, Canty, Gordon y Lane, de la Universidad de Limerick (Irlanda), han utilizado ACJ para evaluar el trabajo de estudiantes de pregrado en programas de Formación Inicial del Profesorado. El Dr. Bartholomew, de la Universidad de Purdue, también ha utilizado ACJ para evaluar portafolios de diseño de estudiantes de secundaria, bachillerato y universidad. Asimismo, Bartholomew ha empleado ACJ como herramienta de evaluación formativa para la enseñanza y el aprendizaje de problemas abiertos.
Referencias
- ↑ Laming, Donald (2003). El juicio humano . Londres: Cengage Learning. ISBN 978-1-86152-777-6.
- ↑ Thurstone, LL (1927). "Análisis psicofísico" (PDF) . The American Journal of Psychology . 38 (3). University of Illinois Press: 368– 389. doi : 10.2307/1415006 . ISSN 0002-9556 . JSTOR 1415006. Consultado el 5 de diciembre de 2024 .
- ↑ Thurstone, LL (1959). La medición de valores . University of Chicago Press. OCLC 9794765 .
- ↑ Thurstone, LL (1927). "El método de comparaciones por pares para valores sociales". The Journal of Abnormal and Social Psychology . 21 (4): 384– 400. doi : 10.1037/h0065439 . ISSN 0096-851X .
- ↑ Bramley, Tom (2007). "Métodos de comparación por pares". Técnicas para monitorear la comparabilidad de los estándares de examen . 246 : 294.
- 1 2 Pollitt, Alastair (2012). "El método del juicio comparativo adaptativo". Evaluación en educación: principios, política y práctica . 19 (3): 281– 300. doi : 10.1080/0969594X.2012.665354 . ISSN 0969-594X .
- ↑ Bramley, Tom; Vitello, Sylvia (2019-01-02). "El efecto de la adaptabilidad en el coeficiente de fiabilidad en el juicio comparativo adaptativo". Assessment in Education: Principles, Policy & Practice . 26 (1): 43– 58. doi : 10.1080/0969594X.2017.1418734 . ISSN 0969-594X .
- ↑ "RM Compare" . RM plc . 2024-12-02 . Consultado el 2024-12-05 .
- ↑ Kimbell, Richard; Pollitt, Alastair (2008). Evaluación de trabajos de curso en exámenes de alto riesgo: autenticidad, creatividad, fiabilidad . Tercera conferencia internacional de medición Rasch. Perth, Australia Occidental.
Lecturas adicionales
- Pollitt, A (2015) Sobre el sesgo de fiabilidad en el ACJ: simulación válida del juicio comparativo adaptativo. Cambridge Exam Research: Cambridge, Reino Unido. Disponible en https://www.researchgate.net/publication/283318012_On_%27Reliability%27_bias_in_ACJ
- Normas de la APA, la AERA y la NCME (1999) para las pruebas educativas y psicológicas.
- Galton, F (1855) El genio hereditario : una investigación sobre sus leyes y consecuencias. Londres: Macmillan.
- Kimbell, RA, Wheeler A, Miller S y Pollitt A (2007) Evaluación de portafolios e-scape (soluciones electrónicas para la evaluación creativa en entornos de portafolios) : informe de la fase 2. TERU Goldsmiths, Universidad de Londres ISBN 978-1-904158-79-0
- Pollitt, A (2004) Dejemos de calificar exámenes. Conferencia anual de la Asociación Internacional para la Evaluación Educativa, Filadelfia, junio . Disponible en http://www.camexam.co.uk publicaciones.
- Pollitt, A. (2009) Abolir el marksismo y rescatar la validez . Conferencia anual de la Asociación Internacional para la Evaluación Educativa, Brisbane, septiembre. Disponible en http://www.camexam.co.uk/publications .
- Pollitt, A. y Murray, N. (1993) A qué prestan atención realmente los evaluadores . Coloquio de Investigación sobre Evaluación del Lenguaje, Cambridge. Republicado en Milanovic, M. y Saville, N. (Eds.), Estudios sobre Evaluación del Lenguaje 3: Evaluación del Desempeño, Cognición y Valoración, Cambridge University Press, Cambridge.
Enlaces externos
- RM Compare
- No More Marking Ltd.
- Escapar
- Recompensar el riesgo
- Evaluación TAG ACJ
- exámenes escolares
- Neurociencia
- psicología cognitiva
- Psicofísica
- Psicometría