Una prueba de clasificación computarizada ( CCT ) se refiere a un sistema de evaluación del desempeño administrado por computadora con el propósito de clasificar a los examinados. La CCT más común es una prueba de dominio que clasifica a los examinados como "Aprobado" o "Reprobado", pero el término también incluye pruebas que clasifican a los examinados en más de dos categorías. Si bien el término generalmente se considera que se refiere a todas las pruebas de clasificación administradas por computadora, suele usarse para referirse a pruebas de administración interactiva o de longitud variable, similares a las pruebas adaptativas computarizadas (CAT). Al igual que las CAT, las CCT de longitud variable pueden lograr el objetivo de la prueba (clasificación precisa) con una fracción de la cantidad de ítems utilizados en una prueba convencional de formato fijo.
Un CCT requiere varios componentes:
- Un banco de ítems calibrado con un modelo psicométrico seleccionado por el diseñador de la prueba.
- Un punto de partida
- Un algoritmo de selección de elementos
- Un criterio de terminación y un procedimiento de puntuación
El punto de partida no es motivo de controversia; la investigación sobre CCT se centra principalmente en la aplicación de diferentes métodos para los otros tres componentes. Nota: El criterio de finalización y el procedimiento de puntuación son distintos en CAT, pero iguales en CCT, ya que la prueba finaliza al obtenerse una clasificación. Por lo tanto, existen cinco componentes que deben especificarse para diseñar una CAT.
Una introducción a la CCT se encuentra en Thompson (2007) [ 1 ] y en un libro de Parshall, Spray, Kalohn y Davey (2006). [ 2 ] A continuación se incluye una bibliografía de investigaciones publicadas sobre CCT.
Cómo funciona
Una prueba CCT es muy similar a una CAT. Los ítems se administran uno a uno al examinado. Después de que el examinado responde al ítem, la computadora lo califica y determina si el examinado puede ser clasificado. Si lo es, la prueba finaliza y el examinado es clasificado. Si no, se administra otro ítem. Este proceso se repite hasta que el examinado sea clasificado o se alcance otro punto final (se hayan administrado todos los ítems del banco o se haya alcanzado la duración máxima de la prueba).
Modelo psicométrico
Existen dos enfoques para el modelo psicométrico de una prueba de competencias cognitivas (PCC): la teoría clásica de los tests (TCT) y la teoría de respuesta al ítem (TRI). La TCT presupone un modelo de estado, ya que se aplica determinando los parámetros de los ítems para una muestra de examinados clasificados en cada categoría. Por ejemplo, se podría muestrear a varios cientos de "expertos" y varios cientos de "no expertos" para determinar la dificultad y la discriminación de cada grupo, pero esto requiere poder identificar fácilmente un conjunto distinto de personas en cada grupo. La TRI, por otro lado, presupone un modelo de rasgo; el conocimiento o la habilidad que mide la prueba es un continuo. Los grupos de clasificación deberán definirse de forma más o menos arbitraria a lo largo del continuo, como el uso de un punto de corte para delimitar a los expertos de los no expertos, pero la especificación de los parámetros de los ítems presupone un modelo de rasgo.
Cada método tiene sus ventajas y desventajas. La TCT ofrece mayor simplicidad conceptual. Más importante aún, la TCT requiere menos participantes en la muestra para la calibración de los parámetros de los ítems que se utilizarán posteriormente en el diseño de la CCT, lo que la hace útil para programas de evaluación más pequeños. Véase Frick (1992) [ 3 ] para una descripción de una CCT basada en la TCT. Sin embargo, la mayoría de las CCT utilizan la IRT. La IRT ofrece mayor especificidad , pero la razón más importante puede ser que el diseño de una CCT (y una CAT) es costoso y, por lo tanto, es más probable que lo realice un programa de evaluación grande con amplios recursos. Dicho programa probablemente utilizaría la IRT.
Punto de partida
Un CCT debe tener un punto de partida específico para habilitar ciertos algoritmos. Si se utiliza la prueba de razón de probabilidad secuencial como criterio de terminación, se asume implícitamente una razón inicial de 1.0 (igual probabilidad de que el examinado sea un maestro o no maestro). Si el criterio de terminación es un enfoque de intervalo de confianza , se debe especificar un punto de partida en theta. Por lo general, este es 0.0, el centro de la distribución , pero también podría extraerse aleatoriamente de una distribución determinada si se conocen los parámetros de la distribución del examinado. Además, se puede utilizar información previa sobre un examinado individual, como su puntuación la última vez que realizó la prueba (si la está repitiendo).
Selección de artículos
En una CCT, los ítems se seleccionan para su administración a lo largo de la prueba, a diferencia del método tradicional de administrar un conjunto fijo de ítems a todos los examinados. Si bien esto generalmente se hace ítem por ítem, también se puede hacer en grupos de ítems conocidos como testlets (Leucht y Nungester, 1996; [ 4 ] Vos y Glas, 2000 [ 5 ] ).
Los métodos de selección de ítems se dividen en dos categorías: basados en el punto de corte y basados en la estimación. Los métodos basados en el punto de corte (también conocidos como selección secuencial) maximizan la información proporcionada por el ítem en el punto de corte, o puntos de corte si hay más de uno, independientemente de la habilidad del examinado. Los métodos basados en la estimación (también conocidos como selección adaptativa) maximizan la información en la estimación actual de la habilidad del examinado, independientemente de la ubicación del punto de corte. Ambos funcionan de manera eficiente, pero la eficiencia depende en parte del criterio de terminación empleado. Dado que la prueba de razón de probabilidad secuencial solo evalúa probabilidades cercanas al punto de corte, la selección de ítems basada en el punto de corte es más apropiada. Dado que el criterio de terminación del intervalo de confianza se centra en la estimación de la habilidad del examinado, la selección de ítems basada en la estimación es más apropiada. Esto se debe a que la prueba realizará una clasificación cuando el intervalo de confianza sea lo suficientemente pequeño como para estar completamente por encima o por debajo del punto de corte (véase más adelante). El intervalo de confianza será menor cuando el error estándar de medición sea menor, y el error estándar de medición será menor cuando haya más información en el nivel theta del examinado.
Criterio de terminación
Existen tres criterios de terminación comúnmente utilizados para las CCT. Los métodos de la teoría de decisión bayesiana ofrecen gran flexibilidad al presentar una selección infinita de estructuras de pérdida/utilidad y consideraciones de evaluación, pero también introducen mayor arbitrariedad. Un enfoque de intervalo de confianza calcula un intervalo de confianza alrededor de la estimación actual de theta del examinado en cada punto de la prueba, y clasifica al examinado cuando el intervalo cae completamente dentro de una región de theta que define una clasificación. Esto se conocía originalmente como prueba de dominio adaptativa ( Kingsbury y Weiss 1983 ) , pero no requiere necesariamente una selección adaptativa de ítems, ni se limita a la situación de prueba de dominio de dos clasificaciones. La prueba de razón de probabilidad secuencial ( Reckase 1983 ) define el problema de clasificación como una prueba de hipótesis de que el theta del examinado es igual a un punto especificado por encima de la puntuación de corte o un punto especificado por debajo de la puntuación de corte.
Referencias
- ↑ Thompson, NA (2007). "Guía práctica para pruebas de clasificación computarizadas de longitud variable" (PDF) . Practical Assessment Research & Evaluation . 12 (1). Archivado del original el 21 de octubre de 2007.
- ↑ Parshall, CG; Spray, JA; Kalohn, JC; Davey, T. (2006). Consideraciones prácticas en las pruebas basadas en computadora . Nueva York: Springer.
- ↑ Frick, T. (1992). "Pruebas de dominio adaptativas computarizadas como sistemas expertos". Journal of Educational Computing Research . 8 (2): 187– 213. doi : 10.2190/J87V-6VWP-52G7-L4XX .
- ↑ Luecht, RM; Nungester, RJ (1998). "Algunos ejemplos prácticos de pruebas secuenciales adaptativas por computadora". Journal of Educational Measurement . 35 : 229–249 . doi : 10.1111/j.1745-3984.1998.tb00537.x .
- ↑ Vos, HJ; Glas, CAW (2000). "Pruebas de dominio adaptativas basadas en conjuntos de pruebas". En van der Linden, WJ; Glas, CAW (eds.). Pruebas adaptativas computarizadas: teoría y práctica . doi : 10.1007/0-306-47531-6_15 .
Bibliografía de investigaciones sobre CCT
- Armitage, P. (1950). "Análisis secuencial con más de dos hipótesis alternativas y su relación con el análisis de función discriminante". Journal of the Royal Statistical Society . 12 : 137–144 .
- Braun, H.; Bejar, II; Williamson, DM (2006). "Métodos basados en reglas para la calificación automatizada: Aplicación en un contexto de licencias". En Williamson, DM; Mislevy, RJ; Bejar, II (eds.). Calificación automatizada de tareas complejas en pruebas informatizadas . Mahwah, NJ: Erlbaum.
- Dodd, BG; De Ayala, RJ; Koch, WR (1995). "Pruebas adaptativas computarizadas con ítems politómicos" . Medición psicológica aplicada . 19 : 5–22 .
- Eggen, TJHM (1999). "Selección de ítems en pruebas adaptativas con la prueba de razón de probabilidad secuencial" . Medición psicológica aplicada . 23 : 249–261 .
- Eggen, TJHM; Straetmans, GJJM (2000). "Pruebas adaptativas computarizadas para clasificar a los examinados en tres categorías" . Medición educativa y psicológica . 60 : 713–734 .
- Epstein, KI; Knerr, CS (1977). Aplicaciones de procedimientos de pruebas secuenciales a pruebas de rendimiento . Conferencia de Pruebas Adaptativas Computarizadas de 1977. Minneapolis, MN.
- Ferguson, RL (1969). El desarrollo, implementación y evaluación de una prueba ramificada asistida por computadora para un programa de instrucción individualizada (tesis doctoral, inédita). Universidad de Pittsburgh.
- Frick, TW (1989). "Adaptación bayesiana durante pruebas informatizadas y ejercicios guiados por ordenador". Journal of Educational Computing Research . 5 : 89–114 .
- Frick, TW (1990). "Una comparación de tres modelos de decisión para adaptar la duración de las pruebas de dominio basadas en computadora". Journal of Educational Computing Research . 6 : 479–513 .
- Frick, TW (1992). "Pruebas de dominio adaptativas computarizadas como sistemas expertos". Journal of Educational Computing Research . 8 : 187–213 .
- Huang, C.-Y.; Kalohn, JC; Lin, C.-J.; Spray, J. (2000). Estimación de parámetros de ítems a partir de índices clásicos para el desarrollo de bancos de ítems con una prueba de clasificación computarizada (Informe de investigación 2000–4). Iowa City, IA: ACT, Inc.
- Jacobs-Cassuto, MS (2005). Comparación de pruebas de dominio adaptativas mediante conjuntos de pruebas con el modelo logístico de 3 parámetros (tesis doctoral, inédita). Universidad de Minnesota, Minneapolis, MN.
- Jiao, H.; Lau, AC (abril de 2003). Los efectos del desajuste del modelo en las pruebas de clasificación computarizadas . Reunión anual del Consejo Nacional de Medición Educativa. Chicago, IL.
- Jiao, H.; Wang, S.; Lau, CA (abril de 2004). Una investigación de dos procedimientos combinados de SPRT para decisiones de clasificación de tres categorías en pruebas de clasificación computarizadas . Reunión anual de la Asociación Estadounidense de Investigación Educativa. San Antonio.
- Kalohn, JC; Spray, JA (1999). "El efecto de la especificación errónea del modelo en las decisiones de clasificación realizadas mediante una prueba computarizada". Journal of Educational Measurement . 36 : 47–59 .
- Kingsbury, GG; Weiss, DJ (1979). Una estrategia de evaluación adaptativa para decisiones de dominio (Informe de investigación 79–05). Minneapolis: Universidad de Minnesota, Laboratorio de Métodos Psicométricos.
- Kingsbury, GG; Weiss, DJ (1983). «Una comparación entre la evaluación adaptativa del dominio basada en la TRI y un procedimiento secuencial de evaluación del dominio». En Weiss, DJ (ed.). Nuevos horizontes en la evaluación: Teoría de los rasgos latentes y evaluación adaptativa computarizada . Nueva York: Academic Press. pp. 237–254 .
- Lau, CA (1996). Robustez de un procedimiento de evaluación computarizada unidimensional con datos de evaluación multidimensionales (Tesis doctoral, inédita). Universidad de Iowa, Iowa City, IA.
- Lau, CA; Wang, T. (1998). Comparación y combinación de ítems dicotómicos y politómicos con el procedimiento SPRT en pruebas de clasificación computarizadas . Reunión anual de la Asociación Estadounidense de Investigación Educativa. San Diego.
- Lau, CA; Wang, T. (1999). Pruebas de clasificación computarizadas bajo restricciones prácticas con un modelo politómico . Reunión anual de la Asociación Estadounidense de Investigación Educativa. Montreal, Canadá.
- Lau, CA; Wang, T. (2000). Un nuevo procedimiento de selección de ítems para tipos de ítems mixtos en pruebas de clasificación computarizadas . Reunión anual de la Asociación Estadounidense de Investigación Educativa. Nueva Orleans, Luisiana.
- Lewis, C.; Sheehan, K. (1990). "Uso de la teoría de la decisión bayesiana para diseñar una prueba de dominio computarizada" . Medición psicológica aplicada . 14 : 367–386 .
- Lin, C.-J.; Spray, JA (2000). Efectos de los criterios de selección de ítems en las pruebas de clasificación con la prueba de razón de probabilidad secuencial (Informe de investigación 2000–8). Iowa City, IA: ACT, Inc.
- Linn, RL; Rock, DA; Cleary, TA (1972). "Pruebas secuenciales para decisiones dicotómicas" . Educational & Psychological Measurement . 32 : 85–95 .
- Luecht, RM (1996). "Pruebas adaptativas computarizadas multidimensionales en un contexto de certificación o licencia" . Medición psicológica aplicada . 20 : 389–404 .
- Reckase, MD (1983). "Un procedimiento para la toma de decisiones mediante pruebas personalizadas". En Weiss, DJ (ed.). Nuevos horizontes en las pruebas: teoría de rasgos latentes y pruebas adaptativas computarizadas . Nueva York: Academic Press. pp. 237–254 .
- Rudner, LM (1–5 de abril de 2002). Un examen de los procedimientos de evaluación adaptativa basados en la teoría de la decisión . Reunión anual de la Asociación Estadounidense de Investigación Educativa. Nueva Orleans, LA.
- Sheehan, K.; Lewis, C. (1992). "Pruebas de dominio computarizadas con conjuntos de pruebas no equivalentes". Medición psicológica aplicada . 16 : 65–76 .
- Spray, JA (1993). Clasificación de múltiples categorías mediante una prueba de razón de probabilidad secuencial (Informe de investigación 93–7). Iowa City, Iowa: ACT, Inc.
- Spray, JA; Abdel-fattah, AA; Huang, C.; Lau, CA (1997). Aproximaciones unidimensionales para una prueba computarizada cuando el conjunto de ítems y el espacio latente son multidimensionales (Informe de investigación 97–5). Iowa City, Iowa: ACT, Inc.
- Spray, JA; Reckase, MD (1987). El efecto del error de estimación de parámetros de ítems en las decisiones tomadas utilizando la prueba de razón de probabilidad secuencial (Informe de investigación 87–17). Iowa City, IA: ACT, Inc.
- Spray, JA; Reckase, MD (5–7 de abril de 1994). La selección de ítems de prueba para la toma de decisiones con una prueba adaptativa computarizada . Reunión anual del Consejo Nacional de Medición en Educación. Nueva Orleans, LA.
- Spray, JA; Reckase, MD (1996). "Comparación de los procedimientos SPRT y Bayes secuencial para clasificar a los examinados en dos categorías mediante una prueba computarizada" . Journal of Educational & Behavioral Statistics . 21 : 405–414 .
- Thompson, NA (2006). "Pruebas de clasificación computarizadas de longitud variable con teoría de respuesta al ítem". CLEAR Exam Review . 17 (2).
- Vos, HJ (1998). "Reglas secuenciales óptimas para la instrucción asistida por computadora". Journal of Educational Computing Research . 19 : 133–154 .
- Vos, HJ (1999). "Aplicaciones de la teoría de la decisión bayesiana a las pruebas de dominio secuenciales" . Journal of Educational and Behavioral Statistics . 24 : 271–292 .
- Wald, A. (1947). Análisis secuencial . Nueva York: Wiley.
- Weiss, DJ; Kingsbury, GG (1984). "Aplicación de pruebas adaptativas computarizadas a problemas educativos". Journal of Educational Measurement . 21 : 361–375 .
- Weissman, A. (2004). Selección de ítems de información mutua en la clasificación de múltiples categorías CAT . Reunión anual del Consejo Nacional para la Medición en Educación. San Diego, CA.
- Weitzman, RA (1982a). "Pruebas secuenciales para la selección". Medición psicológica aplicada . 6 : 337–351 .
- Weitzman, RA (1982b). Weiss, DJ (ed.). Uso de pruebas secuenciales para la preselección de aspirantes al servicio militar . Actas de la Conferencia de Pruebas Adaptativas Computarizadas de 1982. Minneapolis, MN: Universidad de Minnesota, Departamento de Psicología, Programa de Métodos Psicométricos.
Enlaces externos
- Rudner, Lawrence. "Teoría de la decisión de medición" . Archivado del original el 16 de mayo de 2024.
- Weiss, David J. "CAT Central" . Archivado del original el 11 de julio de 2006.
- Psicometría
- Pruebas basadas en computadora
- exámenes escolares