Una prueba referenciada a la norma ( NRT ) es un tipo de prueba , evaluación o valoración que produce una estimación de la posición del individuo evaluado en una población predefinida, con respecto al rasgo que se está midiendo. La asignación de puntuaciones en dichas pruebas puede describirse como calificación relativa , calificación en una curva ( BrE ) o calificación en una curva ( AmE , CanE ) (también denominada calificación curva , curva de campana o uso de curvas de calificación ). Es un método para asignar calificaciones a los estudiantes de una clase de tal manera que se obtenga o se aproxime a una distribución preespecificada de estas calificaciones que tenga una media y propiedades de derivación específicas, como una distribución normal (también llamada distribución gaussiana ). [ 1 ] El término "curva" se refiere a la curva de campana , la representación gráfica de la densidad de probabilidad de la distribución normal, pero este método puede utilizarse para lograr cualquier distribución deseada de las calificaciones, por ejemplo, una distribución uniforme . La estimación se deriva del análisis de las puntuaciones de las pruebas y, posiblemente, de otros datos relevantes de una muestra extraída de la población. Es decir, este tipo de prueba identifica si el examinado obtuvo un mejor o peor resultado que otros examinados, no si posee más o menos conocimientos de los necesarios para un propósito determinado. El término evaluación normativa se utiliza cuando la población de referencia son los pares del examinado.
La evaluación referenciada a la norma se puede contrastar con la evaluación referenciada a criterios y la evaluación ipsativa . En una evaluación referenciada a criterios, la puntuación muestra si los examinados tuvieron un buen o mal desempeño en una tarea determinada, no cómo se compara con otros examinados; en un sistema ipsativo, los examinados se comparan con su desempeño anterior. Ambos métodos se pueden utilizar para calificar el mismo examen. [ 2 ]
Robert Glaser acuñó originalmente los términos prueba referenciada a la norma y prueba referenciada al criterio . [ 3 ]
Usos comunes
Muchos exámenes de ingreso a la universidad y pruebas escolares de uso nacional utilizan pruebas con referencia a normas. El SAT , el Examen de Admisión a Estudios de Posgrado (GRE) y la Escala de Inteligencia de Wechsler para Niños (WISC) comparan el desempeño individual del estudiante con el de una muestra normativa. Quienes realizan la prueba no pueden "reprobar" una prueba con referencia a normas, ya que cada uno recibe una puntuación que lo compara con otros que la han realizado, generalmente expresada en percentiles. Esto resulta útil cuando existe un amplio rango de puntuaciones aceptables y el objetivo es determinar quién tiene un mejor desempeño.
Las pruebas de CI son pruebas estandarizadas, ya que su objetivo es clasificar la inteligencia de quienes las realizan. El CI medio se establece en 100, y todos los participantes se clasifican en función de ese nivel.
Otros tipos
Como alternativas a las pruebas normativas, las pruebas pueden ser evaluaciones ipsativas o evaluaciones referenciadas a criterios.
Ipsativo
En una evaluación ipsativa , el desempeño de los individuos se compara únicamente con sus desempeños anteriores. [ 4 ] [ 5 ] Por ejemplo, una persona que está a dieta para bajar de peso es juzgada por cómo su peso actual se compara con su propio peso anterior, en lugar de cómo su peso se compara con un ideal o cómo se compara con otra persona.
Referenciado a criterios
Una prueba es referenciada a criterios cuando el desempeño se juzga según el comportamiento esperado o deseado. Las pruebas que evalúan al examinado en función de un estándar establecido (por ejemplo, todos deberían poder correr un kilómetro en menos de cinco minutos) son pruebas referenciadas a criterios. El objetivo de una prueba referenciada a criterios es determinar si el individuo puede correr tan rápido como el examinador desea, no determinar si el individuo es más rápido o más lento que los demás corredores. La reforma educativa basada en estándares se centra en las pruebas referenciadas a criterios. [ 6 ] [ 7 ] La mayoría de las pruebas y cuestionarios cotidianos que se realizan en la escuela, así como la mayoría de las pruebas de rendimiento estatales y los exámenes de graduación de la escuela secundaria , son referenciados a criterios. En este modelo, es posible que todos los examinados aprueben o que todos los examinados reprueben.
Comparación de pruebas referenciadas a criterios, referenciadas a dominios y referenciadas a normas.
Ambos términos, referenciado a criterios y referenciado a normas, fueron acuñados originalmente por Robert Glaser . [ 8 ] A diferencia de una prueba referenciada a criterios, una prueba referenciada a normas indica si el examinado lo hizo mejor o peor que otras personas que realizaron la prueba. Por ejemplo, si el criterio es "Los estudiantes deben ser capaces de sumar correctamente dos números de un solo dígito", entonces las preguntas razonables de la prueba podrían ser como "" o "Una prueba referenciada a criterios informaría el desempeño del estudiante estrictamente según si el estudiante individual respondió correctamente a estas preguntas. Una prueba referenciada a normas informaría principalmente si este estudiante respondió correctamente a más preguntas en comparación con otros estudiantes del grupo. Incluso al evaluar temas similares, una prueba diseñada para evaluar con precisión el dominio puede usar preguntas diferentes a una que está destinada a mostrar la clasificación relativa . Esto se debe a que algunas preguntas reflejan mejor el logro real de los estudiantes, y algunas preguntas de la prueba diferencian mejor entre los mejores y los peores estudiantes. (Muchas preguntas harán ambas cosas). Una prueba referenciada a criterios utilizará preguntas que fueron respondidas correctamente por estudiantes que conocen el material específico. Una prueba referenciada a normas utilizará preguntas que fueron respondidas correctamente por los "mejores" estudiantes y no correctamente por los "peores" estudiantes (por ejemplo, el examen de ingreso 'S' de la Universidad de Cambridge). Algunas pruebas pueden proporcionar información útil tanto sobre el logro real como sobre la clasificación relativa. El ACT proporciona tanto una clasificación como una indicación del nivel que se considera necesario para un probable éxito en la universidad. [ 9 ] Algunos argumentan que el término El término "prueba referenciada a criterios" es un nombre inapropiado, ya que puede referirse tanto a la interpretación de la puntuación como a la prueba en sí. [ 10 ] En el ejemplo anterior, la misma puntuación en el ACT puede interpretarse de forma referenciada a normas o referenciada a criterios.
Las pruebas referenciadas a dominios son similares a las pruebas referenciadas a criterios; se trata de evaluaciones que abarcan un área de estudio específica, de modo que la puntuación obtenida revela el grado de dominio de dicha área. Por lo tanto, si una persona obtiene el 90 % de las respuestas correctas en una prueba referenciada a dominios o a criterios , obtendrá una puntuación alta que indica su profundo conocimiento y comprensión del contenido evaluado. Este tipo de pruebas se diferencian de las pruebas referenciadas a normas , en las que las puntuaciones indican el desempeño de quien realiza la prueba en relación con otros participantes. [ 11 ] [ 12 ]
Métodos
Un método de calificación basado en una curva utiliza tres pasos:
- Se asignan puntuaciones numéricas (o posiblemente puntuaciones en una escala ordinal suficientemente detallada ) a los estudiantes. Los valores absolutos son menos relevantes, siempre que el orden de las puntuaciones corresponda al rendimiento relativo de cada estudiante dentro del curso.
- Estas puntuaciones se convierten en percentiles (o en algún otro sistema de cuantiles ).
- Los valores percentiles se transforman en grados según una división de la escala percentil en intervalos, donde la amplitud del intervalo de cada grado indica la frecuencia relativa deseada para ese grado.
Por ejemplo, si en un curso universitario hay cinco calificaciones: A, B, C, D y F, donde A está reservada para el 20 % superior de los estudiantes, B para el siguiente 30 %, C para el siguiente 30-40 %, y D o F para el 10-20 % restante, entonces las puntuaciones en el intervalo percentil del 0 % al 10-20 % recibirán una calificación de D o F, las puntuaciones del 11-21 % al 50 % recibirán una calificación de C, las puntuaciones del 51 % al 80 % recibirán una calificación de B, y las puntuaciones del 81 % al 100 % obtendrán una calificación de A.
De acuerdo con el ejemplo ilustrado anteriormente, una curva de calificaciones permite a las instituciones académicas asegurar la distribución de los estudiantes en función de ciertos umbrales de promedio de calificaciones (GPA). Dado que muchos profesores establecen la curva para alcanzar un promedio de curso de C, el promedio de calificaciones equivalente sería de 2.0 en una escala estándar de 4.0 utilizada en la mayoría de las universidades norteamericanas. [ 1 ] De manera similar, un promedio de calificaciones de 3.0 en una escala de 4.0 indicaría que el estudiante se encuentra dentro del 20 % superior de la clase. Las curvas de calificaciones sirven para otorgar mayor importancia a estas cifras, y la distribución específica empleada puede variar entre instituciones académicas. [ 13 ]
Ventajas y limitaciones
La principal ventaja de las pruebas de referencia normativa es que pueden proporcionar información sobre cómo se compara el rendimiento de un individuo en la prueba con el de otros miembros del grupo de referencia.
Una limitación importante de las pruebas de referencia normativa es que el grupo de referencia puede no representar a la población de interés. Como señala el sitio web del International Personality Item Pool del Oregon Research Institute , «Hay que tener mucho cuidado al usar "normas" predefinidas, ya que no es evidente que se pueda encontrar una población de la cual la muestra actual sea un subconjunto representativo. La mayoría de las "normas" son engañosas y, por lo tanto, no deberían usarse. Son mucho más fiables las normas locales, que uno mismo desarrolla. Por ejemplo, si se quiere dar retroalimentación a los alumnos de una clase, se debe relacionar la puntuación de cada individuo con las medias y desviaciones estándar derivadas de la propia clase. Para maximizar la información, se puede proporcionar a los alumnos la distribución de frecuencias para cada escala, basada en estas normas locales, y los alumnos pueden entonces encontrar (y marcar) sus propias puntuaciones en estas distribuciones relevantes». [ 14 ]
La referencia a normas no garantiza que una prueba sea válida (es decir, que mida el constructo que pretende medir).
Otra desventaja de las pruebas estandarizadas es que no pueden medir el progreso de la población en su conjunto, sino solo el de los individuos dentro de ese conjunto. En cambio, es necesario medir el desempeño en función de un objetivo fijo; por ejemplo, para medir el éxito de un programa de reforma educativa que busca elevar el rendimiento de todos los estudiantes.
Con una prueba referenciada a normas, el nivel de grado se establecía tradicionalmente en el nivel establecido por el 50 por ciento central de las puntuaciones. [ 15 ] Por el contrario, la National Children's Reading Foundation cree que es esencial asegurar que prácticamente todos los niños lean al nivel de grado o por encima de él para tercer grado, un objetivo que no se puede lograr con una definición de nivel de grado referenciada a normas. [ 16 ]
Las normas no implican automáticamente un estándar. Una prueba con referencia a normas no busca imponer ninguna expectativa sobre lo que los examinados deberían saber o ser capaces de hacer. Mide el nivel actual de los examinados comparándolos con sus compañeros. Un sistema basado en rangos solo proporciona datos que indican qué estudiantes tienen un rendimiento promedio, cuáles lo tienen superior y cuáles lo tienen inferior. No identifica qué examinados son capaces de realizar correctamente las tareas a un nivel aceptable para el empleo o la educación superior.
El objetivo principal de las curvas de calificación es minimizar o eliminar la influencia de las variaciones entre los distintos profesores de un mismo curso, garantizando que los estudiantes de cada clase sean evaluados en relación con sus compañeros. Esto también evita los problemas asociados con el uso de múltiples versiones de un mismo examen, un método que se emplea con frecuencia cuando las fechas de administración de las pruebas varían entre las distintas secciones de la clase. Independientemente de cualquier diferencia en el nivel de dificultad, real o percibida, la curva de calificación asegura una distribución equilibrada de los resultados académicos.
Sin embargo, la calificación con curva puede aumentar la competitividad entre los estudiantes y afectar su percepción de la imparcialidad del profesorado en clase. Los estudiantes suelen sentirse más molestos cuando la curva reduce su calificación en comparación con la que habrían obtenido si no se hubiera aplicado. Para evitarlo, los profesores se esfuerzan por garantizar que la prueba sea lo suficientemente difícil cuando se aplica la curva, de modo que el estudiante promedio obtenga una puntuación bruta inferior a la puntuación que se utilizará como promedio en la curva, asegurando así que todos los estudiantes se beneficien de ella. Por lo tanto, las calificaciones con curva no pueden utilizarse indiscriminadamente y deben considerarse y sopesarse cuidadosamente en comparación con alternativas como la calificación por criterios. Además, el uso indebido constante de la calificación con curva puede alterar las calificaciones de pruebas mal diseñadas, mientras que las evaluaciones deben diseñarse para reflejar con precisión los objetivos de aprendizaje establecidos por el profesor. [ 17 ]
Véase también
- Inventario de conceptos
- evaluación educativa
- Igualar
- Calificación en la educación
- Lista de curvas de calificaciones promedio de la facultad de derecho
- Constante macabra
- Psicometría
- Prueba estandarizada : todos los individuos realizan la misma prueba bajo las mismas condiciones; se utiliza tanto para pruebas con referencia a la norma como para pruebas con referencia a criterios.
Referencias
- 1 2 Roell, Kelly. "¿Qué es calificar con una curva?" . About.com. Archivado del original el 1 de diciembre de 2016. Recuperado el 13 de noviembre de 2013 .
- ↑ Cronbach, LJ (1970). Fundamentos de las pruebas psicológicas (3.ª ed.). Nueva York: Harper & Row.
- ↑ Glaser, R. (1963). "Tecnología instruccional y la medición de los resultados del aprendizaje". American Psychologist . 18 : 510–522 . doi : 10.1037/h0049294 .
- ↑ Evaluación
- ↑ "Presentación en PDF" (PDF) . Archivado del original (PDF) el 24/09/2015 . Consultado el 21/07/2006 .
- ↑ stories 5-01.html Archivado el 10/01/2020 en Wayback Machine Fairtest.org: Times on Testing Las pruebas "con referencia a criterios" miden a los estudiantes contra una vara de medir fija, no entre sí.
- ↑ "Junta Estatal de Educación de Illinois - Estándares de Aprendizaje de Illinois" . Archivado del original el 14 de abril de 2010. Consultado el 14 de abril de 2010 .Estándares de aprendizaje de Illinois
- ↑ Glaser, R. (1963). "Tecnología instruccional y la medición de los resultados del aprendizaje". American Psychologist . 18 (8): 519– 522. doi : 10.1037/h0049294 .
- ↑ Cronbach, LJ (1970). Fundamentos de las pruebas psicológicas (3.ª ed.). Nueva York: Harper & Row.
- ↑ Haertel, E. (1985). "Validez de constructo y pruebas con referencia a criterios". Review of Educational Research . 55 (1): 23– 46. doi : 10.3102/00346543055001023 . S2CID 145124784 .
- ↑ "Prueba referenciada al dominio" . Diccionario de Psicología de la APA . Washington, DC: Asociación Americana de Psicología . s.f. Consultado el 19 de febrero de 2021 .
- ↑ Denham, Carolyn H. (1975). "Medición referenciada a criterios, referenciada a dominios y referenciada a normas: una perspectiva de paralaje" . Educational Technology . 15 (12): 9– 13. ISSN 0013-1962 . JSTOR 44418878 .
- ↑ Volokh, Eugene (9 de febrero de 2015). "Elogio de la calificación según una curva" . Washington Post . Consultado el 18 de mayo de 2017.
Al igual que la democracia, la calificación según una curva puede ser el peor sistema posible, excepto por todas las alternativas.
- ^ Instituto de Investigación de Oregón, sitio web de IPIP, http://ipip.ori.org/newNorms.htm
- ↑NCTM: Noticias y medios de comunicación: Problemas de evaluación (Boletín informativo de abril de 2004) "Por definición, la mitad de los estudiantes del país están por debajo del nivel de grado en cualquier momento dado".
- ↑Archivado el 11 de marzo de 2007 en el sitio web de la Fundación Nacional de Lectura Infantil Wayback Machine .
- ↑ Reese, Michael (13 de mayo de 2013). "Curva o no curva" . El blog del instructor innovador . Universidad Johns Hopkins . Recuperado el 13 de mayo de 2013 .
Enlaces externos
- Un análisis exhaustivo de los tipos de curvas
- Una breve nota sobre las estadísticas de calificaciones o cómo se calcula la curva.
- Cómo crear una curva de campana en Excel
- Pruebas psicológicas
- Pruebas estandarizadas
- psicología educativa
- métodos de evaluación educativa