Articulo de referencia

teoría de respuesta al ítem

En psicometría , la teoría de respuesta al ítem ( TRI , también conocida como teoría de rasgos latentes , teoría de la puntuación verdadera fuerte o teoría moderna de las prueba...

En psicometría , la teoría de respuesta al ítem ( TRI , también conocida como teoría de rasgos latentes , teoría de la puntuación verdadera fuerte o teoría moderna de las pruebas mentales ) es un paradigma para el diseño, análisis y puntuación de pruebas , cuestionarios e instrumentos similares que miden habilidades, actitudes u otras variables. Es una teoría de la evaluación basada en la relación entre el desempeño de los individuos en un ítem de la prueba y los niveles de desempeño de los evaluados en una medida general de la habilidad que dicho ítem fue diseñado para medir. Se utilizan varios modelos estadísticos diferentes para representar tanto las características del ítem como las del evaluado. [ 1 ] A diferencia de alternativas más simples para crear escalas y evaluar las respuestas de los cuestionarios, no asume que cada ítem sea igualmente difícil. Esto distingue a la TRI de, por ejemplo, la escala Likert , en la que "se asume que todos los ítems son réplicas entre sí o, en otras palabras, los ítems se consideran instrumentos paralelos". [ 2 ] Por el contrario, la teoría de respuesta al ítem trata la dificultad de cada ítem (las curvas características del ítem, o CCI ) como información que se incorpora en la escala de los ítems.

La IRT se basa en la aplicación de modelos matemáticos a datos de prueba . Debido a su capacidad para manejar situaciones de prueba más complejas en comparación con la teoría clásica de pruebas , [ 3 ] la IRT es el método preferido en varias evaluaciones de alto riesgo, incluyendo el Graduate Record Examination (GRE) y el Graduate Management Admission Test (GMAT).

La denominación de teoría de respuesta al ítem (TRI) se debe a que se centra en el ítem, a diferencia de la teoría clásica de los tests, que se centra en el nivel de la prueba. Así, la TRI modela la respuesta de cada examinado de una determinada habilidad a cada ítem de la prueba. El término ítem es genérico y abarca todo tipo de elementos informativos. Pueden ser preguntas de opción múltiple con respuestas correctas e incorrectas, pero también suelen ser afirmaciones en cuestionarios que permiten a los encuestados indicar su nivel de acuerdo (una escala de valoración o Likert ), síntomas de pacientes marcados como presentes/ausentes o información diagnóstica en sistemas complejos.

La IRT se basa en la idea de que la probabilidad de una respuesta correcta a un ítem es una función matemática de los parámetros de la persona y del ítem . (La expresión "una función matemática de los parámetros de la persona y del ítem" es análoga a la ecuación de Lewin , B = f(P, E) , que afirma que el comportamiento es una función de la persona en su entorno). El parámetro de la persona se interpreta (generalmente) como un único rasgo o dimensión latente. Ejemplos de ello son la inteligencia general o la fuerza de una actitud. Los parámetros que caracterizan a los ítems incluyen su dificultad (conocida como "ubicación" por su posición en el rango de dificultad); la discriminación (pendiente o correlación), que representa cuán pronunciadamente varía la tasa de éxito de los individuos con su habilidad; y un parámetro de pseudoadivinación, que caracteriza la asíntota (inferior) en la que incluso las personas menos capaces obtendrán una puntuación debido a la adivinación (por ejemplo, 25% para una probabilidad puramente aleatoria en un ítem de opción múltiple con cuatro posibles respuestas).

Descripción general

El concepto de función de respuesta al ítem existía antes de 1950. El trabajo pionero de la TRI como teoría tuvo lugar durante las décadas de 1950 y 1960. Tres de los pioneros fueron el psicometrista del Educational Testing Service, Frederic M. Lord , [ 4 ] el matemático danés Georg Rasch y el sociólogo austriaco Paul Lazarsfeld , quienes llevaron a cabo investigaciones paralelas de forma independiente. Figuras clave que impulsaron el progreso de la TRI incluyen a Benjamin Drake Wright y David Andrich . La TRI no se generalizó hasta finales de las décadas de 1970 y 1980, cuando a los profesionales se les explicó la "utilidad" y las "ventajas" de la TRI, por un lado, y las computadoras personales brindaron a muchos investigadores acceso a la potencia de cálculo necesaria para la TRI, por otro. En la década de 1990, Margaret Wu desarrolló dos programas de software de respuesta al ítem que analizan datos de PISA y TIMSS : ACER ConQuest (1998) y el paquete R TAM (2010).

Entre otras cosas, el propósito de la TRI es proporcionar un marco para evaluar la eficacia de las evaluaciones y de los ítems individuales que las componen. La aplicación más común de la TRI se encuentra en la educación, donde los psicometristas la utilizan para desarrollar y diseñar exámenes , mantener bancos de ítems para exámenes y equiparar la dificultad de los ítems en versiones sucesivas de exámenes (por ejemplo, para permitir comparaciones entre resultados a lo largo del tiempo). [ 5 ]

Los modelos de la Teoría de Respuesta al Ítem (TRI) suelen denominarse modelos de rasgos latentes . El término «latente» se utiliza para enfatizar que las respuestas a los ítems individuales se consideran manifestaciones observables de rasgos, constructos o atributos hipotetizados, no directamente observables, sino que deben inferirse a partir de las respuestas manifiestas. Los modelos de rasgos latentes se desarrollaron en el campo de la sociología, pero son prácticamente idénticos a los modelos TRI.

Generalmente se afirma que la TRI representa una mejora con respecto a la teoría clásica de los tests (TCT). Para las tareas que pueden realizarse con la TCT, la TRI ofrece mayor flexibilidad y proporciona información más sofisticada. Algunas aplicaciones, como las pruebas adaptativas computarizadas , son posibles gracias a la TRI y no pueden llevarse a cabo de forma razonable utilizando únicamente la teoría clásica de los tests. Otra ventaja de la TRI sobre la TCT es que la información más sofisticada que proporciona permite al investigador mejorar la fiabilidad de una evaluación .

La teoría de respuesta al ítem (TRI) implica tres supuestos:

  1. Un rasgo unidimensional denotado porθ{\displaystyle {\theta }} ;
  2. Independencia local de los artículos;
  3. La respuesta de una persona a un ítem puede modelarse mediante una función de respuesta al ítem (FRI) matemática.

Se asume además que el rasgo es medible en una escala (la mera existencia de una prueba lo presupone), generalmente establecida en una escala estándar con una media de 0,0 y una desviación estándar de 1,0. La unidimensionalidad debe interpretarse como homogeneidad, una cualidad que debe definirse o demostrarse empíricamente en relación con un propósito o uso determinado, pero no una cantidad que pueda medirse. La «independencia local» significa (a) que la probabilidad de que se utilice un ítem no está relacionada con el uso de ningún otro ítem y (b) que la respuesta a un ítem es una decisión independiente de cada examinado, es decir, no hay trampas ni trabajo en parejas o en grupo. El tema de la dimensionalidad se investiga a menudo con el análisis factorial , mientras que la IRF es el componente básico de la IRT y es el centro de gran parte de la investigación y la literatura.

La función de respuesta al ítem

La función de respuesta al ítem (FRI) indica la probabilidad de que una persona con un nivel de habilidad determinado responda correctamente. Las personas con menor habilidad tienen menos probabilidades, mientras que las personas con mayor habilidad tienen una alta probabilidad de responder correctamente; por ejemplo, los estudiantes con mayor habilidad matemática tienen más probabilidades de acertar un ítem de matemáticas. El valor exacto de la probabilidad depende, además de la habilidad, de un conjunto de parámetros del ítem para la FRI.

Modelo logístico de tres parámetros

Figura 1: Ejemplo de IRF 3PL, con líneas punteadas superpuestas para mostrar los parámetros.

Por ejemplo, en el modelo logístico de tres parámetros ( 3PL ), la probabilidad de una respuesta correcta a un ítem dicotómico i , generalmente una pregunta de opción múltiple, es:

pagi(θ)=doi+1doi1+miai(θbi){\displaystyle p_{i}({\theta })=c_{i}+{\frac {1-c_{i}}{1+e^{-a_{i}({\theta }-b_{i})}}}}

dóndeθ{\displaystyle {\theta }}Esto indica que las habilidades de la persona se modelan como una muestra de una distribución normal con el fin de estimar los parámetros de los ítems. Una vez estimados los parámetros de los ítems, se estiman las habilidades de cada persona para fines de elaboración de informes.ai{\displaystyle a_{i}},bi{\displaystyle b_{i}}, ydoi{\displaystyle c_{i}}son los parámetros del elemento. Los parámetros del elemento determinan la forma de la IRF. La Figura 1 muestra un ICC 3PL ideal.

Los parámetros de los elementos pueden interpretarse como un cambio en la forma de la función logística estándar : PAG(t)=11+mit.{\displaystyle P(t)={\frac {1}{1+e^{-t}}}.} En resumen, los parámetros se interpretan de la siguiente manera (omitiendo los subíndices para mayor legibilidad); b es el más básico, por lo que aparece primero:

  • b – dificultad, ubicación del elemento:pag(b)=(1+do)/2,{\displaystyle p(b)=(1+c)/2,}el punto medio entredoi{\displaystyle c_{i}}(mín.) y 1 (máx.), también donde la pendiente es máxima.
  • a – discriminación, escala, pendiente: la pendiente máximapag(b)=a(1do)/4.{\displaystyle p'(b)=a\cdot (1-c)/4.}
  • c – pseudoadivinación, azar, mínimo asintóticopag()=do.{\displaystyle p(-\infty )=c.}

Sido=0,{\displaystyle c=0,}entonces estos se simplifican apag(b)=1/2{\displaystyle p(b)=1/2}ypag(b)=a/4,{\displaystyle p'(b)=a/4,}lo que significa que b es igual al nivel de éxito del 50% (dificultad), y a (dividido por cuatro) es la pendiente máxima (discriminación), que ocurre en el nivel de éxito del 50%. Además, el logit (logaritmo de las probabilidades ) de una respuesta correcta esa(θb){\displaystyle a(\theta -b)}(arrogantedo=0{\displaystyle c=0}): en particular, si la habilidad θ es igual a la dificultad b, hay probabilidades iguales (1:1, por lo que logit 0) de una respuesta correcta, cuanto mayor sea la habilidad por encima (o por debajo) de la dificultad, más (o menos) probable será una respuesta correcta, y la discriminación a determina con qué rapidez aumentan o disminuyen las probabilidades con la habilidad.

En otras palabras, la función logística estándar tiene un mínimo asintótico de 0 (do=0{\displaystyle c=0}), se centra en torno a 0 (b=0{\displaystyle b=0},PAG(0)=1/2{\displaystyle P(0)=1/2}), y tiene pendiente máximaPAG(0)=1/4.{\displaystyle P'(0)=1/4.}Ela{\displaystyle a}El parámetro estira la escala horizontal, elb{\displaystyle b}El parámetro desplaza la escala horizontal y lado{\displaystyle c}El parámetro comprime la escala vertical desde[0,1]{\displaystyle [0,1]}a[do,1].{\displaystyle [c,1].}Esto se explica con más detalle a continuación.

El parámetrobi{\displaystyle b_{i}}representa la ubicación del elemento que, en el caso de las pruebas de logro, se denomina dificultad del elemento. Es el punto enθ{\displaystyle {\theta }}donde la IRF tiene su pendiente máxima y donde el valor está a medio camino entre el valor mínimo dedoi{\displaystyle c_{i}}y el valor máximo de 1. El elemento de ejemplo es de dificultad media ya quebi{\displaystyle b_{i}}=0,0, que se encuentra cerca del centro de la distribución. Cabe destacar que este modelo escala la dificultad del ítem y el rasgo de la persona en el mismo continuo. Por lo tanto, es válido decir que un ítem es aproximadamente tan difícil como el nivel del rasgo de la Persona A, o que el nivel del rasgo de una persona es aproximadamente igual a la dificultad del Ítem Y, en el sentido de que el desempeño exitoso de la tarea relacionada con un ítem refleja un nivel específico de habilidad.

El parámetro del elementoai{\displaystyle a_{i}}representa la discriminación del ítem: es decir, el grado en que el ítem discrimina entre personas en diferentes regiones del continuo latente. Este parámetro caracteriza la pendiente de la IRF donde la pendiente es máxima. El ítem de ejemplo tieneai{\displaystyle a_{i}}=1,0, lo que permite una discriminación bastante buena; las personas con baja capacidad tienen, en efecto, una probabilidad mucho menor de responder correctamente que las personas con mayor capacidad. Este parámetro de discriminación corresponde al coeficiente de ponderación del ítem o indicador correspondiente en una regresión lineal ponderada estándar (mínimos cuadrados ordinarios, MCO ) y, por lo tanto, puede utilizarse para crear un índice ponderado de indicadores para la medición no supervisada de un concepto latente subyacente.

Para elementos como los de opción múltiple , el parámetrodoi{\displaystyle c_{i}}Se utiliza para intentar explicar los efectos de adivinar en la probabilidad de una respuesta correcta. Indica la probabilidad de que individuos con muy baja capacidad acierten este ítem por casualidad, representada matemáticamente como una asíntota inferior . Un ítem de opción múltiple de cuatro opciones podría tener una IRF como la del ítem de ejemplo; hay una probabilidad de 1/4 de que un candidato con capacidad extremadamente baja adivine la respuesta correcta, por lo quedoi{\displaystyle c_{i}}sería aproximadamente 0,25. Este enfoque supone que todas las opciones son igualmente plausibles, porque si una opción no tuviera sentido, incluso la persona con menor capacidad podría descartarla, por lo que los métodos de estimación de parámetros de la TRI tienen esto en cuenta y estiman undoi{\displaystyle c_{i}}basado en los datos observados. [ 6 ]

modelos IRT

En términos generales, los modelos IRT se pueden dividir en dos familias: unidimensionales y multidimensionales. Los modelos unidimensionales requieren una sola dimensión de rasgo (habilidad).θ{\displaystyle {\theta }}Los modelos IRT multidimensionales modelan datos de respuesta que, según la hipótesis, provienen de múltiples rasgos. Sin embargo, debido a la gran complejidad que esto implica, la mayoría de las investigaciones y aplicaciones de IRT utilizan un modelo unidimensional.

Los modelos IRT también se pueden categorizar según el número de respuestas puntuadas. El ítem típico de opción múltiple es dicotómico ; aunque puede haber cuatro o cinco opciones, se puntúa solo como correcto/incorrecto (correcto/incorrecto). Otra clase de modelos se aplica a resultados politómicos , donde cada respuesta tiene un valor de puntuación diferente. [ 7 ] [ 8 ] Un ejemplo común de esto son los ítems tipo Likert , por ejemplo, "Califique en una escala del 1 al 5". Otro ejemplo es la puntuación de crédito parcial, a la que se pueden aplicar modelos como el modelo Rasch politómico .

Número de parámetros IRT

Los modelos IRT dicotómicos se describen por la cantidad de parámetros que utilizan. [ 9 ] El 3PL se llama así porque emplea tres parámetros de ítem. El modelo de dos parámetros (2PL) supone que los datos no tienen adivinación, pero que los elementos pueden variar en términos de ubicación (bi{\displaystyle b_{i}}) y discriminación (ai{\displaystyle a_{i}}). El modelo de un parámetro (1PL) supone que adivinar es parte de la habilidad y que todos los elementos que se ajustan al modelo tienen discriminaciones equivalentes, de modo que los elementos se describen únicamente mediante un único parámetro (bi{\displaystyle b_{i}}Esto da como resultado que los modelos de un parámetro tengan la propiedad de objetividad específica, lo que significa que el rango de dificultad del ítem es el mismo para todos los encuestados independientemente de la habilidad, y que el rango de habilidad de la persona es el mismo para los ítems independientemente de la dificultad. Por lo tanto, los modelos de 1 parámetro son independientes de la muestra, una propiedad que no se cumple para los modelos de dos y tres parámetros. Además, teóricamente existe un modelo de cuatro parámetros (4PL), con una asíntota superior , denotada pordi,{\displaystyle d_{i},}dónde1doi{\displaystyle 1-c_{i}}en el 3PL se reemplaza pordidoi{\displaystyle d_{i}-c_{i}}. Sin embargo, esto se usa raramente. Tenga en cuenta que el orden alfabético de los parámetros de los ítems no coincide con su importancia práctica o psicométrica; la ubicación/dificultad (bi{\displaystyle b_{i}}El parámetro ) es claramente el más importante porque está incluido en los tres modelos. El 1PL utiliza solobi{\displaystyle b_{i}}, el 2PL utilizabi{\displaystyle b_{i}}yai{\displaystyle a_{i}}, el 3PL añadedoi{\displaystyle c_{i}}y el 4PL añadedi{\displaystyle d_{i}}.

El modelo 2PL es equivalente al modelo 3PL condoi=0{\displaystyle c_{i}=0}y es apropiado para evaluar ítems en los que adivinar la respuesta correcta es muy improbable, como los ítems de completar espacios en blanco ("¿Cuál es la raíz cuadrada de 121?"), o donde el concepto de adivinar no se aplica, como los ítems de personalidad, actitud o interés (por ejemplo, "Me gustan los musicales de Broadway. De acuerdo/En desacuerdo").

El modelo 1PL asume no solo que no hay (o es irrelevante) la posibilidad de adivinar, sino también que todos los ítems son equivalentes en términos de discriminación, de forma análoga a un análisis factorial común con cargas idénticas para todos los ítems. Los ítems o individuos individuales pueden tener factores secundarios, pero se asume que estos son mutuamente independientes y colectivamente ortogonales .

Modelos IRT logísticos y normales

Una formulación alternativa construye funciones de respuesta impulsional (FRI) basadas en la distribución de probabilidad normal ; a estas se las denomina a veces modelos de ojiva normal . Por ejemplo, la fórmula para una FRI de ojiva normal de dos parámetros es:

pagi(θ)=Φ(θbiσi){\displaystyle p_{i}(\theta )=\Phi \left({\frac {\theta -b_{i}}{\sigma _{i}}}\right)}

donde Φ es la función de distribución acumulativa (CDF) de la distribución normal estándar.

El modelo de ojiva normal se deriva de la suposición de un error de medición con distribución normal y, sobre esa base, resulta teóricamente atractivo.bi{\displaystyle b_{i}}es, de nuevo, el parámetro de dificultad. El parámetro de discriminación esσi{\displaystyle {\sigma }_{i}}, la desviación estándar del error de medición para el elemento i , y comparable a 1/ai{\displaystyle a_{i}}.

Se puede estimar un modelo de rasgo latente de ojiva normal mediante el análisis factorial de una matriz de correlaciones tetracóricas entre ítems. [ 10 ] Esto significa que es técnicamente posible estimar un modelo IRT simple utilizando software estadístico de propósito general.

Al reescalar el parámetro de habilidad, es posible lograr que el modelo logístico 2PL se aproxime mucho a la ojiva normal acumulativa . [ 11 ] Por lo general, las funciones de respuesta al impulso (IRF) del modelo logístico 2PL y de la ojiva normal difieren en probabilidad en no más de 0,01 en todo el rango de la función. Sin embargo, la diferencia es mayor en las colas de la distribución, que tienden a tener mayor influencia en los resultados.

El modelo de rasgo latente/TRI se desarrolló originalmente utilizando ojivas normales, pero se consideró que esto requería demasiados recursos computacionales para las computadoras de la época (década de 1960). El modelo logístico se propuso como una alternativa más simple y desde entonces ha tenido un amplio uso. Sin embargo, más recientemente se demostró que, utilizando aproximaciones polinómicas estándar a la función de distribución acumulada normal , [ 12 ] el modelo de ojiva normal no requiere más recursos computacionales que los modelos logísticos. [ 13 ]

El modelo de Rasch

El modelo de Rasch se suele considerar el modelo IRT de 1PL. Sin embargo, los defensores del modelado de Rasch prefieren verlo como un enfoque completamente diferente para conceptualizar la relación entre datos y teoría. [ 14 ] Al igual que otros enfoques de modelado estadístico, IRT enfatiza la primacía del ajuste de un modelo a los datos observados, [ 15 ] mientras que el modelo de Rasch enfatiza la primacía de los requisitos para la medición fundamental, siendo el ajuste adecuado de los datos al modelo un requisito importante pero secundario que debe cumplirse antes de que se pueda afirmar que una prueba o instrumento de investigación mide un rasgo. [ 16 ] Operacionalmente, esto significa que los enfoques IRT incluyen parámetros de modelo adicionales para reflejar los patrones observados en los datos (por ejemplo, permitiendo que los ítems varíen en su correlación con el rasgo latente), mientras que en el enfoque de Rasch, las afirmaciones sobre la presencia de un rasgo latente solo pueden considerarse válidas cuando (a) los datos se ajustan al modelo de Rasch, y (b) los ítems de la prueba y los examinados se ajustan al modelo. Por lo tanto, en los modelos de Rasch, las respuestas que no se ajustan al modelo requieren un diagnóstico de la razón de dicha falta de ajuste, y pueden excluirse del conjunto de datos si se puede explicar de manera sustancial por qué no abordan el rasgo latente. [ 17 ] Así, el enfoque de Rasch puede considerarse un enfoque confirmatorio, a diferencia de los enfoques exploratorios que intentan modelar los datos observados.

La presencia o ausencia de un parámetro de adivinación o pseudoazar es una distinción importante y a veces controvertida. El enfoque IRT incluye un parámetro de asíntota izquierda para tener en cuenta la adivinación en exámenes de opción múltiple , mientras que el modelo de Rasch no lo hace porque se supone que la adivinación agrega ruido distribuido aleatoriamente a los datos. Como el ruido está distribuido aleatoriamente, se supone que, siempre que se prueben suficientes ítems, el orden de rango de las personas a lo largo del rasgo latente por puntuación bruta no cambiará, sino que simplemente sufrirá un reescalamiento lineal. Por el contrario, IRT de tres parámetros logra el ajuste del modelo de datos al seleccionar un modelo que se ajuste a los datos, [ 18 ] a costa de sacrificar la objetividad específica .

En la práctica, el modelo de Rasch tiene al menos dos ventajas principales en comparación con el enfoque IRT. La primera ventaja es la primacía de los requisitos específicos de Rasch, [ 19 ] que (cuando se cumplen) proporciona una medición fundamental independiente de la persona (donde las personas y los ítems pueden mapearse en la misma escala invariante). [ 20 ] Otra ventaja del enfoque de Rasch es que la estimación de parámetros es más directa en los modelos de Rasch debido a la presencia de estadísticas suficientes, lo que en esta aplicación significa un mapeo uno a uno de las puntuaciones brutas de número correcto a Raschθ{\displaystyle {\theta }}estimaciones. [ 21 ]

Análisis del ajuste del modelo

Como ocurre con cualquier uso de modelos matemáticos, es importante evaluar el ajuste de los datos al modelo. Si se diagnostica que la falta de ajuste de un ítem a un modelo se debe a la mala calidad del ítem, por ejemplo, distractores confusos en una prueba de opción múltiple, entonces los ítems pueden eliminarse de esa versión de la prueba y reescribirse o reemplazarse en versiones futuras. Sin embargo, si se presenta un gran número de ítems que no se ajustan al modelo sin una razón aparente, será necesario reconsiderar la validez de constructo de la prueba y posiblemente reescribir sus especificaciones. Por lo tanto, la falta de ajuste proporciona herramientas de diagnóstico invaluables para los desarrolladores de pruebas, permitiendo que las hipótesis en las que se basan las especificaciones de la prueba se sometan a pruebas empíricas con datos.

Existen varios métodos para evaluar el ajuste, como la estadística chi-cuadrado o una versión estandarizada de la misma. Los modelos IRT de dos y tres parámetros ajustan la discriminación de los ítems, lo que garantiza un mejor ajuste entre los datos y el modelo, por lo que las estadísticas de ajuste carecen del valor diagnóstico confirmatorio que se encuentra en los modelos de un parámetro, donde el modelo idealizado se especifica de antemano.

Los datos no deben eliminarse por un ajuste deficiente al modelo, sino porque se ha diagnosticado una razón relevante para dicho ajuste, como por ejemplo, que un hablante no nativo de inglés realice una prueba de ciencias escrita en inglés. Se puede argumentar que dicho candidato no pertenece a la misma población, dependiendo de la dimensionalidad de la prueba, y, aunque se argumenta que las medidas IRT de un parámetro son independientes de la muestra, no lo son de la población; por lo tanto, un ajuste de este tipo es relevante para el constructo y no invalida la prueba ni el modelo. Este enfoque es una herramienta esencial en la validación de instrumentos. En los modelos de dos y tres parámetros, donde el modelo psicométrico se ajusta a los datos, las futuras administraciones de la prueba deben verificarse para comprobar su ajuste al mismo modelo utilizado en la validación inicial, con el fin de confirmar la hipótesis de que las puntuaciones de cada administración se generalizan a otras administraciones. Si se especifica un modelo diferente para cada administración con el fin de lograr un ajuste entre los datos y el modelo, entonces se está midiendo un rasgo latente diferente y no se puede argumentar que las puntuaciones de la prueba sean comparables entre administraciones.

Información

Una de las principales contribuciones de la teoría de respuesta al ítem es la extensión del concepto de fiabilidad . Tradicionalmente, la fiabilidad se refiere a la precisión de la medición (es decir, el grado en que la medición está libre de errores). Tradicionalmente, se mide utilizando un único índice definido de diversas maneras, como la razón entre la varianza de la puntuación verdadera y la observada. Este índice es útil para caracterizar la fiabilidad promedio de una prueba, por ejemplo, para comparar dos pruebas. Sin embargo, la teoría de respuesta al ítem deja claro que la precisión no es uniforme en todo el rango de puntuaciones de la prueba. Las puntuaciones en los extremos del rango de la prueba, por ejemplo, generalmente tienen más error asociado que las puntuaciones más cercanas al centro del rango.

La teoría de respuesta al ítem avanza el concepto de información del ítem y de la prueba para reemplazar la confiabilidad. La información también es una función de los parámetros del modelo. Por ejemplo, según la teoría de la información de Fisher , la información del ítem proporcionada en el caso del 1PL para datos de respuesta dicotómicos es simplemente la probabilidad de una respuesta correcta multiplicada por la probabilidad de una respuesta incorrecta, o,

I(θ)=pagi(θ)qi(θ).{\displaystyle I(\theta )=p_{i}(\theta )q_{i}(\theta ).\,}

El error estándar de estimación (EE) es el recíproco de la información de la prueba en un nivel de rasgo dado, es el

SE(θ)=1I(θ).{\displaystyle {\text{SE}}(\theta )={\frac {1}{\sqrt {I(\theta )}}}.}

Por lo tanto, a mayor información, menor margen de error en la medición.

Para otros modelos, como los modelos de dos y tres parámetros, el parámetro de discriminación juega un papel importante en la función. La función de información del ítem para el modelo de dos parámetros es

I(θ)=ai2pagi(θ)qi(θ).{\displaystyle I(\theta )=a_{i}^{2}p_{i}(\theta )q_{i}(\theta ).\,}

La función de información del elemento para el modelo de tres parámetros es [ 22 ]

I(θ)=ai2(pagi(θ)doi)2(1doi)2qi(θ)pagi(θ).{\displaystyle I(\theta )=a_{i}^{2}{\frac {(p_{i}(\theta )-c_{i})^{2}}{(1-c_{i})^{2}}}{\frac {q_{i}(\theta )}{p_{i}(\theta )}}.}

En general, las funciones de información de los ítems tienden a tener forma de campana. Los ítems altamente discriminatorios presentan funciones de información altas y estrechas; contribuyen significativamente, pero en un rango limitado. Los ítems menos discriminatorios proporcionan menos información, pero en un rango más amplio.

Los gráficos de información de los ítems permiten observar cuánta información aporta cada ítem y a qué parte del rango de puntuación de la escala. Debido a la independencia local, las funciones de información de los ítems son aditivas . Por lo tanto, la función de información de la prueba es simplemente la suma de las funciones de información de los ítems del examen. Al utilizar esta propiedad con un banco de ítems extenso, las funciones de información de la prueba pueden ajustarse para controlar el error de medición con gran precisión.

Caracterizar la precisión de las puntuaciones de las pruebas es quizás el aspecto central de la teoría psicométrica y constituye una diferencia fundamental entre la TRI y la TCC. Los hallazgos de la TRI revelan que el concepto de fiabilidad de la TCC es una simplificación. En lugar de la fiabilidad, la TRI ofrece la función de información de la prueba, que muestra el grado de precisión en diferentes valores de theta, θ.

Estos resultados permiten a los psicometristas (potencialmente) ajustar con precisión el nivel de fiabilidad para diferentes rangos de habilidad mediante la inclusión de ítems cuidadosamente seleccionados. Por ejemplo, en una prueba de certificación donde solo se puede aprobar o reprobar, donde existe un único puntaje mínimo de aprobación y donde este puntaje es irrelevante, se puede desarrollar una prueba muy eficiente seleccionando únicamente ítems con alto contenido de información cerca del puntaje mínimo. Estos ítems generalmente corresponden a aquellos cuya dificultad es similar a la del puntaje mínimo.

Tanteo

El parámetro de la personaθ{\displaystyle {\theta }}representa la magnitud del rasgo latente del individuo, que es la capacidad o atributo humano medido por la prueba. [ 23 ] Podría ser una habilidad cognitiva, habilidad física, destreza, conocimiento, actitud, característica de personalidad, etc.

La estimación del parámetro de la persona —la "puntuación" en una prueba con IRT— se calcula e interpreta de una manera muy diferente en comparación con las puntuaciones tradicionales como el número o el porcentaje de respuestas correctas. La puntuación total de respuestas correctas del individuo no es la puntuación real, sino que se basa en las IRF, lo que da como resultado una puntuación ponderada cuando el modelo contiene parámetros de discriminación de ítems. En realidad, se obtiene multiplicando la función de respuesta del ítem para cada ítem para obtener una función de verosimilitud , cuyo punto más alto es la estimación de máxima verosimilitud deθ{\displaystyle {\theta }}Este punto máximo se estima típicamente con software IRT utilizando el método de Newton-Raphson . [ 24 ] Si bien la puntuación es mucho más sofisticada con IRT, para la mayoría de las pruebas, la correlación entre la estimación theta y una puntuación tradicional es muy alta; a menudo es de 0,95 o más. Un gráfico de puntuaciones IRT frente a puntuaciones tradicionales muestra una forma ojival, lo que implica que las estimaciones IRT separan a los individuos en los límites del rango más que en el centro.

Una diferencia importante entre la TCC y la TRI radica en el tratamiento del error de medición, indexado por el error estándar de medición . Todas las pruebas, cuestionarios e inventarios son herramientas imprecisas; nunca podemos conocer la puntuación real de una persona , sino solo una estimación: la puntuación observada. Existe cierto margen de error aleatorio que puede hacer que la puntuación observada sea mayor o menor que la puntuación real. La TCC asume que la cantidad de error es la misma para cada examinado, mientras que la TRI permite que varíe. [ 25 ]

Además, nada en la Teoría de Respuesta al Ítem (TRI) refuta el desarrollo o la mejora humana ni presupone que el nivel de un rasgo sea fijo. Una persona puede adquirir habilidades, conocimientos o incluso las llamadas "habilidades para realizar pruebas", lo que puede traducirse en una puntuación real más alta. De hecho, una parte de la investigación en TRI se centra en la medición del cambio en el nivel del rasgo. [ 26 ]

Una comparación de las teorías clásicas y de respuesta al ítem.

La teoría clásica de los tests (TCT) y la teoría de respuesta al ítem (TRI) abordan en gran medida los mismos problemas, pero constituyen cuerpos teóricos diferentes e implican métodos distintos. Si bien ambos paradigmas son generalmente coherentes y complementarios, existen varios puntos de diferencia:

  • La teoría de respuesta al ítem (TRI) parte de supuestos más estrictos que la teoría clásica de los textos (TCT) y, en muchos casos, proporciona resultados igualmente sólidos; principalmente, caracterizaciones del error. Por supuesto, estos resultados solo son válidos cuando se cumplen los supuestos de los modelos TRI.
  • Si bien los resultados de la CTT han permitido obtener importantes resultados prácticos, la naturaleza basada en modelos de la IRT ofrece muchas ventajas sobre los hallazgos análogos de la CTT.
  • Los procedimientos de puntuación de las pruebas CTT tienen la ventaja de ser sencillos de calcular (y de explicar), mientras que la puntuación IRT generalmente requiere procedimientos de estimación relativamente complejos.
  • La Teoría de Respuesta al Ítem (TRI) ofrece varias mejoras en la evaluación de ítems y personas. Los detalles dependen del modelo de TRI, pero la mayoría de los modelos evalúan la dificultad de los ítems y la capacidad de las personas con la misma métrica. De este modo, la dificultad de un ítem y la capacidad de una persona pueden compararse de forma significativa.
  • Otra mejora que aporta la TRI es que los parámetros de sus modelos generalmente no dependen de la muestra ni de la prueba, mientras que en la TC la puntuación verdadera se define en el contexto de una prueba específica. Por lo tanto, la TRI ofrece una flexibilidad significativamente mayor en situaciones donde se utilizan diferentes muestras o versiones de la prueba. Estos hallazgos de la TRI son fundamentales para las pruebas adaptativas computarizadas .

También vale la pena mencionar algunas similitudes específicas entre la TCC y la TRI que ayudan a comprender la correspondencia entre conceptos. Primero, Lord [ 27 ] demostró que bajo el supuesto de queθ{\displaystyle \theta }Si la distribución es normal, la discriminación en el modelo 2PL es aproximadamente una función monótona de la correlación biserial puntual . En particular:

aiρit1ρit2{\displaystyle a_{i}\cong {\frac {\rho _{it}}{\sqrt {1-\rho _{it}^{2}}}}}

dóndeρit{\displaystyle \rho _{it}}es la correlación biserial puntual del elemento i . Por lo tanto, si se cumple la suposición, donde hay una mayor discriminación, generalmente habrá una mayor correlación biserial puntual.

Otra similitud es que, si bien la IRT proporciona un error estándar para cada estimación y una función de información, también es posible obtener un índice para una prueba en su conjunto que es directamente análogo al alfa de Cronbach , llamado índice de separación . Para ello, es necesario comenzar con una descomposición de una estimación de la IRT en una ubicación verdadera y un error, análoga a la descomposición de una puntuación observada en una puntuación verdadera y un error en la CTT. Sea

θ^=θ+ϵ{\displaystyle {\hat {\theta }}=\theta +\epsilon }

dóndeθ{\displaystyle \theta }es la ubicación verdadera, yϵ{\displaystyle \epsilon }es la asociación de error con una estimación. EntoncesSE(θ){\displaystyle {\mbox{SE}}({\theta })}es una estimación de la desviación estándar deϵ{\displaystyle \epsilon }Para una persona con una puntuación ponderada determinada, el índice de separación se obtiene de la siguiente manera:

Rθ=var[θ]var[θ^]=var[θ^]var[ϵ]var[θ^]{\displaystyle R_{\theta }={\frac {{\text{var}}[\theta ]}{{\text{var}}[{\hat {\theta }}]}}={\frac {{\text{var}}[{\hat {\theta }}]-{\text{var}}[\epsilon ]}{{\text{var}}[{\hat {\theta }}]}}}

donde el error estándar cuadrático medio de la estimación de la persona proporciona una estimación de la varianza de los errores,ϵnorte{\displaystyle \epsilon _{n}}, entre personas. Los errores estándar se producen normalmente como un subproducto del proceso de estimación. El índice de separación suele tener un valor muy cercano al alfa de Cronbach. [ 28 ]

La TRI a veces se denomina teoría de la puntuación verdadera fuerte o teoría moderna de las pruebas mentales porque es un cuerpo teórico más reciente y explicita las hipótesis que están implícitas en la TCT.

Implementación

Existen implementaciones de diferentes variantes de la teoría de respuesta al ítem en muchos programas y lenguajes estadísticos distintos, incluyendo el lenguaje de programación R , [ 29 ] [ 30 ] [ 31 ] y Python . [ 32 ]

Véase también

Referencias

  1. «Glosario de términos importantes de evaluación y medición» . Consejo Nacional de Medición en Educación . Archivado del original el 22 de julio de 2017.
  2. van Alphen, A.; Halfens, R.; Hasman, A.; Imbos, T. (1994). "¿Likert o Rasch? Nada es más aplicable que una buena teoría" . Journal of Advanced Nursing . 20 (1): 196– 201. doi : 10.1046/j.1365-2648.1994.20010196.x . PMID 7930122 . 
  3. Embretson y Reise 2000 .
  4. "Resumen de la investigación de ETS" . Archivado del original el 2 de enero de 2007.
  5. Hambleton, RK; Swaminathan, H.; Rogers, HJ (1991). Fundamentos de la teoría de respuesta al ítem . Newbury Park, CA: Sage Press.
  6. Bock, RD; Aitkin, M. (1981). "Estimación de máxima verosimilitud marginal de parámetros de ítems: aplicación de un algoritmo EM" . Psychometrika . 46 (4): 443– 459. doi : 10.1007/BF02293801 . S2CID 122123206 . 
  7. Ostini, Remo; Nering, Michael L. (2005). Modelos de teoría de respuesta al ítem politómicos . Aplicaciones cuantitativas en las ciencias sociales. Vol. 144. SAGE. ISBN  978-0-7619-3068-6.
  8. Nering, Michael L.; Ostini, Remo, eds. (2010). Handbook of polytomous item response theory models . Taylor & Francis. ISBN 978-0-8058-5992-8.
  9. Thissen, D.; Orlando, M. (2001). "Teoría de respuesta al ítem para ítems puntuados en dos categorías". En Thissen, D.; Wainer, H. (eds.). Puntuación de pruebas . Mahwah, NJ: Lawrence Erlbaum Associates, Inc. pp. 73–140 . doi : 10.4324/9781410604729 . ISBN  978-1-4106-0472-9.
  10. Jöreskog, KG ; Sörbom, D. (1988). Manual del usuario de PRELIS 1, versión 1. Chicago: Scientific Software, Inc.
  11. Camilli, Gregory (1994). "Origen de la constante de escala d = 1,7 en la teoría de respuesta al ítem" . Journal of Educational and Behavioral Statistics . 19 (3): 293– 295. doi : 10.3102/10769986019003293 . S2CID 122401679 . 
  12. Abramowitz, M.; Stegun, IA (1972). Manual de funciones matemáticas (PDF) . Washington D.C.: Oficina de Imprenta del Gobierno de los Estados Unidos. Bibcode : 1972hmfw.book.....A . Archivado (PDF) del original el 21 de septiembre de 2021.
  13. Uebersax, JS (diciembre de 1999). "Análisis de clases latentes probit con medidas de categorías dicotómicas u ordenadas: modelos de independencia/dependencia condicional" . Applied Psychological Measurement . 23 (4): 283–297 . doi : 10.1177/01466219922031400 . S2CID 120497324 . 
  14. Andrich, D (1989). «Distinciones entre supuestos y requisitos en la medición en las ciencias sociales». En Keats, JA; Taft, R.; Heath, RA; Lovibond, S (eds.). Sistemas matemáticos y teóricos . North Holland, Ámsterdam: Elsevier Science Publishers. pp. 7–16 . 
  15. Steinberg, J. (10 de febrero de 2000). "Frederic Lord, quien ideó el sistema de evaluación, muere a los 87 años". New York Times .
  16. Andrich, D. (enero de 2004). "Controversia y el modelo de Rasch: ¿una característica de paradigmas incompatibles?". Medical Care . 42 (1): I–7. doi : 10.1097/01.mlr.0000103528.48582.7c . PMID 14707751. S2CID 23087904 .  
  17. Smith, RM (1990). "Teoría y práctica del ajuste" . Rasch Measurement Transactions . 3 (4): 78.
  18. Zwick, R.; Thayer, DT; Wingersky, M. (diciembre de 1995). "Efecto de la calibración de Rasch en la estimación de la habilidad y el DIF en pruebas adaptativas por computadora". Journal of Educational Measurement . 32 (4): 341– 363. doi : 10.1111/j.1745-3984.1995.tb00471.x .
  19. Rasch, G. (1980) [1960, Copenhague, Instituto Danés de Investigación Educativa]. Modelos probabilísticos para algunas pruebas de inteligencia y rendimiento (edición ampliada con prólogo y epílogo de BD Wright, ed.). Chicago: The University of Chicago Press. 
  20. Wright, BD (1992). "La IRT en la década de 1990: ¿Qué modelos funcionan mejor?" . Rasch Measurement Transactions . 6 (1): 196–200 .
  21. ^ Fischer, GH; Molenaar, IW (1995). Fischer, Gerhard H.; Molenaar, Ivo W. (eds.). Modelos de Rasch: fundamentos, desarrollos recientes y aplicaciones . Nueva York: Springer. doi : 10.1007/978-1-4612-4230-7 . ISBN 978-1-4612-8704-9.
  22. de Ayala, RJ (2009). The Theory and Practice of Item Response Theory . Nueva York, NY: The Guilford Press. pp. (6.12), p.144. ISBN  978-1-59385-869-8.
  23. Lazarsfeld, PF; Henry, NW (1968). Análisis de la estructura latente . Boston: Houghton Mifflin.
  24. Thompson, NA (2009). "Estimación de la habilidad con IRT" (PDF) .
  25. Kolen, Michael J.; Zeng, Lingjia; Hanson, Bradley A. (junio de 1996). "Errores estándar condicionales de medición para puntuaciones de escala utilizando IRT". Journal of Educational Measurement . 33 (2): 129– 140. doi : 10.1111/j.1745-3984.1996.tb00485.x .
  26. Hall, LA; McDonald, JL (24–28 de abril de 2000). Medición del cambio en las percepciones de los docentes sobre el impacto del desarrollo profesional en la enseñanza . Reunión anual de la Asociación Estadounidense de Investigación Educativa. Nueva Orleans, LA.
  27. Señor 1980 .
  28. Andrich, D. (1982). "Un índice de separación de personas en la teoría de rasgos latentes, el índice tradicional KR.20 y el patrón de respuesta de la escala de Guttman" . Education Research and Perspectives . 9 : 95–104 .
  29. Chalmers, R. Philip (2012). "mirt : Un paquete de teoría de respuesta al ítem multidimensional para el entorno R" . Journal of Statistical Software . 48 (6). doi : 10.18637/jss.v048.i06 . 
  30. Bürkner, Paul-Christian (2021). "Modelado bayesiano de respuesta a ítems en R con brms y Stan" . Journal of Statistical Software . 100 (5). arXiv : 1905.09501 . doi : 10.18637/jss.v100.i05 .
  31. Mair, Patrick; Rosseel, Yves; Gruber, Kathrin (15 de diciembre de 2023). "CRAN Task View: Psychometric Models and Methods" . cran.r-project.org . Consultado el 3 de octubre de 2024 .
  32. Lalor, John Patrick; Rodriguez, Pedro (enero de 2023). "py-irt : una biblioteca escalable de teoría de respuesta al ítem para Python". INFORMS Journal on Computing . 35 (1): 5–13 . arXiv : 2203.01282 . doi : 10.1287/ijoc.2022.1250 . 

Lecturas adicionales

Se han escrito numerosos libros que abordan la teoría de respuesta al ítem o que contienen modelos de TRI o similares. Esta es una lista parcial, centrada en textos que profundizan más en el tema.

  • Lord, FM (1980). Aplicaciones de la teoría de respuesta al ítem a problemas prácticos de evaluación . Mahwah, NJ: Lawrence Erlbaum Associates, Inc. doi : 10.4324/9780203056615 . ISBN 978-1-136-55724-8.
Este libro resume gran parte del trabajo de Lord sobre la Teoría de Respuesta al Ítem (TRI), incluyendo capítulos sobre la relación entre la TRI y los métodos clásicos, los fundamentos de la TRI, la estimación y varios temas avanzados. Su capítulo sobre estimación está desactualizado, ya que se centra principalmente en el método de máxima verosimilitud conjunta en lugar del método de máxima verosimilitud marginal implementado por Darrell Bock y sus colegas.
  • Embretson, Susan E.; Reise, Steven P. (2000). Teoría de respuesta al ítem para psicólogos . Psychology Press. ISBN 978-0-8058-2819-1.
Este libro es una introducción accesible a la Teoría de Respuesta al Ítem (TRI), dirigida, como indica el título, a psicólogos.
  • Baker, Frank (2001). Los fundamentos de la teoría de respuesta al ítem . ERIC Clearinghouse on Assessment and Evaluation, Universidad de Maryland, College Park, MD.
Este libro introductorio es obra de uno de los pioneros en este campo.
  • Baker, Frank B.; Kim, Seock-Ho (2004). Teoría de respuesta al ítem: Técnicas de estimación de parámetros (2.ª  ed.). Marcel Dekker. ISBN 978-0-8247-5825-7.
Este libro describe diversos modelos de teoría de respuesta al ítem y ofrece explicaciones detalladas de algoritmos que pueden utilizarse para estimar los parámetros del ítem y de la habilidad. Algunas partes del libro están disponibles en línea como vista previa limitada en Google Libros .
  • van der Linden, Wim J.; Hambleton, Ronald K., eds. (1996). Manual de teoría moderna de la respuesta al ítem . Saltador. ISBN 978-0-387-94661-0.
Este libro ofrece una visión general completa de varios modelos populares de la Teoría de Respuesta al Ítem (TRI). Es muy adecuado para personas que ya poseen conocimientos básicos de la TRI.
  • de Boeck, Paul; Wilson, Mark (2004). Modelos explicativos de respuesta al ítem: un enfoque lineal y no lineal generalizado . Springer. ISBN 978-0-387-40275-8.
Este volumen ofrece una introducción integrada a los modelos de respuesta a ítems, dirigida principalmente a profesionales, investigadores y estudiantes de posgrado.
  • Fox, Jean-Paul (2010). Modelado bayesiano de respuesta al ítem: teoría y aplicaciones . Springer. ISBN 978-1-4419-0741-7.
Este libro aborda el enfoque bayesiano para el modelado de respuestas a ítems. Resultará útil para quienes estén familiarizados con la Teoría de Respuesta al Ítem (TRI) y tengan interés en analizar datos de respuestas a ítems desde una perspectiva bayesiana.
  • "HISTORIA DE LA TEORÍA DE RESPUESTA A LOS ÍTEMS (hasta 1982)" . Universidad de Illinois en Chicago .
  • "Una guía sencilla sobre la teoría de respuesta al ítem" (PDF) .
  • "Descargas de software psicométrico" . Archivado del original el 5 de junio de 2011.
  • "Tutorial de IRT" . Archivado del original el 10 de diciembre de 2004.
  • "Preguntas frecuentes sobre el tutorial de IRT" .
  • "Introducción a la TRI" . Archivado del original el 5 de febrero de 2024. Consultado el 1 de enero de 2005 .
  • "Estándares para las pruebas educativas y psicológicas" .
  • Programa informático "Lenguaje de comandos IRT (ICL)" . Archivado del original el 13 de junio de 2006.
  • "Programas IRT de SSI, Inc." Archivado del original el 16 de julio de 2011.
  • "Análisis de rasgos latentes y modelos IRT" .
  • Análisis de Rasch . Archivado del original el 25 de agosto de 2009.
  • "Programas de análisis Rasch de Winsteps" .
  • "Teoría de respuesta al ítem" . 25 de mayo de 2024.
  • "Software IRT gratuito" .
  • "Paquetes IRT en R" . 15 de diciembre de 2023.
  • "Soporte para IRT / EIRT en Lertap 5" (PDF) . Archivado del original (PDF) el 4 de marzo de 2016.
  • "Análisis y elaboración de informes visuales mediante la Teoría de Respuesta al Ítem (TRI) con Xcalibre" .