Articulo de referencia

Validez (estadística)

La validez es el grado en que un concepto , conclusión o medición está bien fundamentado y probablemente se corresponde con precisión con el mundo real. [ 1 ] [ 2 ] La palabra «...

La validez es el grado en que un concepto , conclusión o medición está bien fundamentado y probablemente se corresponde con precisión con el mundo real. [ 1 ] [ 2 ] La palabra «válido» deriva del latín validus , que significa fuerte. La validez de un instrumento de medición (por ejemplo, una prueba en educación) es el grado en que el instrumento mide lo que afirma medir. [ 3 ] La validez se basa en la solidez de un conjunto de diferentes tipos de evidencia (por ejemplo, validez aparente, validez de constructo, etc.) que se describen con mayor detalle a continuación.

En psicometría , la validez tiene una aplicación particular conocida como validez de la prueba : "el grado en que la evidencia y la teoría respaldan las interpretaciones de las puntuaciones de las pruebas" ("tal como se deduce de los usos propuestos de las pruebas"). [ 4 ]

Generalmente se acepta que el concepto de validez científica aborda la naturaleza de la realidad en términos de medidas estadísticas y, como tal, constituye una cuestión epistemológica y filosófica , además de una cuestión de medición . El uso del término en lógica es más restringido, ya que se refiere a la relación entre las premisas y la conclusión de un argumento. En lógica, la validez alude a la propiedad de un argumento según la cual, si las premisas son verdaderas, la verdad de la conclusión se deduce necesariamente. La conclusión de un argumento es verdadera si el argumento es sólido, es decir, si el argumento es válido y sus premisas son verdaderas.

Por el contrario, la «validez científica o estadística» no es una afirmación deductiva que necesariamente preserve la verdad, sino una afirmación inductiva que permanece verdadera o falsa de manera indefinida. Por ello, la «validez científica o estadística» es una afirmación que se califica como fuerte o débil en su naturaleza; nunca es necesaria ni absolutamente verdadera. Esto hace que las afirmaciones de «validez científica o estadística» estén sujetas a interpretación en cuanto a lo que, en realidad, significan los hechos.

La validez es importante porque puede ayudar a determinar qué tipos de pruebas utilizar y a garantizar que los investigadores utilicen métodos que no solo sean éticos y rentables, sino también que midan realmente las ideas o constructos en cuestión.

Validez de la prueba

Validez (exactitud)

La validez [ 5 ] de una evaluación es el grado en que mide lo que se supone que debe medir. Esto no es lo mismo que la fiabilidad , que es el grado en que una medición da resultados muy consistentes. Dentro de la validez, la medición no siempre tiene que ser similar, como sucede en la fiabilidad. Sin embargo, el hecho de que una medición sea fiable no significa necesariamente que sea válida. Por ejemplo, una báscula que tiene un error de 5 libras es fiable pero no válida. Una prueba no puede ser válida a menos que sea fiable. La validez también depende de que la medición mida lo que fue diseñada para medir, y no otra cosa. [ 6 ] La validez (similar a la fiabilidad) es un concepto relativo; la validez no es una idea de todo o nada. Hay muchos tipos diferentes de validez.

Validez de constructo

La validez de constructo se refiere al grado en que las operacionalizaciones de un constructo (por ejemplo, pruebas prácticas desarrolladas a partir de una teoría) miden dicho constructo según la definición de la teoría. Engloba todos los demás tipos de validez. Por ejemplo, el grado en que una prueba mide la inteligencia es una cuestión de validez de constructo. Una medida de inteligencia presupone, entre otras cosas, que la medida está asociada con aquello con lo que debería estar asociada ( validez convergente ) y no con aquello con lo que no debería estar asociada ( validez discriminante ). [ 7 ]

La evidencia de validez de constructo implica el respaldo empírico y teórico para la interpretación del constructo. Dichas líneas de evidencia incluyen análisis estadísticos de la estructura interna de la prueba, incluyendo las relaciones entre las respuestas a los diferentes ítems de la prueba. También incluyen relaciones entre la prueba y medidas de otros constructos. Tal como se entiende actualmente, la validez de constructo no se distingue del respaldo a la teoría sustantiva del constructo que la prueba está diseñada para medir. Por lo tanto, los experimentos diseñados para revelar aspectos del rol causal del constructo también contribuyen a la construcción de evidencia de validez. [ 7 ]

Validez del contenido

La validez de contenido es un tipo de validez no estadística que implica "el examen sistemático del contenido de la prueba para determinar si abarca una muestra representativa del dominio de comportamiento que se va a medir" (Anastasi y Urbina, 1997, p.  114). Por ejemplo, ¿un cuestionario de CI incluye ítems que abarcan todas las áreas de inteligencia descritas en la literatura científica ?

La evidencia de validez de contenido implica el grado en que el contenido de la prueba coincide con un dominio de contenido asociado con el constructo. Por ejemplo, una prueba de la capacidad de sumar dos números debe incluir una gama de combinaciones de dígitos. Una prueba con solo números de un dígito, o solo números pares, no tendría una buena cobertura del dominio de contenido. La evidencia relacionada con el contenido generalmente implica que un experto en la materia (SME) evalúe los ítems de la prueba con respecto a las especificaciones de la prueba. Los expertos deben prestar atención a cualquier diferencia cultural. Por ejemplo, cuando un cuestionario de evaluación de conducción se adapta de Inglaterra (p. ej., DBQ), los expertos deben considerar la conducción por la derecha en Gran Bretaña. Algunos estudios han encontrado que esto será fundamental para obtener un cuestionario válido. [ 8 ] Antes de proceder a la administración final de los cuestionarios, el investigador debe consultar la validez de los ítems con respecto a cada uno de los constructos o variables y, en consecuencia, modificar los instrumentos de medición basándose en la opinión del SME.

Una prueba posee validez de contenido gracias a la cuidadosa selección de los ítems que se incluyen (Anastasi y Urbina, 1997). Los ítems se eligen de manera que cumplan con las especificaciones de la prueba, las cuales se elaboran mediante un examen exhaustivo del dominio del tema. Foxcroft, Paterson, le Roux y Herbst (2004, p.  49) [ 9 ] señalan que, al utilizar un panel de expertos para revisar las especificaciones de la prueba y la selección de ítems, se puede mejorar la validez de contenido de una prueba. Los expertos podrán revisar los ítems y comentar si estos abarcan una muestra representativa del dominio del comportamiento.

Validez aparente

La validez aparente es una estimación de si una prueba parece medir un criterio determinado; no garantiza que la prueba mida realmente fenómenos en ese ámbito. Las medidas pueden tener una alta validez, pero cuando la prueba no parece medir lo que dice medir, tiene una baja validez aparente. De hecho, cuando una prueba es susceptible de simulación , una baja validez aparente podría hacerla más válida. Dado que se pueden obtener respuestas más honestas con una menor validez aparente, a veces es importante aparentar que existe una baja validez aparente al administrar las medidas.

La validez aparente está estrechamente relacionada con la validez de contenido. Mientras que la validez de contenido depende de una base teórica para determinar si una prueba evalúa todos los dominios de un criterio determinado (por ejemplo, ¿evaluar las habilidades de suma proporciona una buena medida de las habilidades matemáticas? Para responder a esto, es necesario saber qué tipos de habilidades aritméticas abarcan las habilidades matemáticas), la validez aparente se refiere a si una prueba parece ser una buena medida o no. Este juicio se basa en la apariencia de la prueba, por lo que incluso una persona sin experiencia puede juzgarla.

La validez aparente es un punto de partida, pero nunca debe asumirse como probablemente válida para ningún propósito dado, ya que los "expertos" se han equivocado antes: el Malleus Malificarum (Martillo de las Brujas) no tenía ningún respaldo para sus conclusiones más allá de la autoproclamada competencia de dos "expertos" en "detección de brujería", sin embargo, se utilizó como "prueba" para condenar y quemar en la hoguera a decenas de miles de hombres y mujeres como "brujos". [ 10 ]

Validez de criterio

La evidencia de validez de criterio implica la correlación entre la prueba y una o varias variables de criterio consideradas representativas del constructo. En otras palabras, compara la prueba con otras medidas o resultados (los criterios) que ya se consideran válidos. Por ejemplo, las pruebas de selección de personal suelen validarse comparándolas con medidas de desempeño laboral (el criterio), y las pruebas de CI suelen validarse comparándolas con medidas de rendimiento académico (el criterio).

Si los datos de la prueba y los datos del criterio se recopilan simultáneamente, se habla de validez concurrente. Si los datos de la prueba se recopilan primero para predecir los datos del criterio que se recopilarán posteriormente, se habla de validez predictiva.

Validez concurrente

La validez concurrente se refiere al grado en que la operacionalización se correlaciona con otras medidas del mismo constructo que se miden simultáneamente. Cuando una medida se compara con otra del mismo tipo, estarán relacionadas (o correlacionadas). Volviendo al ejemplo de la prueba de selección, esto significaría que las pruebas se administran a los empleados actuales y luego se correlacionan con sus puntuaciones en las evaluaciones de desempeño.

Validez predictiva

La validez predictiva se refiere al grado en que la operacionalización puede predecir (o correlacionarse con) otras medidas del mismo constructo que se midan en algún momento futuro. Siguiendo con el ejemplo de la prueba de selección, esto significaría que las pruebas se administran a los solicitantes, todos los solicitantes son contratados, su desempeño se evalúa posteriormente y luego se correlacionan sus puntuaciones en ambas medidas.

Esto también ocurre cuando la medición predice una relación entre lo medido y otra cosa, prediciendo si la otra cosa sucederá o no en el futuro. Una alta correlación entre los resultados predichos ex ante y los resultados reales ex post es la prueba más sólida de validez.

Validez experimental

La validez del diseño de los estudios de investigación experimental es una parte fundamental del método científico [ 2 ] y una preocupación de la ética de la investigación . Sin un diseño válido, no se pueden extraer conclusiones científicas válidas.

Validez de la conclusión estadística

La validez de las conclusiones estadísticas se refiere al grado en que las conclusiones sobre la relación entre variables, basadas en los datos, son correctas o razonables. Inicialmente, esto se centraba únicamente en si la conclusión estadística sobre la relación entre las variables era correcta, pero ahora existe una tendencia hacia conclusiones razonables que utilizan datos cuantitativos, estadísticos y cualitativos. [ 11 ]

La validez de las conclusiones estadísticas implica garantizar el uso de procedimientos de muestreo adecuados, pruebas estadísticas apropiadas y procedimientos de medición fiables. [ 12 ] Dado que este tipo de validez se centra únicamente en la relación que se encuentra entre las variables, dicha relación puede ser simplemente una correlación.

Validez interna

La validez interna es una estimación inductiva del grado en que se pueden extraer conclusiones sobre relaciones causales (por ejemplo, causa y efecto), basándose en las medidas utilizadas, el contexto de la investigación y el diseño general de la misma . Las buenas técnicas experimentales, en las que se estudia el efecto de una variable independiente sobre una variable dependiente en condiciones altamente controladas, suelen permitir mayores grados de validez interna que, por ejemplo, los diseños de caso único.

Existen ocho tipos de variables de confusión que pueden interferir con la validez interna (es decir, con el intento de aislar relaciones causales):

  1. Historial , los eventos específicos que ocurren entre la primera y la segunda medición, además de las variables experimentales.
  2. La maduración son procesos que se producen dentro de los participantes en función del paso del tiempo (no específicos de eventos particulares), por ejemplo, envejecer, tener más hambre, cansarse más, etc.
  3. Pruebas , los efectos de realizar una prueba sobre los resultados de una segunda prueba.
  4. La instrumentación , los cambios en la calibración de un instrumento de medición o los cambios en los observadores o evaluadores pueden producir cambios en las mediciones obtenidas.
  5. Regresión estadística , que se aplica cuando se han seleccionado grupos en función de sus puntuaciones extremas.
  6. Selección , sesgos resultantes de la selección diferencial de encuestados para los grupos de comparación.
  7. Mortalidad experimental , o pérdida diferencial de participantes respecto a los grupos de comparación.
  8. interacción selección-maduración , etc., por ejemplo, en diseños cuasiexperimentales de grupos múltiples.

Validez externa

La validez externa se refiere al grado en que los resultados (internamente válidos) de un estudio pueden considerarse válidos para otros casos, por ejemplo, para diferentes personas, lugares o momentos. En otras palabras, se trata de si los hallazgos pueden generalizarse válidamente. Si se realizara el mismo estudio de investigación en esos otros casos, ¿se obtendrían los mismos resultados?

Un factor importante en esto es si la muestra del estudio (por ejemplo, los participantes de la investigación) es representativa de la población general en las dimensiones relevantes. Otros factores que comprometen la validez externa son:

  1. Efecto reactivo o de interacción de las pruebas : una prueba previa podría aumentar las puntuaciones en una prueba posterior.
  2. Efectos de interacción de los sesgos de selección y la variable experimental .
  3. Efectos reactivos de los arreglos experimentales , que impedirían generalizar sobre el efecto de la variable experimental en personas expuestas a ella en entornos no experimentales.
  4. Interferencia de tratamientos múltiples , donde los efectos de tratamientos anteriores no se pueden borrar.

Validez ecológica

La validez ecológica se refiere al grado en que los resultados de una investigación pueden aplicarse a situaciones de la vida real fuera del ámbito de la investigación. Este tema está estrechamente relacionado con la validez externa, pero abarca la cuestión de hasta qué punto los hallazgos experimentales reflejan lo que se observa en el mundo real (ecología = la ciencia de la interacción entre los organismos y su entorno). Para que un estudio sea ecológicamente válido, sus métodos, materiales y contexto deben aproximarse a la situación real que se investiga.

La validez ecológica está relacionada, en parte, con la dicotomía entre experimentación y observación. En ciencia, generalmente existen dos ámbitos de investigación: la observacional (pasiva) y la experimental (activa). El objetivo de los diseños experimentales es comprobar la causalidad, de modo que se pueda inferir que A causa B o B causa A. Sin embargo, en ocasiones, las restricciones éticas o metodológicas impiden realizar un experimento (por ejemplo, ¿cómo influye el aislamiento en el funcionamiento cognitivo de un niño?). En esos casos, la investigación aún puede llevarse a cabo, pero no es causal, sino correlacional. Solo se puede concluir que A ocurre junto con B. Ambas técnicas tienen sus ventajas y desventajas.

Relación con la validez interna

A primera vista, la validez interna y externa parecen contradecirse: para obtener un diseño experimental, es necesario controlar todas las variables interferentes. Por eso, a menudo se realizan experimentos en un laboratorio. Si bien se gana validez interna (al excluir las variables interferentes manteniéndolas constantes), se pierde validez ecológica o externa, ya que se establece un entorno de laboratorio artificial. Por otro lado, con la investigación observacional no se pueden controlar las variables interferentes (baja validez interna), pero se puede medir en el entorno natural (ecológico), en el lugar donde el comportamiento ocurre normalmente. Sin embargo, al hacerlo, se sacrifica la validez interna.

La aparente contradicción entre validez interna y validez externa es, sin embargo, solo superficial. La cuestión de si los resultados de un estudio particular se generalizan a otras personas, lugares o momentos surge únicamente cuando se sigue una estrategia de investigación inductiva . Si el objetivo de un estudio es probar deductivamente una teoría, solo se consideran los factores que podrían menoscabar el rigor del estudio, es decir, las amenazas a la validez interna. En otras palabras, la relevancia de la validez externa e interna para un estudio de investigación depende de los objetivos del estudio. Además, confundir los objetivos de la investigación con las preocupaciones sobre la validez puede conducir al problema de la validez interna mutua, donde las teorías solo pueden explicar fenómenos en entornos de laboratorio artificiales, pero no en el mundo real. [ 13 ] [ 14 ]

Validez diagnóstica

En psiquiatría existe un problema particular con la evaluación de la validez de las categorías diagnósticas en sí mismas. En este contexto: [ 15 ]

  • La validez del contenido puede referirse a los síntomas y a los criterios de diagnóstico;
  • La validez concurrente puede definirse mediante diversos correlatos o marcadores, y quizás también mediante la respuesta al tratamiento;
  • La validez predictiva puede referirse principalmente a la estabilidad diagnóstica a lo largo del tiempo;
  • La validez discriminante puede implicar la delimitación respecto de otros trastornos.

Robins y Guze propusieron en 1970 lo que se convertirían en influyentes criterios formales para establecer la validez de los diagnósticos psiquiátricos. Enumeraron cinco criterios: [ 15 ]

  • Descripción clínica específica (que incluye perfiles de síntomas, características demográficas y factores desencadenantes típicos).
  • estudios de laboratorio (incluidas pruebas psicológicas, radiología y hallazgos post mortem)
  • delimitación de otros trastornos (mediante criterios de exclusión)
  • Estudios de seguimiento que muestran una evolución característica (incluida evidencia de estabilidad diagnóstica).
  • estudios familiares que muestran agrupamiento familiar

Estos criterios se incorporaron a los Criterios de Feighner y a los Criterios Diagnósticos de Investigación, que desde entonces han constituido la base de los sistemas de clasificación DSM e ICD.

En 1980, Kendler distinguió entre: [ 15 ]

  • Validadores antecedentes (agregación familiar, personalidad premórbida y factores precipitantes)
  • validadores concurrentes (incluidas pruebas psicológicas)
  • Validadores predictivos (consistencia diagnóstica a lo largo del tiempo, tasas de recaída y recuperación, y respuesta al tratamiento)

Nancy Andreasen (1995) enumeró varios validadores adicionales: genética molecular y biología molecular , neuroquímica , neuroanatomía , neurofisiología y neurociencia cognitiva , que son potencialmente capaces de vincular síntomas y diagnósticos con sus sustratos neuronales . [ 15 ]

Kendell y Jablinsky (2003) enfatizaron la importancia de distinguir entre validez y utilidad , y argumentaron que las categorías diagnósticas definidas por sus síndromes deben considerarse válidas solo si se ha demostrado que son entidades discretas con límites naturales que las separan de otros trastornos. [ 15 ]

Kendler (2006) enfatizó que, para ser útil, un criterio de validación debe ser lo suficientemente sensible como para validar la mayoría de los síndromes que son trastornos verdaderos, a la vez que lo suficientemente específico como para invalidar la mayoría de los síndromes que no lo son. Sobre esta base, argumenta que el criterio de Robins y Guze de "es hereditario" es insuficientemente específico porque la mayoría de los rasgos psicológicos y físicos humanos cumplirían con los requisitos; por ejemplo, se encontrará que un síndrome arbitrario que comprende una mezcla de "estatura superior a 1,83 m, cabello rojo y nariz grande" es " hereditario ", pero esto no debería considerarse evidencia de que se trate de un trastorno. Kendler ha sugerido además que los modelos genéticos " esencialistas " de los trastornos psiquiátricos, y la esperanza de que podamos validar diagnósticos psiquiátricos categóricos "desentrañando la naturaleza" únicamente como resultado del descubrimiento de genes, son inverosímiles. [ 16 ]

En el sistema judicial federal de los Estados Unidos, la validez y confiabilidad de las pruebas se evalúan utilizando el estándar Daubert : véase Daubert v. Merrell Dow Pharmaceuticals . Perri y Lichtenwald (2010) ofrecen un punto de partida para un análisis de una amplia gama de temas relacionados con la confiabilidad y la validez en su análisis de una condena errónea por asesinato. [ 17 ]

Véase también

References

  1. Brains, Willnat, Manheim, Rich 2011. Empirical Political Analysis 8th edition. Boston: Longman p. 105
  2. 12Campbell, Donald T. (1957). "Factors relevant to the validity of experiments in social settings". Psychological Bulletin. 54 (4): 297–312. doi:10.1037/h0040950. ISSN 1939-1455. PMID 13465924.
  3. Kelley, Truman Lee (1927). Interpretation of Educational Measurements. Yonkers-on-Hudson, NY: World Book Company. p. 14. The problem of validity is that of whether a test really measures what it purports to measure...
  4. American Educational Research Association, Psychological Association, & National Council on Measurement in Education. (1999). Standards for Educational and Psychological Testing. Washington, D.C.: American Educational Research Association.
  5. National Council on Measurement in Education. https://web.archive.org/web/20160924135257/http://www.ncme.org/ncme/NCME/Resource_Center/Glossary/NCME/Resource_Center/Glossary1.aspx?hkey=4bb87415-44dc-4088-9ed9-e8515326a061
  6. Kramer, Geoffrey P., Douglas A. Bernstein, and Vicky Phares. Introduction to clinical psychology. 7th ed. Upper Saddle River, N.J.: Pearson Prentice Hall, 2009. Print.
  7. 12Cronbach, Lee J.; Meehl, Paul E. (1955). "Construct validity in psychological tests". Psychological Bulletin. 52 (4): 281–302. doi:10.1037/h0040957. hdl:11299/184279. ISSN 0033-2909. PMID 13245896. S2CID 5312179.
  8. Arghami, Shirazeh; Sadeghi, Gholamreza; Abbasi Chenari, Mohsen (2020). "Psychometric properties re-evaluation of the Persian version of Manchester driving behavior questionnaire". Iran Occupational Health. 17 (8): 1–19.
  9. Foxcroft, C., Paterson, H., le Roux, N., & Herbst, D. Consejo de Investigación en Ciencias Humanas, (2004). Evaluación psicológica en Sudáfrica: Un análisis de necesidades: Patrones de uso de pruebas y necesidades de los profesionales de la evaluación psicológica: Informe final: julio . Recuperado del sitio web: http://www.hsrc.ac.za/research/output/outputDocuments/1716_Foxcroft_Psychologicalassessmentin%20SA.pdf Archivado el 19 de noviembre de 2012 en Wayback Machine
  10. Las estimaciones más comunes se sitúan entre 40 000 y 60 000 muertes. Brian Levack ( La caza de brujas en la Europa moderna temprana ) multiplicó el número de juicios por brujería conocidos en Europa por la tasa media de condenas y ejecuciones, para llegar a una cifra de alrededor de 60 000 muertes. Anne Lewellyn Barstow ( Cruz de brujas ) ajustó la estimación de Levack para tener en cuenta los registros perdidos, estimando 100 000 muertes. Ronald Hutton ( El triunfo de la luna ) argumenta que la estimación de Levack ya había sido ajustada para estos registros y revisa la cifra a aproximadamente 40 000.
  11. Cozby, Paul C. Métodos en la investigación del comportamiento. 10.ª ed. Boston: McGraw-Hill Higher Education, 2009. Impreso.
  12. Jonathan Javid (6 de noviembre de 2015). "Validez y fiabilidad de la medición" . slideshare.net . Consultado el 23 de marzo de 2018 .
  13. Lin, Hause; Werner, Kaitlyn M.; Inzlicht, Michael (16 de febrero de 2021). "Promesas y peligros de la experimentación: el problema de la validez interna mutua" . Perspectives on Psychological Science . 16 (4): 854– 863. doi : 10.1177/1745691620974773 . ISSN 1745-6916 . PMID 33593177. S2CID 231877717 .   
  14. Schram, Arthur (1 de junio de 2005). "Artificialidad: La tensión entre la validez interna y externa en los experimentos económicos" . Journal of Economic Methodology . 12 (2): 225– 237. doi : 10.1080/13501780500086081 . ISSN 1350-178X . S2CID 145588503 .  
  15. 1 2 3 4 5 Kendell, R; Jablensky, A (2003). "Distinguir entre la validez y la utilidad de los diagnósticos psiquiátricos". The American Journal of Psychiatry . 160 (1): 4– 12. doi : 10.1176/appi.ajp.160.1.4 . PMID 12505793 . 
  16. Kendler, KS (2006). "Reflexiones sobre la relación entre la genética psiquiátrica y la nosología psiquiátrica". The American Journal of Psychiatry . 163 (7): 1138– 46. doi : 10.1176/appi.ajp.163.7.1138 . PMID 16816216 . 
  17. Perri, FS; Lichtenwald, TG (2010). "El uso precario de la psicología forense como prueba: el caso de Timothy Masters" (PDF) . Revista Champion (julio): 34–45 .

Lecturas adicionales

  • Cronbach, LJ; Meehl, PE (1955), "Validez de constructo en pruebas psicológicas" , Psychological Bulletin , 52 (4): 281–302 , doi : 10.1037/h0040957 , hdl : 11299/184279 , PMID 13245896 , S2CID 5312179  
  • Rupp, AA; Pant, HA (2007), "Teoría de la validez", en Salkind, Neil J. (ed.), Enciclopedia de medición y estadística , SAGE Publishing