Articulo de referencia

Prueba de hipótesis estadística

Una prueba de hipótesis estadística es un método de inferencia estadística que se utiliza para determinar si los datos proporcionan evidencia suficiente para rechazar una hipóte...

Una prueba de hipótesis estadística es un método de inferencia estadística que se utiliza para determinar si los datos proporcionan evidencia suficiente para rechazar una hipótesis específica. Generalmente, una prueba de hipótesis estadística implica el cálculo de un estadístico de prueba . Posteriormente, se toma una decisión, ya sea comparando el estadístico de prueba con un valor crítico o, de forma equivalente, evaluando un valor p calculado a partir del estadístico de prueba. Existen aproximadamente 100 pruebas estadísticas especializadas en uso. [ 1 ] [ 2 ]

Definición de términos

El objetivo de una prueba de hipótesis es determinar si ciertas propiedades de una población estadística son verdaderas mediante el análisis de datos de una muestra . Generalmente, la población se modela mediante una variable aleatoria cuya distribución tiene parámetros desconocidos. Por ejemplo, un ensayo clínico podría querer determinar si un fármaco en particular es eficaz para tratar la hipertensión arterial, siendo la variable aleatoria "el cambio en la presión arterial observado en un paciente que toma el fármaco". Una hipótesis de ejemplo podría ser "el cambio medio en la presión arterial es cero" o "el cambio medio en la presión arterial es negativo". En general, cualquier afirmación sobre los parámetros que describen una población puede ser una hipótesis (pero no una afirmación sobre la muestra). [ 3 ]

La prueba compara dos hipótesis: una hipótesis "nula" predeterminada (denotada H₀ ) y su negación, la hipótesis "alternativa" (H₁ ) . Normalmente, la prueba seleccionará una hipótesis nula que establece que la intervención que se está estudiando no tiene efecto, o que el parámetro de la población toma algún valor "obvio". Se calcula un estadístico de prueba a partir de los datos de la muestra proporcionados, y el evaluador calcula la probabilidad condicional de observar un valor al menos tan extremo, suponiendo que la hipótesis nula es verdadera. Si esta probabilidad (llamada valor p ) es menor que el nivel de significancia de la prueba (denotadoα{\displaystyle \alpha }), entonces se rechaza la hipótesis nula. La prueba no concluye que la hipótesis nula sea falsa, o que la probabilidad de que la hipótesis nula sea falsa sea menor queα{\displaystyle \alpha }. [ 4 ]

Dado que generalmente es imposible establecer con certeza si la hipótesis que se está probando es verdadera o falsa a partir de una muestra, la conclusión de una prueba de hipótesis no tiene por qué ser correcta. Existen dos posibles clases de error:

  • Un error de tipo I , en el que se rechaza la hipótesis nula a pesar de que la hipótesis nula sea verdadera, con probabilidadα=PAG(rechazar H0|H0){\displaystyle \alpha =P({\text{rechazar }}H_{0}|H_{0})}Esto es lo mismo que el nivel de significancia de la prueba.
  • Un error de tipo II , en el que se acepta la hipótesis nula a pesar de que la hipótesis alternativa sea verdadera, con probabilidadβ=PAG(aceptar H0|H1){\displaystyle \beta =P({\text{aceptar }}H_{0}|H_{1})}. La cantidad1β{\displaystyle 1-\beta }Se denomina poder de la prueba.

Algunas definiciones adicionales:

  • Hipótesis simple : Cualquier hipótesis que especifique completamente la distribución de la población.
  • Hipótesis compuesta: Cualquier hipótesis que no especifique completamente la distribución de la población.
  • Datos positivos: Datos que permiten al investigador rechazar una hipótesis nula.
Supongamos que los datos se pueden obtener de una distribución N(0,1). Por ejemplo, con un nivel de significancia α = 0,05, a partir de la tabla Z, se puede obtener un valor crítico unilateral de aproximadamente 1,645. El valor crítico unilateral C α ≈ 1,645 corresponde al nivel de significancia elegido. La región crítica [C α , ∞) se corresponde con la cola de la distribución normal estándar.
  • Los valores críticos de una prueba estadística son los límites de la región de aceptación de la prueba. [ 5 ] La región de aceptación es el conjunto de valores del estadístico de prueba para los cuales no se rechaza la hipótesis nula. Dependiendo de la forma de la región de aceptación, puede haber uno o más valores críticos.
    • Región de rechazo /Región crítica : El conjunto de valores del estadístico de prueba para los cuales se rechaza la hipótesis nula.
  • Tamaño : Para hipótesis simples, esta es la probabilidad de que la prueba rechace incorrectamente la hipótesis nula. Latasa de falsos positivos . Para hipótesis compuestas, este es el supremo de la probabilidad de rechazar la hipótesis nula en todos los casos cubiertos por la hipótesis nula. El complemento de la tasa de falsos positivos se denomina especificidad en bioestadística . («Esta es una prueba específica. Dado que el resultado es positivo, podemos afirmar con seguridad que el paciente tiene la afección.») Consulte sensibilidad y especificidad , y errores de tipo I y tipo II para obtener definiciones exhaustivas.
  • Prueba de significación estadística : Precursora de la prueba de hipótesis estadística (véase la sección Orígenes). Se consideraba que un resultado experimental eraestadísticamente significativosi una muestra era suficientemente inconsistente con la hipótesis (nula). Esto se interpretó de diversas maneras: como sentido común, una heurística pragmática para identificar resultados experimentales relevantes, una convención que establecía un umbral de evidencia estadística o un método para extraer conclusiones a partir de los datos. La prueba de hipótesis estadística añadió rigor matemático y coherencia filosófica al concepto al explicitar la hipótesis alternativa. El término se utiliza de forma imprecisa para referirse a la versión moderna, que ahora forma parte de las pruebas de hipótesis estadísticas.
  • Prueba conservadora: Una prueba es conservadora si, cuando se construye para un nivel de significancia nominal dado, la probabilidad real de rechazar incorrectamente la hipótesis nula nunca es mayor que el nivel nominal.
  • Prueba exacta

Una prueba de hipótesis estadística compara un estadístico de prueba ( z o t , por ejemplo) con un umbral. El estadístico de prueba (cuya fórmula se encuentra en la tabla siguiente) se basa en la optimalidad. Para un nivel fijo de tasa de error de tipo I, el uso de estos estadísticos minimiza las tasas de error de tipo II (equivalente a maximizar la potencia). Los siguientes términos describen las pruebas en términos de dicha optimalidad:

  • Prueba más potente: Para un tamaño o nivel de significancia dado , la prueba con la mayor potencia (probabilidad de rechazo) para un valor dado del/de los parámetro(s) que se están probando, contenido en la hipótesis alternativa.
  • Prueba uniformemente más potente (UMP)

Historia

Aunque la comprobación de hipótesis se popularizó a principios del siglo XX, las primeras formas se utilizaron en el siglo XVIII. El primer uso se atribuye a John Arbuthnot (1710), [ 6 ] seguido por Pierre-Simon Laplace (década de 1770), en el análisis de la proporción de sexos humanos al nacer; véase §  Proporción de sexos humanos .

1778: Pierre Laplace compara las tasas de natalidad de niños y niñas en varias ciudades europeas. Afirma: «Es natural concluir que estas posibilidades están muy cerca de la misma proporción». Por lo tanto, la hipótesis nula en este caso es que las tasas de natalidad de niños y niñas deberían ser iguales según la «sabiduría convencional». [ 7 ]

1900: Karl Pearson desarrolla la prueba de chi cuadrado para determinar si una forma dada de curva de frecuencia describe eficazmente las muestras extraídas de una población determinada. Así, la hipótesis nula es que una población se describe mediante alguna distribución predicha por la teoría. Utiliza como ejemplo los números de cinco y seis en los datos de lanzamiento de dados de Weldon . [ 8 ]

1904: Karl Pearson desarrolla el concepto de " contingencia " para determinar si los resultados son independientes de un factor categórico dado. Aquí, la hipótesis nula es, por defecto, que dos cosas no están relacionadas (por ejemplo, la formación de cicatrices y las tasas de mortalidad por viruela). [ 9 ] La hipótesis nula en este caso ya no se predice mediante la teoría o el conocimiento convencional, sino que es el principio de indiferencia que llevó a Fisher y otros a descartar el uso de "probabilidades inversas". [ 10 ]

Orígenes modernos y controversia inicial

Las pruebas de significancia modernas son en gran parte producto de Karl Pearson ( valor p , prueba chi-cuadrado de Pearson ), William Sealy Gosset ( distribución t de Student ) y Ronald Fisher (" hipótesis nula ", análisis de varianza , " prueba de significancia "), mientras que las pruebas de hipótesis fueron desarrolladas por Jerzy Neyman y Egon Pearson (hijo de Karl). Ronald Fisher comenzó su vida en estadística como bayesiano (Zabell 1992), pero pronto se desencantó con la subjetividad involucrada (es decir, el uso del principio de indiferencia al determinar probabilidades previas) y buscó proporcionar un enfoque más "objetivo" para la inferencia inductiva. [ 11 ]

Fisher hizo hincapié en el diseño experimental riguroso y en los métodos para obtener resultados a partir de pocas muestras, asumiendo distribuciones gaussianas . Neyman (quien colaboró ​​con el joven Pearson) enfatizó el rigor matemático y los métodos para obtener más resultados a partir de muchas muestras y una gama más amplia de distribuciones. Las pruebas de hipótesis modernas constituyen un híbrido inconsistente de la formulación, los métodos y la terminología de Fisher y Neyman/Pearson, desarrollados a principios del siglo XX.

Fisher popularizó la prueba de significancia. Requería una hipótesis nula (correspondiente a una distribución de frecuencia poblacional) y una muestra. Sus cálculos (ahora conocidos) determinaban si se rechazaba o no la hipótesis nula. La prueba de significancia no utilizaba una hipótesis alternativa, por lo que no existía el concepto de error de tipo II (falso negativo).

El valor p se ideó como un índice informal, pero objetivo, destinado a ayudar al investigador a determinar (con base en otros conocimientos) si modificar experimentos futuros o fortalecer su confianza en la hipótesis nula. [ 12 ] La prueba de hipótesis (y los errores de tipo I/II) fue ideada por Neyman y Pearson como una alternativa más objetiva al valor p de Fisher , también destinada a determinar el comportamiento del investigador, pero sin requerir ninguna inferencia inductiva por parte de este. [ 13 ] [ 14 ]

Neyman y Pearson consideraron un problema distinto al de Fisher (al que denominaron "prueba de hipótesis"). Inicialmente, consideraron dos hipótesis simples (ambas con distribuciones de frecuencia). Calcularon dos probabilidades y, por lo general, seleccionaron la hipótesis con mayor probabilidad (la que tenía más probabilidades de haber generado la muestra). Su método siempre seleccionaba una hipótesis. Además, permitía calcular ambos tipos de probabilidades de error.

Fisher y Neyman/Pearson tuvieron fuertes enfrentamientos. Neyman/Pearson consideraban que su formulación era una generalización mejorada de las pruebas de significancia (el artículo fundamental [ 13 ] era abstracto ; los matemáticos han generalizado y perfeccionado la teoría durante décadas [ 15 ] ). Fisher opinaba que no era aplicable a la investigación científica porque, a menudo, durante el transcurso del experimento, se descubre que los supuestos iniciales sobre la hipótesis nula son cuestionables debido a fuentes de error inesperadas. Creía que el uso de decisiones rígidas de rechazo/aceptación basadas en modelos formulados antes de la recopilación de datos era incompatible con este escenario común al que se enfrentan los científicos, y que los intentos de aplicar este método a la investigación científica conducirían a una gran confusión. [ 16 ]

La disputa entre Fisher y Neyman-Pearson se libró por motivos filosóficos, caracterizados por un filósofo como una disputa sobre el papel adecuado de los modelos en la inferencia estadística. [ 17 ]

Neyman aceptó un puesto en la Universidad de California, Berkeley en 1938, rompiendo su sociedad con Pearson y separando a los contendientes (que anteriormente habían ocupado el mismo edificio). La disputa entre Fisher y Neyman terminó (sin resolverse después de 27 años) con la muerte de Fisher en 1962. Neyman escribió un elogio fúnebre muy apreciado. [ 18 ] Algunas de las publicaciones posteriores de Neyman informaron valores p y niveles de significancia. [ 19 ]

Prueba de significancia de la hipótesis nula (NHST)

La versión moderna de la prueba de hipótesis se denomina generalmente prueba de significación de la hipótesis nula (NHST) [ 20 ] y es un híbrido del enfoque de Fisher con el enfoque de Neyman-Pearson. En 2000, Raymond S. Nickerson escribió un artículo en el que afirmaba que la NHST era (en ese momento) "posiblemente el método de análisis de datos más utilizado en experimentos psicológicos, y lo había sido durante unos 70 años", y que al mismo tiempo era "muy controvertida". [ 20 ]

Esta fusión surgió de la confusión entre los autores de libros de texto de estadística (como predijo Fisher) a partir de la década de 1940 [ 21 ] (pero la detección de señales , por ejemplo, todavía utiliza la formulación de Neyman/Pearson). Se ignoraron grandes diferencias conceptuales y muchas advertencias, además de las ya mencionadas. Neyman y Pearson proporcionaron una terminología más sólida, unas matemáticas más rigurosas y una filosofía más consistente, pero el tema que se enseña hoy en estadística introductoria tiene más similitudes con el método de Fisher que con el suyo. [ 22 ]

Alrededor de 1940, [ 21 ] los autores de libros de texto de estadística comenzaron a combinar los dos enfoques utilizando el valor p en lugar del estadístico de prueba (o datos) para probar contra el "nivel de significancia" de Neyman-Pearson.

Filosofía

Paul Meehl ha argumentado que la importancia epistemológica de la elección de la hipótesis nula ha pasado en gran medida desapercibida. Cuando la hipótesis nula se predice mediante la teoría, un experimento más preciso constituirá una prueba más rigurosa de la teoría subyacente. Cuando la hipótesis nula por defecto es "ninguna diferencia" o "ningún efecto", un experimento más preciso representa una prueba menos rigurosa de la teoría que motivó su realización. [ 23 ]

Fisher y Neyman se opusieron a la subjetividad de la probabilidad. Sus puntos de vista contribuyeron a las definiciones objetivas. El núcleo de su desacuerdo histórico era filosófico.

Muchas de las críticas filosóficas a la comprobación de hipótesis son abordadas por estadísticos en otros contextos, en particular la contradicción entre correlación y causalidad , y el diseño de experimentos . La comprobación de hipótesis sigue siendo de interés para los filósofos. [ 17 ] [ 24 ]

Educación

La estadística se enseña cada vez más en las escuelas, siendo la prueba de hipótesis uno de los elementos que se imparten. [ 25 ] [ 26 ] Muchas conclusiones publicadas en la prensa popular (desde encuestas de opinión política hasta estudios médicos) se basan en la estadística. Algunos autores han afirmado que este tipo de análisis estadístico permite pensar con claridad sobre problemas que implican grandes cantidades de datos, así como informar eficazmente sobre tendencias e inferencias a partir de dichos datos, pero advierten que quienes escriben para un público amplio deben tener un conocimiento sólido del campo para utilizar correctamente los términos y conceptos. [ 27 ] [ 28 ] Un curso introductorio de estadística universitaria pone mucho énfasis en la prueba de hipótesis, quizás la mitad del curso. Campos como la literatura y la teología ahora incluyen hallazgos basados ​​en análisis estadísticos (véase el Analizador Bíblico ). Un curso introductorio de estadística enseña la prueba de hipótesis como un proceso de manual. La prueba de hipótesis también se enseña a nivel de posgrado. Los estadísticos aprenden a crear buenos procedimientos de prueba estadística (como z , t de Student , F y chi-cuadrado). La prueba de hipótesis estadística se considera un área madura dentro de la estadística, [ 29 ] pero continúa un desarrollo limitado.

Un estudio académico afirma que el método de enseñanza de estadística introductoria, basado en la técnica del libro de recetas, no deja espacio para la historia, la filosofía ni la controversia. La prueba de hipótesis se ha enseñado como un método unificado y convencional. Las encuestas mostraron que los graduados del curso estaban plagados de ideas filosóficas erróneas (sobre todos los aspectos de la inferencia estadística) que persistían entre los instructores. [ 30 ] Si bien el problema se abordó hace más de una década, [ 31 ] y continúan los llamados a la reforma educativa, [ 32 ] los estudiantes aún se gradúan de las clases de estadística con ideas erróneas fundamentales sobre la prueba de hipótesis. [ 33 ] Las ideas para mejorar la enseñanza de la prueba de hipótesis incluyen alentar a los estudiantes a buscar errores estadísticos en artículos publicados, enseñar la historia de la estadística y enfatizar la controversia en un tema generalmente árido. [ 34 ]

Raymond S. Nickerson comentó:

El debate sobre las pruebas de hipótesis nulas (NHST) tiene sus raíces en desacuerdos sin resolver entre los principales contribuyentes al desarrollo de las teorías de la estadística inferencial en las que se basan los enfoques modernos. Gigerenzer et al. (1989) revisaron con considerable detalle la controversia entre R.A. Fisher, por un lado, y Jerzy Neyman y Egon Pearson, por el otro, así como los desacuerdos entre estas dos posturas y las de los seguidores de Thomas Bayes. Señalaron el hecho notable de que apenas se encuentra rastro de la controversia histórica y actual en la mayoría de los libros de texto utilizados para enseñar NHST a sus potenciales usuarios. La consiguiente falta de una perspectiva histórica precisa y de comprensión de la complejidad y, a veces, de los fundamentos filosóficos controvertidos de los diversos enfoques de la inferencia estadística puede explicar en gran medida la aparente facilidad con la que las pruebas estadísticas se utilizan y se interpretan erróneamente. [ 20 ]

Realización de una prueba de hipótesis frecuentista en la práctica

Los pasos típicos que implica realizar una prueba de hipótesis frecuentista en la práctica son:

  1. Defina una hipótesis (afirmación que se puede comprobar utilizando datos).
  2. Seleccione una prueba estadística pertinente con su estadístico de prueba T asociado .
  3. Deduce la distribución del estadístico de prueba bajo la hipótesis nula a partir de los supuestos. En casos estándar, este será un resultado bien conocido. Por ejemplo, el estadístico de prueba podría seguir una distribución t de Student con grados de libertad conocidos, o una distribución normal con media y varianza conocidas.
  4. Seleccione un nivel de significancia ( α ), la tasa máxima aceptable de falsos positivos . Los valores comunes son 5% y 1%.
  5. Calcula a partir de las observaciones el valor observado t obs del estadístico de prueba T.
  6. Decida si rechazar la hipótesis nula a favor de la alternativa o no rechazarla. La regla de decisión de Neyman-Pearson consiste en rechazar la hipótesis nula H₀ si el valor observado t obs se encuentra en la región crítica, y no rechazarla en caso contrario. [ 35 ]

Ejemplo práctico

La diferencia entre los dos procesos aplicados al ejemplo de la maleta radiactiva (abajo):

  • "El contador Geiger marca 10. El límite es 9. Revise la maleta."
  • "La lectura del contador Geiger es alta; el 97% de las maletas seguras tienen lecturas más bajas. El límite es del 95%. Revise la maleta."

El primer informe es adecuado, el segundo ofrece una explicación más detallada de los datos y del motivo por el que se está revisando la maleta.

No rechazar la hipótesis nula no significa que la hipótesis nula sea "aceptada" per se (aunque Neyman y Pearson usaron esa palabra en sus escritos originales; véase la sección de Interpretación ).

Los procesos descritos aquí son perfectamente adecuados para el cálculo. Sin embargo, descuidan seriamente las consideraciones del diseño de experimentos . [ 36 ] [ 37 ]

Es fundamental, en particular, estimar el tamaño adecuado de la muestra antes de realizar el experimento.

La frase "prueba de significancia" fue acuñada por el estadístico Ronald Fisher . [ 38 ]

Interpretación

Cuando la hipótesis nula es verdadera y se cumplen los supuestos estadísticos, la probabilidad de que el valor p sea menor o igual al nivel de significancia esα{\displaystyle \alpha }es como máximoα{\displaystyle \alpha }Esto garantiza que la prueba de hipótesis mantenga su tasa de falsos positivos especificada (siempre que se cumplan los supuestos estadísticos). [ 3 ]

El valor p es la probabilidad de que un estadístico de prueba al menos tan extremo como el obtenido ocurra bajo la hipótesis nula. Con un nivel de significancia de 0,05, se esperaría que una moneda justa rechazara (incorrectamente) la hipótesis nula (que es justa) en 1 de cada 20 pruebas en promedio. El valor p no proporciona la probabilidad de que la hipótesis nula o su opuesta sea correcta (una fuente común de confusión). [ 39 ]

Si el valor p es menor que el umbral de significancia elegido (o, lo que es lo mismo, si el estadístico de prueba observado se encuentra en la región crítica), entonces decimos que la hipótesis nula se rechaza al nivel de significancia elegido. Si el valor p no es menor que el umbral de significancia elegido (o, lo que es lo mismo, si el estadístico de prueba observado se encuentra fuera de la región crítica), entonces la hipótesis nula no se rechaza al nivel de significancia elegido.

En el ejemplo de la "señora que prueba el té" (ver más abajo), Fisher le pidió que clasificara correctamente todas las tazas de té para justificar la conclusión de que era improbable que el resultado se debiera al azar. Su prueba reveló que, si la señora estuviera adivinando al azar (la hipótesis nula), habría una probabilidad del 1,4 % de que se produjeran los resultados observados (té perfectamente ordenado).

Uso e importancia

Las estadísticas son útiles para analizar la mayoría de los conjuntos de datos. Esto también se aplica a las pruebas de hipótesis, que pueden justificar conclusiones incluso cuando no existe una teoría científica. En el ejemplo de la dama que probaba el té, era "obvio" que no existía diferencia entre (leche vertida en té) y (té vertido en leche). Sin embargo, los datos contradecían esa "obviedad".

Las aplicaciones en el mundo real de las pruebas de hipótesis incluyen: [ 40 ]

  • Prueba para determinar si más hombres que mujeres sufren pesadillas.
  • Determinación de la autoría de los documentos
  • Evaluación del efecto de la luna llena en el comportamiento
  • Determinar el alcance en el que un murciélago puede detectar un insecto por eco.
  • Decidir si las alfombras de los hospitales provocan más infecciones.
  • Seleccionar el mejor método para dejar de fumar
  • Comprobar si las pegatinas del parachoques reflejan el comportamiento del propietario del coche.
  • Poniendo a prueba las afirmaciones de los analistas de escritura

La comprobación de hipótesis estadísticas desempeña un papel importante en el conjunto de la estadística y en la inferencia estadística . Por ejemplo, Lehmann (1992), en una reseña del artículo fundamental de Neyman y Pearson (1933), afirma: «No obstante, a pesar de sus deficiencias, el nuevo paradigma formulado en el artículo de 1933, y los numerosos desarrollos llevados a cabo dentro de su marco, siguen desempeñando un papel central tanto en la teoría como en la práctica de la estadística, y cabe esperar que así siga siendo en el futuro previsible».

Las pruebas de significación han sido la herramienta estadística preferida en algunas ciencias sociales experimentales (más del 90 % de los artículos en el Journal of Applied Psychology a principios de la década de 1990). [ 41 ] Otros campos han preferido la estimación de parámetros (por ejemplo, el tamaño del efecto ). Las pruebas de significación se utilizan como sustituto de la comparación tradicional entre el valor predicho y el resultado experimental, que constituye el núcleo del método científico . Cuando la teoría solo es capaz de predecir el signo de una relación, se puede configurar una prueba de hipótesis direccional (unilateral) de modo que solo un resultado estadísticamente significativo respalde la teoría. Esta forma de evaluación de la teoría es la aplicación más criticada de las pruebas de hipótesis.

Precauciones

"Si el gobierno exigiera que los procedimientos estadísticos llevaran etiquetas de advertencia como las de los medicamentos, la mayoría de los métodos de inferencia tendrían etiquetas muy largas." [ 42 ] Esta precaución se aplica a las pruebas de hipótesis y a sus alternativas.

La prueba de hipótesis exitosa está asociada con una probabilidad y una tasa de error de tipo I. La conclusión podría ser errónea.

La conclusión de la prueba es tan sólida como la muestra en la que se basa. El diseño del experimento es fundamental. Se han observado varios efectos inesperados, entre ellos:

  • El ingenioso efecto Hans . Un caballo parecía ser capaz de realizar operaciones aritméticas sencillas.
  • El efecto Hawthorne . Los trabajadores industriales eran más productivos con mejor iluminación y aún más productivos con peor iluminación.
  • El efecto placebo . Las pastillas sin ingredientes médicamente activos resultaron sorprendentemente efectivas.

Un análisis estadístico de datos engañosos produce conclusiones erróneas. La cuestión de la calidad de los datos puede ser más compleja. En la previsión, por ejemplo, no existe consenso sobre una medida de precisión. En ausencia de una medición consensuada, ninguna decisión basada en mediciones estará exenta de controversia.

Sesgo de publicación: Es menos probable que se publiquen los resultados estadísticamente no significativos, lo que puede sesgar la literatura científica.

Pruebas múltiples: Cuando se realizan varias pruebas de hipótesis nulas verdaderas a la vez sin ajuste, la probabilidad general de error de tipo I es mayor que el nivel alfa nominal. [ 43 ]

Quienes toman decisiones cruciales basándose en los resultados de una prueba de hipótesis deben, con prudencia, analizar los detalles en lugar de centrarse únicamente en la conclusión. En las ciencias físicas, la mayoría de los resultados solo se aceptan plenamente cuando se confirman de forma independiente.

Prueba de hipótesis bootstrap no paramétrica

Los métodos de remuestreo basados ​​en Bootstrap pueden utilizarse para la prueba de hipótesis nula. Un bootstrap crea numerosas muestras simuladas mediante el remuestreo aleatorio (con reemplazo) de los datos de muestra combinados originales, asumiendo que la hipótesis nula es correcta. El bootstrap es muy versátil, ya que es independiente de la distribución y no se basa en supuestos paramétricos restrictivos, sino en métodos empíricos aproximados con garantías asintóticas. Las pruebas de hipótesis paramétricas tradicionales son computacionalmente más eficientes, pero hacen supuestos estructurales más fuertes. En situaciones donde calcular la probabilidad del estadístico de prueba bajo la hipótesis nula es difícil o imposible (debido quizás a la inconveniencia o a la falta de conocimiento de la distribución subyacente), el bootstrap ofrece un método viable para la inferencia estadística. [ 44 ] [ 45 ] [ 46 ] [ 47 ]

Ejemplos

proporción de sexos humanos

El primer uso de la prueba de hipótesis estadística se atribuye generalmente a la pregunta de si los nacimientos de varones y mujeres son igualmente probables (hipótesis nula), que fue abordada en el siglo XVIII por John Arbuthnot (1710) [ 48 ] y posteriormente por Pierre-Simon Laplace (década de 1770) [ 49 ] .

Arbuthnot examinó los registros de nacimientos en Londres para cada uno de los 82 años desde 1629 hasta 1710, y aplicó la prueba de signos , una prueba no paramétrica simple . [ 50 ] [ 51 ] [ 52 ] En cada año, el número de varones nacidos en Londres superó al de mujeres. Considerando que un mayor número de nacimientos de varones o de mujeres es igualmente probable, la probabilidad del resultado observado es 0,5 82 , o aproximadamente 1 en 4.836.000.000.000.000.000.000.000; en términos modernos, este es el valor p . Arbuthnot concluyó que esto es demasiado pequeño para deberse al azar y debe deberse en cambio a la providencia divina: "De donde se sigue que es el Arte, no el Azar, lo que gobierna". En términos modernos, rechazó la hipótesis nula de nacimientos de varones y mujeres igualmente probables al nivel de significancia p  =  1/2 82 .

Laplace analizó las estadísticas de casi medio millón de nacimientos. Las estadísticas mostraron un exceso de niños en comparación con las niñas. [ 7 ] Concluyó, mediante el cálculo de un valor p , que dicho exceso era un efecto real, pero inexplicable. [ 53 ]

Una dama degustando té

En un famoso ejemplo de prueba de hipótesis, conocido como la Dama catando té , [ 54 ] la Dra. Muriel Bristol , colega de Fisher, afirmó poder distinguir si se había añadido primero el té o la leche a una taza. Fisher propuso darle ocho tazas, cuatro de cada variedad, en orden aleatorio. Se podría entonces preguntar cuál era la probabilidad de que acertara el número que acertó, pero solo por casualidad. La hipótesis nula era que la Dama no tenía tal habilidad. El estadístico de prueba era un simple recuento del número de éxitos al seleccionar las cuatro tazas. La región crítica era el único caso de 4 éxitos de 4 posibles según un criterio de probabilidad convencional (<  5%). Un patrón de 4 éxitos corresponde a 1 de 70 combinaciones posibles (p ≈  1,4%). Fisher afirmó que no se requería ninguna hipótesis alternativa. La dama identificó correctamente todas las tazas, [ 55 ] lo que se consideraría un resultado estadísticamente significativo.

Juego de cartas de clarividencia

Se somete a una persona (el sujeto) a una prueba de clarividencia . Se le muestra el reverso de una carta de juego elegida al azar 25 veces y se le pregunta a cuál de los cuatro palos pertenece. El número de aciertos, o respuestas correctas, se denomina X.

Mientras intentamos encontrar evidencia de su clarividencia, por el momento la hipótesis nula es que la persona no es clarividente. [ 56 ] La alternativa es: la persona es (más o menos) clarividente.

Si la hipótesis nula es válida, lo único que puede hacer la persona examinada es adivinar. Para cada carta, la probabilidad (frecuencia relativa) de que aparezca un solo palo es 1/4. Si la hipótesis alternativa es válida, el sujeto de prueba predecirá correctamente el palo con una probabilidad mayor que 1/4. Llamaremos p a la probabilidad de adivinar correctamente . Las hipótesis, entonces, son:

  • hipótesis nula:H0:pag=14{\displaystyle {\text{:}}\qquad H_{0}:p={\tfrac {1}{4}}}    (Solo estoy adivinando)

y

  • hipótesis alternativa:H1:pag>14{\displaystyle {\text{:}}H_{1}:p>{\tfrac {1}{4}}}   (verdadera clarividente).

Cuando el sujeto de prueba predice correctamente las 25 cartas, lo consideraremos clarividente y rechazaremos la hipótesis nula. Lo mismo ocurre con 24 o 23 aciertos. Con solo 5 o 6 aciertos, por otro lado, no hay motivo para considerarlo clarividente. Pero ¿qué pasa con 12 o 17 aciertos? ¿Cuál es el número crítico, c , de aciertos, en el que consideramos que el sujeto es clarividente? ¿Cómo determinamos el valor crítico c ? Con la elección c = 25 (es decir, solo aceptamos la clarividencia cuando todas las cartas se predicen correctamente) somos más críticos que con c = 10. En el primer caso, casi ningún sujeto de prueba será reconocido como clarividente; en el segundo caso, un cierto número pasará la prueba. En la práctica, uno decide cuán crítico será. Es decir, uno decide con qué frecuencia acepta un error del primer tipo: un falso positivo o error de tipo I. Con c = 25, la probabilidad de tal error es:

PAG(rechazar H0H0 es válido)=PAG(incógnita=25pag=14)=(14)251015{\displaystyle P({\text{rechazar }}H_{0}\mid H_{0}{\text{ es válido}})=P\left(X=25\mid p={\frac {1}{4}}\right)=\left({\frac {1}{4}}\right)^{25}\approx 10^{-15}},

y por lo tanto, muy pequeña. La probabilidad de un falso positivo es la probabilidad de adivinar correctamente al azar las 25 veces.

Siendo menos crítico, con c = 10, se obtiene:

PAG(rechazar H0H0 es válido)=PAG(incógnita10pag=14)=k=1025PAG(incógnita=kpag=14)=k=1025(25k)(114)25k(14)k0,0713{\displaystyle P({\text{rechazar }}H_{0}\mid H_{0}{\text{ es válido}})=P\left(X\geq 10\mid p={\frac {1}{4}}\right)=\sum _{k=10}^{25}P\left(X=k\mid p={\frac {1}{4}}\right)=\sum _{k=10}^{25}{\binom {25}{k}}\left(1-{\frac {1}{4}}\right)^{25-k}\left({\frac {1}{4}}\right)^{k}\approx 0.0713}.

Por lo tanto, c = 10 produce una probabilidad mucho mayor de falso positivo.

Antes de realizar la prueba, se determina la probabilidad máxima aceptable de un error de tipo I ( α ). Normalmente, se seleccionan valores entre el 1 % y el 5 %. (Si la tasa de error máxima aceptable es cero, se requiere un número infinito de aciertos). En función de esta tasa de error de tipo I, se calcula el valor crítico c . Por ejemplo, si seleccionamos una tasa de error del 1 %, c se calcula de la siguiente manera:

PAG(rechazar H0H0 es válido)=PAG(incógnitadopag=14)0,01{\displaystyle P({\text{rechazar }}H_{0}\mid H_{0}{\text{ es válido}})=P\left(X\geq c\mid p={\frac {1}{4}}\right)\leq 0.01}.

De entre todos los números c que poseen esta propiedad, elegimos el más pequeño para minimizar la probabilidad de un error de tipo II, un falso negativo . Para el ejemplo anterior, seleccionamos:do=13{\displaystyle c=13}.

Variaciones y subclases

Las pruebas de hipótesis estadísticas son una técnica clave tanto de la inferencia frecuentista como de la bayesiana , aunque ambos tipos de inferencia presentan diferencias notables. Las pruebas de hipótesis estadísticas definen un procedimiento que controla (fija) la probabilidad de decidir erróneamente que una posición predeterminada ( hipótesis nula ) es incorrecta. El procedimiento se basa en la probabilidad de que se produzca un conjunto de observaciones si la hipótesis nula fuera verdadera. Esta probabilidad de tomar una decisión incorrecta no es la probabilidad de que la hipótesis nula sea verdadera, ni de que alguna hipótesis alternativa específica sea verdadera. Esto contrasta con otras posibles técnicas de la teoría de la decisión en las que la hipótesis nula y la alternativa se tratan en igualdad de condiciones.

Un enfoque bayesiano ingenuo para la prueba de hipótesis consiste en basar las decisiones en la probabilidad posterior , [ 57 ] [ 58 ] pero esto falla al comparar hipótesis puntuales y continuas. Otros enfoques para la toma de decisiones, como la teoría de la decisión bayesiana , intentan equilibrar las consecuencias de las decisiones incorrectas en todas las posibilidades, en lugar de concentrarse en una sola hipótesis nula. Existen otros enfoques para llegar a una decisión basada en datos a través de la teoría de la decisión y las decisiones óptimas , algunos de los cuales poseen propiedades deseables. Sin embargo, la prueba de hipótesis es un enfoque dominante para el análisis de datos en muchos campos de la ciencia. Las extensiones a la teoría de la prueba de hipótesis incluyen el estudio de la potencia de las pruebas, es decir, la probabilidad de rechazar correctamente la hipótesis nula dado que es falsa. Estas consideraciones pueden utilizarse para determinar el tamaño de la muestra antes de la recopilación de datos.

Prueba de hipótesis de Neyman-Pearson

Un ejemplo de prueba de hipótesis de Neyman-Pearson (o prueba de significancia estadística de hipótesis nula) se puede hacer modificando el ejemplo de la maleta radiactiva. Si la "maleta" es en realidad un contenedor blindado para el transporte de material radiactivo, entonces se podría usar una prueba para seleccionar entre tres hipótesis: ninguna fuente radiactiva presente, una presente, dos (todas) presentes. La prueba podría ser necesaria por seguridad, con acciones requeridas en cada caso. El lema de Neyman-Pearson de prueba de hipótesis dice que un buen criterio para la selección de hipótesis es la razón de sus probabilidades (una razón de verosimilitud ). Un método simple de solución es seleccionar la hipótesis con la probabilidad más alta para los recuentos de Geiger observados. El resultado típico coincide con la intuición: pocos recuentos implican ninguna fuente, muchos recuentos implican dos fuentes y recuentos intermedios implican una fuente. Nótese también que generalmente hay problemas para probar una negación . Las hipótesis nulas deben ser al menos falsables .

La teoría de Neyman-Pearson puede incorporar tanto probabilidades previas como los costos de las acciones derivadas de las decisiones. [ 59 ] La primera permite que cada prueba considere los resultados de pruebas anteriores (a diferencia de las pruebas de significancia de Fisher). La segunda permite considerar aspectos económicos (por ejemplo) además de las probabilidades. La razón de verosimilitud sigue siendo un buen criterio para seleccionar entre hipótesis.

Las dos formas de prueba de hipótesis se basan en formulaciones de problemas diferentes. La prueba original es análoga a una pregunta de verdadero/falso; la prueba de Neyman-Pearson se asemeja más a una pregunta de opción múltiple. Según Tukey [ 60 ], la primera produce una conclusión basada únicamente en evidencia sólida, mientras que la segunda produce una decisión basada en la evidencia disponible. Si bien las dos pruebas parecen bastante diferentes tanto matemática como filosóficamente, desarrollos posteriores llevan a la afirmación opuesta. Consideremos muchas fuentes radiactivas diminutas. Las hipótesis se convierten en 0, 1, 2, 3... granos de arena radiactiva. Hay poca distinción entre ninguna o alguna radiación (Fisher) y 0 granos de arena radiactiva frente a todas las alternativas (Neyman-Pearson). El importante artículo de Neyman-Pearson de 1933 [ 13 ] también consideró hipótesis compuestas (aquellas cuya distribución incluye un parámetro desconocido). Un ejemplo demostró la optimalidad de la prueba t (de Student) : «no puede haber mejor prueba para la hipótesis en cuestión» (p. 321). La teoría de Neyman-Pearson demostró la optimalidad de los métodos fisherianos desde sus inicios.

La prueba de significancia de Fisher ha demostrado ser una herramienta estadística flexible y popular en la práctica, con escaso potencial de desarrollo matemático. La prueba de hipótesis de Neyman-Pearson se considera un pilar de la estadística matemática, [ 61 ] creando un nuevo paradigma para el campo. También impulsó nuevas aplicaciones en el control estadístico de procesos , la teoría de la detección , la teoría de la decisión y la teoría de juegos . Ambas formulaciones han tenido éxito, pero de naturaleza diferente.

La controversia sobre las formulaciones sigue sin resolverse. La ciencia utiliza principalmente la formulación de Fisher (ligeramente modificada), tal como se enseña en estadística introductoria. Los estadísticos estudian la teoría de Neyman-Pearson en posgrado. Los matemáticos se enorgullecen de haber unificado ambas formulaciones. Los filósofos las consideran por separado. La opinión de los expertos las clasifica como competitivas (Fisher vs. Neyman), incompatibles [ 11 ] o complementarias [ 15 ] . La controversia se ha vuelto más compleja desde que la inferencia bayesiana alcanzó prestigio.

La terminología es inconsistente. La prueba de hipótesis puede referirse a cualquier combinación de dos formulaciones que hayan cambiado con el tiempo. Cualquier debate sobre pruebas de significancia frente a pruebas de hipótesis es doblemente propenso a la confusión.

Fisher pensaba que la prueba de hipótesis era una estrategia útil para realizar el control de calidad industrial; sin embargo, discrepaba profundamente de que pudiera ser útil para los científicos. [ 12 ] La prueba de hipótesis proporciona un medio para encontrar estadísticos de prueba utilizados en las pruebas de significancia. [ 15 ] El concepto de potencia es útil para explicar las consecuencias de ajustar el nivel de significancia y se utiliza ampliamente en la determinación del tamaño de la muestra . Los dos métodos siguen siendo filosóficamente distintos. [ 17 ] Por lo general (pero no siempre ) producen la misma respuesta matemática. La respuesta preferida depende del contexto. [ 15 ] Si bien la fusión existente de las teorías de Fisher y Neyman-Pearson ha sido duramente criticada, se ha considerado modificar la fusión para lograr objetivos bayesianos. [ 62 ]

Crítica

Gran parte de las críticas a las pruebas de hipótesis estadísticas se pueden resumir en los siguientes puntos:

  • La interpretación de un valor p depende de la regla de detención y de la definición de comparación múltiple. La primera suele cambiar durante el transcurso de un estudio, y la segunda es inevitablemente ambigua. (Es decir, "los valores p dependen tanto de los datos observados como de otros datos posibles que podrían haberse observado pero no se observaron"). [ 63 ]
  • Confusión resultante (en parte) de combinar los métodos de Fisher y Neyman-Pearson, que son conceptualmente distintos. [ 60 ]
  • Énfasis en la significación estadística, excluyendo la estimación y la confirmación mediante experimentos repetidos. [ 64 ]
  • Exigir rigurosamente significancia estadística como criterio de publicación, lo que resulta en sesgo de publicación . [ 65 ] La mayor parte de la crítica es indirecta. En lugar de ser errónea, la prueba de hipótesis estadística se malinterpreta, se usa en exceso y se utiliza incorrectamente.
  • Cuando se utiliza para detectar si existe una diferencia entre grupos, surge una paradoja. A medida que se realizan mejoras en el diseño experimental (por ejemplo, mayor precisión de medición y tamaño de la muestra), la prueba se vuelve más permisiva. A menos que se acepte la suposición absurda de que todas las fuentes de ruido en los datos se cancelan por completo, la probabilidad de encontrar significancia estadística en cualquier dirección se acerca al 100 %. [ 66 ] Sin embargo, esta suposición absurda de que la diferencia media entre dos grupos no puede ser cero implica que los datos no pueden ser independientes e idénticamente distribuidos (i.i.d.) porque la diferencia esperada entre cualesquiera dos subgrupos de variables aleatorias i.i.d. es cero; por lo tanto, la suposición i.i.d. también es absurda.
  • Capas de preocupaciones filosóficas. La probabilidad de significación estadística es una función de las decisiones tomadas por los experimentadores/analistas. [ 67 ] Si las decisiones se basan en la convención, se denominan arbitrarias o irracionales [ 68 ] mientras que las que no se basan en ella pueden denominarse subjetivas. Para minimizar los errores de tipo II, se recomiendan muestras grandes. En psicología, prácticamente todas las hipótesis nulas se consideran falsas para muestras suficientemente grandes, por lo que "...suele ser absurdo realizar un experimento con el único objetivo de rechazar la hipótesis nula". [ 69 ] "Los hallazgos estadísticamente significativos suelen ser engañosos" en psicología. [ 70 ] La significación estadística no implica significación práctica, y la correlación no implica causalidad . Por lo tanto, poner en duda la hipótesis nula está lejos de apoyar directamente la hipótesis de investigación.
  • "[N]o nos dice lo que queremos saber". [ 71 ] Hay listas de docenas de quejas disponibles. [ 72 ] [ 20 ] [ 73 ]

Críticos y partidarios coinciden en gran medida en cuanto a las características de la prueba de significación de la hipótesis nula (NHST): si bien puede proporcionar información crucial, resulta inadecuada como única herramienta de análisis estadístico . Rechazar con éxito la hipótesis nula puede no ofrecer ningún respaldo a la hipótesis de investigación. La controversia persiste en torno a la selección de las mejores prácticas estadísticas para el futuro cercano, dadas las prácticas existentes. Sin embargo, un diseño de investigación adecuado puede minimizar este problema. Los críticos preferirían prohibir la NHST por completo, forzando un abandono total de dichas prácticas, [ 74 ] mientras que los partidarios sugieren un cambio menos radical. [ 75 ]

La controversia sobre las pruebas de significación, y sus efectos en el sesgo de publicación en particular, ha producido varios resultados. La Asociación Americana de Psicología ha reforzado sus requisitos de informes estadísticos tras una revisión, [ 76 ] los editores de revistas médicas han reconocido la obligación de publicar algunos resultados que no son estadísticamente significativos para combatir el sesgo de publicación, [ 77 ] y se ha creado una revista ( Journal of Articles in Support of the Null Hypothesis ) para publicar exclusivamente dichos resultados. [ 78 ] Los libros de texto han añadido algunas advertencias, [ 79 ] y han aumentado la cobertura de las herramientas necesarias para estimar el tamaño de la muestra requerido para producir resultados significativos. Pocas organizaciones importantes han abandonado el uso de pruebas de significación, aunque algunas han considerado hacerlo. [ 76 ] Por ejemplo, en 2023, los editores del Journal of Physiology "recomiendan encarecidamente el uso de métodos de estimación para quienes publican en The Journal" (es decir, la magnitud del tamaño del efecto (para permitir a los lectores juzgar si un hallazgo tiene relevancia práctica, fisiológica o clínica) y los intervalos de confianza para transmitir la precisión de esa estimación), diciendo "En última instancia, es la importancia fisiológica de los datos lo que más debería preocupar a quienes publican en The Journal of Physiology, en lugar de la significación estadística". [ 80 ]

Los valores p son variables aleatorias. [ 81 ] Por lo tanto, la decisión de una prueba estadística es una variable aleatoria; para comprender su estabilidad, se han propuesto enfoques que incluyen los siguientes:

Alternativas

Una postura común entre los críticos es que la estadística no debe conducir a una conclusión o decisión de aceptación o rechazo, sino a un valor estimado con un intervalo de confianza ; esta filosofía de análisis de datos se conoce generalmente como estadística de estimación . La estadística de estimación puede realizarse mediante métodos frecuentistas [ 83 ] o bayesianos [ 84 ] [ 85 ] .

Los críticos de las pruebas de significación han abogado por basar la inferencia menos en los valores p y más en los intervalos de confianza para los tamaños del efecto en cuanto a importancia, los intervalos de predicción en cuanto a confianza, las replicaciones y extensiones en cuanto a replicabilidad, y los metaanálisis en cuanto a generalidad  . [ 86 ] Pero ninguna de estas alternativas sugeridas produce inherentemente una decisión. Lehmann dijo que la teoría de la prueba de hipótesis puede presentarse en términos de conclusiones/decisiones, probabilidades o intervalos de confianza: "La distinción entre los enfoques es principalmente de presentación e interpretación". [ 29 ]

La inferencia bayesiana es una alternativa propuesta a las pruebas de significancia. (Nickerson citó 10 fuentes que la sugieren, incluyendo a Rozeboom (1960)). [ 20 ] Por ejemplo, la estimación de parámetros bayesianos puede proporcionar información rica sobre los datos a partir de los cuales los investigadores pueden extraer inferencias, mientras que utiliza distribuciones previas inciertas que ejercen una influencia mínima en los resultados cuando se dispone de suficientes datos. El psicólogo John K. Kruschke ha sugerido la estimación bayesiana como una alternativa a la prueba t [ 84 ] y también ha contrastado la estimación bayesiana para evaluar valores nulos con la comparación de modelos bayesianos para pruebas de hipótesis. [ 85 ] Dos modelos/hipótesis en competencia pueden compararse utilizando factores de Bayes . [ 87 ] Los métodos bayesianos podrían ser criticados por requerir información que rara vez está disponible en los casos donde las pruebas de significancia se utilizan con mayor frecuencia. Ni las probabilidades previas ni la distribución de probabilidad del estadístico de prueba bajo la hipótesis alternativa suelen estar disponibles en las ciencias sociales. [ 20 ]

Los defensores de un enfoque bayesiano a veces afirman que el objetivo de un investigador es, con mayor frecuencia, evaluar objetivamente la probabilidad de que una hipótesis sea verdadera basándose en los datos que han recopilado. [ 88 ] [ 89 ] Ni la prueba de significancia de Fisher , ni la prueba de hipótesis de Neyman-Pearson pueden proporcionar esta información, y no pretenden hacerlo. La probabilidad de que una hipótesis sea verdadera solo puede derivarse del uso del Teorema de Bayes , que fue insatisfactorio tanto para los bandos de Fisher como de Neyman-Pearson debido al uso explícito de subjetividad en forma de probabilidad previa . [ 13 ] [ 90 ] La estrategia de Fisher es eludir esto con el valor p (un índice objetivo basado solo en los datos) seguido de inferencia inductiva , mientras que Neyman-Pearson idearon su enfoque de comportamiento inductivo .

Véase también

Referencias

  1. Lewis, Nancy D.; Lewis, Nigel Da Costa; Lewis, ND (2013). 100 Pruebas estadísticas en R: Qué elegir, cómo calcular fácilmente, con más de 300 ilustraciones y ejemplos . Heather Hills Press. ISBN 978-1-4840-5299-0.
  2. Kanji, Gopal K. (18 de julio de 2006). 100 pruebas estadísticas . SAGE. ISBN 978-1-4462-2250-8.
  3. 1 2 Lehmann, EL; Romano, Joseph P. (2005). Prueba de hipótesis estadísticas (3.ª ed.). Nueva York: Springer. ISBN  978-0-387-98864-1.
  4. Wasserstein RL, Lazar NA (2016). "Declaración de la ASA sobre los valores p : contexto, proceso y propósito" (PDF) . The American Statistician . 70 (2): 129– 133. doi : 10.1080/00031305.2016.1154108 . S2CID 124084622 . 
  5. Hughes, Ann J.; Grawoig, Dennis E. (1971). Statistics: A Foundation for Analysis . Reading, Mass.: Addison-Wesley. p . 191. ISBN  0-201-03021-7.
  6. Bellhouse, P. (2001), "John Arbuthnot", en Statisticians of the Centuries de C. C. Heyde y E. Seneta , Springer, pp. 39–42 , ISBN  978-0-387-95329-8
  7. ^ Laplace , P. (1778). "Mémoire sur les probabilités" . Mémoires de l'Académie Royale des Sciences de Paris : 227– 332.Reimpreso en Laplace, P. (1878-1912). «Mémoire sur les probabilités (XIX, XX)» . Obras completas de Laplace . vol. 9. Gauthier-Villars. págs. 383–488 .  Traducción al inglés: Laplace, P. (21 de agosto de 2010). "Mémoire sur les probabilités" (PDF) . Traducido por Pulskam, Richard J. Archivado desde el original (PDF) el 27 de abril de 2015.
  8. Pearson, K (1900). "Sobre el criterio de que un sistema dado de desviaciones de lo probable en el caso de un sistema de variables correlacionadas es tal que se puede suponer razonablemente que surgió de un muestreo aleatorio" (PDF) . The London, Edinburgh, and Dublin Philosophical Magazine and Journal of Science . 5 (50): 157– 175. doi : 10.1080/14786440009463897 .
  9. Pearson, K (1904). "Sobre la teoría de la contingencia y su relación con la asociación y la correlación normal" . Drapers' Company Research Memoirs Biometric Series . 1 : 1–35 .
  10. Zabell, S (1989). "RA Fisher sobre la historia de la probabilidad inversa" . Statistical Science . 4 (3): 247– 256. doi : 10.1214/ss/1177012488 . JSTOR 2245634 . 
  11. 1 2 Raymond Hubbard, MJ Bayarri , Los valores p no son probabilidades de error. Archivado el 4 de septiembre de 2013 en Wayback Machine . Un documento de trabajo que explica la diferencia entre el valor p de evidencia de Fisher y la tasa de error de tipo I de Neyman-Pearson.α{\displaystyle \alpha }.
  12. 1 2 Fisher, R (1955). "Métodos estadísticos e inducción científica" (PDF) . Journal of the Royal Statistical Society, Serie B. 17 ( 1): 69– 78. doi : 10.1111/j.2517-6161.1955.tb00180.x .
  13. 1 2 3 4 Neyman, J; Pearson, ES (1 de enero de 1933). "Sobre el problema de las pruebas más eficientes de hipótesis estadísticas" . Philosophical Transactions of the Royal Society A. 231 ( 694–706 ) : 289–337 . Bibcode : 1933RSPTA.231..289N . doi : 10.1098/rsta.1933.0009 .
  14. Goodman, SN (15 de junio de 1999). " Hacia estadísticas médicas basadas en la evidencia. 1: La falacia del valor p". Ann Intern Med . 130 (12): 995– 1004. doi : 10.7326/0003-4819-130-12-199906150-00008 . PMID 10383371. S2CID 7534212 .  
  15. 1 2 3 4 Lehmann, EL (diciembre de 1993). "Las teorías de Fisher, Neyman-Pearson sobre la prueba de hipótesis: ¿una teoría o dos?". Journal of the American Statistical Association . 88 (424): 1242– 1249. Bibcode : 1993JASA...88.1242L . doi : 10.1080/01621459.1993.10476404 .
  16. Fisher, RN (1958). "La naturaleza de la probabilidad" (PDF) . Centennial Review . 2 : 261–274 . Corremos el grave peligro de enviar al mundo a jóvenes altamente capacitados e inteligentes con tablas de números erróneos bajo el brazo y con una densa niebla en el lugar donde deberían estar sus cerebros. En este siglo, por supuesto, trabajarán en misiles guiados y asesorarán a la profesión médica sobre el control de enfermedades, y no hay límite a la medida en que podrían obstaculizar todo tipo de esfuerzo nacional.
  17. 1 2 3 Lenhard, Johannes (2006). "Modelos e inferencia estadística: la controversia entre Fisher y Neyman-Pearson". Br. J. Philos. Sci . 57 : 69–91 . doi : 10.1093/bjps/axi152 . S2CID 14136146 . 
  18. Neyman, Jerzy (1967). "RA Fisher (1890—1962): Una apreciación". Science . 156 (3781): 1456– 1460. Bibcode : 1967Sci...156.1456N . doi : 10.1126/science.156.3781.1456 . PMID 17741062 . S2CID 44708120 .  
  19. Losavich, JL; Neyman, J.; Scott, EL; Wells, MA (1971). "Explicaciones hipotéticas de los efectos aparentes negativos de la siembra de nubes en el experimento Whitetop" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 68 (11): 2643– 2646. Bibcode : 1971PNAS...68.2643L . doi : 10.1073 / pnas.68.11.2643 . PMC 389491. PMID 16591951 .  
  20. 1 2 3 4 5 6 Nickerson, Raymond S. (2000). "Pruebas de significación de la hipótesis nula: una revisión de una controversia antigua y continua" ( PDF) . Métodos psicológicos . 5 (2): 241– 301. doi : 10.1037/1082-989X.5.2.241 . PMID 10937333. S2CID 28340967. Archivado del original el 23 de febrero de 2000.  
  21. 1 2 Halpin, PF; Stam, HJ (Invierno 2006). "Inferencia inductiva o comportamiento inductivo: Fisher y Neyman: Enfoques de Pearson para las pruebas estadísticas en la investigación psicológica (1940–1960)". The American Journal of Psychology . 119 (4): 625– 653. doi : 10.2307/20445367 . JSTOR 20445367 . PMID 17286092 .  
  22. Gigerenzer, Gerd; Zeno Swijtink; Theodore Porter; Lorraine Daston; John Beatty; Lorenz Kruger (1989). «Parte 3: Los expertos en inferencia». El imperio del azar: cómo la probabilidad cambió la ciencia y la vida cotidiana . Cambridge University Press. págs. 70–122 . ISBN  978-0-521-39838-1.
  23. Meehl, P (1990). "Evaluación y enmienda de teorías: la estrategia de defensa lakatosiana y dos principios que la justifican" (PDF) . Psychological Inquiry . 1 (2): 108– 141. doi : 10.1207/s15327965pli0102_1 .
  24. Mayo, DG; Spanos, A. (2006). "La prueba severa como concepto básico en una filosofía de inducción de Neyman-Pearson". The British Journal for the Philosophy of Science . 57 (2): 323– 357. CiteSeerX 10.1.1.130.8131 . doi : 10.1093/bjps/axl003 . S2CID 7176653 .  
  25. Matemáticas > Bachillerato: Estadística y Probabilidad > Introducción Enlace obsoleto archivado el 28 de julio de 2012 en archive.today Iniciativa de Estándares Estatales Básicos Comunes (relacionado con estudiantes de EE. UU.)
  26. Exámenes del College Board > AP: Asignaturas > Estadística El College Board (dirigido a estudiantes de EE. UU.)
  27. Huff, Darrell (1993). Cómo mentir con estadísticas . Nueva York: Norton. pág . 8. ISBN  978-0-393-31072-6.Los métodos y la terminología estadística son necesarios para informar sobre la gran cantidad de datos relativos a las tendencias sociales y económicas, las condiciones empresariales, las encuestas de opinión y los censos. Pero sin autores que utilicen las palabras con honestidad y lectores que comprendan su significado, el resultado solo puede ser un sinsentido semántico.
  28. Snedecor, George W.; Cochran, William G. (1967). Métodos estadísticos (6.ª ed.). Ames, Iowa: Iowa State University Press. pág. 3.  "...las ideas básicas de la estadística nos ayudan a pensar con claridad sobre el problema, nos proporcionan algunas pautas sobre las condiciones que deben cumplirse para poder realizar inferencias sólidas y nos permiten detectar muchas inferencias que carecen de una buena base lógica."
  29. 1 2 E. L. Lehmann (1997). "Prueba de hipótesis estadísticas: la historia de un libro" . Ciencia estadística . 12 (1): 48– 52. doi : 10.1214/ss/1029963261 .
  30. Sotos, Ana Elisa Castro; Vanhoof, Stijn; Noortgate, Wim Van den; Onghena, Patrick (2007). "Concepciones erróneas de los estudiantes sobre la inferencia estadística: una revisión de la evidencia empírica de la investigación sobre educación estadística" (PDF) . Educational Research Review . 2 (2): 98– 113. doi : 10.1016/j.edurev.2007.04.001 .
  31. Moore, David S. (1997). "Nueva pedagogía y nuevo contenido: el caso de la estadística" (PDF) . International Statistical Review . 65 (2): 123– 165. doi : 10.2307/1403333 . JSTOR 1403333 . 
  32. Hubbard, Raymond; Armstrong, J. Scott (2006). "Por qué realmente no sabemos qué significa la significación estadística: implicaciones para los educadores". Journal of Marketing Education . 28 (2): 114– 120. doi : 10.1177/0273475306288399 . hdl : 2092/413 . S2CID 34729227 . 
  33. Sotos, Ana Elisa Castro; Vanhoof, Stijn; Noortgate, Wim Van den; Onghena, Patrick (2009). "¿Cuán seguros están los estudiantes de sus ideas erróneas acerca de las pruebas de hipótesis?" . Journal of Statistics Education . 17 (2). doi : 10.1080/10691898.2009.11889514 .
  34. Gigerenzer, G. (2004). «El ritual nulo: lo que siempre quiso saber sobre las pruebas de significancia pero temía preguntar» (PDF) . Manual SAGE de metodología cuantitativa para las ciencias sociales . págs. 391–408 . doi : 10.4135/9781412986311 . ISBN  9780761923596.
  35. "Prueba de hipótesis estadísticas" . Springer Texts in Statistics . 2005. doi : 10.1007/0-387-27605-x . ISBN 978-0-387-98864-1ISSN 1431-875X 
  36. Hinkelmann, Klaus; Kempthorne, Oscar (2008). Diseño y análisis de experimentos . Vol. I y II (Segunda edición). Wiley. ISBN   978-0-470-38551-7.
  37. Montgomery, Douglas (2009). Diseño y análisis de experimentos . Hoboken, NJ: Wiley. ISBN 978-0-470-12866-4.
  38. RA Fisher (1925). Métodos estadísticos para investigadores , Edimburgo: Oliver and Boyd, 1925, p. 43.
  39. Nuzzo, Regina (2014). "Método científico: errores estadísticos" . Nature . 506 (7487): 150–152 . Bibcode : 2014Natur.506..150N . doi : 10.1038/506150a . hdl : 11573/685222 . PMID 24522584 . 
  40. Richard J. Larsen; Donna Fox Stroup (1976). Statistics in the Real World: a book of examples . Macmillan. ISBN 978-0023677205.
  41. Hubbard, R.; Parsa, AR; Luthy, MR (1997). "La difusión de las pruebas de significación estadística en psicología: el caso del Journal of Applied Psychology". Theory and Psychology . 7 (4): 545– 554. doi : 10.1177/0959354397074006 . S2CID 145576828 . 
  42. Moore, David (2003). Introducción a la práctica de la estadística . Nueva York: WH Freeman and Co. pág. 426. ISBN  9780716796572.
  43. Ranganathan, Priya; Pramesh, C. S; Buyse, Marc (abril-junio de 2016). "Errores comunes en el análisis estadístico: los peligros de las pruebas múltiples" . Perspect Clin Res . 7 (2): 106–107 . doi : 10.4103/2229-3485.179436 . PMC 4840791. PMID 27141478 .  
  44. Hall, P. y Wilson, SR, 1991. Dos directrices para la prueba de hipótesis bootstrap. Biometrics, pp.757-762.
  45. Tibshirani, RJ y Efron, B., 1993. Una introducción al bootstrap. Monografías sobre estadística y probabilidad aplicada, 57(1).
  46. Martin, MA, 2007. Prueba de hipótesis bootstrap para algunos problemas estadísticos comunes: una evaluación crítica de las propiedades de tamaño y potencia. Computational Statistics & Data Analysis, 51(12), pp.6321-6342.
  47. Horowitz, JL, 2019. Métodos Bootstrap en econometría. Annual Review of Economics, 11, pp.193-224. Soy
  48. John Arbuthnot (1710). "Un argumento a favor de la Divina Providencia, tomado de la constante regularidad observada en los nacimientos de ambos sexos" (PDF) . Philosophical Transactions of the Royal Society of London . 27 ( 325–336 ): 186–190 . doi : 10.1098/rstl.1710.0011 . S2CID 186209819 . 
  49. Brian, Éric; Jaisson, Marie (2007). «Fisicoteología y matemáticas (1710–1794)». El origen de la proporción sexual humana al nacer . Springer Science & Business Media. págs. 1–25 . ISBN  978-1-4020-6036-6.
  50. Conover, WJ (1999), "Capítulo 3.4: La prueba de signos", Estadística no paramétrica práctica (Tercera ed.), Wiley, págs. 157–176 , ISBN   978-0-471-16068-7
  51. Sprent, P. (1989), Métodos estadísticos no paramétricos aplicados (Segunda edición), Chapman & Hall, ISBN  978-0-412-44980-2
  52. Stigler, Stephen M. (1986). Historia de la estadística: La medición de la incertidumbre antes de 1900. Harvard University Press. págs. 225–226 . ISBN  978-0-67440341-3.
  53. Stigler, Stephen M. (1986). Historia de la estadística: La medición de la incertidumbre antes de 1900. Cambridge, Mass: Belknap Press de Harvard University Press. pág . 134. ISBN  978-0-674-40340-6.
  54. Fisher, Sir Ronald A. (2000) [1935]. "Matemáticas de una dama que prueba el té" . En James Roy Newman (ed.). El mundo de las matemáticas, volumen 3 [ Diseño de experimentos ] . Courier Dover Publications. ISBN 978-0-486-41151-4.Originalmente del libro de Fisher, Diseño de experimentos .
  55. Box, Joan Fisher (1978). RA Fisher, La vida de un científico . Nueva York: Wiley. pág. 134. ISBN  978-0-471-09300-8.
  56. Jaynes, ET (2007). Teoría de la probabilidad : la lógica de la ciencia (5.ª ed. impresa). Cambridge [ua]: Cambridge Univ. Press. ISBN   978-0-521-59271-0.
  57. Schervish, M (1996) Teoría de la Estadística , p. 218. ISBN de la primavera. 0-387-94546-6
  58. Kaye, David H.; Freedman, David A. (2011). «Guía de referencia sobre estadística» . Manual de referencia sobre evidencia científica (3.ª ed.). Eagan, MN; Washington, DC: West National Academies Press. pág. 259. ISBN   978-0-309-21421-6.
  59. Ash, Robert (1970). Teoría básica de la probabilidad . Nueva York: Wiley. ISBN 978-0471034506.Sección 8.2
  60. 1 2 Tukey, John W. (1960). "Conclusiones vs decisiones". Technometrics . 26 (4): 423– 433. doi : 10.1080/00401706.1960.10489909 ."Hasta que no analicemos los métodos de comprobación de hipótesis, separando los elementos de decisión [Neyman-Pearson] de los elementos de conclusión [Fisher], la mezcla intrincada de elementos dispares seguirá siendo una fuente constante de confusión." ... "Hay lugar tanto para 'hacer lo mejor posible' como para 'decir solo lo que es seguro', pero es importante saber, en cada caso, qué se está haciendo y qué se debería hacer."
  61. Stigler, Stephen M. (agosto de 1996). "La historia de la estadística en 1933" . Statistical Science . 11 (3): 244– 252. doi : 10.1214/ss/1032280216 . JSTOR 2246117 . 
  62. Berger, James O. (2003). "¿Podrían Fisher, Jeffreys y Neyman haber coincidido en las pruebas?" . Statistical Science . 18 (1): 1– 32. Bibcode : 2003StaSc..1897485B . doi : 10.1214/ss/1056397485 .
  63. Cornfield, Jerome (1976). "Contribuciones metodológicas recientes a los ensayos clínicos" (PDF) . American Journal of Epidemiology . 104 (4): 408– 421. doi : 10.1093/oxfordjournals.aje.a112313 . PMID 788503 . 
  64. Yates, Frank (1951). "La influencia de los métodos estadísticos para investigadores en el desarrollo de la ciencia estadística". Journal of the American Statistical Association . 46 (253): 19– 34. doi : 10.1080/01621459.1951.10500764 .«El énfasis puesto en las pruebas formales de significación a lo largo de Métodos estadísticos [de R.A. Fisher]... ha provocado que los investigadores científicos presten una atención excesiva a los resultados de las pruebas de significación que realizan sobre sus datos, especialmente los derivados de experimentos, y muy poca a las estimaciones de la magnitud de los efectos que investigan.» ... «El énfasis en las pruebas de significación y la consideración de los resultados de cada experimento de forma aislada han tenido la desafortunada consecuencia de que los investigadores científicos a menudo han considerado la realización de una prueba de significación en un experimento como el objetivo final.»
  65. Begg, Colin B.; Berlin, Jesse A. (1988). "Sesgo de publicación: un problema en la interpretación de datos médicos". Journal of the Royal Statistical Society, Serie A. 151 ( 3): 419– 463. doi : 10.2307/2982993 . JSTOR 2982993. S2CID 121054702 .  
  66. Meehl, Paul E. (1967). «Prueba de teorías en psicología y física: una paradoja metodológica» (PDF) . Filosofía de la ciencia . 34 (2): 103–115 . doi : 10.1086/288135 . S2CID 96422880. Archivado del original (PDF) el 3 de diciembre de 2013. Treinta años después, Meehl reconoció que la teoría de la significación estadística era matemáticamente sólida, aunque siguió cuestionando la elección predeterminada de la hipótesis nula, culpando en cambio a la "mala comprensión que tienen los científicos sociales de la relación lógica entre teoría y hecho" en "El problema es la epistemología, no la estadística: sustituya las pruebas de significación por intervalos de confianza y cuantifique la precisión de las predicciones numéricas arriesgadas" (Capítulo 14 en Harlow (1997)).
  67. Bakan, David (1966). "La prueba de significancia en la investigación psicológica". Psychological Bulletin . 66 (6): 423– 437. doi : 10.1037/h0020412 . PMID 5974619 . 
  68. Gigerenzer, G (noviembre de 2004). "Estadísticas sin sentido". The Journal of Socio-Economics . 33 (5): 587– 606. doi : 10.1016/j.socec.2004.09.033 . hdl : 11858/00-001M-0000-0025-87C0-8 .
  69. Nunnally, Jum (1960). "El lugar de la estadística en la psicología". Educational and Psychological Measurement . 20 (4): 641– 650. doi : 10.1177/001316446002000401 . S2CID 144813784 . 
  70. Lykken, David T. (1991). "¿Qué tiene de malo la psicología, después de todo?". Pensando con claridad sobre la psicología . 1 : 3–39 .
  71. Jacob Cohen (diciembre de 1994). "La Tierra es redonda (p < .05)". American Psychologist . 49 (12): 997– 1003. doi : 10.1037/0003-066X.49.12.997 . S2CID 380942 . Este artículo dio lugar a la revisión de las prácticas estadísticas por parte de la APA. Cohen fue miembro del grupo de trabajo que realizó dicha revisión.
  72. Kline, Rex (2004). Más allá de las pruebas de significación: reformando los métodos de análisis de datos en la investigación del comportamiento . Washington, DC: Asociación Americana de Psicología. ISBN 9781591471189.
  73. Branch, Mark (2014). "Efectos secundarios malignos de las pruebas de significación de hipótesis nula". Theory & Psychology . 24 (2): 256– 277. doi : 10.1177/0959354314525282 . S2CID 40712136 . 
  74. Hunter, John E. (enero de 1997). "Necesario: Prohibición de la prueba de significación". Psychological Science . 8 (1): 3– 7. doi : 10.1111/j.1467-9280.1997.tb00534.x . S2CID 145422959 . 
  75. Lakens, Daniël (2021). " La alternativa práctica al valor p es el valor p correctamente utilizado" . Perspectives on Psychological Science . 16 (3): 639– 648. doi : 10.1177/1745691620958012 . PMC 8114329. S2CID 231863811 .  
  76. 1 2 Wilkinson, Leland (1999). "Métodos estadísticos en revistas de psicología; directrices y explicaciones". American Psychologist . 54 (8): 594– 604. Bibcode : 1999AmPsy..54..594W . doi : 10.1037/0003-066X.54.8.594 . S2CID 428023 . «Pruebas de hipótesis. Es difícil imaginar una situación en la que una decisión dicotómica de aceptación o rechazo sea mejor que informar un valor p real o, mejor aún, un intervalo de confianza» (p. 599). El comité utilizó el término de advertencia «tolerancia» para describir su decisión de no prohibir las pruebas de hipótesis en los informes de psicología (p. 603).
  77. "ICMJE: Obligación de publicar estudios negativos" . Archivado del original el 16 de julio de 2012. Recuperado el 3 de septiembre de 2012. Los editores deben considerar seriamente para su publicación cualquier estudio bien realizado sobre una cuestión importante, relevante para sus lectores, si los resultados para el resultado principal o cualquier resultado adicional son estadísticamente significativos. No presentar o publicar hallazgos debido a la falta de significación estadística es una causa importante de sesgo de publicación.
  78. Sitio web de la Revista de Artículos en Apoyo de la Hipótesis Nula : página principal de JASNH . El volumen 1, número 1, se publicó en 2002 y todos los artículos tratan sobre temas relacionados con la psicología.
  79. Howell, David (2002). Métodos estadísticos para la psicología (5.ª ed.). Duxbury. pág . 94. ISBN   978-0-534-37770-0.
  80. Williams, S.; Carson, R.; Tóth, K. (10 de octubre de 2023). "Más allá de los valores P en The Journal of Physiology: una introducción al valor de los tamaños del efecto y los intervalos de confianza" . J Physiol . 601 (23): 5131– 5133. doi : 10.1113/JP285575 . PMID 37815959. S2CID 263827430 .  
  81. Los valores p son variables aleatorias. Duncan J. Murdoch, Yu-Ling Tsai y James Adcock, The American Statistician, 2008, https://www.jstor.org/stable/27644033
  82. Boos, Dennis D; Stefanski, Leonard A (2011). "Precisión y reproducibilidad del valor p" . The American Statistician . 65 (4): 213– 221. doi : 10.1198/tas.2011.10129 . PMC 3370685. PMID 22690019 .  
  83. Ho, Joses; Tumkaya, Tayfun; Aryal, Sameer; Choi, Hyungwon; Claridge-Chang, Adam (19 de junio de 2019). "Más allá de los valores P: análisis de datos con gráficos de estimación" . Nature Methods . 16 (7): 565– 566. doi : 10.1038/s41592-019-0470-3 . ISSN 1548-7091 . PMID 31217592 .  
  84. 1 2 Kruschke, JK (9 de julio de 2012). "La estimación bayesiana reemplaza la prueba T" ( PDF) . Journal of Experimental Psychology: General . 142 (2): 573– 603. doi : 10.1037/a0029146 . PMID 22774788. S2CID 5610231 .  
  85. 1 2 Kruschke, JK (8 de mayo de 2018). "Rechazo o aceptación de valores de parámetros en la estimación bayesiana" (PDF) . Avances en métodos y prácticas en la ciencia psicológica . 1 (2): 270– 280. doi : 10.1177/2515245918771304 . S2CID 125788648 . 
  86. Armstrong, J. Scott (2007). "Las pruebas de significancia perjudican el progreso en la previsión" . International Journal of Forecasting . 23 (2): 321– 327. CiteSeerX 10.1.1.343.9516 . doi : 10.1016/j.ijforecast.2007.03.004 . S2CID 1550979 .  
  87. Kass, RE (1993). Factores de Bayes e incertidumbre del modelo (PDF) (Informe). Departamento de Estadística, Universidad de Washington.
  88. Rozeboom, William W (1960). "La falacia de la prueba de significación de la hipótesis nula" (PDF) . Psychological Bulletin . 57 (5): 416– 428. CiteSeerX 10.1.1.398.9002 . doi : 10.1037/h0042040 . PMID 13744252 .  "...la correcta aplicación de la estadística a la inferencia científica está irrevocablemente comprometida con una amplia consideración de las probabilidades inversas [también conocidas como bayesianas]..." Se reconoció, con pesar, que las distribuciones de probabilidad a priori estaban disponibles "solo como una percepción subjetiva, que difiere de una persona a otra" "al menos en el futuro inmediato".
  89. Berger, James (2006). "El caso del análisis bayesiano objetivo" . Análisis bayesiano . 1 (3): 385– 402. doi : 10.1214/06-ba115 . Al enumerar las definiciones contrapuestas de análisis bayesiano "objetivo", el autor expresó que "un objetivo fundamental de la estadística (y de la ciencia en general) es encontrar una metodología bayesiana objetiva y completamente coherente para aprender de los datos". Añadió que este objetivo "no es alcanzable".
  90. Aldrich, J (2008). "RA Fisher sobre Bayes y el teorema de Bayes" . Análisis Bayesiano . 3 (1): 161– 170. doi : 10.1214/08-BA306 .

Lecturas adicionales

  • Lehmann EL (1992) «Introducción a Neyman y Pearson (1933) Sobre el problema de las pruebas más eficientes de hipótesis estadísticas». En: Avances en estadística, Volumen 1 , (Eds. Kotz, S., Johnson, NL), Springer-Verlag. ISBN 0-387-94037-5(seguido de la reimpresión del artículo)
  • Neyman, J.; Pearson, ES (1933). "Sobre el problema de las pruebas más eficientes de hipótesis estadísticas" . Philosophical Transactions of the Royal Society A. 231 ( 694–706 ) : 289–337 . Bibcode : 1933RSPTA.231..289N . doi : 10.1098/rsta.1933.0009 .
  • "Hipótesis estadísticas, verificación de" , Enciclopedia de Matemáticas , EMS Press , 2001 [1994]
  • Crítica bayesiana de la prueba de hipótesis clásica
  • Crítica de las pruebas de hipótesis clásicas que pone de relieve las dudas de larga data de los estadísticos.
  • Introducción a las pruebas estadísticas: Cómo elegir la prueba estadística correcta
  • Método de prueba de hipótesis basado en análisis estadístico para el descubrimiento de conocimiento biológico; Md. Naseef-Ur-Rahman Chowdhury, Suvankar Paul, Kazi Zakia Sultana

Calculadoras en línea

  • Algunas calculadoras de valores p y pruebas de hipótesis .