Articulo de referencia

Significancia estadística

En las pruebas de hipótesis estadísticas , [ 1 ] [ 2 ] un resultado tiene significación estadística cuando un resultado al menos igual de extremo sería muy infrecuente si la hip...

En las pruebas de hipótesis estadísticas , [ 1 ] [ 2 ] un resultado tiene significación estadística cuando un resultado al menos igual de extremo sería muy infrecuente si la hipótesis nula fuera verdadera. [ 3 ] Más precisamente, el nivel de significación definido de un estudio , denotado porα{\displaystyle \alpha }, es la probabilidad de que el estudio rechace la hipótesis nula, dado que la hipótesis nula es verdadera; [ 4 ] y el valor p de un resultado,pag{\displaystyle p}es la probabilidad de obtener un resultado al menos tan extremo, dado que la hipótesis nula es verdadera. [ 5 ] Se dice que el resultado es estadísticamente significativo , según los estándares del estudio, cuandopagα{\displaystyle p\leq \alpha }. [ 6 ] [ 7 ] [ 8 ] [ 9 ] [ 10 ] [ 11 ] [ 12 ] El nivel de significancia para un estudio se elige antes de la recopilación de datos y normalmente se establece en 5% [ 13 ] o mucho menor, dependiendo del campo de estudio. [ 14 ]

En cualquier experimento u observación que implique extraer una muestra de una población , siempre existe la posibilidad de que un efecto observado se deba únicamente al error de muestreo . [ 15 ] [ 16 ] Pero si el valor p de un efecto observado es menor o igual al nivel de significancia, un investigador puede concluir que el efecto refleja las características de toda la población, [ 1 ] rechazando así la hipótesis nula. [ 17 ]

Esta técnica para evaluar la significación estadística de los resultados se desarrolló a principios del siglo XX. El término significación no implica importancia en este contexto, y el término significación estadística no es lo mismo que significación en la investigación, significación teórica o significación práctica. [ 1 ] [ 2 ] [ 18 ] [ 19 ] Por ejemplo, el término significación clínica se refiere a la importancia práctica del efecto de un tratamiento. [ 20 ]

Historia

La significación estadística se remonta al siglo XVIII, en la obra de John Arbuthnot y Pierre-Simon Laplace , quienes calcularon el valor p para la proporción de sexos humanos al nacer, asumiendo una hipótesis nula de igual probabilidad de nacimientos masculinos y femeninos; véase el valor p §  Historia para más detalles. [ 21 ] [ 22 ] [ 23 ] [ 24 ] [ 25 ] [ 26 ] [ 27 ]

En 1925, Ronald Fisher impulsó la idea de las pruebas de hipótesis estadísticas, que denominó "pruebas de significancia", en su publicación Métodos estadísticos para investigadores . [ 28 ] [ 29 ] [ 30 ] Fisher sugirió una probabilidad de uno en veinte (0,05) como un nivel de corte conveniente para rechazar la hipótesis nula. [ 31 ] En un artículo de 1933, Jerzy Neyman y Egon Pearson denominaron a este corte nivel de significancia , al que llamaronα{\displaystyle \alpha }Recomendaron queα{\displaystyle \alpha }debe establecerse con anticipación, antes de cualquier recopilación de datos. [ 31 ] [ 32 ]

A pesar de su sugerencia inicial de 0,05 como nivel de significancia, Fisher no pretendía que este valor límite fuera fijo. En su publicación de 1956, Métodos estadísticos e inferencia científica, recomendó que los niveles de significancia se establecieran según las circunstancias específicas. [ 31 ]

El nivel de significanciaα{\displaystyle \alpha }es el umbral parapag{\displaystyle p}por debajo de la cual se rechaza la hipótesis nula aunque por supuesto fuera verdadera. Esto significa que si de hecho la hipótesis nula es verdadera,α{\displaystyle \alpha }es también la probabilidad de rechazarlo erróneamente de todos modos. [ 4 ] Esto también se denomina falso positivo y error de tipo I.

A veces, los investigadores hablan del nivel de confianza γ = (1 − α ) . Esta es la probabilidad de no rechazar la hipótesis nula dado que es verdadera. [ 33 ] [ 34 ] Los niveles de confianza y los intervalos de confianza fueron introducidos por Neyman en 1937. [ 35 ]

Función en la comprobación de hipótesis estadísticas

En una prueba bilateral , la región de rechazo para un nivel de significancia de α = 0,05 se divide en ambos extremos de la distribución muestral y constituye el 5% del área bajo la curva (áreas blancas).

La significación estadística desempeña un papel fundamental en la prueba de hipótesis estadísticas. Se utiliza para determinar si la hipótesis nula debe rechazarse o aceptarse. La hipótesis nula es la hipótesis de que no existe ningún efecto en el fenómeno que se está estudiando. [ 36 ] Para que se rechace la hipótesis nula, un resultado observado debe ser estadísticamente significativo, es decir, el valor p observado es menor que el nivel de significación preestablecido.α{\displaystyle \alpha }.

Para determinar si un resultado es estadísticamente significativo, un investigador calcula un valor p , que es la probabilidad de observar un efecto de la misma magnitud o más extremo dado que la hipótesis nula es verdadera. [ 5 ] [ 12 ] La hipótesis nula se rechaza si el valor p es menor que (o igual a) un nivel predeterminado,α{\displaystyle \alpha }. α{\displaystyle \alpha }También se le llama nivel de significancia y es la probabilidad de rechazar la hipótesis nula dado que es verdadera (un error de tipo I ). Generalmente se establece en un 5 % o menos.

Por ejemplo, cuandoα{\displaystyle \alpha }Se establece en 5%, la probabilidad condicional de un error de tipo I , dado que la hipótesis nula es verdadera , es 5%, [ 37 ] y un resultado estadísticamente significativo es aquel donde el valor p observado es menor o igual al 5%. [ 38 ] Al extraer datos de una muestra, esto significa que la región de rechazo comprende el 5% de la distribución muestral . [ 39 ] Este 5% puede asignarse a un lado de la distribución muestral, como en una prueba unilateral , o dividirse en ambos lados de la distribución, como en una prueba bilateral , con cada cola (o región de rechazo) conteniendo el 2,5% de la distribución.

El uso de una prueba unilateral depende de si la pregunta de investigación o la hipótesis alternativa especifica una dirección, como si un grupo de objetos es más pesado o si el rendimiento de los estudiantes en una evaluación es mejor . [ 3 ] Se puede usar una prueba bilateral, pero será menos potente que una unilateral, porque la región de rechazo para una prueba unilateral se concentra en un extremo de la distribución nula y es el doble de grande (5% frente a 2,5%) que cada región de rechazo para una prueba bilateral. Como resultado, la hipótesis nula se puede rechazar con un resultado menos extremo si se usó una prueba unilateral. [ 40 ] La prueba unilateral solo es más potente que una bilateral si la dirección especificada de la hipótesis alternativa es correcta. Sin embargo, si es incorrecta, entonces la prueba unilateral no tiene potencia.

Umbrales de significancia en campos específicos

En campos específicos como la física de partículas y la manufactura , la significancia estadística se expresa a menudo en múltiplos de la desviación estándar o sigma ( σ ) de una distribución normal , con umbrales de significancia establecidos a un nivel mucho más estricto (por ejemplo , ). [ 41 ] [ 42 ] Por ejemplo, la certeza de la existencia de la partícula bosón de Higgs se basó en el criterio de 5σ , que corresponde a un valor p de aproximadamente 1 en 3,5 millones. [ 42 ] [ 43 ]

En otros campos de investigación científica, como los estudios de asociación de todo el genoma , los niveles de significancia son tan bajos como5 × 10 −8 no son infrecuentes [ 44 ] [ 45 ] —ya que el número de pruebas realizadas es extremadamente grande.

Limitaciones

Los investigadores que se centran únicamente en si sus resultados son estadísticamente significativos podrían informar hallazgos que no son sustanciales [ 46 ] ni replicables. [ 47 ] [ 48 ] También existe una diferencia entre significación estadística y significación práctica. Un estudio que se considera estadísticamente significativo no necesariamente es prácticamente significativo. [ 49 ] [ 19 ]

Tamaño del efecto

El tamaño del efecto es una medida de la significancia práctica de un estudio. [ 49 ] Un resultado estadísticamente significativo puede tener un efecto débil. Para evaluar la significancia de la investigación de sus resultados, se recomienda a los investigadores que siempre informen el tamaño del efecto junto con los valores p . Una medida del tamaño del efecto cuantifica la fuerza de un efecto, como la distancia entre dos medias en unidades de desviación estándar (cf. d de Cohen ), el coeficiente de correlación entre dos variables o su cuadrado , y otras medidas. [ 50 ]

Reproducibilidad

Un resultado estadísticamente significativo puede no ser fácil de reproducir. [ 48 ] En particular, algunos resultados estadísticamente significativos serán, de hecho, falsos positivos. Cada intento fallido de reproducir un resultado aumenta la probabilidad de que el resultado sea un falso positivo. [ 51 ]

Desafíos

Uso excesivo en algunas revistas

A partir de la década de 2010, algunas revistas comenzaron a cuestionar si las pruebas de significancia, y en particular el uso de un umbral de α = 5%, se estaban utilizando con demasiada frecuencia como medida principal de validez de una hipótesis. [ 52 ] Algunas revistas alentaron a los autores a realizar análisis más detallados que una simple prueba de significancia estadística. En psicología social, la revista Basic and Applied Social Psychology prohibió por completo el uso de pruebas de significancia en los artículos que publicaba, [ 53 ] exigiendo a los autores que utilizaran otras medidas para evaluar las hipótesis y el impacto. [ 54 ] [ 55 ]

Otros editores, al comentar sobre esta prohibición, han señalado: «Prohibir la presentación de valores p , como lo hizo recientemente Basic and Applied Social Psychology, no va a resolver el problema porque simplemente trata un síntoma del mismo. No hay nada malo con las pruebas de hipótesis y los valores p en sí mismos, siempre que los autores, revisores y editores de acción los utilicen correctamente». [ 56 ] Algunos estadísticos prefieren utilizar medidas alternativas de evidencia, como razones de verosimilitud o factores de Bayes . [ 57 ] El uso de la estadística bayesiana puede evitar los niveles de confianza, pero también requiere hacer suposiciones adicionales, [ 57 ] y puede que no mejore necesariamente la práctica con respecto a las pruebas estadísticas. [ 58 ]

El abuso generalizado de la significación estadística representa un tema importante de investigación en metaciencia . [ 59 ]

Redefiniendo la importancia

En 2016, la Asociación Estadounidense de Estadística (ASA) publicó una declaración sobre los valores p , afirmando que "el uso generalizado de la 'significación estadística' (generalmente interpretada como ' p  ≤ 0,05') como licencia para hacer una afirmación de un hallazgo científico (o verdad implícita) conduce a una distorsión considerable del proceso científico ". [ 57 ] En 2017, un grupo de 72 autores propuso mejorar la reproducibilidad cambiando el umbral del valor p para la significación estadística de 0,05 a 0,005. [ 60 ] Otros investigadores respondieron que imponer un umbral de significación más estricto agravaría problemas como la manipulación de datos ; por lo tanto, las propuestas alternativas son seleccionar y justificar umbrales de valor p flexibles antes de recopilar datos, [ 61 ] o interpretar los valores p como índices continuos, descartando así los umbrales y la significación estadística. [ 62 ] Además, el cambio a 0,005 aumentaría la probabilidad de falsos negativos, en los que el efecto que se está estudiando es real, pero la prueba no lo demuestra. [ 63 ]

En 2019, más de 800 estadísticos y científicos firmaron un mensaje pidiendo el abandono del término "significación estadística" en la ciencia, [ 64 ] y la ASA publicó un editorial [ 65 ] declarando (página 2):

Concluimos, basándonos en nuestra revisión de los artículos de este número especial y la literatura más amplia, que es hora de dejar de usar el término "estadísticamente significativo" por completo. Tampoco deberían usarse variantes como "significativamente diferente",pag0,05{\displaystyle p\leq 0.05}"," y "no significativo" sobreviven, ya sea expresados ​​con palabras, mediante asteriscos en una tabla o de alguna otra manera.

Véase también

Referencias

  1. 1 2 3 Sirkin, R. Mark (2005). «Pruebas t de dos muestras». Estadística para las ciencias sociales (3.ª  ed.). Thousand Oaks, CA: SAGE Publications, Inc. págs. 271–316 . ISBN  978-1-4129-0546-6.
  2. 1 2 Borror, Connie M. (2009). «Toma de decisiones estadísticas». Manual del Ingeniero de Calidad Certificado (3.ª ed.). Milwaukee, WI: ASQ Quality Press. págs. 418–472 . ISBN   978-0-87389-745-7.
  3. 1 2 Myers, Jerome L.; Well, Arnold D.; Lorch, Robert F. Jr. (2010). «Desarrollo de los fundamentos de la prueba de hipótesis utilizando la distribución binomial». Diseño de investigación y análisis estadístico (3.ª ed.). Nueva York, NY: Routledge. págs. 65–90 . ISBN   978-0-8058-6431-1.
  4. 1 2 Dalgaard, Peter (2008). "Potencia y cálculo del tamaño de la muestra". Estadística introductoria con R. Estadística y computación. Nueva York: Springer. págs. 155–56 . doi : 10.1007/978-0-387-79054-1_9 . ISBN  978-0-387-79053-4.
  5. 1 2 "Prueba de hipótesis estadística" . www.dartmouth.edu . Archivado del original el 2 de agosto de 2020. Consultado el 11 de noviembre de 2019 .
  6. Johnson, Valen E. (9 de octubre de 2013). "Estándares revisados ​​para la evidencia estadística" . Actas de la Academia Nacional de Ciencias . 110 (48): 19313– 19317. Bibcode : 2013PNAS..11019313J . doi : 10.1073 / pnas.1313476110 . PMC 3845140. PMID 24218581 .  
  7. Redmond, Carol; Colton, Theodore (2001). «Significación clínica frente a significación estadística». Bioestadística en ensayos clínicos . Serie de referencia de Wiley en bioestadística (3.ª ed.). West Sussex, Reino Unido: John Wiley & Sons Ltd. pp. 35–36 . ISBN   978-0-471-82211-0.
  8. Cumming, Geoff (2012). Comprender las nuevas estadísticas: tamaños del efecto, intervalos de confianza y metaanálisis . Nueva York, EE. UU.: Routledge. págs. 27–28 . 
  9. Krzywinski, Martin; Altman, Naomi (30 de octubre de 2013). "Puntos de significancia: significancia, valores P y pruebas t" . Nature Methods . 10 (11): 1041– 1042. doi : 10.1038/nmeth.2698 . PMID 24344377 . 
  10. Sham, Pak C.; Purcell, Shaun M (17 de abril de 2014). "Potencia estadística y pruebas de significación en estudios genéticos a gran escala". Nature Reviews Genetics . 15 (5): 335– 346. doi : 10.1038/nrg3706 . PMID 24739678. S2CID 10961123 .  
  11. Altman, Douglas G. (1999). Practical Statistics for Medical Research . Nueva York, EE . UU.: Chapman & Hall/CRC. pp. 167. ISBN  978-0-412-27630-9.
  12. 1 2 Devore, Jay L. (2011). Probabilidad y estadística para ingeniería y ciencias (8.ª ed.). Boston, MA: Cengage Learning. págs. 300–344 . ISBN   978-0-538-73352-6.
  13. Craparo, Robert M. (2007). «Nivel de significancia». En Salkind, Neil J. (ed.). Enciclopedia de medición y estadística . Vol. 3. Thousand Oaks, CA: SAGE Publications. pp. 889–891 . ISBN   978-1-4129-1611-0.
  14. Sproull, Natalie L. (2002). «Prueba de hipótesis» . Manual de métodos de investigación: Guía para profesionales y estudiantes de ciencias sociales (2.ª ed.). Lanham, MD: Scarecrow Press, Inc. pp. 49–64 . ISBN   978-0-8108-4486-5.
  15. Babbie, Earl R. (2013). «La lógica del muestreo». La práctica de la investigación social (13.ª ed.). Belmont, CA: Cengage Learning. pp. 185–226 . ISBN   978-1-133-04979-1.
  16. Faherty, Vincent (2008). «Probabilidad y significación estadística». Estadística compasiva: Análisis cuantitativo aplicado a los servicios sociales (con ejercicios e instrucciones en SPSS) (1.ª ed.). Thousand Oaks, CA: SAGE Publications, Inc. pp. 127–138 . ISBN   978-1-4129-3982-9.
  17. McKillup, Steve (2006). «La probabilidad te ayuda a tomar una decisión sobre tus resultados» . Statistics Explained: An Introductory Guide for Life Scientists (1.ª ed.). Cambridge, Reino Unido: Cambridge University Press. pp. 44–56 . ISBN   978-0-521-54316-3.
  18. Myers, Jerome L.; Well, Arnold D.; Lorch, Robert F. Jr. (2010). «La distribución t y sus aplicaciones». Diseño de investigación y análisis estadístico (3.ª ed.). Nueva York, NY: Routledge. págs. 124–153 . ISBN   978-0-8058-6431-1.
  19. 1 2 Hooper, Peter. "¿Qué es el valor p?" (PDF) . Universidad de Alberta, Departamento de Ciencias Matemáticas y Estadísticas . Archivado del original (PDF) el 31 de marzo de 2020. Recuperado el 10 de noviembre de 2019 .
  20. Leung, W.-C. (2001-03-01). "Equilibrando la significación estadística y clínica en la evaluación de los efectos del tratamiento" . Postgraduate Medical Journal . 77 (905): 201– 204. doi : 10.1136/pmj.77.905.201 . ISSN 0032-5473 . PMC 1741942. PMID 11222834 .   
  21. Brian, Éric; Jaisson, Marie (2007). «Fisicoteología y matemáticas (1710–1794)». El origen de la proporción de sexos al nacer en los seres humanos . Springer Science & Business Media. págs. 1–25 . ISBN  978-1-4020-6036-6.
  22. John Arbuthnot (1710). "Un argumento a favor de la Divina Providencia, tomado de la constante regularidad observada en los nacimientos de ambos sexos" (PDF) . Philosophical Transactions of the Royal Society of London . 27 ( 325–336 ): 186–190 . doi : 10.1098/rstl.1710.0011 .
  23. Conover, WJ (1999), "Capítulo 3.4: La prueba de signos", Estadística no paramétrica práctica (Tercera ed.), Wiley, págs. 157–176 , ISBN   978-0-471-16068-7
  24. Sprent, P. (1989), Métodos estadísticos no paramétricos aplicados (Segunda edición), Chapman & Hall, ISBN  978-0-412-44980-2
  25. Stigler, Stephen M. (1986). Historia de la estadística: La medición de la incertidumbre antes de 1900. Harvard University Press. págs. 225–226 . ISBN  978-0-674-40341-3.
  26. Bellhouse, David (2001), "John Arbuthnot", en CC Heyde ; E. Seneta (eds.), en Statisticians of the Centuries , Springer, pp. 39–42 , ISBN  978-0-387-95329-8
  27. Hald, Anders (1998), "Capítulo 4. Azar o diseño: Pruebas de significación", Historia de la estadística matemática de 1750 a 1930 , Wiley, pág. 65 
  28. Cumming, Geoff (2011). «De la significación de la hipótesis nula a la prueba de tamaños del efecto». Comprensión de las nuevas estadísticas: tamaños del efecto, intervalos de confianza y metaanálisis . Serie de aplicaciones multivariantes. East Sussex, Reino Unido: Routledge. págs. 21–52 . ISBN  978-0-415-87968-2.
  29. Fisher, Ronald A. (1925). Métodos estadísticos para investigadores . Edimburgo, Reino Unido: Oliver and Boyd. 43 págs . ISBN  978-0-05-002170-5.{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda )
  30. Poletiek, Fenna H. (2001). «Teorías formales de la comprobación». Comportamiento de comprobación de hipótesis . Ensayos de psicología cognitiva (1.ª ed.). East Sussex, Reino Unido: Psychology Press. pp. 29–48 . ISBN   978-1-84169-159-6.
  31. 1 2 3 Quinn, Geoffrey R.; Keough, Michael J. (2002). Diseño experimental y análisis de datos para biólogos (1.ª ed.). Cambridge, Reino Unido: Cambridge University Press. págs. 46–69 . ISBN   978-0-521-00976-8.
  32. Neyman, J.; Pearson, ES (1933). "La comprobación de hipótesis estadísticas en relación con probabilidades a priori". Actas Matemáticas de la Sociedad Filosófica de Cambridge . 29 (4): 492– 510. Bibcode : 1933PCPS...29..492N . doi : 10.1017/S030500410001152X . S2CID 119855116 . 
  33. "Es posible llegar a conclusiones sobre la significación estadística con la ayuda del intervalo de confianza. Si el intervalo de confianza no incluye el valor de efecto cero, se puede asumir que hay un resultado estadísticamente significativo." Prel, Jean-Baptist du; Hommel, Gerhard; Röhrig, Bernd; Blettner, Maria (2009). "¿Intervalo de confianza o valor p?" . Deutsches Ärzteblatt Online . 106 (19): 335– 9. doi : 10.3238/arztebl.2009.0335 . PMC 2689604 . PMID 19547734 .  
  34. StatNews #73: Intervalos de confianza superpuestos y significación estadística
  35. Neyman, J. (1937). "Esquema de una teoría de estimación estadística basada en la teoría clásica de la probabilidad". Philosophical Transactions of the Royal Society A. 236 ( 767): 333– 380. Bibcode : 1937RSPTA.236..333N . doi : 10.1098/rsta.1937.0005 . JSTOR 91337. S2CID 19584450 .  
  36. Meier, Kenneth J.; Brudney, Jeffrey L.; Bohte, John (2011). Estadística aplicada para la administración pública y sin fines de lucro (3.ª ed.). Boston, MA: Cengage Learning. págs. 189–209 . ISBN   978-1-111-34280-7.
  37. Healy, Joseph F. (2009). Fundamentos de estadística: una herramienta para la investigación social (2.ª ed.). Belmont, CA: Cengage Learning. pp. 177–205 . ISBN   978-0-495-60143-2.
  38. McKillup, Steve (2006). Statistics Explained: An Introductory Guide for Life Scientists (1.ª ed.). Cambridge, Reino Unido: Cambridge University Press. pp. 32–38 . ISBN   978-0-521-54316-3.
  39. Health, David (1995). Introducción al diseño experimental y la estadística para biología (1.ª ed.). Boston, MA: CRC Press. págs. 123–154 . ISBN   978-1-85728-132-3.
  40. Hinton, Perry R. (2010). «Significancia, error y potencia». Statistics explained (3.ª ed.). Nueva York, NY: Routledge. pp. 79–90 . ISBN   978-1-84872-312-2.
  41. Vaughan, Simon (2013). Inferencia científica: Aprendiendo de los datos (1.ª ed.). Cambridge, Reino Unido: Cambridge University Press. págs. 146–152 . ISBN   978-1-107-02482-3.
  42. 1 2 Bracken, Michael B. (2013). Riesgo, azar y causalidad: Investigación de los orígenes y el tratamiento de las enfermedades (1.ª ed.). New Haven, CT: Yale University Press. págs. 260–276 . ISBN   978-0-300-18884-4.
  43. Franklin, Allan (2013). «Prólogo: El auge de las sigmas». Shifting Standards: Experiments in Particle Physics in the Twentieth Century (1.ª ed.). Pittsburgh, PA: University of Pittsburgh Press. pp. II– III. ISBN   978-0-8229-4430-0.
  44. Clarke, GM; Anderson, CA; Pettersson, FH; Cardon, LR; Morris, AP; Zondervan, KT (6 de febrero de 2011). " Análisis estadístico básico en estudios genéticos de casos y controles" . Nature Protocols . 6 (2): 121– 33. doi : 10.1038/nprot.2010.182 . PMC 3154648. PMID 21293453 .  
  45. Barsh, GS; Copenhaver, GP; Gibson, G; Williams, SM (5 de julio de 2012). "Directrices para estudios de asociación de genoma completo" . PLOS Genetics . 8 (7) e1002812. doi : 10.1371/journal.pgen.1002812 . PMC 3390399. PMID 22792080 .  
  46. Carver, Ronald P. (1978). "Argumentos en contra de las pruebas de significación estadística". Harvard Educational Review . 48 (3): 378– 399. doi : 10.17763/haer.48.3.t490261645281841 . S2CID 16355113 . 
  47. Ioannidis, John PA (2005). " Por qué la mayoría de los hallazgos de investigación publicados son falsos" . PLOS Medicine . 2 (8) e124. doi : 10.1371/journal.pmed.0020124 . PMC 1182327. PMID 16060722 .  
  48. 1 2 Amrhein, Valentin; Korner-Nievergelt, Fränzi; Roth, Tobias (2017). "La Tierra es plana (p > 0,05): umbrales de significancia y la crisis de la investigación irreplicable" . PeerJ . 5 e3544 . doi : 10.7717/peerj.3544 . PMC 5502092. PMID 28698825 .  
  49. 1 2 Hojat, Mohammadreza; Xu, Gang (2004). "Una guía para visitantes sobre tamaños del efecto". Avances en la educación en ciencias de la salud . 9 (3): 241– 9. doi : 10.1023/B:AHSE.0000038173.00909.f6 . PMID 15316274 . S2CID 8045624 .  
  50. ^ Pedhazur, Elazar J.; Schmelkin, Liora P. (1991). Medición, diseño y análisis: un enfoque integrado ( edición estudiantil). Nueva York, NY: Psychology Press. págs. 180-210 . ISBN   978-0-8058-1063-9.
  51. Stahel, Werner (2016). «Problemas estadísticos en la reproducibilidad». Principios, problemas, prácticas y perspectivas de la reproducibilidad: págs. 87–114 . doi : 10.1002/9781118865064.ch5 . ISBN  978-1-118-86497-5.
  52. "Serie de seminarios CSSME: El debate sobre los valores p y el paradigma de la prueba de significación de la hipótesis nula (NHST)" . www.education.leeds.ac.uk . Facultad de Educación, Universidad de Leeds . Consultado el 1 de diciembre de 2016 .
  53. Novella, Steven (25 de febrero de 2015). "Revista de psicología prohíbe las pruebas de significación" . Medicina basada en la ciencia.
  54. Woolston, Chris (2015-03-05). "Revista de psicología prohíbe los valores p" . Nature . 519 (7541): 9. Bibcode : 2015Natur.519....9W . doi : 10.1038/519009f .
  55. Siegfried, Tom (17 de marzo de 2015). "Prohibición del valor p: un pequeño paso para una revista, un gran salto para la ciencia" . Science News . Recuperado el 1 de diciembre de 2016 .
  56. Antonakis, John (febrero de 2017). "Sobre cómo hacer mejor ciencia: de la emoción del descubrimiento a las implicaciones políticas" (PDF) . The Leadership Quarterly . 28 (1): 5–21 . doi : 10.1016/j.leaqua.2017.01.006 .
  57. 1 2 3 Wasserstein, Ronald L.; Lazar, Nicole A. (2016-04-02). "Declaración de la ASA sobre los valores p: contexto, proceso y propósito" . The American Statistician . 70 (2): 129– 133. doi : 10.1080/00031305.2016.1154108 .
  58. García-Pérez, Miguel A. (2016-10-05). "No darás falso testimonio contra la prueba de significancia de la hipótesis nula" . Medición educativa y psicológica . 77 (4): 631– 662. doi : 10.1177/0013164416668232 . ISSN 0013-1644 . PMC 5991793. PMID 30034024 .   
  59. Ioannidis, John PA; Ware, Jennifer J.; Wagenmakers, Eric-Jan; Simonsohn, Uri; Chambers, Christopher D.; Button, Katherine S.; Bishop, Dorothy VM; Nosek, Brian A.; Munafò, Marcus R. (enero de 2017). " Un manifiesto para la ciencia reproducible" . Nature Human Behaviour . 1 (1): 0021. doi : 10.1038/s41562-016-0021 . PMC 7610724. PMID 33954258 .  
  60. Benjamin, Daniel; et al. (2018). "Redefinir la significación estadística" . Nature Human Behaviour . 1 (1): 6– 10. doi : 10.1038/s41562-017-0189-z . hdl : 10281/184094 . PMID 30980045 .  
  61. Chawla, Dalmeet (2017) .Umbral de "talla única" para los valores P bajo fuego" . Nature . doi : 10.1038/nature.2017.22625 .
  62. Amrhein, Valentin; Greenland, Sander (2017). "Eliminar, en lugar de redefinir, la significación estadística". Nature Human Behaviour . 2 (1): 0224. doi : 10.1038/s41562-017-0224-0 . PMID 30980046 . S2CID 46814177 .  
  63. Vyse, Stuart (noviembre de 2017). "Moving Science's Statistical Goalposts" . csicop.org . CSI . Consultado el 10 de julio de 2018 .
  64. McShane, Blake; Greenland, Sander; Amrhein, Valentin (marzo de 2019). "Los científicos se alzan contra la significación estadística" . Nature . 567 (7748): 305–307 . Bibcode : 2019Natur.567..305A . doi : 10.1038/d41586-019-00857-9 . PMID 30894741 . 
  65. ^ Wasserstein, Ronald L.; Schirm, Allen L.; Lazar, Nicole A. (20 de marzo de 2019). "Moviéndose hacia un mundo más allá "p < 0,05"" . The American Statistician . 73 (supl. 1): 1– 19. doi : 10.1080/00031305.2019.1583913 .

Lecturas adicionales

  • Imbens, Guido W. 2021. " Significación estadística, valores p y la presentación de informes de incertidumbre ". Journal of Economic Perspectives 35 (3): 157–74.
  • Lydia Denworth, «Un problema significativo: Los métodos científicos estándar están en entredicho. ¿Cambiará algo?», Scientific American , vol. 321, n.º 4 (octubre de 2019), págs.  62-67. «El uso de valores p durante casi un siglo [desde 1925] para determinar la significación estadística de los resultados experimentales ha contribuido a una ilusión de certeza y a crisis de reproducibilidad en muchos campos científicos . Existe una creciente determinación de reformar el análisis estadístico... Algunos [investigadores] sugieren cambiar los métodos estadísticos, mientras que otros eliminarían el umbral para definir los resultados "significativos"». (pág. 63).
  • Ziliak, Stephen y Deirdre McCloskey (2008), El culto a la significación estadística: cómo el error estándar nos cuesta empleos, justicia y vidas. Archivado el 8 de junio de 2010 en Wayback Machine . Ann Arbor, University of Michigan Press , 2009. ISBN 978-0-472-07007-7Reseñas y recepción: (recopiladas por Ziliak)
  • Thompson, Bruce (2004). "La crisis de la "significación" en psicología y educación". Journal of Socio-Economics . 33 (5): 607– 613. doi : 10.1016/j.socec.2004.09.034 .
  • Chow, Siu L., (1996). Significancia estadística: fundamentos, validez y utilidad. Archivado el 3 de diciembre de 2013 en Wayback Machine , volumen 1 de la serie Introducción a los métodos estadísticos, Sage Publications Ltd, ISBN 978-0-7619-5205-3– argumenta que la significación estadística es útil en ciertas circunstancias.
  • Kline, Rex, (2004). Más allá de las pruebas de significación: reformando los métodos de análisis de datos en la investigación del comportamiento. Washington, DC: Asociación Americana de Psicología.
  • Nuzzo, Regina (2014). Método científico: errores estadísticos . Nature , vol. 506, págs.  150-152 (acceso abierto). Destaca los malentendidos comunes sobre el valor p.
  • Cohen, Joseph (1994).Archivado el 13 de julio de 2017 en Wayback Machine . La Tierra es redonda (p < 0,05). American Psychologist. Vol. 49, págs.  997-1003. Analiza los problemas de las pruebas estadísticas de hipótesis nula.
  • Amrhein, Valentin; Greenland, Sander; McShane, Blake (2019-03-20). "Los científicos se rebelan contra la significación estadística" . Nature . 567 (7748): 305–307 . Bibcode : 2019Natur.567..305A . doi : 10.1038/d41586-019-00857-9 . PMID 30894741 . 
  • El artículo " Primeros usos conocidos de algunas palabras de las matemáticas (S) " contiene una entrada sobre el significado que proporciona información histórica.
  • " El concepto de prueba de significación estadística" (archivado el 7 de septiembre de 2022 en Wayback Machine ) (febrero de 1994): artículo de Bruce Thompson alojado en el ERIC Clearinghouse on Assessment and Evaluation, Washington, DC.
  • ¿ Qué significa que un resultado sea "estadísticamente significativo"? (sin fecha): artículo del Servicio de Evaluación Estadística de la Universidad George Mason, Washington, D.C.