Articulo de referencia

dragado de datos

Un ejemplo humorístico de un resultado obtenido mediante la extracción de datos, que muestra una correlación entre el número de letras de la palabra ganadora del concurso nacion...

Un ejemplo humorístico de un resultado obtenido mediante la extracción de datos, que muestra una correlación entre el número de letras de la palabra ganadora del concurso nacional de ortografía Scripps y el número de personas en Estados Unidos que han muerto por picaduras de arañas venenosas.

El dragado de datos, también conocido como espionaje de datos o p -hacking , [ 1 ] [ a ] ​​es el mal uso del análisis de datos para encontrar patrones en los datos que puedan presentarse como estadísticamente significativos , aumentando así drásticamente y subestimando el riesgo de falsos positivos . Esto se hace realizando muchas pruebas estadísticas en los datos y reportando solo aquellos que arrojan resultados significativos. [ 2 ] Por lo tanto, el dragado de datos también es a menudo una forma de minería de datos mal utilizada o mal aplicada .

El proceso de extracción de datos implica probar múltiples hipótesis utilizando un único conjunto de datos mediante una búsqueda exhaustiva , tal vez de combinaciones de variables que puedan mostrar una correlación , y tal vez de grupos de casos u observaciones que muestren diferencias en su media o en su desglose por alguna otra variable.

Las pruebas convencionales de significación estadística se basan en la probabilidad de que un resultado particular surja por azar, y necesariamente aceptan cierto riesgo de conclusiones erróneas de un tipo determinado (rechazos erróneos de la hipótesis nula ). Este nivel de riesgo se denomina significación . Cuando se realizan muchas pruebas, algunas producen resultados falsos de este tipo; por lo tanto, el 5 % de las hipótesis elegidas al azar podrían ser reportadas (erróneamente) como estadísticamente significativas al nivel de significación del 5 %, el 1 % podría ser reportado (erróneamente) como estadísticamente significativo al nivel de significación del 1 %, y así sucesivamente, por mera casualidad. Cuando se prueban suficientes hipótesis, es prácticamente seguro que algunas serán reportadas como estadísticamente significativas (aunque esto sea engañoso), ya que casi cualquier conjunto de datos con algún grado de aleatoriedad probablemente contenga (por ejemplo) algunas correlaciones espurias . Si no son cautelosos, los investigadores que utilizan técnicas de minería de datos pueden ser fácilmente engañados por estos resultados. El término p-hacking (en referencia a los valores p ) fue acuñado en un artículo de 2014 por los tres investigadores detrás del blog Data Colada , que se ha centrado en descubrir tales problemas en la investigación en ciencias sociales. [ 3 ] [ 4 ] [ 5 ]

La manipulación de datos es un ejemplo de cómo se ignora el problema de las comparaciones múltiples . Una forma de hacerlo es comparar subgrupos sin informar al lector sobre el número total de comparaciones de subgrupos examinadas. [ 6 ] Cuando se utiliza incorrectamente, es una práctica de investigación cuestionable que puede socavar la integridad científica.

Tipos

Extraer conclusiones a partir de los datos

El procedimiento convencional de prueba de hipótesis estadística mediante probabilidad frecuentista consiste en formular una hipótesis de investigación, como «las personas de clases sociales más altas viven más tiempo», y luego recopilar los datos pertinentes. Finalmente, se realiza una prueba de significación estadística para determinar la probabilidad de que los resultados se deban únicamente al azar (también conocida como prueba contra la hipótesis nula).

Un aspecto clave del análisis estadístico adecuado es contrastar una hipótesis con datos que no se hayan utilizado para formularla. Esto es fundamental, ya que todo conjunto de datos contiene patrones debidos exclusivamente al azar. Si la hipótesis no se contrasta con un conjunto de datos diferente de la misma población estadística , resulta imposible evaluar la probabilidad de que dichos patrones se deban únicamente al azar.

Por ejemplo, lanzar una moneda cinco veces y obtener dos caras y tres cruces podría llevar a plantear la hipótesis de que la moneda favorece las cruces en una proporción de 3/5 a 2/5. Si esta hipótesis se prueba con el conjunto de datos existente, se confirma, pero la confirmación carece de sentido. El procedimiento correcto habría sido formular de antemano una hipótesis sobre la probabilidad de obtener cruz y luego lanzar la moneda varias veces para comprobar si la hipótesis se rechaza o no. Si se observan tres cruces y dos caras, se podría formular otra hipótesis, que la probabilidad de obtener cruz es de 3/5, pero solo podría comprobarse con una nueva serie de lanzamientos. La significación estadística bajo el procedimiento incorrecto es completamente espuria; las pruebas de significación no protegen contra la manipulación de datos.

Parada opcional

La figura muestra el cambio en los valores p calculados a partir de una prueba t a medida que aumenta el tamaño de la muestra, y cómo la detención temprana puede permitir el p -hacking. El conjunto de datos se extrae de dos distribuciones normales idénticas,norte(0,10){\displaystyle N(0,10)}. Para cada tamaño de muestranorte{\displaystyle n}, que van desde 5 hasta104{\displaystyle 10^{4}}, se realiza una prueba t en el primeronorte{\displaystyle n}Se toman muestras de cada distribución y se grafica el valor p resultante . La línea discontinua roja indica el nivel de significancia comúnmente utilizado de 0,05. Si la recopilación o el análisis de datos se detuviera en un punto donde el valor p cayera por debajo del nivel de significancia, podría informarse una diferencia estadísticamente significativa espuria.

La detención opcional es una práctica en la que se recopilan datos hasta que se alcanza algún criterio de parada. Si bien es un procedimiento válido, se presta fácilmente a un uso indebido. El problema es que el valor p de una prueba estadística con detención opcional es mayor de lo que parece. Intuitivamente, esto se debe a que se supone que el valor p es la suma de todos los eventos al menos tan raros como el observado. Con la detención opcional, existen eventos aún más raros que son difíciles de tener en cuenta, es decir, no activar la regla de detención opcional, y recopilar aún más datos antes de detenerse. Ignorar estos eventos conduce a un valor p demasiado bajo. De hecho, si la hipótesis nula es verdadera, entonces se puede alcanzar cualquier nivel de significancia si se permite seguir recopilando datos y detenerse cuando se obtiene el valor p deseado (calculado como si siempre se hubiera planeado recopilar exactamente esta cantidad de datos). [ 7 ] Para un ejemplo concreto de prueba de una moneda justa , véase valor p §  Detención opcional .

O, dicho de forma más concisa, el cálculo correcto del valor p requiere tener en cuenta los contrafactuales, es decir, lo que el experimentador podría haber hecho en respuesta a datos que podrían haber sido. Tener en cuenta lo que podría haber sido es difícil, incluso para investigadores honestos. [ 7 ] Una ventaja del preregistro es que permite tener en cuenta todos los contrafactuales, lo que posibilita el cálculo correcto del valor p . [ 8 ]

El problema de la interrupción prematura no se limita solo a la mala conducta del investigador. A menudo existe presión para detener la investigación prematuramente si el costo de recopilar datos es elevado. Algunos comités de ética animal incluso exigen la interrupción temprana si el estudio obtiene un resultado significativo a mitad de camino. [ 9 ]

Reemplazo de datos post hoc

Si se eliminan datos después de haber realizado algún análisis, por ejemplo, con el pretexto de "eliminar valores atípicos", aumentará la tasa de falsos positivos. Los valores atípicos solo deben eliminarse de un conjunto de datos tras su correcta identificación y confirmación de que existe una variación por causas especiales responsable de los datos inusuales. Reemplazar los "valores atípicos" con datos de reemplazo incrementa aún más la tasa de falsos positivos. [ 10 ]

Agrupación post hoc

Si un conjunto de datos contiene múltiples características, una o más de ellas pueden utilizarse para agrupar los datos y, potencialmente, generar un resultado estadísticamente significativo. Por ejemplo, si un conjunto de datos de pacientes registra su edad y sexo, un investigador puede considerar agruparlos por edad y comprobar si la tasa de recuperación de la enfermedad está correlacionada con la edad. Si no se observa correlación, el investigador podría comprobar si existe correlación con el sexo. Si no es así, tal vez sí exista correlación con la edad tras controlar el sexo, etc. El número de agrupaciones posibles crece exponencialmente con el número de características. [ 10 ]

Hipótesis sugerida por datos no representativos

Supongamos que un estudio de una muestra aleatoria de personas incluye exactamente a dos personas nacidas el 7 de agosto: María y Juan. Alguien que se dedica a la búsqueda de similitudes entre ellos podría intentar encontrar otras similitudes. Al examinar cientos o miles de posibles similitudes, cada una con una baja probabilidad de ser cierta, es casi seguro que se encontrará una similitud inusual. Quizás Juan y María sean las únicas dos personas en el estudio que cambiaron de especialización secundaria tres veces en la universidad. Una hipótesis, sesgada por la búsqueda de similitudes, podría ser entonces: "Las personas nacidas el 7 de agosto tienen una probabilidad mucho mayor de cambiar de especialización secundaria más de dos veces en la universidad".

Los datos, sacados de contexto, podrían interpretarse como un fuerte respaldo a esa correlación, ya que nadie con una fecha de nacimiento diferente había cambiado de especialización secundaria tres veces en la universidad. Sin embargo, si (como es probable) se trata de una hipótesis errónea, este resultado probablemente no será reproducible ; cualquier intento de comprobar si otras personas nacidas el 7 de agosto tienen una tasa similar de cambio de especialización secundaria probablemente arrojará resultados contradictorios casi de inmediato.

Sesgo sistemático

El sesgo es un error sistemático en el análisis. Por ejemplo, los médicos derivaron a pacientes con VIH de alto riesgo cardiovascular a un tratamiento específico, el abacavir , y a pacientes de menor riesgo a otros fármacos, lo que impidió una evaluación sencilla del abacavir en comparación con otros tratamientos. Un análisis que no corrigió este sesgo penalizó injustamente al abacavir, ya que sus pacientes tenían un mayor riesgo y, por lo tanto, un mayor número de ellos sufrieron infartos. [ 6 ] Este problema puede ser muy grave, por ejemplo, en el estudio observacional . [ 6 ] [ 2 ]

Los factores faltantes, los factores de confusión no medidos y la pérdida de seguimiento también pueden generar sesgos. [ 6 ] Al seleccionar artículos con valores p significativos , se descartan los estudios negativos, lo que constituye un sesgo de publicación . Esto también se conoce como sesgo de cajón de archivo , ya que los resultados con valores p menos significativos se dejan en el cajón y nunca se publican.

Modelado múltiple

Otro aspecto del condicionamiento de las pruebas estadísticas por el conocimiento de los datos se observa al utilizar el análisis de sistemas o máquinas y la regresión lineal para observar la frecuencia de los datos. Un paso crucial en el proceso es decidir qué covariables incluir en una relación que explique una o más variables. Existen consideraciones tanto estadísticas (véase regresión por pasos ) como sustantivas que llevan a los autores a favorecer algunos de sus modelos sobre otros, y se hace un uso liberal de las pruebas estadísticas. Sin embargo, descartar una o más variables de una relación explicativa basándose en los datos implica que no se pueden aplicar válidamente los procedimientos estadísticos estándar a las variables retenidas en la relación como si nada hubiera ocurrido. Por su naturaleza, las variables retenidas han tenido que superar algún tipo de prueba preliminar (posiblemente una prueba intuitiva imprecisa) que las variables descartadas no superaron. En 1966, Selvin y Stuart compararon las variables retenidas en el modelo con los peces que no caen en la red, en el sentido de que sus efectos están destinados a ser mayores que los de aquellos que sí caen en la red. Esto no solo altera el rendimiento de todas las pruebas subsiguientes en el modelo explicativo retenido, sino que también puede introducir sesgos y alterar el error cuadrático medio en la estimación. [ 11 ] [ 12 ]

Ejemplos

En meteorología y epidemiología

En meteorología , las hipótesis suelen formularse utilizando datos meteorológicos actuales y contrastarse con datos futuros, lo que garantiza que, incluso de forma subconsciente, estos datos no influyan en la formulación de la hipótesis. Por supuesto, esta disciplina requiere esperar a que se disponga de nuevos datos para demostrar la capacidad predictiva de la teoría formulada frente a la hipótesis nula . Este proceso asegura que nadie pueda acusar al investigador de haber adaptado el modelo predictivo a los datos disponibles, ya que el pronóstico meteorológico futuro aún no se conoce.

Como otro ejemplo, supongamos que unos observadores notan que una ciudad en particular parece tener una concentración de casos de cáncer , pero carecen de una hipótesis sólida sobre la razón. Sin embargo, tienen acceso a una gran cantidad de datos demográficos sobre la ciudad y sus alrededores, que contienen mediciones de cientos o miles de variables diferentes, en su mayoría no correlacionadas. Incluso si todas estas variables son independientes de la tasa de incidencia de cáncer, es muy probable que al menos una variable se correlacione significativamente con la tasa de cáncer en toda la zona. Si bien esto puede sugerir una hipótesis, se necesitan más pruebas utilizando las mismas variables, pero con datos de una ubicación diferente, para confirmarla. Cabe señalar que un valor p de 0,01 sugiere que en el 1 % de los casos se obtendría un resultado al menos tan extremo por casualidad; si se prueban cientos o miles de hipótesis (con variables independientes relativamente no correlacionadas entre sí), es probable obtener un valor p inferior a 0,01 para muchas hipótesis nulas.

En la investigación farmacéutica

El problema del p -hacking es preocupantemente común en el desarrollo e investigación de fármacos. [ 13 ] [ 14 ] Se puede demostrar que fármacos sin efecto discernible tienen un efecto estadísticamente significativo cuando se realizan cientos, o incluso miles, de análisis —sobre los mismos datos— utilizando diferentes grupos objetivo, medidas de resultado primarias, ajustes por edad y un sinfín de otras variables que se pueden omitir o seleccionar para obtener un resultado significativo. [ 15 ] Incluso cuando un fármaco no tiene ningún efecto medible, si se realizan suficientes análisis, se encontrará un efecto fuerte y estadísticamente significativo (por ejemplo, «el fármaco mejoró significativamente la función de la memoria en mujeres mayores de 40 años», donde la función de la memoria no era el resultado primario original que se evaluaba). Esto no requiere ninguna falsificación de datos, ni la omisión de resultados inconvenientes. En cambio, el p -hacking se basa simplemente en análisis repetidos de los mismos datos hasta que el investigador encuentra la correlación con el «mejor» valor p . El análisis se ajusta a los datos, en lugar de que los datos se manipulen de alguna manera.

Aparición en los medios

Un ejemplo es el estudio fraudulento sobre la pérdida de peso con chocolate realizado por el periodista John Bohannon , quien explicó públicamente en un artículo de Gizmodo que el estudio se llevó a cabo deliberadamente de forma fraudulenta como un experimento social . [ 16 ] Este estudio se difundió ampliamente en muchos medios de comunicación alrededor de 2015, y muchas personas creyeron la afirmación de que comer una barra de chocolate todos los días les haría perder peso, en contra de su buen juicio. Este estudio se publicó en el Instituto de Dieta y Salud. Según Bohannon, para reducir el valor p a menos de 0,05, era crucial tener en cuenta 18 variables diferentes al realizar las pruebas.

Remedios

Si bien buscar patrones en los datos es legítimo, aplicar una prueba estadística de significancia o una prueba de hipótesis a los mismos datos hasta que surja un patrón es susceptible de abuso. Una forma de formular hipótesis evitando la manipulación de datos es realizar pruebas aleatorias fuera de la muestra . El investigador recopila un conjunto de datos y lo divide aleatoriamente en dos subconjuntos, A y B. Solo se examina un subconjunto, por ejemplo, el subconjunto A, para formular hipótesis. Una vez formulada una hipótesis, debe probarse en el subconjunto B, que no se utilizó para su formulación. Solo si B también respalda dicha hipótesis, es razonable creer que la hipótesis podría ser válida. (Este es un tipo simple de validación cruzada y a menudo se denomina validación de entrenamiento o de división por mitades).

Otro remedio para la extracción de datos es registrar el número de todas las pruebas de significancia realizadas durante el estudio y simplemente dividir el criterio de significancia (alfa) por este número; esta es la corrección de Bonferroni . Sin embargo, esta es una métrica muy conservadora. Un alfa familiar de 0,05, dividido de esta manera por 1000 para tener en cuenta 1000 pruebas de significancia, produce un alfa por hipótesis muy estricto de 0,00005. Los métodos particularmente útiles en el análisis de varianza y en la construcción de bandas de confianza simultáneas para regresiones que involucran funciones base son el método de Scheffé y, si el investigador tiene en mente solo comparaciones por pares , el método de Tukey . Para evitar el conservadurismo extremo de la corrección de Bonferroni, se dispone de métodos de inferencia selectiva más sofisticados. [ 17 ] El método de inferencia selectiva más común es el uso del procedimiento de control de la tasa de falsos descubrimientos de Benjamini y Hochberg : es un enfoque menos conservador que se ha convertido en un método popular para el control de pruebas de hipótesis múltiples.

Cuando ninguno de los dos enfoques es práctico, se puede establecer una clara distinción entre análisis de datos confirmatorios y análisis exploratorios . La inferencia estadística es apropiada únicamente para los primeros. [ 12 ]

En última instancia, la significación estadística de una prueba y la confianza estadística de un hallazgo son propiedades conjuntas de los datos y del método utilizado para analizarlos. Así, si alguien afirma que un determinado evento tiene una probabilidad del 20 % ± 2 % en 19 de cada 20 casos, esto significa que si la probabilidad del evento se estima mediante el mismo método utilizado para obtener la estimación del 20 %, el resultado se encuentra entre el 18 % y el 22 %, con una probabilidad de 0,95. No se puede afirmar la significación estadística simplemente observando los datos, sin tener en cuenta el método utilizado para evaluarlos.

Las revistas académicas están adoptando cada vez más el formato de informe registrado , que busca contrarrestar problemas muy serios como la manipulación de datos y el HARKing , que han hecho que la investigación de comprobación de teorías sea muy poco fiable. Por ejemplo, Nature Human Behaviour ha adoptado el formato de informe registrado, ya que "desplaza el énfasis de los resultados de la investigación a las preguntas que la guían y los métodos utilizados para responderlas". [ 18 ] El European Journal of Personality define este formato de la siguiente manera: "En un informe registrado, los autores crean una propuesta de estudio que incluye antecedentes teóricos y empíricos, preguntas/hipótesis de investigación y datos piloto (si están disponibles). Tras su presentación, esta propuesta será revisada antes de la recopilación de datos y, si se acepta, el artículo resultante de este procedimiento de revisión por pares se publicará, independientemente de los resultados del estudio". [ 19 ]

Los métodos y resultados también pueden hacerse públicos, como en el enfoque de ciencia abierta , lo que dificulta aún más la extracción de datos. [ 20 ]

Véase también

Notas

  1. Otros nombres incluyen recolección de datos, manipulación de datos, pesca de datos, inferencia selectiva, búsqueda de significancia y búsqueda de significancia.

Referencias

  1. Wasserstein, Ronald L.; Lazar, Nicole A. (2016-04-02). "Declaración de la ASA sobre los valores p: contexto, proceso y propósito" . The American Statistician . 70 (2). Informa UK Limited: 129– 133. doi : 10.1080/00031305.2016.1154108 . ISSN 0003-1305 . 
  2. 1 2 Davey Smith, G. ; Ebrahim, S. (2002). "Dragado de datos, sesgo o confusión" . BMJ . 325 (7378): 1437– 1438. doi : 10.1136/bmj.325.7378.1437 . PMC 1124898 . PMID 12493654 .  
  3. Lewis-Kraus, Gideon (30 de septiembre de 2023). «Estudiaron la deshonestidad. ¿Fue su trabajo una mentira?» . The New Yorker . ISSN 0028-792X . Consultado el 1 de octubre de 2023 . 
  4. Subbaraman, Nidhi (24 de septiembre de 2023). "El grupo de desenmascaradores que desenmascaran a los malos científicos" . Wall Street Journal . Consultado el 8 de octubre de 2023 .{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace )
  5. Simonsohn, Uri; Nelson, Leif D.; Simmons, Joseph P. (2014). "Curva P: una clave para el cajón de archivos" . Journal of Experimental Psychology: General . 143 (2): 534– 547. doi : 10.1037/a0033242 . PMID 23855496 . 
  6. 1 2 3 4 Young, S. S.; Karr, A. (2011). "Deming, datos y estudios observacionales" (PDF) . Significance . 8 (3): 116– 120. doi : 10.1111/j.1740-9713.2011.00506.x . 
  7. 1 2 Wagenmakers, Eric-Jan (octubre de 2007). "Una solución práctica a los problemas generalizados de los valores p" . Psychonomic Bulletin & Review . 14 (5): 779– 804. doi : 10.3758/BF03194105 . ISSN 1069-9384 . PMID 18087943 .  
  8. ^ Wicherts, Jelte M.; Veldkamp, ​​Coosje LS; Augusteijn, HildeEM; Bakker, Marjan; van Aert, Robbie CM; van Assen, Marcel ALM (25 de noviembre de 2016). "Grados de libertad en la planificación, ejecución, análisis e informes de estudios psicológicos: una lista de verificación para evitar el p-hacking" . Fronteras en Psicología . 7 : 1832. doi : 10.3389/fpsyg.2016.01832 . ISSN 1664-1078 . PMC 5122713 . PMID 27933012 .   
  9. Head, Megan L.; Holman, Luke; Lanfear, Rob; Kahn, Andrew T.; Jennions, Michael D. (2015-03-13). " El alcance y las consecuencias del P-Hacking en la ciencia" . PLOS Biology . 13 (3) e1002106. doi : 10.1371/journal.pbio.1002106 . ISSN 1545-7885 . PMC 4359000. PMID 25768323 .   
  10. 1 2 Szucs, Denes (22 de septiembre de 2016). " Un tutorial sobre cómo encontrar significancia estadística persiguiendo N" . Frontiers in Psychology . 7 : 1444. doi : 10.3389/fpsyg.2016.01444 . ISSN 1664-1078 . PMC 5031612. PMID 27713723 .   
  11. Selvin, H. C.; Stuart, A. (1966). "Procedimientos de extracción de datos en el análisis de encuestas". The American Statistician . 20 (3): 20– 23. doi : 10.1080/00031305.1966.10480401 . JSTOR 2681493 .  
  12. 1 2 Berk, R.; Brown, L.; Zhao, L. (2009). "Inferencia estadística después de la selección del modelo" . J Quant Criminol . 26 (2): 217– 236. doi : 10.1007/s10940-009-9077-7 . S2CID 10350955 . 
  13. Gall, Thomas; Ioannidis, John PA; Maniadis, Zacharias (26 de abril de 2017). "La crisis de credibilidad en la investigación: ¿Pueden ayudar las herramientas económicas?" . PLOS Biology . 15 (4) e2001846. doi : 10.1371/journal.pbio.2001846 . ISSN 1545-7885 . PMC 5405914. PMID 28445470 .   
  14. Adda, Jérôme; Decker, Christian; Ottaviani, Marco (2020-06-16). "P-hacking en ensayos clínicos y cómo los incentivos dan forma a la distribución de resultados entre fases" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 117 (24): 13386– 13392. arXiv : 1907.00185 . Bibcode : 2020PNAS..11713386A . doi : 10.1073 / pnas.1919906117 . ISSN 1091-6490 . PMC 7306753. PMID 32487730 .   
  15. "The P-Hacking Sandbox: encuentra un descubrimiento en puro ruido" . unspurious . Consultado el 17 de junio de 2026 .
  16. Bohannon, John (27 de mayo de 2015). "Engañé a millones de personas haciéndoles creer que el chocolate ayuda a perder peso. Aquí les cuento cómo" . Gizmodo . Consultado el 20 de octubre de 2023 .
  17. Taylor, J.; Tibshirani, R. (2015). "Aprendizaje estadístico e inferencia selectiva" . Actas de la Academia Nacional de Ciencias . 112 ( 25): 7629– 7634. ​​Bibcode : 2015PNAS..112.7629T . doi : 10.1073/pnas.1507583112 . PMC 4485109. PMID 26100887 .  
  18. "Promoción de la reproducibilidad con informes registrados" . Nature Human Behaviour . 1 (1) 0034. 10 de enero de 2017. doi : 10.1038/s41562-016-0034 . S2CID 28976450 . 
  19. "Próximamente, EJP implementará oficialmente un sistema de revisión simplificado e informes registrados" . ejp-blog.com . 6 de febrero de 2018.
  20. Vyse, Stuart (2017). "Confesiones de P-Hacker: Daryl Bem y yo" . Skeptical Inquirer . 41 (5): 25– 27. Archivado del original el 5 de agosto de 2018. Recuperado el 5 de agosto de 2018 .
  21. Gelman, Andrew (2013). "El jardín de los senderos que se bifurcan" (PDF) .

Lecturas adicionales

  • Graham Elliott, Nikolay Kudrin, Kaspar Wüthrich. 2025. " El poder de las pruebas para detectar el p-hacking ". The Review of Economics and Statistics.
  • Ioannidis, John PA (30 de agosto de 2005). "Por qué la mayoría de los hallazgos de investigación publicados son falsos" . PLOS Medicine . 2 (8) e124. San Francisco: Public Library of Science. doi : 10.1371/journal.pmed.0020124 . ISSN 1549-1277 . PMC 1182327. PMID 16060722 .   
  • Head, Megan L.; Holman, Luke; Lanfear, Rob; Kahn, Andrew T.; Jennions, Michael D. (13 de marzo de 2015). " El alcance y las consecuencias del P-Hacking en la ciencia" . PLOS Biology . 13 (3) e1002106. doi : 10.1371/journal.pbio.1002106 . PMC 4359000. PMID 25768323 .  
  • Insel, Thomas (14 de noviembre de 2014). "P-Hacking" . Blog del director del NIMH . Archivado del original el 15 de diciembre de 2016.
  • Smith, Gary (2016). Desviaciones estándar: supuestos erróneos, datos manipulados y otras formas de mentir con las estadísticas . Gerald Duckworth & Co. ISBN 978-0-7156-4974-9.
  • Stefan, Angelika M.; Schönbrodt, Felix D. (1 de febrero de 2023). "Grandes pequeñas mentiras: un compendio y simulación de estrategias de p-hacking" . Royal Society Open Science . 10 (2) 220346. Bibcode : 2023RSOS...1020346S . doi : 10.1098/rsos.220346 . PMC 9905987. PMID 36778954 .  
  • Una bibliografía sobre el sesgo de la búsqueda intrusiva de datos
  • Correlaciones espurias : una galería de ejemplos de correlaciones inverosímiles.
  • StatQuest: Errores comunes en el cálculo del valor p y la potencia estadística en YouTube
  • Vídeo explicativo sobre p-hacking realizado por " Neuroskeptic ", un bloguero de la revista Discover.
  • Aléjese de la regresión por pasos , un artículo en el Journal of Big Data que critica la regresión por pasos.