
La crisis de replicación , también conocida como crisis de reproducibilidad , se refiere a los numerosos fallos al intentar reproducir resultados científicos publicados. Dado que la reproducibilidad de los resultados empíricos es la piedra angular del método científico , [ 2 ] tales fallos socavan la credibilidad de las teorías y ponen en entredicho gran parte del conocimiento científico.
La psicología y la medicina han sido puntos clave para los esfuerzos de replicación, con investigadores que reexaminan sistemáticamente estudios clásicos para verificar su fiabilidad y, cuando surgen fallos, para identificar las causas subyacentes. [ 3 ] [ 4 ] Los datos indican claramente que otras ciencias naturales y sociales también se ven afectadas. [ 5 ]
La expresión «crisis de replicación» se acuñó a principios de la década de 2010 como parte de una creciente conciencia del problema. [ 6 ] Las consideraciones sobre las causas y las soluciones han dado lugar a una nueva disciplina científica conocida como metaciencia , [ 7 ] que utiliza métodos de investigación empírica para examinar la práctica de la investigación empírica. [ 7 ]
Los investigadores distinguen dos formas de reproducibilidad. La reproducibilidad en sentido estricto se refiere a la revisión y validación del análisis de un conjunto de datos. La segunda categoría, la replicación , implica repetir un experimento o estudio con datos nuevos e independientes para verificar las conclusiones originales.
Fondo
Replicación
La replicación ha sido denominada "la piedra angular de la ciencia". [ 8 ] [ 9 ] El científico de salud ambiental Stefan Schmidt comenzó una revisión de 2009 con esta descripción de la replicación:
La replicación es uno de los aspectos centrales de cualquier ciencia empírica. Confirmar resultados o hipótesis mediante un procedimiento de repetición constituye la base de toda concepción científica. Un experimento de replicación, cuyo objetivo es demostrar que los mismos hallazgos pueden obtenerse en cualquier otro lugar por cualquier otro investigador, se concibe como una operacionalización de la objetividad. Es la prueba de que el experimento refleja un conocimiento que puede separarse de las circunstancias específicas (como el tiempo, el lugar o las personas) en las que se obtuvo. [ 10 ]
Pero no se ha llegado a un acuerdo sobre una definición universal de replicación o conceptos relacionados. [ 11 ] [ 12 ] [ 10 ] Los tipos de replicación incluyen:
- directo (repitiendo los procedimientos lo más fielmente posible), [ 10 ] [ 13 ]
- sistemático (repetir con cambios intencionales), [ 13 ] y
- conceptual (prueba de hipótesis utilizando diferentes procedimientos para evaluar la generalización). [ 10 ] [ 13 ]
La reproducibilidad también se puede distinguir de la replicación , ya que se refiere a reproducir los mismos resultados utilizando el mismo conjunto de datos. Este tipo de reproducibilidad es la razón por la que muchos investigadores ponen sus datos a disposición de otros para su comprobación. [ 14 ]
Los fallos de replicación no indican que los campos afectados carezcan de rigor científico. [ 15 ] [ 16 ] [ 17 ] Más bien, reflejan el funcionamiento normal de la ciencia: un mecanismo mediante el cual se eliminan las hipótesis sin fundamento, [ 18 ] [ 19 ] pero que a menudo funciona de forma lenta e inconsistente. [ 20 ] [ 21 ]
Una hipótesis se considera generalmente respaldada cuando los resultados coinciden con el patrón predicho y dicho patrón resulta ser estadísticamente significativo . Bajo el supuesto de hipótesis nula , los resultados se consideran estadísticamente significativos cuando su probabilidad cae por debajo de un umbral predeterminado (el nivel de significancia ). Esto generalmente responde a la pregunta de cuán improbables serían tales resultados por mera casualidad si no existiera un efecto real en la población estadística . Si la probabilidad asociada con el estadístico de prueba excede el valor crítico elegido , los resultados se consideran estadísticamente significativos. [ 22 ] El valor p representa la probabilidad de obtener resultados al menos tan extremos como los observados, suponiendo que la hipótesis nula sea verdadera. El umbral estándar p < 0,05 significa aceptar una tasa de falsos positivos del 5 %. Algunos campos utilizan valores p más pequeños, como p < 0,01 (1 % de probabilidad de un falso positivo) o p < 0,001 (0,1 % de probabilidad de un falso positivo). Pero una menor probabilidad de un falso positivo a menudo requiere tamaños de muestra mayores o una mayor probabilidad de un falso negativo (una hipótesis correcta que se encuentra erróneamente incorrecta) . Si bien la prueba del valor p es el método más utilizado, no es el único.
Estadística
Ciertos términos comúnmente utilizados en las discusiones sobre la crisis de replicación tienen significados técnicamente precisos, que se presentan aquí. [ 1 ]
En el caso más común, la prueba de hipótesis nula , hay dos hipótesis, una hipótesis nulay una hipótesis alternativaLa hipótesis nula suele tener la forma "X e Y son estadísticamente independientes ". Por ejemplo, la hipótesis nula podría ser "tomar el fármaco X no altera la tasa de recuperación de la enfermedad Y al cabo de un año", y la hipótesis alternativa es que sí la altera.
Como es difícil comprobar la independencia estadística completa, la hipótesis nula completa a menudo se reduce a una hipótesis nula simplificada : "el tamaño del efecto es 0", donde " tamaño del efecto " es un número real que es 0 si la hipótesis nula completa es verdadera, y cuanto mayor sea el tamaño del efecto, más falsa será la hipótesis nula. [ 23 ] Por ejemplo, si X es binaria, el tamaño del efecto podría definirse como el cambio en la esperanza de Y ante un cambio de X:Tenga en cuenta que el tamaño del efecto, tal como se definió anteriormente, podría ser cero incluso si X e Y no son independientes, como cuando su relación no es lineal (como) o cuando una variable afecta a diferentes subgrupos de forma opuesta. Dado que las diferentes definiciones de "tamaño del efecto" capturan diferentes maneras en que X e Y pueden ser dependientes, existen muchas definiciones de tamaño del efecto.
En la práctica, los tamaños del efecto no se pueden observar directamente, sino que deben medirse mediante estimadores estadísticos . Por ejemplo, la definición anterior de tamaño del efecto se suele medir con el estimador d de Cohen . Un mismo tamaño del efecto puede tener varios estimadores, ya que presentan compensaciones entre eficiencia , sesgo , varianza , etc. Esto aumenta aún más el número de cantidades estadísticas posibles que se pueden calcular en un único conjunto de datos. Cuando se utiliza un estimador del tamaño del efecto para realizar pruebas estadísticas, se denomina estadístico de prueba .

Una prueba de hipótesis nula es un procedimiento de decisión que toma algunos datos y produce o bieno. Si produce una salida, normalmente se expresa como "hay un efecto estadísticamente significativo" o "se rechaza la hipótesis nula".
A menudo, la prueba estadística es una prueba de umbral (unilateral) , que se estructura de la siguiente manera:
- Recopilar datos.
- Calcular un estadístico de pruebapara los datos.
- Comparar el estadístico de prueba con un valor crítico / umbral. Si, luego salida, de lo contrario, salida.
Una prueba de umbral bilateral es similar, pero con dos umbrales, de modo que producesi alguno de los doso
Hay 4 posibles resultados de una prueba de hipótesis nula: falso negativo, verdadero negativo, falso positivo, verdadero positivo. Un falso negativo significa quees cierto, pero el resultado de la prueba es; un verdadero negativo significa quees cierto, y el resultado de la prueba es, etc.

El nivel de significancia , la tasa de falsos positivos o el nivel alfa es la probabilidad de encontrar que la hipótesis alternativa es verdadera cuando la hipótesis nula es verdadera: :=Pr({\text{encontrar }}H_{1}|H_{0})} Por ejemplo, cuando la prueba es una prueba de umbral unilateral, entoncesdóndesignifica "los datos se muestrean de".
La potencia estadística , o tasa de verdaderos positivos, es la probabilidad de encontrar que la alternativa es verdadera cuando la hipótesis alternativa es verdadera: :=Pr({\text{encontrar }}H_{1}|H_{1})} dondeTambién se denomina tasa de falsos negativos. Por ejemplo, cuando la prueba es una prueba de umbral unilateral, entonces.
Dado un test estadístico y un conjunto de datos, el valor p correspondiente es la probabilidad de que el estadístico de prueba sea al menos tan extremo, condicionado a. Por ejemplo, para una prueba de umbral unilateral,Si la hipótesis nula es verdadera, entonces el valor p se distribuye uniformemente en. De lo contrario, suele alcanzar su punto máximo eny aproximadamente exponencial, aunque la forma precisa de la distribución del valor p depende de cuál sea la hipótesis alternativa. [ 24 ] [ 25 ]
Debido a que los valores p se distribuyen uniformemente enBajo la hipótesis nula, los investigadores pueden establecer cualquier nivel de significancia.calculando el valor p y luego generando la salida.siEsto se suele expresar como "la hipótesis nula se rechaza al nivel de significancia".", o "", como por ejemplo "fumar está correlacionado con el cáncer (p < 0,001)".
Historia
La crisis de replicación se remonta a una serie de eventos a principios de la década de 2010. Felipe Romero identificó cuatro precursores de la crisis: [ 26 ]
- Fallos de priming social : A principios de la década de 2010, dos intentos de replicación directa no lograron reproducir [ 27 ] los resultados del estudio de "caminata de ancianos" del psicólogo social John Bargh, muy citado (publicado originalmente en 1996). [ 28 ] Este experimento formaba parte de una serie de tres estudios que habían sido ampliamente citados a lo largo de los años, se enseñaban regularmente en cursos universitarios y habían inspirado muchas replicaciones conceptuales. Estos fallos de replicación provocaron un intenso desacuerdo entre los investigadores de replicación y los autores originales. [ 29 ] Cabe destacar que muchas de las replicaciones conceptuales de los estudios originales tampoco lograron replicarse en replicaciones directas posteriores. [ 30 ] [ 31 ] [ 32 ] [ 33 ]
- Experimentos sobre percepción extrasensorial: El psicólogo social Daryl Bem realizó una serie de experimentos que supuestamente proporcionaban evidencia del controvertido fenómeno de la percepción extrasensorial . [ 34 ] Bem enfrentó críticas sustanciales a la metodología de su estudio. Un nuevo análisis de sus datos no encontró evidencia de percepción extrasensorial. [ 35 ] El experimento tampoco se replicó en replicaciones directas posteriores. [ 36 ] Según Romero, lo que la comunidad consideró particularmente preocupante fue que muchos de los procedimientos defectuosos y las herramientas estadísticas utilizadas en los estudios de Bem formaban parte de la práctica común de investigación en psicología.
- Fallos en la replicación biomédica: Científicos de las empresas de biotecnología Amgen y Bayer Healthcare informaron tasas de replicación alarmantemente bajas (11-20%) de hallazgos clave en la investigación oncológica preclínica. [ 37 ]
- Estudios de manipulación de datos y prácticas de investigación cuestionables : Desde finales de la década de 2000, varios estudios en metaciencia mostraron cómo las prácticas comúnmente adoptadas en muchos campos científicos, como explotar la flexibilidad del proceso de recopilación y presentación de datos, podrían aumentar considerablemente la probabilidad de resultados falsos positivos. [ 38 ] [ 39 ] [ 40 ] Estos estudios sugirieron cómo una proporción significativa de la literatura publicada en varios campos científicos podría ser investigación no replicable.
Esta serie de acontecimientos generó un gran escepticismo sobre la validez de las investigaciones existentes, a la luz de las numerosas deficiencias metodológicas y la imposibilidad de replicar los hallazgos. Esto llevó a destacados académicos a declarar una «crisis de confianza» en la psicología y otros campos, [ 41 ] y la situación resultante pasó a conocerse como la «crisis de replicación».
Aunque el inicio de la crisis de replicación se remonta a principios de la década de 2010, algunos autores señalan que las preocupaciones sobre la replicabilidad y las prácticas de investigación en las ciencias sociales se habían expresado mucho antes. Romero observa que los autores manifestaron su preocupación por la falta de replicaciones directas en la investigación psicológica a finales de la década de 1960 y principios de la de 1970. [ 42 ] [ 43 ] También escribe que ciertos estudios de la década de 1990 ya informaban de que los editores y revisores de revistas científicas suelen tener prejuicios contra la publicación de estudios de replicación. [ 44 ] [ 45 ]
En las ciencias sociales, se le atribuye al blog Data Colada (cuyos tres autores acuñaron el término " p-hacking " en un artículo de 2014) haber contribuido al inicio de la crisis de replicación. [ 46 ] [ 47 ] [ 48 ]
La profesora de la Universidad de Virginia y psicóloga cognitiva Barbara Spellman ha escrito que muchas críticas a las prácticas de investigación y las preocupaciones sobre la replicabilidad de la investigación no son nuevas. [ 49 ] [ 50 ] Informa que entre finales de la década de 1950 y la de 1990, los académicos ya expresaban preocupaciones sobre una posible crisis de replicación, [ 51 ] una tasa sospechosamente alta de hallazgos positivos, [ 52 ] prácticas de investigación cuestionables, [ 53 ] los efectos del sesgo de publicación, [ 54 ] problemas con el poder estadístico, [ 55 ] [ 56 ] y malos estándares de presentación de informes. [ 51 ]
Spellman también identifica razones por las que la reiteración de estas críticas y preocupaciones en los últimos años condujo a una crisis generalizada y a desafíos al statu quo. En primer lugar, las mejoras tecnológicas facilitaron la realización y difusión de estudios de replicación, así como el análisis de grandes cantidades de literatura en busca de problemas sistémicos. En segundo lugar, el creciente tamaño y diversidad de la comunidad investigadora hizo que el trabajo de los miembros establecidos fuera más fácilmente examinado por otros miembros de la comunidad que no los conocían. Según Spellman, estos factores, junto con recursos cada vez más limitados e incentivos desalineados para realizar trabajo científico, condujeron a una crisis en la psicología y otros campos. [ 49 ]
Según Andrew Gelman , [ 57 ] los trabajos de Paul Meehl , Jacob Cohen , Tversky y Kahneman en las décadas de 1960 y 1970 fueron señales tempranas de la crisis de replicación. Al analizar los orígenes del problema, el propio Kahneman señaló precedentes históricos en la percepción subliminal y los fallos de replicación en la reducción de la disonancia . [ 58 ]
Se había señalado repetidamente desde 1962 [ 55 ] que la mayoría de los estudios psicológicos tienen baja potencia (tasa de verdaderos positivos), pero la baja potencia persistió durante 50 años, lo que indica un problema estructural y persistente en la investigación psicológica. [ 59 ] [ 60 ]
Predominio
En psicología
Varios factores se han combinado para colocar a la psicología en el centro de la conversación. [ 61 ] [ 62 ] Algunas áreas de la psicología que antes se consideraban sólidas, como el priming social y el agotamiento del ego , [ 63 ] han sido objeto de un mayor escrutinio debido a replicaciones fallidas. [ 64 ] Gran parte del enfoque se ha centrado en la psicología social , [ 65 ] aunque otras áreas de la psicología, como la psicología clínica , [ 66 ] [ 67 ] [ 68 ] la psicología del desarrollo , [ 69 ] [ 70 ] [ 71 ] y la investigación educativa también se han visto implicadas. [ 72 ] [ 73 ] [ 74 ] [ 75 ] [ 76 ]
En agosto de 2015, se publicó el primer estudio empírico abierto sobre reproducibilidad en psicología, llamado The Reproducibility Project: Psychology . Coordinado por el psicólogo Brian Nosek , los investigadores rehicieron 100 estudios en ciencias psicológicas de tres revistas de psicología de alto rango ( Journal of Personality and Social Psychology , Journal of Experimental Psychology: Learning, Memory, and Cognition y Psychological Science ). De 97 estudios originales con efectos significativos, el 36% se replicó con éxito ( valor p inferior a 0,05), con tamaños del efecto que promediaron la mitad de la magnitud original. [ 11 ] Entre las no replicaciones, el 25% contradijo directamente el original, mientras que el 49% fueron inconclusos debido a diseños con poca potencia. El mismo artículo examinó las tasas de reproducibilidad y los tamaños del efecto por revista y disciplina. Las tasas de replicación de estudios fueron del 23% para el Journal of Personality and Social Psychology , del 48% para el Journal of Experimental Psychology: Learning, Memory, and Cognition y del 38% para Psychological Science . Los estudios en el campo de la psicología cognitiva tuvieron una tasa de replicación más alta (50%) que los estudios en el campo de la psicología social (25%). [ 77 ] Esta falta de conclusiones reflejó una potencia estadística insuficiente: las muestras de replicación fueron aproximadamente un 40% del tamaño de las originales. [ 78 ]
Un estudio publicado en 2018 en Nature Human Behaviour replicó 21 artículos de ciencias sociales y del comportamiento de Nature y Science , y encontró que solo alrededor del 62% pudo reproducir con éxito los resultados originales. [ 79 ] [ 80 ]
De manera similar, en un estudio realizado bajo los auspicios del Centro para la Ciencia Abierta , un equipo de 186 investigadores de 60 laboratorios (que representan 36 nacionalidades de seis continentes) llevó a cabo replicaciones de 28 hallazgos clásicos y contemporáneos en psicología. [ 81 ] [ 82 ] El enfoque del estudio no fue solo si los hallazgos de los artículos originales se replicaban, sino también el grado en que los hallazgos variaban en función de las variaciones en las muestras y los contextos. En general, el 50% de los hallazgos no se replicaron a pesar de los grandes tamaños de muestra. Cuando los hallazgos se replicaron, lo hicieron de manera consistente en la mayoría de las muestras. Cuando fallaron, fallaron de manera consistente en todos los contextos, lo que sugiere que la sensibilidad contextual no fue el principal impulsor de los fallos de replicación. Esta evidencia es inconsistente con una explicación propuesta de que los fallos de replicación en psicología probablemente se deban a cambios en la muestra entre el estudio original y el de replicación. [ 82 ]
Los resultados de un estudio de 2022 sugieren que muchos estudios anteriores sobre cerebro y fenotipo ("estudios de asociación de todo el cerebro" (BWAS)) produjeron conclusiones inválidas, ya que la replicación de dichos estudios requiere muestras de miles de individuos debido a los pequeños tamaños del efecto . [ 83 ] [ 84 ]
En medicina

De 49 estudios médicos de 1990 a 2003 con más de 1000 citas, el 92% encontró que las terapias estudiadas eran efectivas. De estos estudios, el 16% fueron contradichos por estudios posteriores, el 16% había encontrado efectos más fuertes que los estudios posteriores, el 44% fueron replicados y el 24% permaneció en gran medida sin ser cuestionado. [ 85 ] Un análisis de 2011 realizado por investigadores de la compañía farmacéutica Bayer encontró que, como máximo, una cuarta parte de los hallazgos internos de Bayer replicaron los resultados originales. [ 86 ] Pero el análisis de los resultados de Bayer encontró que los resultados que sí se replicaron a menudo podían usarse con éxito para aplicaciones clínicas. [ 87 ]
En un artículo de 2012, C. Glenn Begley , consultor de biotecnología que trabajaba en Amgen , y Lee Ellis, investigador médico de la Universidad de Texas, descubrieron que solo el 11 % de 53 estudios preclínicos sobre cáncer tenían replicaciones que podían confirmar las conclusiones de los estudios originales. [ 37 ] A finales de 2021, The Reproducibility Project: Cancer Biology examinó 53 artículos destacados sobre cáncer publicados entre 2010 y 2012 y mostró que, entre los estudios que proporcionaron información suficiente para ser repetidos, los tamaños del efecto fueron un 85 % menores en promedio que los hallazgos originales. [ 88 ] [ 89 ] Una encuesta a investigadores del cáncer encontró que la mitad de ellos no había podido reproducir un resultado publicado. [ 90 ] Otro informe estimó que casi la mitad de los ensayos controlados aleatorios contenían datos defectuosos (basado en el análisis de datos individuales de participantes anonimizados (IPD) de más de 150 ensayos). [ 91 ]
En otras disciplinas
en ciencias de la nutrición
En ciencias de la nutrición, para la mayoría de los ingredientes alimentarios, existen estudios que demuestran que el ingrediente influye en el riesgo de cáncer. Específicamente, de una muestra aleatoria de 50 ingredientes de un libro de cocina, el 80% contaba con artículos que informaban sobre su riesgo de cáncer. La significación estadística disminuyó en los metaanálisis. [ 92 ]
En economía
La economía se ha quedado rezagada con respecto a otras ciencias sociales y la psicología en sus intentos de evaluar las tasas de replicación y aumentar el número de estudios que intentan replicarse. [ 12 ] Un estudio de 2016 en la revista Science replicó 18 estudios experimentales publicados en dos revistas de economía líderes, The American Economic Review y Quarterly Journal of Economics , entre 2011 y 2014. Encontró que aproximadamente el 61% de los estudios se replicaron con éxito, aunque los tamaños del efecto replicados fueron solo el 66% de los tamaños del efecto originales informados en promedio, lo que sugiere que los tamaños del efecto de los estudios originales estaban inflados. [ 93 ] [ 94 ] [ 95 ] Alrededor del 20% de los estudios publicados en The American Economic Review son contradichos por otros estudios a pesar de basarse en los mismos o similares conjuntos de datos. [ 96 ] Un estudio de hallazgos empíricos en el Strategic Management Journal encontró que alrededor del 30% de 27 artículos reevaluados mostraron resultados estadísticamente no significativos para hallazgos previamente significativos, mientras que alrededor del 4% mostró resultados estadísticamente significativos para hallazgos previamente no significativos. [ 97 ]
En la gestión de los recursos hídricos
Un estudio de 2019 publicado en Scientific Data estimó con un 95 % de confianza que, de 1989 artículos sobre recursos hídricos y gestión publicados en 2017, los resultados del estudio podrían reproducirse solo entre un 0,6 % y un 6,8 %, principalmente porque los artículos no proporcionaban información suficiente para permitir la replicación. [ 98 ]
En la investigación sobre y con grandes modelos de lenguaje
La rápida adopción de grandes modelos de lenguaje (LLM) después de 2022 introdujo un conjunto distinto de preocupaciones de reproducibilidad, afectando tanto a la investigación sobre LLM como a la investigación que los utiliza como herramientas. [ 99 ] Una dificultad es que los hallazgos empíricos sobre cómo se comportan los LLM a menudo son difíciles de reproducir. Los modelos comerciales se actualizan o se retiran sin previo aviso, sus datos de entrenamiento y pesos generalmente no se divulgan, y sus resultados pueden cambiar de una ejecución a otra incluso cuando la configuración se mantiene constante, por lo que un resultado informado una vez puede no ser válido cuando se prueban las mismas indicaciones más adelante. Los investigadores han advertido que esta combinación de sistemas cerrados y de rápido cambio y sensibilidad a pequeños cambios en la redacción de las indicaciones podría producir una ola de hallazgos que no se pueden replicar. [ 99 ] La reproducibilidad también se ve afectada cuando los LLM se utilizan como instrumentos en otros campos. Las revisiones de investigaciones sobre aprendizaje automático han encontrado que muchos artículos no se pueden reproducir ni siquiera en principio, porque el código, los datos, los hiperparámetros exactos , las semillas aleatorias o las versiones del modelo no se informan, mientras que la dependencia de modelos y conjuntos de datos propietarios impide que otros verifiquen los resultados. [ 100 ] [ 101 ]
Un peligro recurrente en estos estudios es la fuga de datos, en la que la información del conjunto de prueba entra inadvertidamente en el entrenamiento e infla el rendimiento aparente; se ha señalado como una de las principales causas de afirmaciones irreproducibles en la ciencia basada en el aprendizaje automático. [ 102 ] Una revisión de 2025 de 640 artículos que aplicaron LLM a tareas de ingeniería de software encontró brechas persistentes en la disponibilidad de artefactos, la especificación de entornos informáticos y la documentación, y denominó a la situación una crisis de reproducibilidad dentro de ese subcampo. [ 103 ]
Otra preocupación es que la IA generativa puede corromper los datos en los que se basa la investigación del comportamiento. Las plataformas de participación en línea como Prolific y Amazon Mechanical Turk se utilizan ampliamente en psicología, pero algunos participantes ahora recurren a chatbots para responder preguntas abiertas, lo que produce textos fluidos que ocultan la falta de atención y pueden distorsionar los resultados experimentales. Tras analizar los registros de pulsaciones de teclas de tres estudios realizados en Prolific en 2025, un equipo estimó tasas notables de respuestas asistidas por IA y advirtió que este tipo de contaminación reduce la potencia estadística y socava la validez de los estudios basados en la colaboración colectiva. [ 104 ]
En respuesta, los investigadores han comenzado a desarrollar estándares de presentación de informes adaptados al trabajo basado en LLM. En 2026, un amplio grupo de consenso publicó una lista de verificación para la presentación de informes en Nature Human Behaviour , conocida como GUIDE-LLM, con el objetivo de mejorar la transparencia, la reproducibilidad y la responsabilidad ética de la investigación basada en LLM en las ciencias del comportamiento. La lista de verificación solicita a los autores que documenten qué modelos y versiones utilizaron, cómo se eligieron las indicaciones y los parámetros, y qué medidas se tomaron para prevenir los problemas de inestabilidad y contaminación descritos anteriormente, de modo que otros investigadores tengan mayores posibilidades de reproducir el trabajo. [ 105 ]
En todos los campos
Una encuesta realizada en 2016 por Nature a 1576 investigadores que respondieron un breve cuestionario en línea sobre reproducibilidad reveló que más del 70 % de los investigadores habían intentado reproducir los resultados de experimentos de otros científicos sin éxito (incluidos el 87 % de los químicos , el 77 % de los biólogos , el 69 % de los físicos e ingenieros , el 67 % de los investigadores médicos , el 64 % de los científicos de la Tierra y del medio ambiente , y el 62 % de todos los demás), y más de la mitad no habían logrado reproducir sus propios experimentos. Sin embargo, menos del 20 % había sido contactado por otro investigador que no había podido reproducir su trabajo. La encuesta reveló que menos del 31 % de los investigadores cree que el hecho de no poder reproducir los resultados implica que el resultado original probablemente sea erróneo, aunque el 52 % coincide en que existe una importante crisis de replicación. La mayoría de los investigadores afirmó seguir confiando en la literatura publicada. [ 5 ] [ 106 ] En 2010, Fanelli (2010) [ 107 ] encontró que el 91,5% de los estudios de psiquiatría/psicología confirmaron los efectos que buscaban, y concluyó que las probabilidades de que esto ocurriera (un resultado positivo) eran aproximadamente cinco veces mayores que en campos como la astronomía o las geociencias . Fanelli argumentó que esto se debe a que los investigadores en ciencias "más blandas" tienen menos limitaciones en sus sesgos conscientes e inconscientes.
Los primeros análisis de la revisión por pares ciega a los resultados , que se ve menos afectada por el sesgo de publicación, han estimado que el 61% de los estudios ciegos a los resultados en biomedicina y psicología han dado lugar a resultados nulos , en contraste con un estimado del 5% al 20% en investigaciones anteriores. [ 108 ]
En 2021, un estudio realizado por la Universidad de California en San Diego encontró que los artículos que no se pueden replicar tienen más probabilidades de ser citados. [ 109 ] Las publicaciones no replicables a menudo se citan más incluso después de que se publica un estudio de replicación. [ 110 ]
Causas
Existen muchas causas propuestas para la crisis de replicación.
Causas históricas y sociológicas
La crisis de replicación puede desencadenarse por la "generación de nuevos datos y publicaciones científicas a un ritmo sin precedentes" que lleva a la "desesperación por publicar o perecer" y al incumplimiento de las buenas prácticas científicas. [ 111 ]
Las predicciones de una crisis inminente en el mecanismo de control de calidad de la ciencia se remontan a varias décadas atrás. Derek de Solla Price —considerado el padre de la cienciometría , el estudio cuantitativo de la ciencia— predijo en su libro de 1963 , Little Science, Big Science , que la ciencia podría alcanzar la «senilidad» como resultado de su propio crecimiento exponencial. [ 112 ] Parte de la literatura actual parece confirmar esta profecía de «desbordamiento», lamentando el deterioro tanto de la atención como de la calidad. [ 113 ] [ 114 ]
El historiador Philip Mirowski sostiene que el declive de la calidad científica puede vincularse a su mercantilización, especialmente impulsada por la decisión de las grandes corporaciones, motivada por el lucro, de subcontratar sus investigaciones a universidades y organizaciones de investigación por contrato . [ 115 ]
La teoría de los sistemas sociales , tal como la expone el sociólogo alemán Niklas Luhmann , inspira un diagnóstico similar. Esta teoría sostiene que cada sistema, como la economía, la ciencia, la religión y los medios de comunicación, se comunica utilizando su propio código: verdadero y falso para la ciencia, ganancia y pérdida para la economía, noticia y no noticia para los medios, y así sucesivamente. [ 116 ] [ 117 ] Según algunos sociólogos, la mediatización de la ciencia , [ 118 ] la mercantilización, [ 115 ] y la politización, [ 118 ] [ 119 ] como resultado del acoplamiento estructural entre sistemas, han llevado a una confusión de los códigos originales del sistema.
Problemas con el sistema de publicación en la ciencia
Sesgo de publicación
El sesgo de publicación —la tendencia a publicar solo resultados positivos y significativos— crea el « efecto cajón de archivo », donde los resultados negativos permanecen sin publicar. [ a ] Esto produce literatura engañosa y metaanálisis sesgados. [ 26 ] Solo una proporción muy pequeña de revistas académicas en psicología y neurociencias acogió explícitamente las presentaciones de estudios de replicación en su objetivo y alcance o instrucciones para los autores. [ 120 ] [ 121 ] Esto no fomenta la presentación de informes sobre estudios de replicación, ni siquiera los intentos de realizarlos. Entre 1.576 investigadores encuestados por Nature en 2016, solo una minoría había intentado alguna vez publicar una replicación, y varios encuestados que habían publicado replicaciones fallidas señalaron que los editores y revisores exigieron que minimizaran las comparaciones con los estudios originales. [ 5 ] [ 106 ] Un análisis de 4270 estudios empíricos en 18 revistas de negocios de 1970 a 1991 informó que menos del 10 % de los artículos de contabilidad, economía y finanzas y el 5 % de los artículos de administración y marketing eran estudios de replicación. [ 93 ] [ 122 ] El sesgo de publicación se ve aumentado por la presión de publicar y el propio sesgo de confirmación del autor , [ b ] y es un riesgo inherente en el campo, que requiere cierto grado de escepticismo por parte de los lectores. [ 40 ]
Si se considera el sesgo de publicación junto con el hecho de que la mayoría de las hipótesis probadas podrían ser falsas a priori , es plausible que una proporción considerable de los hallazgos de investigación sean falsos positivos, como lo demostró el metacientífico John Ioannidis. [ 1 ] A su vez, una alta proporción de falsos positivos en la literatura publicada puede explicar por qué muchos hallazgos no son reproducibles. [ 26 ]
Otro sesgo de publicación es que los estudios que no rechazan la hipótesis nula se examinan de forma asimétrica. Por ejemplo, es probable que se rechacen por ser difíciles de interpretar o por tener un error de tipo II. Los estudios que sí rechazan la hipótesis nula no suelen ser rechazados por esas razones. [ 124 ]
En los medios de comunicación populares, existe otro elemento de sesgo de publicación: el deseo de hacer que la investigación sea accesible al público llevó a la simplificación excesiva y la exageración de los hallazgos, creando expectativas poco realistas y amplificando el impacto de las no replicaciones. Por el contrario, los resultados nulos y los fracasos en la replicación tienden a no ser reportados. Esta explicación puede aplicarse a la crisis de replicación de la postura de poder . [ 125 ]
Errores matemáticos
Incluso las revistas de alto impacto presentan una fracción significativa de errores matemáticos en el uso de estadísticas. Por ejemplo, el 11 % de los resultados estadísticos publicados en Nature y BMJ en 2001 son "incongruentes", lo que significa que el valor p informado difiere matemáticamente del que debería obtenerse si se calculara correctamente a partir del estadístico de prueba informado. Es probable que estos errores se debieran a errores de composición tipográfica, redondeo y transcripción. [ 126 ]
Entre 157 artículos de neurociencia publicados en cinco revistas de alto nivel que intentan demostrar que dos efectos experimentales son diferentes, 78 probaron erróneamente si un efecto es significativo mientras que el otro no lo es, y 79 probaron correctamente si su diferencia es significativamente diferente de 0. [ 127 ]
cultura de "publicar o perecer"
La cultura académica de "publicar o perecer" exacerba el sesgo de publicación. La intensa presión por publicar en revistas reconocidas, impulsada por entornos hipercompetitivos y evaluaciones bibliométricas de la carrera, incentiva a los investigadores a priorizar los resultados publicables sobre la validez. [ 128 ] Según Fanelli, esto empuja a los científicos a emplear diversas estrategias destinadas a hacer que los resultados sean "publicables". [ 129 ] En el contexto del sesgo de publicación, esto puede significar adoptar comportamientos dirigidos a hacer que los resultados sean positivos o estadísticamente significativos, a menudo a expensas de su validez. [ 128 ]
Según Brian Nosek, fundador del Centro para la Ciencia Abierta, y sus colegas, la cultura de "publicar o perecer" creó una situación en la que los objetivos y valores de los científicos individuales (por ejemplo, la posibilidad de publicar) no coinciden con los objetivos generales de la ciencia (por ejemplo, la búsqueda de la verdad científica). Esto perjudica la validez de los hallazgos publicados. [ 130 ]
El filósofo Brian D. Earp y el psicólogo Jim AC Everett sostienen que, si bien la replicación beneficia a los académicos e investigadores en su conjunto, ciertas características de la cultura psicológica académica desalientan la replicación por parte de investigadores individuales. Argumentan que realizar replicaciones puede consumir mucho tiempo y restar recursos a proyectos que reflejan el pensamiento original del investigador. Son más difíciles de publicar, principalmente porque carecen de originalidad, e incluso cuando se publican, es improbable que se consideren contribuciones importantes al campo. Las replicaciones "aportan menos reconocimiento y recompensa, incluyendo financiación, a sus autores". [ 131 ]
En su libro de 1971, *El conocimiento científico y sus problemas sociales* , [ 132 ] el filósofo e historiador de la ciencia Jerome R. Ravetz predijo que la ciencia —en su progresión desde la ciencia "pequeña", compuesta por comunidades aisladas de investigadores, hasta la ciencia "grande" o "tecnociencia"— sufriría graves problemas en su sistema interno de control de calidad. Reconoció que la estructura de incentivos para los científicos modernos podría volverse disfuncional, creando incentivos perversos para publicar cualquier hallazgo, por dudoso que fuera. Según Ravetz, la calidad en la ciencia se mantiene solo cuando existe una comunidad de académicos, vinculados por un conjunto de normas y estándares compartidos, que están dispuestos y son capaces de exigirse responsabilidades mutuamente.
Normas de presentación de informes
Ciertas prácticas de publicación también dificultan la realización de replicaciones y el monitoreo de la gravedad de la crisis de reproducibilidad, ya que los artículos a menudo vienen con descripciones insuficientes para que otros investigadores reproduzcan el estudio. El Proyecto de Reproducibilidad: Biología del Cáncer mostró que de 193 experimentos de 53 artículos principales sobre cáncer publicados entre 2010 y 2012, solo 50 experimentos de 23 artículos tenían autores que proporcionaron suficiente información para que los investigadores rehicieran los estudios, a veces con modificaciones. Ninguno de los 193 artículos examinados tenía sus protocolos experimentales completamente descritos y replicar el 70% de los experimentos requirió solicitar reactivos clave. [ 88 ] [ 89 ] El estudio mencionado anteriormente de hallazgos empíricos en Strategic Management Journal encontró que el 70% de 88 artículos no se pudieron replicar debido a una falta de información suficiente para datos o procedimientos. [ 93 ] [ 97 ] En recursos hídricos y gestión , la mayoría de 1987 artículos publicados en 2017 no fueron replicables debido a una falta de información disponible compartida en línea. [ 98 ] En estudios de potenciales relacionados con eventos , solo se informaron dos tercios de la información necesaria para replicar un estudio en una muestra de 150 estudios, lo que pone de manifiesto que existen importantes lagunas en la presentación de informes. [ 133 ]
Sesgo procedimental
Según la tesis de Duhem-Quine , los resultados científicos se interpretan tanto a partir de una teoría sustantiva como de una teoría de los instrumentos. Por ejemplo, las observaciones astronómicas dependen tanto de la teoría de los objetos astronómicos como de la teoría de los telescopios. Una gran cantidad de investigación no replicable podría acumularse si existe un sesgo del siguiente tipo: ante un resultado nulo, un científico prefiere tratar los datos como indicando que el instrumento es insuficiente; ante un resultado no nulo, un científico prefiere aceptar el instrumento como bueno y tratar los datos como indicativos de la teoría sustantiva. [ 134 ]
Evolución cultural
Smaldino y McElreath [ 60 ] propusieron un modelo simple para la evolución cultural de la práctica científica. Cada laboratorio decide aleatoriamente producir investigación novedosa o replicación, con diferentes niveles fijos de tasa de falsos positivos, tasa de verdaderos positivos, tasa de replicación y productividad (sus "rasgos"). Un laboratorio podría emplear más "esfuerzo", lo que hace que la curva ROC sea más convexa, pero disminuye la productividad. Un laboratorio acumula una puntuación a lo largo de su existencia que aumenta con las publicaciones y disminuye cuando otro laboratorio no logra replicar sus resultados. A intervalos regulares, un laboratorio aleatorio "muere" y otro "reproduce" un laboratorio hijo con un rasgo similar al de su progenitor. Los laboratorios con puntuaciones más altas tienen mayor probabilidad de reproducirse. Bajo ciertas configuraciones de parámetros, la población de laboratorios converge a la productividad máxima, incluso a costa de tasas de falsos positivos muy elevadas.
Prácticas de investigación cuestionables
Las prácticas de investigación cuestionables son comportamientos que explotan los grados de libertad del investigador (DF del investigador) —elecciones en el diseño del estudio, el análisis de datos o la presentación de informes— para inflar las tasas de falsos positivos y socavar la reproducibilidad. [ 135 ] [ 136 ] [ 40 ] Ejemplos de prácticas de investigación cuestionables incluyen el dragado de datos , [ 136 ] [ 137 ] [ 39 ] [ c ] la presentación selectiva de solo hallazgos estadísticamente significativos, [ 135 ] [ 136 ] [ 137 ] [ 39 ] [ d ] HARKing (formular hipótesis después de conocer los resultados), [ 136 ] [ 137 ] [ 39 ] [ e ] PARKing (preinscribir después de conocer los resultados) y la realización de análisis de potencia inapropiados. [ 139 ]
Génesis
Los grados de libertad de los investigadores se presentan en muchas etapas: formulación de hipótesis , diseño de experimentos , recopilación y análisis de datos , e informe de la investigación . [ 136 ] Los análisis de conjuntos de datos idénticos por diferentes equipos, incluso sin incentivos para hallazgos significativos, a menudo producen resultados divergentes en disciplinas como la psicología, la lingüística y la ecología. [ 140 ] [ 141 ] [ 142 ] Esto se debe a que el diseño de la investigación y el análisis de datos implican numerosas decisiones que no están suficientemente restringidas por las mejores prácticas y metodologías estadísticas de un campo. Como resultado, los grados de libertad del investigador pueden conducir a situaciones en las que algunos intentos fallidos de replicación utilizan un diseño de investigación o análisis estadístico diferente, pero plausible; tales estudios no necesariamente socavan los hallazgos previos. [ 143 ] El análisis multiverso , un método que hace inferencias basadas en todas las posibles secuencias de procesamiento de datos, proporciona una solución al problema de la flexibilidad analítica. [ 144 ] El análisis de sensibilidad explora las especificaciones del modelo para crear una visión integral de cómo las diferentes opciones analíticas influyen en los resultados. [ 145 ] Los enfoques colaborativos pueden utilizarse para compensar prácticas de investigación cuestionables. En los enfoques multianalistas, diferentes analistas realizan diferentes análisis para abordar las preguntas. [ 146 ] [ 147 ] [ 141 ] Esta validación colaborativa fomenta la honestidad intelectual y expone prácticas de investigación cuestionables, lo que conduce a conclusiones científicas más fiables y sólidas. [ 148 ]
En medicina
Los estudios médicos irreproducibles suelen compartir estas características: los investigadores no desconocen si un grupo es experimental o de control; no se repiten los experimentos; falta de controles positivos y negativos ; no se informan todos los datos; uso inapropiado de pruebas estadísticas; y uso de reactivos que no fueron validados adecuadamente . [ 149 ]
En la investigación sobre IA
En la investigación del aprendizaje automático , han surgido diversas prácticas cuestionables debido a la intensa presión por alcanzar resultados de referencia de vanguardia. Las prácticas de evaluación cuestionables más comunes incluyen el "sobreajuste de referencia" mediante el ajuste repetido de hiperparámetros en conjuntos de prueba reservados, la presentación selectiva del mejor resultado entre múltiples semillas aleatorias o ejecuciones experimentales, y la "manipulación de métricas" a través de decisiones post hoc no reportadas, como la elección de scripts de tokenización o evaluación que inflan las puntuaciones. [ 150 ] Los investigadores también suelen seleccionar tareas o conjuntos de datos donde su modelo propuesto supera a los modelos de referencia, omiten resultados negativos o de menor rendimiento y ocultan los presupuestos de computación para presentar métodos de alto consumo energético como eficientes. Estas prácticas pueden dar una impresión engañosa del progreso del modelo y dificultar las comparaciones justas entre métodos. Además, muchos estudios de aprendizaje automático adolecen de prácticas de investigación irreproducibles que impiden la replicación y la auditoría. Los problemas clave incluyen la divulgación incompleta de los detalles del entrenamiento, como el preprocesamiento del conjunto de datos, los hiperparámetros exactos del modelo, las semillas aleatorias y las configuraciones de hardware, y la falta de publicación del código o los datos utilizados en los experimentos. Los investigadores suelen omitir versiones de dependencias o recurrir a conjuntos de datos propietarios, impidiendo que otros reproduzcan los resultados. Incluso en el caso de los conjuntos de datos de referencia públicos, la sutil "filtración de datos" mediante la inclusión inadvertida de datos de prueba en los conjuntos de entrenamiento sigue siendo generalizada. En conjunto, estas prácticas cuestionables socavan la validez y la credibilidad de los hallazgos publicados en el aprendizaje automático y representan obstáculos importantes para el progreso científico acumulativo. [ 150 ]
En octubre de 2024, Communications of the ACM publicó una crítica revisada por pares [ 151 ] de un artículo de Nature de 2021 [ 152 ] de investigadores de Google . La crítica describió "un conjunto de prácticas cuestionables en ML , incluidas prácticas de investigación irreproducibles, múltiples variantes de selección sesgada , informes erróneos y probable contaminación de datos (filtración)" con una referencia a Leech et al. [ 150 ] El artículo criticado afirmaba progreso en el diseño rápido de chips usando aprendizaje por refuerzo , pero respaldaba la afirmación con experimentos en conjuntos de datos de entrenamiento y prueba propietarios cuyos detalles estadísticos no se revelaron, lo que impedía la reproducción independiente fuera de la empresa. [ 153 ] Los tiempos de ejecución específicos tanto para el enfoque propuesto como para las técnicas anteriores en casos de prueba individuales no se revelaron en el artículo, pero estudios posteriores encontraron que el método de Google se ejecutaba órdenes de magnitud más lento que las herramientas de Cadence Design Systems disponibles al mismo tiempo. La crítica contrastó dichos estudios [ 154 ] y destacó prácticas cuestionables en el artículo de Nature como (i) informes selectivos de resultados en solo un subconjunto de puntos de referencia, (ii) comparaciones desfavorables con métodos de referencia más débiles, (iii) uso de métricas de evaluación inconsistentes y (iv) uso no revelado de datos de software comercial que solo se admitió años después del trabajo original [ 152 ] y múltiples rondas de críticas. [ 155 ] [ 156 ] [ 157 ] Además, la investigación pudo haber sufrido fuga de datos, donde la separación de datos de entrenamiento y prueba no pudo verificarse utilizando datos publicados, considerado un defecto significativo en el diseño experimental. [ 151 ] Después de que se renombrara como AlphaChip en 2024, varios investigadores expresaron escepticismo sobre el enfoque de Google, así como sobre los datos y el código fuente publicados. Las prácticas de investigación cuestionables y la incapacidad de los investigadores independientes para reproducir el rendimiento de AlphaChip pusieron de relieve la necesidad de puntos de referencia transparentes y reproducibles, así como de estándares de evaluación rigurosos para garantizar un progreso real en el campo de la automatización del diseño electrónico . [ 158 ] [ 159 ]
Predominio
Según el profesor de la IU Ernest O'Boyle y el psicólogo Martin Götz, alrededor del 50% de los investigadores encuestados en varios estudios admitieron haber participado en HARKing. [ 160 ] En una encuesta a 2000 psicólogos realizada por el científico del comportamiento Leslie K. John y sus colegas, alrededor del 94% de los psicólogos admitieron haber empleado al menos una práctica de investigación cuestionable. Más específicamente, el 63% admitió no haber informado todas las medidas dependientes de un estudio, el 28% no haber informado todas las condiciones de un estudio y el 46% haber informado selectivamente estudios que produjeron el patrón de resultados deseado. Además, el 56% admitió haber recopilado más datos después de haber inspeccionado los datos ya recopilados y el 16% haber detenido la recopilación de datos porque el resultado deseado ya era visible. [ 39 ] Según la estimación del investigador de biotecnología J. Leslie Glick en 1992, entre el 10% y el 20% de los estudios de investigación y desarrollo involucraron prácticas de investigación cuestionables o fraude directo. [ 161 ] La metodología utilizada para estimar las prácticas de investigación cuestionables ha sido cuestionada, y estudios más recientes sugieren tasas de prevalencia más bajas en promedio. [ 162 ]
Fraude
Las prácticas de investigación cuestionables se consideran una categoría aparte de las violaciones más explícitas de la integridad científica , como la falsificación de datos. [ 135 ] [ 136 ] Un metaanálisis de 2009 encontró que el 2% de los científicos de todos los campos admitieron haber falsificado estudios al menos una vez y el 14% admitió conocer a alguien que lo hizo. Según un estudio, esta mala conducta fue reportada con mayor frecuencia por investigadores médicos que por otros. [ 163 ] Ejemplos prominentes (véase también Lista de incidentes de mala conducta científica ) incluyen el fraude científico del psicólogo social Diederik Stapel , [ 164 ] [ 13 ] el psicólogo cognitivo Marc Hauser y el psicólogo social Lawrence Sanna. [ 13 ] En 2018, algunos investigadores consideraron que el fraude científico era poco común. [ 13 ] Un estudio de la Universidad Northwestern de 2025 encontró que "la publicación de ciencia fraudulenta está superando la tasa de crecimiento de las publicaciones científicas legítimas". El estudio también descubrió amplias redes de estafadores científicos organizados. [ 165 ] [ 166 ]
En marzo de 2024, el comité de investigación de la Harvard Business School , tras revisar un informe de casi 1300 páginas desclasificado durante la demanda de 25 millones de dólares de la profesora Francesca Gino contra Harvard y los blogueros de Data Colada , concluyó que Gino "cometió mala conducta en la investigación de forma intencionada, a sabiendas o imprudente" al falsificar datos en cuatro estudios publicados. [ 167 ] El informe documentó que Gino había alterado las respuestas de los participantes, incluyendo el cambio de 104 calificaciones de impureza moral (cambiando valores bajos a altos en una condición experimental y viceversa en otra) y manipulando cuatro ítems de intenciones de establecer redes, para un total de 168 observaciones modificadas, para que los datos se ajustaran a sus hipótesis. [ 168 ] También incurrió en informes selectivos al publicar solo el conjunto de datos "Publicado" mientras omitía los archivos originales de Qualtrics y tergiversó la procedencia de sus datos al atribuir las discrepancias a una supuesta manipulación de terceros en lugar de a cambios deliberados por parte de su equipo de investigación. [ 168 ] En junio de 2023, Gino fue puesta en licencia administrativa sin goce de sueldo, y en mayo de 2025 Harvard revocó su titularidad —la primera acción de este tipo en aproximadamente 80 años— citando violaciones flagrantes de la integridad académica. [ 169 ]
Cuestiones estadísticas
Baja potencia estadística
La baja potencia estadística dificulta la replicación por tres razones: (1) las replicaciones con baja potencia tienen una capacidad reducida para detectar efectos reales, (2) los estudios originales con baja potencia producen estimaciones sesgadas del tamaño del efecto que dan lugar a replicaciones con tamaño insuficiente, y (3) los estudios originales con baja potencia producen resultados que difícilmente reflejan los efectos reales. [ 14 ]
Matemáticamente, la probabilidad de replicar una publicación anterior que rechazó una hipótesis nulaa favor de una alternativaesSuponer que la significancia es menor que la potencia. Por lo tanto, una potencia baja implica una baja probabilidad de replicación, independientemente de cómo se haya diseñado la publicación anterior y de cuál sea realmente la hipótesis verdadera. [ 78 ]
Stanley y sus colegas estimaron la potencia estadística promedio de la literatura psicológica analizando datos de 200 metaanálisis . Descubrieron que, en promedio, los estudios de psicología tienen entre un 33,1 % y un 36,4 % de potencia estadística. Estos valores son bastante bajos en comparación con el 80 % considerado como potencia estadística adecuada para un experimento. En los 200 metaanálisis, la mediana de los estudios con potencia estadística adecuada se situó entre el 7,7 % y el 9,1 %, lo que implica que un resultado positivo se replicaría con una probabilidad inferior al 10 %, independientemente de si se trataba de un verdadero positivo o un falso positivo. [ 14 ]
El poder estadístico de los estudios de neurociencia es bastante bajo. El poder estadístico estimado de la investigación con fMRI se sitúa entre 0,08 y 0,31, [ 170 ] y el de los estudios de potenciales relacionados con eventos se estimó entre 0,72 y 0,98 para tamaños de efecto grandes, entre 0,35 y 0,73 para efectos medianos y entre 0,10 y 0,18 para efectos pequeños. [ 133 ]
En un estudio publicado en Nature , la psicóloga Katherine Button y sus colegas realizaron un estudio similar con 49 metaanálisis en neurociencia, estimando una potencia estadística mediana del 21 %. [ 171 ] El metacientífico John Ioannidis y sus colegas calcularon una estimación de la potencia promedio para la investigación económica empírica, encontrando una potencia mediana del 18 % basada en la literatura que se basa en 6700 estudios. [ 172 ] A la luz de estos resultados, es plausible que una razón importante de los fracasos generalizados para replicar en varios campos científicos podría ser una potencia estadística muy baja en promedio.
La misma prueba estadística con el mismo nivel de significancia tendrá menor potencia estadística si el tamaño del efecto es pequeño bajo la hipótesis alternativa. Los rasgos hereditarios complejos suelen estar correlacionados con un gran número de genes, cada uno con un tamaño de efecto pequeño, por lo que una alta potencia requiere un tamaño de muestra grande. En particular, muchos resultados de la literatura sobre genes candidatos sufrieron de tamaños de efecto pequeños y tamaños de muestra pequeños y no se replicaron. Más datos de estudios de asociación de genoma completo (GWAS) se acercan a resolver este problema. [ 173 ] [ 174 ] Como ejemplo numérico, la mayoría de los genes asociados con el riesgo de esquizofrenia tienen un tamaño de efecto bajo ( riesgo relativo genotípico , GRR). Un estudio estadístico con 1000 casos y 1000 controles tiene una potencia del 0,03 % para un gen con GRR = 1,15, que ya es grande para la esquizofrenia. En contraste, el GWAS más grande hasta la fecha tiene una potencia de ~100 % para él. [ 175 ]
sesgo positivo en el tamaño del efecto
Incluso cuando el estudio se replica, la replicación suele tener un tamaño del efecto menor. Los estudios con poca potencia estadística presentan un sesgo de tamaño del efecto grande. [ 176 ]

En estudios que estiman estadísticamente un factor de regresión, como elenCuando el conjunto de datos es grande, el ruido tiende a provocar que el factor de regresión se subestime, pero cuando el conjunto de datos es pequeño, el ruido tiende a provocar que el factor de regresión se sobreestime. [ 177 ]
Problemas del metaanálisis
Los metaanálisis tienen sus propios problemas y controversias metodológicas, lo que lleva al rechazo del método metaanalítico por parte de investigadores cuya teoría es cuestionada por el metaanálisis. [ 124 ]
Rosenthal propuso el "número de seguridad contra fallos" (FSN) [ 54 ] para evitar el sesgo de publicación contra los resultados nulos. Se define de la siguiente manera: Supongamos que la hipótesis nula es verdadera; ¿cuántas publicaciones se requerirían para que el resultado actual fuera indistinguible de la hipótesis nula?
El argumento de Rosenthal es que ciertos tamaños del efecto son lo suficientemente grandes como para que, incluso si existe un sesgo de publicación total en contra de los resultados nulos (el "problema del cajón de archivos"), la cantidad de resultados nulos no publicados sea imposible de enmascarar el tamaño del efecto. Por lo tanto, el tamaño del efecto debe ser estadísticamente significativo incluso después de tener en cuenta los resultados nulos no publicados.
Una objeción al FSN es que se calcula como si los resultados no publicados fueran muestras insesgadas de la hipótesis nula. Pero si el problema del cajón de archivos es cierto, entonces los resultados no publicados tendrían tamaños del efecto concentrados alrededor de 0. Por lo tanto, se necesitarían menos resultados nulos no publicados para cambiar el tamaño del efecto, y por lo tanto el FSN es una sobreestimación. [ 124 ]
Otro problema del metaanálisis es que los estudios malos son "contagiosos" en el sentido de que un estudio malo podría hacer que todo el metaanálisis sobreestime la significación estadística. [ 78 ]
P-hacking
Se pueden aplicar diversos métodos estadísticos para que el valor p parezca menor de lo que realmente es. Esto no tiene por qué ser malintencionado, ya que un análisis de datos moderadamente flexible, habitual en la investigación, puede aumentar la tasa de falsos positivos a más del 60 %. [ 40 ]
Por ejemplo, si se recopilan algunos datos, se les aplican varias pruebas de significancia diferentes y se publica solo la que resulta tener un valor p menor que 0,05, entonces el valor p total para "al menos una prueba de significancia alcanza p < 0,05" puede ser mucho mayor que 0,05, porque incluso si la hipótesis nula fuera verdadera, la probabilidad de que una de entre muchas pruebas de significancia sea extrema no es en sí misma extrema.
Por lo general, un estudio estadístico consta de múltiples pasos, con varias opciones en cada uno, como durante la recopilación de datos, el rechazo de valores atípicos, la elección del estadístico de prueba, la elección de una prueba unilateral o bilateral, etc. Estas opciones en el " jardín de caminos que se bifurcan " se multiplican, creando muchos "grados de libertad del investigador". El efecto es similar al problema del cajón de archivos, ya que los caminos no tomados no se publican. [ 178 ]
Consideremos una ilustración simple. Supongamos que la hipótesis nula es verdadera y que tenemos 20 posibles pruebas de significancia para aplicar al conjunto de datos. Supongamos también que los resultados de las pruebas de significancia son independientes. Por definición de "significancia", cada prueba tiene una probabilidad de 0.05 de pasar con un nivel de significancia de 0.05. La probabilidad de que al menos 1 de 20 sea significativa es, por el supuesto de independencia,. [ 179 ]
Otra posibilidad es el problema de las comparaciones múltiples . En 2009, se observó en dos ocasiones que los estudios de fMRI presentaban un número sospechoso de resultados positivos con tamaños del efecto grandes, más de lo esperado dado que los estudios tenían una potencia baja (un ejemplo [ 180 ] tenía solo 13 sujetos). Se señaló que más de la mitad de los estudios probaban la correlación entre un fenómeno y vóxeles individuales de fMRI, y solo informaban sobre los vóxeles que superaban los umbrales elegidos. [ 181 ]

La detención opcional es una práctica en la que se recopilan datos hasta que se alcanza algún criterio de parada. Aunque es un procedimiento válido, se presta fácilmente a un uso indebido. El problema es que el valor p de una prueba estadística con detención opcional es mayor de lo que parece. Intuitivamente, esto se debe a que se supone que el valor p es la suma de todos los eventos al menos tan raros como el observado. Con la detención opcional, existen eventos aún más raros que son difíciles de tener en cuenta, es decir, no activar la regla de detención opcional y recopilar aún más datos antes de detenerse. Ignorar estos eventos lleva a un valor p demasiado bajo. De hecho, si la hipótesis nula es verdadera, se puede alcanzar cualquier nivel de significancia si se permite seguir recopilando datos y detenerse cuando se obtiene el valor p deseado (calculado como si siempre se hubiera planeado recopilar exactamente esta cantidad de datos). [ 182 ] Para un ejemplo concreto de prueba de una moneda justa, véase p -value#optional stopping .
En resumen, el cálculo correcto del valor p requiere considerar los contrafactuales, es decir, lo que el experimentador podría haber hecho en respuesta a datos que podrían haber sido. Considerar lo que podría haber sido es difícil incluso para investigadores honestos. [ 182 ] Una ventaja del preregistro es que permite considerar todos los contrafactuales, lo que posibilita el cálculo correcto del valor p. [ 183 ]
El problema de la interrupción prematura no se limita solo a la mala conducta del investigador. A menudo existe presión para detener la investigación prematuramente si el costo de recopilar datos es elevado. Algunos comités de ética animal incluso exigen la interrupción temprana si el estudio obtiene un resultado significativo a mitad de camino. [ 179 ]
Estas prácticas son comunes en psicología. En una encuesta de 2012, el 56% de los psicólogos admitió haber interrumpido prematuramente los análisis, el 46% haber informado solo los análisis que "funcionaron" y el 38% haber realizado exclusiones post hoc , es decir, eliminar algunos datos después de haberlos analizado antes de volver a analizar los datos restantes (a menudo con la premisa de "eliminar valores atípicos"). [ 39 ]
Heterogeneidad estadística
Como también informaron Stanley y sus colegas, otra razón por la que los estudios podrían no replicarse es la alta heterogeneidad de los efectos que se pretenden replicar. La heterogeneidad (varianza en los hallazgos de la investigación debido a múltiples tamaños de efecto verdaderos en lugar de uno solo) se mide mediante el estadístico I², que cuantifica la variación no explicada en los tamaños de efecto entre estudios. [ 14 ] [ 184 ] Esta variación puede deberse a diferencias en los métodos experimentales, las poblaciones, las cohortes y los métodos estadísticos entre los estudios de replicación. La heterogeneidad representa un desafío para los estudios que intentan replicar tamaños de efecto encontrados previamente . Cuando la heterogeneidad es alta, las replicaciones posteriores tienen una alta probabilidad de encontrar un tamaño de efecto radicalmente diferente al del estudio original. [ f ]
Es importante destacar que también se encuentran niveles significativos de heterogeneidad en las replicaciones directas/exactas de un estudio. Stanley y sus colegas abordan este tema al informar sobre un estudio del científico conductual cuantitativo Richard Klein y sus colegas, donde los autores intentaron replicar 15 efectos psicológicos en 36 sitios diferentes en Europa y Estados Unidos. En el estudio, Klein y sus colegas encontraron cantidades significativas de heterogeneidad en 8 de los 16 efectos (I-cuadrado = 23% a 91%). Es importante señalar que, si bien los sitios de replicación diferían intencionalmente en una variedad de características, tales diferencias podrían explicar muy poca heterogeneidad. Según Stanley y sus colegas, esto sugiere que la heterogeneidad podría haber sido una característica genuina de los fenómenos investigados. Por ejemplo, los fenómenos podrían estar influenciados por los llamados "moderadores ocultos": factores relevantes que anteriormente no se consideraban importantes en la producción de un efecto determinado.
En su análisis de 200 metaanálisis de efectos psicológicos, Stanley y sus colegas encontraron un porcentaje medio de heterogeneidad de I² = 74%. Según los autores, este nivel de heterogeneidad puede considerarse "enorme". Es tres veces mayor que la varianza de muestreo aleatorio de los tamaños del efecto medidos en su estudio. Si se considera junto con el error de muestreo , la heterogeneidad produce una desviación estándar de un estudio a otro incluso mayor que el tamaño del efecto medio de los 200 metaanálisis que investigaron. [ g ] Los autores concluyen que si la replicación se define por un estudio posterior que encuentra un tamaño del efecto suficientemente similar al original, el éxito de la replicación no es probable incluso si las replicaciones tienen tamaños de muestra muy grandes. Es importante destacar que esto ocurre incluso si las replicaciones son directas o exactas, ya que la heterogeneidad, no obstante, sigue siendo relativamente alta en estos casos.
Otros
En economía, la crisis de replicación también puede verse exacerbada porque los resultados econométricos son frágiles: [ 185 ] el uso de procedimientos de estimación o técnicas de preprocesamiento de datos diferentes pero plausibles puede conducir a resultados contradictorios. [ 186 ] [ 187 ] [ 188 ]
Sensibilidad al contexto
El profesor de la Universidad de Nueva York, Jay Van Bavel, y sus colegas argumentan que otra razón por la que los hallazgos son difíciles de replicar es la sensibilidad al contexto de ciertos efectos psicológicos. Desde esta perspectiva, los fallos en la replicación podrían explicarse por diferencias contextuales entre el experimento original y la replicación, a menudo denominadas " moderadores ocultos ". [ 189 ] Van Bavel y sus colegas probaron la influencia de la sensibilidad al contexto al reanalizar los datos del ampliamente citado Proyecto de Reproducibilidad llevado a cabo por la Open Science Collaboration. [ 11 ] Recodificaron los efectos según su sensibilidad a los factores contextuales y luego probaron la relación entre la sensibilidad al contexto y el éxito de la replicación en varios modelos de regresión .
Se encontró que la sensibilidad al contexto se correlacionaba negativamente con el éxito de la replicación, de modo que las puntuaciones más altas de sensibilidad al contexto se asociaban con menores probabilidades de replicar un efecto. [ h ] Es importante destacar que la sensibilidad al contexto se correlacionó significativamente con el éxito de la replicación incluso al ajustar por otros factores considerados importantes para reproducir los resultados (por ejemplo, tamaño del efecto y tamaño de la muestra del original, potencia estadística de la replicación, similitud metodológica entre el original y la replicación). [ i ] A la luz de los resultados, los autores concluyeron que intentar una replicación en un momento, lugar o con una muestra diferente puede alterar significativamente los resultados de un experimento. Por lo tanto, la sensibilidad al contexto puede ser una razón por la que ciertos efectos no se replican en psicología. [ 189 ]
Explicación bayesiana
En el marco de la probabilidad bayesiana, según el teorema de Bayes , rechazar la hipótesis nula con un nivel de significancia del 5% no implica que la probabilidad posterior de la hipótesis alternativa sea del 95%, y la probabilidad posterior también es diferente de la probabilidad de replicación. [ 190 ] [ 182 ] Consideremos un caso simplificado donde solo hay dos hipótesis. Sea la probabilidad previa de la hipótesis nula.y la alternativaPara un estudio estadístico dado, sea su tasa de falsos positivos (nivel de significancia)y la tasa de verdaderos positivos (potencia) sea. A modo de ejemplo, supongamos que el nivel de significancia es 0,05 y la potencia es 0,45 (potencia insuficiente).
Ahora, por el teorema de Bayes, condicionado al estudio estadístico del hallazgopara ser cierto, la probabilidad posterior deEn realidad, ser cierto no es, pero
y la probabilidad de replicar el estudio estadístico eslo cual también es diferente de. En particular, para un nivel de significancia fijo, la probabilidad de replicación aumenta con la potencia y la probabilidad previa para. Si la probabilidad previa paraSi es pequeño, entonces se requeriría una gran potencia para su replicación.
Por ejemplo, si la probabilidad previa de la hipótesis nula esy el estudio encontró un resultado positivo, entonces la probabilidad posterior paraesy la probabilidad de replicación es.
Problema con la prueba de hipótesis nula
Algunos argumentan que la prueba de hipótesis nula es en sí misma inapropiada, especialmente en "ciencias blandas" como la psicología social. [ 191 ] [ 192 ]
Como han observado repetidamente los estadísticos, [ 193 ] en sistemas complejos, como la psicología social, "la hipótesis nula siempre es falsa" o "todo está correlacionado". Si es así, entonces si la hipótesis nula no se rechaza, eso no demuestra que la hipótesis nula sea verdadera, sino simplemente que fue un falso negativo, generalmente debido a una baja potencia. [ 194 ] La baja potencia es especialmente frecuente en áreas temáticas donde los tamaños del efecto son pequeños y la adquisición de datos es costosa, como la psicología social. [ 191 ] [ 195 ]
Además, cuando se rechaza la hipótesis nula, esto podría no constituir evidencia a favor de la hipótesis alternativa sustancial. En las ciencias sociales, muchas hipótesis pueden predecir una correlación entre dos variables. Por lo tanto, la evidencia en contra de la hipótesis nula "no hay correlación" no es evidencia a favor de ninguna de las muchas hipótesis alternativas que predicen igualmente bien "hay correlación". Fisher desarrolló la prueba de hipótesis nula (NHST) para agronomía, donde rechazar la hipótesis nula suele ser una buena prueba de la hipótesis alternativa, ya que no hay muchas. Rechazar la hipótesis "el fertilizante no ayuda" es evidencia a favor de "el fertilizante ayuda". Pero en psicología, existen muchas hipótesis alternativas para cada hipótesis nula. [ 195 ] [ 196 ]
En particular, cuando los estudios estadísticos sobre percepción extrasensorial rechazan la hipótesis nula con un valor p extremadamente bajo (como en el caso de Daryl Bem ), esto no implica la hipótesis alternativa de que "existe la PES". [ 197 ] Es mucho más probable que hubiera una pequeña señal (no PES) en la configuración experimental que se haya medido con precisión. [ 198 ]
Paul Meehl señaló que la prueba de hipótesis estadística se utiliza de manera diferente en la psicología "blanda" (personalidad, social, etc.) que en la física. En física, una teoría hace una predicción cuantitativa y se prueba comprobando si la predicción se encuentra dentro del intervalo medido estadísticamente. En psicología blanda, una teoría hace una predicción direccional y se prueba comprobando si la hipótesis nula se rechaza en la dirección correcta. En consecuencia, una técnica experimental mejorada hace que las teorías sean más propensas a ser refutadas en física, pero menos propensas a ser refutadas en psicología blanda, ya que la hipótesis nula siempre es falsa dado que dos variables cualesquiera están correlacionadas por un "factor crudo" de aproximadamente 0,30. El efecto neto es una acumulación de teorías que permanecen sin refutar , pero sin evidencia empírica para preferir una sobre las demás. [ 22 ] [ 196 ]
falacia de la tasa base
Según el filósofo Alexander Bird , una posible razón de las bajas tasas de replicabilidad en ciertos campos científicos es que la mayoría de las hipótesis probadas son falsas a priori . [ 199 ] Desde esta perspectiva, las bajas tasas de replicabilidad podrían ser consistentes con la ciencia de calidad. En relación con esto, la expectativa de que la mayoría de los hallazgos deberían replicarse sería errónea y, según Bird, una forma de falacia de tasa base. El argumento de Bird funciona de la siguiente manera. Suponiendo una situación ideal de una prueba de significancia, donde la probabilidad de rechazar incorrectamente la hipótesis nula es del 5% (es decir, error de tipo I ) y la probabilidad de rechazar correctamente la hipótesis nula es del 80% (es decir, potencia ), en un contexto donde una alta proporción de hipótesis probadas son falsas, es concebible que el número de falsos positivos sea alto en comparación con el de verdaderos positivos. [ 199 ] Por ejemplo, en una situación donde solo el 10% de las hipótesis probadas son realmente verdaderas, se puede calcular que hasta el 36% de los resultados serán falsos positivos. [ j ]
La afirmación de que la falsedad de la mayoría de las hipótesis probadas puede explicar las bajas tasas de replicabilidad cobra aún más relevancia al considerar que la potencia promedio de las pruebas estadísticas en ciertos campos podría ser mucho menor al 80 %. Por ejemplo, la proporción de falsos positivos aumenta a un valor entre el 55,2 % y el 57,6 % cuando se calcula con las estimaciones de una potencia promedio entre el 34,1 % y el 36,4 % para estudios de psicología, según lo proporcionado por Stanley y sus colegas en su análisis de 200 metaanálisis en el campo. [ 14 ] Una alta proporción de falsos positivos daría como resultado que muchos hallazgos de investigación no fueran replicables.
Bird señala que la afirmación de que la mayoría de las hipótesis comprobadas son falsas a priori en ciertos campos científicos podría ser plausible dados factores como la complejidad de los fenómenos investigados, el hecho de que las teorías rara vez son indiscutibles, la "distancia inferencial" entre teorías e hipótesis, y la facilidad con la que se pueden generar hipótesis. En este sentido, los campos que Bird toma como ejemplos son la medicina clínica, la epidemiología genética y molecular, y la psicología social. Esta situación es radicalmente diferente en campos donde las teorías tienen una base empírica sólida y las hipótesis se pueden derivar fácilmente de ellas (por ejemplo, la física experimental). [ 199 ]
Consecuencias
Cuando en la literatura se afirma erróneamente que ciertos efectos son relevantes, la falta de detección de este error mediante la replicación conducirá a la canonización de tales hechos falsos. [ 200 ]
Un estudio de 2021 reveló que los artículos publicados en revistas líderes de interés general, psicología y economía con hallazgos no replicables tienden a ser citados con mayor frecuencia que los artículos de investigación reproducibles, probablemente debido a que estos resultados son sorprendentes o interesantes. Esta tendencia no se ve afectada por la publicación de reproducciones fallidas, tras las cuales solo el 12 % de los artículos que citan la investigación original mencionan la replicación fallida. [ 201 ] [ 202 ] Además, los expertos pueden predecir qué estudios serán replicables, lo que llevó a los autores del estudio de 2021, Marta Serra-García y Uri Gneezy , a concluir que los expertos aplican estándares menos exigentes a los resultados interesantes al decidir si publicarlos. [ 202 ]
Conciencia y percepciones públicas
Se ha expresado preocupación dentro de la comunidad científica de que el público en general pueda considerar la ciencia menos creíble debido a las replicaciones fallidas. [ 203 ] La investigación que respalda esta preocupación es escasa, pero una encuesta representativa a nivel nacional en Alemania mostró que más del 75 % de los alemanes no han oído hablar de fallos de replicación en la ciencia. [ 204 ] El estudio también encontró que la mayoría de los alemanes tienen percepciones positivas de los esfuerzos de replicación: solo el 18 % piensa que la falta de replicabilidad demuestra que no se puede confiar en la ciencia, mientras que el 65 % piensa que la investigación de replicación demuestra que la ciencia aplica control de calidad, y el 80 % está de acuerdo en que los errores y las correcciones son parte de la ciencia. [ 204 ]
Respuesta en el ámbito académico
Con la crisis de replicación de la psicología acaparando la atención, la psicóloga de la Universidad de Princeton, Susan Fiske, generó controversia por hablar en contra de los críticos de la psicología por lo que ella llamó acoso y socavamiento de la ciencia. [ 205 ] [ 206 ] [ 207 ] [ 208 ] Llamó a estos "adversarios" no identificados con nombres como "terrorista metodológico" y "policía de datos autoproclamada", diciendo que las críticas a la psicología solo deberían expresarse en privado o contactando a las revistas. [ 205 ] El estadístico y politólogo de la Universidad de Columbia, Andrew Gelman, respondió a Fiske, diciendo que ella se había encontrado dispuesta a tolerar el "paradigma muerto" de estadísticas defectuosas y se había negado a retractarse de publicaciones incluso cuando se señalaban errores. [ 205 ] Añadió que su gestión como editora había sido pésima y que se descubrió que varios artículos publicados que ella editó se basaban en estadísticas extremadamente débiles; uno de los propios artículos publicados de Fiske tenía un error estadístico importante y conclusiones "imposibles". [ 205 ]
La revolución de la credibilidad
Algunos investigadores en psicología indican que la crisis de replicación sienta las bases para una «revolución de la credibilidad», donde los cambios en los estándares de evaluación de la ciencia psicológica podrían incluir un mayor énfasis en la transparencia y la apertura, el preregistro de proyectos de investigación y la replicación de investigaciones con estándares de evidencia más elevados para fortalecer las afirmaciones científicas. [ 209 ] Estos cambios podrían disminuir la productividad de los investigadores individuales, pero este efecto podría evitarse mediante el intercambio de datos y una mayor colaboración. [ 209 ]
Remedios
El enfoque en la crisis de replicación ha llevado a renovados esfuerzos en psicología para volver a probar hallazgos importantes. [ 40 ] [ 210 ] Una edición especial de 2013 de la revista Social Psychology se centró en los estudios de replicación. [ 12 ]
Se ha propuesto la estandarización, así como la transparencia (exigida) de los métodos estadísticos y experimentales utilizados. [ 211 ] Se considera crucial documentar cuidadosamente el diseño experimental para la replicabilidad de los experimentos, y diversas variables pueden no estar documentadas ni estandarizadas, como la dieta de los animales en los estudios con animales. [ 212 ]
Un artículo de 2016 de John Ioannidis profundizó en "Por qué la mayor parte de la investigación clínica no es útil". [ 213 ] Ioannidis describe lo que él considera algunos de los problemas y pide reformas, caracterizando ciertos puntos para que la investigación médica vuelva a ser útil; un ejemplo que da es la necesidad de que la medicina esté centrada en el paciente (por ejemplo, en la forma del Instituto de Investigación de Resultados Centrados en el Paciente ) en lugar de la práctica actual de atender principalmente "las necesidades de los médicos, investigadores o patrocinadores".
Reforma en la publicación científica
Metaciencia
La metaciencia es el uso de la metodología científica para estudiar la ciencia misma. Busca aumentar la calidad de la investigación científica y, al mismo tiempo, reducir el desperdicio. También se la conoce como «investigación sobre la investigación» y «la ciencia de la ciencia», ya que utiliza métodos de investigación para estudiar cómo se realiza la investigación y dónde se pueden introducir mejoras. La metaciencia se ocupa de todos los campos de la investigación y se la ha denominado «una visión panorámica de la ciencia». [ 214 ] En palabras de Ioannidis: «La ciencia es lo mejor que le ha sucedido a la humanidad... pero podemos mejorarla». [ 215 ]
Se siguen realizando metaanálisis para identificar las causas de la crisis y abordarlas. Entre los métodos para afrontarla se incluyen el preregistro de estudios científicos y ensayos clínicos , así como la creación de organizaciones como CONSORT y la Red EQUATOR , que emiten directrices sobre metodología e informes. Se mantienen los esfuerzos para reformar el sistema de incentivos académicos, mejorar el proceso de revisión por pares , reducir el uso indebido de las estadísticas , combatir los sesgos en la literatura científica y aumentar la calidad y la eficiencia generales del proceso científico.
Presentación de la metodología
Algunos autores han argumentado que la comunicación insuficiente de los métodos experimentales contribuye significativamente a la crisis de reproducibilidad y que una mejor descripción del diseño experimental y los análisis estadísticos mejoraría la situación. Estos autores suelen abogar por un cambio cultural profundo en la comunidad científica respecto a cómo se consideran las estadísticas y por una mayor presión por parte de las revistas científicas y los organismos de financiación. [ 216 ] Sin embargo, se han planteado preocupaciones sobre la posibilidad de que los estándares de transparencia y replicación se apliquen erróneamente tanto a estudios cualitativos como cuantitativos. [ 217 ]
Entre las revistas de negocios y administración que han introducido políticas editoriales sobre accesibilidad, replicación y transparencia de datos se incluyen el Strategic Management Journal , el Journal of International Business Studies y el Management and Organization Review . [ 93 ]
Revisión por pares sin tener en cuenta los resultados
En respuesta a las preocupaciones en psicología sobre el sesgo de publicación y la manipulación de datos , más de 140 revistas de psicología han adoptado la revisión por pares ciega a los resultados. En este enfoque, los estudios se aceptan no en función de sus hallazgos y una vez finalizados, sino antes de su realización y en función del rigor metodológico de sus diseños experimentales y las justificaciones teóricas de sus técnicas de análisis estadístico antes de la recopilación o el análisis de datos. [ 218 ] Un análisis inicial de este procedimiento estimó que el 61 % de los estudios ciegos a los resultados arrojaron resultados nulos , en contraste con un estimado del 5 % al 20 % en investigaciones anteriores. [ 108 ] Además, las colaboraciones a gran escala entre investigadores que trabajan en múltiples laboratorios en diferentes países y que regularmente ponen sus datos a disposición de otros investigadores para su evaluación se han vuelto mucho más comunes en psicología. [ 219 ]
Preinscripción de estudios
La publicación científica ha comenzado a utilizar informes de preinscripción para abordar la crisis de replicación. [ 220 ] [ 221 ] El formato de informe registrado requiere que los autores presenten una descripción de los métodos y análisis del estudio antes de la recopilación de datos. Una vez que el método y el plan de análisis son revisados por pares, la publicación de los hallazgos se garantiza provisionalmente, según si los autores siguen el protocolo propuesto. Uno de los objetivos de los informes registrados es evitar el sesgo de publicación hacia hallazgos significativos que pueden llevar a la implementación de prácticas de investigación cuestionables. Otro es fomentar la publicación de estudios con métodos rigurosos.
La revista Psychological Science ha fomentado el preregistro de estudios y la presentación de tamaños del efecto e intervalos de confianza. [ 222 ] El editor jefe también señaló que el equipo editorial solicitará la replicación de estudios con resultados sorprendentes de exámenes con muestras pequeñas antes de permitir la publicación de los manuscritos.
Metadatos y herramientas digitales para el seguimiento de réplicas
Se ha sugerido que se necesita "una forma sencilla de comprobar con qué frecuencia se han repetido los estudios y si se confirman o no los hallazgos originales". [ 201 ] Los revisores, la revista científica o los lectores podrían realizar categorizaciones y valoraciones de la reproducibilidad a nivel de estudio o resultados, así como añadir enlaces a confirmaciones de terceros y valorarlas, en combinación con nuevas plataformas o herramientas digitales.
Reforma estadística
Requeriendo valores p más pequeños
Muchas publicaciones requieren un valor p < 0,05 para afirmar la significación estadística . El artículo "Redefinir la significación estadística" [ 223 ] , firmado por un gran número de científicos y matemáticos, propone que en "campos donde el umbral para definir la significación estadística de nuevos descubrimientos es p < 0,05, proponemos un cambio a p < 0,005. Este simple paso mejoraría inmediatamente la reproducibilidad de la investigación científica en muchos campos". Su razonamiento es que "una de las principales causas de la falta de reproducibilidad es que los estándares estadísticos de evidencia para afirmar nuevos descubrimientos en muchos campos de la ciencia son simplemente demasiado bajos. Asociar hallazgos 'estadísticamente significativos' con p < 0,05 da como resultado una alta tasa de falsos positivos incluso en ausencia de otros problemas experimentales, de procedimiento y de presentación de informes". [ 223 ]
Esta propuesta fue posteriormente criticada por otro grupo numeroso, que argumentó que «redefinir» el umbral no solucionaría los problemas actuales, sino que generaría otros nuevos, y que, en última instancia, todos los umbrales debían justificarse caso por caso en lugar de seguir convenciones generales. [ 224 ] Un estudio de seguimiento de 2022 examinó el impacto práctico de estas recomendaciones contrapuestas. A pesar de las altas tasas de citación de ambas propuestas, los investigadores encontraron una implementación limitada, tanto del umbral p < 0,005 como del enfoque de justificación caso por caso, en la práctica. Esto reveló lo que los autores denominaron un «círculo vicioso», en el que los científicos rechazan las recomendaciones porque no son práctica estándar, mientras que las recomendaciones no logran convertirse en práctica estándar porque pocos científicos las adoptan. [ 225 ]
Cómo abordar la mala interpretación de los valores p
Aunque los estadísticos coinciden en que el uso de " p < 0,05" como estándar de significación proporciona una evidencia más débil de lo que generalmente se reconoce, no existe consenso sobre qué se debe hacer al respecto. Algunos han defendido que los métodos bayesianos deberían reemplazar los valores p . Esto no se ha generalizado, en parte porque es complejo y en parte porque muchos usuarios desconfían de la especificación de distribuciones previas en ausencia de datos concretos. El farmacólogo David Colquhoun sugirió una versión simplificada del argumento bayesiano, basada en la prueba de una hipótesis nula puntual . [ 226 ] [ 227 ] Los problemas lógicos de la inferencia inductiva se discutieron en "El problema con los valores p" (2016). [ 228 ]
Los riesgos de confiar en los valores p surgen en parte porque incluso una observación de p = 0,001 no es necesariamente una evidencia sólida contra la hipótesis nula. [ 227 ] A pesar de que la razón de verosimilitud a favor de la hipótesis alternativa sobre la nula es cercana a 100, si la hipótesis fuera inverosímil, con una probabilidad previa de un efecto real de 0,1, incluso la observación de p = 0,001 tendría un riesgo de falso positivo del 8 por ciento. Aun así, no alcanzaría el nivel del 5 por ciento.
Se recomendó que no se utilizaran los términos "significativo" y "no significativo". [ 227 ] Los valores p y los intervalos de confianza aún deben especificarse, pero deben ir acompañados de una indicación del riesgo de falso positivo. Se sugirió que la mejor manera de hacerlo es calcular la probabilidad previa que sería necesario creer para lograr un riesgo de falso positivo de cierto nivel, como el 5%. Los cálculos pueden hacerse con varios programas informáticos. [ 227 ] [ 229 ] Este enfoque bayesiano inverso, que el físico Robert Matthews sugirió en 2001, [ 230 ] es una forma de evitar el problema de que la probabilidad previa rara vez se conoce.
Fomentar tamaños de muestra más grandes
Para mejorar la calidad de las replicaciones, a menudo se necesitan tamaños de muestra mayores que los utilizados en el estudio original. [ 231 ] Se necesitan tamaños de muestra mayores porque las estimaciones de los tamaños del efecto en los trabajos publicados a menudo se exageran debido al sesgo de publicación y a la gran variabilidad de muestreo asociada con tamaños de muestra pequeños en un estudio original. [ 232 ] [ 233 ] [ 234 ] Además, el uso de umbrales de significancia generalmente conduce a efectos inflados, porque particularmente con tamaños de muestra pequeños, solo los efectos más grandes se volverán significativos. [ 192 ]
Validación cruzada
Un problema estadístico común es el sobreajuste , es decir, cuando los investigadores ajustan un modelo de regresión a un gran número de variables pero a un número reducido de puntos de datos. Por ejemplo, un estudio típico de resonancia magnética funcional (fMRI) sobre emoción, personalidad y cognición social tiene menos de 100 sujetos, pero cada sujeto tiene 10 000 vóxeles. El estudio ajustaría un modelo de regresión lineal disperso que utiliza los vóxeles para predecir una variable de interés, como el estrés autoinformado. Sin embargo, el estudio informaría sobre el valor p del modelo en los mismos datos a los que se ajustó. El enfoque estándar en estadística, donde los datos se dividen en un conjunto de entrenamiento y otro de validación , se resiste porque la adquisición de sujetos de prueba es costosa. [ 181 ] [ 235 ]
Una posible solución es la validación cruzada , que permite la validación del modelo al tiempo que permite utilizar todo el conjunto de datos para el ajuste del modelo. [ 236 ]
Esfuerzos de replicación
Fondos
En julio de 2016, la Organización Neerlandesa para la Investigación Científica destinó 3 millones de euros a estudios de replicación. La financiación se destina a la replicación basada en el reanálisis de datos existentes y a la replicación mediante la recopilación y el análisis de nuevos datos. La financiación está disponible en las áreas de ciencias sociales, investigación en salud e innovación sanitaria. [ 237 ]
En 2013, la Fundación Laura y John Arnold financió el lanzamiento del Centro para la Ciencia Abierta con una subvención de 5,25 millones de dólares. Para 2017, proporcionó 10 millones de dólares adicionales en financiación. [ 238 ] También financió el lanzamiento del Centro de Innovación en Metainvestigación en Stanford, en la Universidad de Stanford, dirigido por Ioannidis y el científico médico Steven Goodman para estudiar formas de mejorar la investigación científica. [ 238 ] Asimismo, proporcionó financiación para la iniciativa AllTrials , liderada en parte por el científico médico Ben Goldacre . [ 238 ]
Énfasis en la educación postsecundaria
Basándose en cursos de métodos experimentales del MIT, Stanford y la Universidad de Washington , se ha sugerido que los cursos de metodología en psicología y otros campos deberían hacer hincapié en los intentos de replicación en lugar de los estudios originales. [ 239 ] [ 240 ] [ 241 ] Este enfoque ayudaría a los estudiantes a aprender metodología científica y proporcionaría numerosas replicaciones independientes de hallazgos científicos significativos que pondrían a prueba la replicabilidad de dichos hallazgos. Algunos han recomendado que se exija a los estudiantes de posgrado publicar un intento de replicación de alta calidad sobre un tema relacionado con su investigación doctoral antes de graduarse. [ 242 ]
Base de datos de replicación
Ha habido preocupación por el aumento de los intentos de replicación. [ 243 ] [ 244 ] Como resultado, esto puede conducir a un desperdicio de recursos en la investigación. [ 245 ] A su vez, esto ha generado la necesidad de realizar un seguimiento sistemático de los intentos de replicación. Como resultado, se han creado varias bases de datos (por ejemplo, [ 246 ] [ 247 ] ). Estas bases de datos han creado una base de datos de replicación que incluye la psicología, entre otras disciplinas, para promover la investigación basada en la teoría y optimizar el uso de los recursos académicos e institucionales, al tiempo que se fomenta la confianza en la ciencia. [ 246 ]
Tesis de último año
Algunas instituciones exigen a los estudiantes de pregrado que presenten una tesis de fin de carrera que consista en un trabajo de investigación original. Daniel Quintana, psicólogo de la Universidad de Oslo en Noruega, ha recomendado que se anime a los estudiantes a realizar estudios de replicación en sus proyectos de tesis, así como a recibir formación sobre ciencia abierta . [ 248 ]
Semiautomatizado

Los investigadores demostraron una forma de prueba semiautomatizada para la reproducibilidad: se extrajeron declaraciones sobre resultados experimentales de artículos de investigación sobre cáncer de expresión genética no semánticos ( hasta 2022) y posteriormente se reprodujeron mediante el robot científico " Eve ". [ 249 ] [ 250 ] Los problemas de este enfoque incluyen que puede no ser factible para muchas áreas de investigación y que puede que no se extraigan suficientes datos experimentales de algunos o muchos artículos, incluso si están disponibles.
Con la participación de autores originales
El psicólogo Daniel Kahneman argumentó que, en psicología, los autores originales deberían participar en el esfuerzo de replicación porque los métodos publicados suelen ser demasiado vagos. [ 251 ] [ 252 ] Otros, como el psicólogo Andrew Wilson, discrepan, argumentando que los autores originales deberían escribir los métodos en detalle. [ 251 ] Una investigación sobre las tasas de replicación en psicología en 2012 indicó tasas de éxito de replicación más altas en los estudios de replicación cuando había coincidencia de autores con los autores originales de un estudio [ 253 ] (tasas de éxito de replicación del 91,7 % en estudios con coincidencia de autores en comparación con tasas de éxito de replicación del 64,6 % sin coincidencia de autores).
Ciencia de gran equipo
La crisis de replicación ha llevado a la formación y el desarrollo de diversas comunidades colaborativas a gran escala para aunar sus recursos y abordar una misma pregunta en diferentes culturas, países y disciplinas. [ 254 ] El enfoque está en la replicación, para asegurar que el efecto se generalice más allá de una cultura específica e investigar si el efecto es replicable y genuino. [ 255 ] Esto permite revisiones internas interdisciplinarias, múltiples perspectivas, protocolos uniformes en todos los laboratorios y la captación de muestras más grandes y diversas. [ 255 ] Los investigadores pueden colaborar coordinando la recopilación de datos o financiando la recopilación de datos por parte de investigadores que tal vez no tengan acceso a fondos, lo que permite tamaños de muestra mayores y aumenta la solidez de las conclusiones.
Cambios más amplios en el enfoque científico
Enfatizar la triangulación, no solo la replicación.
El psicólogo Marcus R. Munafò y el epidemiólogo George Davey Smith argumentan, en un artículo publicado por Nature , que la investigación debería hacer hincapié en la triangulación , no solo en la replicación, para protegerse contra ideas erróneas. Afirman que,
La replicación por sí sola solo nos llevará hasta cierto punto (y) podría incluso empeorar las cosas ... [La triangulación] es el uso estratégico de múltiples enfoques para abordar una misma pregunta. Cada enfoque tiene sus propias suposiciones, fortalezas y debilidades no relacionadas. Los resultados que coinciden entre diferentes metodologías tienen menos probabilidades de ser artefactos . ... Quizás una de las razones por las que la replicación ha captado tanto interés es la idea, a menudo repetida, de que la falsación está en el corazón de la empresa científica. Esta idea fue popularizada por la máxima de Karl Popper en la década de 1950 de que las teorías nunca pueden probarse, solo falsificarse. Sin embargo, un énfasis excesivo en la repetición de experimentos podría proporcionar una sensación infundada de certeza sobre los hallazgos que se basan en un solo enfoque. ... Los filósofos de la ciencia han evolucionado desde Popper. Mejores descripciones de cómo trabajan realmente los científicos incluyen lo que el epistemólogo Peter Lipton llamó en 1991 " inferencia a la mejor explicación ". [ 256 ]
paradigma de sistemas complejos
El modelo científico y estadístico dominante de causalidad es el modelo lineal. [ 257 ] El modelo lineal supone que las variables mentales son propiedades estables e independientes entre sí. En otras palabras, no se espera que estas variables se influyan mutuamente. En cambio, el modelo supone que las variables tendrán un efecto lineal e independiente sobre los resultados observables. [ 257 ]
Los científicos sociales Sebastian Wallot y Damian Kelty-Stephen sostienen que el modelo lineal no siempre es apropiado. [ 257 ] Una alternativa es el modelo de sistema complejo, que asume que las variables mentales son interdependientes. No se asume que estas variables sean estables, sino que interactuarán y se adaptarán a cada contexto específico. [ 257 ] Argumentan que el modelo de sistema complejo suele ser más apropiado en psicología, y que el uso del modelo lineal cuando el modelo de sistema complejo es más apropiado dará lugar a replicaciones fallidas. [ 257 ]
...la psicología puede estar esperando replicaciones en las mismas mediciones y bajo las mismas condiciones donde un creciente conjunto de evidencia psicológica desalienta explícitamente la predicción de replicación. Los fallos de replicación pueden estar claramente incorporados al fallo potencialmente incompleto, pero ampliamente generalizado, del comportamiento humano para ajustarse al estándar de independencia[ce] ... [ 257 ]
La replicación debería intentar revisar las teorías.
La replicación es fundamental para el progreso científico, ya que confirma los hallazgos originales. Sin embargo, la replicación por sí sola no basta para resolver la crisis de replicación. Los esfuerzos de replicación no solo deben buscar apoyar o cuestionar los hallazgos originales, sino también reemplazarlos con teorías revisadas y más sólidas, con mayor poder explicativo. Este enfoque implica, por lo tanto, depurar las teorías existentes, comparar todas las teorías alternativas y hacer que los esfuerzos de replicación sean más generativos y participen en la construcción de teorías. [ 258 ] [ 259 ] Sin embargo, la replicación por sí sola no es suficiente; es importante evaluar hasta qué punto los resultados se generalizan a través de contextos geográficos, históricos y sociales, lo cual es importante para varios campos científicos, especialmente para profesionales y responsables políticos, para realizar análisis que guíen decisiones estratégicas importantes. Los hallazgos reproducibles y replicables fueron el mejor predictor de generalización más allá de los contextos históricos y geográficos, lo que indica que, para las ciencias sociales, los resultados de un período de tiempo y lugar determinados pueden conducir significativamente a lo que está universalmente presente en los individuos. [ 260 ]
Ciencia abierta

Los datos abiertos, el software de código abierto y el hardware de código abierto son fundamentales para permitir la reproducibilidad en el sentido de la validación del análisis de datos original. El uso de software propietario, la falta de publicación del software de análisis y la falta de datos abiertos impiden la replicación de estudios. A menos que el software utilizado en la investigación sea de código abierto, reproducir resultados con diferentes configuraciones de software y hardware es imposible. [ 261 ] El CERN cuenta con proyectos de Datos Abiertos y Preservación de Análisis del CERN para almacenar datos, toda la información relevante y todo el software y las herramientas necesarias para preservar un análisis en los grandes experimentos del LHC . Además de todo el software y los datos, los activos de análisis preservados incluyen metadatos que permiten comprender el flujo de trabajo del análisis, el software relacionado, las incertidumbres sistemáticas, los procedimientos estadísticos y formas significativas de buscar el análisis, así como referencias a publicaciones y a material de respaldo. [ 262 ] El software del CERN es de código abierto y está disponible para su uso fuera de la física de partículas , y se proporciona orientación a otros campos sobre los enfoques y estrategias generales utilizados para la ciencia abierta en la física de partículas contemporánea. [ 263 ]
Los repositorios en línea donde se pueden almacenar y evaluar datos, protocolos y hallazgos por parte del público buscan mejorar la integridad y la reproducibilidad de la investigación. Ejemplos de estos repositorios incluyen Open Science Framework , Registry of Research Data Repositories y Psychfiledrawer.org. Sitios como Open Science Framework ofrecen insignias por usar prácticas de ciencia abierta para incentivar a los científicos. Sin embargo, ha habido preocupación de que quienes tienen más probabilidades de proporcionar sus datos y código para análisis sean los investigadores más sofisticados. [ 264 ] Ioannidis sugirió que "puede surgir la paradoja de que los investigadores más meticulosos, sofisticados, expertos en métodos y cuidadosos pueden volverse más susceptibles a las críticas y ataques a la reputación por parte de reanalizadores que buscan errores, sin importar cuán insignificantes sean". [ 264 ]
Véase también
- falacia de la tasa base
- Teoría del cisne negro
- La correlación no implica causalidad.
- dragado de datos
- Efecto de disminución
- Estadísticas de estimación
- Análisis exploratorio de datos
- Negligencia en la extensión
- Falsabilidad
- Ciencia inválida
- Mal uso de las estadísticas
- Naturalismo
- Sesgo del observador
- valor p
- Problema de inducción
- Sesgo de muestreo
- sesgo de selección
- Pruebas de hipótesis estadísticas
- Uniformismo
Notas
- ↑ En el contexto de las pruebas de significación de hipótesis nula, los resultados que no son estadísticamente significativos
- ↑ Según el Diccionario de Psicología de la APA , el sesgo de confirmación es "la tendencia a reunir evidencia que confirme las expectativas preexistentes, generalmente enfatizando o buscando evidencia que las respalde, mientras se descarta o no se busca evidencia contradictoria". [ 123 ]
- ↑ El dragado de datos, también conocido como p -hacking o p -fishing , es el uso indebido de datos, a través de una miríada de técnicas, para encontrar apoyo a hipótesis para las que los datos son inadecuados. [ 138 ]
- ↑ La presentación selectiva de resultados también se conoce como publicación parcial . La presentación de resultados ofrece la oportunidad de revelar todos los grados de libertad utilizados o explotados por el investigador. La presentación selectiva de resultados implica la omisión de detalles o decisiones relevantes, como algunas variables independientes y dependientes, datos faltantes, exclusiones de datos y exclusiones de valores atípicos. [ 136 ]
- ↑ HARKing, también conocido como narración post hoc , es cuando un análisis exploratorio se plantea como un análisis confirmatorio. Implica cambiar una hipótesis después de que se ha realizado la investigación, de modo que la nueva hipótesis pueda ser confirmada por los resultados del experimento. [ 136 ]
- ↑ Los autores dan un ejemplo en el que, suponiendo que la correlación media real que refleja un efecto es 0,2 y la desviación estándar de la distribución de efectos también es 0,2, un estudio de replicación tendrá una probabilidad del 62 % de encontrar un efecto real de medio a grande (r > 0,3) o un efecto real insignificante (r < 0,1).
- ↑ 0,412 frente a 0,389 en unidades de diferencias medias estandarizadas (DME).
- ↑ La principal variable dependiente utilizada fue la calificación binaria subjetiva (es decir, replicado/no replicado) empleada en el estudio original de OSC. Los autores también midieron correlaciones con otras medidas de reproducibilidad (por ejemplo, intervalos de confianza) y encontraron correlaciones casi iguales entre la sensibilidad al contexto y el éxito de la replicación.
- ↑ El efecto independiente de la sensibilidad al contexto pudo observarse tanto en una regresión logística múltiple como en un modelo de regresión jerárquica. En este último caso, la sensibilidad al contexto se incluyó en el paso 2 de la jerarquía y el cambio en el coeficiente de determinación múltiple resultó ser significativo.
- ↑ Siguiendo el argumento de Bird, este porcentaje se obtiene calculando la Probabilidad de Informe Falso Positivo (FPRP) de la siguiente manera.
- FPRP = Número de falsos positivos / Número total de positivos
- Número de falsos positivos = Probabilidad de obtener un falso positivo x Número de pruebas negativas
- Número de verdaderos positivos = Probabilidad de obtener un verdadero positivo x Número de pruebas positivas
- Número de pruebas = 1000
- Proporción de hipótesis verdaderas p = 0,10
- Probabilidad de obtener un falso positivo a = 0,05
- Probabilidad de obtener un verdadero positivo 1 – B = 0,8
Referencias
- 1 2 3 Ioannidis JP (agosto de 2005). "Por qué la mayoría de los hallazgos de investigación publicados son falsos" . PLOS Medicine . 2 (8) e124. doi : 10.1371/journal.pmed.0020124 . PMC 1182327. PMID 16060722 .
- ↑ John S (8 de diciembre de 2017). Método científico . Nueva York, NY: Routledge. doi : 10.4324/9781315100708 . ISBN 978-1-315-10070-8. S2CID 201781341 .
- ↑ Lehrer J (13 de diciembre de 2010). "La verdad se desvanece" . The New Yorker . Recuperado el 30 de enero de 2020 .
- ↑ Marcus G (1 de mayo de 2013). "La crisis en la psicología social que no existe" . The New Yorker . Recuperado el 30 de enero de 2020 .
- 1 2 3 Baker M (mayo de 2016). "1500 científicos revelan los secretos de la reproducibilidad" . Nature (Artículo de noticias). 533 ( 7604 ). Springer Nature : 452–454 . Bibcode : 2016Natur.533..452B . doi : 10.1038/533452a . PMID 27225100. S2CID 4460617 . (Errata: )
- ↑ Pashler H, Harris CR (noviembre de 2012). " ¿Se ha exagerado la crisis de replicabilidad? Se examinan tres argumentos". Perspectives on Psychological Science . 7 (6): 531– 536. doi : 10.1177/1745691612463401 . PMID 26168109. S2CID 1342421 .
- 1 2 Fidler F , Wilcox J (2018). "Reproducibilidad de los resultados científicos" . La enciclopedia de filosofía de Stanford . Laboratorio de investigación en metafísica, Universidad de Stanford . Recuperado el 19 de mayo de 2019 .
- ↑ Moonesinghe R, Khoury MJ, Janssens AC (febrero de 2007). "La mayoría de los hallazgos de investigación publicados son falsos, pero una pequeña replicación puede ser muy útil" . PLOS Medicine . 4 (2) e28. doi : 10.1371/journal.pmed.0040028 . PMC 1808082. PMID 17326704 .
- ↑ Simons DJ (enero de 2014). "El valor de la replicación directa". Perspectives on Psychological Science . 9 (1): 76– 80. doi : 10.1177/1745691613514755 . PMID 26173243. S2CID 1149441 .
- 1 2 3 4 Schmidt S (2009). "¿Realmente deberíamos hacerlo de nuevo? El poderoso concepto de replicación se descuida en las ciencias sociales". Revista de Psicología General . 13 (2). Publicaciones SAGE: 90– 100. doi : 10.1037/a0015108 . ISSN 1089-2680 . S2CID 143855611 .
- 1 2 3 Colaboración de Ciencia Abierta (agosto de 2015). " PSICOLOGÍA. Estimación de la reproducibilidad de la ciencia psicológica" (PDF) . Science . 349 (6251) aac4716. doi : 10.1126/science.aac4716 . hdl : 10722/230596 . PMID 26315443. S2CID 218065162 .
- 1 2 3 Duvendack M, Palmer-Jones R, Reed RW (mayo de 2017). "¿Qué se entiende por "replicación" y por qué encuentra resistencia en economía?" . American Economic Review . 107 (5): 46– 51. doi : 10.1257/aer.p20171031 . ISSN 0002-8282 .
- 1 2 3 4 5 6 Shrout PE, Rodgers JL (enero de 2018). "Psicología, ciencia y construcción del conocimiento: ampliando las perspectivas desde la crisis de replicación". Annual Review of Psychology . 69 (1). Annual Reviews: 487– 510. doi : 10.1146/annurev-psych-122216-011845 . PMID 29300688. S2CID 19593610 .
- 1 2 3 4 5 Stanley TD, Carter EC, Doucouliagos H (diciembre de 2018). "Lo que revelan los metaanálisis sobre la replicabilidad de la investigación psicológica" . Psychological Bulletin . 144 (12): 1325– 1346. doi : 10.1037/bul0000169 . PMID 30321017. S2CID 51951232 .
- ↑ Meyer C, Chabris C (31 de julio de 2014). "Por qué importa la pelea de los psicólogos por la comida" . Slate .
- ↑ Aschwanden C (19 de agosto de 2015). "La ciencia no está rota" . FiveThirtyEight . Archivado del original el 19 de agosto de 2015. Consultado el 30 de enero de 2020 .
- ↑ Aschwanden C (27 de agosto de 2015). "La psicología está empezando a abordar su problema de replicación" . FiveThirtyEight . Archivado del original el 14 de diciembre de 2017. Consultado el 30 de enero de 2020 .
- ↑ Etchells P (28 de mayo de 2014). "El impulso de replicación de la psicología: no se trata de ti" . The Guardian .
- ^ Wagenmakers EJ, Wetzels R, Borsboom D, van der Maas HL, Kievit RA (noviembre de 2012). "Una agenda para la investigación puramente confirmatoria". Perspectivas de la ciencia psicológica . 7 (6): 632– 638. doi : 10.1177/1745691612463078 . PMID 26168122 . S2CID 5096417 .
- ↑ Ioannidis JP (noviembre de 2012). "Por qué la ciencia no necesariamente se autocorrige". Perspectives on Psychological Science . 7 (6): 645– 654. doi : 10.1177/1745691612464056 . PMID 26168125. S2CID 11798785 .
- ↑ Pashler H, Harris CR (noviembre de 2012). " ¿Se ha exagerado la crisis de replicabilidad? Se examinan tres argumentos". Perspectives on Psychological Science . 7 (6): 531– 536. doi : 10.1177/1745691612463401 . PMID 26168109. S2CID 1342421 .
- 1 2 Meehl PE (1967). "Prueba de teorías en psicología y física: una paradoja metodológica". Filosofía de la ciencia . 34 (2): 103– 115. doi : 10.1086/288135 . ISSN 0031-8248 . JSTOR 186099 . S2CID 96422880 .
- ↑ Kelley K, Preacher KJ (junio de 2012). "Sobre el tamaño del efecto". Métodos Psicológicos . 17 (2): 137– 152. doi : 10.1037/a0028086 . PMID 22545595 .
- ↑ Simonsohn U, Nelson LD, Simmons JP (noviembre de 2014). "Curva p y tamaño del efecto: corrección del sesgo de publicación utilizando solo resultados significativos". Perspectives on Psychological Science . 9 (6): 666– 681. doi : 10.1177/1745691614553988 . PMID 26186117 .
- ↑ Simonsohn U, Nelson LD, Simmons JP (abril de 2014). "Curva P: una clave para el cajón de archivos". Journal of Experimental Psychology: General . 143 (2): 534– 547. doi : 10.1037/a0033242 . PMID 23855496 .
- 1 2 3 Romero F (noviembre de 2019). "Filosofía de la ciencia y la crisis de replicabilidad" . Philosophy Compass . 14 (11) e12633. doi : 10.1111/phc3.12633 . ISSN 1747-9991 . S2CID 202261836 .
- ↑ Doyen S, Klein O, Pichon CL, Cleeremans A (18 de enero de 2012). Lauwereyns J (ed.). "Preparación conductual: todo está en la mente, ¿pero en la mente de quién?" . PLOS ONE . 7 (1) e29081. Bibcode : 2012PLoSO...729081D . doi : 10.1371/journal.pone.0029081 . PMC 3261136. PMID 22279526 .
- ↑ Bargh JA, Chen M, Burrows L (agosto de 1996). "Automaticidad del comportamiento social: efectos directos del constructo de rasgos y la activación de estereotipos en la acción". Journal of Personality and Social Psychology . 71 (2): 230– 244. Bibcode : 1996JPSP...71..230B . doi : 10.1037/0022-3514.71.2.230 . PMID 8765481. S2CID 6654763 .
- ↑ Yong E (10 de marzo de 2012). "Una replicación fallida provoca un ataque personal mordaz de un profesor de psicología" . National Geographic . Archivado del original el 25 de febrero de 2021. Consultado el 4 de julio de 2023 .
- ↑ Pashler H, Coburn N, Harris CR (29 de agosto de 2012). "¿Activación de la distancia social? Fracaso en la replicación de efectos en juicios sociales y alimentarios" . PLOS ONE . 7 (8) e42510. Bibcode : 2012PLoSO...742510P . doi : 10.1371/journal.pone.0042510 . PMC 3430642. PMID 22952597 .
- ↑ Harris CR, Coburn N, Rohrer D, Pashler H (16 de agosto de 2013). "Dos fracasos en replicar los efectos de la activación de objetivos de alto rendimiento" . PLOS ONE . 8 (8) e72467. Bibcode : 2013PLoSO...872467H . doi : 10.1371/journal.pone.0072467 . PMC 3745413. PMID 23977304 .
- ↑ Shanks DR, Newell BR, Lee EH, Balakrishnan D, Ekelund L, Cenac Z, et al. (24 de abril de 2013). " Preparando el comportamiento inteligente: un fenómeno esquivo" . PLOS ONE . 8 (4) e56515. Bibcode : 2013PLoSO...856515S . doi : 10.1371/journal.pone.0056515 . PMC 3634790. PMID 23637732 .
- ↑ Klein RA, Ratliff KA, Vianello M, Adams RB, Bahník Š, Bernstein MJ, et al. (mayo de 2014). "Investigando la variación en la replicabilidad" . Psicología social . 45 (3): 142– 152. doi : 10.1027/1864-9335/a000178 . hdl : 2066/131506 . ISSN 1864-9335 .
- ↑ Bem DJ (marzo de 2011). "Sintiendo el futuro: evidencia experimental de influencias retroactivas anómalas en la cognición y el afecto". Journal of Personality and Social Psychology . 100 (3): 407– 425. doi : 10.1037/a0021524 . PMID 21280961. S2CID 1961013 .
- ↑ Wagenmakers EJ, Wetzels R, Borsboom D, van der Maas HL (marzo de 2011). "Por qué los psicólogos deben cambiar la forma en que analizan sus datos: el caso de la psi: comentario sobre Bem (2011)". Journal of Personality and Social Psychology . 100 (3): 426– 432. doi : 10.1037/a0022790 . PMID 21280965 .
- ↑ Galak J, LeBoeuf RA, Nelson LD, Simmons JP (diciembre de 2012). "Corrigiendo el pasado: fallos en la replicación de ψ". Journal of Personality and Social Psychology . 103 (6): 933– 948. doi : 10.1037/a0029709 . PMID 22924750 .
- 1 2 Begley CG, Ellis LM (marzo de 2012). "Desarrollo de fármacos: elevar los estándares para la investigación preclínica del cáncer" . Nature ( Artículo de comentario). 483 (7391): 531– 533. Bibcode : 2012Natur.483..531B . doi : 10.1038/483531a . PMID 22460880. S2CID 4326966 . (Errata: doi : 10.1038/485041e )
- ↑ Ioannidis JP (septiembre de 2008). "Por qué la mayoría de las asociaciones verdaderas descubiertas están infladas" . Epidemiología . 19 (5): 640– 648. doi : 10.1097/EDE.0b013e31818131e7 . PMID 18633328. S2CID 15440816 .
- 1 2 3 4 5 6 John LK, Loewenstein G , Prelec D (mayo de 2012). "Medición de la prevalencia de prácticas de investigación cuestionables con incentivos para decir la verdad". Psychological Science . 23 (5): 524– 532. doi : 10.1177/0956797611430953 . PMID 22508865. S2CID 8400625 .
- 1 2 3 4 5 Simmons JP, Nelson LD, Simonsohn U (noviembre de 2011). "Psicología de falsos positivos: la flexibilidad no revelada en la recopilación y el análisis de datos permite presentar cualquier cosa como significativa". Psychological Science . 22 (11): 1359– 1366. doi : 10.1177/0956797611417632 . PMID 22006061. S2CID 13802986 .
- ↑ Pashler H, Wagenmakers EJ (noviembre de 2012). "Introducción de los editores a la sección especial sobre replicabilidad en la ciencia psicológica: ¿una crisis de confianza?". Perspectives on Psychological Science . 7 (6): 528– 530. doi : 10.1177/1745691612465253 . PMID 26168108. S2CID 26361121 .
- ↑ Ahlgren A (abril de 1969). "Una propuesta modesta para fomentar la replicación" . American Psychologist . 24 (4): 471. doi : 10.1037/h0037798 . ISSN 1935-990X .
- ↑ Smith NC (octubre de 1970). "Estudios de replicación: un aspecto descuidado de la investigación psicológica" . American Psychologist . 25 (10): 970– 975. doi : 10.1037/h0029774 . ISSN 1935-990X .
- ↑ Neuliep JW, Crandall R (1993). "Sesgo del revisor contra la investigación de replicación" . Journal of Social Behavior and Personality . 8 (6): 21– 29. ProQuest 1292304227 .
- ↑ Neuliep JW, Crandall R (1990). "Sesgo editorial contra la investigación de replicación" . Journal of Social Behavior and Personality . 5 (4): 85– 90. ProQuest 1292299467 .
- ↑ Lewis-Kraus G (30 de septiembre de 2023). "Estudiaron la deshonestidad. ¿Fue su trabajo una mentira?" . The New Yorker . ISSN 0028-792X . Consultado el 1 de octubre de 2023 .
- ↑ Subbaraman N (24 de septiembre de 2023). "El grupo de desenmascaradores que desenmascaran a los malos científicos" . Wall Street Journal . Consultado el 8 de octubre de 2023 .
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ Simonsohn U, Nelson LD, Simmons JP (2014). "Curva P: una clave para el cajón de archivos" . Journal of Experimental Psychology: General . 143 (2): 534– 547. doi : 10.1037/a0033242 . PMID 23855496 .
- 1 2 Spellman BA (noviembre de 2015). "Una breve historia futura (personal) de la Revolución 2.0" . Perspectives on Psychological Science . 10 (6): 886– 899. doi : 10.1177/1745691615609918 . PMID 26581743. S2CID 206778431 .
- ↑ Spellman BA (2012). "Introducción a la sección especial sobre replicabilidad en la investigación psicológica: por qué, cuándo y cómo". Perspectives on Psychological Science . 7 (6): 537– 541. doi : 10.1177/1745691612465253 . PMID 26168108 .
- 1 2 Greenwald AG, ed. (enero de 1976). "Un editorial" . Journal of Personality and Social Psychology . 33 (1): 1– 7. doi : 10.1037/h0078635 . ISSN 1939-1315 .
- ↑ Sterling TD (1959). "Decisiones de publicación y sus posibles efectos en las inferencias extraídas de pruebas de significancia, o viceversa". Journal of the American Statistical Association . 54 (285): 30– 34. doi : 10.2307/2282137 . ISSN 0162-1459 . JSTOR 2282137 .
- ↑ Mills JL (octubre de 1993). "Tortura de datos". The New England Journal of Medicine . 329 (16): 1196– 1199. doi : 10.1056/NEJM199310143291613 . PMID 8166792 .
- 1 2 Rosenthal R (mayo de 1979). "El problema del cajón de archivos y la tolerancia a los resultados nulos" . Psychological Bulletin . 86 (3): 638– 641. doi : 10.1037/0033-2909.86.3.638 . ISSN 1939-1455 . S2CID 36070395 .
- 1 2 Cohen J (septiembre de 1962). "El poder estadístico de la investigación en psicología social anormal: una revisión". Journal of Abnormal and Social Psychology . 65 : 145–153 . doi : 10.1037/h0045186 . PMID 13880271 .
- ↑ Sedlmeier P, Gigerenzer G (marzo de 1989). "¿Los estudios de potencia estadística tienen un efecto en la potencia de los estudios?" . Psychological Bulletin . 105 (2): 309– 316. doi : 10.1037/0033-2909.105.2.309 . hdl : 21.11116/0000-0000-B883-C . ISSN 1939-1455 .
- ↑ Gelman A (21 de septiembre de 2016). "Lo que ha sucedido aquí abajo es que los vientos han cambiado" . Modelado estadístico, inferencia causal y ciencias sociales .
- ↑ Yong E (3 de octubre de 2012). "Premio Nobel desafía a los psicólogos a mejorar su práctica" . Nature . doi : 10.1038/nature.2012.11535 . ISSN 1476-4687 .
- ↑ Vankov I, Bowers J, Munafò MR (mayo de 2014). "Sobre la persistencia del bajo poder en la ciencia psicológica" . Quarterly Journal of Experimental Psychology . 67 (5): 1037– 1040. doi : 10.1080/17470218.2014.885986 . PMC 4961230. PMID 24528377 .
- 1 2 Smaldino PE, McElreath R (septiembre de 2016). "La selección natural de la mala ciencia" . Royal Society Open Science . 3 (9) 160384. arXiv : 1605.09511 . Bibcode : 2016RSOS....360384S . doi : 10.1098 / rsos.160384 . PMC 5043322. PMID 27703703 .
- ↑ Achenbach J. "No, el problema de la reproducibilidad de la ciencia no se limita a la psicología" . The Washington Post . Consultado el 10 de septiembre de 2015 .
- ↑ Wiggins BJ, Christopherson C (2019). "La crisis de replicación en psicología: una visión general para la psicología teórica y filosófica" . Journal of Theoretical and Philosophical Psychology . 39 (4): 202– 217. doi : 10.1037/teo0000137 . ISSN 2151-3341 . S2CID 210567289 .
- ↑ Hagger MS, Chatzisarantis NL, Alberts H, Anggono CO, Batailler C, Birt AR, et al. (julio de 2016). "Una replicación preregistrada en múltiples laboratorios del efecto de agotamiento del ego" . Perspectives on Psychological Science . 11 (4): 546– 573. doi : 10.1177/1745691616652873 . hdl : 20.500.11937/16871 . PMID 27474142 .
- ↑ Bartlett T (30 de enero de 2013). "El poder de la sugestión" . The Chronicle of Higher Education .
- ↑ Dominus S (18 de octubre de 2017). "Cuando la revolución llegó para Amy Cuddy" . The New York Times . ISSN 0362-4331 . Consultado el 19 de octubre de 2017 .
- ↑ Duncan LE, Keller MC (octubre de 2011). "Una revisión crítica de los primeros 10 años de investigación sobre la interacción gen-ambiente candidata en psiquiatría" . The American Journal of Psychiatry . 168 (10): 1041– 1049. doi : 10.1176/appi.ajp.2011.11020191 . PMC 3222234. PMID 21890791 .
- ↑ Leichsenring F, Abbass A , Hilsenroth MJ, Leweke F, Luyten P, Keefe JR, et al. (abril de 2017). " Sesgos en la investigación: factores de riesgo de no replicabilidad en la investigación en psicoterapia y farmacoterapia" . Psychological Medicine . 47 (6): 1000–1011 . doi : 10.1017/S003329171600324X . PMID 27955715. S2CID 1872762 .
- ↑ Hengartner MP (28 de febrero de 2018). "Concientización sobre la crisis de replicación en psicología clínica al centrarse en las inconsistencias en la investigación en psicoterapia: ¿hasta qué punto podemos confiar en los hallazgos publicados de los ensayos de eficacia?" . Frontiers in Psychology . 9 256. Frontiers Media . doi : 10.3389/fpsyg.2018.00256 . PMC 5835722. PMID 29541051 .
- ↑ Frank MC , Bergelson E, Bergmann C, Cristia A, Floccia C, Gervain J, et al. (9 de marzo de 2017). "Un enfoque colaborativo para la investigación infantil: promoción de la reproducibilidad, las mejores prácticas y la construcción de teorías" . Infancy . 22 ( 4): 421– 435. doi : 10.1111/infa.12182 . hdl : 10026.1/9942 . PMC 6879177. PMID 31772509 .
- ↑ Harris JR (2009) [1998]. La suposición de la crianza: por qué los niños son como son (2.ª ed.). Nueva York: Free Press . ISBN 978-1-4391-0165-0.
- ↑ Harris HR (2006). No hay dos iguales: Naturaleza humana e individualidad humana . Nueva York: WW Norton & Company . ISBN 978-0-393-32971-1.
- ↑ Tyson C (14 de agosto de 2014). "Failure to Replicate" . Inside Higher Ed . Recuperado el 19 de diciembre de 2018 .
- ↑ Makel MC, Plucker JA (1 de agosto de 2014). "Los hechos son más importantes que la novedad: replicación en las ciencias de la educación" . Educational Researcher . 43 (6): 304–316 . doi : 10.3102/0013189X14545513 . S2CID 145571836. Recuperado el 19 de diciembre de 2018 .
- ↑ Kirschner PA, Sweller J , Clark RE (2006). "Por qué la mínima orientación durante la instrucción no funciona: un análisis del fracaso de la enseñanza constructivista, por descubrimiento, basada en problemas, experiencial y basada en la indagación" . Educational Psychologist . 41 (2). Routledge : 75–86 . doi : 10.1207/s15326985ep4102_1 . S2CID 17067829 .
- ↑ Fundamentos para el éxito: Informe final del Panel Asesor Nacional de Matemáticas (PDF) (Informe). Departamento de Educación de los Estados Unidos . 2008. págs. 45–46 . Archivado (PDF) del original el 18 de enero de 2018. Consultado el 3 de noviembre de 2020 .
- ↑ Pashler H , McDaniel M , Rohrer D, Bjork R (diciembre de 2008). "Estilos de aprendizaje: conceptos y evidencia" . Psychological Science in the Public Interest . 9 (3). SAGE Publications : 105– 119. doi : 10.1111/j.1539-6053.2009.01038.x . PMID 26162104 . S2CID 2112166 .
- ↑ Nosek BA, Cohoon J, Kidwell MC, Spies JR (2018) [2015]. "Resumen de las tasas de reproducibilidad y los tamaños del efecto para estudios originales y de replicación en general y por revista/disciplina" . Estimación de la reproducibilidad de la ciencia psicológica (tabla). Proyecto de reproducibilidad: Psicología . Recuperado el 16 de octubre de 2019 .
- 1 2 3 Nelson LD, Simmons J, Simonsohn U (enero de 2018). "El renacimiento de la psicología". Annual Review of Psychology . 69 (1): 511– 534. doi : 10.1146/annurev-psych-122216-011836 . PMID 29068778 .
- ↑ Roger A (27 de agosto de 2018). "La ciencia detrás de las ciencias sociales se sacude, otra vez" . Wired . Recuperado el 28 de agosto de 2018 .
- ↑ Camerer CF , Dreber A, Holzmeister F, Ho TH, Huber J, Johannesson M, et al. (septiembre de 2018). " Evaluación de la replicabilidad de experimentos de ciencias sociales en Nature y Science entre 2010 y 2015" . Nature Human Behaviour . 2 (9): 637– 644. doi : 10.1038/s41562-018-0399-z . PMID 31346273. S2CID 52098703 .
- ↑ Klein RA (2018). "Many Labs 2: Investigating Variation in Replicability Across Samples and Settings" . Advances in Methods and Practices in Psychological Science . 1 (4): 443– 490. doi : 10.1177/2515245918810225 . hdl : 1854/LU-8637133 .
- 1 2 Witkowski T (2019). "¿El vaso está medio vacío o medio lleno? Últimos resultados en la crisis de replicación en Psicología" (PDF) . Skeptical Inquirer . Vol. 43, n.º 2, págs. 5-6 . Archivado del original (PDF) el 30 de enero de 2020.
- ↑ Richtel M (16 de marzo de 2022). "Estudios de neuroimagen obstaculizados por conjuntos de datos pequeños, según un estudio" . The New York Times .
- ↑ Marek S, Tervo-Clemmens B, Calabro FJ, Montez DF, Kay BP, Hatoum AS, et al. (marzo de 2022). "Los estudios de asociación cerebral reproducibles requieren miles de individuos" . Nature . 603 (7902): 654– 660. Bibcode : 2022Natur.603..654M . doi : 10.1038/s41586-022-04492-9 . PMC 8991999. PMID 35296861 .
- ↑ Ioannidis JP (julio de 2005). "Efectos contradictorios e inicialmente más fuertes en investigaciones clínicas muy citadas". JAMA . 294 (2): 218– 28. doi : 10.1001/jama.294.2.218 . PMID 16014596 .
- ↑ Prinz F, Schlange T, Asadullah K (agosto de 2011). "Lo creas o no: ¿cuánto podemos confiar en los datos publicados sobre posibles dianas farmacológicas?" . Nature Reviews. Drug Discovery . 10 (9): 712. Bibcode : 2011NRvDD..10..712P . doi : 10.1038/nrd3439-c1 . PMID 21892149 .
- ↑ Wheeling K (12 de mayo de 2016). "La gran industria farmacéutica revela una crisis de replicación biomédica" . Pacific Standard . Consultado el 30 de enero de 2020 .Actualizado el 14 de junio de 2017.
- 1 2 Haelle T (7 de diciembre de 2021). "Docenas de estudios importantes sobre el cáncer no se pueden replicar" . Science News . Recuperado el 19 de enero de 2022 .
- 1 2 " Proyecto de reproducibilidad: biología del cáncer" . www.cos.io. Centro para la Ciencia Abierta . Consultado el 19 de enero de 2022 .
- ↑ Mobley A, Linder SK, Braeuer R, Ellis LM, Zwelling L (2013). Arakawa H (ed.). "Una encuesta sobre la reproducibilidad de datos en la investigación del cáncer ofrece perspectivas sobre nuestra limitada capacidad para trasladar los hallazgos del laboratorio a la clínica" . PLOS ONE . 8 (5) e63221. Bibcode : 2013PLoSO...863221M . doi : 10.1371/journal.pone.0063221 . PMC 3655010. PMID 23691000 .
- ↑ Van Noorden R (julio de 2023). "La medicina está plagada de ensayos clínicos poco fiables. ¿Cuántos estudios son falsos o defectuosos?" . Nature . 619 (7970): 454– 458. Bibcode : 2023Natur.619..454V . doi : 10.1038/d41586-023-02299-w . PMID 37464079 .
- ↑ Schoenfeld JD, Ioannidis JP (enero de 2013). "¿Está todo lo que comemos asociado con el cáncer? Una revisión sistemática de libros de cocina". The American Journal of Clinical Nutrition . 97 (1): 127– 134. doi : 10.3945/ajcn.112.047142 . ISSN 1938-3207 . PMID 23193004 .
- 1 2 3 4 Tsui AS (21 de enero de 2022). "De la investigación tradicional a la investigación responsable: la necesidad de libertad científica y responsabilidad científica para mejores sociedades" . Annual Review of Organizational Psychology and Organizational Behavior . 9 (1): 1– 32. doi : 10.1146/annurev-orgpsych-062021-021303 . ISSN 2327-0608 . S2CID 244238570 .
- ↑ Camerer CF, Dreber A, Forsell E, Ho TH, Huber J, Johannesson M, et al. (marzo de 2016). "Evaluación de la replicabilidad de experimentos de laboratorio en economía" . Science . 351 (6280): 1433– 1436. Bibcode : 2016Sci...351.1433C . doi : 10.1126/science.aaf0918 . PMID 26940865 .
- ↑ Bohannon J (3 de marzo de 2016). "Alrededor del 40% de los experimentos económicos fracasan en la replicación: encuesta" . Science . doi : 10.1126/science.aaf4141 . Recuperado el 25 de octubre de 2017 .
- ↑ Goldfarb RS (1 de diciembre de 1997). "Ahora lo ves, ahora no lo ves: resultados contrarios emergentes en economía". Journal of Economic Methodology . 4 (2): 221– 244. doi : 10.1080/13501789700000016 . ISSN 1350-178X .
- 1 2 Bergh DD, Sharp BM, Aguinis H, Li M (6 de abril de 2017). "¿Existe una crisis de credibilidad en la investigación sobre gestión estratégica? Evidencia sobre la reproducibilidad de los hallazgos de los estudios" . Strategic Organization . 15 (3): 423– 436. doi : 10.1177/1476127017701076 . ISSN 1476-1270 . S2CID 44024633 .
- 1 2 Stagge JH, Rosenberg DE, Abdallah AM, Akbar H, Attallah NA, James R (febrero de 2019). " Evaluación de la disponibilidad de datos y la reproducibilidad de la investigación en hidrología y recursos hídricos" . Scientific Data . 6 190030. Bibcode : 2019NatSD...690030S . doi : 10.1038/sdata.2019.30 . PMC 6390703. PMID 30806638 .
- 1 2 Vaugrante L, Niepert M, Hagendorff T (30 de septiembre de 2024). "¿Una inminente crisis de replicación en la evaluación del comportamiento en los modelos de lenguaje? Evidencia y soluciones". arXiv : 2409.20303 [ cs.CL ].
- ↑ Semmelrock H, Ross-Hellauer T, Kopeinik S, Theiler D, Haberl A, Thalmann S, et al. (junio de 2025). "Reproducibilidad en la investigación basada en aprendizaje automático: descripción general, barreras y factores impulsores" . AI Magazine . 46 (2) e70002. doi : 10.1002/aaai.70002 . ISSN 0738-4602 .
- ↑ Desai A, Abdelhamid M, Padalkar NR (2025). "¿Qué es la reproducibilidad en la investigación sobre inteligencia artificial y aprendizaje automático?" . AI Magazine . 46 (2) e70004. doi : 10.1002/aaai.70004 . ISSN 2371-9621 .
- ↑ Kapoor S, Narayanan A (septiembre de 2023). "Fugas y la crisis de reproducibilidad en la ciencia basada en el aprendizaje automático" . Patterns . 4 (9) 100804. doi : 10.1016/j.patter.2023.100804 . ISSN 2666-3899 . PMC 10499856. PMID 37720327 .
- ↑ Siddiq ML, Islam-Gomes A, Sekerak N, Santos JC (29 de noviembre de 2025). "Grandes modelos de lenguaje para ingeniería de software: una crisis de reproducibilidad". arXiv : 2512.00651 [ cs.SE ].
- ↑ Asher MW, Gold G, Chen E, Carvalho PF (1 de enero de 2026). "Los chatbots están socavando la investigación colaborativa en las ciencias del comportamiento: detección de trampas asistidas por inteligencia artificial con una herramienta basada en pulsaciones de teclas". Advances in Methods and Practices in Psychological Science . 9 (1) 25152459261424723. doi : 10.1177/25152459261424723 . ISSN 2515-2459 .
- ↑ Feuerriegel S, Barrie C, Crockett MJ, Globig LK, McLoughlin KL, Mirea DM, et al. (9 de junio de 2026). "Una lista de verificación para la elaboración de informes de modelos de lenguaje grandes en ciencias del comportamiento" . Nature Human Behaviour : 1–5 . doi : 10.1038/s41562-026-02492-7 . ISSN 2397-3374 . PMID 42265331 .
- 1 2 Nature Video (28 de mayo de 2016). "¿Existe una crisis de reproducibilidad en la ciencia?" . Scientific American . Recuperado el 15 de agosto de 2019 .
- ^ Fanelli D (abril de 2010). Escalas E (ed.). "Los resultados "positivos" aumentan a medida que se desciende en la jerarquía de las ciencias . PLOS ONE . 5 (4) e10068. Bibcode : 2010PLoSO...510068F . doi : 10.1371/journal.pone.0010068 . PMC 2850928. PMID 20383332 .
- 1 2 Allen C, Mehler DM (mayo de 2019). "Desafíos, beneficios y consejos de la ciencia abierta en la etapa inicial de la carrera y más allá" . PLOS Biology . 17 (5) e3000246. Public Library of Science. doi : 10.1371/journal.pbio.3000246 . PMC 6513108. PMID 31042704 .
- ↑ "Una nueva crisis de replicación: se citan más las investigaciones que tienen menos probabilidades de ser ciertas" . Universidad de California, San Diego . 21 de mayo de 2021. Archivado del original el 13 de abril de 2024. Consultado el 20 de julio de 2024 .
- ↑ Serra-Garcia M, Gneezy U (mayo de 2021). "Las publicaciones no replicables se citan más que las replicables" . Science Advances . 7 (21) eabd1705. Bibcode : 2021SciA....7.1705S . doi : 10.1126/sciadv.abd1705 . PMC 8139580. PMID 34020944 .
- ↑ Begley CG, Ioannidis JP (enero de 2015). " Reproducibilidad en la ciencia: mejorando el estándar para la investigación básica y preclínica" . Circulation Research . 116 (1): 116– 126. doi : 10.1161/CIRCRESAHA.114.303819 . PMID 25552691. S2CID 3587510 .
- ↑ De Solla Price DJ (1963). Little Science, Big Science . Columbia University Press. pág. 32.
- ↑ Siebert S, Machesky LM , Insall RH (septiembre de 2015). "Desbordamiento en la ciencia y sus implicaciones para la confianza" . eLife . 4 e10825. doi : 10.7554/eLife.10825 . PMC 4563216. PMID 26365552 .
- ↑ Della Briotta Parolo P, Pan RK, Ghosh R, Huberman BA, Kaski K, Fortunato S (2015). "Disminución de la atención en la ciencia". Journal of Informetrics . 9 (4): 734– 745. arXiv : 1503.01881 . doi : 10.1016/j.joi.2015.07.006 . S2CID 10949754 .
- 1 2 Mirowski P (2011). Science-Mart . Harvard University Press. pp. 2, 24. ISBN 978-0-674-06113-2.
- ↑ Moeller HG (2006). Luhmann explicado: de las almas a los sistemas . Chicago: Open Court. p. 25. ISBN 0-8126-9598-4OCLC 68694011
- ↑ Luhmann N (1995). Sistemas sociales . Stanford, CA: Stanford University Press. pág. 288. ISBN 978-0-8047-2625-2OCLC 31710315
- 1 2 Scheufele DA (septiembre de 2014). "Comunicación científica como comunicación política" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 111 (Supl. 4): 13585–13592 . Bibcode : 2014PNAS..111S3585S . doi : 10.1073 /pnas.1317516111 . PMC 4183176. PMID 25225389 .
- ↑ Pielke R (2007). El intermediario honesto: comprender la ciencia en la política y las políticas públicas . Cambridge: Cambridge University Press. doi : 10.1017/CBO9780511818110 . ISBN 978-0-511-81811-0OCLC 162145073
- ↑ Martin GN, Clarke RM (2017). "¿Son las revistas de psicología antirreplicación? Una instantánea de las prácticas editoriales" . Frontiers in Psychology . 8 : 523. doi : 10.3389/fpsyg.2017.00523 . PMC 5387793. PMID 28443044 .
- ↑ Yeung AW (2017). " ¿ Aceptan las revistas de neurociencia las replicaciones? Una revisión de la literatura" . Frontiers in Human Neuroscience . 11 468. doi : 10.3389/fnhum.2017.00468 . PMC 5611708. PMID 28979201 .
- ↑ Hubbard R, Vetter DE (1 de febrero de 1996). "Una comparación empírica de investigaciones de replicación publicadas en contabilidad, economía, finanzas, administración y marketing". Journal of Business Research . 35 (2): 153– 164. doi : 10.1016/0148-2963(95)00084-4 . ISSN 0148-2963 .
- ↑ "Sesgo de confirmación" . Diccionario de psicología de la APA . Washington, DC: Asociación Americana de Psicología . s.f. Consultado el 2 de febrero de 2022 .
- 1 2 3 Ferguson CJ, Heene M (noviembre de 2012). "Un vasto cementerio de teorías no muertas: sesgo de publicación y aversión de la ciencia psicológica a la nulidad". Perspectives on Psychological Science . 7 (6): 555– 561. doi : 10.1177/1745691612459059 . PMID 26168112 .
- ↑ Dominus S (18 de octubre de 2017). "Cuando la revolución llegó para Amy Cuddy" . New York Times Magazine .
- ↑ García-Berthou E, Alcaraz C (mayo de 2004). " Incongruencia entre las estadísticas de prueba y los valores p en artículos médicos" . BMC Medical Research Methodology . 4 (1) 13. doi : 10.1186/1471-2288-4-13 . PMC 443510. PMID 15169550 .
- ↑ Nieuwenhuis S, Forstmann BU, Wagenmakers EJ (agosto de 2011). "Análisis erróneos de interacciones en neurociencia: un problema de significancia". Nature Neuroscience . 14 (9): 1105– 1107. doi : 10.1038/nn.2886 . PMID 21878926 .
- 1 2 Fanelli D (abril de 2010). "¿Aumentan las presiones para publicar el sesgo de los científicos? Un apoyo empírico de los datos de los estados de EE. UU." . PLOS ONE . 5 (4) e10271. Bibcode : 2010PLoSO...510271F . doi : 10.1371/journal.pone.0010271 . PMC 2858206 . PMID 20422014 .
- ↑ Fanelli D (2010). "Los resultados "positivos" aumentan a medida que se desciende en la jerarquía de las ciencias . PLOS ONE . 5 (4) e10068. Bibcode : 2010PLoSO...510068F . doi : 10.1371/journal.pone.0010068 . PMC 2850928. PMID 20383332 .
- ↑ Nosek BA, Spies JR, Motyl M (noviembre de 2012). "Utopía científica: II. Reestructuración de incentivos y prácticas para promover la verdad sobre la publicabilidad" . Perspectives on Psychological Science . 7 (6): 615– 631. arXiv : 1205.4251 . doi : 10.1177 / 1745691612459058 . PMC 10540222. PMID 26168121. S2CID 23602412 .
- ↑ Everett JA, Earp BD (1 de enero de 2015). "Una tragedia de los bienes comunes (académicos): interpretar la crisis de replicación en psicología como un dilema social para los investigadores noveles" . Frontiers in Psychology . 6 : 1152. doi : 10.3389/fpsyg.2015.01152 . PMC 4527093. PMID 26300832 .
- ↑ Ravetz JR (1971). El conocimiento científico y sus problemas sociales . Oxford: Oxford University Press.
- 1 2 Clayson PE, Carbine KA, Baldwin SA, Larson MJ (noviembre de 2019). "Comportamiento de informes metodológicos, tamaños de muestra y potencia estadística en estudios de potenciales relacionados con eventos: barreras para la reproducibilidad y replicabilidad" . Psicofisiología . 56 (11) e13437. doi : 10.1111/psyp.13437 . PMID 31322285 .
- ↑ LeBel EP, Peters KR (diciembre de 2011). "Temiendo el futuro de la psicología empírica: la evidencia de Psi de Bem (2011) como estudio de caso de deficiencias en la práctica de la investigación modal" . Review of General Psychology . 15 (4): 371– 379. doi : 10.1037/a0025172 . ISSN 1089-2680 .
- 1 2 3 "Mala conducta en la investigación: la zona gris de las prácticas de investigación cuestionables" . www.vib.be. Vlaams Instituut voor Biotechnologie . 30 de septiembre de 2013. Archivado del original el 31 de octubre de 2014. Consultado el 13 de noviembre de 2015 .
- ^ Wicherts JM , Veldkamp CL , Augusteijn HE , Bakker M, van Aert RC, van Assen MA (2016) . "Grados de libertad en la planificación, ejecución, análisis e informes de estudios psicológicos: una lista de verificación para evitar el p -Hacking" . Fronteras en Psicología . 7 : 1832. doi : 10.3389/fpsyg.2016.01832 . PMC 5122713 . PMID 27933012 .
- 1 2 3 "Los nueve círculos del infierno científico" . Perspectivas sobre la ciencia psicológica (opinión). 7 (6): 643– 644. Noviembre de 2012. doi : 10.1177 /1745691612459519 . PMID 26168124. S2CID 45328962 .
- ↑ "Extracción de datos" . Diccionario de Psicología de la APA . Washington, DC: Asociación Americana de Psicología . s.f. Consultado el 9 de enero de 2022.
La práctica inapropiada de buscar en grandes archivos de información para intentar confirmar una hipótesis o creencia preconcebida sin un diseño adecuado que controle posibles factores de confusión o hipótesis alternativas. La extracción de datos puede implicar seleccionar qué partes de un gran conjunto de datos conservar para obtener resultados específicos y deseados.
- ↑ Nagy T, Hergert J, Elsherif MM, Wallrich L, Schmidt K, Waltzer T, et al. (1 de julio de 2025). "Bestiario de prácticas de investigación cuestionables en psicología". Advances in Methods and Practices in Psychological Science . 8 (3) 25152459251348431. doi : 10.1177/25152459251348431 . ISSN 2515-2459 .
- ↑ Silberzahn R, Uhlmann EL, Martin DP, Anselmi P, Aust F, Awtrey E, et al. (1 de septiembre de 2018). "Muchos analistas, un conjunto de datos: cómo transparentar las variaciones en las elecciones analíticas afectan los resultados" . Advances in Methods and Practices in Psychological Science . 1 (3): 337– 356. doi : 10.1177/2515245917747646 . ISSN 2515-2459 .
- 1 2 Gould E, Fraser HS, Parker TH, Nakagawa S, Griffith SC, Vesk PA, et al. (6 de febrero de 2025). "Mismos datos, diferentes analistas: variación en los tamaños del efecto debido a decisiones analíticas en ecología y biología evolutiva" . BMC Biology . 23 (1): 35. doi : 10.1186/s12915-024-02101-x . ISSN 1741-7007 . PMC 11804095. PMID 39915771 .
- ↑ Coretta S, Casillas JV, Roessig S, Franke M, Ahn B, Al-Hoorie AH, et al. (1 de julio de 2023). "Señales multidimensionales y flexibilidad analítica: estimación de grados de libertad en análisis del habla humana" . Advances in Methods and Practices in Psychological Science . 6 (3) 25152459231162567. doi : 10.1177/25152459231162567 . hdl : 10810/66212 . ISSN 2515-2459 .
- ↑ Maziarz M (1 de diciembre de 2024). "Resultados contradictorios y maleabilidad estadística: abrazando el pluralismo de los resultados empíricos" . Perspectives on Science . 32 (6): 701– 728. doi : 10.1162/posc_a_00627 . ISSN 1063-6145 .
- ↑ Steegen S, Tuerlinckx F, Gelman A, Vanpaemel W (1 de septiembre de 2016). "Aumento de la transparencia mediante un análisis multiverso" . Perspectives on Psychological Science . 11 (5): 702– 712. doi : 10.1177/1745691616658637 . ISSN 1745-6916 . PMID 27694465 .
- ↑ Simonsohn U, Simmons JP, Nelson LD (noviembre de 2020). "Análisis de la curva de especificación" . Nature Human Behaviour . 4 (11): 1208– 1214. doi : 10.1038/s41562-020-0912-z . ISSN 2397-3374 . PMID 32719546 .
- ↑ Coretta S, Casillas JV, Roessig S, Franke M, Ahn B, Al-Hoorie AH, et al. (1 de julio de 2023). "Señales multidimensionales y flexibilidad analítica: estimación de grados de libertad en análisis del habla humana". Advances in Methods and Practices in Psychological Science . 6 (3) 25152459231162567. doi : 10.1177/25152459231162567 . hdl : 10810/66212 . ISSN 2515-2459 .
- ↑ Silberzahn R, Uhlmann EL (octubre de 2015). "Investigación colaborativa: muchas manos hacen un trabajo arduo" . Nature . 526 (7572): 189–191 . Bibcode : 2015Natur.526..189S . doi : 10.1038/526189a . ISSN 1476-4687 . PMID 26450041 .
- ↑ Aczel B, Szaszi B, Nilsonne G, van den Akker OR, Albers CJ, van Assen MA, et al. (9 de noviembre de 2021). "Guía basada en el consenso para la realización y presentación de informes de estudios multianalistas" . eLife . 10 e72185. doi : 10.7554/eLife.72185 . ISSN 2050-084X . PMC 8626083. PMID 34751133 .
- ↑ Begley CG (mayo de 2013). "Seis señales de alerta para trabajos sospechosos" . Nature (Artículo de comentario). 497 (7450): 433– 434. Bibcode : 2013Natur.497..433B . doi : 10.1038/497433a . PMID 23698428. S2CID 4312732 .
- 1 2 3 Leech G, Vazquez JJ, Kupper N, Yagudin M, Aitchison L (2024). "Prácticas cuestionables en el aprendizaje automático". arXiv : 2407.12220 [ cs.LG ].
- 1 2 Markov IL (23 de octubre de 2024). "Reevaluación del aprendizaje por refuerzo de Google para la colocación de macros IC" . Communications of the ACM . 67 (11): 60– 71. arXiv : 2306.09633 . doi : 10.1145/3676845 .
- 1 2 Mirhoseini A, Goldie A, Yazgan M, et_al. (2021). "Una metodología de colocación de grafos para el diseño rápido de chips" . Nature . 594 (7862): 207– 212. Bibcode : 2021Natur.594..207M . doi : 10.1038/s41586-021-03544-w . PMID 34108699 .
- ↑ Goth G (29 de marzo de 2023). "Más detalles, pero no suficientes" . Communications of the ACM . Association for Computing Machinery . Recuperado el 27 de agosto de 2025 .
- ↑ Cheng CK, Kahng AB, Kundu S, Wang Y, Wang Z (2023). "Evaluación del aprendizaje por refuerzo para la colocación de macros" . Actas del Simposio Internacional sobre Diseño Físico (ISPD) . ACM. págs. 158–166 . doi : 10.1145/3569052.3578926 .
- ↑ Wakabayashi D, Metz C (2 de mayo de 2022). "Otro despido entre el equipo de expertos en IA de Google y más discordia" . The New York Times . Recuperado el 27 de agosto de 2025 .
- ↑ Quach K (27 de marzo de 2023). "Las afirmaciones de Google sobre el diseño de chips de IA sobrehumana vuelven a estar bajo la lupa" . The Register .
- ↑ Joelving F (26 de septiembre de 2023). "Nature señala dudas sobre el estudio de IA de Google y retira el comentario" . Retraction Watch . Recuperado el 27 de agosto de 2025 .
- ↑ Jeremy Hsu (13 de octubre de 2024). "Google afirma que su IA diseña chips mejor que los humanos; los expertos discrepan" . New Scientist . Consultado el 27 de agosto de 2025 .
- ↑ "Las actualizaciones provocan revuelo" . Communications of the ACM . 29 de octubre de 2024. Consultado el 31 de agosto de 2025 .
- ↑ O'Boyle EH, Götz M (2022). «Prácticas de investigación cuestionables». Integridad en la investigación: Mejores prácticas para las ciencias sociales y del comportamiento . Oxford University Press. pp. 261–294 . ISBN 978-0-19-093855-0.
- ↑ Glick JL (1992). "Auditoría de datos científicos: una herramienta clave de gestión". Accountability in Research . 2 (3): 153– 168. doi : 10.1080/08989629208573811 .
- ↑ Fiedler K, Schwarz N (19 de octubre de 2015). "Prácticas de investigación cuestionables revisadas". Social Psychological and Personality Science . 7 : 45–52 . doi : 10.1177/1948550615612150 . ISSN 1948-5506 . S2CID 146717227 .
- ↑ Fanelli D (mayo de 2009). "¿Cuántos científicos fabrican y falsifican investigaciones? Una revisión sistemática y metaanálisis de datos de encuestas" . PLOS ONE . 4 (5) e5738. Bibcode : 2009PLoSO...4.5738F . doi : 10.1371/journal.pone.0005738 . PMC 2685008. PMID 19478950 .
- ↑ Shea C (13 de noviembre de 2011). "El escándalo de fraude alimenta el debate sobre las prácticas de la psicología social" . The Chronicle of Higher Education .
- ↑ "El fraude científico organizado está creciendo a un ritmo alarmante" . EurekAlert! . Consultado el 4 de agosto de 2025 .
- ↑ Richardson RA, Hong SS, Byrne JA, Stoeger T, Amaral LA (12 de agosto de 2025). "Las entidades que permiten el fraude científico a gran escala son grandes, resistentes y crecen rápidamente" . Actas de la Academia Nacional de Ciencias . 122 (32) e2420092122. Bibcode : 2025PNAS..12220092R . doi : 10.1073/pnas.2420092122 . ISSN 0027-8424 . PMC 12358853. PMID 40758886 .
- ↑ "Investigador de la honestidad cometió mala conducta en la investigación, según un informe de Harvard recientemente desclasificado" . Science . 14 de marzo de 2024. Consultado el 29 de agosto de 2025 .
- 1 2 Schwitzgebel E (3 de mayo de 2025). "El informe Gino de Harvard revela cómo se alteró un conjunto de datos" . Data Colada . Recuperado el 29 de agosto de 2025 .
- ↑ Stein S (27 de mayo de 2025). "Se revoca la titularidad de la profesora de Harvard Francesca Gino en medio de una investigación por fraude de datos" . NBC News . Consultado el 29 de agosto de 2025 .
- ↑ Button KS, Ioannidis JP, Mokrysz C, Nosek BA, Flint J, Robinson ES, et al. (mayo de 2013). "Fallo de potencia: por qué el tamaño de muestra pequeño socava la fiabilidad de la neurociencia". Nature Reviews. Neuroscience . 14 (5): 365– 376. doi : 10.1038/nrn3475 . PMID 23571845 .
- ↑ Button KS, Ioannidis JP, Mokrysz C, Nosek BA, Flint J, Robinson ES, et al. (mayo de 2013). "Fallo de potencia: por qué el tamaño de muestra pequeño socava la fiabilidad de la neurociencia" . Nature Reviews. Neuroscience . 14 (5): 365– 376. doi : 10.1038/nrn3475 . PMID 23571845. S2CID 455476 .
- ^ Ioannidis JP, Stanley TD, Doucouliagos H (1 de octubre de 2017). "El poder del sesgo en la investigación económica" . La Revista Económica . 127 (605): F236– F265. doi : 10.1111/ecoj.12461 . ISSN 0013-0133 . S2CID 158829482 .
- ↑ Flint J, Munafò MR (febrero de 2013). " Genes candidatos y no candidatos en genética del comportamiento" . Current Opinion in Neurobiology . 23 (1): 57– 61. doi : 10.1016/j.conb.2012.07.005 . PMC 3752971. PMID 22878161 .
- ↑ Dumas-Mallet E, Button KS, Boraud T, Gonon F, Munafò MR (febrero de 2017). "Bajo poder estadístico en la ciencia biomédica: una revisión de tres dominios de investigación humana" . Royal Society Open Science . 4 (2) 160254. Bibcode : 2017RSOS....460254D . doi : 10.1098/rsos.160254 . PMC 5367316. PMID 28386409 .
- ↑ Farrell MS, Werge T, Sklar P, Owen MJ, Ophoff RA, O'Donovan MC, et al. (mayo de 2015). " Evaluación de genes candidatos históricos para la esquizofrenia" . Molecular Psychiatry . 20 (5): 555– 562. doi : 10.1038/mp.2015.16 . PMC 4414705. PMID 25754081 .
- ↑ Protzko J, Schooler JW (21 de febrero de 2017), "Efectos de declive: tipos, mecanismos y reflexiones personales" , en Lilienfeld SO, Waldman ID (eds.), Psychological Science Under Scrutiny (1.ª ed.), Wiley, pp. 85–107 , doi : 10.1002/9781119095910.ch6 , ISBN 978-1-118-66107-9, consultado el 26 de julio de 2024
- 1 2 Loken E, Gelman A (febrero de 2017). "Error de medición y la crisis de replicación". Science . 355 (6325): 584– 585. Bibcode : 2017Sci...355..584L . doi : 10.1126/science.aal3618 . PMID 28183939 .
- ↑ Gelman, Andrew y Eric Loken. " El jardín de caminos que se bifurcan: por qué las comparaciones múltiples pueden ser un problema, incluso cuando no hay "expedición de pesca" o "p-hacking" y la hipótesis de investigación se planteó con anticipación. " Departamento de Estadística, Universidad de Columbia 348.1-17 (2013): 3.
- 1 2 Head ML, Holman L, Lanfear R, Kahn AT, Jennions MD (marzo de 2015). "El alcance y las consecuencias del p-hacking en la ciencia" . PLOS Biology . 13 (3) e1002106. doi : 10.1371/journal.pbio.1002106 . PMC 4359000. PMID 25768323 .
- ↑ Eisenberger NI, Lieberman MD, Williams KD (octubre de 2003). "¿Duele el rechazo? Un estudio de resonancia magnética funcional sobre la exclusión social". Science . 302 (5643): 290– 292. Bibcode : 2003Sci...302..290E . doi : 10.1126/science.1089134 . PMID 14551436 .
- 1 2 Vul E, Harris C, Winkielman P, Pashler H (mayo de 2009). "Correlaciones sorprendentemente altas en estudios de fMRI de emoción, personalidad y cognición social" . Perspectives on Psychological Science . 4 (3): 274– 290. doi : 10.1111/j.1745-6924.2009.01125.x . PMID 26158964 .
- 1 2 3 Wagenmakers EJ (octubre de 2007). "Una solución práctica a los problemas generalizados de los valores p". Psychonomic Bulletin & Review . 14 (5): 779– 804. doi : 10.3758/BF03194105 . PMID 18087943 .
- ^ Wicherts JM, Veldkamp CL, Augusteijn HE, Bakker M, van Aert RC, van Assen MA (25 de noviembre de 2016). "Grados de libertad en la planificación, ejecución, análisis e informes de estudios psicológicos: una lista de verificación para evitar el p -Hacking" . Fronteras en Psicología . 7 : 1832. doi : 10.3389/fpsyg.2016.01832 . PMC 5122713 . PMID 27933012 .
- ↑ Higgins JP, Thompson SG (junio de 2002). " Cuantificación de la heterogeneidad en un metaanálisis". Statistics in Medicine . 21 (11): 1539– 1558. Bibcode : 2002StMed..21.1539H . doi : 10.1002/sim.1186 . PMID 12111919. S2CID 6319826 .
- ↑ Moosa IA (2 de octubre de 2019). "La fragilidad de los resultados y el sesgo en la investigación empírica: una exposición exploratoria" . Journal of Economic Methodology . 26 (4): 347– 360. doi : 10.1080/1350178X.2018.1556798 . ISSN 1350-178X . S2CID 158504639 .
- ↑ Granger CW (1999). Modelado empírico en economía: especificación y evaluación . Cambridge University Press. pág. 5. doi : 10.1017/CBO9780511492327 . ISBN 978-0-521-77825-1.
- ↑ Maziarz M (1 de diciembre de 2021). "Resolviendo controversias empíricas con evidencia mecanicista" . Synthese . 199 (3): 9957– 9978. doi : 10.1007/s11229-021-03232-2 . ISSN 1573-0964 . S2CID 236249427 .
- ↑ Morgan MS, Magnus JR (septiembre de 1997). "El experimento en econometría aplicada" . Journal of Applied Econometrics . 12 (5): 459– 661. ISSN 1099-1255 .
- 1 2 Van Bavel JJ, Mende-Siedlecki P, Brady WJ, Reinero DA (junio de 2016). "Sensibilidad contextual en la reproducibilidad científica" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 113 (23): 6454– 6459. Bibcode : 2016PNAS..113.6454V . doi : 10.1073/pnas.1521897113 . JSTOR 26470212. PMC 4988618. PMID 27217556 .
- ↑ Trafimow D (julio de 2003). "Prueba de hipótesis y evaluación de teorías en los límites: perspectivas sorprendentes del teorema de Bayes". Psychological Review . 110 (3): 526– 535. doi : 10.1037/0033-295X.110.3.526 . PMID 12885113 .
- 1 2 Cohen J (diciembre de 1994). "La Tierra es redonda (p < .05)". American Psychologist . 49 (12): 997– 1003. doi : 10.1037/0003-066X.49.12.997 . ISSN 1935-990X .
- 1 2 Amrhein V, Korner-Nievergelt F, Roth T (2017). "La Tierra es plana ( p > 0,05): umbrales de significancia y la crisis de la investigación irreplicable" . PeerJ . 5 e3544 . doi : 10.7717/peerj.3544 . PMC 5502092. PMID 28698825 .
- ↑ Branwen G (30 de abril de 2023). "Todo está correlacionado" . gwern.net .
- ↑ Cohen J (1992). "Cosas que he aprendido (hasta ahora)" . En Kazdin AE (ed.). Cuestiones metodológicas y estrategias en la investigación clínica . Washington: American Psychological Association. pp. 315–333 . doi : 10.1037/10109-028 . ISBN 978-1-55798-154-7. Consultado el 26 de julio de 2024 .
- 1 2 Meehl PE (1992). «Riesgos teóricos y asteriscos tabulares: Sir Karl, Sir Ronald y el lento progreso de la psicología blanda». En Miller RB (ed.). La restauración del diálogo: Lecturas en la filosofía de la psicología clínica . Washington: American Psychological Association. pp. 523–555 . doi : 10.1037/10112-043 . ISBN 978-1-55798-157-8.
- 1 2 Paul Meehl (1986). Lo que los científicos sociales no entienden . En DW Fiske y RA Shweder (Eds.), Metateoría en ciencias sociales: Pluralismos y subjetividades (pp. 315-338). Chicago: University of Chicago Press.
- ↑ Bem DJ (2011). "Sintiendo el futuro: evidencia experimental de influencias retroactivas anómalas en la cognición y el afecto". Journal of Personality and Social Psychology . 100 (3): 407– 425. doi : 10.1037/a0021524 . PMID 21280961 .
- ↑ Jaynes ET, Bretthorst GL (2003). "5. Usos inusuales de la teoría de la probabilidad". Teoría de la probabilidad: la lógica de la ciencia . Cambridge, Reino Unido; Nueva York, NY: Cambridge University Press. ISBN 978-0-521-59271-0.
- 1 2 3 Bird A (1 de diciembre de 2021). "Comprender la crisis de replicación como una falacia de tasa base" . The British Journal for the Philosophy of Science . 72 (4): 965– 993. doi : 10.1093/bjps/axy051 . ISSN 0007-0882 .
- ↑ Nissen SB, Magidson T, Gross K, Bergstrom CT (diciembre de 2016). " Sesgo de publicación y canonización de hechos falsos" . eLife . 5 e21451. arXiv : 1609.00494 . doi : 10.7554/eLife.21451 . PMC 5173326. PMID 27995896 .
- 1 2 Universidad de California San Diego (mayo de 2021). "Una nueva crisis de replicación: se citan más las investigaciones que tienen menos probabilidades de ser ciertas" . phys.org . Consultado el 14 de junio de 2021 .
- 1 2 Serra-Garcia M , Gneezy U (mayo de 2021). "Las publicaciones no replicables se citan más que las replicables" . Science Advances . 7 (21) eabd1705. Bibcode : 2021SciA....7.1705S . doi : 10.1126/sciadv.abd1705 . PMC 8139580 . PMID 34020944 .
- ↑ Białek M (enero de 2018). "Las replicaciones pueden causar creencias distorsionadas en el progreso científico". The Behavioral and Brain Sciences . 41 e122. doi : 10.1017/S0140525X18000584 . PMID 31064528. S2CID 147705650 .
- 1 2 Mede NG, Schäfer MS, Ziegler R, Weißkopf M (enero de 2021). "La "crisis de replicación" en el ojo público: conciencia y percepciones de los alemanes sobre la (ir)reproducibilidad de la investigación científica" . Public Understanding of Science . 30 (1): 91– 102. doi : 10.1177/0963662520954370 . PMID 32924865. S2CID 221723269 .
- 1 2 3 4 Letzter R (22 de septiembre de 2016). "Los científicos están furiosos después de que una famosa psicóloga acusara a sus colegas de 'terrorismo metodológico'"" . Business Insider . Consultado el 30 de enero de 2020 .
- ↑ "Borrador de columna en Observer provoca fuerte respuesta en redes sociales" . APS Observer . Asociación para la Ciencia Psicológica. Septiembre de 2016. Consultado el 4 de octubre de 2017 .
- ↑ Fiske ST (31 de octubre de 2016). "Un llamado a cambiar la cultura de la vergüenza en la ciencia" . APS Observer . 29 (9).
- ↑ Singal J (12 de octubre de 2016). "Dentro del debate sobre el 'terrorismo metodológico' en psicología" . NY Mag . Recuperado el 4 de octubre de 2017 .
- 1 2 Vazire S (julio de 2018). " Implicaciones de la revolución de la credibilidad para la productividad, la creatividad y el progreso" . Perspectives on Psychological Science . 13 (4): 411– 417. doi : 10.1177/1745691617751884 . PMID 29961410. S2CID 49647586 .
- ↑ Stroebe W, Strack F (enero de 2014). " La supuesta crisis y la ilusión de replicación exacta" . Perspectives on Psychological Science . 9 (1): 59– 71. doi : 10.1177/1745691613514450 . PMID 26173241. S2CID 31938129 .
- ↑ Jensen A (7 de mayo de 2019). "La replicación como éxito y replicación fallida" . Facultad de Artes Liberales, Departamento de Filosofía . Universidad de Minnesota . Recuperado el 25 de mayo de 2022 .
- ↑ Madhusoodanan J (mayo de 2022). "La variable pasada por alto en los estudios con animales: por qué la dieta marca la diferencia" . Nature . 605 ( 7911): 778–779 . Bibcode : 2022Natur.605..778M . doi : 10.1038/d41586-022-01393-9 . PMID 35606524. S2CID 249015202 .
- ↑ Ioannidis JP (junio de 2016). "Por qué la mayoría de la investigación clínica no es útil" . PLOS Medicine . 13 (6) e1002049. doi : 10.1371/journal.pmed.1002049 . PMC 4915619. PMID 27328301 .
- ↑ Ioannidis JP, Fanelli D, Dunne DD, Goodman SN (octubre de 2015). "Metarresearch: Evaluation and Improvement of Research Methods and Practices" . PLOS Biology . 13 (10) e1002264. doi : 10.1371/journal.pbio.1002264 . PMC 4592065. PMID 26431313 .
- ↑ Bach B (8 de diciembre de 2015). "Sobre la comunicación de la ciencia y la incertidumbre: Un podcast con John Ioannidis" . Scope . Archivado del original el 8 de noviembre de 2021. Recuperado el 20 de mayo de 2019 .
- ↑ Gosselin RD (enero de 2020). "El análisis estadístico debe mejorar para abordar la crisis de reproducibilidad: el llamado a la acción del ACCESS to Transparent Statistics (ACTS)". BioEssays . 42 ( 1) 1900189. doi : 10.1002/bies.201900189 . PMID 31755115. S2CID 208228664 .
- ↑ Pratt MG, Kaplan S, Whittington R (6 de noviembre de 2019). "Ensayo editorial: El tumulto sobre la transparencia: desacoplar la transparencia de la replicación en el establecimiento de una investigación cualitativa confiable" . Administrative Science Quarterly . 65 (1): 1– 19. doi : 10.1177/0001839219887663 . ISSN 0001-8392 . S2CID 210537501 .
- ↑ Aschwanden C (6 de diciembre de 2018). "La crisis de replicación de la psicología ha mejorado el campo" . FiveThirtyEight . Archivado del original el 7 de diciembre de 2018. Consultado el 19 de diciembre de 2018 .
- ↑ Chartier C, Kline M, McCarthy R, Nuijten M, Dunleavy DJ, Ledgerwood A (diciembre de 2018), "La revolución cooperativa está mejorando la ciencia psicológica" , Observer , 31 (10) , consultado el 19 de diciembre de 2018.
- ↑ "Informes de replicación registrados" . Asociación para la Ciencia Psicológica . Consultado el 13 de noviembre de 2015 .
- ↑ Chambers C (20 de mayo de 2014). "La 'revolución del registro' en psicología"" . The Guardian . Consultado el 13 de noviembre de 2015 .
- ↑ Lindsay DS (diciembre de 2015). "Replicación en la ciencia psicológica" . Psychological Science . 26 (12): 1827– 1832. doi : 10.1177/0956797615616374 . PMID 26553013 .
- 1 2 Benjamin DJ, Berger JO, Johannesson M, Nosek BA, Wagenmakers EJ, Berk R, et al. (enero de 2018). "Redefinir la significación estadística" . Nature Human Behaviour . 2 (1): 6– 10. doi : 10.1038/s41562-017-0189-z . hdl : 10281/184094 . PMID 30980045 .
- ↑ Lakens D, Adolfi FG, Albers CJ, Anvari F, Apps MA, Argamon SE, et al. (marzo de 2018). "Justifica tu alfa" . Nature Human Behaviour . 2 (3): 168– 171. doi : 10.1038/s41562-018-0311-x . hdl : 21.11116/0000-0004-9413-F . ISSN 2397-3374 . S2CID 3692182 .
- ↑ Białek M, Misiak M, Dziekan M (2022). "El círculo vicioso que frena la revolución estadística". Nature Human Behaviour . 7 (2): 161– 163. doi : 10.1038/s41562-022-01515-3 . PMID 36690817 .
- ↑ Colquhoun D (noviembre de 2014). "Una investigación sobre la tasa de falsos descubrimientos y la mala interpretación de los valores p" . Royal Society Open Science . 1 (3) 140216. arXiv : 1407.5296 . Bibcode : 2014RSOS....140216C . doi : 10.1098/rsos.140216 . PMC 4448847. PMID 26064558 .
- 1 2 3 4 Colquhoun D (diciembre de 2017). "La reproducibilidad de la investigación y la mala interpretación de los valores p " . Royal Society Open Science . 4 (12) 171085. Bibcode : 2017RSOS....471085C . doi : 10.1098/rsos.171085 . PMC 5750014. PMID 29308247 .
- ↑ Colquhoun D (11 de octubre de 2016). "El problema con los valores p" . Revista Aeon . Consultado el 11 de diciembre de 2016 .
- ↑ Longstaff C, Colquhoun D. "Calculadora para el riesgo de falsos positivos (FPR)" . University College London. Versión 1.7.
- ↑ Matthews RA (2001). "¿Por qué deberían los clínicos preocuparse por los métodos bayesianos?". Journal of Statistical Planning and Inference . 94 : 43–58 . doi : 10.1016/S0378-3758(00)00232-9 .
- ↑ Maxwell SE, Lau MY, Howard GS (septiembre de 2015). "¿Está la psicología sufriendo una crisis de replicación? ¿Qué significa realmente "fallo en la replicación"?". The American Psychologist . 70 (6): 487– 498. doi : 10.1037/a0039400 . PMID 26348332 .
- ↑ IntHout J, Ioannidis JP, Borm GF, Goeman JJ (agosto de 2015). "Los estudios pequeños son más heterogéneos que los grandes: un meta-metaanálisis" . Journal of Clinical Epidemiology . 68 (8): 860– 869. doi : 10.1016/j.jclinepi.2015.03.017 . hdl : 2066/153978 . PMID 25959635 .
- ↑ Button KS, Ioannidis JP, Mokrysz C, Nosek BA, Flint J, Robinson ES, et al. (mayo de 2013). "Fallo de potencia: por qué el tamaño de muestra pequeño socava la fiabilidad de la neurociencia" . Nature Reviews. Neuroscience . 14 (5): 365– 376. doi : 10.1038/nrn3475 . PMID 23571845 .
- ↑ Greenwald AG (1975). "Consecuencias del prejuicio contra la hipótesis nula" (PDF) . Psychological Bulletin . 82 (1): 1– 20. doi : 10.1037/h0076157 .
- ↑ Kriegeskorte N, Simmons WK, Bellgowan PS, Baker CI (mayo de 2009). "Análisis circular en neurociencia de sistemas: los peligros de la doble inmersión" . Nature Neuroscience . 12 (5): 535– 540. doi : 10.1038/nn.2303 . PMC 2841687. PMID 19396166 .
- ↑ Yarkoni T, Westfall J (noviembre de 2017). " Elegir la predicción sobre la explicación en psicología: lecciones del aprendizaje automático" . Perspectives on Psychological Science . 12 (6): 1100– 1122. doi : 10.1177/1745691617693393 . PMC 6603289. PMID 28841086 .
- ↑ «La NWO destina 3 millones de dólares al programa piloto de estudios de replicación» . Organización Neerlandesa para la Investigación Científica (Comunicado de prensa). Julio de 2016. Archivado del original el 22 de julio de 2016.
- 1 2 3 Apple S (22 de enero de 2017). "El joven multimillonario detrás de la guerra contra la mala ciencia" . Wired .
- ↑ Frank MC, Saxe R (noviembre de 2012). "Enseñando la replicación" . Perspectivas sobre la ciencia psicológica . 7 ( 6): 600– 604. doi : 10.1177/1745691612460686 . PMID 26168118. S2CID 33661604 .
- ↑ Grahe JE, Reifman A, Hermann AD, Walker M, Oleson KC, Nario-Redmond M, et al. (noviembre de 2012). "Aprovechando el recurso no descubierto de los proyectos de investigación estudiantiles" . Perspectives on Psychological Science . 7 (6): 605– 607. doi : 10.1177/1745691612459057 . PMID 26168119 .
- ↑ Marwick B, Wang L, Robinson R, Loiselle H (22 de octubre de 2019). "Cómo utilizar tareas de replicación para enseñar integridad en arqueología empírica" . Advances in Archaeological Practice . 8 : 78–86 . doi : 10.1017/aap.2019.38 .
- ↑ Everett JA, Earp BD (1 de enero de 2015). "Una tragedia de los bienes comunes (académicos): interpretar la crisis de replicación en psicología como un dilema social para los investigadores noveles" . Frontiers in Psychology . 6 : 1152. doi : 10.3389/fpsyg.2015.01152 . PMC 4527093. PMID 26300832 .
- ↑ Ziano I, Mok PY, Feldman G (agosto de 2021). "Replicación y extensión del efecto mejor que el promedio de Alicke (1985) para rasgos deseables y controlables" . Social Psychological and Personality Science . 12 (6): 1005– 1017. doi : 10.1177/1948550620948973 . ISSN 1948-5506 .
- ↑ Pennington CR (2023). Guía para estudiantes sobre ciencia abierta: cómo aprovechar la crisis de replicación para reformar la psicología . Maidenhead: Open University Press. ISBN 978-0-335-25117-9.
- ↑ Kulke L, Rakoczy H (1 de febrero de 2018). "Teoría implícita de la mente: una visión general de las replicaciones y no replicaciones actuales" . Data in Brief . 16 : 101–104 . Bibcode : 2018DIB....16..101K . doi : 10.1016 / j.dib.2017.11.016 . ISSN 2352-3409 . PMC 5694957. PMID 29188228 .
- 1 2 "Curate Science" . curatescience.org . Consultado el 19 de septiembre de 2024 .
- ↑ LeBel EP, McCarthy RJ, Earp BD, Elson M, Vanpaemel W (septiembre de 2018). "Un marco unificado para cuantificar la credibilidad de los hallazgos científicos" . Advances in Methods and Practices in Psychological Science . 1 (3): 389– 402. doi : 10.1177/2515245918787489 . ISSN 2515-2459 .
- ↑ Quintana DS (septiembre de 2021). "Estudios de replicación para tesis de pregrado para mejorar la ciencia y la educación". Nature Human Behaviour (artículo World View). 5 (9): 1117– 1118. doi : 10.1038/s41562-021-01192-8 . PMID 34493847 . S2CID 237439956 .
- ↑ Universidad de Cambridge (abril de 2022) .La "científica robot" Eve descubre que menos de un tercio de los resultados científicos son reproducibles . Techxplore . Consultado el 15 de mayo de 2022 .
- ↑ Roper K, Abdel-Rehim A, Hubbard S, Carpenter M, Rzhetsky A, Soldatova L, et al. (abril de 2022). "Prueba de reproducibilidad y robustez de la literatura sobre biología del cáncer mediante un robot" . Journal of the Royal Society, Interface . 19 (189) 20210821. doi : 10.1098/rsif.2021.0821 . PMC 8984295. PMID 35382578 .
- 1 2 Chambers C (10 de junio de 2014). "Envidia de la física: ¿Tienen las ciencias 'duras' la solución a la crisis de replicación en psicología?" . The Guardian .
- ↑ Kahneman D (2014). "Una nueva etiqueta para la replicación". Psicología social (Comentario). Comentarios y réplicas sobre. 45 (4): 310– 311. doi : 10.1027/1864-9335/a000202 .
- ↑ Makel MC, Plucker JA, Hegarty B (noviembre de 2012). "Replicaciones en la investigación psicológica: ¿con qué frecuencia ocurren realmente?" . Perspectives on Psychological Science . 7 (6): 537– 542. doi : 10.1177/1745691612460688 . PMID 26168110 .
- ↑ Uhlmann EL, Ebersole CR, Chartier CR, Errington TM, Kidwell MC, Lai CK, et al. (septiembre de 2019). "Utopía científica III: ciencia colaborativa" . Perspectivas sobre la ciencia psicológica . 14 (5): 711– 733. doi : 10.1177/1745691619850561 . PMID 31260639 .
- 1 2 Forscher PS, Wagenmakers EJ, Coles NA, Silan MA, Dutra N, Basnight-Brown D, et al. (mayo de 2023). " Los beneficios, las barreras y los riesgos de la ciencia en grandes equipos" . Perspectives on Psychological Science . 18 (3): 607– 623. doi : 10.1177/17456916221082970 . PMID 36190899. S2CID 236816530 .
- ↑ Munafò MR, Davey Smith G (enero de 2018). "Una investigación sólida necesita muchas líneas de evidencia" . Nature . 553 (7689): 399– 401. Bibcode : 2018Natur.553..399M . doi : 10.1038/d41586-018-01023-3 . PMID 29368721 .
- 1 2 3 4 5 6 Wallot S, Kelty-Stephen DG (1 de junio de 2018). "Causalidad dominante de la interacción en la mente y el cerebro, y su implicación para cuestiones de generalización y replicación" . Minds and Machines . 28 (2): 353– 374. doi : 10.1007/s11023-017-9455-0 . hdl : 21.11116/0000-0001-AC9C-E . ISSN 1572-8641 .
- ↑ Tierney W, Hardy JH, Ebersole CR, Leavitt K, Viganola D, Clemente EG, et al. (1 de noviembre de 2020). "Destrucción creativa en la ciencia" . Organizational Behavior and Human Decision Processes . 161 : 291–309 . doi : 10.1016/j.obhdp.2020.07.002 . hdl : 2066/228242 . ISSN 0749-5978 . S2CID 224979451 .
- ↑ Tierney W, Hardy J, Ebersole CR, Viganola D, Clemente EG, Gordon M, et al. (1 de marzo de 2021). "Un enfoque de destrucción creativa para la replicación: moralidad implícita del trabajo y el sexo en diferentes culturas" . Journal of Experimental Social Psychology . 93 104060. doi : 10.1016/j.jesp.2020.104060 . hdl : 10037/24275 . ISSN 0022-1031 . S2CID 229028797 .
- ↑ Delios A, Clemente EG, Wu T, Tan H, Wang Y, Gordon M, et al. (julio de 2022). "Examinando la generalización de los hallazgos de investigación a partir de datos de archivo" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 119 (30) e2120377119. Bibcode : 2022PNAS..11920377D . doi : 10.1073/pnas.2120377119 . PMC 9335312. PMID 35858443 .
- ↑ Ince DC, Hatton L, Graham-Cumming J (febrero de 2012). "El caso de los programas informáticos abiertos" . Nature . 482 (7386): 485– 488. Bibcode : 2012Natur.482..485I . doi : 10.1038/nature10836 . PMID 22358837 .
- ↑ Vuong QH (enero de 2018). " La consideración (ir)racional del costo de la ciencia en las economías en transición" . Nature Human Behaviour . 2 (1): 5. doi : 10.1038/s41562-017-0281-4 . PMID 30980055. S2CID 46878093 .
- ↑ Junk TR, Lyons L (21 de diciembre de 2020). "Reproducibilidad y replicación de resultados experimentales de física de partículas". Harvard Data Science Review . 2 (4). arXiv : 2009.06864 . Bibcode : 2020HDSRv...2f995bJ . doi : 10.1162/99608f92.250f995b . S2CID 221703733 .
- 1 2 Ioannidis JP (febrero de 2016). "Anticipando las consecuencias de compartir datos y código sin procesar y de otorgar insignias por compartir". Journal of Clinical Epidemiology (Comentario). 70 : 258–260 . doi : 10.1016/j.jclinepi.2015.04.015 . PMID 26163123 .
Lecturas adicionales
- Bastian H (5 de diciembre de 2016). "Cronología de la crisis de reproducibilidad: hitos para abordar la fiabilidad de la investigación" . Absolutely Maybe . Recuperado el 5 de junio de 2019 .
- Bonett, DG (2021). Diseño y análisis de estudios de replicación. Organizational Research Methods, 24, 513–529. https://doi.org/10.1177/1094428120911088
- Denworth L (octubre de 2019). "Un problema significativo: los métodos científicos estándar están en entredicho. ¿Cambiará algo?" (PDF) . Scientific American . Vol. 321, n.º 4. pp. 62–67 . p. 63:
El uso de
valores
p
durante casi un siglo [desde 1925] para determinar
la significación estadística
de los resultados
experimentales
ha contribuido a una ilusión de
certeza
y [a]
crisis de reproducibilidad
en muchos
campos científicos
. Hay una creciente determinación de reformar el análisis estadístico... Algunos [investigadores] sugieren cambiar los métodos estadísticos, mientras que otros eliminarían un umbral para definir resultados "significativos".
- Harris R (2017). Rigor Mortis: Cómo la ciencia negligente crea curas inútiles, destruye la esperanza y desperdicia miles de millones . Nueva York: Basic Books. ISBN 978-0-465-09790-6.
- Kafkafi N, Agassi J, Chesler EJ, Crabbe JC , Crusio WE , Eilam D, et al. (abril de 2018). "Reproducibilidad y replicabilidad del fenotipado de roedores en estudios preclínicos" . Neuroscience and Biobehavioral Reviews . 87 : 218–232 . doi : 10.1016/j.neubiorev.2018.01.003 . PMC 6071910. PMID 29357292 .
- Ritchie S (julio de 2020). Ciencia ficción: cómo el fraude, los prejuicios, la negligencia y la exageración socavan la búsqueda de la verdad . Nueva York: Metropolitan Books. ISBN 978-1-250-22269-5.Reseña de libro (noviembre de 2020, The American Conservative )
- Whitfield J (octubre de 2021). "Crisis de replicación" . London Review of Books . 43 (19): 39– 40.Reseña de Ritchie S (julio de 2020). Science Fictions: Exposing Fraud, Negligence and Hype in Science . Londres: Bodley Head. ISBN 978-1-84792-565-7.
- Método científico
- Crítica a la ciencia
- Ética y estadística
- Metaciencia
- Fiabilidad estadística