Los fundamentos de la estadística constituyen las bases matemáticas y filosóficas de los métodos estadísticos. Estas bases son los marcos teóricos que fundamentan y justifican los métodos de inferencia estadística , estimación , contraste de hipótesis , cuantificación de la incertidumbre e interpretación de conclusiones estadísticas. Además, estos fundamentos pueden utilizarse para explicar paradojas estadísticas, describir leyes estadísticas [ 1 ] y orientar la aplicación de la estadística a problemas del mundo real .
Los distintos fundamentos estadísticos pueden ofrecer perspectivas diferentes y contrastantes sobre el análisis e interpretación de datos, y algunos de estos contrastes han sido objeto de siglos de debate. [ 2 ] Algunos ejemplos incluyen la inferencia bayesiana frente a la inferencia frecuentista ; la distinción entre la prueba de significancia de Fisher y la prueba de hipótesis de Neyman - Pearson ; y si se cumple el principio de verosimilitud .
Ciertos marcos pueden ser preferibles para aplicaciones específicas, como el uso de métodos bayesianos para ajustar modelos ecológicos complejos. [ 3 ]
Bandyopadhyay y Forster [ 4 ] identifican cuatro paradigmas estadísticos : estadística clásica (estadística de error), estadística bayesiana , estadística basada en la verosimilitud y estadística basada en la información utilizando el Criterio de Información de Akaike . Más recientemente, Judea Pearl reintrodujo las matemáticas formales al atribuir causalidad en sistemas estadísticos que abordaron las limitaciones fundamentales de los métodos bayesianos y de Neyman-Pearson, como se analiza en su libro Causality .
Prueba de significancia de Fisher frente a prueba de hipótesis de Neyman-Pearson
Durante el siglo XX, el desarrollo de la estadística clásica dio lugar a la aparición de dos fundamentos contrapuestos para las pruebas estadísticas inductivas . [ 5 ] [ 6 ] Los méritos de estos modelos fueron objeto de un amplio debate. [ 7 ] Si bien se enseña y utiliza ampliamente un método híbrido de ambos, las cuestiones filosóficas planteadas en el debate aún no se han resuelto.
Pruebas de significancia
Fisher popularizó las pruebas de significancia con Métodos estadísticos para investigadores , publicado en 1925, y El diseño de experimentos , publicado en 1935. [ 8 ] Fisher estaba motivado por obtener resultados experimentales científicos sin la influencia explícita de opiniones previas. La prueba de significancia es una versión probabilística del modus tollens , una forma clásica de inferencia deductiva. La prueba de significancia podría enunciarse de forma simplificada: "Si la evidencia es suficientemente discordante con la hipótesis, rechácela". En la práctica, se calcula un estadístico a partir de los datos experimentales y la probabilidad de superar ese estadístico bajo un modelo predeterminado o "nulo" se compara con un umbral. El umbral (la versión numérica de "suficientemente discordante") es arbitrario (generalmente decidido por convención). Una aplicación común del método es decidir si un tratamiento tiene un efecto reportable basándose en un experimento comparativo. La hipótesis nula corresponde entonces al modelo sin efecto del tratamiento, lo que implica que los tratados y los controles provienen de la misma población. La significancia estadística es una medida de probabilidad, no de importancia práctica. Puede considerarse un requisito aplicado a la relación señal/ruido estadística. Cabe destacar que la prueba no puede demostrar la hipótesis (de ausencia de efecto del tratamiento), sino que solo proporciona evidencia en su contra. El método se basa en la formulación de una población infinita imaginaria (es decir, un modelo estadístico específico) que corresponde a la hipótesis nula.
La prueba de significancia de Fisher implica una sola hipótesis, pero la elección del estadístico de prueba requiere, al menos, una intuición sobre las direcciones relevantes de desviación del modelo hipotético. Históricamente, el resultado de la prueba consistía en rechazar o no la hipótesis, mientras que hoy en día la probabilidad de observar los resultados de la prueba asumiendo la hipótesis puede calcularse con la ayuda de computadoras, algo imposible en la época de Fisher. Esta probabilidad, conocida como valor p , permite una evaluación más precisa de la significancia del resultado.
Prueba de hipótesis
Neyman y Pearson colaboraron en un problema diferente, pero relacionado: la selección entre hipótesis en competencia basándose únicamente en la evidencia experimental. De sus artículos conjuntos, el más citado data de 1933. [ 9 ] El famoso resultado de ese artículo es el lema de Neyman-Pearson . El lema afirma que una razón de probabilidades es un excelente criterio para seleccionar una hipótesis (con un umbral de comparación arbitrario). El artículo demostró la optimalidad de la prueba t de Student (una de las pruebas de significancia). Neyman expresó la opinión de que la prueba de hipótesis era una generalización y una mejora de la prueba de significancia. La justificación de sus métodos se encuentra en sus artículos conjuntos. [ 10 ]
La comprobación de hipótesis requiere múltiples hipótesis. Siempre se selecciona una hipótesis, como en el caso de las opciones múltiples. La falta de evidencia no se considera de inmediato. El método se basa en el supuesto de muestreo repetido de la misma población (el supuesto frecuentista clásico), aunque Fisher criticó este supuesto (Rubin, 2020). [ 11 ]
Motivos de desacuerdo
La duración de la disputa permitió debatir una amplia gama de cuestiones consideradas fundamentales para la estadística.
Un ejemplo de intercambio de 1955-1956.
El ataque de Fisher [ 12 ]
Muestreo repetido de la misma población
- Este tipo de muestreo es la base de la probabilidad frecuentista.
- Fisher prefirió la inferencia fiducial
Errores de tipo II
- que resultan de una hipótesis alternativa
Comportamiento inductivo
- (Vs. razonamiento inductivo )
La refutación de Neyman [ 13 ]
El ataque de Fisher contra el comportamiento inductivo ha tenido un éxito considerable porque seleccionó el campo de batalla. Si bien las decisiones operacionales se toman habitualmente en función de diversos criterios (como el costo), las conclusiones científicas derivadas de la experimentación suelen basarse únicamente en la probabilidad. La teoría de Fisher sobre la inferencia fiduciaria es errónea.
- Las paradojas son comunes.
Una teoría puramente probabilística de las pruebas requiere una hipótesis alternativa. Los ataques de Fisher contra los errores de tipo II se han desvanecido con el tiempo. En los años transcurridos, la estadística ha diferenciado lo exploratorio de lo confirmatorio. En el contexto actual, el concepto de errores de tipo II se utiliza en los cálculos de potencia para determinar el tamaño de la muestra en las pruebas de hipótesis confirmatorias .
Discusión
El ataque de Fisher basado en la probabilidad frecuentista fracasó, pero no careció de resultados. Identificó un caso específico (tabla de 2×2) donde las dos escuelas de pruebas arrojaron resultados diferentes. Este caso es uno de varios que aún generan inquietud. Los comentaristas creen que la respuesta "correcta" depende del contexto. [ 14 ] La probabilidad fiducial no ha tenido buena acogida, prácticamente sin defensores, mientras que la probabilidad frecuentista sigue siendo una interpretación predominante.
El ataque de Fisher contra el comportamiento inductivo ha tenido un éxito considerable porque supo elegir el campo de batalla. Mientras que las "decisiones operativas" se toman habitualmente en función de diversos criterios (como el coste), las "conclusiones científicas" derivadas de la experimentación suelen basarse únicamente en la probabilidad.
En este intercambio, Fisher también abordó los requisitos para la inferencia inductiva, criticando específicamente las funciones de costo que penalizan los juicios erróneos. Neyman replicó que Gauss y Laplace las utilizaron. Este intercambio de argumentos tuvo lugar 15 años después de que los libros de texto comenzaran a enseñar una teoría híbrida de las pruebas estadísticas.
Fisher y Neyman no estaban de acuerdo sobre los fundamentos de la estadística (aunque estaban unidos en su vehemente oposición a la visión bayesiana [ 14 ] ):
- La interpretación de la probabilidad
- La discrepancia entre el razonamiento inductivo de Fisher y el comportamiento inductivo de Neyman contenía elementos de la división bayesiana-frecuentista. Fisher estaba dispuesto a revisar su opinión (llegar a una conclusión provisional) basándose en la probabilidad calculada, mientras que Neyman se inclinaba más por ajustar su comportamiento observable (tomar una decisión) basándose en los costos calculados.
- La formulación adecuada de preguntas científicas, con especial énfasis en el modelado [ 7 ] [ 15 ]
- Si es justificable rechazar una hipótesis basándose en una baja probabilidad sin conocer la probabilidad de una alternativa
- Si una hipótesis podría ser aceptada alguna vez basándose únicamente en datos
- En matemáticas, la deducción demuestra, mientras que los contraejemplos refutan.
- En la filosofía popperiana de la ciencia, el progreso se produce cuando las teorías son refutadas.
- Subjetividad: Si bien Fisher y Neyman se esforzaron por minimizar la subjetividad, ambos reconocieron la importancia del "buen juicio". Cada uno acusó al otro de subjetividad.
- Fisher seleccionó subjetivamente la hipótesis nula.
- Neyman-Pearson determinó subjetivamente el criterio de selección (que no se limitaba a la probabilidad).
- Ambos umbrales numéricos fueron establecidos de forma subjetiva .
Fisher y Neyman se diferenciaban por sus actitudes y quizás por su lenguaje. Fisher era un científico y un matemático intuitivo. El razonamiento inductivo le resultaba natural. Neyman era un matemático riguroso. Se convencía más por el razonamiento deductivo que por un cálculo de probabilidad basado en un experimento. [ 5 ] Por lo tanto, existía un conflicto subyacente entre lo aplicado y lo teórico (entre la ciencia y las matemáticas).
Historia relacionada
Neyman, quien había ocupado el mismo edificio en Inglaterra que Fisher, aceptó un puesto en la costa oeste de los Estados Unidos de América en 1938. Su traslado puso fin a su colaboración con Pearson y al desarrollo conjunto de la prueba de hipótesis. [ 5 ] Otros continuaron el desarrollo.
Los libros de texto proporcionaban una versión híbrida de significancia y prueba de hipótesis para 1940. [ 16 ] Ninguno de los principales tuvo participación personal conocida en el desarrollo posterior del híbrido que se enseña en estadística introductoria hoy en día. [ 6 ]
Posteriormente, la estadística se desarrolló en distintas direcciones, incluyendo la teoría de la decisión (y posiblemente la teoría de juegos), la estadística bayesiana, el análisis exploratorio de datos, la estadística robusta y la estadística no paramétrica . La prueba de hipótesis de Neyman-Pearson contribuyó significativamente a la teoría de la decisión, que se utiliza ampliamente (por ejemplo, en el control estadístico de calidad). La prueba de hipótesis se generalizó fácilmente para aceptar probabilidades previas, lo que le confirió un carácter bayesiano.
La prueba de hipótesis de Neyman-Pearson se ha convertido en un tema matemático abstracto que se enseña en estadística de posgrado, [ 17 ] mientras que la mayor parte de lo que se enseña a los estudiantes de pregrado y se utiliza bajo el nombre de prueba de hipótesis proviene de Fisher.
Opinión contemporánea
La combinación de las dos escuelas de pruebas en competencia puede interpretarse de diferentes maneras: como la unión imperfecta de dos ideas matemáticamente complementarias [ 14 ] o como la unión fundamentalmente defectuosa de ideas filosóficamente incompatibles [ 18 ] . Fisher gozaba de cierta ventaja filosófica, mientras que Neyman y Pearson empleaban las matemáticas más rigurosas. Las pruebas de hipótesis son controvertidas entre algunos usuarios, pero la alternativa más popular (intervalos de confianza) se basa en las mismas matemáticas.
La historia del desarrollo dejó a las pruebas sin una única fuente autorizada y citable para la teoría híbrida que refleje la práctica estadística común. La terminología fusionada también es algo inconsistente. Existe una sólida evidencia empírica de que los graduados (y los instructores) de un curso introductorio de estadística tienen una comprensión deficiente del significado de la prueba de hipótesis. [ 19 ]
Resumen
- La interpretación de la probabilidad no se ha resuelto (pero la probabilidad fiducial es un concepto huérfano).
- Ninguno de los dos métodos de prueba ha sido rechazado. Ambos se utilizan ampliamente para diferentes propósitos.
- Los textos han fusionado los dos métodos de prueba bajo el término prueba de hipótesis.
- Los matemáticos afirman (con algunas excepciones) que las pruebas de significancia son un caso especial de pruebas de hipótesis.
- Otros consideran que los problemas y los métodos son distintos (o incompatibles).
- La disputa ha afectado negativamente a la enseñanza de la estadística.
Inferencia bayesiana versus inferencia frecuentista
Desde hace mucho tiempo existen dos interpretaciones diferentes de la probabilidad (basadas en evidencia objetiva y grados subjetivos de creencia). Gauss y Laplace podrían haber debatido alternativas hace más de 200 años. Como consecuencia, se han desarrollado dos escuelas de estadística rivales. La estadística inferencial clásica se desarrolló principalmente en el segundo cuarto del siglo XX, [ 6 ] en gran medida como reacción a la probabilidad (bayesiana) de la época, que utilizaba el controvertido principio de indiferencia para establecer probabilidades previas. La rehabilitación de la inferencia bayesiana fue una reacción a las limitaciones de la probabilidad frecuentista. Le siguieron más reacciones. Si bien las interpretaciones filosóficas son antiguas, la terminología estadística no lo es. Los términos estadísticos actuales "bayesiano" y "frecuentista" se estabilizaron en la segunda mitad del siglo XX. [ 20 ] La terminología (filosófica, matemática, científica, estadística) es confusa: la interpretación "clásica" de la probabilidad es bayesiana, mientras que la estadística "clásica" es frecuentista. El término "frecuentista" también tiene diversas interpretaciones, diferentes en filosofía que en física.
Los matices de las interpretaciones filosóficas de la probabilidad se abordan en otro apartado. En estadística, las interpretaciones alternativas permiten analizar datos distintos mediante métodos diferentes basados en modelos distintos para alcanzar objetivos ligeramente diferentes. Cualquier comparación estadística entre las escuelas en competencia considera criterios pragmáticos que van más allá de los filosóficos.
Principales contribuyentes
Dos de los principales contribuyentes a los métodos frecuentistas (clásicos) fueron Fisher y Neyman . [ 5 ] La interpretación de la probabilidad de Fisher era idiosincrásica (pero marcadamente no bayesiana). Las ideas de Neyman eran rigurosamente frecuentistas. Tres de los principales contribuyentes a la filosofía, las matemáticas y los métodos estadísticos bayesianos del siglo XX fueron de Finetti , [ 21 ] Jeffreys [ 22 ] y Savage . [ 23 ] Savage popularizó las ideas de de Finetti en el mundo angloparlante e hizo que las matemáticas bayesianas fueran rigurosas. En 1965, la obra de dos volúmenes de Dennis Lindley, "Introducción a la probabilidad y la estadística desde una perspectiva bayesiana", acercó los métodos bayesianos a un público amplio. La estadística ha avanzado a lo largo de las últimas tres generaciones. Las opiniones "autorizadas" de los primeros contribuyentes no son todas actuales.
Enfoques contrastantes
Inferencia frecuentista
La inferencia frecuentista se describe de forma parcial y concisa más arriba (en la comparación entre la "prueba de significancia" de Fisher y la "prueba de hipótesis" de Neyman-Pearson). La inferencia frecuentista combina diversas perspectivas. El resultado permite fundamentar conclusiones científicas, tomar decisiones operativas y estimar parámetros con o sin intervalos de confianza . La inferencia frecuentista se basa exclusivamente en un único conjunto de evidencia.
Inferencia bayesiana
Una distribución de frecuencia clásica describe la probabilidad de los datos. El uso del teorema de Bayes permite un concepto más abstracto: la probabilidad de una hipótesis (correspondiente a una teoría) dados los datos. Este concepto se conocía antiguamente como "probabilidad inversa". La inferencia bayesiana actualiza la estimación de probabilidad de una hipótesis a medida que se obtiene evidencia adicional. La inferencia bayesiana se basa explícitamente en la evidencia y la opinión previa, lo que permite que se fundamente en múltiples conjuntos de evidencia.
Comparaciones de características
Los frecuentistas y los bayesianos utilizan modelos de probabilidad diferentes. Los frecuentistas suelen considerar que los parámetros son fijos pero desconocidos, mientras que los bayesianos asignan distribuciones de probabilidad a parámetros similares. En consecuencia, los bayesianos hablan de probabilidades que no existen para los frecuentistas; un bayesiano habla de la probabilidad de una teoría, mientras que un frecuentista verdadero solo puede hablar de la consistencia de la evidencia con la teoría. Ejemplo: Un frecuentista no dice que hay una probabilidad del 95 % de que el valor verdadero de un parámetro se encuentre dentro de un intervalo de confianza, sino que dice que el 95 % de los intervalos de confianza contienen el valor verdadero.
Resultados matemáticos
Ninguna escuela es inmune a la crítica matemática y ninguna la acepta sin resistencia. La paradoja de Stein (por ejemplo) ilustró que encontrar una distribución de probabilidad previa "plana" o "no informativa" en dimensiones altas es sutil. [ 2 ] Los bayesianos consideran esto periférico al núcleo de su filosofía, mientras que encuentran que el frecuentismo está plagado de inconsistencias, paradojas y malos comportamientos matemáticos. Los frecuentistas pueden explicar la mayoría. Algunos de los "malos" ejemplos son situaciones extremas, como estimar el peso de una manada de elefantes midiendo el peso de uno ("los elefantes de Basu"), lo que no permite una estimación estadística de la variabilidad de los pesos. El principio de verosimilitud ha sido un campo de batalla.
Resultados estadísticos
Ambas escuelas han logrado resultados impresionantes en la resolución de problemas del mundo real. La estadística clásica tiene una trayectoria más larga, ya que numerosos resultados se obtuvieron con calculadoras mecánicas y tablas impresas de funciones estadísticas especiales. Los métodos bayesianos han tenido un gran éxito en el análisis de información muestreada secuencialmente de forma natural (radar y sonar). Muchos métodos bayesianos y algunos métodos frecuentistas recientes (como el bootstrap) requieren la potencia computacional ampliamente disponible solo en las últimas décadas. Existe un debate activo sobre la combinación de métodos bayesianos y frecuentistas, [ 27 ] [ 25 ] pero se expresan reservas sobre el significado de los resultados y la reducción de la diversidad de enfoques.
Resultados filosóficos
Los bayesianos están unidos en su oposición a las limitaciones del frecuentismo, pero están divididos filosóficamente en numerosos grupos (empíricos, jerárquicos, objetivos, personales, subjetivos), cada uno con un énfasis diferente. Un filósofo de la estadística (frecuentista) ha observado un retroceso del campo estadístico hacia las interpretaciones filosóficas de la probabilidad en las últimas dos generaciones. [ 28 ] Existe la percepción de que los éxitos en las aplicaciones bayesianas no justifican la filosofía que las sustenta. [ 29 ] Los métodos bayesianos a menudo crean modelos útiles que no se utilizan para la inferencia tradicional y que deben poco a la filosofía. [ 30 ] Ninguna de las interpretaciones filosóficas de la probabilidad (frecuentista o bayesiana) parece robusta. La visión frecuentista es demasiado rígida y limitante, mientras que la visión bayesiana puede ser simultáneamente objetiva y subjetiva, etc.
Citas ilustrativas
- "Utilizado con cuidado, el enfoque frecuentista produce respuestas ampliamente aplicables, aunque a veces torpes" [ 31 ].
- «Insistir en técnicas [frecuentes] imparciales puede conducir a estimaciones negativas (pero imparciales) de la varianza; el uso de valores p en pruebas múltiples puede generar contradicciones flagrantes; las regiones de confianza convencionales del 0,95 pueden abarcar toda la recta real. No es de extrañar que a los matemáticos les resulte difícil creer que los métodos estadísticos convencionales sean una rama de las matemáticas.» [ 32 ]
- "El bayesianismo es una filosofía pulcra y con principios sólidos, mientras que el frecuentismo es una mezcla heterogénea de métodos oportunistas e individualmente óptimos." [ 24 ]
- "En problemas multiparamétricos, las distribuciones a priori planas pueden generar respuestas muy malas" [ 31 ].
- La regla de Bayes establece que existe una manera sencilla y elegante de combinar la información actual con la experiencia previa para determinar cuánto se sabe. Implica que datos suficientemente buenos lograrán que observadores previamente dispares lleguen a un acuerdo. Aprovecha al máximo la información disponible y produce decisiones con la menor tasa de error posible. [ 33 ]
- "La estadística bayesiana trata de hacer afirmaciones de probabilidad, la estadística frecuentista trata de evaluar afirmaciones de probabilidad." [ 34 ]
- "A menudo, los estadísticos se encuentran en una situación que recuerda a la paradoja de Arrow, donde se nos pide que proporcionemos estimaciones informativas e imparciales, así como declaraciones de confianza que sean correctas según los datos y el parámetro real subyacente." [ 34 ] (Estos son requisitos contradictorios).
- "Los aspectos inferenciales formales suelen ser una parte relativamente pequeña del análisis estadístico" [ 31 ].
- "Las dos filosofías, la bayesiana y la frecuente, son más ortogonales que antitéticas." [ 24 ]
- "Una hipótesis que podría ser cierta se rechaza porque no ha logrado predecir resultados observables que no se han producido. Esto parece un procedimiento notable." [ 22 ]
Resumen
- La teoría bayesiana tiene una ventaja matemática.
- La probabilidad frecuentista tiene problemas de existencia y consistencia.
- Pero encontrar buenas distribuciones previas para aplicar la teoría bayesiana sigue siendo (¿muy?) difícil.
- Ambas teorías cuentan con un impresionante historial de aplicaciones exitosas.
- Ni la interpretación filosófica de la probabilidad ni su fundamento son sólidos.
- Existe un creciente escepticismo sobre la conexión entre la aplicación práctica y la filosofía.
- Algunos estadísticos recomiendan una colaboración activa (más allá de un alto el fuego).
El principio de probabilidad
En el lenguaje común, verosimilitud es sinónimo de probabilidad. En estadística, esto no es cierto. Una probabilidad se refiere a datos variables para una hipótesis fija, mientras que una verosimilitud se refiere a hipótesis variables para un conjunto fijo de datos. Las mediciones repetidas de una longitud fija con una regla generan un conjunto de observaciones. Cada conjunto fijo de condiciones de observación se asocia con una distribución de probabilidad, y cada conjunto de observaciones puede interpretarse como una muestra de esa distribución: la perspectiva frecuentista de la probabilidad. Alternativamente, un conjunto de observaciones puede resultar del muestreo de cualquiera de varias distribuciones (cada una resultante de un conjunto de condiciones de observación). La relación probabilística entre una muestra fija y una distribución variable (resultante de una hipótesis variable) se denomina verosimilitud: la perspectiva bayesiana de la probabilidad. Un conjunto de mediciones de longitud puede implicar lecturas tomadas por observadores cuidadosos, sobrios, descansados y motivados, con buena iluminación.
Una verosimilitud es una probabilidad (o no probabilidad) con otro nombre que existe debido a la definición frecuentista limitada de probabilidad. La verosimilitud es un concepto introducido y desarrollado por Fisher durante más de 40 años (aunque existen referencias previas al concepto y el apoyo de Fisher fue tibio). [ 35 ] El concepto fue aceptado y modificado sustancialmente por Jeffreys . [ 36 ] En 1962, Birnbaum "demostró" el principio de verosimilitud a partir de premisas aceptables para la mayoría de los estadísticos. [ 37 ] Su "prueba" ha sido cuestionada por estadísticos y filósofos. Es importante destacar que, para 1970, Birnbaum había rechazado una de estas premisas (el principio de condicionalidad ) y también había rechazado el principio de verosimilitud porque ambos eran incompatibles con el "concepto de confianza de la evidencia estadística" frecuentista. [ 38 ] [ 39 ] El principio de verosimilitud afirma que toda la información en una muestra está contenida en la función de verosimilitud , que es aceptada como una distribución de probabilidad válida por los bayesianos (pero no por los frecuentistas).
Algunas pruebas de significancia (frecuentistas) no son consistentes con el principio de verosimilitud. Los bayesianos aceptan el principio que es consistente con su filosofía (quizás alentados por la incomodidad de los frecuentistas). "[E]l enfoque de verosimilitud es compatible con la inferencia estadística bayesiana en el sentido de que la distribución bayesiana posterior para un parámetro se obtiene, por el teorema de Bayes, multiplicando la distribución previa por la función de verosimilitud." [ 35 ] Los frecuentistas interpretan el principio de manera adversa para los bayesianos como una falta de preocupación por la fiabilidad de la evidencia. "El principio de verosimilitud de la estadística bayesiana implica que la información sobre el diseño experimental del cual se recopila la evidencia no entra en el análisis estadístico de los datos." [ 40 ] Muchos bayesianos (Savage, por ejemplo) reconocen esa implicación como una vulnerabilidad.
Los defensores más acérrimos del principio de verosimilitud afirman que ofrece una base estadística mejor que cualquiera de las dos escuelas. «La verosimilitud resulta muy ventajosa en comparación con estas alternativas [bayesiana y frecuentista]». [ 41 ] Entre estos defensores se encuentran estadísticos y filósofos de la ciencia. [ 42 ] Si bien los bayesianos reconocen la importancia de la verosimilitud para el cálculo, creen que la distribución de probabilidad posterior es la base adecuada para la inferencia. [ 43 ]
Modelado
La estadística inferencial se basa en modelos estadísticos . Gran parte de las pruebas de hipótesis clásicas, por ejemplo, se basaban en la suposición de normalidad de los datos. La estadística robusta y no paramétrica se desarrolló para reducir la dependencia de dicha suposición. La estadística bayesiana interpreta las nuevas observaciones desde la perspectiva del conocimiento previo, asumiendo una continuidad modelada entre el pasado y el presente. El diseño de experimentos presupone cierto conocimiento de los factores que se controlarán, variarán, aleatorizarán y observarán. Los estadísticos son conscientes de las dificultades para probar la causalidad (más una limitación del modelo que matemática), afirmando que " la correlación no implica causalidad ".
Las estadísticas más complejas utilizan modelos más complejos, a menudo con la intención de encontrar una estructura latente subyacente a un conjunto de variables. A medida que los modelos y los conjuntos de datos han aumentado en complejidad, [ a ] [ b ] se han planteado preguntas fundamentales sobre la justificación de los modelos y la validez de las inferencias extraídas de ellos. Existe una amplia gama de opiniones contradictorias sobre el modelado.
- Los modelos pueden basarse en teoría científica o en análisis de datos ad hoc. Los enfoques utilizan diferentes métodos. Hay defensores de cada uno. [ 45 ]
- La complejidad del modelo es un compromiso. El criterio de información de Akaike y el criterio de información bayesiano son dos enfoques menos subjetivos para lograr ese compromiso. [ 46 ]
- Se han expresado reservas fundamentales incluso sobre los modelos de regresión simples utilizados en las ciencias sociales. Por lo general, no se menciona ni se verifica una larga lista de supuestos inherentes a la validez de un modelo. A menudo se considera suficiente una comparación favorable entre las observaciones y el modelo. [ 47 ]
- La estadística bayesiana se centra tanto en la probabilidad posterior que ignora la comparación fundamental entre las observaciones y el modelo. [ 30 ]
- Los modelos tradicionales basados en la observación son inadecuados para resolver muchos problemas importantes. Es necesario utilizar una gama mucho más amplia de modelos, incluidos los modelos algorítmicos. «Si el modelo no emula bien la naturaleza, las conclusiones pueden ser erróneas». [ 48 ]
- A menudo, el modelado se realiza de forma deficiente (se utilizan métodos incorrectos) y se informa de forma deficiente. [ 49 ]
Ante la ausencia de un consenso filosófico sólido sobre la modelización estadística, muchos estadísticos aceptan las palabras de advertencia del estadístico George Box : " Todos los modelos son erróneos , pero algunos son útiles " .
Otras lecturas
Para una breve introducción a los fundamentos de la estadística, véase Stuart, A.; Ord, JK (1994). «Cap. 8 – Probabilidad e inferencia estadística». Teoría avanzada de la estadística de Kendall . Vol. I: Teoría de la distribución (6.ª ed.). Edward Arnold.
En su libro *La estadística como argumento basado en principios* , Robert P. Abelson expone la idea de que la estadística sirve como un medio estandarizado para dirimir disputas entre científicos que, de otro modo, podrían argumentar indefinidamente a favor y en contra de sus posturas . Desde este punto de vista, la estadística es una forma de retórica; como ocurre con cualquier método para dirimir disputas, los métodos estadísticos solo pueden tener éxito si todas las partes coinciden en el enfoque empleado. [ 50 ]
Véase también
Notas a pie de página
- ↑ Algunos modelos a gran escala intentan predecir el comportamiento de los votantes en los Estados Unidos de América. La población ronda los 300 millones. Cada votante puede verse influenciado por muchos factores. Para conocer algunas de las complejidades del comportamiento electoral (que los nativos comprenden mejor), véase: Gelman [ 44 ].
- ↑ Efron (2013) menciona millones de puntos de datos y miles de parámetros de estudios científicos. [ 24 ]
Citas
- ↑ Kitcher y Salmon (2009) pág. 51
- 1 2 Efron 1978 .
- ↑ van de Schoot, Rens; Depaoli, Sarah; King, Ruth; Kramer, Bianca; Märtens, Kaspar; Tadesse, Mahlet G. ; Vannucci, Marina; Gelman, Andrew; Veen, Duco; Willemsen, Joukje; Yau, Christopher (2021-01-14). "Estadística y modelado bayesiano" . Nature Reviews Methods Primers . 1 (1). doi : 10.1038/s43586-020-00001-2 . hdl : 20.500.11820/9fc72a0b-33e4-4a9c-bdb7-d88dab16f621 . ISSN 2662-8449 .
- ↑ Bandyopadhyay y Forster 2011 .
- 1 2 3 4 Lehmann 2011 .
- 1 2 3 Gigerenzer et al. 1989 .
- 1 2 Louçã 2008 .
- ↑ Fisher 1956 .
- ↑ Neyman y Pearson 1933 .
- ↑ Neyman y Pearson 1967 .
- ↑ Rubin, M (2020). "«¿Muestreo repetido de la misma población?» Una crítica a las respuestas de Neyman y Pearson a Fisher . Revista Europea de Filosofía de la Ciencia . 10 (42): 1– 15. doi : 10.1007/s13194-020-00309-6 . S2CID 221939887 .
- ↑ Fisher 1955 .
- ↑ Neyman 1956 .
- 1 2 3 Lehmann 1993 .
- ↑ Lenhard 2006 .
- ↑ Halpin y Stam 2006 .
- ↑ Lehmann y Romano 2005 .
- ^ Hubbard y Bayarri c. 2003 .
- ↑ Sotos et al. 2007 .
- ↑ Fienberg 2006 .
- ↑ de Finetti 1964 .
- 1 2 Jeffreys 1939 .
- ↑ Savage 1972 .
- 1 2 3 4 Efron 2013 .
- 1 2 Pequeño 2006 .
- ↑ Yu 2009 .
- ↑ Berger 2003 .
- ↑ Mayo de 2013 .
- ↑ Senn 2011 .
- 1 2 Gelman y Shalizi 2012 .
- 1 2 3 Cox 2005 .
- ↑ Bernardo 2008 .
- ↑ Kass c. 2012 .
- 1 2 Gelman 2008 .
- 1 2 Edwards 1999 .
- ↑ Aldrich 2002 .
- ↑ Birnbaum 1962 .
- ↑ Birnbaum, A., (1970) Métodos estadísticos en la inferencia científica. Nature , 225, 14 de marzo de 1970, págs. 1033.
- ^ Giere, R. (1977) La concepción de la evidencia estadística de Allan Birnbaum. Síntesis , 36, pp.5-13.
- ↑ Backe 1999 .
- ↑ Forster y Sober 2001 .
- ↑ Royall 1997 .
- ↑ Lindley 2000 .
- ↑ Gelman. "Red-blue talk UBC" (PDF) . Estadística. Universidad de Columbia.
- ↑ Tabachnick y Fidell 1996 .
- ↑ Forster y Sober 1994 .
- ↑ Freedman 1995 .
- ↑ Breiman 2001 .
- ↑ Chin nd .
- ↑ Abelson, Robert P. (1995). Statistics as Principled Argument . Lawrence Erlbaum Associates. ISBN 978-0-8058-0528-4...
el propósito de la estadística es organizar un argumento útil a partir de evidencia cuantitativa, utilizando una forma de retórica basada en principios.
Referencias
- Aldrich, John (2002). "Cómo la probabilidad y la identificación se volvieron bayesianas" (PDF) . International Statistical Review . 70 (1): 79– 98. doi : 10.1111/j.1751-5823.2002.tb00350.x . S2CID 15435919 .
- Backe, Andrew (1999). "El principio de probabilidad y la fiabilidad de los experimentos". Filosofía de la Ciencia . 66 : S354– S361. doi : 10.1086/392737 . S2CID 15822883 .
- Bandyopadhyay, Prasanta; Forster, Malcolm, eds. (2011). Filosofía de la estadística . Manual de filosofía de la ciencia. Vol. 7. Oxford: North-Holland. ISBN 978-0444518620.El texto es una colección de ensayos.
- Berger, James O. (2003). "¿Podrían Fisher, Jeffreys y Neyman haber coincidido en las pruebas?" . Statistical Science . 18 (1): 1– 32. doi : 10.1214/ss/1056397485 .
- Bernardo, Jose M. (2008). "Comentario sobre el artículo de Gelman" . Análisis Bayesiano . 3 (3): 453. doi : 10.1214/08-BA318REJ .
- Birnbaum, A. (1962). "Sobre los fundamentos de la inferencia estadística". J. Amer. Statist. Assoc . 57 (298): 269– 326. doi : 10.1080/01621459.1962.10480660 .
- Breiman, Leo (2001). "Modelado estadístico: las dos culturas" . Ciencia estadística . 16 (3): 199– 231. doi : 10.1214/ss/1009213726 .
- Chin, Wynne W. (s.f.). "Modelado de ecuaciones estructurales en la investigación de sistemas de información: comprensión de la perspectiva de LISREL y PLS" . Archivado del original el 20 de julio de 2011. Recuperado el 16 de septiembre de 2013 .¿Apuntes de clase de la Universidad de Houston?
- Cox, DR (2005). "Estadística frecuentista y bayesiana: una crítica". Problemas estadísticos en física de partículas, astrofísica y cosmología . PHYSTAT05. CiteSeerX 10.1.1.173.4608 .
- de Finetti, Bruno (1964). «Prospectiva: sus leyes lógicas, sus fuentes subjetivas». En Kyburg, HE (ed.). Estudios sobre probabilidad subjetiva . HE Smokler. Nueva York: Wiley. pp. 93–158 . Traducción del original francés de 1937 con notas posteriores añadidas.
- Edwards, AWF (1999). "Probabilidad" . Archivado del original el 26 de enero de 2020. Recuperado el 16 de septiembre de 2013 .Versión preliminar de un artículo para la Enciclopedia Internacional de las Ciencias Sociales y del Comportamiento.
- Efron, Bradley (2013). "Un argumento de 250 años: Creencia, comportamiento y el bootstrap" . Boletín de la Sociedad Matemática Americana . Nueva Serie. 50 (1): 129– 146. doi : 10.1090/s0273-0979-2012-01374-5 .
- Efron, Bradley (1978). «Controversias en los fundamentos de la estadística» (PDF) . The American Mathematical Monthly . 85 (4): 231– 246. doi : 10.2307/2321163 . JSTOR 2321163. Archivado del original (PDF) el 14 de julio de 2010. Recuperado el 1 de noviembre de 2012 .
- Fienberg, Stephen E. (2006). "¿Cuándo se convirtió la inferencia bayesiana en "bayesiana"?" . Análisis bayesiano . 1 (1): 1– 40. doi : 10.1214/06-ba101 .
- Fisher, RA (1925). Métodos estadísticos para investigadores . Edimburgo: Oliver and Boyd.
- Fisher, Sir Ronald A. (1935). Diseño de experimentos . Edimburgo: Oliver and Boyd.
- Fisher, R. (1955). "Métodos estadísticos e inducción científica" (PDF) . Journal of the Royal Statistical Society, Serie B. 17 ( 1): 69– 78. doi : 10.1111/j.2517-6161.1955.tb00180.x .
- Fisher, Sir Ronald A. (1956). La lógica de la inferencia científica . Edimburgo: Oliver and Boyd.
- Forster, Malcolm; Sober, Elliott (1994). "Cómo determinar cuándo las teorías más simples, más unificadas o menos ad hoc proporcionarán predicciones más precisas". British Journal for the Philosophy of Science . 45 (1): 1– 36. doi : 10.1093/bjps/45.1.1 .
- Forster, Malcolm; Sober, Elliott (2001). "Por qué la probabilidad". Probabilidad y evidencia : 89–99 .
- Freedman, David (marzo de 1995). "Algunas cuestiones en los fundamentos de la estadística". Fundamentos de la ciencia . 1 (1): 19– 39. doi : 10.1007/BF00208723 .
- Gelman, Andrew (2008). "Rejoinder" . Bayesian Analysis . 3 (3): 467– 478. doi : 10.1214/08-BA318REJ .– Una broma se convirtió en una seria discusión sobre problemas bayesianos entre 5 autores (Gelman, Bernardo, Kadane, Senn, Wasserman) en las páginas 445–478.
- Gelman, Andrew; Shalizi, Cosma Rohilla (2012). "Filosofía y práctica de la estadística bayesiana" . British Journal of Mathematical and Statistical Psychology . 66 (1): 8– 38. arXiv : 1006.3868 . doi : 10.1111 / j.2044-8317.2011.02037.x . PMC 4476974. PMID 22364575 .
- Gigerenzer, Gerd ; Swijtink, Zeno; Porter, Theodore; Daston, Lorraine; Beatty, John; Kruger, Lorenz (1989). «Parte 3: Los expertos en inferencia». El imperio del azar: cómo la probabilidad cambió la ciencia y la vida cotidiana . Cambridge University Press. págs. 70-122 . ISBN 978-0-521-39838-1.
- Halpin, PF; Stam, HJ (Invierno 2006). "Inferencia inductiva o comportamiento inductivo: Fisher y Neyman: Enfoques de Pearson sobre las pruebas estadísticas en la investigación psicológica (1940-1960)". The American Journal of Psychology . 119 (4): 625– 653. doi : 10.2307/20445367 . JSTOR 20445367. PMID 17286092 .
- Hubbard, Raymond; Bayarri, MJ (c. 2003). " Los valores p no son probabilidades de error" (PDF) . Archivado del original (PDF) el 4 de septiembre de 2013. Recuperado el 3 de septiembre de 2013 .– Un documento de trabajo que explica la diferencia entre el valor p de evidencia de Fisher y la tasa de error de tipo I de Neyman-Pearson..
- Jeffreys, H. (1939). La teoría de la probabilidad . Oxford University Press.
- Kass (c. 2012). "¿Por qué la regla de Bayes no solo ha captado la atención de tanta gente, sino que ha inspirado una devoción religiosa y controversia, repetidamente, a lo largo de muchos años?" (PDF) .
- Lehmann, EL (diciembre de 1993). "Las teorías de Fisher, Neyman-Pearson sobre la prueba de hipótesis: ¿Una teoría o dos?". Journal of the American Statistical Association . 88 (424): 1242– 1249. doi : 10.1080/01621459.1993.10476404 .
- Lehmann, EL (2011). Fisher, Neyman y la creación de la estadística clásica . Nueva York: Springer. ISBN 978-1441994998.
- Lehmann, EL; Romano, Joseph P. (2005). Prueba de hipótesis estadísticas (3.ª ed.). Nueva York: Springer. ISBN 978-0-387-98864-1.
- Lenhard, Johannes (2006). "Modelos e inferencia estadística: la controversia entre Fisher y Neyman-Pearson". Br. J. Philos. Sci . 57 (1): 69– 91. CiteSeerX 10.1.1.399.1622 . doi : 10.1093/bjps/axi152 . JSTOR 3541653 .
- Lindley, DV (2000). "La filosofía de la estadística". Journal of the Royal Statistical Society, Serie D. 49 ( 3): 293– 337. doi : 10.1111/1467-9884.00238 .
- Little, Roderick J. (2006). "Calibrated Bayes: A Bayes / frequentist roadmap". The American Statistician . 60 (3): 213– 223. doi : 10.1198/000313006X117837 . JSTOR 27643780 . S2CID 53505632 .
- Louçã, Francisco (2008). "Should The Widest Cleft in Statistics-How and Why Fisher against Neyman and Pearson" (PDF) .El documento de trabajo contiene numerosas citas de las fuentes de la controversia.
- Mayo, Deborah G. (febrero de 2013). "Discusión: Métodos bayesianos: ¿Aplicados? Sí. ¿Defensa filosófica? En constante cambio". The American Statistician . 67 (1): 11– 15. doi : 10.1080/00031305.2012.752410 . S2CID 11215443 .
- Neyman, J.; Pearson , ES (1 de enero de 1933). "Sobre el problema de las pruebas más eficientes de hipótesis estadísticas" . Phil. Trans. R. Soc. Lond. A. 231 ( 694–706 ) : 289–337 . Bibcode : 1933RSPTA.231..289N . doi : 10.1098/rsta.1933.0009 .
- Neyman, J.; Pearson, ES (1967). Artículos estadísticos conjuntos de J. Neyman y ES Pearson . Cambridge University Press.
- Neyman, Jerzy (1956). "Nota sobre un artículo de Sir Ronald Fisher". Journal of the Royal Statistical Society, Serie B. 18 ( 2): 288– 294. doi : 10.1111/j.2517-6161.1956.tb00236.x .
- Royall, Richard (1997). Evidencia estadística: un paradigma de probabilidad . Chapman & Hall . ISBN 978-0412044113.
- Savage, LJ (1972) [1954]. Fundamentos de estadística (segunda edición).
- Senn, Stephen (2011). "Puede que creas que eres bayesiano, pero probablemente te equivoques". RMM . 2 : 48–66 .
- Sotos, Ana Elisa Castro; van Hoof, Stijn; van den Noortgate, Wim; Onghena, Patrick (2007). "Concepciones erróneas de los estudiantes sobre la inferencia estadística: una revisión de la evidencia empírica de la investigación sobre la enseñanza de la estadística" . Educational Research Review . 2 (2): 98– 113. doi : 10.1016/j.edurev.2007.04.001 .
- Stuart, A.; Ord, JK (1994). Teoría avanzada de la estadística de Kendall . Vol. I: Teoría de la distribución. Edward Arnold.
- Tabachnick, Barbara G.; Fidell, Linda S. (1996). Uso de estadísticas multivariantes (3.ª ed.). HarperCollins College Publishers. ISBN 978-0-673-99414-1El método de componentes principales es un enfoque empírico ,
mientras que el análisis factorial y el modelado de ecuaciones estructurales tienden a ser enfoques teóricos. (p. 27)
- Yu, Yue (2009). "Bayesiano vs. Frecuentista" (PDF) .– ¿Apuntes de clase? Universidad de Illinois en Chicago
Lecturas adicionales
- Barnett, Vic (1999). Inferencia estadística comparativa (3.ª ed.). Wiley. ISBN 978-0-471-97643-1.
- Cox, David R. (2006). Principios de inferencia estadística . Cambridge University Press. ISBN 978-0-521-68567-2.
- Efron, Bradley (1986), "¿Por qué no todos son bayesianos? (con discusión)", The American Statistician , 40 (1): 1– 11, doi : 10.2307/2683105 , JSTOR 2683105 .
- Good, IJ (1988), "La interfaz entre la estadística y la filosofía de la ciencia", Statistical Science , 3 (4): 386–397 , doi : 10.1214/ss/1177012754 , JSTOR 2245388
- Kadane, JB ; Schervish, MJ; Seidenfeld, T. (1999). Repensando los fundamentos de la estadística . Cambridge University Press. Bibcode : 1999rfs..book.....K .– Bayesiano.
- Mayo, Deborah G. (1992), "¿Pearson rechazó la filosofía de la estadística de Neyman-Pearson?", Synthese , 90 (2): 233– 262, doi : 10.1007/BF00485352 , S2CID 14236921 .
Enlaces externos
- "Interpretaciones de la probabilidad" . Interpretación de la probabilidad . Enciclopedia de Filosofía de Stanford. Palo Alto, CA: Universidad de Stanford. 2019.
- Filosofía de la estadística . Enciclopedia de Filosofía de Stanford. Palo Alto, California: Universidad de Stanford. 2022.
- Filosofía de la estadística