Articulo de referencia

Relación espuria

Modelo gráfico : Mientras que un mediador es un factor en la cadena causal (arriba), un factor de confusión es un factor espurio que implica causalidad de forma incorrecta (abaj...

Modelo gráfico : Mientras que un mediador es un factor en la cadena causal (arriba), un factor de confusión es un factor espurio que implica causalidad de forma incorrecta (abajo).

En estadística , una relación espuria o correlación espuria [ 1 ] [ 2 ] es una relación matemática en la que dos o más eventos o variables están asociados pero no están relacionados causalmente , debido a la coincidencia o a la presencia de un tercer factor no visto (conocido como "variable de respuesta común", "factor de confusión" o " variable oculta ").

Ejemplos

Un ejemplo de relación espuria se encuentra en la literatura sobre series temporales , donde una regresión espuria proporciona evidencia estadística engañosa de una relación lineal entre variables independientes no estacionarias . De hecho, la no estacionariedad puede deberse a la presencia de una raíz unitaria en ambas variables. [ 3 ] [ 4 ] En particular, es probable que dos variables económicas nominales cualesquiera estén correlacionadas entre sí, incluso cuando ninguna tenga un efecto causal sobre la otra, porque cada una es igual a una variable real multiplicada por el nivel de precios , y la presencia común del nivel de precios en ambas series de datos les confiere correlación. (Véase también correlación espuria de razones ).

Otro ejemplo de relación espuria se observa al examinar las ventas de helados en una ciudad . Es posible que las ventas sean más altas cuando la tasa de ahogamientos en las piscinas municipales también lo sea. Afirmar que las ventas de helados causan ahogamientos, o viceversa, implicaría una relación espuria entre ambos. En realidad, una ola de calor podría haber causado ambos fenómenos. La ola de calor es un ejemplo de variable oculta o invisible, también conocida como variable de confusión .

Otro ejemplo comúnmente mencionado es una serie de estadísticas holandesas que muestran una correlación positiva entre el número de cigüeñas que anidan en una serie de primaveras y el número de bebés humanos nacidos en ese momento. Por supuesto, no había una relación causal; la correlación se debía únicamente a dos coincidencias independientes. Durante la era pagana, que se remonta al menos a la Edad Media, hace más de 600 años, era común que las parejas se casaran durante el solsticio de verano, ya que el verano se asociaba con la fertilidad. Al mismo tiempo, las cigüeñas comenzaban su migración anual, volando desde Europa hasta África. Las aves regresaban la primavera siguiente, exactamente nueve meses después. [ 5 ]

En casos raros, puede ocurrir una relación espuria entre dos variables completamente no relacionadas sin ninguna variable de confusión, como fue el caso entre el éxito del equipo de fútbol americano profesional Washington Commanders en un juego específico antes de cada elección presidencial y el éxito del partido político del presidente en ejercicio en dicha elección. Durante 16 elecciones consecutivas entre 1940 y 2000, la Regla de los Redskins coincidió correctamente si el partido político del presidente en ejercicio retendría o perdería la Presidencia. La regla finalmente falló poco después de que Elias Sports Bureau descubriera la correlación en 2000; en 2004, 2012 y 2016, los resultados del juego de los Commanders y la elección no coincidieron. [ 6 ] [ 7 ] [ 8 ] En una relación espuria similar que involucra a la Liga Nacional de Fútbol Americano, en la década de 1970, Leonard Koppett notó una correlación entre la dirección del mercado de valores y la conferencia ganadora del Super Bowl de ese año , el indicador del Super Bowl ; La relación se mantuvo durante la mayor parte del siglo XX antes de volver a un comportamiento más aleatorio en el siglo XXI. [ 9 ]

Prueba de hipótesis

A menudo se prueba una hipótesis nula de no correlación entre dos variables y se opta de antemano por rechazarla si la correlación calculada a partir de una muestra de datos se hubiera producido en menos del 5 % de las muestras si la hipótesis nula fuera verdadera. Si bien una hipótesis nula verdadera se acepta el 95 % de las veces, en el 5 % restante, una hipótesis nula verdadera de no correlación (correlación cero) se rechaza erróneamente, lo que lleva a aceptar una correlación espuria (un evento conocido como error de tipo I ). En este caso, la correlación espuria en la muestra se debe a la selección aleatoria de una muestra que no refleja las propiedades reales de la población subyacente.

Detección de relaciones espurias

El término "relación espuria" se usa comúnmente en estadística y, en particular, en técnicas de investigación experimental , ya que ambas buscan comprender y predecir relaciones causales directas (X → Y). Una correlación no causal puede crearse espuriamente por un antecedente que causa ambas relaciones (W → X y W → Y). Las variables mediadoras (X → M → Y), si no se detectan, estiman un efecto total en lugar de un efecto directo sin ajustar por la variable mediadora M. Por lo tanto, las correlaciones identificadas experimentalmente no representan relaciones causales a menos que se puedan descartar las relaciones espurias.

Experimentos

En los experimentos, las relaciones espurias a menudo se pueden identificar controlando otros factores, incluidos aquellos que se han identificado teóricamente como posibles factores de confusión. Por ejemplo, consideremos a un investigador que intenta determinar si un nuevo fármaco mata las bacterias; cuando el investigador aplica el fármaco a un cultivo bacteriano, las bacterias mueren. Pero para ayudar a descartar la presencia de una variable de confusión, otro cultivo se somete a condiciones lo más parecidas posible a las del primer cultivo mencionado, pero este segundo cultivo no se somete al fármaco. Si existe un factor de confusión oculto en esas condiciones, este cultivo de control también morirá, por lo que no se puede extraer ninguna conclusión sobre la eficacia del fármaco a partir de los resultados del primer cultivo. Por otro lado, si el cultivo de control no muere, entonces el investigador no puede rechazar la hipótesis de que el fármaco es eficaz.

Análisis estadísticos no experimentales

Las disciplinas cuyos datos son mayoritariamente no experimentales, como la economía , suelen emplear datos observacionales para establecer relaciones causales. El conjunto de técnicas estadísticas utilizadas en economía se denomina econometría . El principal método estadístico en econometría es el análisis de regresión multivariable . Típicamente, una relación lineal como

y=a0+a1incógnita1+a2incógnita2++akincógnitak+mi{\displaystyle y=a_{0}+a_{1}x_{1}+a_{2}x_{2}+\cdots +a_{k}x_{k}+e}

Se plantea la hipótesis de que, en la cualy{\displaystyle y}es la variable dependiente (se hipotetiza que es la variable causal),incógnitaj{\displaystyle x_{j}}para j  =  1,  ..., k es la j -ésima variable independiente (que se hipotetiza que es una variable causal), y mi{\displaystyle e}es el término de error (que contiene los efectos combinados de todas las demás variables causales, las cuales deben estar descorrelacionadas con las variables independientes incluidas). Si hay motivos para creer que ninguna de lasincógnitaj{\displaystyle x_{j}}s es causado por y , entonces estimaciones de los coeficientesaj{\displaystyle a_{j}}se obtienen. Si la hipótesis nula es queaj=0{\displaystyle a_{j}=0}Si se rechaza, entonces la hipótesis alternativa es queaj0{\displaystyle a_{j}\neq 0}y equivalentemente queincógnitaj{\displaystyle x_{j}}causa y no puede rechazarse. Por otro lado, si la hipótesis nula queaj=0{\displaystyle a_{j}=0}no puede rechazarse, entonces equivalentemente la hipótesis de que no existe efecto causal deincógnitaj{\displaystyle x_{j}}en y no se puede rechazar. Aquí la noción de causalidad es una de causalidad contributiva : si el valor verdaderoaj0{\displaystyle a_{j}\neq 0}, luego un cambio enincógnitaj{\displaystyle x_{j}}dará como resultado un cambio en y a menos que alguna otra variable causal, ya sea incluida en la regresión o implícita en el término de error, cambie de tal manera que compense exactamente su efecto; por lo tanto, un cambio enincógnitaj{\displaystyle x_{j}}no es suficiente para cambiar y . Del mismo modo, un cambio en incógnitaj{\displaystyle x_{j}}no es necesario cambiar y , porque un cambio en y podría ser causado por algo implícito en el término de error (o por alguna otra variable explicativa causal incluida en el modelo).

El análisis de regresión controla otras variables relevantes incluyéndolas como regresores (variables explicativas). Esto ayuda a evitar inferencias erróneas de causalidad debido a la presencia de una tercera variable subyacente que influye tanto en la variable potencialmente causal como en la variable potencialmente causada: su efecto sobre la variable potencialmente causada se captura al incluirla directamente en la regresión, de modo que ese efecto no se detectará como un efecto espurio de la variable potencialmente causal de interés. Además, el uso de la regresión multivariante ayuda a evitar inferir erróneamente que un efecto indirecto de, por ejemplo , x 1 (p. ej., x 1x 2y ) es un efecto directo ( x 1y ).

Así como un experimentador debe tener cuidado de emplear un diseño experimental que controle todos los factores de confusión, el usuario de la regresión múltiple también debe tener cuidado de controlar todos los factores de confusión incluyéndolos entre los regresores. Si se omite un factor de confusión de la regresión, su efecto se captura en el término de error por defecto, y si el término de error resultante está correlacionado con uno (o más) de los regresores incluidos, entonces la regresión estimada puede estar sesgada o ser inconsistente (véase sesgo por variable omitida ).

Además del análisis de regresión, los datos pueden examinarse para determinar si existe causalidad de Granger . La presencia de causalidad de Granger indica que x precede a y , y que x contiene información única sobre y . 

Otras relaciones

Existen otras relaciones definidas en el análisis estadístico, como se indica a continuación.

Véase también

Literatura

  • David A. Freedman (1983) Una nota sobre ecuaciones de regresión de selección, The American Statistician, 37:2, 152–155, DOI: 10.1080/00031305.1983.10482729

Notas a pie de página

  1. Burns, William C., " Correlaciones espurias ", 1997.
  2. Pearl, Judea . "Serie de conferencias de investigación del profesorado de la UCLA número 81" . singapore.cs.ucla.edu . Consultado el 10 de noviembre de 2019 .
  3. Yule, G. Udny (1926-01-01). "¿Por qué a veces obtenemos correlaciones sin sentido entre series temporales? Un estudio sobre el muestreo y la naturaleza de las series temporales". Journal of the Royal Statistical Society . 89 (1): 1– 63. doi : 10.2307/2341482 . JSTOR 2341482. S2CID 126346450 .  
  4. Granger, Clive WJ; Ghysels, Eric; Swanson, Norman R.; Watson, Mark W. (2001). Ensayos de econometría: Obras completas de Clive WJ Granger . Cambridge University Press. ISBN 978-0-521-79649-1.
  5. Sapsford, Roger; Jupp, Victor, eds. (2006). Recopilación y análisis de datos . Sage. ISBN 978-0-7619-4362-4.
  6. ^ Hofheimer, Bill (30 de octubre de 2012). "«Los Redskins mandan»: Hirdt de MNF habla sobre la intersección entre el fútbol americano y la política . ESPN . Consultado el 16 de octubre de 2016 .
  7. Manker, Rob (7 de noviembre de 2012). "Los Redskins mandan: la victoria de Barack Obama sobre Mitt Romney le cuesta su primera derrota al predictor presidencial" . Chicago Tribune . Consultado el 8 de noviembre de 2012 .
  8. Pohl, Robert S. (2013). Leyendas urbanas y tradiciones históricas de Washington . The History Press. págs. 78–80 . ISBN  978-1-62584-664-8.
  9. Don Peppers. "Big Data. Super Bowl. Mentes pequeñas" . Consultado el 31 de diciembre de 2015 .

Referencias

  • Gumbel, EJ (1926), "Correlación espuria y su importancia para la fisiología", Journal of the American Statistical Association , 21 (154): 179– 194, doi : 10.1080/01621459.1926.10502169
  • Banerjee, A.; Dolado, J.; Galbraith, JW; Hendry, DF (1993). Co-Integración, corrección de errores y análisis econométrico de datos no estacionarios . Oxford University Press. pp. 70–81 . ISBN  978-0-19-828810-7.
  • Pearl, Judea (2000). Causalidad: Modelos, razonamiento e inferencia . Cambridge University Press. ISBN 978-0-521-77362-1.
  • https://www.tylervigen.com/spurious-correlations , un sitio web que enumera ejemplos de correlaciones espurias.