Articulo de referencia

Regresión hacia la media

Configuración experimental de Galton "Esquema eugenésico estándar de descendencia" – aplicación temprana de la idea de Galton [ 1 ] En estadística , la regresión a la media (tam...

Configuración experimental de Galton
"Esquema eugenésico estándar de descendencia" – aplicación temprana de la idea de Galton [ 1 ]

En estadística , la regresión a la media (también llamada regresión a la media , reversión a la media y reversión a la mediocridad ) es el fenómeno por el cual, si una muestra de una variable aleatoria es extrema , es probable que la siguiente muestra de la misma variable aleatoria esté más cerca de su media . [ 2 ] [ 3 ] [ 4 ] Además, cuando se muestrean muchas variables aleatorias y se seleccionan intencionalmente los resultados más extremos, se refiere al hecho de que (en muchos casos) una segunda muestra de estas variables seleccionadas dará como resultado resultados "menos extremos", más cercanos a la media inicial de todas las variables.

Matemáticamente, la intensidad de este efecto de "regresión" depende de si todas las variables aleatorias provienen de la misma distribución o si existen diferencias reales en las distribuciones subyacentes de cada variable aleatoria. En el primer caso, es estadísticamente probable que se produzca el efecto de "regresión", pero en el segundo, puede ser menos intenso o incluso inexistente.

La regresión a la media es, por lo tanto, un concepto útil a considerar al diseñar cualquier experimento científico, análisis de datos o prueba que seleccione intencionalmente los eventos más extremos; indica que pueden ser útiles verificaciones posteriores para evitar llegar a conclusiones erróneas sobre estos eventos, ya que podrían ser eventos extremos genuinos, una selección completamente sin sentido debido al ruido estadístico o una combinación de ambos casos. [ 5 ]

Ejemplos conceptuales

Ejemplo sencillo: estudiantes haciendo un examen

Consideremos una clase de estudiantes que realizan una prueba de verdadero/falso de 100 preguntas sobre un tema. Supongamos que todos los estudiantes eligen aleatoriamente todas las preguntas. Entonces, la puntuación de cada estudiante sería una realización de un conjunto de variables aleatorias independientes e idénticamente distribuidas , con una media esperada de 50. Naturalmente, algunos estudiantes obtendrán puntuaciones sustancialmente superiores a 50 y otros sustancialmente inferiores a 50 simplemente por azar. Si se selecciona solo el 10% de los estudiantes con las puntuaciones más altas y se les aplica una segunda prueba en la que nuevamente eligen aleatoriamente todas las preguntas, se esperaría que la puntuación media volviera a estar cerca de 50. Por lo tanto, la media de estos estudiantes "regresaría" hasta la media de todos los estudiantes que realizaron la prueba original. Independientemente de la puntuación que obtenga un estudiante en la prueba original, la mejor predicción de su puntuación en la segunda prueba es 50.

Si la elección de las respuestas a las preguntas del examen no fuera aleatoria, es decir, si no interviniera la suerte (buena o mala) ni el azar en las respuestas proporcionadas por los estudiantes, entonces se esperaría que todos los estudiantes obtuvieran la misma puntuación en el segundo examen que en el examen original, y no habría regresión a la media.

La mayoría de las situaciones realistas se sitúan entre estos dos extremos: por ejemplo, se podría considerar que las calificaciones de un examen son una combinación de habilidad y suerte . En este caso, el subconjunto de estudiantes con calificaciones superiores a la media estaría compuesto por aquellos que eran hábiles y no tuvieron mala suerte, junto con aquellos que no eran hábiles, pero sí tuvieron muchísima suerte. En una segunda prueba para este subconjunto, es improbable que los menos hábiles repitan su golpe de suerte, mientras que los hábiles tendrán una segunda oportunidad de tener mala suerte. Por lo tanto, es improbable que quienes obtuvieron buenos resultados anteriormente obtengan resultados igual de buenos en la segunda prueba, incluso si la original no se puede replicar.

El siguiente es un ejemplo de este segundo tipo de regresión a la media. Un grupo de estudiantes realiza dos ediciones del mismo examen en dos días consecutivos. Se ha observado con frecuencia que los estudiantes con peor desempeño el primer día tienden a mejorar sus puntuaciones el segundo día, y los que mejor desempeño el primer día tienden a empeorar el segundo día. Este fenómeno se produce porque las puntuaciones de los estudiantes están determinadas en parte por su capacidad innata y en parte por el azar. En el primer examen, algunos tendrán suerte y obtendrán una puntuación superior a su capacidad, y otros tendrán mala suerte y obtendrán una puntuación inferior. Algunos de los estudiantes afortunados en el primer examen volverán a tener suerte en el segundo, pero la mayoría obtendrá puntuaciones promedio o inferiores a la media. Por lo tanto, un estudiante que tuvo suerte y superó su capacidad en el primer examen tiene más probabilidades de obtener una puntuación peor en el segundo examen que una mejor. De manera similar, los estudiantes que, por mala suerte, obtienen una puntuación inferior a su capacidad en el primer examen tenderán a ver aumentar sus puntuaciones en el segundo. Cuanto mayor sea la influencia de la suerte en la producción de un evento extremo, menos probable será que la suerte se repita en múltiples eventos.

Otros ejemplos

Si tienes un conjunto de bolas verdes y otro de bolas azules, y eliges una bola hasta tener seis, hay una probabilidad de 1/64 de que tengas seis bolas verdes, una probabilidad de 6/64 de que tengas cinco bolas verdes y una azul, una probabilidad de 15/64 de que tengas cuatro bolas verdes y dos azules, y una probabilidad de 20/64 de que tengas tres bolas verdes y tres azules. Si tomas un conjunto diferente de bolas, es más probable que aproximadamente la mitad de las bolas sean del mismo color.

Si tu equipo deportivo favorito ganó el campeonato el año pasado, ¿qué significa eso para sus posibilidades de ganar la próxima temporada? En la medida en que este resultado se deba a la habilidad (el equipo está en buenas condiciones, cuenta con un entrenador de primer nivel, etc.), su victoria indica que es más probable que vuelvan a ganar el año que viene. Pero cuanto mayor sea la influencia de la suerte (otros equipos involucrados en un escándalo de dopaje, un sorteo favorable, selecciones del draft que resultaron productivas, etc.), menos probable será que vuelvan a ganar el año que viene. [ 6 ]

Si una organización empresarial tiene un trimestre muy rentable, a pesar de que las razones subyacentes de su rendimiento no hayan cambiado, es probable que tenga un rendimiento inferior en el trimestre siguiente. [ 7 ]

Los jugadores de béisbol que batean bien en su temporada de novatos suelen tener un rendimiento peor en la segunda; el llamado " bajón del segundo año ". De manera similar, la regresión a la media explica la maldición de la portada de Sports Illustrated : los períodos de rendimiento excepcional que resultan en un reportaje en la portada suelen ir seguidos de períodos de rendimiento más mediocre, lo que da la impresión de que aparecer en la portada provoca el declive de un atleta. [ 8 ]

Historia

Descubrimiento

Ilustración de Francis Galton de 1886 sobre la correlación entre las alturas de los adultos y sus padres. [ 9 ] La observación de que las alturas de los hijos adultos tendían a desviarse menos de la altura media que las de sus padres sugirió el concepto de "regresión a la media", dando nombre al análisis de regresión .

El concepto de regresión proviene de la genética y fue popularizado por Sir Francis Galton a finales del siglo XIX con la publicación de *Regresión hacia la mediocridad en la estatura hereditaria* . [ 9 ] Galton observó que las características extremas (por ejemplo, la altura) en los padres no se transmiten completamente a su descendencia. Más bien, las características en la descendencia regresan hacia un punto medio (un punto que desde entonces se ha identificado como la media). Al medir las alturas de cientos de personas, pudo cuantificar la regresión a la media y estimar la magnitud del efecto. Galton escribió que "la regresión promedio de la descendencia es una fracción constante de sus respectivas desviaciones promedio de los padres ". Esto significa que la diferencia entre un hijo y sus padres para alguna característica es proporcional a la desviación de sus padres con respecto a las personas típicas de la población. Si sus padres son dos pulgadas más altos que el promedio para hombres y mujeres, entonces, en promedio, la descendencia será más baja que sus padres por algún factor (que, hoy, llamaríamos uno menos el coeficiente de regresión ) multiplicado por dos pulgadas. En cuanto a la estatura, Galton estimó que este coeficiente era de aproximadamente 2/3: la estatura de un individuo se medirá alrededor de un punto medio que representa dos tercios de la desviación de los padres con respecto al promedio de la población.

Galton también publicó estos resultados [ 10 ] utilizando el ejemplo más sencillo de perdigones que caen a través de un tablero de Galton para formar una distribución normal centrada directamente debajo de su punto de entrada. Estos perdigones podrían luego ser liberados en una segunda galería correspondiente a una segunda medición. Galton entonces planteó la pregunta inversa: "¿De dónde vinieron estos perdigones?"

La respuesta no fue " en promedio, directamente encima " . Más bien fue " en promedio, más hacia el centro " , por la sencilla razón de que había más bolitas por encima, hacia el centro, que podían desviarse hacia la izquierda que en el extremo izquierdo que podían desviarse hacia la derecha, hacia adentro. [ 11 ]

Uso en evolución del término

Galton acuñó el término «regresión» para describir un hecho observable en la herencia de rasgos genéticos cuantitativos multifactoriales : los rasgos de la descendencia de padres que se encuentran en los extremos de la distribución tienden a estar más cerca del centro, la media, de dicha distribución. Cuantificó esta tendencia y, al hacerlo, inventó el análisis de regresión lineal , sentando así las bases de gran parte del modelado estadístico moderno. Desde entonces, el término «regresión» se ha utilizado en otros contextos, y los estadísticos modernos pueden emplearlo para describir fenómenos como el sesgo de muestreo , que poco tienen que ver con las observaciones originales de Galton en el campo de la genética.

La explicación de Galton sobre el fenómeno de regresión que observó en biología fue la siguiente: «Un niño hereda en parte de sus padres y en parte de sus ancestros. En términos generales, cuanto más se remonta su genealogía, más numerosa y variada será su ascendencia, hasta que deje de diferir de cualquier muestra igualmente numerosa tomada al azar de la raza en general». [ 9 ] La afirmación de Galton requiere cierta aclaración a la luz del conocimiento de la genética: Los niños reciben material genético de sus padres, pero la información hereditaria (por ejemplo, los valores de los rasgos heredados) de ancestros anteriores puede transmitirse a través de sus padres (y puede que no se haya expresado en ellos). La media del rasgo puede no ser aleatoria y estar determinada por la presión selectiva, pero la distribución de los valores alrededor de la media refleja una distribución estadística normal.

Si dos padres comparten el mismo haplotipo y tienen un alelo dominante y un alelo recesivo para cada gen, entonces la mayoría de su descendencia tendrá un fenotipo intermedio, con algunos tendiendo hacia el fenotipo dominante o el fenotipo recesivo.

El fenómeno genético poblacional estudiado por Galton es un caso especial de "regresión a la media"; este término se utiliza a menudo para describir muchos fenómenos estadísticos en los que los datos presentan una distribución normal alrededor de una media.

Importancia

La regresión a la media es una consideración importante en el diseño de experimentos .

Consideremos un ejemplo hipotético de 1000 personas de edad similar examinadas y clasificadas según su riesgo de sufrir un infarto. Se podrían utilizar estadísticas para medir la eficacia de una intervención en las 50 personas con mayor riesgo, según una prueba con cierto grado de incertidumbre. La intervención podría consistir en un cambio en la dieta, ejercicio o un tratamiento farmacológico. Incluso si las intervenciones resultaran ineficaces, se esperaría que el grupo de prueba mostrara una mejoría en su siguiente examen físico, debido a la regresión a la media. La mejor manera de contrarrestar este efecto es dividir aleatoriamente al grupo en un grupo de tratamiento y un grupo de control. El tratamiento se consideraría eficaz solo si el grupo de tratamiento mejora más que el grupo de control.

Como alternativa, se podría evaluar a un grupo de niños desfavorecidos para identificar a aquellos con mayor potencial universitario. Se podría identificar al 1% superior y brindarles cursos de enriquecimiento especiales, tutorías, asesoramiento y acceso a computadoras. Incluso si el programa es efectivo, sus puntajes promedio podrían ser menores cuando se repita la prueba un año después. Sin embargo, en estas circunstancias, podría considerarse poco ético tener un grupo de control de niños desfavorecidos cuyas necesidades especiales se ignoran. Un cálculo matemático para la contracción puede ajustar este efecto, aunque no será tan confiable como el método del grupo de control (véase también el ejemplo de Stein ).

Este efecto también puede aprovecharse para la inferencia y estimación general. Es más probable que el lugar más caluroso del país hoy sea más fresco mañana que más caluroso, en comparación con hoy. Es más probable que el fondo de inversión con mejor rendimiento en los últimos tres años experimente una disminución en su rendimiento relativo en lugar de una mejora en los próximos tres años. Es probable que el actor de Hollywood más exitoso de este año tenga una recaudación menor, en lugar de mayor, por su próxima película. Es más probable que el jugador de béisbol con el promedio de bateo más alto a mitad de temporada tenga un promedio menor que un promedio mayor durante el resto de la temporada.

malentendidos

El concepto de regresión a la media puede utilizarse de forma incorrecta con mucha facilidad.

En el ejemplo de la prueba estudiantil anterior, se asumió implícitamente que lo que se medía no cambiaba entre las dos mediciones. Sin embargo, supongamos que el curso era de aprobado/reprobado y que los estudiantes debían obtener una puntuación superior a 70 en ambas pruebas para aprobar. En ese caso, los estudiantes que obtuvieron menos de 70 la primera vez no tendrían ningún incentivo para esforzarse y podrían obtener peores resultados en promedio la segunda vez. Por otro lado, los estudiantes que obtuvieron una puntuación ligeramente superior a 70 tendrían un fuerte incentivo para estudiar y concentrarse durante la prueba. En ese caso, se podría observar una tendencia a alejarse de 70, con puntuaciones inferiores disminuyendo y superiores aumentando. Es posible que los cambios entre los momentos de medición aumenten, compensen o inviertan la tendencia estadística a regresar a la media.

La regresión estadística hacia la media no es un fenómeno causal . Un estudiante con la peor puntuación en la prueba del primer día no necesariamente aumentará su puntuación sustancialmente el segundo día debido a este efecto. En promedio, los peores puntuadores mejoran, pero esto solo es cierto porque es más probable que hayan tenido mala suerte que suerte. En la medida en que una puntuación se determine aleatoriamente, o que una puntuación tenga variación o error aleatorio, en lugar de estar determinada por la capacidad académica del estudiante o ser un "valor verdadero", el fenómeno tendrá un efecto. Un error clásico en este sentido se dio en la educación. Se observó que los estudiantes que recibieron elogios por su buen trabajo obtuvieron peores resultados en la siguiente evaluación, y los estudiantes que fueron castigados por su mal trabajo obtuvieron mejores resultados en la siguiente evaluación. Los educadores decidieron dejar de elogiar y seguir castigando sobre esta base. [ 12 ] Tal decisión fue un error, porque la regresión hacia la media no se basa en la causalidad, sino en el error aleatorio en una distribución natural alrededor de una media.

Aunque las mediciones individuales extremas tienden a regresar a la media, la segunda muestra de mediciones no estará más cerca de la media que la primera. Consideremos nuevamente a los estudiantes. Supongamos que la tendencia de los individuos extremos es regresar un 10% a la media de 80, por lo que se espera que un estudiante que obtuvo 100 el primer día obtenga 98 el segundo día, y que un estudiante que obtuvo 70 el primer día obtenga 71 el segundo día. Estas expectativas están más cerca de la media que las puntuaciones del primer día. Sin embargo, las puntuaciones del segundo día variarán en torno a estas expectativas; algunas serán más altas y otras más bajas. Para los individuos extremos, esperamos que la segunda puntuación esté más cerca de la media que la primera, pero para todos los individuos, esperamos que la distribución de las distancias a la media sea la misma en ambos conjuntos de mediciones.

En relación con lo anterior, la regresión a la media funciona igual de bien en ambas direcciones. Esperamos que el estudiante con la puntuación más alta en el examen del segundo día haya obtenido peores resultados el primer día. Y si comparamos al mejor estudiante del primer día con el mejor estudiante del segundo día, independientemente de si se trata de la misma persona o no, no existe ninguna tendencia a la regresión a la media en ninguna dirección. Esperamos que las mejores puntuaciones de ambos días estén igualmente alejadas de la media.

falacias de regresión

Muchos fenómenos tienden a atribuirse a causas erróneas cuando no se tiene en cuenta la regresión a la media.

Un ejemplo extremo es el libro de Horace Secrist de 1933, *El triunfo de la mediocridad en los negocios* , en el que el profesor de estadística recopiló montañas de datos para demostrar que las tasas de ganancias de las empresas competitivas tienden hacia el promedio con el tiempo. De hecho, no existe tal efecto; la variabilidad de las tasas de ganancias es casi constante a lo largo del tiempo. Secrist solo había descrito la regresión común hacia la media. Un crítico exasperado, Harold Hotelling , comparó el libro con "demostrar la tabla de multiplicar colocando elefantes en filas y columnas, y luego haciendo lo mismo con muchos otros tipos de animales". [ 13 ]

El cálculo e interpretación de las "puntuaciones de mejora" en las pruebas educativas estandarizadas en Massachusetts probablemente constituye otro ejemplo de la falacia de la regresión. En 1999, se establecieron objetivos de mejora para las escuelas. Para cada escuela, el Departamento de Educación calculó la diferencia en la puntuación promedio obtenida por los estudiantes en 1999 y en 2000. Rápidamente se observó que la mayoría de las escuelas con peor desempeño habían alcanzado sus objetivos, lo que el Departamento de Educación interpretó como una confirmación de la validez de sus políticas. Sin embargo, también se observó que muchas de las supuestas mejores escuelas de la Commonwealth, como Brookline High School (con 18 finalistas de la Beca Nacional al Mérito), fueron declaradas como reprobadas. Como en muchos casos que involucran estadísticas y políticas públicas, el tema es objeto de debate, pero no se anunciaron "puntuaciones de mejora" en los años posteriores y los hallazgos parecen ser un caso de regresión a la media.

El psicólogo Daniel Kahneman , ganador del Premio Nobel de Economía de 2002 , señaló que la regresión a la media podría explicar por qué las reprimendas parecen mejorar el rendimiento, mientras que los elogios parecen tener un efecto contraproducente. [ 14 ]

Tuve la experiencia más gratificante de mi carrera al intentar enseñar a los instructores de vuelo que el elogio es más efectivo que el castigo para fomentar el aprendizaje de habilidades. Al terminar mi entusiasta discurso, uno de los instructores más experimentados del público levantó la mano y pronunció un breve discurso, que comenzó reconociendo que el refuerzo positivo podría ser bueno para las aves, pero luego negó que fuera óptimo para los cadetes de vuelo. Dijo: «En muchas ocasiones he elogiado a los cadetes por la ejecución impecable de alguna maniobra acrobática, y por lo general, cuando la repiten, lo hacen peor. Por otro lado, a menudo les he gritado por una mala ejecución, y por lo general lo hacen mejor la próxima vez. Así que, por favor, no nos digan que el refuerzo funciona y el castigo no, porque ocurre lo contrario». Fue un momento de alegría, en el que comprendí una verdad importante sobre el mundo: debido a que tendemos a recompensar a los demás cuando les va bien y a castigarlos cuando les va mal, y debido a la regresión a la media, es parte de la condición humana que estadísticamente seamos castigados por recompensar a los demás y recompensados ​​por castigarlos. Inmediatamente organicé una demostración en la que cada participante lanzó dos monedas a un objetivo situado a sus espaldas, sin recibir ninguna retroalimentación. Medimos las distancias al objetivo y pudimos observar que quienes habían obtenido mejores resultados la primera vez, en su mayoría, habían empeorado en su segundo intento, y viceversa. Pero sabía que esta demostración no desharía los efectos de una exposición de por vida a una contingencia perversa.

La falacia de la regresión también se explica en el libro de Rolf Dobelli , El arte de pensar con claridad .

Las políticas de las fuerzas del orden del Reino Unido han fomentado la colocación visible de radares de velocidad, tanto fijos como móviles, en puntos negros de accidentes . Esta política se justificaba por la percepción de que, tras la instalación de un radar, se producía una reducción correspondiente de los accidentes de tráfico graves . Sin embargo, los estadísticos han señalado que, si bien existe un beneficio neto en vidas salvadas, no tener en cuenta los efectos de la regresión a la media conlleva una sobreestimación de los efectos beneficiosos. [ 15 ] [ 16 ] [ 17 ]

Los analistas estadísticos reconocen desde hace tiempo el efecto de la regresión a la media en los deportes; incluso tienen un nombre específico para ello: el " bajón del segundo año ". Por ejemplo, Carmelo Anthony, de los Denver Nuggets de la NBA , tuvo una temporada de novato excepcional en 2004. Fue tan excepcional que no se podía esperar que la repitiera: en 2005, sus estadísticas habían disminuido con respecto a su temporada de novato. Las razones del "bajón del segundo año" son numerosas, ya que los deportes se basan en el ajuste y el contraajuste, pero la excelencia basada en la suerte como novato es una razón tan válida como cualquier otra. La regresión a la media en el rendimiento deportivo también puede explicar la aparente " maldición de la portada de Sports Illustrated " y la " maldición de Madden ". John Hollinger tiene un nombre alternativo para el fenómeno de la regresión a la media: la "regla de la casualidad" , mientras que Bill James lo llama el "principio de plexiglás".

Debido a que la creencia popular se ha centrado en la regresión a la media como explicación del declive del rendimiento de los atletas de una temporada a otra, generalmente ha pasado por alto el hecho de que dicha regresión también puede explicar una mejora del rendimiento. Por ejemplo, si se observa el promedio de bateo de los jugadores de las Grandes Ligas de Béisbol en una temporada, aquellos cuyo promedio de bateo estuvo por encima de la media de la liga tienden a regresar a la media al año siguiente, mientras que aquellos cuyo promedio de bateo estuvo por debajo de la media tienden a progresar hacia la media al año siguiente. [ 18 ]

Otros fenómenos estadísticos

La regresión a la media simplemente indica que, tras un evento aleatorio extremo, es probable que el siguiente evento aleatorio sea menos extremo. En ningún caso el evento futuro "compensa" o "equilibra" el evento anterior, aunque esto se asume en la falacia del jugador (y en la variante de la ley de los promedios ). De manera similar, la ley de los grandes números establece que, a largo plazo, el promedio tenderá hacia el valor esperado, pero no hace ninguna afirmación sobre los ensayos individuales. Por ejemplo, tras una racha de 10 caras en el lanzamiento de una moneda justa (un evento raro y extremo), la regresión a la media indica que la siguiente racha de caras probablemente será menor a 10, mientras que la ley de los grandes números indica que, a largo plazo, este evento probablemente se compensará y la fracción promedio de caras tenderá a 1/2. Por el contrario, la falacia del jugador asume erróneamente que la moneda ahora "debe" tener una racha de cruces para equilibrarse.

El efecto opuesto es la regresión a la cola, resultante de una distribución con densidad de probabilidad no nula hacia el infinito. [ 19 ]

Definición de regresión lineal simple de puntos de datos

Esta es la definición de regresión a la media que sigue fielmente el uso original de Sir Francis Galton . [ 9 ]

Supongamos que hay n puntos de datos { y i , x i } , para i = 1, 2, ..., n . Queremos encontrar la ecuación de la recta de regresión , es decir, la recta. y=α+βincógnita,{\displaystyle y=\alpha +\beta x\,,} que proporcionaría el mejor ajuste para los puntos de datos. (Una línea recta puede no ser la curva de regresión apropiada para los puntos de datos dados). Aquí, "mejor" se entenderá como en el método de mínimos cuadrados : una línea que minimice la suma de los residuos al cuadrado del modelo de regresión lineal. En otras palabras, los números α y β resuelven el siguiente problema de minimización:

  • Encontrarminα,βQ(α,β){\displaystyle \min _{\alpha ,\,\beta }Q(\alpha ,\beta )}, dóndeQ(α,β)=i=1norteε^i2=i=1norte(yiαβincógnitai)2 {\displaystyle Q(\alpha ,\beta )=\sum _{i=1}^{n}{\hat {\varepsilon }}_{i}^{\,2}=\sum _{i=1}^{n}(y_{i}-\alpha -\beta x_{i})^{2}\ }

Utilizando cálculo diferencial se puede demostrar que los valores de α y β que minimizan la función objetivo Q son: β^=i=1norte(incógnitaiincógnita¯)(yiy¯)i=1norte(incógnitaiincógnita¯)2=incógnitay¯incógnita¯y¯incógnita2¯incógnita¯2=Cov[incógnita,y]Var[incógnita]=rincógnitaysysincógnita,α^=y¯β^incógnita¯,{\displaystyle {\begin{aligned}&{\hat {\beta }}={\frac {\sum _{i=1}^{n}(x_{i}-{\bar {x}})(y_{i}-{\bar {y}})}{\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}={\frac {{\overline {xy}}-{\bar {x}}{\bar {y}}}{{\overline {x^{2}}}-{\bar {x}}^{2}}}={\frac {\operatorname {Cov} [x,y]}{\operatorname {Var} [x]}}=r_{xy}{\frac {s_{y}}{s_{x}}},\\&{\hat {\alpha }}={\bar {y}}-{\hat {\beta }}\,{\bar {x}},\end{aligned}}}

donde r xy es el coeficiente de correlación muestral entre x e y , s x es la desviación estándar de x , y s y es, respectivamente, la desviación estándar de y . La barra horizontal sobre una variable indica el promedio muestral de esa variable. Por ejemplo:incógnitay¯=1nortei=1norteincógnitaiyi .{\displaystyle {\overline {xy}}={\tfrac {1}{n}}\textstyle \sum _{i=1}^{n}x_{i}y_{i}\ .}

Sustituyendo las expresiones anteriores para ︿ α y ︿ β en y = α + βx se obtienen los valores ajustados. y^=α^+β^incógnita,{\displaystyle {\sombrero {y}}={\sombrero {\alpha }}+{\sombrero {\beta }}x,\,}

lo cual produce y^y¯sy=rincógnitayincógnitaincógnita¯sincógnita{\displaystyle {\frac {{\hat {y}}-{\bar {y}}}{s_{y}}}=r_{xy}{\frac {x-{\bar {x}}}{s_{x}}}}

Esto muestra el papel que desempeña r xy en la línea de regresión de puntos de datos estandarizados.

Si  −1 < r xy < 1 , decimos que los datos presentan regresión a la media. En otras palabras, si la regresión lineal es el modelo adecuado para un conjunto de datos cuyo coeficiente de correlación muestral no es perfecto, entonces existe regresión a la media. El valor estandarizado predicho (o ajustado) de y está más cerca de su media que el valor estandarizado de x .

Definiciones para distribución bivariada con distribuciones marginales idénticas

Definición restrictiva

Sean X 1 , X 2 variables aleatorias con distribuciones marginales idénticas con media μ . En esta formalización, se dice que la distribución bivariada de X 1 y X 2 presenta regresión hacia la media si, para cada número c > μ , se cumple que μmi[incógnita2|incógnita1=do]<do,{\displaystyle \mu \leq \operatorname {E} [X_{2}\vert X_{1}=c]<c\,,} con las desigualdades inversas válidas para c < μ . [ 20 ] [ 21 ]

A continuación se presenta una descripción informal de la definición anterior. Consideremos una población de widgets . Cada widget tiene dos números, X₁ y X₂ , es decir, su intervalo izquierdo ( X₁ ) y su intervalo derecho ( X₂ ) . Supongamos que las distribuciones de probabilidad de X₁ y X₂ en la población son idénticas y que las medias de X₁ y X₂ son ambas μ . Ahora tomamos un widget al azar de la población y denotamos su valor X₁ por c ( c puede ser mayor, igual o menor que μ ). Aún no tenemos acceso al valor X₂ de este widget. Sea d el valor esperado de X₂ de este widget en particular; es decir, sea d el valor promedio de X₂ de todos los widgets en la población con X₁ = c . Si se cumple la siguiente condición: 

  • Cualquiera que sea el valor de c , d se encuentra entre μ y c (es decir, d está más cerca de μ que c ),

Entonces decimos que X 1 y X 2 muestran regresión hacia la media .

Esta definición concuerda estrechamente con el uso común actual, derivado del uso original de Galton, del término "regresión a la media". Es "restrictiva" en el sentido de que no toda distribución bivariada con distribuciones marginales idénticas presenta regresión a la media (según esta definición). [ 21 ]

Teorema

Si un par ( X , Y ) de variables aleatorias sigue una distribución normal bivariada , entonces la media condicional E( Y | X ) es una función lineal de X. El coeficiente de correlación r entre X e Y , junto con las medias marginales y las varianzas de X e Y , determina esta relación lineal: mi(Y|incógnita)mi[Y]σy=rincógnitami[incógnita]σincógnita,{\displaystyle {\frac {\operatorname {E} (Y\vert X)-\operatorname {E} [Y]}{\sigma _{y}}}=r{\frac {X-\operatorname {E} [X]}{\sigma _{x}}},}

donde E[ X ] y E[ Y ] son ​​los valores esperados de X e Y , respectivamente, y σ x y σ y son las desviaciones estándar de X e Y , respectivamente.

Por lo tanto, el valor esperado condicional de Y , dado que X está t desviaciones estándar por encima de su media (y esto incluye el caso en que está por debajo de su media, cuando t < 0 ), es rt desviaciones estándar por encima de la media de Y. Dado que | r | ≤ 1 , Y no está más lejos de la media que X , según se mide en número de desviaciones estándar. [ 22 ]

Por lo tanto, si 0 ≤ r < 1 , entonces ( X , Y ) muestra una regresión hacia la media (según esta definición).

Definición general

Samuels propuso la siguiente definición de reversión a la media como alternativa a la definición más restrictiva de regresión a la media mencionada anteriormente. [ 20 ]

Sean X 1 y X 2 variables aleatorias con distribuciones marginales idénticas con media μ . En esta formalización, se dice que la distribución bivariada de X 1 y X 2 presenta reversión hacia la media si, para cada número c , se cumple que μmi[incógnita2|incógnita1>do]<mi[incógnita1|incógnita1>do], yμmi[incógnita2|incógnita1<do]>mi[incógnita1|incógnita1<do].{\displaystyle {\begin{aligned}\mu &\leq \operatorname {E} [X_{2}\vert X_{1}>c]<\operatorname {E} [X_{1}\vert X_{1}>c],{\text{ y}}\\\mu &\geq \operatorname {E} [X_{2}\vert X_{1}<c]>\operatorname {E} [X_{1}\vert X_{1}<c].\end{aligned}}}

Esta definición es "general" en el sentido de que toda distribución bivariada con distribuciones marginales idénticas exhibe reversión hacia la media , siempre que se cumplan algunos criterios débiles (no degeneración y dependencia positiva débil como se describe en el artículo de Samuels [ 20 ] ).

Definición alternativa en el uso financiero

Jeremy Siegel utiliza el término "retorno a la media" para describir una serie temporal financiera en la que " los rendimientos pueden ser muy inestables a corto plazo, pero muy estables a largo plazo". Cuantitativamente, se trata de una serie en la que la desviación estándar de los rendimientos anuales promedio disminuye más rápidamente que el inverso del período de tenencia, lo que implica que el proceso no es un paseo aleatorio , sino que los períodos de menores rendimientos van seguidos sistemáticamente por períodos compensatorios de mayores rendimientos, como ocurre en muchos negocios estacionales, por ejemplo. [ 23 ]

Véase también

Referencias

  1. Galton, Francis (1901-1902). Popular Science Monthly Volumen 60 , "La posible mejora de la raza humana bajo las condiciones existentes de ley y sentimiento", pág. 224
  2. Everitt, BS (12 de agosto de 2002). The Cambridge Dictionary of Statistics (2.ª  ed.). Cambridge University Press . ISBN 978-0521810999.
  3. Upton, Graham; Cook, Ian (21 de agosto de 2008). Oxford Dictionary of Statistics . Oxford University Press . ISBN 978-0-19-954145-4.
  4. Stigler, Stephen M (1997). "Regresión hacia la media, considerada históricamente" . Métodos estadísticos en la investigación médica . 6 (2): 103– 114. doi : 10.1191/096228097676361431 . PMID 9261910 . 
  5. Chiolero, A; Paradis, G; Rich, B; Hanley, JA (2013). "Evaluación de la relación entre el valor basal de una variable continua y el cambio posterior a lo largo del tiempo" . Frontiers in Public Health . 1 : 29. doi : 10.3389/fpubh.2013.00029 . PMC 3854983. PMID 24350198 .  
  6. "Análisis estadístico de 'Pensar rápido, pensar despacio' de Daniel Kahneman" . Burns Statistics . 11 de noviembre de 2013. Consultado el 1 de enero de 2022 .
  7. "¿Qué es la regresión a la media? Definición y ejemplos" . conceptually.org . Consultado el 25 de octubre de 2017 .
  8. Goldacre, Ben (4 de abril de 2009). Mala ciencia . Fourth Estate. pág. 39. ISBN  978-0007284870.
  9. 1 2 3 4 Galton, F. (1886). "Regresión hacia la mediocridad en la estatura hereditaria" . The Journal of the Anthropological Institute of Great Britain and Ireland . 15 : 246–263 . doi : 10.2307/2841583 . JSTOR 2841583 . 
  10. Galton, Francis (1889). Herencia natural . Londres: Macmillan .
  11. Stigler, Stephen M. (17 de junio de 2010). "Darwin, Galton y la Ilustración estadística". Journal of the Royal Statistical Society, Serie A. 173 ( 3): 469– 482, 477. doi : 10.1111/j.1467-985X.2010.00643.x . ISSN 1467-985X . S2CID 53333238 .  
  12. Kahneman, Daniel (1 de octubre de 2011). Pensar rápido y despacio . Farrar, Straus and Giroux . ISBN 978-0-374-27563-1.
  13. Secrist, Horace; Hotelling, Harold; Rorty, MC; Gini, Corrada; King, Wilford I. (junio de 1934). "Cartas abiertas" . Journal of the American Statistical Association . 29 (186): 196– 205. doi : 10.1080/01621459.1934.10502711 . JSTOR 2278295 . 
  14. Defulio, Anthony (2012). "Cita: Kahneman sobre las contingencias" . Journal of the Experimental Analysis of Behavior . 97 (2): 182. doi : 10.1901/jeab.2012.97-182 . PMC 3292229 . 
  15. Webster, Ben (16 de diciembre de 2005). "Los beneficios de las cámaras de velocidad están sobrevalorados" . The Times . Consultado el 1 de enero de 2022 .(Se requiere suscripción)
  16. Mountain, L. (2006). "Cámaras de seguridad: ¿Impuesto encubierto o salvavidas?". Significance . 3 (3): 111– 113. doi : 10.1111/j.1740-9713.2006.00179.x .
  17. Maher, Mike; Mountain, Linda (2009). "La sensibilidad de las estimaciones de regresión a la media". Accident Analysis & Prevention . 41 (4): 861– 8. doi : 10.1016/j.aap.2009.04.020 . PMID 19540977 . 
  18. Para ver una ilustración, consulte Nate Silver , "Aleatoriedad: ¡Contágiate de la fiebre!" , Baseball Prospectus , 14 de mayo de 2003.
  19. Flyvbjerg, Bent (5 de octubre de 2020). "La ley de regresión a la cola: cómo sobrevivir a la Covid-19, la crisis climática y otros desastres" . Environmental Science & Policy . 114 : 614–618 . Bibcode : 2020ESPol.114..614F . doi : 10.1016/j.envsci.2020.08.013 . ISSN 1462-9011 . PMC 7533687. PMID 33041651 .   
  20. 1 2 3 Samuels, Myra L. (noviembre de 1991). "Reversión estadística hacia la media: más universal que la regresión hacia la media". The American Statistician . 45 (4): 344– 346. doi : 10.2307/2684474 . JSTOR 2684474 . .
  21. 1 2 Schmittlein, David C (agosto de 1989). "Inferencias sorprendentes a partir de observaciones no sorprendentes: ¿Las expectativas condicionales realmente regresan a la media?" . The American Statistician . 43 (3): 176– 183. doi : 10.2307/2685070 . JSTOR 2685070 . 
  22. Chernick, Michael R.; Friis, Robert H. (17 de marzo de 2003). Introducción a la bioestadística para las ciencias de la salud . Wiley-Interscience . pág. 272. ISBN  978-0-471-41137-6.
  23. Siegel, Jeremy (27 de noviembre de 2007). Acciones a largo plazo (4.ª ed.). McGraw-Hill. págs. 13, 28-29 . ISBN   978-0071494700.

Lecturas adicionales

  • JM Bland y DG Altman (junio de 1994). " Notas estadísticas: regresión hacia la media" . British Medical Journal . 308 (6942): 1499. doi : 10.1136/bmj.308.6942.1499 . PMC 2540330. PMID 8019287 .  Artículo que incluye un diagrama con los datos originales de Galton.
  • Edward J. Dudewicz y Satya N. Mishra (1988). «Sección 14.1: Estimación de parámetros de regresión; Modelos lineales». Estadística matemática moderna . John Wiley & Sons . ISBN 978-0-471-81472-6.
  • Francis Galton (1886). "Regresión hacia la mediocridad en la estatura hereditaria" (PDF) . The Journal of the Anthropological Institute of Great Britain and Ireland . 15 : 246–263 . doi : 10.2307/2841583 . JSTOR 2841583 . 
  • Donald F. Morrison (1967). «Capítulo 3: Muestras de la población normal multivariada». Métodos estadísticos multivariados . McGraw-Hill . ISBN 978-0-534-38778-5.
  • Myra L. Samuels (noviembre de 1991). "Reversión estadística hacia la media: más universal que la regresión hacia la media". The American Statistician . 45 (4): 344– 346. doi : 10.2307/2684474 . JSTOR 2684474 . 
  • Senn, Stephen (mayo de 1990). "Regresión: un nuevo modo para un viejo significado" . The American Statistician . 44 (2): 181–183 .{{cite journal}}: Mantenimiento CS1: fecha y año ( enlace )
  • «Regresión a la media y el estudio del cambio» (PDF) . Boletín Psicológico de la Universidad de Harvard . Archivado (PDF) del original el 15 de abril de 2017.
  • Una explicación no matemática de la regresión a la media.
  • Una simulación de regresión a la media.
  • Amanda Wachsmuth, Leland Wilkinson, Gerard E. Dallal. La curva de Galton: una no linealidad no descubierta en los datos de regresión de estatura familiar de Galton y una posible explicación basada en los datos de estatura de Pearson y Lee (Una mirada moderna al análisis de Galton).
  • Resultados de las pruebas estandarizadas de Massachusetts, interpretados por un estadístico como un ejemplo de regresión: véase la discusión en sci.stat.edu y su continuación .
  • Gary Smith , What the Luck: The Surprising Role of Chance in Our Everyday Lives, Nueva York: Overlook, Londres: Duckworth. ISBN 978-1-4683-1375-8.
  • Logotipo de Wikimedia CommonsContenido multimedia relacionado con la regresión a la media en Wikimedia Commons.