Articulo de referencia

Coeficiente de determinación

En estadística , el coeficiente de determinación , denotado R² o r² y pronunciado "R cuadrado ", es la proporción de la variación en la variable dependiente que puede predecirse...

En estadística , el coeficiente de determinación , denotado o r² y pronunciado "R cuadrado ", es la proporción de la variación en la variable dependiente que puede predecirse a partir de la(s) variable(s) independiente(s). Es una estadística utilizada en el contexto de modelos estadísticos cuyo objetivo principal es la predicción de resultados futuros o la comprobación de hipótesis , basándose en otra información relacionada. Proporciona una medida de la precisión con la que el modelo reproduce los resultados observados, según la proporción de la variación total de los resultados explicada por el modelo. [ 1 ] [ 2 ] [ 3 ]

Existen varias definiciones de que solo en ocasiones son equivalentes. En la regresión lineal simple (que incluye un término constante ), es simplemente el cuadrado del coeficiente de correlación muestral ( r ) entre los resultados observados y los valores de los predictores observados. [ 4 ] Si se incluyen regresores adicionales , es el cuadrado del coeficiente de correlación múltiple . En ambos casos, el coeficiente de determinación siempre es menor que 1 y generalmente mayor que 0.

Los casos en los que R² es negativo pueden surgir cuando las predicciones que se comparan con los resultados correspondientes no se han derivado de un procedimiento de ajuste de modelos utilizando esos datos. Incluso si se ha utilizado un procedimiento de ajuste de modelos, puede seguir siendo negativo, por ejemplo, cuando se realiza una regresión lineal sin incluir un término constante [ 5 ] o cuando se utiliza una función no lineal para ajustar los datos [ 6 ] . En los casos en que aparecen valores negativos, la media de los datos proporciona un mejor ajuste a los resultados que los valores de la función ajustada, según este criterio particular.

El coeficiente de determinación puede ser más intuitivamente informativo que MAE , MAPE , MSE y RMSE en la evaluación del análisis de regresión , ya que el primero se puede expresar como un porcentaje, mientras que las últimas medidas tienen rangos arbitrarios. También demostró ser más robusto para ajustes deficientes en comparación con SMAPE en ciertos conjuntos de datos de prueba. [ 7 ]

Al evaluar la bondad de ajuste de los valores simulados ( Y pred ) frente a los medidos ( Y obs ), no es apropiado basarse en el de la regresión lineal (es decir, Y obs = m · Y pred + b). El cuantifica el grado de correlación lineal entre Y obs y Y pred , mientras que para la evaluación de la bondad de ajuste solo debe considerarse una correlación lineal específica: Y obs = 1 · Y pred + 0 ( es decir, la línea 1:1). [ 8 ] [ 9 ]

Definiciones

R2=1SSresSSnene{\displaystyle R^{2}=1-{\frac {\color {blue}{SS_{\text{res}}}}{\color {red}{SS_{\text{tot}}}}}} Cuanto mejor se ajuste la regresión lineal (a la derecha) a los datos en comparación con el promedio simple (en el gráfico de la izquierda), más se aproximará el valor de R² a 1. Las áreas de los cuadrados azules representan los residuos al cuadrado con respecto a la regresión lineal. Las áreas de los cuadrados rojos representan los residuos al cuadrado con respecto al valor promedio.

Un conjunto de datos tiene n valores marcados y 1 , ..., y n (conocidos colectivamente como y i o como un vector y =[ y 1 , ..., y n ] T ), cada uno asociado con un valor ajustado (o modelado, o predicho) f 1 , ..., f n (conocido como f i , o a veces ŷ i , como un vector f ).

Definimos los residuos como e i = y if i (formando un vector e ).

Siy¯{\displaystyle {\bar {y}}}es la media de los datos observados: y¯=1nortei=1norteyi{\displaystyle {\bar {y}}={\frac {1}{n}}\sum _{i=1}^{n}y_{i}} Entonces, la variabilidad del conjunto de datos se puede medir con dos fórmulas de suma de cuadrados :

  • La suma de los cuadrados de los residuos, también llamada suma residual de los cuadrados :SSres=i(yiFi)2=imii2{\displaystyle SS_{\text{res}}=\sum _{i}(y_{i}-f_{i})^{2}=\sum _{i}e_{i}^{2}\,}
  • La suma total de cuadrados (proporcional a la varianza de los datos):SSnene=i(yiy¯)2{\displaystyle SS_{\text{total}}=\sum _{i}(y_{i}-{\bar {y}})^{2}}

La definición más general del coeficiente de determinación es R2=1SSrmisSStot{\displaystyle R^{2}=1-{SS_{\rm {res}} \over SS_{\rm {tot}}}}

En el mejor de los casos, los valores modelados coinciden exactamente con los valores observados, lo que resulta enSSres=0{\displaystyle SS_{\text{res}}=0}y R 2 =1 . Un modelo de referencia, que siempre predice y , tendrá R 2 =0 .

Relación con la varianza no explicada

En términos generales, se puede observar que R² está relacionado con la fracción de varianza no explicada (FVU), ya que el segundo término compara la varianza no explicada (varianza de los errores del modelo) con la varianza total (de los datos): R2=1FVU{\displaystyle R^{2}=1-{\text{FVU}}}

Como varianza explicada

Un valor mayor de implica un modelo de regresión más exitoso. [ 4 ] : ​​463 Supongamos que = 0,49 . Esto implica que se ha explicado el 49% de la variabilidad de la variable dependiente en el conjunto de datos, y el 51% restante de la variabilidad aún no se ha explicado. Para los modelos de regresión, la suma de cuadrados de la regresión, también llamada suma de cuadrados explicada , se define como

SSreg=i(Fiy¯)2{\displaystyle SS_{\text{reg}}=\sum _{i}(f_{i}-{\bar {y}})^{2}}

En algunos casos, como en la regresión lineal simple , la suma total de cuadrados es igual a la suma de las otras dos sumas de cuadrados definidas anteriormente:

SSres+SSreg=SSnene{\displaystyle SS_{\text{res}}+SS_{\text{reg}}=SS_{\text{tot}}}

Consulte Particionamiento en el modelo OLS general para una derivación de este resultado para un caso en el que se cumple la relación. Cuando se cumple esta relación, la definición anterior de R 2 es equivalente a

R2=SSregSSnene=SSreg/norteSSnene/norte{\displaystyle R^{2}={\frac {SS_{\text{reg}}}{SS_{\text{tot}}}}={\frac {SS_{\text{reg}}/n}{SS_{\text{tot}}/n}}}

donde n es el número de observaciones (casos) de las variables.

En esta forma, R 2 se expresa como la razón entre la varianza explicada (varianza de las predicciones del modelo, que es SS reg / n ) y la varianza total (varianza muestral de la variable dependiente, que es SS tot / n ).

Esta partición de la suma de cuadrados se cumple, por ejemplo, cuando los valores del modelo ƒ i se han obtenido mediante regresión lineal . Una condición suficiente más suave se lee de la siguiente manera: El modelo tiene la forma

Fi=α^+β^qi{\displaystyle f_{i}={\widehat {\alpha }}+{\widehat {\beta }}q_{i}}

donde los q i son valores arbitrarios que pueden o no depender de i o de otros parámetros libres (la elección común q i  = x i es solo un caso especial), y las estimaciones de los coeficientes α^{\displaystyle {\widehat {\alpha }}}yβ^{\displaystyle {\widehat {\beta }}}se obtienen minimizando la suma residual de los cuadrados.

Este conjunto de condiciones es importante y tiene varias implicaciones para las propiedades de los residuos ajustados y los valores modelados. En particular, bajo estas condiciones:

F¯=y¯.{\displaystyle {\bar {f}}={\bar {y}}.\,}

Como coeficiente de correlación al cuadrado

En la regresión múltiple de mínimos cuadrados lineales (con intercepto y pendiente ajustados), es igual aρ2(y,F){\displaystyle \rho ^{2}(y,f)}el cuadrado del coeficiente de correlación de Pearson entre los observadosy{\displaystyle y}y modelado (predicho)F{\displaystyle f}valores de datos de la variable dependiente.

En una regresión lineal de mínimos cuadrados con un solo explicativo (con intercepto y pendiente ajustados), esto también es igual a ρ2(y,incógnita){\displaystyle \rho ^{2}(y,x)}el coeficiente de correlación de Pearson al cuadrado entre la variable dependientey{\displaystyle y}y variable explicativaincógnita{\displaystyle x}.

No debe confundirse con el coeficiente de correlación entre dos variables explicativas , definido como

ρα^,β^=cobertura(α^,β^)σα^σβ^,{\displaystyle \rho _{{\widehat {\alpha }},{\widehat {\beta }}}={\operatorname {cov} \left({\widehat {\alpha }},{\widehat {\beta }}\right) \over \sigma _{\widehat {\alpha }}\sigma _{\widehat {\beta }}},}

donde la covarianza entre dos estimaciones de coeficientes, así como sus desviaciones estándar , se obtienen de la matriz de covarianza de las estimaciones de coeficientes,(incógnitaTincógnita)1{\displaystyle (X^{T}X)^{-1}}.

En condiciones de modelado más generales, donde los valores predichos podrían generarse a partir de un modelo diferente de la regresión lineal de mínimos cuadrados, se puede calcular un valor como el cuadrado del coeficiente de correlación entre los valores originales.y{\displaystyle y}y modeladoF{\displaystyle f}valores de datos. En este caso, el valor no es directamente una medida de cuán buenos son los valores modelados, sino más bien una medida de cuán bueno podría ser un predictor construido a partir de los valores modelados (al crear un predictor revisado de la forma α + βƒ i ). [ 10 ] Según Everitt, [ 11 ] este uso es específicamente la definición del término "coeficiente de determinación": el cuadrado de la correlación entre dos variables (generales).

Interpretación

es una medida de la bondad de ajuste de un modelo. [ 12 ] En regresión, el coeficiente de determinación R² es una medida estadística de qué tan bien las predicciones de la regresión se aproximan a los datos reales. Un R² de 1 indica que las predicciones de la regresión se ajustan perfectamente a los datos .

Los valores de R² fuera del rango de 0 a 1 se producen cuando el modelo se ajusta peor a los datos que el peor predictor posible de mínimos cuadrados (equivalente a un hiperplano horizontal a una altura igual a la media de los datos observados). Esto ocurre cuando se ha elegido un modelo incorrecto o se han aplicado restricciones sin sentido por error. Si se utiliza la ecuación 1 de Kvålseth [ 13 ] (que es la ecuación más utilizada), R² puede ser menor que cero. Si se utiliza la ecuación 2 de Kvålseth, puede ser mayor que uno .

En todos los casos donde se usa R² , los predictores se calculan mediante regresión de mínimos cuadrados ordinarios: es decir, minimizando SS res . En este caso, aumenta a medida que aumenta el número de variables en el modelo ( aumenta monótonamente con el número de variables incluidas; nunca disminuirá). Esto ilustra una desventaja de un posible uso de , donde se podrían seguir agregando variables ( regresión de fregadero ) para aumentar el valor de R² . Por ejemplo, si se intenta predecir las ventas de un modelo de automóvil a partir del consumo de combustible, el precio y la potencia del motor, se pueden incluir factores probablemente irrelevantes como la primera letra del nombre del modelo o la altura del ingeniero jefe que diseña el automóvil, porque nunca disminuirá a medida que se agreguen variables y probablemente experimentará un aumento debido al azar.

Esto nos lleva al enfoque alternativo de analizar el ajustado . La explicación de este estadístico es casi la misma que la del , pero penaliza el estadístico a medida que se incluyen variables adicionales en el modelo. Para casos distintos al ajuste por mínimos cuadrados ordinarios, el estadístico se puede calcular como se indicó anteriormente y aún puede ser una medida útil. Si el ajuste se realiza mediante mínimos cuadrados ponderados o mínimos cuadrados generalizados , se pueden calcular versiones alternativas de R² adecuadas a esos marcos estadísticos, mientras que el "bruto" aún puede ser útil si es más fácil de interpretar. Los valores de R² se pueden calcular para cualquier tipo de modelo predictivo, que no necesariamente tiene una base estadística.

En un modelo lineal múltiple

Consideremos un modelo lineal con más de una variable explicativa , de la forma

Yi=β0+j=1pagβjincógnitai,j+εi,{\displaystyle Y_{i}=\beta _{0}+\sum _{j=1}^{p}\beta _{j}X_{i,j}+\varepsilon _{i},}

donde, para el i- ésimo caso,Yi{\displaystyle {Y_{i}}}es la variable de respuesta,incógnitai,1,,incógnitai,pag{\displaystyle X_{i,1},\dots ,X_{i,p}}son pre regresores yεi{\displaystyle \varepsilon _{i}}es un término de error medio cero . Las cantidadesβ0,,βpag{\displaystyle \beta _{0},\dots ,\beta _{p}}son coeficientes desconocidos, cuyos valores se estiman por mínimos cuadrados . El coeficiente de determinación es una medida del ajuste global del modelo. Específicamente, es un elemento de [0, 1 ] y representa la proporción de variabilidad en Yᵢ que puede atribuirse a alguna combinación lineal de los regresores ( variables explicativas ) en X. [ 14 ] 

R² se interpreta a menudo como la proporción de variación de respuesta "explicada" por los regresores en el modelo. Por lo tanto, = 1 indica que el modelo ajustado explica toda la variabilidad en  y{\displaystyle y}, mientras que R 2  =  0 indica que no hay relación 'lineal' (para la regresión de línea recta, esto significa que el modelo de línea recta es una línea constante (pendiente  =  0, intersección  = y¯{\displaystyle {\bar {y}}}) entre la variable de respuesta y los regresores). Un valor interno como = 0,7 puede interpretarse de la siguiente manera: "El setenta por ciento de la varianza en la variable de respuesta puede explicarse mediante las variables explicativas. El treinta por ciento restante puede atribuirse a variables desconocidas, ocultas o a la variabilidad inherente."  

Una advertencia que se aplica al , al igual que a otras descripciones estadísticas de correlación y asociación , es que " la correlación no implica causalidad ". En otras palabras, si bien las correlaciones a veces pueden proporcionar pistas valiosas para descubrir relaciones causales entre variables, una correlación estimada distinta de cero entre dos variables no es, por sí sola, evidencia de que cambiar el valor de una variable resultaría en cambios en los valores de otras variables. Por ejemplo, la práctica de llevar cerillas (o un encendedor) está correlacionada con la incidencia de cáncer de pulmón, pero llevar cerillas no causa cáncer (en el sentido estándar de "causa").

En el caso de un único regresor, ajustado por mínimos cuadrados, es el cuadrado del coeficiente de correlación de Pearson entre el regresor y la variable de respuesta. De forma más general, R² es el cuadrado de la correlación entre el predictor construido y la variable de respuesta. Con más de un regresor, se denomina coeficiente de determinación múltiple .

Inflación de R 2

En la regresión por mínimos cuadrados con datos típicos, aumenta, al menos ligeramente, con el incremento del número de regresores en el modelo. Dado que el aumento del número de regresores incrementa el valor de , este valor por solo no permite una comparación significativa entre modelos con un número muy diferente de variables independientes. Para una comparación significativa entre dos modelos, se puede realizar una prueba F sobre la suma de cuadrados de los residuos , similar a las pruebas F en causalidad de Granger , aunque esto no siempre es apropiado . Como recordatorio, algunos autores denotan como Rq² , donde q es el número de columnas en X (el número de explicaciones, incluyendo la constante) .

Para demostrar esta propiedad, primero recordemos que el objetivo de la regresión lineal por mínimos cuadrados es

minbSSres(b)minbi(yiincógnitaib)2{\displaystyle \min _{b}SS_{\text{res}}(b)\Rightarrow \min _{b}\sum _{i}(y_{i}-X_{i}b)^{2}\,}

donde X i es un vector fila de valores de variables explicativas para el caso i y b es un vector columna de coeficientes de los elementos respectivos de X i .

El valor óptimo del objetivo es ligeramente menor a medida que se agregan más variables explicativas y, por lo tanto, columnas adicionales deincógnita{\displaystyle X}(la matriz de datos explicativos cuya i- ésima fila es X i ) se suman, por el hecho de que la minimización menos restringida conduce a un costo óptimo que es ligeramente menor que la minimización más restringida. Dada la conclusión anterior y teniendo en cuenta queSStot{\displaystyle SS_{tot}}depende únicamente de y , la propiedad no decreciente de R 2 se deduce directamente de la definición anterior.

La razón intuitiva por la que usar una variable explicativa adicional no puede reducir el es esta: MinimizarSSres{\displaystyle SS_{\text{res}}}Esto equivale a maximizar . Cuando se incluye la variable adicional, los datos siempre tienen la opción de darle un coeficiente estimado de cero, dejando los valores predichos y el sin cambios. La única forma en que el problema de optimización dará un coeficiente distinto de cero es si al hacerlo se mejora el . 

Lo anterior ofrece una explicación analítica de la inflación de . A continuación, se muestra un ejemplo basado en mínimos cuadrados ordinarios desde una perspectiva geométrica. [ 15 ]

Este es un ejemplo de residuos de modelos de regresión en espacios más pequeños y más grandes basados ​​en la regresión de mínimos cuadrados ordinarios.

Un caso sencillo que conviene considerar primero:

Y=β0+β1incógnita1+ε{\displaystyle Y=\beta _{0}+\beta _{1}\cdot X_{1}+\varepsilon \,}

Esta ecuación describe el modelo de regresión de mínimos cuadrados ordinarios con un regresor. La predicción se muestra como el vector rojo en la figura de la derecha. Geométricamente, es la proyección del valor verdadero sobre un espacio de modelo enR{\displaystyle \mathbb {R} }(sin intersección). El residuo se muestra como la línea roja.

Y=β0+β1incógnita1+β2incógnita2+ε{\displaystyle Y=\beta _{0}+\beta _{1}\cdot X_{1}+\beta _{2}\cdot X_{2}+\varepsilon \,}

Esta ecuación corresponde al modelo de regresión de mínimos cuadrados ordinarios con dos regresores. La predicción se muestra como el vector azul en la figura de la derecha. Geométricamente, es la proyección del valor verdadero sobre un espacio de modelo más grande enR2{\displaystyle \mathbb {R} ^{2}}(sin intersección). Cabe destacar que los valores deβ0{\displaystyle \beta _{0}}yβ0{\displaystyle \beta _{0}}no son lo mismo que en la ecuación para un espacio de modelo más pequeño siempre queincógnita1{\displaystyle X_{1}}yincógnita2{\displaystyle X_{2}}no son vectores nulos. Por lo tanto, se espera que las ecuaciones produzcan predicciones diferentes (es decir, se espera que el vector azul sea diferente del vector rojo). El criterio de regresión de mínimos cuadrados garantiza que el residuo se minimice. En la figura, la línea azul que representa el residuo es ortogonal al espacio del modelo enR2{\displaystyle \mathbb {R} ^{2}}, lo que proporciona la distancia mínima desde el espacio.

El espacio del modelo más pequeño es un subespacio del más grande, y por lo tanto, el residuo del modelo más pequeño está garantizado para ser mayor. Comparando las líneas roja y azul en la figura, la línea azul es ortogonal al espacio, y cualquier otra línea sería mayor que la azul. Considerando el cálculo para R 2 , un valor menor deSStot{\displaystyle SS_{tot}}esto dará lugar a un mayor valor de R 2 , lo que significa que añadir regresores provocará una inflación de R 2 .

Advertencias

R 2 no indica si:

  • Las variables independientes son la causa de los cambios en la variable dependiente ;
  • Existe sesgo por variables omitidas ;
  • Se utilizó la regresión correcta ;
  • Se ha elegido el conjunto más apropiado de variables independientes;
  • Existe colinealidad en los datos de las variables explicativas;
  • El modelo podría mejorarse utilizando versiones transformadas del conjunto existente de variables independientes;
  • Hay suficientes datos para llegar a una conclusión sólida;
  • Hay algunos valores atípicos en una muestra que, por lo demás, es buena.
Comparación del estimador de Theil-Sen (negro) y la regresión lineal simple (azul) para un conjunto de puntos con valores atípicos . Debido a la gran cantidad de valores atípicos, ninguna de las líneas de regresión se ajusta bien a los datos, como lo demuestra el hecho de que ninguna da un R² muy alto .

Extensiones

ajustado

El uso de un R 2 ajustado (una notación común esR¯2{\displaystyle {\bar {R}}^{2}}, pronunciado "R barra al cuadrado"; otro esRa2{\displaystyle R_{\text{a}}^{2}}oRadj2{\displaystyle R_{\text{adj}}^{2}}) es un intento de explicar el fenómeno del aumento automático del cuando se añaden variables explicativas adicionales al modelo. Hay muchas formas diferentes de ajustarlo. [ 16 ] La más utilizada, hasta el punto de que normalmente se la denomina simplemente ajustado , es la corrección propuesta por Mordecai Ezekiel . [ 16 ] [ 17 ] [ 18 ] El ajustado se define como

R¯2=1SSres/dfresSSnene/dfnene{\displaystyle {\bar {R}}^{2}={1-{SS_{\text{res}}/{\text{df}}_{\text{res}} \over SS_{\text{tot}}/{\text{df}}_{\text{tot}}}}}

donde df res son los grados de libertad de la estimación de la varianza poblacional alrededor del modelo, y df tot son los grados de libertad de la estimación de la varianza poblacional alrededor de la media. df res se da en términos del tamaño de la muestra n y el número de variables p en el modelo, df res = np − 1. df tot se da de la misma manera, pero con p siendo cero para la media (es decir, df tot = n − 1 ).

Insertando los grados de libertad y utilizando la definición de , se puede reescribir como:

R¯2=1(1R2)norte1nortepag1{\displaystyle {\bar {R}}^{2}=1-(1-R^{2}){n-1 \over n-p-1}}

donde p es el número total de variables explicativas en el modelo (excluyendo el término independiente) y n es el tamaño de la muestra.

El ajustado puede ser negativo, y su valor siempre será menor o igual que el de . A diferencia de , el ajustado aumenta solo cuando el incremento en R² (debido a la inclusión de una nueva variable explicativa ) es mayor de lo que cabría esperar por azar. Si se introduce un conjunto de variables explicativas con una jerarquía de importancia predeterminada en una regresión, calculando el R² ajustado en cada caso , el nivel en el que el R² ajustado alcanza un máximo y luego disminuye correspondería a la regresión con la combinación ideal de mejor ajuste sin términos superfluos o innecesarios.

Esquema de la contribución del sesgo y la varianza al error total.

El ajustado puede interpretarse como un ejemplo de la relación entre sesgo y varianza . Al considerar el rendimiento de un modelo, un error menor representa un mejor rendimiento. A medida que el modelo se vuelve más complejo, la varianza aumenta, mientras que el cuadrado del sesgo disminuye, y estas dos métricas se suman para formar el error total. Al combinar estas dos tendencias, la relación entre sesgo y varianza describe una relación entre el rendimiento del modelo y su complejidad, representada por una curva en forma de U a la derecha. En el caso específico del R² ajustado , la complejidad del modelo (es decir , el número de parámetros) afecta al y al término/fracción, reflejando así sus atributos en el rendimiento general del modelo.

puede interpretarse como la varianza del modelo, la cual está influenciada por su complejidad. Un alto indica un menor error de sesgo , ya que el modelo explica mejor el cambio de Y con los predictores. Por esta razón, se realizan menos suposiciones (erróneas), lo que resulta en un menor error de sesgo. Sin embargo, para incorporar menos suposiciones, el modelo tiende a ser más complejo. En función del equilibrio entre sesgo y varianza, una mayor complejidad conlleva una disminución del sesgo y un mejor rendimiento (por debajo de la línea óptima). En , el término ( 1 − ) será menor con una mayor complejidad, lo que resulta en un R² más alto e indica consistentemente un mejor rendimiento.

Por otro lado, el término/fracción se ve afectado inversamente por la complejidad del modelo. El término/fracción aumentará al añadir regresores (es decir, al aumentar la complejidad del modelo) y conllevará un peor rendimiento. Basándonos en la relación entre sesgo y varianza, una mayor complejidad del modelo (más allá de la línea óptima) conlleva un aumento de los errores y un peor rendimiento.

Considerando el cálculo de , un mayor número de parámetros incrementará R² y , por lo tanto, . Sin embargo, añadir más parámetros incrementará el término/fracción y, en consecuencia, disminuirá . Estas dos tendencias generan una relación en forma de U invertida entre la complejidad del modelo y , lo cual es consistente con la tendencia en forma de U de la complejidad del modelo frente al rendimiento general. A diferencia de , que siempre aumenta al incrementarse la complejidad del modelo, solo aumentará cuando el sesgo eliminado por el regresor añadido sea mayor que la varianza introducida simultáneamente. Por lo tanto, usar en lugar de R² podría prevenir el sobreajuste.

Siguiendo la misma lógica, el R² ajustado puede interpretarse como un estimador menos sesgado del poblacional , mientras que el muestral observado es una estimación con sesgo positivo del valor poblacional. [ 19 ] El R² ajustado es más apropiado al evaluar el ajuste del modelo (la varianza en la variable dependiente explicada por las variables independientes) y al comparar modelos alternativos en la etapa de selección de características de la construcción del modelo. [ 19 ]

El principio que subyace al estadístico R² ajustado se puede observar al reescribir el ordinario como

R2=1VARresVARnene{\displaystyle R^{2}={1-{{\text{VAR}}_{\text{res}} \over {\text{VAR}}_{\text{tot}}}}}

dóndeVARres=SSres/norte{\displaystyle {\text{VAR}}_{\text{res}}=SS_{\text{res}}/n}yVARnene=SSnene/norte{\displaystyle {\text{VAR}}_{\text{tot}}=SS_{\text{tot}}/n}son las varianzas muestrales de los residuos estimados y de la variable dependiente, respectivamente, que pueden considerarse estimaciones sesgadas de las varianzas poblacionales de los errores y de la variable dependiente. Estas estimaciones se reemplazan por versiones estadísticamente insesgadas :VARres=SSres/(nortepag){\displaystyle {\text{VAR}}_{\text{res}}=SS_{\text{res}}/(n-p)}yVARnene=SSnene/(norte1){\displaystyle {\text{VAR}}_{\text{tot}}=SS_{\text{tot}}/(n-1)}.

A pesar de utilizar estimadores insesgados para las varianzas poblacionales del error y la variable dependiente, el R² ajustado no es un estimador insesgado del poblacional , [ 19 ] que resulta de usar las varianzas poblacionales de los errores y la variable dependiente en lugar de estimarlas. Ingram Olkin y John W. Pratt derivaron el estimador insesgado de varianza mínima para el poblacional , [ 20 ] que se conoce como estimador de Olkin-Pratt. Las comparaciones de diferentes enfoques para ajustar el concluyeron que en la mayoría de las situaciones se debería preferir una versión aproximada del estimador de Olkin-Pratt [ 19 ] o el estimador exacto de Olkin-Pratt [ 21 ] sobre el R² ajustado ( Ezekiel ) .

Coeficiente de determinación parcial

El coeficiente de determinación parcial se define como la proporción de variación que no puede explicarse en un modelo reducido, pero sí mediante los predictores especificados en un modelo completo. [ 22 ] [ 23 ] [ 24 ] Este coeficiente se utiliza para determinar si uno o más predictores adicionales podrían ser útiles en un modelo de regresión más completo.

El cálculo del parcial es relativamente sencillo después de estimar dos modelos y generar las tablas ANOVA para ellos. El cálculo del parcial es

SS res, reducidoSS res, completoSS res, reducido,{\displaystyle {\frac {SS_{\text{ res, reduced}}-SS_{\text{ res, full}}}{SS_{\text{ res, reduced}}}},}

lo cual es análogo al coeficiente de determinación habitual:

SSneneSSresSSnene.{\displaystyle {\frac {SS_{\text{tot}}-SS_{\text{res}}}{SS_{\text{tot}}}}.}

Generalización y descomposición de R 2

Como se explicó anteriormente, las heurísticas de selección de modelos , como el criterio R² ajustado y la prueba F, examinan si el total aumenta lo suficiente como para determinar si se debe agregar un nuevo regresor al modelo. Si se agrega un regresor que está altamente correlacionado con otros regresores ya incluidos, el total apenas aumentará, incluso si el nuevo regresor es relevante. En consecuencia, las heurísticas mencionadas anteriormente ignorarán regresores relevantes cuando las correlaciones cruzadas sean altas. [ 25 ]

Representación geométrica de r 2

Alternativamente, se puede descomponer una versión generalizada de para cuantificar la relevancia de desviarse de una hipótesis. [ 25 ] Como muestra Hoornweg (2018), varios estimadores de contracción , como la regresión lineal bayesiana , la regresión de cresta y el lasso (adaptativo) , utilizan esta descomposición de cuando reducen gradualmente los parámetros desde las soluciones MCO no restringidas hacia los valores hipotetizados. Definamos primero el modelo de regresión lineal como

y=incógnitaβ+ε.{\displaystyle y=X\beta +\varepsilon .}

Se supone que la matriz X está estandarizada con puntuaciones Z y que el vector columnay{\displaystyle y}está centrado para tener una media de cero. Sea el vector columnaβ0{\displaystyle \beta _{0}}Consulte los parámetros de regresión hipotetizados y sea el vector columnab{\displaystyle b}denotemos los parámetros estimados. Entonces podemos definir

R2=1(yincógnitab)(yincógnitab)(yincógnitaβ0)(yincógnitaβ0).{\displaystyle R^{2}=1-{\frac {(y-Xb)'(y-Xb)}{(y-X\beta _{0})'(y-X\beta _{0})}}.}

Un R 2 del 75% significa que la precisión dentro de la muestra mejora en un 75% si se utilizan las soluciones b optimizadas con datos en lugar de las hipotetizadas.β0{\displaystyle \beta _{0}}valores. En el caso especial queβ0{\displaystyle \beta _{0}}es un vector de ceros, obtenemos nuevamente el R 2 tradicional .

El efecto individual sobre R 2 de desviarse de una hipótesis se puede calcular conR{\displaystyle R^{\otimes }}('R-exterior'). Estepag{\displaystyle p}vecespag{\displaystyle p}La matriz viene dada por

R=(incógnitay~0)(incógnitay~0)(incógnitaincógnita)1(y~0y~0)1,{\displaystyle R^{\otimes }=(X'{\tilde {y}}_{0})(X'{\tilde {y}}_{0})'(X'X)^{-1}({\tilde {y}}_{0}'{\tilde {y}}_{0})^{-1},}

dóndey~0=yincógnitaβ0{\displaystyle {\tilde {y}}_{0}=y-X\beta _{0}}. Los elementos diagonales deR{\displaystyle R^{\otimes }}exactamente suman R 2 . Si los regresores no están correlacionados yβ0{\displaystyle \beta _{0}}es un vector de ceros, entonces eljel{\displaystyle j^{\text{th}}}elemento diagonal deR{\displaystyle R^{\otimes }}simplemente corresponde al valor r 2 entreincógnitaj{\displaystyle x_{j}}yy{\displaystyle y}. Cuando los regresoresincógnitai{\displaystyle x_{i}}yincógnitaj{\displaystyle x_{j}}están correlacionados,Rii{\displaystyle R_{ii}^{\otimes }}podría aumentar a costa de una disminución enRjj{\displaystyle R_{jj}^{\otimes }}. Como resultado, los elementos diagonales deR{\displaystyle R^{\otimes }}puede ser menor que 0 y, en casos más excepcionales, mayor que 1. Para lidiar con tales incertidumbres, varios estimadores de contracción toman implícitamente un promedio ponderado de los elementos diagonales deR{\displaystyle R^{\otimes }}para cuantificar la relevancia de desviarse de un valor hipotético. [ 25 ] Haga clic en el lazo para ver un ejemplo.

en regresión logística

En el caso de la regresión logística , generalmente ajustada por máxima verosimilitud , existen varias opciones de pseudo- R 2 .

Una de ellas es la R 2 generalizada propuesta originalmente por Cox y Snell, [ 26 ] e independientemente por Magee: [ 27 ]

R2=1(L(0)L(θ^))2/norte{\displaystyle R^{2}=1-\left({{\mathcal {L}}(0) \over {\mathcal {L}}({\widehat {\theta }})}\right)^{2/n}}

dóndeL(0){\displaystyle {\mathcal {L}}(0)}es la probabilidad del modelo con solo el intercepto,L(θ^){\displaystyle {{\mathcal {L}}({\widehat {\theta }})}}es la probabilidad del modelo estimado (es decir, el modelo con un conjunto dado de estimaciones de parámetros) y n es el tamaño de la muestra. Se puede reescribir fácilmente como:

R2=1mi2norte(ln(L(0))ln(L(θ^)))=1miD/norte{\displaystyle R^{2}=1-e^{{\frac {2}{n}}(\ln({\mathcal {L}}(0))-\ln({\mathcal {L}}({\widehat {\theta }})))}=1-e^{-D/n}}

donde D es el estadístico de prueba de la prueba de razón de verosimilitud .

Nico Nagelkerke señaló que tenía las siguientes propiedades: [ 28 ] [ 23 ]

  1. Es coherente con el coeficiente de determinación clásico cuando ambos pueden calcularse;
  2. Su valor se maximiza mediante la estimación de máxima verosimilitud de un modelo;
  3. Es asintóticamente independiente del tamaño de la muestra;
  4. La interpretación es la proporción de la variación explicada por el modelo;
  5. Los valores están entre 0 y 1, donde 0 indica que el modelo no explica ninguna variación y 1 indica que explica perfectamente la variación observada;
  6. No tiene ninguna unidad.

Sin embargo, en el caso de un modelo logístico, dondeL(θ^){\displaystyle {\mathcal {L}}({\widehat {\theta }})}no puede ser mayor que 1, R 2 está entre 0 yRmáximo2=1(L(0))2/norte{\displaystyle R_{\max }^{2}=1-({\mathcal {L}}(0))^{2/n}}: por lo tanto, Nagelkerke  sugirió la posibilidad de definir un R 2 escalado como R 2 / R 2 max . [ 23 ]

Comparación con las estadísticas residuales

En ocasiones, se utilizan estadísticas residuales para indicar la bondad de ajuste. La norma de los residuos se calcula como la raíz cuadrada de la suma de los cuadrados de los residuos (SSR):

norma de los residuos=SSres=mi.{\displaystyle {\text{norm of residuals}}={\sqrt {SS_{\text{res}}}}=\|e\|.}

De manera similar, el chi-cuadrado reducido se calcula como el SSR dividido por los grados de libertad.

Tanto como la norma de los residuos tienen sus méritos relativos. Para el análisis de mínimos cuadrados , R² varía entre 0 y 1, donde los números mayores indican mejores ajustes y 1 representa un ajuste perfecto. La norma de los residuos varía de 0 a infinito , donde los números menores indican mejores ajustes y cero indica un ajuste perfecto. Una ventaja y desventaja de es laSSnene{\displaystyle SS_{\text{tot}}}El término actúa para normalizar el valor. Si todos los valores y i se multiplican por una constante, la norma de los residuos también cambiará por esa constante, pero permanecerá igual. Como ejemplo básico, para el ajuste lineal de mínimos cuadrados al conjunto de datos:

R 2 =0,998 y norma de los residuos=0,302. Si todos los valores de y se multiplican por 1000 (por ejemplo, en un cambio de prefijo del SI ), entonces R 2 permanece igual, pero la norma de los residuos=302.

Otro indicador de ajuste de un solo parámetro es el RMSE de los residuos, o desviación estándar de los residuos. Este tendría un valor de 0,135 para el ejemplo anterior, dado que el ajuste fue lineal con una intersección no forzada. [ 29 ]

Historia

La creación del coeficiente de determinación se atribuye al genetista Sewall Wright y se publicó por primera vez en 1921. [ 30 ]

Véase también

Notas

  1. Steel, RGD; Torrie, JH (14 de julio de 2008). Principios y procedimientos de estadística con especial referencia a las ciencias biológicas (PDF) . McGraw Hill . ISBN 007060925XArchivado del original el 10 de febrero de 2026.
  2. Glantz, Stanton A.; Slinker, BK (1990). Primer of Applied Regression and Analysis of Variance (PDF) . McGraw-Hill. ISBN 9780070234079Archivado del original el 10 de febrero de 2026.
  3. Draper, NR; Smith, H. (1998). Análisis de regresión aplicada (PDF) . Wiley-Interscience. ISBN 9780471170822Archivado del original el 10 de febrero de 2026.
  4. 1 2 Devore, Jay L. (2011). Probabilidad y estadística para ingeniería y ciencias (PDF) (8.ª ed.). Boston, MA: Cengage Learning. págs. 508–510 . ISBN   978-0-538-73352-6Archivado del original el 10 de febrero de 2026.
  5. ^ Barten, Antón P. (1987). "El coeficiente de determinación de la regresión sin término constante". En Heijmans, Risto; Neudecker, Heinz (eds.). La práctica de la econometría (PDF) . Dordrecht: Kluwer. págs. 181-189 . ISBN  90-247-3502-5Archivado del original el 10 de febrero de 2026.
  6. Colin Cameron, A.; Windmeijer, Frank AG (1997). "Una medida de bondad de ajuste R cuadrado para algunos modelos de regresión no lineal comunes" (PDF) . Journal of Econometrics . 77 (2): 1790–2 . doi : 10.1016/S0304-4076(96)01818-0 . Archivado del original el 10 de febrero de 2026.
  7. ^ Chicco, Davide; Warrens, Matthijs J.; Jurman, Giuseppe (2021). "El coeficiente de determinación R-cuadrado es más informativo que SMAPE, MAE, MAPE, MSE y RMSE en la evaluación del análisis de regresión" . PeerJ Ciencias de la Computación . 7 (e623): e623. doi : 10.7717/peerj-cs.623 . PMC 8279135 . PMID 34307865 .  
  8. Legates, DR; McCabe, GJ (1999). "Evaluación del uso de medidas de "bondad de ajuste" en la validación de modelos hidrológicos e hidroclimáticos". Water Resour. Res . 35 (1): 233– 241. Bibcode : 1999WRR....35..233L . doi : 10.1029/1998WR900018 . S2CID 128417849 . 
  9. Ritter, A.; Muñoz-Carpena, R. (2013). "Evaluación del rendimiento de modelos hidrológicos: significancia estadística para reducir la subjetividad en las evaluaciones de bondad de ajuste". Journal of Hydrology . 480 (1): 33– 45. Bibcode : 2013JHyd..480...33R . doi : 10.1016/j.jhydrol.2012.12.004 .
  10. Book, Stephen A.; Young, Philip H. (2006). "El problema con R2". Journal of Statistics Education : 87–114 . doi : 10.1080/10157891.2006.10462273 .
  11. Everitt, BS (2002). Diccionario de estadística de Cambridge (2.ª ed.). CUP. pág. 78. ISBN   978-0-521-81099-9.
  12. Casella, Georges (2002). Inferencia estadística (Segunda edición). Pacific Grove, California: Duxbury/Thomson Learning. pág. 556. ISBN   9788131503942.
  13. Kvalseth, Tarald O. (1985). "Nota de precaución sobre R2". The American Statistician . 39 (4): 279– 285. doi : 10.2307/2683704 . JSTOR 2683704 . 
  14. " Regresión lineal – MATLAB y Simulink" . www.mathworks.com
  15. Faraway, Julian James (2005). Modelos lineales con R (PDF) . Chapman & Hall/CRC. ISBN 9781584884255.
  16. 1 2 Raju, Nambury S.; Bilgic, Reyhan; Edwards, Jack E.; Fleer, Paul F. (1997). "Methodology review: Estimation of population validity and cross-validity, and the use of equal weights in prediction" . Applied Psychological Measurement . 21 (4): 291– 305. doi : 10.1177/01466216970214001 . ISSN 0146-6216 . S2CID 122308344 .  
  17. Mordecai Ezekiel (1930), Métodos de análisis de correlación , Wiley , Wikidata Q120123877 , págs. 208–211.
  18. Yin, Ping; Fan, Xitao (enero de 2001). "Estimación de la contracción de en regresión múltiple: una comparación de diferentes métodos analíticos" (PDF) . The Journal of Experimental Education . 69 (2): 203–224 . doi : 10.1080/00220970109600656 . ISSN 0022-0973 . S2CID 121614674 .  
  19. 1 2 3 4 Shieh, Gwowen (2008-04-01). "Estimación mejorada de la contracción del coeficiente de correlación múltiple al cuadrado y del coeficiente de validez cruzada al cuadrado". Métodos de investigación organizacional . 11 (2): 387– 407. doi : 10.1177/1094428106292901 . ISSN 1094-4281 . S2CID 55098407 .  
  20. Olkin, Ingram; Pratt, John W. (marzo de 1958). "Estimación insesgada de ciertos coeficientes de correlación" . The Annals of Mathematical Statistics . 29 (1): 201– 211. Bibcode : 1958AnnMS..29..201O . doi : 10.1214/aoms/1177706717 . ISSN 0003-4851 . 
  21. Karch, Julian (29 de septiembre de 2020). "Mejora del R cuadrado ajustado" . Collabra: Psicología . 6 (45) 45. doi : 10.1525/collabra.343 . hdl : 1887/3161248 . ISSN 2474-7394 . 
  22. Richard Anderson-Sprecher, " Comparaciones de modelos y R 2 ", The American Statistician , Volumen 48, Número 2, 1994, pp. 113–117.
  23. 1 2 3 Nagelkerke, NJD (septiembre de 1991). "Una nota sobre una definición general del coeficiente de determinación" (PDF) . Biometrika . 78 (3): 691– 692. doi : 10.1093/biomet/78.3.691 . JSTOR 2337038 . 
  24. "regresión – Implementación en R del coeficiente de determinación parcial" . Validado cruzadamente .
  25. 1 2 3 Hoornweg, Victor (2018). «Parte II: Sobre el mantenimiento de parámetros fijos» . Science: Under Submission . Hoornweg Press. ISBN 978-90-829188-0-9.
  26. Cox, DD; Snell, EJ (1989). El análisis de datos binarios (2.ª ed.). Chapman and Hall. 
  27. Magee, L. (1990). " Medidas R 2 basadas en pruebas de significancia conjunta de Wald y razón de verosimilitud". The American Statistician . 44 (3): 250– 3. doi : 10.1080/00031305.1990.10475731 .
  28. Nagelkerke, Nico JD (1992). Estimación de máxima verosimilitud de relaciones funcionales, Países Bajos . Notas de clase en estadística. Vol. 69. ISBN  978-0-387-97721-8.
  29. Página web de OriginLab, http://www.originlab.com/doc/Origin-Help/LR-Algorithm . Consultado el 9 de febrero de 2016.
  30. Wright, Sewall (enero de 1921). "Correlación y causalidad". Journal of Agricultural Research . 20 : 557–585 .

Lecturas adicionales

  • Gujarati, Damodar N .; Porter, Dawn C. (2009). Econometría básica (Quinta  ed.). Nueva York: McGraw-Hill/Irwin. págs. 73–78 . ISBN  978-0-07-337577-9.
  • Hughes, Ann; Grawoig, Dennis (1971). Estadística: Fundamentos para el análisis . Reading: Addison-Wesley. pp. 344–348 . ISBN  0-201-03021-7.
  • Kmenta, Jan (1986). Elementos de econometría (Segunda  edición). Nueva York: Macmillan. pp. 240–243 . ISBN  978-0-02-365070-3.
  • Lewis-Beck, Michael S .; Skalaban, Andrew (1990). "El R cuadrado: algunas palabras directas". Análisis político . 2 : 153–171 . doi : 10.1093/pan/2.1.153 . JSTOR 23317769 .