Articulo de referencia

Regresión segmentada

La regresión segmentada , también conocida como regresión por partes o regresión de segmentos , es un método de análisis de regresión en el que la variable independiente se divi...

La regresión segmentada , también conocida como regresión por partes o regresión de segmentos , es un método de análisis de regresión en el que la variable independiente se divide en intervalos y se ajusta un segmento de línea independiente a cada intervalo. El análisis de regresión segmentada también se puede realizar con datos multivariados mediante la partición de las distintas variables independientes. La regresión segmentada es útil cuando las variables independientes, agrupadas en diferentes conjuntos, presentan distintas relaciones entre las variables en estas regiones. Los límites entre los segmentos se denominan puntos de quiebre .

La regresión lineal segmentada es una regresión segmentada en la que las relaciones en los intervalos se obtienen mediante regresión lineal .

Regresión lineal segmentada, dos segmentos

Primera extremidad horizontal
Primera rama inclinada hacia arriba
Primera rama inclinada hacia abajo

La regresión lineal segmentada con dos segmentos separados por un punto de quiebre puede ser útil para cuantificar un cambio abrupto de la función de respuesta (Yr) de un factor influyente variable ( x ). El punto de quiebre puede interpretarse como un valor crítico , seguro o umbral más allá o por debajo del cual ocurren efectos (no) deseados. El punto de quiebre puede ser importante en la toma de decisiones [ 1 ].

Las figuras ilustran algunos de los resultados y tipos de regresión que se pueden obtener.

Un análisis de regresión segmentada se basa en la presencia de un conjunto de datos ( y, x ), en el que y es la variable dependiente y x la variable independiente .

El método de mínimos cuadrados aplicado por separado a cada segmento, mediante el cual se hacen las dos líneas de regresión para ajustar el conjunto de datos lo más posible mientras se minimiza la suma de los cuadrados de las diferencias (SSD) entre los valores observados ( y ) y calculados (Yr) de la variable dependiente, da como resultado las dos ecuaciones siguientes:

  • Yr = A 1 . x + K 1 para x < BP (punto de quiebre)  
  • Yr = A² . x +para x > BP (punto de quiebre)  

dónde:

Yr es el valor esperado (predicho) de y para un determinado valor de x ;
A 1 y A 2 son coeficientes de regresión (que indican la pendiente de los segmentos de línea);
K 1 y K 2 son constantes de regresión (que indican la intersección con el eje y ).

Los datos pueden mostrar muchos tipos o tendencias, [ 2 ] véanse las figuras.

El método también arroja dos coeficientes de correlación (R):

  • R12=1(yYr)2(yYa1)2{\displaystyle R_{1}^{2}=1-{\frac {\sum (y-Y_{r})^{2}}{\sum (y-Y_{a1})^{2}}}}  para x < BP (punto de ruptura)

y

  • R22=1(yYr)2(yYa2)2{\displaystyle R_{2}^{2}=1-{\frac {\sum (y-Y_{r})^{2}}{\sum (y-Y_{a2})^{2}}}}  para x > BP (punto de ruptura)

dónde:

(yYr)2{\displaystyle \sum (y-Y_{r})^{2}}es el SSD minimizado por segmento

y

Y a1 y Y a2 son los valores promedio de y en los segmentos respectivos.

Para determinar la tendencia más adecuada, es necesario realizar pruebas estadísticas que garanticen que dicha tendencia sea fiable (significativa).

Cuando no se detecta ningún punto de ruptura significativo, hay que recurrir a una regresión sin punto de ruptura.

Ejemplo

Regresión lineal segmentada, tipo 3b

Para la figura azul de la derecha que muestra la relación entre el rendimiento de la mostaza (Yr = Ym, t/ha) y la salinidad del suelo ( x = Ss, expresada como conductividad eléctrica de la solución del suelo CE en dS/m) se encuentra que: [ 3 ]

BP = 4,93, A 1 = 0, K 1 = 1,74, A 2 = 0,129, K 2 = 2,38, R 1 2 = 0,0035 (no significativo), R 2 2 = 0,395 (significativo) y:

  • Ym = 1,74 t/ha para Ss < 4,93 (punto de inflexión)            
  • Ym = 0,129 Ss + 2,38 t/ha para Ss > 4,93 (punto de inflexión)  

lo que indica que las salinidades del suelo < 4,93 dS/m son seguras y las salinidades del suelo > 4,93 dS/m reducen el rendimiento a razón de 0,129 t/ha por cada unidad de aumento de la salinidad del suelo.

La figura también muestra los intervalos de confianza y la incertidumbre, tal como se detalla a continuación.

Procedimientos de prueba

Ejemplo de serie temporal, tipo 5
Ejemplo de una tabla ANOVA: en este caso, la introducción de un punto de quiebre es altamente significativa.

Las siguientes pruebas estadísticas se utilizan para determinar el tipo de tendencia:

  1. Se analiza la significancia del punto de quiebre (BP) expresando BP como una función de los coeficientes de regresión A 1 y A 2 y las medias Y 1 y Y 2 de los datos y , y las medias X 1 y X 2 de los datos x (a la izquierda y a la derecha de BP), utilizando las leyes de propagación de errores en sumas y multiplicaciones para calcular el error estándar (SE) de BP, y aplicando la prueba t de Student.
  2. significancia de A 1 y A 2 aplicando la distribución t de Student y el error estándar SE de A 1 y A 2
  3. significancia de la diferencia de A 1 y A 2 aplicando la distribución t de Student usando el SE de su diferencia.
  4. significancia de la diferencia de Y 1 y Y 2 aplicando la distribución t de Student utilizando el SE de su diferencia.
  5. Un enfoque estadístico más formal para probar la existencia de un punto de quiebre es mediante la prueba de pseudopuntuación, que no requiere la estimación de la línea segmentada. [ 4 ]

Además, se utiliza el coeficiente de correlación de todos los datos (Ra), el coeficiente de determinación o coeficiente de explicación, los intervalos de confianza de las funciones de regresión y el análisis ANOVA . [ 5 ]

El coeficiente de determinación para todos los datos (Cd), que debe maximizarse bajo las condiciones establecidas por las pruebas de significancia, se obtiene de:

  • dod=1(yYr)2(yYa)2{\displaystyle C_{d}=1-{\sum (y-Y_{r})^{2} \over \sum (y-Y_{a})^{2}}}

donde Yr es el valor esperado (predicho) de y según las ecuaciones de regresión anteriores y Ya es el promedio de todos los valores de y .

El coeficiente Cd varía de 0 (sin explicación alguna) a 1 (explicación completa, coincidencia perfecta). En una regresión lineal pura, no segmentada, los valores de Cd y Ra² son iguales. En una regresión segmentada, Cd debe ser significativamente mayor que Ra² para justificar la segmentación.

El valor óptimo del punto de ruptura se puede encontrar de manera que el coeficiente Cd sea máximo .

Rango sin efecto

Ilustración de un rango desde X=0 hasta X=7,85 en el que no hay ningún efecto.

La regresión segmentada se utiliza a menudo para detectar en qué rango una variable explicativa (X) no tiene efecto sobre la variable dependiente (Y), mientras que más allá de ese rango hay una respuesta clara, ya sea positiva o negativa. El rango de ausencia de efecto puede encontrarse en la parte inicial del dominio de X o, por el contrario, en su parte final. Para el análisis de "ausencia de efecto", la aplicación del método de mínimos cuadrados para el análisis de regresión segmentada [ 6 ] puede no ser la técnica más apropiada, ya que el objetivo es encontrar el tramo más largo en el que la relación YX puede considerarse con pendiente cero, mientras que más allá de ese rango la pendiente es significativamente diferente de cero, pero el conocimiento del mejor valor de esta pendiente no es relevante. El método para encontrar el rango de ausencia de efecto es la regresión parcial progresiva [ 7 ] sobre el rango, extendiéndolo con pequeños pasos hasta que el coeficiente de regresión sea significativamente diferente de cero.

En la siguiente figura, el punto de inflexión se encuentra en X=7,9, mientras que para los mismos datos (véase la figura azul anterior para el rendimiento de la mostaza), el método de mínimos cuadrados arroja un punto de inflexión únicamente en X=4,9. Este último valor es menor, pero el ajuste de los datos más allá del punto de inflexión es mejor. Por lo tanto, la elección del método dependerá del objetivo del análisis.

Implementaciones de software

  • En Python , existe el paquete piecewise-regression .
  • En R , existe el paquete segmentado .

Véase también

Referencias

  1. Análisis de frecuencia y regresión . Capítulo 6 en: HPRitzema (ed., 1994), Principios y aplicaciones del drenaje , Publ. 16, pp. 175-224, Instituto Internacional para la Recuperación y Mejora de Tierras (ILRI), Wageningen, Países Bajos. ISBN 90-70754-33-9Descarga gratuita desde la página web., bajo el n.º 20, o directamente como PDF  :
  2. Investigación sobre drenaje en campos agrícolas: análisis de datos . Parte del proyecto "Oro Líquido" del Instituto Internacional para la Recuperación y Mejora de Tierras (ILRI), Wageningen, Países Bajos. Descargar como PDF :
  3. RJOosterbaan, DPSharma, KNSingh y KVGKRao, 1990, Producción de cultivos y salinidad del suelo: evaluación de datos de campo de la India mediante regresión lineal segmentada . En: Actas del Simposio sobre Drenaje de Tierras para el Control de la Salinidad en Regiones Áridas y Semiáridas, del 25 de febrero al 2 de marzo de 1990, El Cairo, Egipto, Vol. 3, Sesión V, págs. 373-383.
  4. Muggeo, VMR (2016). "Prueba con un parámetro de perturbación presente solo bajo la alternativa: un enfoque basado en puntuaciones con aplicación al modelado segmentado" (PDF) . Journal of Statistical Computation and Simulation . 86 (15): 3059– 3067. doi : 10.1080/00949655.2016.1149855 . S2CID 124914264 . 
  5. Significancia estadística de la regresión lineal segmentada con punto de quiebre utilizando análisis de varianza y pruebas F. Descargar desdebajo el n.º 13, o directamente como PDF  :
  6. Análisis de regresión segmentada, Instituto Internacional para la Recuperación y Mejora de Tierras (ILRI), Wageningen, Países Bajos. Descarga gratuita desde la página web.
  7. Análisis de regresión parcial, Instituto Internacional para la Recuperación y Mejora de Tierras (ILRI), Wageningen, Países Bajos. Descarga gratuita desde la página web.