La regresión segmentada , también conocida como regresión por partes o regresión de segmentos , es un método de análisis de regresión en el que la variable independiente se divide en intervalos y se ajusta un segmento de línea independiente a cada intervalo. El análisis de regresión segmentada también se puede realizar con datos multivariados mediante la partición de las distintas variables independientes. La regresión segmentada es útil cuando las variables independientes, agrupadas en diferentes conjuntos, presentan distintas relaciones entre las variables en estas regiones. Los límites entre los segmentos se denominan puntos de quiebre .
La regresión lineal segmentada es una regresión segmentada en la que las relaciones en los intervalos se obtienen mediante regresión lineal .
Regresión lineal segmentada, dos segmentos



La regresión lineal segmentada con dos segmentos separados por un punto de quiebre puede ser útil para cuantificar un cambio abrupto de la función de respuesta (Yr) de un factor influyente variable ( x ). El punto de quiebre puede interpretarse como un valor crítico , seguro o umbral más allá o por debajo del cual ocurren efectos (no) deseados. El punto de quiebre puede ser importante en la toma de decisiones [ 1 ].
Las figuras ilustran algunos de los resultados y tipos de regresión que se pueden obtener.
Un análisis de regresión segmentada se basa en la presencia de un conjunto de datos ( y, x ), en el que y es la variable dependiente y x la variable independiente .
El método de mínimos cuadrados aplicado por separado a cada segmento, mediante el cual se hacen las dos líneas de regresión para ajustar el conjunto de datos lo más posible mientras se minimiza la suma de los cuadrados de las diferencias (SSD) entre los valores observados ( y ) y calculados (Yr) de la variable dependiente, da como resultado las dos ecuaciones siguientes:
- Yr = A 1 . x + K 1 para x < BP (punto de quiebre)
- Yr = A² . x + K² para x > BP (punto de quiebre)
dónde:
- Yr es el valor esperado (predicho) de y para un determinado valor de x ;
- A 1 y A 2 son coeficientes de regresión (que indican la pendiente de los segmentos de línea);
- K 1 y K 2 son constantes de regresión (que indican la intersección con el eje y ).
Los datos pueden mostrar muchos tipos o tendencias, [ 2 ] véanse las figuras.
El método también arroja dos coeficientes de correlación (R):
- para x < BP (punto de ruptura)
y
- para x > BP (punto de ruptura)
dónde:
- es el SSD minimizado por segmento
y
- Y a1 y Y a2 son los valores promedio de y en los segmentos respectivos.
Para determinar la tendencia más adecuada, es necesario realizar pruebas estadísticas que garanticen que dicha tendencia sea fiable (significativa).
Cuando no se detecta ningún punto de ruptura significativo, hay que recurrir a una regresión sin punto de ruptura.
Ejemplo

Para la figura azul de la derecha que muestra la relación entre el rendimiento de la mostaza (Yr = Ym, t/ha) y la salinidad del suelo ( x = Ss, expresada como conductividad eléctrica de la solución del suelo CE en dS/m) se encuentra que: [ 3 ]
BP = 4,93, A 1 = 0, K 1 = 1,74, A 2 = − 0,129, K 2 = 2,38, R 1 2 = 0,0035 (no significativo), R 2 2 = 0,395 (significativo) y:
- Ym = 1,74 t/ha para Ss < 4,93 (punto de inflexión)
- Ym = − 0,129 Ss + 2,38 t/ha para Ss > 4,93 (punto de inflexión)
lo que indica que las salinidades del suelo < 4,93 dS/m son seguras y las salinidades del suelo > 4,93 dS/m reducen el rendimiento a razón de 0,129 t/ha por cada unidad de aumento de la salinidad del suelo.
La figura también muestra los intervalos de confianza y la incertidumbre, tal como se detalla a continuación.
Procedimientos de prueba


Las siguientes pruebas estadísticas se utilizan para determinar el tipo de tendencia:
- Se analiza la significancia del punto de quiebre (BP) expresando BP como una función de los coeficientes de regresión A 1 y A 2 y las medias Y 1 y Y 2 de los datos y , y las medias X 1 y X 2 de los datos x (a la izquierda y a la derecha de BP), utilizando las leyes de propagación de errores en sumas y multiplicaciones para calcular el error estándar (SE) de BP, y aplicando la prueba t de Student.
- significancia de A 1 y A 2 aplicando la distribución t de Student y el error estándar SE de A 1 y A 2
- significancia de la diferencia de A 1 y A 2 aplicando la distribución t de Student usando el SE de su diferencia.
- significancia de la diferencia de Y 1 y Y 2 aplicando la distribución t de Student utilizando el SE de su diferencia.
- Un enfoque estadístico más formal para probar la existencia de un punto de quiebre es mediante la prueba de pseudopuntuación, que no requiere la estimación de la línea segmentada. [ 4 ]
Además, se utiliza el coeficiente de correlación de todos los datos (Ra), el coeficiente de determinación o coeficiente de explicación, los intervalos de confianza de las funciones de regresión y el análisis ANOVA . [ 5 ]
El coeficiente de determinación para todos los datos (Cd), que debe maximizarse bajo las condiciones establecidas por las pruebas de significancia, se obtiene de:
donde Yr es el valor esperado (predicho) de y según las ecuaciones de regresión anteriores y Ya es el promedio de todos los valores de y .
El coeficiente Cd varía de 0 (sin explicación alguna) a 1 (explicación completa, coincidencia perfecta). En una regresión lineal pura, no segmentada, los valores de Cd y Ra² son iguales. En una regresión segmentada, Cd debe ser significativamente mayor que Ra² para justificar la segmentación.
El valor óptimo del punto de ruptura se puede encontrar de manera que el coeficiente Cd sea máximo .
Rango sin efecto

Segmented regression is often used to detect over which range an explanatory variable (X) has no effect on the dependent variable (Y), while beyond the reach there is a clear response, be it positive or negative. The reach of no effect may be found at the initial part of X domain or conversely at its last part. For the "no effect" analysis, application of the least squares method for the segmented regression analysis [6] may not be the most appropriate technique because the aim is rather to find the longest stretch over which the Y-X relation can be considered to possess zero slope while beyond the reach the slope is significantly different from zero but knowledge about the best value of this slope is not material. The method to find the no-effect range is progressive partial regression [7] over the range, extending the range with small steps until the regression coefficient gets significantly different from zero.
In the next figure the break point is found at X=7.9 while for the same data (see blue figure above for mustard yield), the least squares method yields a break point only at X=4.9. The latter value is lower, but the fit of the data beyond the break point is better. Hence, it will depend on the purpose of the analysis which method needs to be employed.
Software implementations
See also
References
- ↑Frequency and Regression Analysis. Chapter 6 in: H.P.Ritzema (ed., 1994), Drainage Principles and Applications, Publ. 16, pp. 175-224, International Institute for Land Reclamation and Improvement (ILRI), Wageningen, The Netherlands. ISBN 90-70754-33-9 . Free download from the webpage , under nr. 20, or directly as PDF :
- ↑ Drainage research in farmers' fields: analysis of data. Part of project "Liquid Gold" of the International Institute for Land Reclamation and Improvement (ILRI), Wageningen, The Netherlands. Download as PDF :
- ↑R.J.Oosterbaan, D.P.Sharma, K.N.Singh and K.V.G.K.Rao, 1990, Crop production and soil salinity: evaluation of field data from India by segmented linear regression. In: Proceedings of the Symposium on Land Drainage for Salinity Control in Arid and Semi-Arid Regions, February 25th to March 2nd, 1990, Cairo, Egypt, Vol. 3, Session V, p. 373 - 383.
- ↑ Muggeo, VMR (2016). "Prueba con un parámetro de perturbación presente solo bajo la alternativa: un enfoque basado en puntuaciones con aplicación al modelado segmentado" (PDF) . Journal of Statistical Computation and Simulation . 86 (15): 3059– 3067. doi : 10.1080/00949655.2016.1149855 . S2CID 124914264 .
- ↑ Significancia estadística de la regresión lineal segmentada con punto de quiebre utilizando análisis de varianza y pruebas F. Descargar desdebajo el n.º 13, o directamente como PDF :
- ↑ Análisis de regresión segmentada, Instituto Internacional para la Recuperación y Mejora de Tierras (ILRI), Wageningen, Países Bajos. Descarga gratuita desde la página web.
- ↑ Análisis de regresión parcial, Instituto Internacional para la Recuperación y Mejora de Tierras (ILRI), Wageningen, Países Bajos. Descarga gratuita desde la página web.
- Modelos de regresión