Articulo de referencia

Intervalo de predicción

En inferencia estadística , específicamente en inferencia predictiva , un intervalo de predicción es una estimación del intervalo en el que caerá una observación futura, con cie...

En inferencia estadística , específicamente en inferencia predictiva , un intervalo de predicción es una estimación del intervalo en el que caerá una observación futura, con cierta probabilidad, dado lo que ya se ha observado. Los intervalos de predicción se utilizan con frecuencia en el análisis de regresión .

Un ejemplo sencillo lo proporciona un dado de seis caras con valores que van del 1 al 6. El intervalo de confianza para el valor esperado estimado de la cara será de aproximadamente 3,5 y se irá reduciendo con un mayor tamaño de muestra. Sin embargo, el intervalo de predicción para la siguiente tirada oscilará aproximadamente entre 1 y 6, independientemente del número de muestras analizadas hasta el momento.

Los intervalos de predicción se utilizan tanto en la estadística frecuentista como en la estadística bayesiana : un intervalo de predicción guarda la misma relación con una observación futura que un intervalo de confianza frecuentista o un intervalo creíble bayesiano con un parámetro poblacional no observable: los intervalos de predicción predicen la distribución de puntos futuros individuales, mientras que los intervalos de confianza y los intervalos creíbles de los parámetros predicen la distribución de las estimaciones de la media poblacional verdadera u otra cantidad de interés que no se puede observar.

Introducción

Si se asume paramétricamente que la distribución subyacente es una distribución normal y se tiene un conjunto de muestras { X 1 ,  ..., X n }, entonces se pueden usar intervalos de confianza e intervalos creíbles para estimar la media poblacional μ y la desviación estándar poblacional σ de la población subyacente, mientras que se pueden usar intervalos de predicción para estimar el valor de la siguiente variable de muestra, X n +1 . 

Alternativamente, en términos bayesianos , un intervalo de predicción puede describirse como un intervalo creíble para la variable en sí, en lugar de para un parámetro de su distribución.

El concepto de intervalos de predicción no tiene por qué limitarse a inferir un único valor de muestra futuro, sino que puede extenderse a casos más complejos. Por ejemplo, en el contexto de las inundaciones fluviales, donde los análisis suelen basarse en los valores anuales del caudal máximo del año, puede resultar interesante realizar inferencias sobre la mayor inundación que probablemente se produzca en los próximos 50 años.

Dado que los intervalos de predicción solo se ocupan de observaciones pasadas y futuras, en lugar de parámetros poblacionales no observables, algunos estadísticos, como Seymour Geisser , los defienden como un método mejor que los intervalos de confianza, siguiendo el enfoque en las variables observables de Bruno de Finetti .

Distribución normal

Dada una muestra de una distribución normal , cuyos parámetros son desconocidos, es posible dar intervalos de predicción en el sentido frecuentista, es decir, un intervalo [ a , b ] basado en las estadísticas de la muestra tal que en experimentos repetidos, X n +1 cae en el intervalo el porcentaje deseado de veces; a estos se les puede llamar " intervalos de confianza predictivos ". [ 1 ] 

Una técnica general de intervalos de predicción frecuentistas consiste en encontrar y calcular una cantidad pivotal de las observables X 1 ,  ..., X n , X n +1 – es decir, una función de observables y parámetros cuya distribución de probabilidad no depende de los parámetros – que se puede invertir para dar una probabilidad de que la observación futura X n +1 caiga en algún intervalo calculado en términos de los valores observados hasta el momento,  incógnita1,,incógnitanorte.{\displaystyle X_{1},\dots ,X_{n}.}Dicha cantidad fundamental, que depende únicamente de observables, se denomina estadística auxiliar . [ 2 ] El método habitual para construir cantidades fundamentales consiste en calcular la diferencia entre dos variables que dependen de la ubicación, de modo que la ubicación se cancele, y luego calcular la razón entre dos variables que dependen de la escala, de modo que la escala se cancele. La cantidad fundamental más conocida es la estadística t de Student , que se puede obtener mediante este método y se utiliza a continuación.

Media conocida, varianza conocida

Se puede calcular un intervalo de predicción [ , u ] para una observación futura X en una distribución normal N ( μ , σ 2 ) con media y varianza conocidas a partir de

γ=PAG(<incógnita<)=PAG(μσ<incógnitaμσ<μσ)=PAG(μσ<Z<μσ),{\displaystyle \gamma =P(\ell <X<u)=P\left({\frac {\ell -\mu }{\sigma }}<{\frac {X-\mu }{\sigma }}<{\frac {u-\mu }{\sigma }}\right)=P\left({\frac {\ell -\mu }{\sigma }}<Z<{\frac {u-\mu }{\sigma }}\right),}

dóndeZ=incógnitaμσ{\displaystyle Z={\frac {X-\mu }{\sigma }}}, la puntuación estándar de X , se distribuye como normal estándar.

Por eso

μσ=z,μσ=z,{\displaystyle {\frac {\ell -\mu }{\sigma }}=-z,\quad {\frac {u-\mu }{\sigma }}=z,}

o

=μzσ,=μ+zσ,{\displaystyle \ell =\mu -z\sigma ,\quad u=\mu +z\sigma ,}

donde z es el cuantil en la distribución normal estándar para el cual:

γ=PAG(z<Z<z).{\displaystyle \gamma =P(-z<Z<z).}

o equivalentemente;

12(1γ)=PAG(Z>z).{\displaystyle {\tfrac {1}{2}}(1-\gamma )=P(Z>z).}
Intervalo de predicción (en el eje y ) dado por z (el cuantil de la puntuación estándar , en el eje x ). El eje y está comprimido logarítmicamente (pero los valores que contiene no se modifican).

El intervalo de predicción se escribe convencionalmente como:

[μzσ, μ+zσ].{\displaystyle \left[\mu -z\sigma ,\ \mu +z\sigma \right].}

Por ejemplo, para calcular el intervalo de predicción del 95% para una distribución normal con una media ( μ ) de 5 y una desviación estándar ( σ ) de 1, entonces z es aproximadamente 2. Por lo tanto, el límite inferior del intervalo de predicción es aproximadamente 5   (2 1) = 3, y el límite superior es aproximadamente 5  +  (2 1) = 7, lo que da un intervalo de predicción de aproximadamente 3 a 7.

Diagrama que muestra la función de distribución acumulativa para la distribución normal con media ( μ ) 0 y varianza ( σ² ) 1. Además de la función cuantil , el intervalo de predicción para cualquier puntuación estándar se puede calcular mediante (1 (1 Φ μ , σ² (puntuación estándar)) 2). Por ejemplo, una puntuación estándar de x = 1,96 da Φ μ , σ² (1,96) = 0,9750 correspondiente a un intervalo de predicción de (1 ( 1 0,9750) 2) = 0,9500 = 95%.                

Estimación de parámetros

Para una distribución con parámetros desconocidos, un enfoque directo para la predicción consiste en estimar los parámetros y luego utilizar la función cuantil asociada; por ejemplo, se podría utilizar la media muestral.incógnita¯{\displaystyle {\overline {x}}}como una estimación para μ y la varianza muestral s 2 como una estimación para σ 2 . Hay dos opciones naturales para s 2 aquí: dividir por(norte1){\displaystyle (n-1)}proporciona una estimación insesgada, mientras que dividir por n produce el estimador de máxima verosimilitud , y cualquiera de los dos puede utilizarse. A continuación, se utiliza la función cuantil con estos parámetros estimados.Φincógnita¯,s21{\displaystyle \Phi _{{\overline {x}},s^{2}}^{-1}}estimar un intervalo en la distribución muestral deincógnitanorte+1{\displaystyle X_{n+1}}.

Este enfoque es utilizable, pero el intervalo resultante no tendrá la promesa de rendimiento de muestreo repetido para cubrir el observable futuro [ 4 ] ; no es un intervalo de predicción.

Para la continuación, utilice la media de la muestra:

incógnita¯=(incógnita1++incógnitanorte)/norte{\displaystyle {\overline {X}}=(X_{1}+\cdots +X_{n})/n}

y la varianza de la muestra (insesgada):

S2=1norte1i=1norte(incógnitaiincógnita¯)2{\displaystyle S^{2}={1 \over n-1}\sum _{i=1}^{n}(X_{i}-{\overline {X}})^{2}}

Media desconocida, varianza conocida

Dado [ 5 ] una distribución normal con media desconocida μ pero varianza conocidaσ2{\displaystyle \sigma ^{2}}, la media de la muestraincógnita¯{\displaystyle {\overline {X}}}de las observacionesincógnita1,,incógnitanorte{\displaystyle X_{1},\dots ,X_{n}}tiene distribuciónnorte(μ,σ2/norte),{\displaystyle N(\mu ,\sigma ^{2}/n),}mientras que la observación futuraincógnitanorte+1{\displaystyle X_{n+1}}tiene distribuciónnorte(μ,σ2).{\displaystyle N(\mu ,\sigma ^{2}).}Al tomar la diferencia de estos se cancela la μ y se obtiene una distribución normal de la varianza.σ2+(σ2/norte),{\displaystyle \sigma ^{2}+(\sigma ^{2}/n),}de este modo

incógnitanorte+1incógnita¯σ2+(σ2/norte)norte(0,1).{\displaystyle {\frac {X_{n+1}-{\overline {X}}}{\sqrt {\sigma ^{2}+(\sigma ^{2}/n)}}}\sim N(0,1).}

Girando esta cantidad paraincógnitanorte+1{\displaystyle X_{n+1}}produce la prueba bilateral de cola igual100(1α)%{\displaystyle 100(1-\alpha )\%}intervalo de predicciónincógnita¯±z1α/2σ2+σ2/norte{\displaystyle {\bar {x}}\pm z_{1-\alpha /2}{\sqrt {\sigma ^{2}+\sigma ^{2}/n}}}Este es un intervalo de predicción en el sentido de que, en aplicaciones repetidas de este cálculo, el intervalo de predicción cubrirá la observación futura.100(1α)%{\displaystyle 100(1-\alpha )\%}de la época.

Observe que este intervalo de predicción es más amplio en comparación con el uso simple de la varianza conocida.σ2{\displaystyle \sigma ^{2}}Esto es necesario para que se cumpla la propiedad del intervalo de predicción deseado.

Tenga en cuenta que algunos autores pueden referirse informalmente anorte(incógnita¯,σ2+(σ2/norte)){\displaystyle N({\overline {x}},\sigma ^{2}+(\sigma ^{2}/n))}como una distribución predictiva o de predicción paraincógnitanorte+1{\displaystyle X_{n+1}}, pero tomado literalmente esto sugeriría queincógnitanorte+1{\displaystyle X_{n+1}}sigue una distribución normal centrada enincógnita¯{\displaystyle {\bar {x}}}con varianzaσ2+(σ2/norte){\displaystyle \sigma ^{2}+(\sigma ^{2}/n)}, en contra de la premisa dondeincógnitanorte+1norte(μ,σ2)incógnita¯norte(μ,σ2/norte){\displaystyle X_{n+1}\sim N(\mu ,\sigma ^{2})\perp {\bar {X}}\sim N(\mu ,\sigma ^{2}/n)}.

Media conocida, varianza desconocida

Por el contrario, dada una distribución normal con media conocida μ pero varianza desconocidaσ2{\displaystyle \sigma ^{2}}, la varianza de la muestraS2{\displaystyle S^{2}}de las observacionesincógnita1,,incógnitanorte{\displaystyle X_{1},\dots ,X_{n}}tiene, a escala, unaχnorte12{\displaystyle \chi _{n-1}^{2}}distribución ; más precisamente:

(norte1)S2σ2χnorte12.{\displaystyle {\frac {(n-1)S^{2}}{\sigma ^{2}}}\sim \chi _{n-1}^{2}.}

Por otro lado, la observación futuraincógnitanorte+1{\displaystyle X_{n+1}}tiene distribuciónnorte(μ,σ2).{\displaystyle N(\mu ,\sigma ^{2}).} Tomando la razón del residuo de la observación futuraincógnitanorte+1μ{\displaystyle X_{n+1}-\mu }y la desviación estándar de la muestra S produce una cantidad fundamental que sigue una distribución t de Student con n  1 grados de libertad (véase su derivación ):

incógnitanorte+1μSTnorte1.{\displaystyle {\frac {X_{n+1}-\mu }{S}}\sim T_{n-1}.}

Girando esta cantidad paraincógnitanorte+1{\displaystyle X_{n+1}}produce la prueba bilateral de cola igual100(1α)%{\displaystyle 100(1-\alpha )\%}intervalo de predicciónμ±t1α/2,norte1s{\displaystyle \mu \pm t_{1-\alpha /2,n-1}\cdot s}, dóndet1α/2,norte1{\displaystyle t_{1-\alpha /2,n-1}} es el100(1α/2)th{\displaystyle 100(1-\alpha /2)^{th}}percentil de la distribución t de Student con n 1 grados de libertad.  

Nótese que este intervalo de predicción es más conservador que el uso de una distribución normal con la desviación estándar estimada.s{\displaystyle s}y una media conocida μ , ya que utiliza la distribución t en lugar de la distribución normal, lo que produce intervalos más amplios. Esto es necesario para que se cumpla la propiedad del intervalo de predicción deseado.

Media desconocida, varianza desconocida

Combinando lo anterior para obtener una distribución normalnorte(μ,σ2){\displaystyle N(\mu ,\sigma ^{2})}con μ y σ 2 desconocidos produce la siguiente estadística auxiliar: [ 6 ]

incógnitanorte+1incógnita¯S+S/norteTnorte1{\displaystyle {\frac {X_{n+1}-{\overline {X}}}{\sqrt {S+S/n}}}\sim T_{n-1}}

Esta sencilla combinación es posible porque la media muestral y la varianza muestral de la distribución normal son estadísticas independientes; esto solo es cierto para la distribución normal y, de hecho, la caracteriza.

Pivoteando paraincógnitanorte+1{\displaystyle X_{n+1}}produce la prueba bilateral de cola igual100(1α)%{\displaystyle 100(1-\alpha )\%}intervalo de predicción

incógnita¯±t1α/2,norte1s2+s2/norte{\displaystyle {\bar {x}}\pm t_{1-\alpha /2,n-1}{\sqrt {s^{2}+s^{2}/n}}}

La probabilidad del intervalo de predicción que cubreincógnitanorte+1{\displaystyle X_{n+1}}es entonces:

Pr(incógnita¯t1α/2,norte1S+S/norteincógnitanorte+1incógnita¯+t1α/2,norte1S+S/norte)=1α{\displaystyle \Pr \left({\overline {X}}-t_{1-\alpha /2,n-1}{\sqrt {S+S/n}}\leq X_{n+1}\leq {\overline {X}}+t_{1-\alpha /2,n-1}{\sqrt {S+S/n}}\,\right)=1-\alpha }

dóndet1α/2,norte1{\displaystyle t_{1-\alpha /2,n-1}} es el100(1α/2)th{\displaystyle 100(1-\alpha /2)^{th}}percentil de la distribución t de Student con n 1 grados de libertad.  

Métodos no paramétricos

Es posible calcular intervalos de predicción sin hacer suposiciones sobre la población, es decir, de forma no paramétrica .

El método bootstrap residual puede utilizarse para construir intervalos de predicción no paramétricos.

Predicción conforme

En general, el método de predicción conforme es más general. Consideremos el caso especial de usar el mínimo y el máximo como límites para un intervalo de predicción: Si se tiene una muestra de variables aleatorias idénticas { X 1 ,  ..., X n }, entonces la probabilidad de que la siguiente observación X n +1 sea la mayor es 1/( n + 1 ), ya que todas las observaciones tienen la misma probabilidad de ser el máximo. De la misma manera, la probabilidad de que X n +1 sea la menor es 1/( n + 1 ). El otro ( n 1)/( n + 1) de las veces, X n +1 cae entre el máximo y el mínimo de la muestra { X 1 , ..., X n }. Por lo tanto, denotando el máximo y el mínimo de la muestra por M y m, esto produce un intervalo de predicción ( n 1)/( n + 1) de [ m , M ].                

Nótese que, si bien esto proporciona la probabilidad de que una observación futura se encuentre dentro de un rango, no ofrece ninguna estimación sobre su posición exacta dentro de dicho rango. Cabe destacar que, si se encuentra fuera del rango de valores observados, podría estar muy alejada de él. Para un análisis más detallado, consulte la teoría de valores extremos . Formalmente, esto se aplica no solo al muestreo de una población, sino a cualquier secuencia intercambiable de variables aleatorias, no necesariamente independientes o idénticamente distribuidas .

Contrasta con otros intervalos

Contraste con intervalos de confianza

En la fórmula del intervalo de confianza predictivo no se mencionan los parámetros no observables μ y σ de la media y la desviación estándar poblacionales, es decir, las estadísticas de la muestra observada.incógnita¯norte{\displaystyle {\overline {X}}_{n}}ySnorte{\displaystyle S_{n}}Se utilizan la media y la desviación estándar de la muestra, y lo que se estima es el resultado de muestras futuras .

Al considerar los intervalos de predicción, en lugar de utilizar las estadísticas de la muestra como estimadores de los parámetros de la población y aplicar intervalos de confianza a estas estimaciones, se considera "la siguiente muestra".incógnitanorte+1{\displaystyle X_{n+1}}como una estadística en sí misma , y ​​calcula su distribución muestral .

En los intervalos de confianza paramétricos, se estiman los parámetros poblacionales; si se desea interpretar esto como una predicción de la siguiente muestra, se modela dicha muestra como una extracción de esta población estimada, utilizando la distribución poblacional (estimada) . Por el contrario, en los intervalos de confianza predictivos, se utiliza la distribución muestral de (un estadístico de) una muestra de n o n  +  1 observaciones de dicha población, y la distribución poblacional no se utiliza directamente, aunque la suposición sobre su forma (si bien no los valores de sus parámetros) se utiliza para calcular la distribución muestral.

En el análisis de regresión

Una aplicación común de los intervalos de predicción es el análisis de regresión . Supongamos que los datos se modelan mediante una línea recta ( regresión lineal simple ):

yi=α+βincógnitai+εi{\displaystyle y_{i}=\alpha +\beta x_{i}+\varepsilon _{i}\,}

dóndeyi{\displaystyle y_{i}}es la variable de respuesta ,incógnitai{\displaystyle x_{i}}es la variable explicativa , ε i es un término de error aleatorio yα{\displaystyle \alpha }yβ{\displaystyle \beta }son parámetros.

Dados los estimadosα^{\displaystyle {\hat {\alpha }}}yβ^{\displaystyle {\hat {\beta }}}Para los parámetros, como por ejemplo los de mínimos cuadrados ordinarios , el valor de respuesta predicho y d para un valor explicativo dado x d es

y^d=α^+β^incógnitad,{\displaystyle {\hat {y}}_{d}={\hat {\alpha }}+{\hat {\beta }}x_{d},}

(el punto en la línea de regresión), mientras que la respuesta real sería

yd=α+βincógnitad+εd.{\displaystyle y_{d}=\alpha +\beta x_{d}+\varepsilon _{d}.\,}

La estimación puntualy^d{\displaystyle {\hat {y}}_{d}}se denomina respuesta media y es una estimación del valor esperado de y d ,mi(yincógnitad).{\displaystyle E(y\mid x_{d}).}

Un intervalo de predicción, en cambio, proporciona un intervalo en el que se espera que caiga y d ; esto no es necesario si se conocen los parámetros reales α y β (junto con el término de error ε i ), pero si se está estimando a partir de una muestra , entonces se puede utilizar el error estándar de las estimaciones para la intersección y la pendiente (α^{\displaystyle {\hat {\alpha }}}yβ^{\displaystyle {\hat {\beta }}}), así como su correlación, para calcular un intervalo de predicción.

En regresión, Faraway (2002 , p. 39) hace una distinción entre intervalos para predicciones de la respuesta media frente a predicciones de la respuesta observada, lo que afecta esencialmente a la inclusión o no del término de unidad dentro de la raíz cuadrada en los factores de expansión anteriores ; para más detalles, véase Faraway (2002) . 

estadística bayesiana

Seymour Geisser , defensor de la inferencia predictiva, ofrece aplicaciones predictivas de la estadística bayesiana . [ 7 ]

En estadística bayesiana, se pueden calcular intervalos de predicción (bayesianos) a partir de la probabilidad posterior de la variable aleatoria, denominados intervalos de credibilidad . En el trabajo teórico, los intervalos de credibilidad no se suelen calcular para la predicción de eventos futuros, sino para la inferencia de parámetros; es decir, intervalos de credibilidad de un parámetro, no para los resultados de la variable en sí. Sin embargo, especialmente cuando las aplicaciones se refieren a posibles valores extremos de casos aún no observados, los intervalos de credibilidad para dichos valores pueden tener una importancia práctica.

Aplicaciones

Los intervalos de predicción se utilizan comúnmente como definiciones de rangos de referencia , como los rangos de referencia para análisis de sangre, para determinar si un análisis es normal o no. Para este propósito, el intervalo de predicción más utilizado es el del 95 %, y un rango de referencia basado en él se denomina rango de referencia estándar .

Véase también

Notas

  1. Geisser (1993 , p. 6 ) : Capítulo 2: Enfoques predictivos no bayesianos 
  2. Geisser (1993 , p. 7 ) 
  3. 1 2 3 4 Tabla A2 en Sterne & Kirkwood (2003 , pág. 472) 
  4. ^ Geisser (1993 , págs. 8-9 ) 
  5. Geisser (1993 , pág. 7– ) 
  6. ^ Geisser (1993 , ejemplo 2.2, págs. 9-10 )
  7. Geisser (1993)

Referencias

  • Faraway, Julian J. (2002), Regresión práctica y ANOVA usando R (PDF)
  • Geisser, Seymour (1993), Inferencia predictiva , CRC Press
  • Sterne, Jonathan; Kirkwood, Betty R. (2003), Essential Medical Statistics , Blackwell Science , ISBN 0-86542-871-9
  • Nikulchev, E.; Chervyakov, A. (2023), "Intervalos de predicción: una visión geométrica", Symmetry , 15 (4): 781, doi : 10.3390/sym15040781
  • Nikulchev, Evgeny (2026), "Algoritmo genético con variables de calibración para la aproximación del frente de Pareto en intervalos de predicción", Matemáticas , 14 (14): 2686, doi : 10.3390/sym15040781

Lecturas adicionales

  • Chatfield, C. (1993). "Cálculo de pronósticos por intervalos". Journal of Business & Economic Statistics . 11 (2): 121– 135. doi : 10.2307/1391361 . JSTOR 1391361 . 
  • Lawless, JF; Fredette, M. (2005). "Intervalos de predicción frecuentistas y distribuciones predictivas" . Biometrika . 92 (3): 529– 542. doi : 10.1093/biomet/92.3.529 .
  • Meade, N.; Islam, T. (1995). "Intervalos de predicción para pronósticos de curvas de crecimiento". Journal of Forecasting . 14 (5): 413– 430. doi : 10.1002/for.3980140502 .
  • Norma ISO 16269-8 Interpretación de datos, Parte 8, Determinación de intervalos de predicción