Articulo de referencia

Remuestreo Jackknife

Esquema del remuestreo jackknife En estadística , el jackknife (validación cruzada jackknife) es una técnica de validación cruzada y, por lo tanto, una forma de remuestreo . Es ...

Esquema del remuestreo jackknife

En estadística , el jackknife (validación cruzada jackknife) es una técnica de validación cruzada y, por lo tanto, una forma de remuestreo . Es especialmente útil para la estimación de sesgo y varianza . El jackknife es anterior a otros métodos comunes de remuestreo como el bootstrap . Dado una muestra de tamañonorte{\displaystyle n}, se puede construir un estimador jackknife agregando las estimaciones de parámetros de cada submuestra de tamaño(norte1){\displaystyle (n-1)}obtenido omitiendo una observación. [ 1 ] El jackknife es una aproximación lineal del bootstrap . [ 2 ]

La técnica de la navaja plegable fue desarrollada por Maurice Quenouille (1924–1973) a partir de 1949 y perfeccionada en 1956. John Tukey amplió la técnica en 1958 y propuso el nombre de "navaja plegable" porque, al igual que una navaja plegable física (una navaja plegable compacta), es una herramienta práctica y versátil que puede improvisar una solución para diversos problemas, aunque problemas específicos se puedan resolver de manera más eficiente con una herramienta diseñada específicamente para ello. [ 3 ]

Un ejemplo sencillo: estimación de la media

El estimador jackknife de un parámetro se obtiene omitiendo sistemáticamente cada observación de un conjunto de datos, calculando la estimación del parámetro sobre las observaciones restantes y, posteriormente, agregando estos cálculos.

Por ejemplo, si el parámetro a estimar es la media poblacional de una variable aleatoriaincógnita{\displaystyle x}, entonces para un conjunto dado de observaciones i.i.d.incógnita1,...,incógnitanorte{\displaystyle x_{1},...,x_{n}}El estimador natural es la media muestral: incógnita¯=1nortei=1norteincógnitai=1nortei[norte]incógnitai,{\displaystyle {\bar {x}}={\frac {1}{n}}\sum _{i=1}^{n}x_{i}={\frac {1}{n}}\sum _{i\in [n]}x_{i},} donde la última suma se utilizó de otra manera para indicar que el índicei{\displaystyle i}corre sobre el conjunto[norte]={1,,norte}{\displaystyle [n]=\{1,\ldots ,n\}}.

Luego procedemos de la siguiente manera: Para cadai[norte]{\displaystyle i\in [n]}calculamos la mediaincógnita¯(i){\displaystyle {\bar {x}}_{(i)}}de la submuestra jackknife que consta de todos excepto eli{\displaystyle i}-ésimo punto de datos, y esto se llama eli{\displaystyle i}-Replicación de la navaja: incógnita¯(i)=1norte1j[norte],jiincógnitaj,i=1,,norte.{\displaystyle {\bar {x}}_{(i)}={\frac {1}{n-1}}\sum _{j\in [n],j\neq i}x_{j},\qquad i=1,\dots ,n.}

Podría ayudar pensar que estosnorte{\displaystyle n}réplicas de navajaincógnita¯(1),,incógnita¯(norte){\displaystyle {\bar {x}}_{(1)},\ldots ,{\bar {x}}_{(n)}}aproximar la distribución de la media muestralincógnita¯{\displaystyle {\bar {x}}}. Un más grandenorte{\displaystyle n}mejora la aproximación. Luego, finalmente, para obtener el estimador jackknife, elnorte{\displaystyle n}Las réplicas de jackknife se promedian: incógnita¯Jacobo=1nortei=1norteincógnita¯(i).{\displaystyle {\bar {x}}_{\text{jack}}={\frac {1}{n}}\sum _{i=1}^{n}{\bar {x}}_{(i)}.}

Uno puede preguntarse acerca del sesgo y la varianza deincógnita¯Jacobo{\displaystyle {\bar {x}}_{\text{jack}}}. Desde la definición deincógnita¯Jacobo{\displaystyle {\bar {x}}_{\text{jack}}}como el promedio de las réplicas jackknife, se podría intentar calcular explícitamente. El sesgo es un cálculo trivial, pero la varianza deincógnita¯Jacobo{\displaystyle {\bar {x}}_{\text{jack}}}es más complejo, ya que las réplicas de jackknife no son independientes.

Para el caso especial de la media, se puede demostrar explícitamente que la estimación jackknife es igual a la estimación usual: 1nortei=1norteincógnita¯(i)=incógnita¯.{\displaystyle {\frac {1}{n}}\sum _{i=1}^{n}{\bar {x}}_{(i)}={\bar {x}}.} Esto establece la identidadincógnita¯Jacobo=incógnita¯{\displaystyle {\bar {x}}_{\text{jack}}={\bar {x}}}. Luego, tomando expectativas, obtenemosmi[incógnita¯Jacobo]=mi[incógnita¯]=mi[incógnita]{\displaystyle E[{\bar {x}}_{\text{jack}}]=E[{\bar {x}}]=E[x]}, entoncesincógnita¯Jacobo{\displaystyle {\bar {x}}_{\text{jack}}}es imparcial, mientras que al tomar la varianza, obtenemosV[incógnita¯Jacobo]=V[incógnita¯]=V[incógnita]/norte{\displaystyle V[{\bar {x}}_{\text{jack}}]=V[{\bar {x}}]=V[x]/n}Sin embargo, estas propiedades generalmente no se cumplen para parámetros distintos de la media.

Este sencillo ejemplo para el caso de la estimación de la media sirve simplemente para ilustrar la construcción de un estimador jackknife, mientras que las sutilezas reales (y la utilidad) surgen en el caso de la estimación de otros parámetros, como momentos de orden superior a la media u otros funcionales de la distribución.

incógnita¯Jacobo{\displaystyle {\bar {x}}_{\text{jack}}}podría utilizarse para construir una estimación empírica del sesgo deincógnita¯{\displaystyle {\bar {x}}}, es decirinclinación^(incógnita¯)Jacobo=do(incógnita¯Jacoboincógnita¯){\displaystyle {\widehat {\operatorname {bias} }}({\bar {x}})_{\text{jack}}=c({\bar {x}}_{\text{jack}}-{\bar {x}})}con algún factor adecuadodo>0{\displaystyle c>0}, aunque en este caso sabemos queincógnita¯Jacobo=incógnita¯{\displaystyle {\bar {x}}_{\text{jack}}={\bar {x}}}, por lo tanto, esta construcción no agrega ningún conocimiento significativo, pero da la estimación correcta del sesgo (que es cero).

Una estimación jackknife de la varianza deincógnita¯{\displaystyle {\bar {x}}}se puede calcular a partir de la varianza de las réplicas jackknifeincógnita¯(i){\displaystyle {\bar {x}}_{(i)}}: [ 4 ] [ 5 ]var^(incógnita¯)Jacobo=norte1nortei=1norte(incógnita¯(i)incógnita¯Jacobo)2=1norte(norte1)i=1norte(incógnitaiincógnita¯)2.{\displaystyle {\widehat {\operatorname {var} }}({\bar {x}})_{\text{jack}}={\frac {n-1}{n}}\sum _{i=1}^{n}({\bar {x}}_{(i)}-{\bar {x}}_{\text{jack}})^{2}={\frac {1}{n(n-1)}}\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}.} La igualdad de la izquierda define el estimador.var^(incógnita¯)Jacobo{\displaystyle {\widehat {\operatorname {var} }}({\bar {x}})_{\text{jack}}}y la igualdad correcta es una identidad que puede verificarse directamente. Luego, tomando expectativas, obtenemosmi[var^(incógnita¯)Jacobo]=V[incógnita]/norte=V[incógnita¯]{\displaystyle E[{\widehat {\operatorname {var} }}({\bar {x}})_{\text{jack}}]=V[x]/n=V[{\bar {x}}]}, por lo tanto, este es un estimador insesgado de la varianza deincógnita¯{\displaystyle {\bar {x}}}.

Estimación del sesgo de un estimador

La técnica jackknife se puede utilizar para estimar (y corregir) el sesgo de un estimador calculado sobre toda la muestra.

Suponerθ{\displaystyle \theta }es el parámetro objetivo de interés, que se supone que es algún funcional de la distribución deincógnita{\displaystyle x}Basado en un conjunto finito de observacionesincógnita1,...,incógnitanorte{\displaystyle x_{1},...,x_{n}}, que se supone que consiste en copias i.i.d. deincógnita{\displaystyle x}, el estimadorθ^{\displaystyle {\hat {\theta }}}se construye:

θ^=Fnorte(incógnita1,,incógnitanorte).{\displaystyle {\hat {\theta }}=f_{n}(x_{1},\ldots ,x_{n}).}

El valor deθ^{\displaystyle {\hat {\theta }}}Depende de la muestra, por lo que este valor cambiará de una muestra aleatoria a otra.

Por definición, el sesgo deθ^{\displaystyle {\hat {\theta }}}es el siguiente:

inclinación(θ^)=mi[θ^]θ.{\displaystyle {\text{bias}}({\hat {\theta }})=E[{\hat {\theta }}]-\theta .}

Uno puede desear calcular varios valores deθ^{\displaystyle {\hat {\theta }}}a partir de varias muestras, y promediarlas, para calcular una aproximación empírica demi[θ^]{\displaystyle E[{\hat {\theta }}]}, pero esto es imposible cuando no hay "otras muestras" cuando el conjunto completo de observaciones disponiblesincógnita1,...,incógnitanorte{\displaystyle x_{1},...,x_{n}}se utilizó para calcularθ^{\displaystyle {\hat {\theta }}}En este tipo de situaciones, la técnica de remuestreo jackknife puede resultar útil.

Construimos las réplicas jackknife:

θ^(1)=Fnorte1(incógnita2,incógnita3,incógnitanorte){\displaystyle {\hat {\theta }}_{(1)}=f_{n-1}(x_{2},x_{3}\ldots ,x_{n})}
θ^(2)=Fnorte1(incógnita1,incógnita3,,incógnitanorte){\displaystyle {\hat {\theta }}_{(2)}=f_{n-1}(x_{1},x_{3},\ldots ,x_{n})}
{\displaystyle \vdots }
θ^(norte)=Fnorte1(incógnita1,incógnita2,,incógnitanorte1){\displaystyle {\hat {\theta }}_{(n)}=f_{n-1}(x_{1},x_{2},\ldots ,x_{n-1})}

donde cada réplica es una estimación de "dejar uno fuera" basada en la submuestra jackknife que consta de todos los puntos de datos excepto uno:

θ^(i)=Fnorte1(incógnita1,,incógnitai1,incógnitai+1,,incógnitanorte)i=1,,norte.{\displaystyle {\hat {\theta }}_{(i)}=f_{n-1}(x_{1},\ldots ,x_{i-1},x_{i+1},\ldots ,x_{n})\quad \quad i=1,\dots ,n.}

Luego definimos su promedio:

θ^jadok=1nortei=1norteθ^(i){\displaystyle {\hat {\theta }}_{\mathrm {jack} }={\frac {1}{n}}\sum _{i=1}^{n}{\hat {\theta }}_{(i)}}

La estimación jackknife del sesgo deθ^{\displaystyle {\hat {\theta }}}está dado por:

inclinación^(θ^)jadok=(norte1)(θ^jadokθ^){\displaystyle {\widehat {\text{bias}}}({\hat {\theta }})_{\mathrm {jack} }=(n-1)({\hat {\theta }}_{\mathrm {jack} }-{\hat {\theta }})}

y la estimación jackknife corregida por sesgo resultante deθ{\displaystyle \theta }está dado por:

θ^Jacobo=θ^inclinación^(θ^)jadok=norteθ^(norte1)θ^jadok.{\displaystyle {\hat {\theta }}_{\text{jack}}^{*}={\hat {\theta }}-{\widehat {\text{bias}}}({\hat {\theta }})_{\mathrm {jack} }=n{\hat {\theta }}-(n-1){\hat {\theta }}_{\mathrm {jack} }.}

Esto elimina el sesgo en el caso especial de que el sesgo seaO(norte1){\displaystyle O(n^{-1})}y lo reduce aO(norte2){\displaystyle O(n^{-2})}en otros casos. [ 3 ]

Estimación de la varianza de un estimador

La técnica jackknife también se puede utilizar para estimar la varianza de un estimador calculado sobre toda la muestra.

Literatura

  • Berger, YG (2007). "Un estimador de varianza jackknife para muestras estratificadas de una sola etapa con probabilidades desiguales". Biometrika . 94 (4): 953– 964. doi : 10.1093/biomet/asm072 .
  • Berger, YG; Rao, JNK (2006). "Jackknife ajustado para imputación bajo muestreo de probabilidad desigual sin reemplazo" . Journal of the Royal Statistical Society, Serie B. 68 ( 3): 531– 547. doi : 10.1111/j.1467-9868.2006.00555.x .
  • Berger, YG; Skinner, CJ (2005). "Un estimador de varianza jackknife para muestreo de probabilidad desigual". Journal of the Royal Statistical Society, Serie B. 67 ( 1): 79– 89. doi : 10.1111/j.1467-9868.2005.00489.x .
  • Jiang, J.; Lahiri, P.; Wan, SM. (2002). "Una teoría jackknife unificada para la mejor predicción empírica con estimación M" . The Annals of Statistics . 30 (6): 1782– 810. doi : 10.1214/aos/1043351257 .
  • Jones, HL (1974). "Estimación jackknife de funciones de medias de estratos". Biometrika . 61 (2): 343– 348. doi : 10.2307/2334363 . JSTOR 2334363 . 
  • Kish, L.; Frankel, MR (1974). "Inferencia a partir de muestras complejas". Journal of the Royal Statistical Society, Serie B . 36 (1): 1– 37.
  • Krewski, D.; Rao, JNK (1981). "Inferencia a partir de muestras estratificadas: propiedades de los métodos de linealización, jackknife y replicación repetida balanceada" . The Annals of Statistics . 9 (5): 1010– 1019. doi : 10.1214/aos/1176345580 .
  • Quenouille, MH (1956). "Notas sobre el sesgo en la estimación". Biometrika . 43 ( 3– 4): 353– 360. doi : 10.1093/biomet/43.3-4.353 .
  • Rao, JNK; Shao, J. (1992). "Estimación de la varianza Jackknife con datos de encuestas bajo imputación hot deck". Biometrika . 79 (4): 811– 822. doi : 10.1093/biomet/79.4.811 .
  • Rao, JNK; Wu, CFJ; Yue, K. (1992). "Algunos trabajos recientes sobre métodos de remuestreo para encuestas complejas". Metodología de encuestas . 18 (2): 209– 217.
  • Shao, J. y Tu, D. (1995). El método Jackknife y Bootstrap. Springer-Verlag, Inc.
  • Tukey, JW (1958). "Sesgo y confianza en muestras no del todo grandes (resumen)". The Annals of Mathematical Statistics . 29 (2): 614.
  • Wu, CFJ (1986). "Jackknife, Bootstrap y otros métodos de remuestreo en el análisis de regresión" . The Annals of Statistics . 14 (4): 1261– 1295. doi : 10.1214/aos/1176350142 .

Notas

  1. Efron 1982 , pág. 2.
  2. ^ Efron y Tibshirani 1994 , pág. 145.
  3. 1 2 Cameron y Trivedi 2005 , pág. 375.
  4. Efron 1982 , pág. 14.
  5. McIntosh, Avery I. "El método de estimación Jackknife" (PDF) . Universidad de Boston . Avery I. McIntosh. pág. 3. Archivado del original (PDF) el 14 de mayo de 2016. Consultado el 30 de abril de 2016 . 

Referencias

  • Efron, Bradley; Tibshirani, RJ (1994). Introducción al método Bootstrap . Chapman and Hall/CRC. ISBN 9780412042317.
  • Cameron, Adrian; Trivedi, Pravin K. (2005). Microeconometría  : métodos y aplicaciones . Cambridge Nueva York: Cambridge University Press. ISBN 9780521848053.
  • Efron, Bradley ; Stein, Charles (mayo de 1981). "La estimación de la varianza mediante el método Jackknife" . The Annals of Statistics . 9 (3): 586– 596. doi : 10.1214/aos/1176345462 . JSTOR 2240822 . 
  • Efron, Bradley (1982). El método jackknife, el bootstrap y otros métodos de remuestreo . Filadelfia, PA: Society for Industrial and Applied Mathematics. ISBN 9781611970319.
  • Quenouille, Maurice H. (septiembre de 1949). "Problemas en el muestreo plano" . The Annals of Mathematical Statistics . 20 (3): 355– 375. doi : 10.1214/aoms/1177729989 . JSTOR 2236533 . 
  • Quenouille, Maurice H. (1956). "Notas sobre el sesgo en la estimación". Biometrika . 43 ( 3– 4): 353– 360. doi : 10.1093/biomet/43.3-4.353 . JSTOR 2332914 . 
  • Tukey, John W. (1958). "Sesgo y confianza en muestras no del todo grandes (resumen)" . The Annals of Mathematical Statistics . 29 (2): 614. doi : 10.1214/aoms/1177706647 .