El bootstrapping es un procedimiento para estimar la distribución de un estimador mediante el remuestreo (a menudo con reemplazo ) de los datos o de un modelo estimado a partir de ellos. [ 1 ] El bootstrapping asigna medidas de precisión ( sesgo , varianza, intervalos de confianza , error de predicción, etc.) a las estimaciones de la muestra. [ 2 ] [ 3 ] Esta técnica permite estimar la distribución muestral de casi cualquier estadístico utilizando métodos de muestreo aleatorio. [ 1 ]
El método bootstrap estima las propiedades de un valor estimado (como su varianza ) midiendo dichas propiedades al muestrear a partir de una distribución aproximada. Una opción estándar para esta distribución aproximada es la función de distribución empírica de los datos observados. En el caso de que se pueda asumir que un conjunto de observaciones proviene de una población independiente e idénticamente distribuida , esto se puede implementar construyendo varias remuestras con reemplazo del conjunto de datos observados (y de igual tamaño que este). Un resultado clave en el artículo fundamental de Efron que introdujo el bootstrap [ 4 ] es el rendimiento favorable de los métodos bootstrap que utilizan muestreo con reemplazo en comparación con métodos anteriores como el jackknife , que muestrean sin reemplazo. Sin embargo, desde su introducción, se han propuesto numerosas variantes del bootstrap, incluyendo métodos que muestrean sin reemplazo o que crean muestras bootstrap mayores o menores que los datos originales.
El bootstrap también puede utilizarse para construir pruebas de hipótesis . [ 5 ] A menudo se utiliza como alternativa a la inferencia estadística basada en el supuesto de un modelo paramétrico cuando ese supuesto está en duda, o cuando la inferencia paramétrica es imposible o requiere fórmulas complicadas para el cálculo de errores estándar .
Historia
El bootstrap [ a ] fue descrito por primera vez por Bradley Efron en "Métodos Bootstrap: otra mirada al jackknife" (1979), [ 4 ] inspirado en trabajos anteriores sobre el jackknife . [ 6 ] [ 7 ] [ 8 ] Posteriormente se desarrollaron estimaciones mejoradas de la varianza. [ 9 ] [ 10 ] En 1981 se desarrolló una extensión bayesiana. [ 11 ] El sesgo corregido y acelerado (El método bootstrap fue desarrollado por Efron en 1987, [ 12 ] y el intervalo de confianza bootstrap aproximado (ABC, o aproximado)) procedimiento en 1992. [ 13 ]
Acercarse

La idea básica del bootstrapping es que la inferencia sobre una población a partir de datos de muestra (muestra → población) se puede modelar remuestreando los datos de muestra y realizando inferencia sobre una muestra a partir de los datos remuestreados (remuestreado → muestra). [ 14 ] Como la población es desconocida, el error real en un estadístico de muestra con respecto a su valor poblacional es desconocido. En los remuestreos bootstrap, la "población" es en realidad la muestra, y esto es conocido; por lo tanto, la calidad de la inferencia de la muestra "verdadera" a partir de los datos remuestreados (remuestreado → muestra) es medible.
Formalmente, el método bootstrap funciona tratando la inferencia de la verdadera distribución de probabilidad J , dados los datos originales, como análoga a la inferencia de la distribución empírica Ĵ , dados los datos remuestreados. La precisión de las inferencias sobre Ĵ utilizando los datos remuestreados se puede evaluar porque conocemos Ĵ . Si Ĵ es una aproximación razonable a J , entonces la calidad de la inferencia sobre J puede inferirse a su vez.
Por ejemplo, supongamos que nos interesa la altura promedio (o media ) de las personas en todo el mundo. No podemos medir a todas las personas de la población mundial, así que tomamos una muestra de una pequeña parte y la medimos. Supongamos que la muestra es de tamaño N ; es decir, medimos las alturas de N individuos. A partir de esa única muestra, solo se puede obtener una estimación de la media. Para razonar sobre la población, necesitamos tener una idea de la variabilidad de la media que hemos calculado. El método bootstrap más simple consiste en tomar el conjunto de datos original de alturas y, usando una computadora, muestrear a partir de él para formar una nueva muestra (llamada "remuestreo" o muestra bootstrap) que también es de tamaño N. La muestra bootstrap se toma del original usando muestreo con reemplazo (por ejemplo, podríamos "remuestrear" 5 veces de [1,2,3,4,5] y obtener [2,5,4,4,1]), por lo que, suponiendo que N sea suficientemente grande, a efectos prácticos existe una probabilidad prácticamente nula de que sea idéntica a la muestra "real" original. Este proceso se repite un gran número de veces (normalmente 1000 o 10 000 veces), y para cada una de estas muestras bootstrap, calculamos su media (cada una de ellas se denomina "estimación bootstrap"). Ahora podemos crear un histograma de las medias bootstrap. Este histograma proporciona una estimación de la forma de la distribución de la media muestral, a partir de la cual podemos responder preguntas sobre cuánto varía la media entre las muestras. (El método aquí descrito para la media puede aplicarse a casi cualquier otro estadístico o estimador ).
Discusión
Ventajas
Una gran ventaja del bootstrap es su simplicidad. Es una forma directa de obtener estimaciones de errores estándar e intervalos de confianza para estimadores complejos de la distribución, como percentiles, proporciones, razón de probabilidades y coeficientes de correlación. Sin embargo, a pesar de su simplicidad, el bootstrap se puede aplicar a diseños de muestreo complejos (por ejemplo, para una población dividida en s estratos con n observaciones por estrato, un ejemplo de lo cual es un experimento de dosis-respuesta, donde el bootstrap se puede aplicar para cada estrato). [ 15 ] El bootstrap también es una forma apropiada de controlar y verificar la estabilidad de los resultados. Aunque para la mayoría de los problemas es imposible conocer el verdadero intervalo de confianza, el bootstrap es asintóticamente más preciso que los intervalos estándar obtenidos utilizando la varianza muestral y supuestos de normalidad. [ 16 ] El bootstrap también es un método conveniente que evita el costo de repetir el experimento para obtener otros grupos de datos de muestra.
Desventajas
El método bootstrap depende en gran medida del estimador utilizado y, aunque simple, su uso ingenuo no siempre produce resultados asintóticamente válidos y puede generar inconsistencias. [ 17 ] Si bien el bootstrap es (bajo ciertas condiciones) asintóticamente consistente , no ofrece garantías generales para muestras finitas. El resultado puede depender de la muestra representativa. La aparente simplicidad puede ocultar el hecho de que se hacen suposiciones importantes al realizar el análisis bootstrap (por ejemplo, independencia de las muestras o un tamaño de muestra suficientemente grande), las cuales se enunciarían de manera más formal en otros enfoques. Además, el bootstrap puede ser laborioso y no existen muchos programas informáticos disponibles para su aplicación, ya que es difícil automatizarlo utilizando paquetes estadísticos tradicionales. [ 15 ]
Recomendaciones
Los investigadores han recomendado un mayor número de muestras bootstrap a medida que ha aumentado la capacidad de cálculo disponible. Si los resultados pueden tener consecuencias importantes en el mundo real, entonces se debe utilizar la mayor cantidad de muestras posible, considerando la capacidad de cálculo y el tiempo disponibles. Aumentar el número de muestras no incrementa la cantidad de información en los datos originales; solo reduce los efectos de los errores de muestreo aleatorio que pueden surgir del propio procedimiento bootstrap. Además, hay evidencia de que un número de muestras superior a 100 produce mejoras insignificantes en la estimación de los errores estándar. [ 18 ] De hecho, según el desarrollador original del método bootstrap, incluso establecer el número de muestras en 50 probablemente conduzca a estimaciones de errores estándar bastante buenas. [ 19 ]
Adèr et al. recomiendan el procedimiento bootstrap para las siguientes situaciones: [ 20 ]
- Cuando la distribución teórica de un estadístico de interés es compleja o desconocida, el procedimiento de remuestreo (bootstrapping), al ser independiente de la distribución, proporciona un método indirecto para evaluar las propiedades de la distribución subyacente a la muestra y los parámetros de interés derivados de dicha distribución.
- Cuando el tamaño de la muestra es insuficiente para una inferencia estadística directa. Si la distribución subyacente es bien conocida, el método bootstrap ofrece una forma de tener en cuenta las distorsiones causadas por la muestra específica, que puede no ser totalmente representativa de la población.
- Cuando se deben realizar cálculos de potencia y se dispone de una pequeña muestra piloto, la mayoría de los cálculos de potencia y tamaño de muestra dependen en gran medida de la desviación estándar del estadístico de interés. Si la estimación utilizada es incorrecta, el tamaño de muestra requerido también lo será. Un método para obtener una idea de la variación del estadístico consiste en utilizar una pequeña muestra piloto y aplicar el método de remuestreo bootstrap para estimar la varianza.
Sin embargo, Athreya ha demostrado [ 21 ] que si se realiza un bootstrap ingenuo sobre la media muestral cuando la población subyacente carece de varianza finita (por ejemplo, una distribución de ley de potencias ), la distribución bootstrap no convergerá al mismo límite que la media muestral. En consecuencia, los intervalos de confianza basados en una simulación de Monte Carlo del bootstrap podrían ser engañosos. Athreya afirma que «a menos que se tenga la certeza razonable de que la distribución subyacente no tiene colas pesadas , se debe dudar en utilizar el bootstrap ingenuo».
Tipos de esquema bootstrap
En problemas univariados, suele ser aceptable remuestrear las observaciones individuales con reemplazo (remuestreo de casos, como se describe más adelante), a diferencia del submuestreo , en el que el remuestreo se realiza sin reemplazo y es válido bajo condiciones mucho más débiles que el bootstrap. En muestras pequeñas, podría ser preferible un enfoque bootstrap paramétrico. Para otros problemas, probablemente se prefiera un bootstrap suavizado .
Para problemas de regresión, existen varias otras alternativas disponibles. [ 2 ]
Remuestreo de casos
El método bootstrap es generalmente útil para estimar la distribución de una estadística (por ejemplo, media, varianza) sin utilizar supuestos de normalidad (como se requiere, por ejemplo, para una estadística z o una estadística t). En particular, el bootstrap es útil cuando no existe una forma analítica o una teoría asintótica (por ejemplo, un teorema del límite central aplicable ) que ayude a estimar la distribución de la estadística de interés. Esto se debe a que los métodos bootstrap pueden aplicarse a la mayoría de las cantidades aleatorias, por ejemplo, la razón entre la varianza y la media. Existen al menos dos formas de realizar el remuestreo de casos.
- El algoritmo de Monte Carlo para el remuestreo de casos es bastante simple. Primero, remuestreamos los datos con reemplazo, y el tamaño de la remuestra debe ser igual al tamaño del conjunto de datos original. Luego, se calcula el estadístico de interés a partir de la remuestra del primer paso. Repetimos este procedimiento muchas veces para obtener una estimación más precisa de la distribución Bootstrap del estadístico. [ 2 ]
- La versión "exacta" para el remuestreo de casos es similar, pero enumeramos exhaustivamente cada posible remuestreo del conjunto de datos. Esto puede ser computacionalmente costoso ya que hay un total dediferentes remuestreos, donde n es el tamaño del conjunto de datos. Así, para n = 5 , 10 , 20, 30 hay 126, 92378, 6,89 × 10¹⁰ y 5,91 × 10¹⁶ remuestreos diferentes respectivamente. [ 22 ]
Estimación de la distribución de la media muestral
Consideremos un experimento de lanzamiento de moneda. Lanzamos la moneda y registramos si cae cara o cruz. Sea X = x 1 , x 2 , …, x 10 10 observaciones del experimento. x i = 1 si el lanzamiento cae cara, y 0 en caso contrario. Invocando el supuesto de que el promedio de los lanzamientos de moneda se distribuye normalmente, podemos usar el estadístico t para estimar la distribución de la media muestral,
Esta suposición de normalidad puede justificarse como una aproximación de la distribución de cada lanzamiento individual de moneda o como una aproximación de la distribución del promedio de un gran número de lanzamientos. La primera es una aproximación deficiente porque la distribución real de los lanzamientos es de Bernoulli en lugar de normal. La segunda es una aproximación válida en muestras infinitamente grandes debido al teorema del límite central .
Sin embargo, si no estamos preparados para hacer tal justificación, entonces podemos usar el bootstrap en su lugar. Usando el remuestreo de casos, podemos derivar la distribución dePrimero remuestreamos los datos para obtener una muestra bootstrap . Un ejemplo de la primera muestra podría ser X 1 * = x 2 , x 1 , x 10 , x 10 , x 3 , x 4 , x 6 , x 7 , x 1 , x 9 . Hay algunos duplicados ya que una muestra bootstrap proviene de un muestreo con reemplazo de los datos. Además, el número de puntos de datos en una muestra bootstrap es igual al número de puntos de datos en nuestras observaciones originales. Luego calculamos la media de esta muestra y obtenemos la primera media bootstrap : μ 1 *. Repetimos este proceso para obtener la segunda muestra X 2 * y calculamos la segunda media bootstrap μ 2 *. Si repetimos esto 100 veces, entonces tenemos μ 1 *, μ 2 *, ..., μ 100 *. Esto representa una distribución bootstrap empírica de la media muestral. A partir de esta distribución empírica, se puede derivar un intervalo de confianza bootstrap para la comprobación de hipótesis.
Regresión
En problemas de regresión, el remuestreo de casos se refiere al esquema simple de remuestrear casos individuales, generalmente filas de un conjunto de datos . Para problemas de regresión, siempre que el conjunto de datos sea bastante grande, este esquema simple suele ser aceptable. Sin embargo, el método es susceptible de críticas . [ 15 ]
En los problemas de regresión, las variables explicativas suelen ser fijas, o al menos se observan con mayor control que la variable de respuesta. Además, el rango de las variables explicativas define la información que se puede obtener de ellas. Por lo tanto, remuestrear casos implica que cada muestra de bootstrap perderá información. En consecuencia, conviene considerar procedimientos de bootstrap alternativos.
Bootstrap bayesiano
El bootstrapping puede interpretarse en un marco bayesiano utilizando un esquema que crea nuevos conjuntos de datos mediante la reponderación de los datos iniciales. Dado un conjunto depuntos de datos, la ponderación asignada a los puntos de datosen un nuevo conjunto de datoses, dóndees una lista ordenada de menor a mayornúmeros aleatorios distribuidos uniformemente en, precedido por 0 y seguido por 1. Las distribuciones de un parámetro inferidas a partir de la consideración de muchos conjuntos de datos de este tipo.son entonces interpretables como distribuciones posteriores sobre ese parámetro. [ 23 ]
arranque suave
Bajo este esquema, se agrega una pequeña cantidad de ruido aleatorio centrado en cero (generalmente con distribución normal) a cada observación remuestreada. Esto es equivalente a muestrear a partir de una estimación de densidad de núcleo de los datos. Supongamos que K es una función de densidad de núcleo simétrica con varianza unitaria. El estimador de núcleo estándardees
dóndees el parámetro de suavizado. Y el estimador de la función de distribución correspondientees
Bootstrap paramétrico
Partiendo de la premisa de que el conjunto de datos original es una realización de una muestra aleatoria de una distribución de un tipo paramétrico específico, en este caso se ajusta un modelo paramétrico mediante el parámetro θ, a menudo por máxima verosimilitud , y se extraen muestras de números aleatorios de este modelo ajustado. Normalmente, la muestra extraída tiene el mismo tamaño que los datos originales. Entonces, la estimación de la función original F se puede escribir comoEste proceso de muestreo se repite muchas veces, al igual que en otros métodos bootstrap. Considerando la media de la muestra centrada en este caso, la función de distribución original de la muestra aleatoriase reemplaza por una muestra aleatoria bootstrap con funcióny la distribución de probabilidad dese aproxima mediante el de, dónde, que es la expectativa correspondiente a. [ 25 ] El uso de un modelo paramétrico en la etapa de muestreo de la metodología bootstrap conduce a procedimientos que son diferentes de los obtenidos al aplicar la teoría estadística básica a la inferencia para el mismo modelo .
Remuestreo de residuos
Otro enfoque para el bootstrapping en problemas de regresión es el remuestreo de residuos . El método procede de la siguiente manera.
- Ajusta el modelo y conserva los valores ajustados.y los residuos.
- Para cada par, ( x i , y i ), en el que x i es la variable explicativa (posiblemente multivariada), agregue un residuo remuestreado aleatoriamente,, al valor ajustadoEn otras palabras, crear variables de respuesta sintéticas.donde j se selecciona aleatoriamente de la lista (1, ..., n ) para cada i .
- Vuelva a ajustar el modelo utilizando las variables de respuesta ficticias.y conservar las cantidades de interés (a menudo los parámetros,, estimado a partir del sintético).
- Repita los pasos 2 y 3 un gran número de veces.
Este método tiene la ventaja de conservar la información de las variables explicativas. Sin embargo, surge la pregunta de qué residuos remuestrear. Una opción son los residuos brutos; otra son los residuos estudentizados (en regresión lineal). Si bien existen argumentos a favor del uso de residuos estudentizados, en la práctica, la diferencia suele ser mínima y resulta sencillo comparar los resultados de ambos métodos.
Bootstrap de regresión de procesos gaussianos
Cuando los datos están correlacionados temporalmente, el remuestreo directo destruye las correlaciones inherentes. Este método utiliza la regresión de procesos gaussianos (GPR) para ajustar un modelo probabilístico a partir del cual se pueden extraer réplicas. La GPR es un método de regresión no lineal bayesiano. Un proceso gaussiano (GP) es una colección de variables aleatorias, cualquier número finito de las cuales tiene una distribución gaussiana (normal) conjunta. Un GP se define mediante una función de media y una función de covarianza, que especifican los vectores de media y las matrices de covarianza para cada colección finita de variables aleatorias. [ 26 ]
Modelo de regresión:
- es un término de ruido.
Prior de proceso gaussiano:
Para cualquier conjunto finito de variables, x 1 , ..., x n , la función produce: se distribuyen conjuntamente según una gaussiana multivariada con mediay matriz de covarianza
AsumirEntonces,
dónde, yes la función delta de Kronecker estándar. [ 26 ]
Proceso gaussiano posterior:
Según el médico de cabecera anterior, podemos obtener
- ,
dóndey
Sea x 1 * ,...,x s * otra colección finita de variables, es obvio que
- ,
dónde,,
Según las ecuaciones anteriores, las salidas y también se distribuyen conjuntamente según una distribución gaussiana multivariada. Por lo tanto,
dónde,,, yesmatriz identidad. [ 26 ]
Botas salvajes
El bootstrap salvaje, propuesto originalmente por Wu (1986), [ 27 ] es adecuado cuando el modelo presenta heterocedasticidad . La idea es, al igual que el bootstrap residual, dejar los regresores en su valor muestral, pero remuestrear la variable de respuesta en función de los valores residuales. Es decir, para cada réplica, se calcula un nuevoResidencia en
por lo que los residuos se multiplican aleatoriamente por una variable aleatoria.con media 0 y varianza 1. Para la mayoría de las distribuciones de(pero no el de Mammen), este método supone que la distribución residual "verdadera" es simétrica y puede ofrecer ventajas sobre el muestreo residual simple para tamaños de muestra más pequeños. Se utilizan diferentes formas para la variable aleatoria., como
- Una distribución sugerida por Mammen (1993). [ 28 ]
- Aproximadamente, la distribución de Mammen es:
- O la distribución más simple, vinculada a la distribución de Rademacher :
Arranque por bloques
El método bootstrap por bloques se utiliza cuando los datos o los errores de un modelo están correlacionados. En este caso, un remuestreo simple o residual no funcionará, ya que no puede replicar la correlación en los datos. El método bootstrap por bloques intenta replicar la correlación mediante el remuestreo dentro de bloques de datos (véase Bloqueo (estadística) ). Este método se ha utilizado principalmente con datos correlacionados en el tiempo (es decir, series temporales), pero también puede utilizarse con datos correlacionados en el espacio o entre grupos (los llamados datos de clúster).
Series temporales: Bootstrap de bloques simple
En el método bootstrap de bloques (simple), la variable de interés se divide en bloques que no se superponen.
Series temporales: Bootstrap de bloques móviles
En el método bootstrap de bloques móviles, introducido por Künsch (1989), [ 29 ] los datos se dividen en n − b + 1 bloques superpuestos de longitud b : la observación 1 a b será el bloque 1, la observación 2 a b + 1 será el bloque 2, etc. Luego, de estos n − b + 1 bloques, se extraerán n / b bloques al azar con reemplazo. Al alinear estos n / b bloques en el orden en que fueron extraídos, se obtendrán las observaciones bootstrap.
Este método bootstrap funciona con datos dependientes; sin embargo, por definición, las observaciones obtenidas mediante bootstrap ya no serán estacionarias. No obstante, se ha demostrado que variar aleatoriamente la longitud del bloque puede evitar este problema. [ 30 ] Este método se conoce como bootstrap estacionario. Otras modificaciones relacionadas del bootstrap de bloques móviles son el bootstrap markoviano y un método bootstrap estacionario que empareja bloques subsiguientes basándose en la coincidencia de la desviación estándar.
Series temporales: Bootstrap de máxima entropía
Vinod (2006), [ 31 ] presenta un método que realiza el remuestreo de datos de series temporales utilizando principios de máxima entropía que satisfacen el teorema ergódico con restricciones que preservan la media y la masa. Existe un paquete de R, meboot , [ 32 ] que utiliza este método, el cual tiene aplicaciones en econometría e informática.
Datos del clúster: arranque de bloques
Los datos de clúster describen datos donde se observan muchas observaciones por unidad. Esto podría ser observar muchas empresas en muchos estados o estudiantes en muchas clases. En tales casos, la estructura de correlación se simplifica y generalmente se asume que los datos están correlacionados dentro de un grupo/clúster, pero son independientes entre grupos/clústeres. La estructura del bootstrap de bloques se obtiene fácilmente (donde el bloque corresponde al grupo) y, por lo general, solo se remuestrean los grupos, mientras que las observaciones dentro de los grupos permanecen sin cambios. Cameron et al. (2008) analiza esto para errores agrupados en regresión lineal. [ 33 ]
Métodos para mejorar la eficiencia computacional
El método bootstrap es una técnica potente, aunque puede requerir importantes recursos computacionales, tanto en tiempo como en memoria. Se han desarrollado algunas técnicas para reducir esta carga. Estas técnicas suelen combinarse con diversos esquemas bootstrap y diferentes conjuntos de datos estadísticos.
Procesamiento paralelo
La mayoría de los métodos bootstrap son algoritmos fácilmente paralelizable . Es decir, la estadística de interés para cada muestra bootstrap no depende de las demás muestras bootstrap. Por lo tanto, estos cálculos pueden realizarse en CPU o nodos de cómputo independientes, y los resultados de cada nodo se agregan posteriormente para el análisis final.
Bootstrap de Poisson
El bootstrap no paramétrico muestrea elementos de una lista de tamaño n con recuentos extraídos de una distribución multinomial . Sidenota el número de veces que el elemento i se incluye en una muestra bootstrap dada, entonces cadase distribuye como una distribución binomial con n ensayos y media 1, perono es independiente depara.
El bootstrap de Poisson en cambio extrae muestras asumiendo que todosLas variables se distribuyen de forma independiente e idéntica como variables de Poisson con media 1. La razón es que el límite de la distribución binomial es Poisson:
Hanley y MacGibbon propusieron el método bootstrap de Poisson como potencialmente útil para personas sin conocimientos de estadística que utilizan software como SAS y SPSS , los cuales carecían de los paquetes bootstrap de los lenguajes de programación R y S-Plus . [ 34 ] Los mismos autores informan que, para valores de n suficientemente grandes, los resultados son relativamente similares a las estimaciones bootstrap no paramétricas, pero señalan que el método bootstrap de Poisson ha tenido un uso mínimo en aplicaciones.
Otra ventaja propuesta del bootstrap de Poisson es la independencia de lahace que el método sea más fácil de aplicar a grandes conjuntos de datos que deben procesarse como flujos. [ 35 ]
Una forma de mejorar el bootstrap de Poisson, denominado "bootstrap secuencial", consiste en tomar las primeras muestras de manera que la proporción de valores únicos sea ≈0,632 del tamaño de muestra original n. Esto proporciona una distribución con características empíricas principales que se encuentran dentro de una distancia de. [ 36 ] La investigación empírica ha demostrado que este método puede producir buenos resultados. [ 37 ] Esto está relacionado con el método bootstrap reducido. [ 38 ]
Bolsa de pequeños zapatos
Para conjuntos de datos masivos, a menudo resulta computacionalmente prohibitivo mantener todos los datos de muestra en memoria y volver a muestrear a partir de ellos. El Bag of Little Bootstraps (BLB) [ 39 ] proporciona un método para preagregar datos antes del bootstrapping para reducir las restricciones computacionales. Esto funciona particionando el conjunto de datos encubos de igual tamaño y agregación de los datos dentro de cada cubo. Este conjunto de datos preagregados se convierte en los nuevos datos de muestra sobre los cuales se extraen muestras con reemplazo. Este método es similar al Bootstrap de bloques, pero las motivaciones y definiciones de los bloques son muy diferentes. Bajo ciertas suposiciones, la distribución de la muestra debería aproximarse al escenario bootstrap completo. Una restricción es el número de cubos.dóndey los autores recomiendan el uso decomo solución general.
Elección de la estadística
La distribución bootstrap de un estimador puntual de un parámetro poblacional se ha utilizado para producir un intervalo de confianza bootstrap para el valor verdadero del parámetro si el parámetro se puede escribir como una función de la distribución de la población .
Los parámetros poblacionales se estiman con muchos estimadores puntuales . Las familias más populares de estimadores puntuales incluyen los estimadores de varianza mínima insesgados en la media , los estimadores insesgados en la mediana , los estimadores bayesianos (por ejemplo, la moda , la mediana y la media de la distribución posterior ) y los estimadores de máxima verosimilitud .
Un estimador puntual bayesiano y un estimador de máxima verosimilitud tienen un buen desempeño cuando el tamaño de la muestra es infinito, según la teoría asintótica . Para problemas prácticos con muestras finitas, otros estimadores pueden ser preferibles. La teoría asintótica sugiere técnicas que a menudo mejoran el desempeño de los estimadores basados en remuestreo (bootstrapping); el remuestreo de un estimador de máxima verosimilitud a menudo puede mejorarse utilizando transformaciones relacionadas con cantidades pivote . [ 40 ]
Obtención de intervalos de confianza a partir de la distribución bootstrap
La distribución bootstrap de un estimador de parámetros se usa frecuentemente para calcular intervalos de confianza para su parámetro poblacional. [ 2 ] Se han propuesto varios métodos para construir los intervalos de confianza, aunque existe desacuerdo sobre cuál es el mejor.
Propiedades deseables
El estudio de los métodos de intervalos de confianza bootstrap de DiCiccio y Efron, y la consiguiente discusión, enumera varias propiedades deseables de los intervalos de confianza, que generalmente no se cumplen todas simultáneamente.
- Invariante a la transformación : idealmente, los intervalos de confianza obtenidos mediante el método bootstrap con datos transformados (por ejemplo, aplicando el logaritmo) serían los mismos que los obtenidos mediante la transformación de los intervalos de confianza con los datos sin transformar.
- Los intervalos de confianza deben ser válidos o consistentes , es decir, la probabilidad de que un parámetro esté en un intervalo de confianza con un nivel nominaldebería ser igual a o al menos converger en probabilidad a. Este último criterio se refina y amplía utilizando el marco de Hall. [ 41 ] Los refinamientos consisten en distinguir entre métodos en función de la rapidez con que la verdadera probabilidad de cobertura se aproxima al valor nominal, donde un método es (utilizando la terminología de DiCiccio y Efron) de primer orden si el término de error en la aproximación esy de segundo orden si el término de error esAdemás, los métodos se distinguen por la velocidad con la que el punto crítico bootstrap estimado converge al punto verdadero (desconocido), y un método es correcto de segundo orden cuando esta tasa es.
- Gleser, en la discusión del artículo, argumenta que una limitación de las descripciones asintóticas en el punto anterior es que laLos términos no son necesariamente uniformes en los parámetros o en la distribución real.
Sesgo, asimetría e intervalos de confianza
- Sesgo : La distribución bootstrap y la muestra pueden discrepar sistemáticamente, en cuyo caso puede producirse un sesgo .
- Si la distribución bootstrap de un estimador es simétrica, se suelen utilizar intervalos de confianza percentiles; estos intervalos son especialmente apropiados para estimadores insesgados con respecto a la mediana y de riesgo mínimo (en relación con una función de pérdida absoluta ). El sesgo en la distribución bootstrap conlleva un sesgo en el intervalo de confianza.
- De lo contrario, si la distribución bootstrap no es simétrica, los intervalos de confianza percentiles suelen ser inapropiados.
Métodos para intervalos de confianza bootstrap
Existen varios métodos para construir intervalos de confianza a partir de la distribución bootstrap de un parámetro real :
- Bootstrap básico , [ 40 ] también conocido como intervalo percentil inverso . [ 42 ] El bootstrap básico es un esquema simple para construir el intervalo de confianza: simplemente se toman los cuantiles empíricos de la distribución bootstrap del parámetro (véase Davison y Hinkley 1997, ec. 5.6 pág. 194):
- dóndedenota elpercentil de los coeficientes obtenidos mediante remuestreo.
- Bootstrap de percentiles . El bootstrap de percentiles procede de forma similar al bootstrap básico, utilizando percentiles de la distribución bootstrap, pero con una fórmula diferente (nótese la inversión de los cuantiles izquierdo y derecho):
- dóndedenota elpercentil de los coeficientes obtenidos mediante remuestreo.
- Véase Davison y Hinkley (1997, equ. 5.18 p. 203) y Efron y Tibshirani (1993, equ. 13.5 p. 171).
- Este método puede aplicarse a cualquier estadístico. Funciona bien en casos donde la distribución bootstrap es simétrica y centrada en el estadístico observado [ 43 ] y donde el estadístico muestral no tiene sesgo con respecto a la mediana y tiene la máxima concentración (o el mínimo riesgo con respecto a una función de pérdida de valor absoluto). Al trabajar con tamaños de muestra pequeños (es decir, menos de 50), los intervalos de confianza percentiles básicos/inversos y percentiles para (por ejemplo) el estadístico de varianza serán demasiado estrechos. De modo que con una muestra de 20 puntos, el intervalo de confianza del 90% incluirá la varianza verdadera solo el 78% de las veces. [ 44 ] Los intervalos de confianza percentiles básicos/inversos son más fáciles de justificar matemáticamente [ 45 ] [ 42 ] , pero son menos precisos en general que los intervalos de confianza percentiles, y algunos autores desaconsejan su uso. [ 42 ]
- Bootstrap estudentizado . El bootstrap estudentizado, también llamado bootstrap-t , se calcula de forma análoga al intervalo de confianza estándar, pero reemplaza los cuantiles de la aproximación normal o de Student por los cuantiles de la distribución bootstrap de la prueba t de Student (véase Davison y Hinkley 1997, ecuación 5.7, pág. 194 y Efron y Tibshirani 1993, ecuación 12.22, pág. 160):
- dóndedenota elpercentil de la prueba t de Student con remuestreo, yes el error estándar estimado del coeficiente en el modelo original.
- La prueba estudentizada goza de propiedades óptimas ya que el estadístico que se remuestrea es fundamental (es decir, no depende de parámetros de perturbación, ya que la prueba t sigue asintóticamente una distribución N(0,1)), a diferencia del remuestreo percentil.
- Bootstrap con corrección de sesgo : ajusta el sesgo en la distribución bootstrap.
- Bootstrap acelerado : El bootstrap acelerado y con corrección de sesgo (BCa), de Efron (1987), [ 12 ] ajusta tanto el sesgo como la asimetría en la distribución bootstrap. Este enfoque es preciso en una amplia variedad de escenarios, tiene requisitos computacionales razonables y produce intervalos razonablemente estrechos. [ 12 ]
Prueba de hipótesis Bootstrap
Efron y Tibshirani [ 2 ] sugieren el siguiente algoritmo para comparar las medias de dos muestras independientes: Seasea una muestra aleatoria de la distribución F con media muestraly varianza de la muestra. Dejarsea otra muestra aleatoria independiente de la distribución G con mediay varianza
- Calcular el estadístico de prueba
- Cree dos nuevos conjuntos de datos cuyos valores seanydóndees la media de la muestra combinada.
- Extraer una muestra aleatoria () de tamañocon reemplazo dey otra muestra aleatoria () de tamañocon reemplazo de.
- Calcular el estadístico de prueba
- Repita los pasos 3 y 4.veces (por ejemplo) para recolectarvalores del estadístico de prueba.
- Estimar el valor p comodóndecuando la condición es verdadera y 0 en caso contrario.
Ejemplos de aplicaciones
Bootstrap suavizado
En 1878, Simon Newcomb realizó observaciones sobre la velocidad de la luz . [ 46 ] El conjunto de datos contiene dos valores atípicos , que influyen considerablemente en la media muestral . (La media muestral no tiene por qué ser un estimador consistente para ninguna media poblacional , ya que no es necesario que exista una media para una distribución de cola pesada ). Una estadística bien definida y robusta para la tendencia central es la mediana muestral, que es consistente y no está sesgada con respecto a la mediana poblacional.
La distribución bootstrap para los datos de Newcomb aparece a continuación. Podemos reducir la discreción de la distribución bootstrap agregando una pequeña cantidad de ruido aleatorio a cada muestra bootstrap. Una opción convencional es agregar ruido con una desviación estándar depara un tamaño de muestra n ; este ruido a menudo se extrae de una distribución t de Student con n-1 grados de libertad. [ 47 ] Esto da como resultado un estimador aproximadamente insesgado para la varianza de la media muestral. [ 48 ] Esto significa que las muestras tomadas de la distribución bootstrap tendrán una varianza que es, en promedio, igual a la varianza de la población total.
A continuación se muestran los histogramas de la distribución bootstrap y la distribución bootstrap suavizada. La distribución bootstrap de la mediana muestral tiene un número reducido de valores. La distribución bootstrap suavizada tiene un soporte más amplio . Sin embargo, cabe señalar que la conveniencia del procedimiento bootstrap suavizado o estándar depende de cada caso y se ha demostrado que varía según la función de distribución subyacente y la magnitud que se estima. [ 49 ]

En este ejemplo, el intervalo de confianza del 95% (percentil) obtenido mediante bootstrap para la mediana de la población es (26, 28,5), que está cerca del intervalo (25,98, 28,46) para el bootstrap suavizado.
Relación con otros enfoques de inferencia
Relación con otros métodos de remuestreo
El bootstrap se distingue de:
- el procedimiento jackknife , utilizado para estimar los sesgos de las estadísticas de muestra y para estimar las varianzas, y
- validación cruzada , en la que los parámetros (por ejemplo, ponderaciones de regresión, cargas factoriales) que se estiman en una submuestra se aplican a otra submuestra.
El método de agregación bootstrap (bagging) es un metaalgoritmo basado en promediar las predicciones de modelos obtenidas a partir de modelos entrenados con múltiples muestras bootstrap.
Estadísticas U
En situaciones donde se puede diseñar una estadística obvia para medir una característica requerida utilizando solo un número pequeño, r , de elementos de datos, se puede formular una estadística correspondiente basada en la muestra completa. Dada una estadística de r muestras, se puede crear una estadística de n muestras mediante un método similar al bootstrapping (calculando el promedio de la estadística sobre todas las submuestras de tamaño r ). Se sabe que este procedimiento tiene ciertas propiedades favorables y el resultado es una estadística U. La media y la varianza muestrales tienen esta forma, para r = 1 y r = 2.
Teoría asintótica
El método bootstrap posee, bajo ciertas condiciones, propiedades asintóticas deseables . Las propiedades asintóticas más frecuentemente descritas son la convergencia débil/consistencia de las trayectorias muestrales del proceso empírico bootstrap y la validez de los intervalos de confianza derivados del mismo. Esta sección describe la convergencia del método bootstrap empírico.
Convergencia estocástica
Este párrafo resume descripciones más completas de la convergencia estocástica en van der Vaart y Wellner [ 50 ] y Kosorok. [ 51 ] El bootstrap define un proceso estocástico , una colección de variables aleatorias indexadas por algún conjunto, dóndees típicamente la línea real () o una familia de funciones. Los procesos de interés son aquellos con trayectorias de muestra acotadas, es decir, trayectorias de muestra en L-infinito (), el conjunto de todas las funciones uniformemente acotadas desdea. Cuando está equipado con la distancia uniforme,es un espacio métrico y cuando, dos subespacios deson de particular interés,, el espacio de todas las funciones continuas desdeal intervalo unitario [0,1], y, el espacio de todas las funciones cadlag dea [0,1]. Esto se debe a quecontiene las funciones de distribución para todas las variables aleatorias continuas, yContiene las funciones de distribución para todas las variables aleatorias. Las afirmaciones sobre la consistencia del bootstrap son afirmaciones sobre la convergencia de las trayectorias de muestra del proceso bootstrap como elementos aleatorios del espacio métrico.o algún subespacio del mismo, especialmenteo.
Consistencia
Horowitz en una revisión reciente [ 1 ] define la consistencia como: el estimador bootstrapes consistente [para una estadística]] si, para cada,converge en probabilidad a 0 cuando, dóndees la distribución empírica de la muestra original,es la distribución verdadera pero desconocida del estadístico,es la función de distribución asintótica de, yes la variable de indexación en la función de distribución, es decir,Esto a veces se denomina más específicamente consistencia en relación con la distancia de Kolmogorov-Smirnov . [ 52 ]
Horowitz continúa recomendando el uso de un teorema de Mammen [ 53 ] que proporciona condiciones necesarias y suficientes más fáciles de verificar para la consistencia de estadísticas de una forma común determinada. En particular, seasea la muestra aleatoria. Sipara una secuencia de númerosy, entonces la estimación bootstrap de la función de distribución acumulativa estima la función de distribución acumulativa empírica si y solo siconverge en distribución a la distribución normal estándar .
Gran consistencia
La convergencia en probabilidad (externa), tal como se describió anteriormente, también se denomina consistencia débil . Con supuestos ligeramente más estrictos, también se puede demostrar que el bootstrap es fuertemente consistente , donde la convergencia en probabilidad (externa) se reemplaza por convergencia (externa) casi segura. Cuando solo se describe un tipo de consistencia, suele ser consistencia débil. Esto es suficiente para la mayoría de las aplicaciones estadísticas, ya que implica que las bandas de confianza derivadas del bootstrap son asintóticamente válidas. [ 51 ]
Demostrar consistencia utilizando el teorema del límite central.
En casos más sencillos, es posible utilizar directamente el teorema del límite central para demostrar la consistencia del procedimiento bootstrap para estimar la distribución de la media muestral.
En concreto, consideremosvariables aleatorias independientes idénticamente distribuidas conypara cada. Dejar. Además, para cada, condicionado a, dejarsean variables aleatorias independientes con distribución igual a la distribución empírica deEsta es la secuencia de muestras bootstrap.
Entonces se puede demostrar que dónderepresenta la probabilidad condicionada a,,, y.
Para ver esto, tenga en cuenta quesatisface la condición de Lindeberg , por lo que se cumple el CLT. [ 54 ]
El teorema de Glivenko-Cantelli proporciona la base teórica para el método bootstrap.
Poblaciones finitas
Las poblaciones finitas y el muestreo sin reemplazo requieren adaptaciones del bootstrap debido a la violación del supuesto i.i.d. Un ejemplo es el "bootstrap de población" [ 55 ] .
Véase también
Referencias
- 1 2 3 Horowitz JL (2019). "Métodos Bootstrap en econometría" . Annual Review of Economics . 11 : 193–224 . arXiv : 1809.04016 . doi : 10.1146/annurev-economics-080218-025651 .
- 1 2 3 4 5 Efron B , Tibshirani R (1993). Una introducción al método Bootstrap . Boca Raton, FL: Chapman & Hall/CRC. ISBN 0-412-04231-2.Software. Enlace obsoleto archivado el 12/07/2012 en archive.today.
- ↑ Efron B (2003). "Segundas reflexiones sobre el bootstrap" (PDF) . Statistical Science . 18 (2): 135– 140. Bibcode : 2003StaSc..1894968E . doi : 10.1214/ss/1063994968 .
- 1 2 3 Efron, B. (1979). "Métodos Bootstrap: Otra mirada al jackknife" . The Annals of Statistics . 7 (1): 1– 26. doi : 10.1214/aos/1176344552 .
- ↑ Lehmann EL (1992) «Introducción a Neyman y Pearson (1933) Sobre el problema de las pruebas más eficientes de hipótesis estadísticas». En: Avances en estadística, Volumen 1, (Eds. Kotz, S., Johnson, NL), Springer-Verlag. ISBN 0-387-94037-5 (seguido de una reimpresión del artículo).
- ↑ Quenouille MH (1949). "Pruebas aproximadas de correlación en series temporales". Journal of the Royal Statistical Society, Serie B. 11 ( 1): 68– 84. doi : 10.1111/j.2517-6161.1949.tb00023.x .
- ↑ Tukey JW . "Sesgo y confianza en muestras no del todo grandes". Anales de Estadística Matemática . 29 : 614.
- ↑ Jaeckel L (1972) La navaja infinitesimal. Memorándum MM72-1215-11, Laboratorio Bell
- ↑ Bickel PJ , Freedman DA (1981). "Alguna teoría asintótica para el bootstrap" . The Annals of Statistics . 9 (6): 1196– 1217. Bibcode : 1981AnSta...945637B . doi : 10.1214/aos/1176345637 .
- ↑ Singh K (1981). "Sobre la precisión asintótica del bootstrap de Efron" . The Annals of Statistics . 9 (6): 1187– 1195. Bibcode : 1981AnSta...945636S . doi : 10.1214/aos/1176345636 . JSTOR 2240409 .
- ↑ Rubin DB (1981). "El bootstrap bayesiano" . The Annals of Statistics . 9 : 130–134 . doi : 10.1214/aos/1176345338 .
- 1 2 3 Efron, B. (1987). "Mejores intervalos de confianza Bootstrap". Journal of the American Statistical Association . 82 (397). Journal of the American Statistical Association, Vol. 82, No. 397: 171– 185. doi : 10.2307/2289144 . JSTOR 2289144 .
- ↑ DiCiccio T, Efron B (1992). "Intervalos de confianza más precisos en familias exponenciales" . Biometrika . 79 (2): 231– 245. doi : 10.2307/2336835 . ISSN 0006-3444 . JSTOR 2336835. OCLC 5545447518. Consultado el 31 de enero de 2024 .
- ↑ Good, P. (2006) Métodos de remuestreo. 3.ª ed. Birkhauser.
- 1 2 3 "21 Modelos de regresión Bootstrapping" (PDF) . Archivado (PDF) del original el 24/07/2015.
- ↑ DiCiccio TJ, Efron B (1996). "Intervalos de confianza Bootstrap (con discusión)" . Statistical Science . 11 (3): 189– 228. doi : 10.1214/ss/1032280214 .
- ↑ Hinkley D (1994). " [ Bootstrap: ¿Más que un golpe a ciegas? ] : Comentario" . Statistical Science . 9 (3): 400– 403. doi : 10.1214/ss/1177010387 . ISSN 0883-4237 .
- ↑ Goodhue DL, Lewis W, Thompson W (2012). "¿Tiene PLS ventajas para tamaños de muestra pequeños o datos no normales?". MIS Quarterly . 36 (3): 981– 1001. doi : 10.2307/41703490 . JSTOR 41703490 . Apéndice .
- ↑ Efron, B., Rogosa, D., & Tibshirani, R. (2004). Métodos de remuestreo para la estimación. En NJ Smelser, & PB Baltes (Eds.). Enciclopedia internacional de las ciencias sociales y del comportamiento (pp. 13216–13220). Nueva York, NY: Elsevier.
- ^ Adèr, HJ , Mellenbergh GJ y Hand, DJ (2008). Asesoramiento sobre métodos de investigación: el compañero de un consultor . Huizen, Países Bajos: Johannes van Kessel Publishing. ISBN 978-90-79418-01-5.
- ↑ Athreya KB (1987). "Bootstrap de la media en el caso de varianza infinita" . Annals of Statistics . 15 (2): 724– 731. doi : 10.1214/aos/1176350371 .
- ↑ "¿Cuántas muestras bootstrap diferentes hay? Statweb.stanford.edu" . Archivado del original el 14 de septiembre de 2019. Consultado el 9 de diciembre de 2019 .
- ↑ Rubin, DB (1981). "El bootstrap bayesiano". Annals of Statistics , 9, 130.
- 1 2 WANG, SUOJIN (1995). "Optimizing the smoothed bootstrap". Ann. Inst. Statist. Math . 47 : 65– 80. doi : 10.1007/BF00773412 . S2CID 122041565 .
- ^ Dekking, Frederik Michel; Kraaikamp, Cornelis; Lopuhaä, Hendrik Paul; Meester, Ludolf Erwin (2005). Una introducción moderna a la probabilidad y la estadística : comprender por qué y cómo . Londres: Springer. ISBN 978-1-85233-896-1OCLC 262680588
- 1 2 3 Kirk, Paul (2009). "Regresión de procesos gaussianos bootstrapping: explorando los efectos de la incertidumbre en datos de series temporales" . Bioinformática . 25 (10): 1300– 1306. doi : 10.1093/bioinformatics/btp139 . PMC 2677737. PMID 19289448 .
- ↑ Wu, CFJ (1986). "Jackknife, bootstrap y otros métodos de remuestreo en el análisis de regresión (con discusiones)" . Annals of Statistics . 14 : 1261–1350 . doi : 10.1214/aos/ 1176350142 .
- ↑ Mammen, E. (marzo de 1993). "Bootstrap y bootstrap salvaje para modelos lineales de alta dimensión" . Annals of Statistics . 21 (1): 255– 285. doi : 10.1214/aos/1176349025 .
- ↑ Künsch, HR (1989). "El método Jackknife y el Bootstrap para observaciones estacionarias generales" . Annals of Statistics . 17 (3): 1217– 1241. doi : 10.1214/aos/1176347265 .
- ↑ Politis, DN; Romano, JP (1994). "The Stationary Bootstrap". Journal of the American Statistical Association . 89 (428): 1303– 1313. Bibcode : 1994JASA...89.1303P . doi : 10.1080/01621459.1994.10476870 . hdl : 10983/25607 .
- ↑ Vinod, HD (2006). "Máxima entropía en conjuntos para inferencia de series temporales en economía". Journal of Asian Economics . 17 (6): 955– 978. doi : 10.1016/j.asieco.2006.09.001 .
- ↑ Vinod, Hrishikesh; López-de-Lacalle, Javier (2009). "Bootstrap de entropía máxima para series temporales: El paquete meboot de R" . Journal of Statistical Software . 29 (5): 1– 19. doi : 10.18637/jss.v029.i05 .
- ↑ Cameron, AC; Gelbach, JB; Miller, DL (2008). "Mejoras basadas en Bootstrap para la inferencia con errores agrupados" (PDF) . Review of Economics and Statistics . 90 (3): 414– 427. doi : 10.1162/rest.90.3.414 .
- ↑ Hanley JA, MacGibbon B (2006). "Creación de muestras bootstrap no paramétricas utilizando frecuencias de Poisson" . Computer Methods and Programs in Biomedicine . 83 (1): 57– 62. doi : 10.1016/j.cmpb.2006.04.006 . PMID 16730851 .
- ↑ Chamandy N, Muralidharan O, Najmi A, Naidu S (2012). "Estimación de la incertidumbre para flujos de datos masivos" . Recuperado el 14 de agosto de 2024 .
- ↑ Babu, G. Jogesh; Pathak, P. K; Rao, CR (1999). "Corrección de segundo orden del bootstrap de Poisson" . The Annals of Statistics . 27 (5): 1666– 1683. doi : 10.1214/aos/1017939146 .
- ↑ Shoemaker, Owen J.; Pathak, PK (2001). "El bootstrap secuencial: una comparación con el bootstrap regular". Communications in Statistics - Theory and Methods . 30 ( 8– 9): 1661– 1674. doi : 10.1081/STA-100105691 .
- ↑ Jiménez-Gamero, María Dolores; Muñoz-García, Joaquín; Pino-Mejías, Rafael (2004). "Bootstrap reducido para la mediana". Estadística Sínica . 14 (4): 1179–1198 . JSTOR 24307226 .
- ^ Kleiner, A; Talwalkar, A; Sarkar, P; Jordania, MI (2014). "Un arranque escalable para datos masivos". Revista de la Royal Statistical Society, Serie B (Metodología estadística) . 76 (4): 795–816 . arXiv : 1112.5016 . doi : 10.1111/rssb.12050 . ISSN 1369-7412 . S2CID 3064206 .
- 1 2 Davison, AC ; Hinkley, DV (1997). Métodos Bootstrap y su aplicación . Cambridge Series in Statistical and Probabilistic Mathematics. Cambridge University Press. ISBN 0-521-57391-2. software .
- ↑ Hall P (1988). "Comparación teórica de intervalos de confianza bootstrap" . The Annals of Statistics . 16 (3): 927– 953. Bibcode : 1988AnSta..1650933H . doi : 10.1214/aos/1176350933 . JSTOR 2241604 .
- 1 2 3 Hesterberg, Tim C (2014). "Lo que los profesores deberían saber sobre el bootstrap: remuestreo en el plan de estudios de estadística de pregrado". arXiv : 1411.5279 [ stat.OT ].
- ↑ Efron, B. (1982). El método jackknife, el bootstrap y otros planes de remuestreo . Vol. 38. Monografías CBMS-NSF de la Sociedad de Matemáticas Industriales y Aplicadas. ISBN 0-89871-179-7.
- ↑ Scheiner, S. (1998). Diseño y análisis de experimentos ecológicos . CRC Press. ISBN 0412035618.Capítulo 13, página 300
- ↑ Rice, John. Estadística matemática y análisis de datos (2.ª ed.). pág. 272. "Si bien esta ecuación directa de los cuantiles de la distribución de muestreo bootstrap con límites de confianza puede parecer atractiva en un principio, su fundamento es algo oscuro."
- ↑ Datos de ejemplos en Análisis de datos bayesiano
- ↑ Chihara, Laura; Hesterberg, Tim (3 de agosto de 2018). Estadística matemática con remuestreo y R (2.ª ed.). John Wiley & Sons, Inc. doi : 10.1002/9781119505969 . ISBN 9781119416548. S2CID 60138121 .
- ↑ Voinov, Vassily [G.]; Nikulin, Mikhail [S.] (1993). Estimadores insesgados y sus aplicaciones. Vol. 1: Caso univariado. Dordrecht: Kluwer Academic Publishers. ISBN 0-7923-2382-3.
- ↑ Young, GA (julio de 1990). "Alternative Smoothed Bootstraps" . Journal of the Royal Statistical Society, Series B (Methodological) . 52 (3): 477–484 . doi : 10.1111/j.2517-6161.1990.tb01801.x . ISSN 0035-9246 .
- ↑ van der Vaart AW , Wellner JA (1996). Convergencia débil y procesos empíricos con aplicaciones a la estadística . Nueva York: Springer Science+Business Media . ISBN 978-1-4757-2547-6.
- 1 2 Kosorok MR (2008). Introducción a los procesos empíricos y la inferencia semiparamétrica . Nueva York: Springer Science+Business Media . ISBN 978-0-387-74977-8.
- ↑ van der Vaart AW (1998). Asymptotic Statistics . Cambridge Series in Statistical and Probabilistic Mathematics. Nueva York: Cambridge University Press . p. 329. ISBN 978-0-521-78450-4.
- ↑ Mammen E (1992). ¿Cuándo funciona el bootstrap?: Resultados asintóticos y simulaciones . Lecture Notes in Statistics. Vol. 57. Nueva York: Springer-Verlag . ISBN 978-0-387-97867-3.
- ↑ Gregory, Karl (29 de diciembre de 2023). "Algunos resultados basados en el teorema del límite central de Lindeberg" (PDF) . Consultado el 29 de diciembre de 2023 .
- ↑ Mashreghi, Zeinab, David Haziza y Christian Léger. «Un estudio de los métodos bootstrap en el muestreo de poblaciones finitas». (2016): 1-52. https://projecteuclid.org/journals/statistics-surveys/volume-10/issue-none/A-survey-of-bootstrap-methods-in-finite-population-sampling/10.1214/16-SS113.full
Lecturas adicionales
- Diaconis P , Efron B (mayo de 1983). "Métodos computacionales intensivos en estadística" (PDF) . Scientific American . 248 (5): 116–130 . Bibcode : 1983SciAm.248e.116D . doi : 10.1038/scientificamerican0583-116 . Archivado del original (PDF) el 13 de marzo de 2016. Consultado el 19 de enero de 2016 .divulgación científica
- Efron B (1981). "Estimaciones no paramétricas del error estándar: El jackknife, el bootstrap y otros métodos". Biometrika . 68 (3): 589– 599. doi : 10.1093/biomet/68.3.589 . JSTOR 2335441 .
- Hesterberg T, Moore DS, Monaghan S, Clipson A, Epstein R (2005). "Métodos Bootstrap y pruebas de permutación" (PDF) . En David S. Moore , George McCabe (eds.). Introducción a la práctica de la estadística . Software . Archivado del original (PDF) el 15 de febrero de 2006. Consultado el 23 de marzo de 2007 .
- Efron B (1979). "Métodos Bootstrap: Otra mirada al jackknife" . The Annals of Statistics . 7 : 1–26 . doi : 10.1214/aos/1176344552 .
- Efron B (1982). El método Jackknife, el Bootstrap y otros planes de remuestreo . Monografías CBMS-NSF de la Sociedad de Matemáticas Industriales y Aplicadas. Vol. 38. Filadelfia, EE. UU.: Sociedad de Matemáticas Industriales y Aplicadas .
- Efron B , Tibshirani RJ (1993). Una introducción al Bootstrap . Monografías sobre estadística y probabilidad aplicada. Vol. 57. Boca Raton, EE. UU.: Chapman & Hall .
{{cite book}}: CS1 maint: servicio de archivado obsoleto ( enlace )
- Davison AC, Hinley DV (1997). Métodos Bootstrap y su aplicación . Serie de Cambridge en Matemáticas Estadísticas y Probabilísticas. Cambridge: Cambridge University Press . ISBN 9780511802843. software .
- Mooney CZ, Duval RD (1993). Bootstrapping: Un enfoque no paramétrico para la inferencia estadística . Serie de documentos universitarios de Sage sobre aplicaciones cuantitativas en las ciencias sociales. Vol. 07–095 . Newbury Park, EE. UU.: Sage .
- Wright D, London K, Field AP (2011). "Uso de la estimación bootstrap y el principio de conexión para datos de psicología clínica". Journal of Experimental Psychopathology . 2 (2): 252– 270. doi : 10.5127/jep.013611 .
- Gong G (1986). "Validación cruzada, jackknife y bootstrap: Estimación del error excesivo en la regresión logística hacia adelante". Journal of the American Statistical Association . 81 (393): 108– 113. Bibcode : 1986JASA...81..108G . doi : 10.1080/01621459.1986.10478245 .
- estadística computacional
- Remuestreo (estadística)