El método de remuestreo de poblaciones en estadística y matemáticas comienza con una muestra.observado a partir de una variable aleatoria .
Cuando X tiene una ley de distribución dada con un conjunto de parámetros no fijos, denotamos con un vectorUn problema de inferencia paramétrica consiste en calcular valores adecuados —denominados estimaciones— de estos parámetros con precisión a partir de la muestra. Una estimación es adecuada si al sustituirla por el parámetro desconocido no se producen daños importantes en los cálculos posteriores. En la inferencia algorítmica , la idoneidad de una estimación se define en términos de compatibilidad con la muestra observada.
En este marco, los métodos de remuestreo tienen como objetivo generar un conjunto de valores candidatos para reemplazar los parámetros desconocidos que interpretamos como réplicas compatibles de los mismos. Representan una población de especificaciones de un vector aleatorio. [ 1 ] compatible con una muestra observada, donde la compatibilidad de sus valores tiene las propiedades de una distribución de probabilidad. Al sustituir parámetros en la expresión de la ley de distribución cuestionada, obtenemos poblaciones enteras de variables aleatoriascompatiblescon la muestra observada.
La lógica de los algoritmos que calculan las réplicas, que denominamos procedimientos bootstrap de población , es identificar un conjunto de estadísticasexhibiendo propiedades específicas, denotando un buen comportamiento , con respecto a los parámetros desconocidos. Las estadísticas se expresan como funciones de los valores observados., por definición. Elpuede expresarse como una función de los parámetros desconocidos y una especificación de semilla aleatoria.a través del mecanismo de muestreo, a su vez. Luego, al sustituir la segunda expresión en la anterior, obtenemosexpresiones en función de semillas y parámetros —las ecuaciones maestras— que invertimos para hallar los valores de estos últimos en función de: i) las estadísticas, cuyos valores, a su vez, están fijados a los observados; y ii) las semillas, que son aleatorias según su propia distribución. Por lo tanto, a partir de un conjunto de muestras de semillas, obtenemos un conjunto de réplicas de parámetros.
Método
Dado unde una variable aleatoria X y un mecanismo de muestreoPara X , la realización x viene dada por, con Centrándonos en estadísticas bien comportadas ,
Para sus parámetros, las ecuaciones maestras leen
Para cada semilla de muestraun vector de parámetrosse obtiene de la solución del sistema anterior confijo a los valores observados. Habiendo calculado un enorme conjunto de vectores compatibles, digamos N , la distribución marginal empírica dese obtiene mediante:
dóndees el j-ésimo componente de la solución genérica de (1) y dondees la función indicadora de en el intervalo Algunas indeterminaciones persisten si X es discreto, y esto lo consideraremos en breve. Todo el procedimiento se puede resumir en la forma del siguiente algoritmo, donde el índicededenota el vector de parámetros a partir del cual se deriva el vector de estadísticas.
Algoritmo


Puede ver fácilmente en una tabla de estadísticas suficientes que obtenemos la curva en la imagen de la izquierda calculando la distribución empírica (2) en la población obtenida a través del algoritmo anterior cuando: i) X es una variable aleatoria exponencial, ii), y
- ,
y la curva en la imagen de la derecha cuando: i) X es una variable aleatoria uniforme en, ii), y
- .
Observación
Cabe destacar que la precisión con la que se obtiene una ley de distribución de parámetros para poblaciones compatibles con una muestra no depende del tamaño de la muestra, sino del número de semillas que se extraen. Este número, a su vez, es puramente una cuestión de tiempo de cálculo, pero no requiere ninguna extensión de los datos observados. Con otros métodos de remuestreo que se centran en la generación de réplicas de la muestra (como los propuestos por Efron y Tibshirani , 1993 ) , la precisión de las distribuciones estimadas depende del tamaño de la muestra.
Ejemplo
ParaSe espera que represente una distribución de Pareto , cuya especificación requiere valores para los parámetros.y k , [ 2 ] tenemos que la función de distribución acumulativa se lee:

- .
Un mecanismo de muestreotienesemilla uniforme U y función explicativadescrito por:
Una estadística relevanteestá constituido por el par de estadísticas suficientes conjuntas paray K , respectivamente Las ecuaciones maestras leen
con.
La figura de la derecha muestra la gráfica tridimensional de la función de distribución acumulativa empírica (2) de.
Notas
- ↑ Por defecto, las letras mayúsculas (como U , X ) denotarán variables aleatorias y las letras minúsculas ( u , x ) sus realizaciones correspondientes.
- ↑ Aquí denotamos con los símbolos a y k los parámetros de Pareto indicados en otros lugares mediante k y.
Referencias
- Efron, B. y Tibshirani, R. (1993). Una introducción al Bootstrap . Freeman, Nueva York: Chapman and Hall.
- Apolloni, B.; Malchiodi, D.; Gaito, S. (2006). Inferencia algorítmica en aprendizaje automático . Serie internacional sobre inteligencia avanzada. Vol. 5 (2.ª ed.). Adelaida: Magill.
Advanced Knowledge International
- Apolloni, B.; Bassis, S.; Gaito, S.; Malchiodi, D. (2007). "Apreciación de los tratamientos médicos mediante el aprendizaje de las funciones subyacentes con buena confianza". Current Pharmaceutical Design . 13 (15): 1545– 1570. doi : 10.2174/138161207780765891 . PMID 17504150 .
- estadística computacional
- Inferencia algorítmica
- Remuestreo (estadística)