Articulo de referencia

Poblaciones de arranque

El método de remuestreo de poblaciones en estadística y matemáticas comienza con una muestra. { incógnita 1 , … , incógnita metro } {\displaystyle \{x_{1},\ldots ,x_{m}\}} obser...

El método de remuestreo de poblaciones en estadística y matemáticas comienza con una muestra.{incógnita1,,incógnitametro}{\displaystyle \{x_{1},\ldots ,x_{m}\}}observado a partir de una variable aleatoria .

Cuando X tiene una ley de distribución dada con un conjunto de parámetros no fijos, denotamos con un vectorθ{\displaystyle {\boldsymbol {\theta }}}Un problema de inferencia paramétrica consiste en calcular valores adecuados —denominados estimaciones— de estos parámetros con precisión a partir de la muestra. Una estimación es adecuada si al sustituirla por el parámetro desconocido no se producen daños importantes en los cálculos posteriores. En la inferencia algorítmica , la idoneidad de una estimación se define en términos de compatibilidad con la muestra observada.

En este marco, los métodos de remuestreo tienen como objetivo generar un conjunto de valores candidatos para reemplazar los parámetros desconocidos que interpretamos como réplicas compatibles de los mismos. Representan una población de especificaciones de un vector aleatorio. Θ{\displaystyle {\boldsymbol {\Theta }}}[ 1 ] compatible con una muestra observada, donde la compatibilidad de sus valores tiene las propiedades de una distribución de probabilidad. Al sustituir parámetros en la expresión de la ley de distribución cuestionada, obtenemos poblaciones enteras de variables aleatoriascompatiblescon la muestra observada.

La lógica de los algoritmos que calculan las réplicas, que denominamos procedimientos bootstrap de población , es identificar un conjunto de estadísticas{s1,,sk}{\displaystyle \{s_{1},\ldots ,s_{k}\}}exhibiendo propiedades específicas, denotando un buen comportamiento , con respecto a los parámetros desconocidos. Las estadísticas se expresan como funciones de los valores observados.{incógnita1,,incógnitametro}{\displaystyle \{x_{1},\ldots ,x_{m}\}}, por definición. Elincógnitai{\displaystyle x_{i}}puede expresarse como una función de los parámetros desconocidos y una especificación de semilla aleatoria.zi{\displaystyle z_{i}}a través del mecanismo de muestreo(gramoθ,Z){\displaystyle (g_{\boldsymbol {\theta }},Z)}, a su vez. Luego, al sustituir la segunda expresión en la anterior, obtenemossj{\displaystyle s_{j}}expresiones en función de semillas y parámetros —las ecuaciones maestras— que invertimos para hallar los valores de estos últimos en función de: i) las estadísticas, cuyos valores, a su vez, están fijados a los observados; y ii) las semillas, que son aleatorias según su propia distribución. Por lo tanto, a partir de un conjunto de muestras de semillas, obtenemos un conjunto de réplicas de parámetros.

Método

Dado unincógnita={incógnita1,,incógnitametro}{\displaystyle {\boldsymbol {x}}=\{x_{1},\ldots ,x_{m}\}}de una variable aleatoria X y un mecanismo de muestreo(gramoθ,Z){\displaystyle (g_{\boldsymbol {\theta }},Z)}Para X , la realización x viene dada porincógnita={gramoθ(z1),,gramoθ(zmetro)}{\displaystyle {\boldsymbol {x}}=\{g_{\boldsymbol {\theta }}(z_{1}),\ldots ,g_{\boldsymbol {\theta }}(z_{m})\}}, con θ=(θ1,,θk){\displaystyle {\boldsymbol {\theta }}=(\theta _{1},\ldots ,\theta _{k})}Centrándonos en estadísticas bien comportadas ,

Para sus parámetros, las ecuaciones maestras leen

Para cada semilla de muestra{z1,,zmetro}{\displaystyle \{z_{1},\ldots,z_{m}\}}un vector de parámetrosθ{\displaystyle {\boldsymbol {\theta }}}se obtiene de la solución del sistema anterior consi{\displaystyle s_{i}}fijo a los valores observados. Habiendo calculado un enorme conjunto de vectores compatibles, digamos N , la distribución marginal empírica deΘj{\displaystyle \Theta _{j}}se obtiene mediante:

dóndeθ˘j,i{\displaystyle {\breve {\theta }}_{j,i}}es el j-ésimo componente de la solución genérica de (1) y dondeI(,θ](θ˘j,i){\displaystyle I_{(-\infty ,\theta ]}({\breve {\theta }}_{j,i})}es la función indicadora de θ˘j,i{\displaystyle {\breve {\theta }}_{j,i}}en el intervalo(,θ].{\displaystyle (-\infty ,\theta ].} Algunas indeterminaciones persisten si X es discreto, y esto lo consideraremos en breve. Todo el procedimiento se puede resumir en la forma del siguiente algoritmo, donde el índiceΘ{\displaystyle {\boldsymbol {\Theta }}}desΘ{\displaystyle {\boldsymbol {s}}_{\boldsymbol {\Theta }}}denota el vector de parámetros a partir del cual se deriva el vector de estadísticas.

Algoritmo

Función de distribución acumulativa del parámetro Λ de una variable aleatoria exponencial cuando el estadísticosΛ=6.36{\displaystyle s_{\Lambda }=6.36}
Función de distribución acumulativa del parámetro A de una variable aleatoria continua uniforme cuando el estadísticosA=9.91{\displaystyle s_{A}=9.91}

Puede ver fácilmente en una tabla de estadísticas suficientes que obtenemos la curva en la imagen de la izquierda calculando la distribución empírica (2) en la población obtenida a través del algoritmo anterior cuando: i) X es una variable aleatoria exponencial, ii)sΛ=j=1metroincógnitaj{\displaystyle s_{\Lambda }=\sum _{j=1}^{m}x_{j}}, y

 iii) Inv(sΛ,i)=j=1metro(registroij)/sΛ{\displaystyle {\text{ iii) Inv}}(s_{\Lambda },{\boldsymbol {u}}_{i})=\sum _{j=1}^{m}(-\log u_{ij})/s_{\Lambda }},

y la curva en la imagen de la derecha cuando: i) X es una variable aleatoria uniforme en[0,a]{\displaystyle [0,a]}, ii)sA=máximoj=1,,metroincógnitaj{\displaystyle s_{A}=\max _{j=1,\ldots ,m}x_{j}}, y

iii) Inv(sA,i)=sA/máximoj=1,,metro{ij}{\displaystyle {\text{iii) Inv}}(s_{A},{\boldsymbol {u}}_{i})=s_{A}/\max _{j=1,\ldots ,m}\{u_{ij}\}}.

Observación

Cabe destacar que la precisión con la que se obtiene una ley de distribución de parámetros para poblaciones compatibles con una muestra no depende del tamaño de la muestra, sino del número de semillas que se extraen. Este número, a su vez, es puramente una cuestión de tiempo de cálculo, pero no requiere ninguna extensión de los datos observados. Con otros métodos de remuestreo que se centran en la generación de réplicas de la muestra (como los propuestos por Efron y Tibshirani , 1993 ) , la precisión de las distribuciones estimadas depende del tamaño de la muestra.

Ejemplo

Paraincógnita{\displaystyle {\boldsymbol {x}}}Se espera que represente una distribución de Pareto , cuya especificación requiere valores para los parámetros.a{\displaystyle a}y k , [ 2 ] tenemos que la función de distribución acumulativa se lee:

Función de distribución acumulativa empírica conjunta de parámetros(A,K){\displaystyle (A,K)}de una variable aleatoria de Pareto cuandometro=30,s1=83,24{\displaystyle m=30,s_{1}=83.24}ys2=8.37{\displaystyle s_{2}=8.37}basado en 5.000 réplicas.
Fincógnita(incógnita)=1(kincógnita)a{\displaystyle F_{X}(x)=1-\left({\frac {k}{x}}\right)^{a}}.

Un mecanismo de muestreo(gramo(a,k),U){\displaystyle (g_{(a,k)},U)}tiene[0,1]{\displaystyle [0,1]}semilla uniforme U y función explicativagramo(a,k){\displaystyle g_{(a,k)}}descrito por:

incógnita=gramo(a,k)=(1)1ak{\displaystyle x=g_{(a,k)}=(1-u)^{-{\frac {1}{a}}}k}

Una estadística relevantesΘ{\displaystyle {\boldsymbol {s}}_{\boldsymbol {\Theta }}}está constituido por el par de estadísticas suficientes conjuntas paraA{\displaystyle A}y K , respectivamente s1=i=1metroregistroincógnitai,s2=min{incógnitai}{\displaystyle s_{1}=\sum _{i=1}^{m}\log x_{i},s_{2}=\min\{x_{i}\}}Las ecuaciones maestras leen

s1=i=1metro1aregistro(1i)+metroregistrok{\displaystyle s_{1}=\sum _{i=1}^{m}-{\frac {1}{a}}\log(1-u_{i})+m\log k}
s2=(1min)1ak{\displaystyle s_{2}=(1-u_{\min })^{-{\frac {1}{a}}}k}

conmin=min{i}{\displaystyle u_{\min }=\min\{u_{i}\}}.

La figura de la derecha muestra la gráfica tridimensional de la función de distribución acumulativa empírica (2) de(A,K){\displaystyle (A,K)}.

Notas

  1. Por defecto, las letras mayúsculas (como U , X ) denotarán variables aleatorias y las letras minúsculas ( u , x ) sus realizaciones correspondientes.
  2. Aquí denotamos con los símbolos a y k los parámetros de Pareto indicados en otros lugares mediante k yincógnitametroinorte{\displaystyle x_{\mathrm {min} }}.

Referencias

  • Efron, B. y Tibshirani, R. (1993). Una introducción al Bootstrap . Freeman, Nueva York: Chapman and Hall.
  • Apolloni, B.; Malchiodi, D.; Gaito, S. (2006). Inferencia algorítmica en aprendizaje automático . Serie internacional sobre inteligencia avanzada. Vol.  5 (2.ª  ed.). Adelaida: Magill. Advanced Knowledge International
  • Apolloni, B.; Bassis, S.; Gaito, S.; Malchiodi, D. (2007). "Apreciación de los tratamientos médicos mediante el aprendizaje de las funciones subyacentes con buena confianza". Current Pharmaceutical Design . 13 (15): 1545– 1570. doi : 10.2174/138161207780765891 . PMID 17504150 .