Articulo de referencia

Estimador de Horvitz-Thompson

En estadística , el estimador de Horvitz-Thompson , que recibe su nombre de Daniel G. Horvitz y Donovan J. Thompson, [ 1 ] es un método para estimar el total [ 2 ] y la media de...

En estadística , el estimador de Horvitz-Thompson , que recibe su nombre de Daniel G. Horvitz y Donovan J. Thompson, [ 1 ] es un método para estimar el total [ 2 ] y la media de una pseudopoblación en una muestra estratificada mediante la aplicación de ponderación de probabilidad inversa para tener en cuenta la diferencia en la distribución muestral entre los datos recopilados y la población objetivo. El estimador de Horvitz-Thompson se aplica con frecuencia en análisis de encuestas y puede utilizarse para tener en cuenta los datos faltantes , así como muchas fuentes de probabilidades de selección desiguales .

El método

Formalmente, dejemosYi,i=1,2,,norte{\displaystyle Y_{i},i=1,2,\ldots ,n}ser una muestra independiente denorte{\displaystyle n}denortenorte{\displaystyle N\geq n}estratos distintos con una media general μ{\displaystyle \mu }Supongamos además queπi{\displaystyle \pi _{i}}es la probabilidad de inclusión de que un individuo muestreado aleatoriamente en una superpoblación pertenezca a lai{\displaystyle i}estrato n.º. El estimador de Horvitz-Thompson del total viene dado por: [ 3 ] : 51

Y^HT=i=1norteYiπi,{\displaystyle {\hat {Y}}_{\mathrm {HT} }=\sum _{i=1}^{n}{\frac {Y_{i}}{\pi _{i}}},}

y la estimación de la media de Horvitz-Thompson viene dada por:

μ^HT=1norteY^HT=1nortei=1norteYiπi.{\displaystyle {\hat {\mu }}_{\mathrm {HT} }={\frac {1}{N}}{\hat {Y}}_{HT}={\frac {1}{N}}\sum _{i=1}^{n}{\frac {Y_{i}}{\pi _{i}}}.}

En un marco probabilístico bayesianoπi{\displaystyle \pi _{i}}se considera la proporción de individuos en una población objetivo que pertenecen a lai{\displaystyle i}estrato. Por lo tanto,Yi/πi{\displaystyle Y_{i}/\pi _{i}}podría considerarse como una estimación de la muestra completa de personas dentro de lai{\displaystyle i}estrato n.º. El estimador de Horvitz-Thompson también puede expresarse como el límite de una estimación de remuestreo bootstrap ponderado de la media. También puede considerarse un caso especial de enfoques de imputación múltiple . [ 4 ]

Para diseños de estudio post-estratificados , estimación deπ{\displaystyle \pi }yμ{\displaystyle \mu }se realizan en pasos distintos. En tales casos, el cálculo de la varianza deμ^HT{\displaystyle {\hat {\mu }}_{HT}}no es sencillo. Se pueden aplicar técnicas de remuestreo como el bootstrap o el jackknife para obtener estimaciones consistentes de la varianza del estimador de Horvitz-Thompson. [ 5 ] El paquete "survey" para R realiza análisis para datos post-estratificados utilizando el estimador de Horvitz-Thompson. [ 6 ]

Demostración de la estimación insesgada de la media según Horvitz-Thompson.

Para esta demostración será útil representar la muestra como un subconjunto aleatorio.S{1,,norte}{\displaystyle S\subseteq \{1,\ldots ,N\}}de tamañonorte{\displaystyle n}Entonces podemos definir variables aleatorias indicadoras.Ij=1[jS]{\displaystyle I_{j}=\mathbf {1} [j\in S]}representando si para cadaj{\displaystyle j}en{1,,norte}{\displaystyle \{1,\ldots ,N\}}si está presente en la muestra. Nótese que para cualquier observación en la muestra, la esperanza es la definición de la probabilidad de inclusión: πi=mi(Ii)=Pr(iS){\displaystyle \pi _{i}=\operatorname {\mathbb {E} } \left(I_{i}\right)=\Pr(i\in S)}. [ a ]

Tomando la esperanza del estimador, podemos demostrar que es insesgado de la siguiente manera:

mi(μ^HT)=mi(1norteiSYiπi)=mi(1nortej=1norteYjπjIj)=1nortej=1norteYjπjmi(Ij)=1nortej=1norteYjπjπj=1nortej=1norteYj{\displaystyle {\begin{aligned}\operatorname {\mathbb {E} } \left({\hat {\mu }}_{\mathrm {HT} }\right)&=\operatorname {\mathbb {E} } \left({\frac {1}{N}}\sum _{i\in S}{\frac {Y_{i}}{\pi _{i}}}\right)\\[6pt]&=\operatorname {\mathbb {E} } \left({\frac {1}{N}}\sum _{j=1}^{N}{\frac {Y_{j}}{\pi _{j}}}I_{j}\right)\\[6pt]&={\frac {1}{N}}\sum _{j=1}^{N}{\frac {Y_{j}}{\pi _{j}}}\operatorname {\mathbb {E} } \left(I_{j}\right)\\&={\frac {1}{N}}\sum _{j=1}^{N}{\frac {Y_{j}}{\pi _{j}}}\pi _{j}\\[6pt]&={\frac {1}{N}}\sum _{j=1}^{N}Y_{j}\end{aligned}}}

Se sabe que la estrategia de Hansen-Hurwitz (1943) es inferior a la de Horvitz-Thompson (1952), asociada a varios procedimientos de muestreo de probabilidades de inclusión proporcionales al tamaño (IPPS). [ 7 ]

Notas

  1. Técnicamente, el esquema de indexación en la demostración es diferente de la indexación en la descripción del estimador. En la demostración,Yj{\displaystyle Y_{j}}es elj{\displaystyle j}valor en un ordenamiento global denorte{\displaystyle N}estratos. En la descripción,Yi{\displaystyle Y_{i}}es eli{\displaystyle i}valor en la muestra, de entrenorte{\displaystyle n}Para unificar estos dos elementos, podríamos definir explícitamente una función que asocie los índices de muestra con los índices globales.

Referencias

  1. Horvitz, DG; Thompson, DJ (1952) "Una generalización del muestreo sin reemplazo de un universo finito", Journal of the American Statistical Association , 47, 663–685, . JSTOR 2280784 
  2. William G. Cochran (1977), Técnicas de muestreo , 3.ª edición, Wiley. ISBN 0-471-16240-X
  3. Särndal, Carl-Erik; Swensson, Bengt; Wretman, Jan Hȧkan (1992). Muestreo de encuestas asistido por modelos . ISBN 9780387975283.
  4. Roderick JA Little, Donald B. Rubin (2002) Análisis estadístico con datos faltantes , 2.ª ed., Wiley. ISBN 0-471-18386-5
  5. Quatember, A. (2014). "El bootstrap de población finita: de la máxima verosimilitud al enfoque de Horvitz-Thompson" . Revista Austriaca de Estadística . 43 (2): 93– 102. doi : 10.17713/ajs.v43i2.10 .
  6. "CRAN - Encuesta de paquetes" . 19 de julio de 2021.
  7. PRABHU-AJGAONKAR, SG "Comparación de la estrategia Horvitz-Thompson con la estrategia Hansen-Hurwitz." Metodología de encuestas (1987): 221. (pdf)
  • Sitio web del paquete de encuestas para R