En estadística , el muestreo estratificado es un método de muestreo de una población que puede dividirse en subpoblaciones .
En los estudios estadísticos , cuando las subpoblaciones dentro de una población general varían, podría ser ventajoso muestrear cada subpoblación ( estrato ) de forma independiente.
La estratificación es el proceso de dividir a los miembros de la población en subgrupos homogéneos antes del muestreo. Los estratos deben definir una partición de la población; es decir, deben ser exhaustivos y mutuamente excluyentes : cada elemento de la población debe asignarse a un único estrato. A continuación, se realiza el muestreo en cada estrato, por ejemplo, mediante muestreo aleatorio simple . El objetivo es mejorar la precisión de la muestra reduciendo el error de muestreo . Esto permite obtener una media ponderada con menor variabilidad que la media aritmética de una muestra aleatoria simple de la población.
En estadística computacional , el muestreo estratificado es un método de reducción de varianza cuando se utilizan métodos de Monte Carlo para estimar estadísticas poblacionales a partir de una población conocida. [ 1 ]
Estrategias
- La asignación proporcional utiliza una fracción de muestreo en cada uno de los estratos que es proporcional a la de la población total. Por ejemplo, si la población consta de n individuos en total, de los cuales m son hombres y f mujeres (y donde m + f = n ), entonces el tamaño relativo de las dos muestras ( x₁ = m / n hombres, x₂ = f / n mujeres) debe reflejar esta proporción .
- Asignación óptima (o asignación desproporcionada ): La fracción de muestreo de cada estrato es proporcional tanto a la proporción (como se indicó anteriormente) como a la desviación estándar de la distribución de la variable. Se toman muestras más grandes en los estratos con mayor variabilidad para generar la menor varianza de muestreo posible . La asignación de Neyman es una estrategia de este tipo.
Un ejemplo práctico del uso del muestreo estratificado sería una encuesta política . Si los encuestados deben reflejar la diversidad de la población, el investigador buscará específicamente incluir participantes de diversos grupos minoritarios, como raza o religión, en función de su proporción con respecto a la población total, como se mencionó anteriormente. Por lo tanto, una encuesta estratificada podría considerarse más representativa de la población que una encuesta de muestreo aleatorio simple o muestreo sistemático . Tanto la media como la varianza pueden corregirse para compensar los costos de muestreo desproporcionados mediante el uso de tamaños de muestra estratificados .
Ejemplo
Supongamos que necesitamos estimar el número promedio de votos para cada candidato en una elección. Supongamos que un país tiene 3 ciudades: la ciudad A tiene 1 millón de trabajadores de fábrica, la ciudad B tiene 2 millones de oficinistas y la ciudad C tiene 3 millones de jubilados. Podemos optar por obtener una muestra aleatoria de tamaño 60 de toda la población, pero existe la posibilidad de que la muestra resultante no esté bien equilibrada entre estas ciudades y, por lo tanto, esté sesgada, lo que provoca un error significativo en la estimación (cuando el resultado de interés tiene una distribución diferente, en términos del parámetro de interés, entre las ciudades). En cambio, si optamos por tomar una muestra aleatoria de 10, 20 y 30 de las ciudades A, B y C respectivamente, podemos producir un error de estimación menor para el mismo tamaño total de muestra. Este método se utiliza generalmente cuando una población no es un grupo homogéneo.
Ventajas
Las razones para utilizar el muestreo estratificado en lugar del muestreo aleatorio simple incluyen [ 2 ]
- Si las mediciones dentro de los estratos tienen una desviación estándar menor (en comparación con la desviación estándar general de la población), la estratificación produce un error de estimación menor.
- Para muchas aplicaciones, las mediciones resultan más manejables y/o económicas cuando la población se agrupa en estratos.
- Cuando se desea obtener estimaciones de los parámetros poblacionales para grupos dentro de la población, el muestreo estratificado verifica que contamos con suficientes muestras de los estratos de interés.
Si la densidad de población varía considerablemente dentro de una región, el muestreo estratificado garantizará que las estimaciones se puedan realizar con la misma precisión en diferentes partes de la región y que las comparaciones entre subregiones se puedan realizar con la misma potencia estadística . Por ejemplo, en Ontario , una encuesta realizada en toda la provincia podría utilizar una mayor proporción de datos en el norte, menos poblado, ya que la disparidad demográfica entre el norte y el sur es tan grande que una proporción de datos basada en la muestra provincial en su conjunto podría resultar en la recopilación de solo unos pocos datos del norte.
Desventajas
Sería una mala aplicación de la técnica hacer que los tamaños de muestra de los subgrupos sean proporcionales a la cantidad de datos disponibles de los subgrupos, en lugar de escalar los tamaños de muestra a los tamaños de los subgrupos (o a sus varianzas, si se sabe que varían significativamente, por ejemplo, usando una prueba F ). Los datos que representan a cada subgrupo se consideran de igual importancia si la variación sospechada entre ellos justifica el muestreo estratificado. Si las varianzas de los subgrupos difieren significativamente y los datos deben estratificarse por varianza, no es posible hacer simultáneamente que el tamaño de muestra de cada subgrupo sea proporcional al tamaño del subgrupo dentro de la población total. Para una forma eficiente de dividir los recursos de muestreo entre grupos que varían en sus medias, varianza y costos, consulte "asignación óptima" . El problema del muestreo estratificado en el caso de priors de clase desconocidos (proporción de subpoblaciones en la población total) puede tener un efecto perjudicial en el rendimiento de cualquier análisis en el conjunto de datos, por ejemplo, la clasificación . [ 3 ] En ese sentido, la proporción de muestreo minimax se puede utilizar para hacer que el conjunto de datos sea robusto con respecto a la incertidumbre en el proceso subyacente de generación de datos. [ 3 ]
La combinación de subestratos para garantizar un número adecuado de muestras puede dar lugar a la paradoja de Simpson , en la que las tendencias que existen en diferentes grupos de datos desaparecen o incluso se invierten cuando se combinan los grupos.
Media y error estándar
La media y la varianza del muestreo aleatorio estratificado vienen dadas por: [ 2 ]
dónde
- número de estratos
- la suma de todos los tamaños de estratos
- tamaño del estrato
- media muestral del estrato
- número de observaciones en el estrato
- desviación estándar de la muestra del estrato
Tenga en cuenta que el término, lo cual es igual a, es una corrección de población finita ydebe expresarse en "unidades de muestra". Si se omite la corrección de población finita, se obtiene:
donde eles el peso poblacional del estrato.
Asignación del tamaño de la muestra
Para la estrategia de asignación proporcional, el tamaño de la muestra en cada estrato se toma en proporción al tamaño del estrato. Supongamos que en una empresa hay el siguiente personal: [ 4 ]
- hombre, jornada completa: 90
- Hombre, a tiempo parcial: 18 años
- mujer, jornada completa: 9
- mujer, a tiempo parcial: 63
- total: 180
y se nos pide que tomemos una muestra de 40 empleados, estratificados según las categorías anteriores.
El primer paso es calcular el porcentaje de cada grupo respecto del total.
- % hombres, tiempo completo = 90 ÷ 180 = 50%
- % hombres, a tiempo parcial = 18 ÷ 180 = 10%
- % mujeres, tiempo completo = 9 ÷ 180 = 5%
- % mujeres, a tiempo parcial = 63 ÷ 180 = 35%
Esto nos dice que de nuestra muestra de 40,
- El 50% (20 personas) deben ser hombres, a tiempo completo.
- El 10% (4 personas) deben ser hombres, a tiempo parcial.
- El 5% (2 personas) deben ser mujeres, a tiempo completo.
- El 35% (14 personas) deberían ser mujeres, a tiempo parcial.
Otra forma sencilla, sin tener que calcular el porcentaje, es multiplicar el tamaño de cada grupo por el tamaño de la muestra y dividirlo por el tamaño total de la población (tamaño de todo el personal):
- hombre, tiempo completo = 90 × (40 ÷ 180) = 20
- hombre, a tiempo parcial = 18 × (40 ÷ 180) = 4
- mujer, tiempo completo = 9 × (40 ÷ 180) = 2
- mujer, a tiempo parcial = 63 × (40 ÷ 180) = 14
Véase también
Referencias
- ↑ Botev, Z.; Ridder, A. (2017). "Reducción de la varianza". Wiley StatsRef: Statistics Reference Online . págs. 1–6 . doi : 10.1002/9781118445112.stat07975 . hdl : 1959.4/unsworks_50616 . ISBN 9781118445112.
- 1 2 "6.1 Cómo usar el muestreo estratificado | STAT 506" . Pennstate: Cursos de estadística en línea . Recuperado el 23 de julio de 2015 .
- 1 2 Shahrokh Esfahani, Mohammad; Dougherty, Edward R. (2014). "Efecto del muestreo separado en la precisión de la clasificación" . Bioinformatics . 30 (2): 242– 250. doi : 10.1093/bioinformatics/btt662 . PMID 24257187 .
- ↑ Hunt, Neville; Tyrrell, Sidney (2001). "Muestreo estratificado" . Página web de la Universidad de Coventry . Consultado el 12 de julio de 2012 .
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace )
Lecturas adicionales
- Särndal, Carl-Erik; et al. (2003). «Muestreo estratificado». Muestreo de encuestas asistido por modelos . Nueva York: Springer. pp. 100–109 . ISBN 0-387-40620-4.
- Muestreo (estadística)
- Técnicas de muestreo
- Reducción de la varianza