En metodología de encuestas , el muestreo sistemático unidimensional es un método estadístico que implica la selección de elementos de un marco de muestreo ordenado . La forma más común de muestreo sistemático es el muestreo de igual probabilidad (también conocido como epsem), un método de equiprobabilidad . [ 1 ] Esto se aplica particularmente cuando las unidades muestreadas son individuos, hogares o corporaciones. Cuando se muestrea un área geográfica para un análisis espacial , se puede aplicar el muestreo sistemático bidimensional en un marco de muestreo de área . [ 2 ]
En el muestreo sistemático unidimensional, la progresión a través de la lista se trata de forma circular, con un retorno al principio una vez que la lista termina. El muestreo comienza seleccionando un elemento de la lista al azar y luego se selecciona cada k -ésimo elemento en el marco, donde k es el intervalo de muestreo (a veces conocido como salto ): esto se calcula como: [ 3 ]
donde n es el tamaño de la muestra y N es el tamaño de la población.
Mediante este procedimiento, cada elemento de la población tiene una probabilidad de selección conocida e igual. Esto hace que el muestreo sistemático sea funcionalmente similar al muestreo aleatorio simple (MAS). Sin embargo, no es lo mismo que el MAS, ya que no todas las muestras posibles de un tamaño determinado tienen la misma probabilidad de ser elegidas (por ejemplo, las muestras con al menos dos elementos adyacentes nunca serán seleccionadas mediante muestreo sistemático). No obstante, es mucho más eficiente (si la varianza dentro de una muestra sistemática es mayor que la varianza de la población).
El muestreo sistemático solo debe aplicarse si la población en cuestión es lógicamente homogénea, ya que las unidades de muestreo sistemático se distribuyen uniformemente en la población. El investigador debe asegurarse de que el intervalo de muestreo elegido no oculte ningún patrón. Cualquier patrón pondría en riesgo la aleatoriedad.
Ejemplo: Supongamos que un supermercado quiere estudiar los hábitos de compra de sus clientes; entonces, utilizando un muestreo sistemático, puede elegir a cada décimo o decimoquinto cliente que entre al supermercado y realizar el estudio con esta muestra.
Este es un muestreo aleatorio con un sistema. A partir del marco de muestreo, se elige un punto de partida al azar y las elecciones posteriores se realizan a intervalos regulares. Por ejemplo, supongamos que queremos muestrear 8 casas de una calle de 120 casas. 120/8=15, por lo que se elige cada 15.ª casa después de un punto de partida aleatorio entre 1 y 15. Si el punto de partida aleatorio es 11, entonces las casas seleccionadas son 11, 26, 41, 56, 71, 86, 101 y 116. Cabe mencionar que si cada 15.ª casa fuera una "casa de esquina", este patrón de esquinas podría destruir la aleatoriedad de la muestra.
Si, con mayor frecuencia, la población no es divisible de manera uniforme (supongamos que se desean seleccionar 8 casas de un total de 125, donde 125/8 = 15,625), ¿debería elegir cada 15.ª casa o cada 16.ª casa? Si se elige cada 16.ª casa, 8 * 16 = 128, existe el riesgo de que la última casa seleccionada no exista. Por otro lado, si se elige cada 15.ª casa, 8 * 15 = 120, por lo que las últimas cinco casas nunca serán seleccionadas. En cambio, el punto de partida aleatorio debería seleccionarse como un número no entero entre 0 y 15,625 (inclusive en un solo extremo) para asegurar que cada casa tenga la misma probabilidad de ser seleccionada; el intervalo debería ser ahora no entero (15,625); y cada número no entero seleccionado debería redondearse al entero superior. Si el punto de partida aleatorio es 3,6, entonces las casas seleccionadas son 4, 20, 35, 50, 66, 82, 98 y 113, donde hay 3 intervalos cíclicos de 15 y 4 intervalos de 16.
Para ilustrar el peligro de ocultar un patrón mediante un muestreo sistemático, supongamos que tomamos una muestra de un vecindario planificado donde cada calle tiene diez casas por cuadra. Esto ubica las casas n.° 1, 10, 11, 20, 21, 30... en las esquinas de las cuadras; las cuadras de esquina pueden ser menos valiosas, ya que una mayor parte de su superficie está ocupada por fachadas, etc., que no están disponibles para la construcción. Si luego tomamos una muestra de cada 10 casas, nuestra muestra estará compuesta únicamente por casas de esquina (si comenzamos en la 1 o la 10) o no tendrá ninguna casa de esquina (si comenzamos en cualquier otro punto); en cualquier caso, no será representativa.
El muestreo sistemático también puede utilizarse con probabilidades de selección desiguales. En este caso, en lugar de simplemente contar los elementos de la población y seleccionar cada k -ésima unidad, asignamos a cada elemento un espacio en una recta numérica según su probabilidad de selección. A continuación, generamos un punto de partida aleatorio a partir de una distribución uniforme entre 0 y 1, y avanzamos a lo largo de la recta numérica en pasos de 1.
Ejemplo: Tenemos una población de 5 unidades (A a E). Queremos darle a la unidad A una probabilidad de selección del 20%, a la unidad B una probabilidad del 40%, y así sucesivamente hasta la unidad E (100%). Suponiendo que mantenemos el orden alfabético, asignamos cada unidad al siguiente intervalo:
A: 0 a 0,2 B: 0,2 a 0,6 (= 0,2 + 0,4) C: 0,6 a 1,2 (= 0,6 + 0,6) D: 1,2 a 2,0 (= 1,2 + 0,8) E: 2,0 a 3,0 (= 2,0 + 1,0)
Si nuestro punto de partida aleatorio fuera 0,156, primero seleccionaríamos la unidad cuyo intervalo contenga este número (es decir, A). A continuación, seleccionaríamos el intervalo que contiene 1,156 (elemento C), y luego 2,156 (elemento E). Si, en cambio, nuestro punto de partida aleatorio fuera 0,350, seleccionaríamos entre los puntos 0,350 (B), 1,350 (D) y 2,350 (E).
Véase también
Referencias
- ^ Levy, Paul (2003). Muestreo de poblaciones. Métodos y aplicaciones (3.ª ed.). Wiley. págs. 68–98 . ISBN 978-0471455066.
- ^ Wang, JF (2012). "Una revisión del muestreo espacial" . Spatial Statistics . 2 (2): 1– 14. Bibcode : 2012SpaSt...2....1W . doi : 10.1016/j.spasta.2012.08.001 – vía Elsevier Science Direct.
- ^ Ken Black (2004). Estadística empresarial para la toma de decisiones contemporánea (Cuarta edición). Wiley-India. ISBN 978-81-265-0809-9.
Enlaces externos
- TRSL – Template Range Sampling Library es una biblioteca de software libre y de código abierto en C++ que implementa el muestreo sistemático detrás de una interfaz de iterador (similar a STL).
- Técnicas de muestreo