Articulo de referencia

Índice de dispersión

En teoría de la probabilidad y estadística , el índice de dispersión , [ 1 ] índice de dispersión , coeficiente de dispersión , varianza relativa o razón varianza-media ( VMR ),...

En teoría de la probabilidad y estadística , el índice de dispersión , [ 1 ] índice de dispersión , coeficiente de dispersión , varianza relativa o razón varianza-media ( VMR ), al igual que el coeficiente de variación , es una medida normalizada de la dispersión de una distribución de probabilidad : es una medida utilizada para cuantificar si un conjunto de ocurrencias observadas están agrupadas o dispersas en comparación con un modelo estadístico estándar.

Se define como la razón de la varianzaσ2{\displaystyle \sigma ^{2}}al medioμ{\displaystyle \mu },

D=σ2μ.{\displaystyle D={\sigma ^{2} \over \mu }.}

También se le conoce como factor de Fano , aunque este término a veces se reserva para datos segmentados (la media y la varianza se calculan sobre una subpoblación), donde el índice de dispersión se utiliza en el caso especial de que la ventana sea infinita. La segmentación de datos es frecuente: la VMR se calcula a menudo sobre varios intervalos de tiempo o pequeñas regiones del espacio, que pueden denominarse "ventanas", y el estadístico resultante se llama factor de Fano.

Solo se define cuando la mediaμ{\displaystyle \mu }es distinto de cero y generalmente solo se utiliza para estadísticas positivas, como datos de conteo o tiempo entre eventos, o cuando se supone que la distribución subyacente es la distribución exponencial o la distribución de Poisson .

Terminología

En este contexto, el conjunto de datos observado puede consistir en los tiempos de ocurrencia de eventos predefinidos, como terremotos en una región determinada con una magnitud específica, o en la ubicación geográfica de plantas de una especie determinada. Los detalles de dichas ocurrencias se convierten primero en recuentos del número de eventos o ocurrencias en cada una de un conjunto de regiones de igual tamaño, ya sean temporales o espaciales.

Lo anterior define un índice de dispersión para recuentos . [ 2 ] Se aplica una definición diferente para un índice de dispersión para intervalos , [ 3 ] donde las cantidades tratadas son las longitudes de los intervalos de tiempo entre los eventos. El uso común es que "índice de dispersión" se refiere al índice de dispersión para recuentos.

Interpretación

Algunas distribuciones, en particular la distribución de Poisson , tienen varianza y media iguales, lo que les da un VMR = 1. La distribución geométrica y la distribución binomial negativa tienen VMR > 1, mientras que la distribución binomial tiene VMR < 1, y la variable aleatoria constante tiene VMR = 0. Esto da como resultado la siguiente tabla:

Esto puede considerarse análogo a la clasificación de secciones cónicas por excentricidad ; véase Cumulantes de distribuciones de probabilidad particulares para más detalles.

La relevancia del índice de dispersión radica en que tiene un valor de 1 cuando la distribución de probabilidad del número de ocurrencias en un intervalo es una distribución de Poisson . Por lo tanto, esta medida puede utilizarse para evaluar si los datos observados pueden modelarse mediante un proceso de Poisson . Cuando el coeficiente de dispersión es menor que 1, se dice que un conjunto de datos está "subdispersado": esta condición puede relacionarse con patrones de ocurrencia más regulares que la aleatoriedad asociada a un proceso de Poisson. Por ejemplo, los eventos regulares y periódicos estarán subdispersados. Si el índice de dispersión es mayor que 1, se dice que un conjunto de datos está sobredispersado .

Una estimación basada en muestras del índice de dispersión puede utilizarse para construir una prueba de hipótesis estadística formal para la adecuación del modelo de que una serie de recuentos sigue una distribución de Poisson. [ 4 ] [ 5 ] En términos de los recuentos de intervalos, la sobredispersión corresponde a que haya más intervalos con recuentos bajos y más intervalos con recuentos altos, en comparación con una distribución de Poisson; por el contrario, la subdispersión se caracteriza por que haya más intervalos con recuentos cercanos al recuento medio, en comparación con una distribución de Poisson.

El VMR también es una buena medida del grado de aleatoriedad de un fenómeno determinado. Por ejemplo, esta técnica se utiliza habitualmente en la gestión de divisas.

Ejemplo

Para partículas que se difunden aleatoriamente ( movimiento browniano ), la distribución del número de partículas dentro de un volumen dado es poissoniana, es decir, VMR=1. Por lo tanto, para evaluar si un patrón espacial dado (suponiendo que se tenga una forma de medirlo) se debe puramente a la difusión o si hay alguna interacción entre partículas involucrada  : divida el espacio en parches, cuadrantes o unidades de muestra (UM), cuente el número de individuos en cada parche o UM y calcule el VMR. Los valores de VMR significativamente mayores que 1 indican una distribución agrupada, donde el movimiento aleatorio no es suficiente para suprimir el potencial atractivo entre partículas.

Historia

El primero en hablar sobre el uso de una prueba para detectar desviaciones de una distribución de Poisson o binomial parece haber sido Lexis en 1877. Una de las pruebas que desarrolló fue la razón de Lexis .

Este índice fue utilizado por primera vez en botánica por Clapham en 1936.

Hoel estudió los primeros cuatro momentos de su distribución. [ 6 ] Encontró que la aproximación al estadístico χ 2 es razonable si μ > 5.

Distribuciones asimétricas

Para distribuciones muy asimétricas, puede ser más apropiado utilizar una función de pérdida lineal, en lugar de una cuadrática. El coeficiente de dispersión análogo en este caso es la razón entre la desviación absoluta promedio de la mediana y la mediana de los datos, [ 7 ] o, en símbolos:

doD=1nortej|metroincógnitaj|metro{\displaystyle CD={\frac {1}{n}}{\frac {\sum _{j}{|m-x_{j}|}}{m}}}

donde n es el tamaño de la muestra, m es la mediana de la muestra y la suma se toma sobre toda la muestra. Iowa , Nueva York y Dakota del Sur utilizan este coeficiente de dispersión lineal para estimar los impuestos sobre las cuotas. [ 8 ] [ 9 ] [ 10 ]

Para una prueba de dos muestras en la que los tamaños de muestra son grandes, ambas muestras tienen la misma mediana y difieren en la dispersión alrededor de ella, un intervalo de confianza para el coeficiente de dispersión lineal está acotado inferiormente por

tatbexp(zα(var[registro(tatb)])){\displaystyle {\frac {t_{a}}{t_{b}}}\exp {\left(-{\sqrt {z_{\alpha }\left(\operatorname {var} \left[\log \left({\frac {t_{a}}{t_{b}}}\right)\right]\right)}}\right)}}

donde t j es la desviación absoluta media de la j -ésima muestra y z α es la longitud del intervalo de confianza para una distribución normal de confianza α (por ejemplo, para α = 0,05, z α = 1,96). [ 7 ]

Véase también

Proporciones similares

Notas

  1. Cox y Lewis (1966)
  2. Cox y Lewis (1966), pág. 72
  3. Cox y Lewis (1966), pág. 71
  4. Cox y Lewis (1966), pág. 158
  5. Upton y Cook (2006), bajo índice de dispersión
  6. Hoel, PG (1943). "Sobre los índices de dispersión" . Anales de estadística matemática . 14 (2): 155– 162. doi : 10.1214/aoms/1177731457 . JSTOR 2235818 . 
  7. 1 2 Bonett, DG; Seier, E (2006). "Intervalo de confianza para un coeficiente de dispersión en distribuciones no normales". Biometrical Journal . 48 (1): 144– 148. doi : 10.1002/bimj.200410148 . PMID 16544819 . S2CID 33665632 .  
  8. "Definiciones de cálculo estadístico para tasación masiva" (PDF) . Iowa.gov . Archivado del original (PDF) el 11 de noviembre de 2010. Índice mediano: El índice ubicado a medio camino entre el índice más alto y el más bajo cuando los índices individuales para una clase de bienes inmuebles se clasifican en orden ascendente o descendente. El índice mediano se utiliza con mayor frecuencia para determinar el nivel de tasación para una clase determinada de bienes inmuebles.
  9. "Equidad en la valoración de propiedades en Nueva York: Resultados de la encuesta de valor de mercado de 2010" . Archivado del original el 6 de noviembre de 2012.
  10. "Resumen del proceso de evaluación" (PDF) . state.sd.us . Departamento de Ingresos de Dakota del Sur - División de Impuestos sobre la Propiedad/Impuestos Especiales. Archivado del original (PDF) el 10 de mayo de 2009.

Referencias

  • Cox, DR; Lewis, PAW (1966). El análisis estadístico de series de eventos . Londres: Methuen.
  • Upton, G.; Cook, I. (2006). Oxford Dictionary of Statistics (2.ª  ed.). Oxford University Press. ISBN 978-0-19-954145-4.