Articulo de referencia

La regla de Scott

La regla de Scott es un método para seleccionar el número de intervalos en un histograma . [ 1 ] La regla de Scott se utiliza ampliamente en software de análisis de datos, inclu...

La regla de Scott es un método para seleccionar el número de intervalos en un histograma . [ 1 ] La regla de Scott se utiliza ampliamente en software de análisis de datos, incluyendo R , [ 2 ] Python [ 3 ] y Microsoft Excel, donde es el método predeterminado de selección de intervalos. [ 4 ]

Para un conjunto denorte{\displaystyle n}observacionesincógnitai{\displaystyle x_{i}}dejarF^(incógnita){\displaystyle {\hat {f}}(x)}sea ​​la aproximación del histograma de alguna funciónF(incógnita){\displaystyle f(x)}. El error cuadrático medio integrado (IMSE) es

IMSE=mi[dincógnita(F^(incógnita)F(incógnita))2]{\displaystyle {\text{IMSE}}=E\left[\int _{-\infty }^{\infty }dx({\hat {f}}(x)-f(x))^{2}\right]}

Dóndemi[]{\displaystyle E[\cdot ]}denota la expectativa en muchos sorteos independientes denorte{\displaystyle n}puntos de datos. Por Taylor expandiendo a primer orden enh{\displaystyle h}, el ancho del contenedor, Scott demostró que el ancho óptimo es

h=(6/F(incógnita)2dincógnita)1/3norte1/3{\displaystyle h^{*}=\left(6/\int _{-\infty }^{\infty }f'(x)^{2}dx\right)^{1/3}n^{-1/3}}

Esta fórmula es también la base de la regla de Freedman-Diaconis .

Tomando una referencia normal, es decir, asumiendo queF(incógnita){\displaystyle f(x)}es una distribución normal , la ecuación parah{\displaystyle h^{*}}se convierte

h=(24π)1/3σnorte1/33.5σnorte1/3{\displaystyle h^{*}=\left(24{\sqrt {\pi }}\right)^{1/3}\sigma n^{-1/3}\sim 3.5\sigma n^{-1/3}}

dóndeσ{\displaystyle \sigma }es la desviación estándar de la distribución normal y se estima a partir de los datos. Con este valor de ancho de intervalo, Scott demuestra que [ 5 ]

IMSEnorte2/3{\displaystyle {\text{IMSE}}\propto n^{-2/3}}

mostrando la rapidez con la que la aproximación del histograma se aproxima a la distribución real a medida que aumenta el número de muestras.

Regla Terrell-Scott

Otro enfoque desarrollado por Terrell y Scott [ 6 ] se basa en la observación de que, entre todas las densidadesgramo(incógnita){\displaystyle g(x)}definido en un intervalo compacto , por ejemplo|incógnita|<1/2{\displaystyle |x|<1/2}, con derivadas que son absolutamente continuas , la densidad que minimizadincógnita(gramo(k)(incógnita))2{\displaystyle \int _{\infty }^{\infty }dx(g^{(k)}(x))^{2}}es

Fk(incógnita)={(2k+1)¡22k(k¡)2(14incógnita2)k,|incógnita|1/20|incógnita|>1/2{\displaystyle f_{k}(x)={\begin{cases}{\frac {(2k+1)!}{2^{2k}(k!)^{2}}}(1-4x^{2})^{k},\quad &|x|\leq 1/2\\0&|x|>1/2\end{cases}}}

Usando esto conk=1{\displaystyle k=1}en la expresión parah{\displaystyle h^{*}}proporciona un límite superior en el valor del ancho del contenedor que es

hTS=(4norte)1/3.{\displaystyle h_{TS}^{*}=\left({\frac {4}{n}}\right)^{1/3}.}

Así pues, para funciones que satisfacen las condiciones de continuidad, al menos

kTS=bah=(2norte)1/3{\displaystyle k_{TS}={\frac {b-a}{h^{*}}}=\left(2n\right)^{1/3}}

Se deben utilizar contenedores. [ 7 ]

10 000 muestras de una distribución normal agrupadas en intervalos utilizando diferentes reglas. La regla de Scott utiliza 48 intervalos, la regla de Terrell-Scott utiliza 28 y la regla de Sturges, 15.

Esta regla también se llama regla sobresuavizada [ 7 ] o regla de Rice [ 8 ] llamada así porque ambos autores trabajaron en la Universidad de Rice . La regla de Rice se suele informar con el factor de 2 fuera de la raíz cúbica ,2(norte)1/3{\displaystyle 2\left(n\right)^{1/3}}y puede considerarse una regla diferente. La principal diferencia con la regla de Scott es que esta regla no presupone que los datos tengan una distribución normal y el ancho del intervalo solo depende del número de muestras, no de ninguna propiedad de los datos.

En general(2norte)1/3{\displaystyle \left(2n\right)^{1/3}}no es un número entero, por lo tanto(2norte)1/3{\displaystyle \lceil \left(2n\right)^{1/3}\rceil }se utiliza donde{\displaystyle \lceil \cdot \rceil }denota la función techo .

Referencias

  1. Scott, David W. (1979). "Sobre histogramas óptimos y basados ​​en datos". Biometrika . 66 (3): 605– 610. doi : 10.1093/biomet/66.3.605 .
  2. "Función Hist - RDocumentation" .
  3. "Numpy.histogram_bin_edges — Manual de NumPy v2.1" .
  4. "Excel: Crear un histograma" .
  5. Scott DW. La regla de Scott. Wiley Interdisciplinary Reviews: Computational Statistics. Julio de 2010; 2(4):497–502.
  6. Terrell GR, Scott DW. Estimaciones de densidad no paramétricas sobresuavizadas. Journal of the American Statistical Association. 1 de marzo de 1985;80(389):209-14.
  7. 1 2 Scott, DW (2009). "Regla de Sturges". WIREs Computational Statistics . 1 (3): 303– 306. doi : 10.1002/wics.35 . S2CID 197483064 . 
  8. Educación estadística en línea: Un curso de estudio multimedia ( http://onlinestatbook.com/ ). Director del proyecto: David M. Lane, Universidad Rice (capítulo 2 "Representación gráfica de distribuciones", sección "Histogramas")