Articulo de referencia

Cuantil

Se muestra la densidad de probabilidad de una distribución normal , con cuantiles 1 "}},"i":0}}]}"> Q 1 , 2 "}},"i":0}}]}"> Q 2 , y 3 "}},"i":0}}]}"> Q 3 . El área debajo de la ...

Se muestra la densidad de probabilidad de una distribución normal , con cuantiles Q 1 , Q 2 , y Q 3 . El área debajo de la curva roja es la misma en los intervalos (−∞, Q 1 ) , ( Q 1 , Q 2 ) , ( Q 2 , Q 3 ) , y ( Q 3 ,+∞) .

En estadística y probabilidad , los cuantiles son puntos de corte que dividen el rango de una distribución de probabilidad en intervalos continuos con probabilidades iguales, o que dividen las observaciones de una muestra de la misma manera. Los cuantiles comunes tienen nombres específicos, como cuartiles (cuatro grupos), deciles (diez grupos) y percentiles (100 grupos). Los grupos creados se denominan mitades, tercios, cuartos, etc., aunque con mayor frecuencia se utilizan los términos del cuantil para referirse a los grupos creados, en lugar de para los puntos de corte.

Los q - cuantiles son valores que dividen un conjunto finito de valores en q subconjuntos de tamaños (casi) iguales. Hay q − 1 subconjuntos de q -cuantiles, uno para cada entero k que satisface 0 < k < q . En algunos casos, el valor de un cuantil puede no estar determinado de forma única, como puede ocurrir con la mediana (2-cuantil) de una distribución de probabilidad uniforme en un conjunto de tamaño par. Los cuantiles también se pueden aplicar adistribuciones continuas , lo que proporciona una forma de generalizar las estadísticas de rango a variables continuas (véase rango percentil ). Cuandose conoce la función de distribución acumulativa de una variable aleatoria , los q -cuantiles son la aplicación de la función cuantil (la función inversa de la función de distribución acumulativa ) a los valores {1/ q , 2/ q , …, ( q − 1)/ q }.

Cuantiles de una población

Como en el cálculo de, por ejemplo, la desviación estándar , la estimación de un cuantil depende de si se trabaja con una población estadística o con una muestra extraída de ella. Para una población de valores discretos o para una densidad de población continua, el k -ésimo q -cuantil es el valor de los datos donde la función de distribución acumulativa cruza k / q . Es decir, x es un k -ésimo q- cuantil para una variable X si

Pr[ X < x ] ≤ k / q o, equivalentemente, Pr[ Xx ] ≥ 1 − k / q

y

Pr[ Xx ] ≥ k / q

donde Pr es la función de probabilidad . Para una población finita de N valores igualmente probables indexados del 1 al N de menor a mayor, el k - ésimo q -cuantil de esta población se puede calcular de forma equivalente mediante el valor de I p = N k / q . Si I p no es un entero, se redondea al entero siguiente para obtener el índice correspondiente; el valor de datos correspondiente es el k -ésimo q -cuantil. Por otro lado, si I p es un entero, cualquier número desde el valor de datos en ese índice hasta el valor de datos del siguiente índice se puede tomar como el cuantil, y es convencional (aunque arbitrario) tomar el promedio de esos dos valores (véase Estimación de cuantiles a partir de una muestra ).

Si, en lugar de usar los enteros k y q , el " cuantil p " se basa en un número real p con 0 < p < 1, entonces p reemplaza a k / q en las fórmulas anteriores. Esta terminología más amplia se usa cuando se emplean cuantiles para parametrizar distribuciones de probabilidad continuas . Además, algunos programas informáticos (incluido Microsoft Excel ) consideran el mínimo y el máximo como el percentil 0 y el percentil 100, respectivamente. Sin embargo, esta terminología más amplia va más allá de las definiciones estadísticas tradicionales.

Ejemplos

Los dos ejemplos siguientes utilizan la definición de cuantil de rango más cercano con redondeo. Para una explicación de esta definición, consulte percentiles .

Población de tamaño par

Consideremos una población ordenada de 10 valores de datos [3, 6, 7, 8, 8, 10, 13, 15, 16, 20]. ¿Cuáles son los 4 cuartiles de este conjunto de datos?

Así, los cuartiles primero, segundo y tercero del conjunto de datos [3, 6, 7, 8, 8, 10, 13, 15, 16, 20] son ​​[7, 9, 15]. Si se requiere, el cuartil cero es 3 y el cuarto cuartil es 20.

Población de tamaño impar

Consideremos una población ordenada de 11 valores de datos [3, 6, 7, 8, 8, 9, 10, 13, 15, 16, 20]. ¿Cuáles son los 4 cuartiles de este conjunto de datos?

Así, los cuartiles primero, segundo y tercero del conjunto de datos [3, 6, 7, 8, 8, 9, 10, 13, 15, 16, 20] son ​​[7, 9, 15]. Si se requiere, el cuartil cero es 3 y el cuarto cuartil es 20.

Relación con la media

Para cualquier distribución de probabilidad de una población con un número finito de valores, y en general para cualquier distribución de probabilidad con una media y una varianza, se cumple que: μσ1pagpagQ(pag)μ+σpag1pag,{\displaystyle \mu -\sigma \cdot {\sqrt {\frac {1-p}{p}}}\leq Q(p)\leq \mu +\sigma \cdot {\sqrt {\frac {p}{1-p}}}\,,} donde Q(p) es el valor del cuantil p para 0 < p < 1 (o equivalentemente es el cuantil q k para p = k / q ) , donde μ es la media aritmética de la distribución y donde σ es la desviación estándar de la distribución . [ 1 ] En particular, la mediana ( p = k / q = 1/2) nunca está a más de una desviación estándar de la media.

La fórmula anterior se puede utilizar para acotar el valor μ + en términos de cuantiles. Cuando z ≥ 0 , el valor que está z desviaciones estándar por encima de la media tiene un límite inferior. μ+zσQ(z21+z2), For z0.{\displaystyle \mu +z\sigma \geq Q\left({\frac {z^{2}}{1+z^{2}}}\right)\,,\mathrm {~para~} z\geq 0.} Por ejemplo, el valor que está z = 1 desviación estándar por encima de la media siempre es mayor o igual que Q ( p = 0,5) , la mediana, y el valor que está z = 2 desviaciones estándar por encima de la media siempre es mayor o igual que Q ( p = 0,8) , el cuarto quintil.

Cuando z ≤ 0 , existe en cambio un límite superior. μ+zσQ(11+z2), For z0.{\displaystyle \mu +z\sigma \leq Q\left({\frac {1}{1+z^{2}}}\right)\,,\mathrm {~para~} z\leq 0.} Por ejemplo, el valor μ + para z = −3 nunca excederá Q ( p = 0,1 ) , el primer decil.

Estimación de cuantiles a partir de una muestra.

Un problema que surge con frecuencia es la estimación de un cuantil de una población (muy grande o infinita) basándose en una muestra finita de tamaño N.

Los paquetes estadísticos modernos se basan en una serie de técnicas para estimar los cuantiles.

Hyndman y Fan compilaron una taxonomía de nueve algoritmos [ 2 ] utilizados por varios paquetes de software. Todos los métodos calculan Q p , la estimación para el cuantil p (el cuantil q k - ésimo , donde p = k / q ) a partir de una muestra de tamaño N calculando un índice de valor real h . Cuando h es un entero, el h -ésimo valor más pequeño de los N valores, x h , es la estimación del cuantil. De lo contrario, se utiliza un esquema de redondeo o interpolación para calcular la estimación del cuantil a partir de h , x h , y x h . (Para la notación, véanse las funciones de piso y techo ).

Las tres primeras son constantes por partes, cambiando abruptamente en cada punto de datos, mientras que las seis últimas utilizan interpolación lineal entre puntos de datos y difieren solo en cómo se elige el índice h utilizado para seleccionar el punto a lo largo de la curva de interpolación lineal por partes.

Los lenguajes de programación Mathematica , [ 3 ] Matlab , [ 4 ] R [ 5 ] y GNU Octave [ 6 ] admiten los nueve métodos de cuantiles de muestra. SAS incluye cinco métodos de cuantiles de muestra, SciPy [ 7 ] y Maple [ 8 ] incluyen ocho cada uno, EViews [ 9 ] y Julia [ 10 ] incluyen las seis funciones lineales por partes, Stata [ 11 ] incluye dos, Python [ 12 ] incluye dos y Microsoft Excel incluye dos. Mathematica, SciPy y Julia admiten parámetros arbitrarios para métodos que permiten otros métodos no estándar. La biblioteca Java Google Guava proporciona el esquema de tipo 7 en la clase Quantiles.

Los tipos de estimación y los esquemas de interpolación utilizados incluyen:

Notas:

  • R-1 a R-3 son constantes por partes, con discontinuidades.
  • R-4 y las siguientes son lineales por partes, sin discontinuidades, pero difieren en la forma en que se calcula h .
  • R‑3 y R‑4 no son simétricos en el sentido de que no dan h = ( N + 1) / 2 cuando p = 1/2 .
  • La función PERCENTILE.EXC de Excel y el método "exclusivo" predeterminado de Python son equivalentes a R-6.
  • Las funciones PERCENTILE y PERCENTILE.INC de Excel, así como el método opcional "inclusive" de Python, son equivalentes a R-7. Este es el método predeterminado de R y Julia.
  • Los paquetes difieren en la forma en que estiman los cuantiles más allá de los valores mínimo y máximo de la muestra, es decir, p < 1/ N y p > ( N − 1)/ N . Las opciones incluyen devolver un valor de error, calcular una extrapolación lineal o asumir un valor constante.

De las técnicas, Hyndman y Fan recomiendan R-8, pero la mayoría de los paquetes de software estadístico han elegido R-6 o R-7 como predeterminado. [ 13 ]

El error estándar de una estimación de cuantil puede estimarse generalmente mediante el método bootstrap . También se puede utilizar el método de Maritz-Jarrett. [ 14 ]

La distribución asintótica de la mediana muestral

La mediana muestral es el cuantil más estudiado, ya que constituye una alternativa para estimar un parámetro de localización cuando no se conoce el valor esperado de la distribución y, por lo tanto, la media muestral no es un estimador adecuado de una característica poblacional. Además, la mediana muestral es un estimador más robusto que la media muestral.

Una peculiaridad de la mediana muestral es su distribución asintótica : cuando la muestra proviene de una distribución continua, entonces la mediana muestral tiene la distribución asintótica normal anticipada,

Mediana de la muestra mnorte(μ=metro,σ2=14norteF(metro)2){\displaystyle {\text{Mediana de la muestra m}}\sim {\mathcal {N}}\left(\mu =m,\sigma ^{2}={\frac {1}{4Nf(m)^{2}}}\right)}

Esto se extiende a los demás cuantiles,

cuantil de muestra pnorte(μ=incógnitapag,σ2=pag(1pag)norteF(incógnitapag)2){\displaystyle {\text{Sample quantile p}}\sim {\mathcal {N}}\left(\mu =x_{p},\sigma ^{2}={\frac {p(1-p)}{Nf(x_{p})^{2}}}\right)}

donde f ( x p ) es el valor de la densidad de distribución en el cuantil de población p (incógnitapag=F1(pag){\displaystyle x_{p}=F^{-1}(p)}). [ 15 ]

Pero cuando la distribución es discreta, entonces la distribución de la mediana de la muestra y los otros cuantiles no es normal (ver ejemplos en https://stats.stackexchange.com/a/86638/28746 ).

Una solución a este problema es utilizar una definición alternativa de cuantiles de muestra a través del concepto de la función de "distribución media", que se define como

Fmedio(incógnita)=PAG(incógnitaincógnita)12PAG(incógnita=incógnita){\displaystyle F_{\text{mid}}(x)=P(X\leq x)-{\frac {1}{2}}P(X=x)}

La definición de cuantiles muestrales mediante el concepto de función de distribución media puede considerarse una generalización que abarca, como casos especiales, las distribuciones continuas. Para distribuciones discretas, la mediana muestral, definida mediante este concepto, presenta una distribución asintóticamente normal (véase Ma, Y., Genton, MG y Parzen, E. (2011). Asymptotic properties of sample quantiles of discrete distributions. Annals of the Institute of Statistical Mathematics, 63(2), 227–243).

Cuantiles aproximados de una corriente

El cálculo de cuantiles aproximados a partir de datos provenientes de un flujo continuo se puede realizar de manera eficiente utilizando estructuras de datos comprimidas. Los métodos más populares son t-digest [ 16 ] y KLL [ 17 ] . Estos métodos leen un flujo continuo de valores y permiten consultar en cualquier momento el valor aproximado de un cuantil específico.

Ambos algoritmos se basan en una idea similar: comprimir el flujo de valores resumiendo valores idénticos o similares con un peso. Si el flujo está formado por una repetición de 100 veces v1 y 100 veces v2, no hay razón para mantener una lista ordenada de 200 elementos; basta con mantener dos elementos y dos recuentos para poder recuperar los cuantiles. Con más valores, estos algoritmos mantienen un equilibrio entre el número de valores únicos almacenados y la precisión de los cuantiles resultantes. Algunos valores pueden descartarse del flujo y contribuir al peso de un valor cercano sin cambiar demasiado los resultados de los cuantiles. El t-digest mantiene una estructura de datos de tamaño limitado utilizando un enfoque inspirado en el agrupamiento k -means para agrupar valores similares. El algoritmo KLL utiliza un método de "compactación" más sofisticado que conduce a un mejor control de los límites de error a costa de requerir un tamaño ilimitado si los errores deben estar limitados en relación con p .

Ambos métodos pertenecen a la familia de resúmenes de datos , que son subconjuntos de algoritmos de procesamiento en tiempo real con propiedades útiles: los resúmenes t-digest o KLL se pueden combinar. El cálculo del resumen para un vector de valores muy grande se puede dividir en procesos fácilmente paralelos, donde los resúmenes se calculan para particiones del vector en paralelo y se combinan posteriormente.

Los algoritmos descritos hasta ahora aproximan directamente los cuantiles empíricos sin ninguna suposición particular sobre los datos; en esencia, los datos son simplemente números o, más generalmente, un conjunto de elementos que se pueden ordenar. Estos algoritmos son métodos derivados de la informática. Existe otra clase de algoritmos que asumen que los datos son realizaciones de un proceso aleatorio. Estos son métodos derivados de la estadística, en particular los algoritmos de estimación no paramétrica secuencial. Existen varios algoritmos de este tipo, como los basados ​​en la aproximación estocástica [ 18 ] [ 19 ] o los estimadores de series de Hermite [ 20 ] .

Estos algoritmos basados ​​en estadísticas suelen tener una complejidad temporal y espacial de actualización constante, pero presentan garantías de límites de error diferentes a las de los métodos de tipo informático y hacen más suposiciones. Sin embargo, los algoritmos basados ​​en estadísticas ofrecen ciertas ventajas, especialmente en el contexto de datos en tiempo real no estacionarios. Los algoritmos de ambas clases, junto con algunas de sus respectivas ventajas y desventajas, han sido objeto de un estudio reciente. [ 21 ]

Discusión

Los resultados de las pruebas estandarizadas se suelen reportar indicando, por ejemplo, que el estudiante obtiene una puntuación "en el percentil 80". Esto utiliza un significado alternativo de la palabra percentil como el intervalo entre (en este caso) el percentil escalar 80 y el 81. [ 22 ] Este significado distinto de percentil también se utiliza en artículos de investigación científica revisados ​​por pares . [ 23 ] El significado utilizado puede derivarse de su contexto.

Si una distribución es simétrica, la mediana es igual a la media (siempre que esta última exista). Sin embargo, en general, la mediana y la media pueden diferir. Por ejemplo, en una variable aleatoria con distribución exponencial , cualquier muestra tendrá aproximadamente un 63 % de probabilidad de ser menor que la media. Esto se debe a que la distribución exponencial tiene una cola larga para los valores positivos, pero es cero para los negativos.

Los cuantiles son medidas útiles porque son menos susceptibles que las medias a las dificultades que generan las distribuciones de cola larga y los valores atípicos. Empíricamente, si los datos analizados no se distribuyen según una distribución supuesta, o si existen otras posibles fuentes de valores atípicos muy alejados de la media, los cuantiles pueden ser estadísticas descriptivas más útiles que las medias y otras estadísticas relacionadas con momentos.

Estrechamente relacionado con esto se encuentra el método de mínimos absolutos (MAPA) , un método de regresión más robusto frente a valores atípicos que el de mínimos cuadrados , en el que se utiliza la suma del valor absoluto de los errores observados en lugar del error cuadrático. La conexión radica en que la media es la única estimación de una distribución que minimiza el error cuadrático esperado, mientras que la mediana minimiza el error absoluto esperado. El método de mínimos absolutos comparte la capacidad de ser relativamente insensible a grandes desviaciones en observaciones atípicas, aunque existen métodos de regresión robusta aún mejores.

Los cuantiles de una variable aleatoria se conservan bajo transformaciones crecientes, en el sentido de que, por ejemplo, si m es la mediana de una variable aleatoria X , entonces 2 m es la mediana de 2 X , a menos que se haya elegido arbitrariamente un valor de un rango para especificar un cuantil en particular. (Véase la estimación de cuantiles, más arriba, para ejemplos de dicha interpolación). Los cuantiles también pueden utilizarse en casos donde solo se dispone de datos ordinales .

Otras cuantificaciones

Los valores que dividen los datos ordenados en subconjuntos iguales distintos de cuatro tienen nombres diferentes.

  • El único cuartil 2 se llama mediana.
  • Los 3 cuantiles se llaman terciles o terciles → T
  • Los 4 cuantiles se llaman cuartiles → Q; la diferencia entre el cuartil superior e inferior también se llama rango intercuartil , dispersión media o cincuenta medios → IQR = Q 3Q 1 .
  • Los 5 cuantiles se denominan quintiles o pentiles → QU
  • Los 6-cuantiles se llaman sextiles → S
  • Los 7 cuantiles se denominan septiles → SP
  • Los cuantiles 8 se llaman octiles → O
  • Los cuantiles 10 se llaman deciles → D
  • Los cuantiles 12 se denominan duodeciles o dodeciles → DD
  • Los 16 cuantiles se llaman hexadeciles → H
  • Los 20 cuantiles se llaman ventiles , vigintiles o demi-deciles → V
  • Los cuantiles 100 se denominan percentiles o centiles → P
  • Los cuantiles de 1000 se han denominado pormilles o milliles, pero estos son raros y en gran medida obsoletos [ 24 ].

Véase también

Referencias

  1. Bagui, S.; Bhaumik, D. (2004). "Atisbos de desigualdades en probabilidad y estadística" (PDF) . Revista Internacional de Ciencias Estadísticas . 3 : 9–15 . ISSN 1683-5603 . Archivado del original (PDF) el 12 de agosto de 2021. Consultado el 12 de agosto de 2021 . 
  2. Hyndman, Rob J. ; Fan, Yanan (noviembre de 1996). "Cuantiles de muestra en paquetes estadísticos" . American Statistician . 50 (4). American Statistical Association: 361– 365. doi : 10.2307/2684934 . JSTOR 2684934 . 
  3. Documentación de Mathematica. Véase la sección 'Detalles'.
  4. "Cálculo de cuantiles" . uk.mathworks.com .
  5. Frohne, Ivan; Hyndman, Rob J. (2009). Sample Quantiles . R Project. ISBN 978-3-900051-07-5.
  6. "Referencia de función: quantile – Octave-Forge – SourceForge" . Consultado el 6 de septiembre de 2013 .
  7. "scipy.stats.mstats.mquantiles — Guía de referencia de SciPy v1.4.1" . docs.scipy.org .
  8. " Estadísticas – Ayuda de programación de Maple" . www.maplesoft.com
  9. "Ayuda de EViews 9" . Archivado del original el 16 de abril de 2016. Consultado el 4 de abril de 2016 .
  10. "Estadísticas – Documentación de Julia" . Consultado el 17 de junio de 2023 .
  11. Documentación de Stata para los comandos pctile y xtile. Consulte la sección 'Métodos y fórmulas'.
  12. "estadística — Funciones de estadística matemática — Documentación de Python 3.8.3rc1" . docs.python.org .
  13. Hyndman, Rob J. (28 de marzo de 2016). "Cuantiles de muestra 20 años después" . Blog de Hyndsignt . Recuperado el 30 de noviembre de 2020 .
  14. Wilcox, Rand R. (2010). Introducción a la estimación robusta y la prueba de hipótesis . Academic Press. ISBN 978-0-12-751542-7.
  15. Stuart, Alan; Ord, Keith (1994). Teoría avanzada de la estadística de Kendall . Londres: Arnold. ISBN 0340614307.
  16. Dunning, Ted; Ertl, Otmar (febrero de 2019). "Cálculo de cuantiles extremadamente precisos mediante resúmenes t". arXiv : 1902.04023 [ stat.CO ].
  17. Zohar Karnin; Kevin Lang; Edo Liberty (2016). "Aproximación óptima de cuantiles en flujos". arXiv : 1603.05346 [ cs.DS ].
  18. Tierney, Luke (1983). "Un procedimiento recursivo eficiente en espacio para estimar un cuantil de una distribución desconocida" . SIAM Journal on Scientific and Statistical Computing . 4 (4): 706-711. doi : 10.1137/0904048 .
  19. Chen, Fei; Lambert, Diane; Pinheiro, Jose (2000). "Estimación incremental de cuantiles para seguimiento masivo" . Actas de la sexta conferencia internacional ACM SIGKDD sobre descubrimiento de conocimiento y minería de datos . págs. 516-522. doi : 10.1145/347090.347195 . ISBN  1-58113-233-6.
  20. Stephanou, Michael; Varughese, Melvin; Macdonald, Iain (2017). "Cuantiles secuenciales mediante estimación de densidad de series de Hermite" . Electronic Journal of Statistics . 11 (1): 570-607. arXiv : 1507.05073 . doi : 10.1214/17-EJS1245 .
  21. Stephanou, M. y Varughese, M. (2023). "Hermiter: paquete R para estimación no paramétrica secuencial". Computational Statistics . 39 (3): 1127– 1163. arXiv : 2111.14091 . doi : 10.1007/s00180-023-01382-0 . S2CID 244715035 . {{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace )
  22. "percentil" . Oxford Reference . Consultado el 17 de agosto de 2020 .
  23. Kruger, J.; Dunning, D. (diciembre de 1999). "Incompetentes e inconscientes de ello: cómo las dificultades para reconocer la propia incompetencia conducen a autoevaluaciones infladas". Journal of Personality and Social Psychology . 77 (6): 1121– 1134. doi : 10.1037/0022-3514.77.6.1121 . ISSN 0022-3514 . PMID 10626367. S2CID 2109278 .   
  24. Walker, Helen Mary; Lev, Joseph (1969). Métodos estadísticos elementales . Holt, Rinehart and Winston. ISBN 978-0-03-081130-2.
  25. Stephen B. Vardeman (1992). "¿Qué pasa con los otros intervalos?". The American Statistician . 46 (3): 193– 197. doi : 10.2307/2685212 . JSTOR 2685212 . 

Lecturas adicionales

  • Serfling, RJ (1980). Teoremas de aproximación de la estadística matemática . John Wiley & Sons. ISBN 0-471-02403-1.
  • Logotipo de Wikimedia CommonsContenido multimedia relacionado con los cuantiles en Wikimedia Commons