Articulo de referencia

Tendencia central

En estadística , una tendencia central (o medida de tendencia central ) es un valor central o típico para una distribución de probabilidad . [ 1 ] Coloquialmente, las medidas de...

En estadística , una tendencia central (o medida de tendencia central ) es un valor central o típico para una distribución de probabilidad . [ 1 ]

Coloquialmente, las medidas de tendencia central suelen denominarse promedios . El término tendencia central data de finales de la década de 1920. [ 2 ]

Las medidas de tendencia central más comunes son la media aritmética , la mediana y la moda . Se puede calcular una tendencia central para un conjunto finito de valores o para una distribución teórica, como la distribución normal . En ocasiones, los autores utilizan el término tendencia central para referirse a "la tendencia de los datos cuantitativos a agruparse alrededor de un valor central". [ 2 ] [ 3 ]

La tendencia central de una distribución se suele contrastar con su dispersión o variabilidad ; la dispersión y la tendencia central son las propiedades que caracterizan con mayor frecuencia a las distribuciones. El análisis puede determinar si los datos presentan una tendencia central fuerte o débil en función de su dispersión.

Medidas

Lo siguiente puede aplicarse a datos unidimensionales. Según las circunstancias, puede ser conveniente transformar los datos antes de calcular la tendencia central. Algunos ejemplos son elevar los valores al cuadrado o aplicar logaritmos. La conveniencia de una transformación y su naturaleza dependen en gran medida de los datos que se analizan.

Media aritmética o simplemente, media
la suma de todas las mediciones dividida por el número de observaciones en el conjunto de datos.
Mediana
El valor medio que separa la mitad superior de la mitad inferior del conjunto de datos. La mediana y la moda son las únicas medidas de tendencia central que se pueden utilizar para datos ordinales , en los que los valores se clasifican en relación unos con otros, pero no se miden en términos absolutos.
Modo
El valor más frecuente en el conjunto de datos. Esta es la única medida de tendencia central que se puede utilizar con datos nominales , cuyas asignaciones de categorías son puramente cualitativas.
Media generalizada
Una generalización de la media pitagórica , especificada por un exponente.
media geométrica
La raíz enésima del producto de los valores de los datos, donde hay n de estos. Esta medida es válida únicamente para datos que se miden en una escala estrictamente positiva.
Media armónica
El recíproco de la media aritmética de los recíprocos de los valores de los datos. Esta medida es válida únicamente para datos que se miden en una escala estrictamente positiva o estrictamente negativa.
Media aritmética ponderada
una media aritmética que incorpora ponderaciones a ciertos elementos de datos.
Media truncada o media recortada
la media aritmética de los valores de los datos después de haber descartado un cierto número o proporción de los valores de datos más altos y más bajos.
media intercuartil
una media truncada basada en datos dentro del rango intercuartil .
Gama media
la media aritmética de los valores máximo y mínimo de un conjunto de datos.
Bisagra central
la media aritmética del primer y tercer cuartil .
Media cuasi-aritmética
Una generalización de la media generalizada , especificada por una función inyectiva continua .
Trimean
la media aritmética ponderada de la mediana y los dos cuartiles.
media winsorizada
una media aritmética en la que los valores extremos se reemplazan por valores más cercanos a la mediana.

Cualquiera de los métodos anteriores puede aplicarse a cada dimensión de los datos multidimensionales, pero los resultados pueden no ser invariantes a las rotaciones del espacio multidimensional.

mediana geométrica
El punto que minimiza la suma de las distancias a un conjunto de puntos de muestra. Esto es equivalente a la mediana cuando se aplica a datos unidimensionales, pero no es lo mismo que calcular la mediana de cada dimensión de forma independiente. No es invariante ante diferentes escalados de las distintas dimensiones.
Media cuadrática (a menudo conocida como raíz cuadrática media )
Es útil en ingeniería, pero no se usa con frecuencia en estadística. Esto se debe a que no es un buen indicador del centro de la distribución cuando esta incluye valores negativos.
Profundidad simplicial
la probabilidad de que un simplex elegido al azar con vértices de la distribución dada contenga el centro dado
mediana de Tukey
un punto con la propiedad de que cada semiplano que lo contiene también contiene muchos puntos de muestra

Algunas de estas medidas son robustas frente a valores atípicos , como la mediana y la media trimestral.

Soluciones a problemas variacionales

Varias medidas de tendencia central pueden caracterizarse como la resolución de un problema variacional, en el sentido del cálculo de variaciones , es decir, la minimización de la variación respecto al centro. Esto significa que, dada una medida de dispersión estadística , se busca una medida de tendencia central que minimice la variación: de modo que la variación respecto al centro sea mínima entre todas las opciones de centro. En un dicho popular, "la dispersión precede a la ubicación". Estas medidas se definen inicialmente en una dimensión, pero pueden generalizarse a múltiples dimensiones. Este centro puede ser único o no. En el sentido de los espacios L p , la correspondencia es:

Las funciones asociadas se denominan p -normas : respectivamente 0-"norma", 1-norma, 2-norma e ∞-norma. La función correspondiente al espacio L 0 no es una norma y, por lo tanto, a menudo se la denomina entre comillas: 0-"norma".

En ecuaciones, para un conjunto de datos X dado (finito) , considerado como un vector x = ( x 1 ,…, x n ) , la dispersión alrededor de un punto c es la "distancia" de x al vector constante c = ( c ,…, c ) en la norma p (normalizada por el número de puntos n ):

Fpag(do)=incógnitadopag:=(1nortei=1norte|incógnitaido|pag)1/pag{\displaystyle f_{p}(c)=\left\|\mathbf {x} -\mathbf {c} \right\|_{p}:={\bigg (}{\frac {1}{n}}\sum _{i=1}^{n}\left|x_{i}-c\right|^{p}{\bigg )}^{1/p}}

Para p = 0 y p = ∞, estas funciones se definen tomando límites, respectivamente, cuando p → 0 y p → ∞ . Para p = 0, los valores límite son 0 0 = 0 y a 0 = 1 para a ≠ 0 , por lo que la diferencia se convierte simplemente en igualdad, de modo que la norma 0 cuenta el número de puntos desiguales . Para p = ∞, el número mayor predomina, y por lo tanto la norma ∞ es la diferencia máxima.

Unicidad

La media ( centro L2 ) y el punto medio ( centro L∞ ) son únicos (cuando existen), mientras que la mediana ( centro L1 ) y la moda ( centro L0 ) no son , en general , únicas. Esto puede entenderse en términos de la convexidad de las funciones asociadas ( funciones coercitivas ).

La norma 2 y la norma ∞ son estrictamente convexas , por lo que (mediante optimización convexa) el minimizador es único (si existe) y existe para distribuciones acotadas. Por lo tanto, la desviación estándar respecto a la media es menor que la desviación estándar respecto a cualquier otro punto, y la desviación máxima respecto al punto medio es menor que la desviación máxima respecto a cualquier otro punto.

La norma L1 no es estrictamente convexa, mientras que la convexidad estricta es necesaria para garantizar la unicidad del minimizador. En consecuencia, la mediana (en este sentido de minimización) no es única en general, y de hecho, cualquier punto entre los dos puntos centrales de una distribución discreta minimiza la desviación absoluta media.

La norma 0 no es convexa (por lo tanto, no es una norma). De igual modo, la moda no es única; por ejemplo, en una distribución uniforme, cualquier punto puede ser la moda.

Agrupación

En lugar de un único punto central, se pueden solicitar múltiples puntos de manera que se minimice la variación respecto a estos. Esto da lugar al análisis de conglomerados , donde cada punto del conjunto de datos se agrupa con el "centro" más cercano. Generalmente, el uso de la norma 2 generaliza la media al agrupamiento k -medias , mientras que el uso de la norma 1 generaliza la mediana (geométrica) al agrupamiento k -medianas . El uso de la norma 0 simplemente generaliza la moda (valor más frecuente) utilizando los k valores más frecuentes como centros.

A diferencia de las estadísticas de un solo centro, esta agrupación multicéntrica no se puede calcular en general mediante una expresión cerrada , sino que debe calcularse o aproximarse mediante un método iterativo ; un enfoque general son los algoritmos de expectativa-maximización .

Geometría de la información

La noción de "centro" como minimizador de la variación puede generalizarse en geometría de la información como una distribución que minimiza la divergencia (una distancia generalizada) de un conjunto de datos. El caso más común es la estimación de máxima verosimilitud , donde la estimación de máxima verosimilitud (EMV) maximiza la verosimilitud (minimiza la sorpresa esperada ), lo que puede interpretarse geométricamente utilizando la entropía para medir la variación: la EMV minimiza la entropía cruzada (o, equivalentemente, la entropía relativa , la divergencia de Kullback-Leibler).

Un ejemplo sencillo de esto se aplica al centro de datos nominales: en lugar de usar la moda (el único "centro" de valor único), se suele utilizar la medida empírica (la distribución de frecuencia dividida por el tamaño de la muestra ) como "centro". Por ejemplo, dados datos binarios , digamos cara o cruz, si un conjunto de datos consta de 2 caras y 1 cruz, entonces la moda es "cara", pero la medida empírica es 2/3 caras, 1/3 cruces, lo que minimiza la entropía cruzada (sorpresa total) del conjunto de datos. Esta perspectiva también se utiliza en el análisis de regresión , donde los mínimos cuadrados encuentran la solución que minimiza las distancias a ella, y de forma análoga en la regresión logística , una estimación de máxima verosimilitud minimiza la sorpresa (distancia de información).

Relaciones entre la media, la mediana y la moda

Para distribuciones unimodales se conocen los siguientes límites, que son precisos: [ 4 ]

|θμ|σ3,{\displaystyle {\frac {|\theta -\mu |}{\sigma }}\leq {\sqrt {3}},}
|νμ|σ0,6,{\displaystyle {\frac {|\nu -\mu |}{\sigma }}\leq {\sqrt {0.6}},}
|θν|σ3,{\displaystyle {\frac {|\theta -\nu |}{\sigma }}\leq {\sqrt {3}},}

donde μ es la media, ν es la mediana, θ es la moda y σ es la desviación estándar.

Para cada distribución, [ 5 ] [ 6 ]

|νμ|σ1.{\displaystyle {\frac {|\nu -\mu |}{\sigma }}\leq 1.}

Véase también

Notas

  1. A diferencia de las otras medidas, la moda no requiere ninguna geometría en el conjunto y, por lo tanto, se aplica igualmente en una dimensión, en múltiples dimensiones o incluso para variables categóricas .
  2. La mediana se define únicamente en una dimensión; la mediana geométrica es una generalización multidimensional.
  3. La media se puede definir de forma idéntica para vectores en múltiples dimensiones que para escalares en una dimensión; la forma multidimensional se suele denominar centroide.
  4. En múltiples dimensiones, el rango medio se puede definir coordenada por coordenada (tomando el rango medio de cada coordenada), aunque esto no es común.

Referencias

  1. Weisberg HF (1992) Tendencia central y variabilidad , Serie de documentos de la Universidad Sage sobre aplicaciones cuantitativas en las ciencias sociales, ISBN 0-8039-4007-6pág. 2
  2. 1 2 Upton, G.; Cook, I. (2008) Oxford Dictionary of Statistics , OUP ISBN 978-0-19-954145-4(entrada para "tendencia central")
  3. Dodge, Y. (2003) The Oxford Dictionary of Statistical Terms , OUP para el Instituto Internacional de Estadística . ISBN 0-19-920613-9(entrada para "tendencia central")
  4. Johnson NL, Rogers CA (1951) "El problema de los momentos para distribuciones unimodales". Annals of Mathematical Statistics , 22 (3) 433–439
  5. Hotelling H, Solomons LM (1932) Los límites de una medida de asimetría. Annals Math Stat 3, 141–114
  6. Garver (1932) Sobre los límites de una medida de asimetría. Ann Math Stats 3(4) 141–142