
En estadística , un estimador L (o estadístico L ) es un estimador que consiste en una combinación lineal de las estadísticas de orden de las mediciones. Puede constar de un solo punto, como en la mediana (de un número impar de valores), o de todos los puntos, como en la media.
Las principales ventajas de los estimadores L radican en su extrema simplicidad y robustez estadística : asumiendo datos ordenados, son muy fáciles de calcular e interpretar, y suelen ser resistentes a los valores atípicos. Por lo tanto, resultan útiles en estadística robusta, estadística descriptiva , enseñanza de la estadística y cuando el cálculo es complejo. Sin embargo, son ineficientes , y actualmente se prefieren los estimadores M de estadística robusta , aunque su cálculo es mucho más complejo. En muchas circunstancias, los estimadores L son razonablemente eficientes y, por consiguiente, adecuados para la estimación inicial.
Ejemplos
Un ejemplo básico es la mediana . Dados n valores, sies impar, la mediana es igual a, el-estadística de orden -ésimo; sies par, es el promedio de dos estadísticas de orden:Estas son ambas combinaciones lineales de estadísticas de orden, y la mediana es, por lo tanto, un ejemplo sencillo de un estimador L.
Una lista más detallada de ejemplos incluye: con un solo punto, el máximo, el mínimo o cualquier estadístico de orden único o cuantil ; con uno o dos puntos, la mediana; con dos puntos, el rango medio , el rango , el resumen medio ( rango medio recortado , incluyendo el punto medio de inflexión ) y el rango recortado (incluyendo el rango intercuartil y el rango interdecil ); con tres puntos, la trimemedia ; con una fracción fija de los puntos, la media recortada (incluyendo la media intercuartil ) y la media winsorizada ; con todos los puntos, la media.
Cabe señalar que algunas de estas medidas (como la mediana o el rango medio) son medidas de tendencia central y se utilizan como estimadores de un parámetro de localización , como la media de una distribución normal, mientras que otras (como el rango o el rango recortado) son medidas de dispersión estadística y se utilizan como estimadores de un parámetro de escala , como la desviación estándar de una distribución normal.
Los estimadores L también pueden medir la forma de una distribución, más allá de la ubicación y la escala. Por ejemplo, la diferencia entre el punto medio y la mediana es un estimador L de 3 términos que mide la asimetría , y otras diferencias de los resúmenes medios proporcionan medidas de asimetría en diferentes puntos de la cola. [ 1 ]
Los momentos L de la muestra son estimadores L para el momento L de la población y tienen expresiones bastante complejas. Los momentos L generalmente se tratan por separado; consulte el artículo correspondiente para obtener más detalles.
Robustez
Los estimadores L suelen ser estadísticamente resistentes , con un alto punto de ruptura . Este se define como la fracción de las mediciones que pueden modificarse arbitrariamente sin que la estimación resultante tienda al infinito (es decir, sin que se produzca una ruptura). El punto de ruptura de un estimador L viene dado por la estadística de orden más cercana al mínimo o al máximo: por ejemplo, la mediana tiene un punto de ruptura del 50 % (el más alto posible), y una media recortada o winsorizada al n % tiene un punto de ruptura del n %.
No todos los estimadores L son robustos; si incluyen el mínimo o el máximo, su punto de ruptura es 0. Estos estimadores L no robustos incluyen el mínimo, el máximo, la media y el rango medio. Sin embargo, los equivalentes recortados sí son robustos.
Los estimadores L robustos utilizados para medir la dispersión, como el rango intercuartílico (IQR), proporcionan medidas de escala robustas .
Aplicaciones
En la práctica, en estadística robusta , los estimadores L han sido reemplazados por los estimadores M , que proporcionan estadísticas robustas con una alta eficiencia relativa , aunque a costa de ser mucho más complejos computacionalmente y menos transparentes.
Sin embargo, la simplicidad de los estimadores L hace que sean fáciles de interpretar y visualizar, lo que los hace idóneos para la estadística descriptiva y la enseñanza de la estadística ; muchos incluso pueden calcularse mentalmente a partir de un resumen de cinco o siete números , o visualizarse mediante un diagrama de caja . Los estimadores L desempeñan un papel fundamental en muchos enfoques de la estadística no paramétrica .
Aunque no son paramétricos, los estimadores L se utilizan con frecuencia para la estimación de parámetros , como indica su nombre, si bien a menudo deben ajustarse para obtener un estimador insesgado y consistente . La elección del estimador L y su ajuste dependen de la distribución cuyo parámetro se está estimando.
Por ejemplo, al estimar un parámetro de localización , para una distribución simétrica, un estimador L simétrico (como la mediana o el punto medio) será insesgado. Sin embargo, si la distribución presenta asimetría , los estimadores L simétricos generalmente estarán sesgados y requerirán ajuste. Por ejemplo, en una distribución asimétrica, la asimetría no paramétrica (y los coeficientes de asimetría de Pearson ) miden el sesgo de la mediana como estimador de la media.
Al estimar un parámetro de escala , como cuando se utiliza un estimador L como medida robusta de escala , por ejemplo para estimar la varianza poblacional o la desviación estándar poblacional , generalmente se debe multiplicar por un factor de escala para convertirlo en un estimador consistente e insesgado; véase parámetro de escala: estimación .
Por ejemplo, dividiendo el IQR por(utilizando la función de error ) se convierte en un estimador insesgado y consistente para la desviación estándar de la población si los datos siguen una distribución normal .
Los estimadores L también pueden utilizarse como estadísticos independientes; por ejemplo, la mediana es una medida de posición y el rango intercuartílico (RIC) es una medida de dispersión. En estos casos, los estadísticos muestrales pueden actuar como estimadores de su propio valor esperado ; por ejemplo, la mediana muestral es un estimador de la mediana poblacional.
Ventajas
Además de su simplicidad, los estimadores L suelen ser fáciles de calcular y robustos.
Suponiendo datos ordenados, los estimadores L que involucran solo unos pocos puntos pueden calcularse con muchas menos operaciones matemáticas que las estimaciones eficientes. [ 2 ] [ 3 ] Antes de la llegada de las calculadoras electrónicas y las computadoras , estos proporcionaron una forma útil de extraer gran parte de la información de una muestra con un mínimo esfuerzo. Estos se mantuvieron en uso práctico durante principios y mediados del siglo XX, cuando la clasificación automatizada de datos de tarjetas perforadas fue posible, pero el cálculo seguía siendo difícil, [ 2 ] y todavía se utilizan hoy en día para estimaciones dada una lista de valores numéricos en un formato no legible por máquina , donde la entrada de datos es más costosa que la clasificación manual. También permiten una estimación rápida.
Los estimadores L suelen ser mucho más robustos que los métodos convencionales de máxima eficiencia: la mediana es estadísticamente muy resistente , con un punto de ruptura del 50% , y el rango medio recortado al X% tiene un punto de ruptura del X%, mientras que la media muestral (que es de máxima eficiencia) es mínimamente robusta, fallando ante un único valor atípico.
Eficiencia
Si bien los estimadores L no son tan eficientes como otras estadísticas, suelen tener una eficiencia relativa razonablemente alta y demuestran que una gran parte de la información utilizada en la estimación puede obtenerse con tan solo unos pocos puntos, como uno, dos o tres. Alternativamente, demuestran que las estadísticas de orden contienen una cantidad significativa de información.
Por ejemplo, en términos de eficiencia, dada una muestra de un parámetro numérico con distribución normal , la media aritmética (promedio) de la población se puede estimar con la máxima eficiencia calculando la media muestral : sumando todos los elementos de la muestra y dividiendo por el número de elementos.
Sin embargo, para un conjunto de datos grande (más de 100 puntos) de una población simétrica, la media se puede estimar razonablemente eficiente en relación con la mejor estimación de los estimadores L. Usando un solo punto, esto se hace tomando la mediana de la muestra, sin cálculos necesarios (aparte de ordenar); esto produce una eficiencia del 64% o mejor (para todo n ). Usando dos puntos, una estimación simple es el punto medio de bisagra (el rango medio recortado al 25% ), pero una estimación más eficiente es el rango medio recortado al 29%, es decir, promediar los dos valores al 29% del camino desde el valor más pequeño y el más grande: los percentiles 29 y 71; esto tiene una eficiencia de alrededor del 81%. [ 3 ] Para tres puntos, se puede usar la trimemedia (promedio de la mediana y el punto medio de bisagra), aunque el promedio de los percentiles 20, 50 y 80 produce una eficiencia del 88%. El uso de más puntos produce una mayor eficiencia, aunque cabe destacar que solo se necesitan 3 puntos para una eficiencia muy alta.
Para estimar la desviación estándar de una distribución normal, el rango interdecil escalado proporciona un estimador razonablemente eficiente, aunque en su lugar se toma el rango recortado al 7% (la diferencia entre los percentiles 7 y 93) y se divide por 3 (que corresponde al 86% de los datos de una distribución normal que caen dentro de 1,5 desviaciones estándar de la media) se obtiene una estimación con una eficiencia de aproximadamente el 65%. [ 3 ]
Para muestras pequeñas, los estimadores L también son relativamente eficientes: el resumen medio del tercer punto desde cada extremo tiene una eficiencia de alrededor del 84% para muestras de tamaño aproximado de 10, y el rango dividido portiene una eficiencia razonablemente buena para tamaños de hasta 20, aunque esta disminuye con el aumento de n y el factor de escala puede mejorarse (eficiencia del 85% para 10 puntos). Otros estimadores heurísticos para muestras pequeñas incluyen el rango sobre n (para el error estándar ) y el rango al cuadrado sobre la mediana (para el chi-cuadrado de una distribución de Poisson ). [ 3 ]
Véase también
Referencias
- ↑ Velleman y Hoaglin 1981 .
- 1 2 Mosteller 2006 .
- 1 2 3 4 Evans 1955 , Apéndice G: Estadísticas ineficientes, págs. 902–904 .
- Evans, Robley Dunglison (1955). El núcleo atómico . Serie internacional de física pura y aplicada. McGraw-Hill. 972 págs . ISBN 0-89874414-8.
{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda ) - Fraiman, R.; Meloche, J.; García-Escudero, LA; Gordaliza, A.; Él, X .; Marona, R.; Yohai, VCJ; Funda, SJ; McKean, JW; Pequeño, CG; Madera, A.; Fraiman, R.; Meloche, J. (1999). "Estimación L multivariada". Prueba . 8 (2): 255– 317. doi : 10.1007/BF02595872 .
- Huber, Peter J. (2004). Estadística robusta . Nueva York: Wiley-Interscience. ISBN 0-471-65072-2.
- Mosteller, Frederick (2006) [1946]. «Sobre algunas estadísticas útiles "ineficientes"». En Fienberg, Stephen; Hoaglin, David (eds.). Artículos seleccionados de Frederick Mosteller . Springer Series in Statistics. Nueva York: Springer. pp. 69-100 . doi : 10.1007/978-0-387-44956-2_4 . ISBN 978-0-387-20271-6.
- Shao, Jun (2003). Estadística matemática . Berlín: Springer-Verlag. ISBN 0-387-95382-5.– sección 5.2.2
- Velleman, PF; Hoaglin, DC (1981). Aplicaciones, fundamentos y computación del análisis exploratorio de datos . Duxbury Press. ISBN 0-87150-409-X.
- estadística no paramétrica
- Estadísticas sólidas
- Estimador