Articulo de referencia

Estadístico U

En teoría estadística , una estadística U es una clase de estadísticas definidas como el promedio sobre la aplicación de una función dada a todas las tuplas de tamaño fijo. La l...

En teoría estadística , una estadística U es una clase de estadísticas definidas como el promedio sobre la aplicación de una función dada a todas las tuplas de tamaño fijo. La letra "U" significa insesgada. En estadística elemental, las estadísticas U surgen de forma natural al producir estimadores insesgados de mínima varianza .

La teoría de la estadística U permite derivar un estimador insesgado de varianza mínima a partir de cada estimador insesgado de un parámetro estimable (o funcional estadístico ) para amplias clases de distribuciones de probabilidad . [ 1 ] [ 2 ] Un parámetro estimable es una función medible de la distribución de probabilidad acumulada de la población : por ejemplo, para cada distribución de probabilidad, la mediana poblacional es un parámetro estimable. La teoría de la estadística U se aplica a clases generales de distribuciones de probabilidad.

Historia

Muchas estadísticas originalmente derivadas para familias paramétricas particulares se han reconocido como estadísticas U para distribuciones generales. En estadística no paramétrica , la teoría de las estadísticas U se utiliza para establecer procedimientos estadísticos (como estimadores y pruebas) y estimadores relacionados con la normalidad asintótica y la varianza (en muestras finitas) de dichas cantidades. [ 3 ] La teoría se ha utilizado para estudiar estadísticas más generales, así como procesos estocásticos , como grafos aleatorios . [ 4 ] [ 5 ] [ 6 ]

Supongamos que un problema involucra variables aleatorias independientes e idénticamente distribuidas y que se requiere la estimación de un parámetro determinado. Supongamos que se puede construir una estimación simple e insesgada a partir de solo unas pocas observaciones: esto define el estimador básico basado en un número dado de observaciones. Por ejemplo, una sola observación es en sí misma una estimación insesgada de la media, y un par de observaciones se pueden usar para obtener una estimación insesgada de la varianza. El estadístico U basado en este estimador se define como el promedio (en todas las selecciones combinatorias del tamaño dado del conjunto completo de observaciones) del estimador básico aplicado a las submuestras.

Pranab K. Sen (1992) ofrece una revisión del artículo de Wassily Hoeffding (1948), que introdujo las estadísticas U y estableció la teoría relacionada con ellas, y al hacerlo Sen destaca la importancia que tienen las estadísticas U en la teoría estadística. Sen dice, [ 7 ] “El impacto de Hoeffding (1948) es abrumador en la actualidad y es muy probable que continúe en los años venideros”. Nótese que la teoría de las estadísticas U no se limita a [ 8 ] el caso de variables aleatorias independientes e idénticamente distribuidas o a variables aleatorias escalares. [ 9 ]

Definición

El término estadístico U, debido a Hoeffding (1948), se define de la siguiente manera.

DejarK{\displaystyle K}sean los números reales o complejos, y seaF:(Kd)rK{\displaystyle f\colon (K^{d})^{r}\to K}ser unK{\displaystyle K}función valorada enr{\displaystyle r}d{\displaystyle d}variables -dimensionales. Para cadanorter{\displaystyle n\geq r}el estadístico U asociadoFnorte:(Kd)norteK{\displaystyle f_{n}\colon (K^{d})^{n}\to K}se define como el promedio de los valoresF(incógnitai1,,incógnitair){\displaystyle f(x_{i_{1}},\dotsc ,x_{i_{r}})}sobre el conjuntoIr,norte{\displaystyle I_{r,n}}der{\displaystyle r}-tuplas de índices de{1,2,,norte}{\displaystyle \{1,2,\dotsc ,n\}}con entradas distintas. Formalmente,

Fnorte(incógnita1,,incógnitanorte)=1i=0r1(nortei)(i1,,ir)Ir,norteF(incógnitai1,,incógnitair){\displaystyle f_{n}(x_{1},\dotsc ,x_{n})={\frac {1}{\prod _{i=0}^{r-1}(ni)}}\sum _{(i_{1},\dotsc ,i_{r})\in I_{r,n}}f(x_{i_{1}},\dotsc ,x_{i_{r}})}.

En particular, siF{\displaystyle f}es simétrico lo anterior se simplifica a

Fnorte(incógnita1,,incógnitanorte)=1(norter)(i1,,ir)Jr,norteF(incógnitai1,,incógnitair){\displaystyle f_{n}(x_{1},\dotsc ,x_{n})={\frac {1}{\binom {n}{r}}}\sum _{(i_{1},\dotsc ,i_{r})\in J_{r,n}}f(x_{i_{1}},\dotsc ,x_{i_{r}})},

¿Dónde ahora?Jr,norte{\displaystyle J_{r,n}}denota el subconjunto deIr,norte{\displaystyle I_{r,n}}de tuplas crecientes .

Cada estadístico UFnorte{\displaystyle f_{n}}es necesariamente una función simétrica .

Las estadísticas U son muy comunes en el trabajo estadístico, particularmente en el contexto de Hoeffding de variables aleatorias independientes e idénticamente distribuidas , o más generalmente para secuencias intercambiables , como en el muestreo aleatorio simple de una población finita, donde la propiedad definitoria se denomina "herencia en promedio".

Las estadísticas k de Fisher y los polikays de Tukey son ejemplos de estadísticas U polinómicas homogéneas (Fisher, 1929; Tukey, 1950).

Para una muestra aleatoria simple φ de tamaño n tomada de una población de tamaño N , el estadístico U tiene la propiedad de que el promedio sobre los valores de la muestra ƒ n ( x φ ) es exactamente igual al valor de la población ƒ N ( x ).    

Ejemplos

Algunos ejemplos: SiF(incógnita)=incógnita{\displaystyle f(x)=x}el estadístico UFnorte(incógnita)=incógnita¯norte=(incógnita1++incógnitanorte)/norte{\displaystyle f_{n}(x)={\bar {x}}_{n}=(x_{1}+\cdots +x_{n})/n}es la media de la muestra.

SiF(incógnita1,incógnita2)=|incógnita1incógnita2|{\displaystyle f(x_{1},x_{2})=|x_{1}-x_{2}|}, el estadístico U es la desviación media por pares Fnorte(incógnita1,,incógnitanorte)=2/(norte(norte1))i>j|incógnitaiincógnitaj|{\displaystyle f_{n}(x_{1},\ldots ,x_{n})=2/(n(n-1))\sum _{i>j}|x_{i}-x_{j}|}, definido paranorte2{\displaystyle n\geq 2}.

SiF(incógnita1,incógnita2)=(incógnita1incógnita2)2/2{\displaystyle f(x_{1},x_{2})=(x_{1}-x_{2})^{2}/2}, el estadístico U es la varianza de la muestraFnorte(incógnita)=(incógnitaiincógnita¯norte)2/(norte1){\displaystyle f_{n}(x)=\sum (x_{i}-{\bar {x}}_{n})^{2}/(n-1)} con divisornorte1{\displaystyle n-1}, definido paranorte2{\displaystyle n\geq 2}.

El tercerok{\displaystyle k}-estadísticak3,norte(incógnita)=(incógnitaiincógnita¯norte)3norte/((norte1)(norte2)){\displaystyle k_{3,n}(x)=\sum (x_{i}-{\bar {x}}_{n})^{3}n/((n-1)(n-2))}, la asimetría de la muestra definida paranorte3{\displaystyle n\geq 3}, es una estadística U.

El siguiente caso destaca un punto importante. SiF(incógnita1,incógnita2,incógnita3){\displaystyle f(x_{1},x_{2},x_{3})}es la mediana de tres valores,Fnorte(incógnita1,,incógnitanorte){\displaystyle f_{n}(x_{1},\ldots ,x_{n})}no es la mediana denorte{\displaystyle n}valores. Sin embargo, es una estimación insesgada de varianza mínima del valor esperado de la mediana de tres valores, no de la mediana de la población. Estimaciones similares desempeñan un papel central cuando los parámetros de una familia de distribuciones de probabilidad se estiman mediante momentos ponderados por probabilidad o L-momentos .

Véase también

Notas

  1. Cox y Hinkley (1974), pág. 200, pág. 258
  2. Hoeffding (1948), entre las ecuaciones (4.3) y (4.4)
  3. Sen (1992)
  4. Página 508 en Koroljuk, VS; Borovskich, Yu. V. (1994). Teoría de la estadística U. Matemáticas y sus aplicaciones. Vol.  273 (Traducido por PV Malyshev y DV Malyshev de la  edición original rusa de 1989). Dordrecht: Kluwer Academic Publishers Group. pp.  x+552. ISBN 0-7923-2608-3. MR 1472486 . 
  5. ^ Páginas 381–382 en Borovskikh, Yu. V. (1996).Estadísticas U en espacios de Banach . Utrecht: VSP. pp.  xii+420. ISBN 90-6764-200-2. MR 1419498 . 
  6. Página xii en Kwapień, Stanisƚaw; Woyczyński, Wojbor A. (1992). Series aleatorias e integrales estocásticas: simples y múltiples . Probabilidad y sus aplicaciones. Boston, MA: Birkhäuser Boston, Inc. pp. xvi+360. ISBN  0-8176-3572-6. MR 1167198 . 
  7. Sen (1992) pág. 307
  8. Sen (1992), pág. 306
  9. El último capítulo de Borovskikh analiza las estadísticas U para elementos aleatorios intercambiables que toman valores en un espacio vectorial ( espacio de Banach separable ).

Referencias

  • Borovskikh, Yu. V. (1996).Estadísticas U en espacios de Banach . Utrecht: VSP. pp.  xii+420. ISBN 90-6764-200-2. MR 1419498 . 
  • Cox, DR, Hinkley, DV (1974) Estadística teórica . Chapman and Hall. ISBN 0-412-12420-3
  • Fisher, RA (1929) Momentos y momentos de producto de distribuciones de muestreo. Actas de la Sociedad Matemática de Londres , 2, 30:199 238.
  • Hoeffding, W. (1948) Una clase de estadísticos con distribuciones asintóticamente normales. Annals of Statistics , 19:293–325. (Reimpreso parcialmente en: Kotz, S., Johnson, NL (1992) Breakthroughs in Statistics , Vol. I, pp. 308–334. Springer-Verlag. ISBN 0-387-94037-5)
  • Koroljuk, V.S.; Borovskich, Yu. V. (1994). Teoría de la estadística U. Matemáticas y sus aplicaciones. Vol.  273 (Traducido por P.V. Malyshev y D.V. Malyshev de la  edición original rusa de 1989). Dordrecht: Kluwer Academic Publishers Group. pp.  x+552. ISBN 0-7923-2608-3. MR 1472486 . 
  • Lee, AJ (1990) U-Statistics: Theory and Practice . Marcel Dekker, Nueva York. pp320 ISBN 0-8247-8253-4
  • Sen, PK (1992) Introducción a Hoeffding (1948) Una clase de estadísticas con distribución asintóticamente normal. En: Kotz, S., Johnson, NL Avances en estadística , Vol. I, pp. 299–307. Springer-Verlag. ISBN 0-387-94037-5.
  • Serfling, Robert J. (1980). Teoremas de aproximación de la estadística matemática . Nueva York: John Wiley and Sons. ISBN 0-471-02403-1.
  • Tukey, JW (1950). "Algunos métodos de muestreo simplificados". Journal of the American Statistical Association . 45 (252): 501– 519. doi : 10.1080/01621459.1950.10501142 .
  • Halmos, P. (1946). "La teoría de la estimación insesgada" . Anales de estadística matemática . 1 (17): 34– 43. doi : 10.1214/aoms/1177731020 .