Articulo de referencia

Estimador M

En estadística , los estimadores M son una clase amplia de estimadores de extremos cuya función objetivo es una media muestral. [ 1 ] Tanto los mínimos cuadrados no lineales com...

En estadística , los estimadores M son una clase amplia de estimadores de extremos cuya función objetivo es una media muestral. [ 1 ] Tanto los mínimos cuadrados no lineales como la estimación de máxima verosimilitud son casos especiales de estimadores M. La definición de estimadores M fue motivada por la estadística robusta , que aportó nuevos tipos de estimadores M. Sin embargo, los estimadores M no son inherentemente robustos, como se desprende del hecho de que incluyen estimadores de máxima verosimilitud, que en general no son robustos. El procedimiento estadístico para evaluar un estimador M en un conjunto de datos se denomina estimación M. La inicial "M" significa "tipo de máxima verosimilitud".

De manera más general, un estimador M puede definirse como un cero de una función de estimación . [ 2 ] [ 3 ] [ 4 ] [ 5 ] [ 6 ] [ 7 ] Esta función de estimación suele ser la derivada de otra función estadística. Por ejemplo, una estimación de máxima verosimilitud es el punto donde la derivada de la función de verosimilitud con respecto al parámetro es cero; por lo tanto, un estimador de máxima verosimilitud es un punto crítico de la función de puntuación . [ 8 ] En muchas aplicaciones, estos estimadores M pueden considerarse como estimaciones de características de la población.

Motivación histórica

Aunque los conceptos principales de la estadística robusta se han desarrollado formalmente solo en las últimas décadas, los precursores de los estimadores M robustos se remontan a los inicios de la estadística. Galileo Galilei (1632) fue uno de los primeros en argumentar que los errores de medición requerían un tratamiento sistemático. Posteriormente, Roger Joseph Boscovich (1757) propuso un estimador basado en desviaciones absolutas, Daniel Bernoulli (1785) sugirió esquemas de reponderación iterativos y Simon Newcomb (1886) experimentó con mezclas de distribuciones para la regresión. A finales del siglo XIX, Smith (1888) introdujo lo que ahora se reconoce como el primer estimador M robusto, que ya se asemejaba a la formulación moderna. Una revisión reciente de De Menezes (2021) recopiló, organizó, clasificó e informó constantes de ajuste para un amplio conjunto de estimadores M, proporcionando una visión general sistemática de sus propiedades y aplicaciones. [ 9 ]

El método de mínimos cuadrados es un estimador M prototípico, ya que el estimador se define como un mínimo de la suma de los cuadrados de los residuos.

Otro estimador M popular es la estimación de máxima verosimilitud. Para una familia de funciones de densidad de probabilidad f parametrizadas por θ , se calcula un estimador de máxima verosimilitud de θ para cada conjunto de datos maximizando la función de verosimilitud sobre el espacio de parámetros { θ } . Cuando las observaciones son independientes e idénticamente distribuidas, una estimación ML   θ^{\displaystyle {\sombrero {\theta }}}Satisface

θ^=argmáximoθ(i=1norteF(incógnitai,θ)){\displaystyle {\widehat {\theta }}=\mathop {\arg \max } _{\theta }{\left(\prod _{i=1}^{n}f(x_{i},\theta )\right)}\,\!}

o, equivalentemente,

θ^=argminθ(i=1norteregistroF(incógnitai,θ)).{\displaystyle {\widehat {\theta }}=\mathop {\arg \min } _{\theta }{\left(\sum _{i=1}^{n}-\log f(x_{i},\theta )\right)}.}

Los estimadores de máxima verosimilitud tienen propiedades óptimas en el límite de un número infinito de observaciones bajo condiciones bastante generales, pero pueden estar sesgados y no ser los estimadores más eficientes para muestras finitas.

Definición

En 1964, Peter J. Huber propuso generalizar la estimación de máxima verosimilitud a la minimización de

i=1norteρ(incógnitai,θ),{\displaystyle \sum _{i=1}^{n}\rho (x_{i},\theta ),\,\!}

donde ρ es una función con ciertas propiedades (véase más abajo). Las soluciones

θ^=argminθi=1norteρ(incógnitai,θ){\displaystyle {\hat {\theta }}=\mathop {\arg \min } _{\theta }\sum _{i=1}^{n}\rho (x_{i},\theta )}

Se denominan estimadores M ("M" por "tipo de máxima verosimilitud" (Huber, 1981, página 43)); otros tipos de estimadores robustos incluyen los estimadores L , R y S. Los estimadores de máxima verosimilitud (EMV) son, por lo tanto, un caso especial de los estimadores M. Con un reescalado adecuado, los estimadores M son casos especiales de estimadores de extremos (en los que se pueden utilizar funciones más generales de las observaciones).

La función ρ, o su derivada, ψ, puede elegirse de tal manera que proporcione al estimador propiedades deseables (en términos de sesgo y eficiencia) cuando los datos provienen realmente de la distribución supuesta, y un comportamiento "aceptable" cuando los datos se generan a partir de un modelo que, en cierto sentido, se aproxima a la distribución supuesta.

Tipos

Los estimadores M son soluciones, θ , que minimizan

i=1norteρ(incógnitai,θ).{\displaystyle \sum _{i=1}^{n}\rho (x_{i},\theta ).}

Esta minimización siempre puede realizarse directamente. A menudo, es más sencillo derivar con respecto a θ y calcular la raíz de la derivada. Cuando esta derivación es posible, se dice que el estimador M es de tipo ψ . En caso contrario, se dice que el estimador M es de tipo ρ .

En la mayoría de los casos prácticos, los estimadores M son de tipo ψ.

tipo ρ

Para un entero positivo r , sea(incógnita,Σ){\displaystyle ({\mathcal {X}},\Sigma )}y(ΘRr,S){\displaystyle (\Theta \subset \mathbb {R} ^{r},S)}medir espacios.θΘ{\displaystyle \theta \in \Theta }es un vector de parámetros. Un estimador M de tipo ρT{\displaystyle T}se define mediante una función medibleρ:incógnita×ΘR{\displaystyle \rho :{\mathcal {X}}\times \Theta \to \mathbb {R} } . Mapea una distribución de probabilidadF{\displaystyle F}enincógnita{\displaystyle {\mathcal {X}}}al valorT(F)Θ{\displaystyle T(F)\in \Theta }(si existe) que minimiza incógnitaρ(incógnita,θ)dF(incógnita){\textstyle \int _{\mathcal {X}}\rho (x,\theta )\,dF(x)}:

T(F):=argminθΘincógnitaρ(incógnita,θ)dF(incógnita){\displaystyle T(F):=\mathop {\arg \min } _{\theta \in \Theta }\int _{\mathcal {X}}\rho (x,\theta )\,dF(x)}

Por ejemplo, para el estimador de máxima verosimilitud ,ρ(incógnita,θ)=registroF(incógnita,θ){\displaystyle \rho (x,\theta )=-\log f(x,\theta )}, dóndeF(incógnita,θ)=incógnitaF(incógnita,θ){\textstyle f(x,\theta )={\frac {\partial }{\partial x}}F(x,\theta )}.

tipo ψ

Siρ{\displaystyle \rho }es diferenciable con respecto aθ{\displaystyle \theta }, el cálculo deθ^{\displaystyle {\widehat {\theta }}}suele ser mucho más fácil. Un estimador M de tipo ψ T se define mediante una función medible.ψ:incógnita×ΘRr{\displaystyle \psi :{\mathcal {X}}\times \Theta \rightarrow \mathbb {R} ^{r}} . Mapea una distribución de probabilidad F enincógnita{\displaystyle {\mathcal {X}}}al valorT(F)Θ{\displaystyle T(F)\in \Theta }(si existe) que resuelve la ecuación vectorial:

incógnitaψ(incógnita,θ)dF(incógnita)=0{\displaystyle \int _{\mathcal {X}}\psi (x,\theta )\,dF(x)=0}

incógnitaψ(incógnita,T(F))dF(incógnita)=0{\displaystyle \int _{\mathcal {X}}\psi (x,T(F))\,dF(x)=0}

Por ejemplo, para el estimador de máxima verosimilitud ,ψ(incógnita,θ)=(θ1registroF(incógnita,θ),,θpagregistroF(incógnita,θ))T{\displaystyle \psi (x,\theta )=\left({\frac {\partial }{\partial \theta ^{1}}}\log f(x,\theta ),\dots ,{\frac {\partial }{\partial \theta ^{p}}}\log f(x,\theta )\right)^{\mathrm {T} }}, dóndeT{\displaystyle u^{\mathrm {T} }}denota la transpuesta del vector u yF(incógnita,θ)=incógnitaF(incógnita,θ){\displaystyle f(x,\theta )={\frac {\partial }{\partial x}}F(x,\theta )}.

Dicho estimador no es necesariamente un estimador M de tipo ρ, pero si ρ tiene una primera derivada continua con respecto aθ{\displaystyle \theta }, entonces una condición necesaria para que un estimador M de tipo ψ sea un estimador M de tipo ρ esψ(incógnita,θ)=θρ(incógnita,θ){\displaystyle \psi (x,\theta )=\nabla _{\theta }\rho (x,\theta )}Las definiciones anteriores pueden extenderse fácilmente a muestras finitas.

Si la función ψ disminuye a cero comoincógnita±{\displaystyle x\rightarrow \pm \infty }El estimador se denomina redenscendente . Dichos estimadores poseen algunas propiedades adicionales deseables, como el rechazo completo de valores atípicos extremos.

Cálculo

Para muchas opciones de ρ o ψ, no existe una solución analítica y se requiere un método iterativo de cálculo. Es posible utilizar algoritmos estándar de optimización de funciones, como el de Newton-Raphson . Sin embargo, en la mayoría de los casos se puede emplear un algoritmo iterativo de ajuste por mínimos cuadrados ponderados ; este suele ser el método preferido.

Para ciertas elecciones de ψ, en particular para funciones descendentes , la solución puede no ser única. Este problema es especialmente relevante en problemas multivariados y de regresión. Por lo tanto, es necesario tener cuidado al elegir buenos puntos de partida. Son comunes los puntos de partida robustos , como la mediana como estimación de la posición y la desviación absoluta mediana como estimación univariada de la escala.

Parámetros de concentración

En el cálculo de estimadores M, a veces resulta útil reescribir la función objetivo para reducir la dimensión de los parámetros. Este procedimiento se denomina "concentración" o "perfilado". Ejemplos en los que la concentración de parámetros aumenta la velocidad de cálculo incluyen los modelos de regresiones aparentemente no relacionadas (SUR). [ 10 ] Considere el siguiente problema de estimación M:

(β^norte,γ^norte):=argmáximoβ,γi=1norteq(wi,β,γ){\displaystyle ({\hat {\beta }}_{n},{\hat {\gamma }}_{n}):=\mathop {\arg \max } _{\beta ,\gamma }\sum _{i=1}^{N}\displaystyle q(w_{i},\beta ,\gamma )}

Suponiendo que la función q es diferenciable, el estimador M resuelve las condiciones de primer orden:

i=1norteβq(wi,β,γ)=0{\displaystyle \sum _{i=1}^{N}{\frac {\partial }{\partial \beta }}\,q(w_{i},\beta ,\gamma )=0}

i=1norteγq(wi,β,γ)=0{\displaystyle \sum _{i=1}^{N}{\frac {\partial }{\partial \gamma }}\,q(w_{i},\beta ,\gamma )=0}

Ahora, si podemos resolver la segunda ecuación para γ en términos deW:=(w1,w2,..,wnorte){\displaystyle W:=(w_{1},w_{2},..,w_{N})} yβ{\displaystyle \beta }, la segunda ecuación se convierte en:

i=1norteγq(wi,β,gramo(W,β))=0{\displaystyle \sum _{i=1}^{N}{\frac {\partial }{\partial \gamma }}\,q(w_{i},\beta ,g(W,\beta ))=0}

donde g es, hay alguna función que encontrar. Ahora, podemos reescribir la función objetivo original únicamente en términos de β insertando la función g en el lugar deγ{\displaystyle \gamma }Como resultado, se produce una reducción en el número de parámetros.

La viabilidad de este procedimiento depende de los problemas específicos que se presenten. Sin embargo, cuando es posible, la concentración de parámetros puede facilitar considerablemente el cálculo. Por ejemplo, al estimar un modelo SUR de 6 ecuaciones con 5 variables explicativas en cada ecuación mediante el método de máxima verosimilitud, el número de parámetros se reduce de 51 a 30. [ 10 ]

A pesar de su atractivo aspecto en el cálculo, la concentración de parámetros tiene un uso limitado para derivar propiedades asintóticas del estimador M. [ 11 ] La presencia de W en cada sumando de la función objetivo dificulta la aplicación de la ley de los grandes números y el teorema del límite central .

Propiedades

Distribución

Se puede demostrar que los estimadores M siguen una distribución normal asintótica. Por lo tanto, se pueden utilizar métodos de tipo Wald para construir intervalos de confianza y realizar pruebas de hipótesis. Sin embargo, dado que la teoría es asintótica, con frecuencia será conveniente verificar la distribución, por ejemplo, examinando la distribución de permutación o la distribución bootstrap .

Función de influencia

La función de influencia de un estimador M deψ{\displaystyle \psi }El tipo es proporcional a su definiciónψ{\displaystyle \psi }función.

Sea T un estimador M de tipo ψ, y G una distribución de probabilidad para la cualT(GRAMO){\displaystyle T(G)}está definido. Su función de influencia SI es SI(incógnita;T,GRAMO)=ψ(incógnita,T(GRAMO))ψ(y,θ)θF(y)dy{\displaystyle \operatorname {IF} (x;T,G)=-{\frac {\psi (x,T(G))}{\int {\frac {\partial \psi (y,\theta )}{\partial \theta }}f(y)\,\mathrm {d} y}}}

suponiendo la función de densidadF(y){\displaystyle f(y)}Existe. Una demostración de esta propiedad de los estimadores M se puede encontrar en Huber (1981, Sección 3.2).

Aplicaciones

Los estimadores M pueden construirse para parámetros de localización y parámetros de escala en entornos univariados y multivariados, además de utilizarse en regresión robusta.

Ejemplos

Significar

Sea ( X 1 , ..., X n ) un conjunto de variables aleatorias independientes e idénticamente distribuidas , con distribución F .

Si definimos

ρ(incógnita,θ)=(incógnitaθ)22,{\displaystyle \rho (x,\theta )={\frac {(x-\theta )^{2}}{2}},}

Observamos que esto se minimiza cuando θ es la media de las X. Por lo tanto, la media es un estimador M de tipo ρ, con esta función ρ.

Como esta función ρ es continuamente diferenciable en θ , la media es también un estimador M de tipo ψ para ψ( x , θ ) = θ x . 

Mediana

Para la estimación mediana de ( X 1 , ..., X n ), en cambio podemos definir la función ρ como ρ(incógnita,θ)=|incógnitaθ|{\displaystyle \rho (x,\theta )=|x-\theta |}y de manera similar, la función ρ se minimiza cuando θ es la mediana de las X.

Si bien esta función ρ no es diferenciable en θ , el estimador M de tipo ψ, que es el subgradiente de la función ρ, puede expresarse como ψ(incógnita,θ)=sgn(incógnitaθ){\displaystyle \psi (x,\theta )=\operatorname {sgn}(x-\theta )}

y ψ(incógnita,θ)={{1},si incógnitaθ<0{1},si incógnitaθ>0[1,1],si incógnitaθ=0{\displaystyle \psi (x,\theta )={\begin{cases}\{-1\},&{\mbox{if }}x-\theta <0\\\{1\},&{\text{if }}x-\theta >0\\\left[-1,1\right],&{\mbox{if }}x-\theta =0\end{cases}}}

Condiciones suficientes para la consistencia estadística

Los estimadores M son consistentes bajo diversas condiciones. Un conjunto típico de supuestos es que la clase de funciones satisface una ley uniforme de grandes números y que el máximo está bien separado. Específicamente, dado un objetivo empírico y poblacionalMETROnorte,METRO:ΘR{\displaystyle M_{n},M:\Theta \rightarrow \mathbb {R} }, respectivamente, comonorte{\displaystyle n\rightarrow \infty }:

sorberθΘ|METROnorte(θ)METRO(θ)| pag 0{\displaystyle \sup _{\theta \in \Theta }\left|M_{n}(\theta )-M(\theta )\right|~{\stackrel {p}{\to }}~0} y por cadaϵ>0{\displaystyle \epsilon >0}: sorberθ:d(θ,θ)ϵMETRO(θ)<METRO(θ){\displaystyle \sup _{\theta :d(\theta ,\theta ^{*})\geq \epsilon }M(\theta )<M(\theta ^{*})}

dónded:Θ×ΘR{\displaystyle d:\Theta \times \Theta \rightarrow \mathbb {R} }es una función de distancia yθ{\displaystyle \theta ^{*}}es el óptimo, entonces la estimación M es consistente. [ 12 ]

La restricción de convergencia uniforme no es necesariamente requerida; un conjunto alternativo de supuestos es considerar en cambio la convergencia puntual ( en probabilidad ) de las funciones objetivo. Además, suponga que cada una de lasMETROnorte{\displaystyle M_{n}}tiene derivada continua con exactamente un cero o tiene una derivada que no es decreciente y es asintóticamente ordenadaopag(1){\displaystyle o_{p}(1)}. Finalmente, supongamos que el máximoθ{\displaystyle \theta ^{*}}está bien separado. Entonces la estimación M es consistente. [ 13 ]

Véase también

Referencias

  1. Hayashi, Fumio (2000). "Estimadores extremos" . Econometría . Princeton University Press. ISBN 0-691-01018-8.
  2. Vidyadhar P. Godambe , editor. Estimating functions , volumen 7 de Oxford Statistical Science Series. The Clarendon Press Oxford University Press, Nueva York, 1991.
  3. Christopher C. Heyde. Cuasi-verosimilitud y su aplicación: Un enfoque general para la estimación óptima de parámetros . Springer Series in Statistics. Springer-Verlag, Nueva York, 1997.
  4. DL McLeish y Christopher G. Small. La teoría y las aplicaciones de las funciones de inferencia estadística , volumen 44 de Lecture Notes in Statistics. Springer-Verlag, Nueva York, 1988.
  5. Parimal Mukhopadhyay. Introducción a la estimación de funciones . Alpha Science International, Ltd, 2004.
  6. Christopher G. Small y Jinfang Wang. Métodos numéricos para ecuaciones de estimación no lineales , volumen 29 de Oxford Statistical Science Series. The Clarendon Press Oxford University Press, Nueva York, 2003.
  7. Sara A. van de Geer . Procesos empíricos en la estimación M: Aplicaciones de la teoría de procesos empíricos, volumen 6 de la serie Cambridge en matemáticas estadísticas y probabilísticas. Cambridge University Press, Cambridge, 2000.
  8. Ferguson, Thomas S. (1982). "Una estimación de máxima verosimilitud inconsistente". Journal of the American Statistical Association . 77 (380): 831– 834. doi : 10.1080/01621459.1982.10477894 . JSTOR 2287314 .  
  9. De Menezes, Diego QF (2021). "Una revisión sobre estimadores M robustos para análisis de regresión". Computers & Chemical Engineering . 147 (1) 107254. doi : 10.1016/j.compchemeng.2021.107254 . S2CID 232328341 . 
  10. 1 2 Giles, DE (10 de julio de 2012). "Concentrando o perfilando la función de verosimilitud" .
  11. Wooldridge, JM (2001). Análisis econométrico de datos de sección transversal y de panel . Cambridge, Mass.: MIT Press. ISBN 0-262-23219-7.
  12. Vaart AW van der. Estadísticas asintóticas. Prensa de la Universidad de Cambridge; 1998.
  13. Vaart AW van der. Estadísticas asintóticas. Prensa de la Universidad de Cambridge; 1998.

Lecturas adicionales

  • Andersen, Robert (2008). Métodos modernos para la regresión robusta . Aplicaciones cuantitativas en las ciencias sociales. Vol.  152. Los Ángeles, CA: Sage Publications. ISBN 978-1-4129-4072-6.
  • Godambe, VP (1991). Estimación de funciones . Oxford Statistical Science Series. Vol.  7. Nueva York: Clarendon Press. ISBN 978-0-19-852228-7.
  • Heyde, Christopher C. (1997). Heyde, Christopher C (ed.). Cuasi-verosimilitud y su aplicación: Un enfoque general para la estimación óptima de parámetros . Springer Series in Statistics. Nueva York: Springer. doi : 10.1007/b98823 . ISBN 978-0-387-98225-0.
  • Huber, Peter J. (2009). Estadística robusta (2.ª  ed.). Hoboken, NJ: John Wiley & Sons Inc. ISBN 978-0-470-12990-6.
  • Hoaglin, David C.; Frederick Mosteller; John W. Tukey (1983). Comprensión del análisis de datos robusto y exploratorio . Hoboken, NJ: John Wiley & Sons Inc. ISBN 0-471-09777-2.
  • McLeish, DL; Christopher G. Small (1989). Teoría y aplicaciones de las funciones de inferencia estadística . Lecture Notes in Statistics. Vol.  44. Nueva York: Springer. ISBN 978-0-387-96720-2.
  • Mukhopadhyay, Parimal (2004). Introducción a la estimación de funciones . Harrow, Reino Unido: Alpha Science International, Ltd. ISBN 978-1-84265-163-6.
  • Press, WH; Teukolsky, SA; Vetterling, WT; Flannery, BP (2007), "Sección 15.7. Estimación robusta" , Numerical Recipes: The Art of Scientific Computing (3.ª  ed.), Nueva York: Cambridge University Press, ISBN 978-0-521-88068-8
  • Serfling, Robert J. (2002). Teoremas de aproximación de la estadística matemática . Serie Wiley en Probabilidad y Estadística Matemática. Hoboken, NJ: John Wiley & Sons Inc. ISBN 978-0-471-21927-9.
  • Shapiro, Alexander (2000). "Sobre la asintótica de los estimadores M locales restringidos ". Annals of Statistics . 28 (3): 948– 960. CiteSeerX 10.1.1.69.2288 . doi : 10.1214/aos/1015952006 . JSTOR 2674061 . MR 1792795 .   
  • Small, Christopher G.; Jinfang Wang (2003). Métodos numéricos para ecuaciones de estimación no lineales . Oxford Statistical Science Series. Vol.  29. Nueva York: Oxford University Press. ISBN 978-0-19-850688-1.
  • van de Geer, Sara A. (2000). Procesos empíricos en la estimación M: Aplicaciones de la teoría de procesos empíricos . Serie de Cambridge en Matemáticas Estadísticas y Probabilísticas. Vol.  6. Cambridge, Reino Unido: Cambridge University Press. ISBN 978-0-521-65002-1.
  • Wilcox, RR (2003). Aplicación de técnicas estadísticas contemporáneas . San Diego, CA: Academic Press. pp. 55–79 . 
  • Wilcox, RR (2012). Introducción a la estimación robusta y la prueba de hipótesis, 3.ª ed . San Diego, CA: Academic Press.
  • Estimadores M : una introducción al tema por Zhengyou Zhang