Articulo de referencia

Estimador consistente

{ T 1 , T 2 , T 3 , ...} es una secuencia de estimadores para el parámetro θ 0 , cuyo valor verdadero es 4. Esta secuencia es consistente: los estimadores se concentran cada vez...

{ T 1 , T 2 , T 3 , ...} es una secuencia de estimadores para el parámetro θ 0 , cuyo valor verdadero es 4. Esta secuencia es consistente: los estimadores se concentran cada vez más cerca del valor verdadero θ 0 ; al mismo tiempo, estos estimadores están sesgados. La distribución límite de la secuencia es una variable aleatoria degenerada que es igual a θ 0 con probabilidad 1.

En estadística , un estimador consistente o asintóticamente consistente es un estimador —una regla para calcular estimaciones de un parámetro θ₀— que posee la propiedad de que, a medida que aumenta indefinidamente el número de puntos de datos utilizados, la secuencia resultante de estimaciones converge en probabilidad a θ₀ . Esto significa que las distribuciones de las estimaciones se concentran cada vez más cerca del valor verdadero del parámetro que se está estimando, de modo que la probabilidad de que el estimador esté arbitrariamente cerca de θ₀ converge a uno.

En la práctica, se construye un estimador en función de una muestra disponible de tamaño n , y luego se imagina la posibilidad de seguir recopilando datos y expandiendo la muestra indefinidamente . De esta manera, se obtendría una secuencia de estimaciones indexadas por n , y la consistencia es una propiedad de lo que ocurre a medida que el tamaño de la muestra tiende a infinito. Si se puede demostrar matemáticamente que la secuencia de estimaciones converge en probabilidad al valor verdadero θ₀ , se denomina estimador consistente; de ​​lo contrario , se dice que el estimador es inconsistente .

La consistencia, tal como se define aquí, a veces se denomina consistencia débil . Cuando reemplazamos la convergencia en probabilidad por la convergencia casi segura , se dice que el estimador es fuertemente consistente . La consistencia está relacionada con el sesgo ; véase sesgo versus consistencia .

Definición

Formalmente hablando, se dice que un estimador T n del parámetro θ es débilmente consistente si converge en probabilidad al verdadero valor del parámetro: [ 1 ]

plomeríanorteTnorte=θ.{\displaystyle {\underset {n\to \infty }{\operatorname {plim} }}\;T_{n}=\theta .}

es decir, si para todo ε > 0

límitenortePr(|Tnorteθ|>ε)=0.{\displaystyle \lim _{n\to \infty }\Pr {\big (}|T_{n}-\theta |>\varepsilon {\big )}=0.}

Se dice que un estimador T n del parámetro θ es fuertemente consistente si converge casi con seguridad al verdadero valor del parámetro:

Pr(límitenorteTnorte=θ)=1.{\displaystyle \Pr {\big (}\lim _{n\to \infty }T_{n}=\theta {\big )}=1.}

Una definición más rigurosa tiene en cuenta el hecho de que θ es realmente desconocido y, por lo tanto, la convergencia en probabilidad debe ocurrir para cada posible valor de este parámetro. Supongamos que { p θ : θ ∈ Θ } es una familia de distribuciones (el modelo paramétrico ), y X θ = { X 1 , X 2 , …  : X i ~ p θ } es una muestra infinita de la distribución p θ . Sea { T n ( X θ ) } una secuencia de estimadores para algún parámetro g ( θ ). Por lo general, T n se basará en las primeras n observaciones de una muestra. Entonces se dice que esta secuencia { T n } es (débilmente) consistente si [ 2 ]

plomeríanorteTnorte(incógnitaθ)=gramo(θ),  a pesar de θΘ.{\displaystyle {\underset {n\to \infty }{\operatorname {plim} }}\;T_{n}(X^{\theta })=g(\theta ),\ \ {\text{for all}}\ \theta \in \Theta .}

Esta definición utiliza g ( θ ) en lugar de simplemente θ , porque a menudo interesa estimar una determinada función o un subvector del parámetro subyacente. En el siguiente ejemplo, estimamos el parámetro de localización del modelo, pero no la escala:

Ejemplos

Media muestral de una variable aleatoria normal

Supongamos que tenemos una secuencia de observaciones estadísticamente independientes { X₁ , X₂ , ...} de una distribución normal N ( μ , σ² ) . Para estimar μ a partir de las primeras n observaciones, podemos usar la media muestral : Tₙ = ( X₁ + ... + Xₙ ) / n . Esto define una secuencia de estimadores, indexados por el tamaño de la muestra n .  

A partir de las propiedades de la distribución normal, conocemos la distribución muestral de este estadístico: T n es en sí mismo una distribución normal, con media μ y varianza σ 2 / n . Equivalentemente,(Tnorteμ)/(σ/norte){\displaystyle \scriptstyle (T_{n}-\mu )/(\sigma /{\sqrt {n}})}tiene una distribución normal estándar:

Pr[|Tnorteμ|ε]=Pr[norte|Tnorteμ|σnorteε/σ]=2(1Φ(norteεσ))0{\displaystyle \Pr \!\left[\,|T_{n}-\mu |\geq \varepsilon \,\right]=\Pr \!\left[{\frac {{\sqrt {n}}\,{\big |}T_{n}-\mu {\big |}}{\sigma }}\geq {\sqrt {n}}\varepsilon /\sigma \right]=2\left(1-\Phi \left({\frac {{\sqrt {n}}\,\varepsilon }{\sigma }}\right)\right)\to 0}

cuando n tiende a infinito, para cualquier ε > 0 fijo . Por lo tanto, la secuencia T n de medias muestrales es consistente para la media poblacional μ (recordando que Φ{\displaystyle \Phi }es la distribución acumulativa de la distribución normal estándar).

Establecer coherencia

La noción de consistencia asintótica es muy similar, casi sinónima, a la de convergencia en probabilidad. Por lo tanto, cualquier teorema, lema o propiedad que establezca la convergencia en probabilidad puede utilizarse para demostrar la consistencia. Existen muchas herramientas de este tipo:

  • Para demostrar la consistencia directamente a partir de la definición se puede utilizar la desigualdad [ 3 ].
Pr[h(Tnorteθ)ε]mi[h(Tnorteθ)]h(ε),{\displaystyle \Pr \!{\big [}h(T_{n}-\theta )\geq \varepsilon {\big ]}\leq {\frac {\operatorname {E} {\big [}h(T_{n}-\theta ){\big ]}}{h(\varepsilon )}},}

La opción más común para la función h es el valor absoluto (en cuyo caso se conoce como desigualdad de Markov ) o la función cuadrática (respectivamente, la desigualdad de Chebyshev ).

  • Otro resultado útil es el teorema de la aplicación continua : si T n es consistente para θ y g (·) es una función de valor real continua en el punto θ , entonces g ( T n ) será consistente para g ( θ ): [ 4 ]
Tnorte pag θ gramo(Tnorte) pag gramo(θ){\displaystyle T_{n}\ {\xrightarrow {p}}\ \theta \ \quad \Rightarrow \quad g(T_{n})\ {\xrightarrow {p}}\ g(\theta )}
  • El teorema de Slutsky se puede utilizar para combinar varios estimadores diferentes, o un estimador con una secuencia convergente no aleatoria. Si T n d α , y S n p β , entonces [ 5 ]
Tnorte+Snorte d α+β,TnorteSnorte d αβ,Tnorte/Snorte d α/β, siempre que β0{\displaystyle {\begin{aligned}&T_{n}+S_{n}\ {\xrightarrow {d}}\ \alpha +\beta ,\\&T_{n}S_{n}\ {\xrightarrow {d}}\ \alpha \beta ,\\&T_{n}/S_{n}\ {\xrightarrow {d}}\ \alpha /\beta ,{\text{ provided that }}\beta \neq 0\end{aligned}}}
  • Si el estimador T n viene dado por una fórmula explícita, entonces lo más probable es que la fórmula emplee sumas de variables aleatorias, y entonces se puede utilizar la ley de los grandes números : para una secuencia { X n } de variables aleatorias y bajo condiciones adecuadas,
1nortei=1nortegramo(incógnitai) pag mi[gramo(incógnita)]{\displaystyle {\frac {1}{n}}\sum _{i=1}^{n}g(X_{i})\ {\xrightarrow {p}}\ \operatorname {E} [\,g(X)\,]}

Sesgo versus coherencia

Imparcial pero no coherente

Un estimador puede ser insesgado pero no consistente. Por ejemplo, para una muestra i.i.d. { x1 ,...,xn } uno puede usarTn (X) =xn como el estimador de la media E[X]. Nótese que aquí la distribución muestral deTn es lo mismo que la distribución subyacente (para cualquiern,ya que ignora todos los puntos excepto el último). Entonces E[Tn (X)] = E[X] para cualquiern,por lo tanto es insesgado, pero no converge a ningún valor.

Sin embargo, si una secuencia de estimadores es insesgada y converge a un valor, entonces es consistente, ya que debe converger al valor correcto.

Parcial pero coherente

Alternativamente, un estimador puede ser sesgado pero consistente. Por ejemplo, si la media se estima mediante1norteincógnitai+1norte{\displaystyle {1 \over n}\sum x_{i}+{1 \over n}}es parcial, pero comonorte{\displaystyle n\rightarrow \infty }Se aproxima al valor correcto y, por lo tanto, es consistente.

Ejemplos importantes incluyen la varianza muestral y la desviación estándar muestral . Sin la corrección de Bessel (es decir, cuando se utiliza el tamaño de la muestra).norte{\displaystyle n}en lugar de los grados de libertadnorte1{\displaystyle n-1}), ambos son estimadores con sesgo negativo pero consistentes. Con la corrección, la varianza muestral corregida es insesgada, mientras que la desviación estándar muestral corregida sigue estando sesgada, pero en menor medida, y ambas siguen siendo consistentes: el factor de corrección converge a 1 a medida que aumenta el tamaño de la muestra.

Aquí hay otro ejemplo. DejemosTnorte{\displaystyle T_{n}}ser una secuencia de estimadores paraθ{\displaystyle \theta }.

Pr(Tnorte)={11/norte,si Tnorte=θ1/norte,si Tnorte=norteδ+θ{\displaystyle \Pr(T_{n})={\begin{cases}1-1/n,&{\mbox{if }}\,T_{n}=\theta \\1/n,&{\mbox{if }}\,T_{n}=n\delta +\theta \end{cases}}}

Podemos ver queTnortepagθ{\displaystyle T_{n}{\xrightarrow {p}}\theta },mi[Tnorte]=θ+δ{\displaystyle \operatorname {E} [T_{n}]=\theta +\delta }y el sesgo no converge a cero.

Véase también

Notas

  1. Amemiya 1985 , Definición 3.4.2.
  2. Lehman y Casella 1998 , pág. 332.
  3. Amemiya 1985 , ecuación (3.2.5).
  4. ^ Amemiya 1985 , Teorema 3.2.6.
  5. ^ Amemiya 1985 , Teorema 3.2.7.
  6. ^ Newey y McFadden 1994 , Capítulo 2.

Referencias