
En estadística , un estimador consistente o asintóticamente consistente es un estimador —una regla para calcular estimaciones de un parámetro θ₀— que posee la propiedad de que, a medida que aumenta indefinidamente el número de puntos de datos utilizados, la secuencia resultante de estimaciones converge en probabilidad a θ₀ . Esto significa que las distribuciones de las estimaciones se concentran cada vez más cerca del valor verdadero del parámetro que se está estimando, de modo que la probabilidad de que el estimador esté arbitrariamente cerca de θ₀ converge a uno.
En la práctica, se construye un estimador en función de una muestra disponible de tamaño n , y luego se imagina la posibilidad de seguir recopilando datos y expandiendo la muestra indefinidamente . De esta manera, se obtendría una secuencia de estimaciones indexadas por n , y la consistencia es una propiedad de lo que ocurre a medida que el tamaño de la muestra tiende a infinito. Si se puede demostrar matemáticamente que la secuencia de estimaciones converge en probabilidad al valor verdadero θ₀ , se denomina estimador consistente; de lo contrario , se dice que el estimador es inconsistente .
La consistencia, tal como se define aquí, a veces se denomina consistencia débil . Cuando reemplazamos la convergencia en probabilidad por la convergencia casi segura , se dice que el estimador es fuertemente consistente . La consistencia está relacionada con el sesgo ; véase sesgo versus consistencia .
Definición
Formalmente hablando, se dice que un estimador T n del parámetro θ es débilmente consistente si converge en probabilidad al verdadero valor del parámetro: [ 1 ]
es decir, si para todo ε > 0
Se dice que un estimador T n del parámetro θ es fuertemente consistente si converge casi con seguridad al verdadero valor del parámetro:
Una definición más rigurosa tiene en cuenta el hecho de que θ es realmente desconocido y, por lo tanto, la convergencia en probabilidad debe ocurrir para cada posible valor de este parámetro. Supongamos que { p θ : θ ∈ Θ } es una familia de distribuciones (el modelo paramétrico ), y X θ = { X 1 , X 2 , … : X i ~ p θ } es una muestra infinita de la distribución p θ . Sea { T n ( X θ ) } una secuencia de estimadores para algún parámetro g ( θ ). Por lo general, T n se basará en las primeras n observaciones de una muestra. Entonces se dice que esta secuencia { T n } es (débilmente) consistente si [ 2 ]
Esta definición utiliza g ( θ ) en lugar de simplemente θ , porque a menudo interesa estimar una determinada función o un subvector del parámetro subyacente. En el siguiente ejemplo, estimamos el parámetro de localización del modelo, pero no la escala:
Ejemplos
Media muestral de una variable aleatoria normal
Supongamos que tenemos una secuencia de observaciones estadísticamente independientes { X₁ , X₂ , ...} de una distribución normal N ( μ , σ² ) . Para estimar μ a partir de las primeras n observaciones, podemos usar la media muestral : Tₙ = ( X₁ + ... + Xₙ ) / n . Esto define una secuencia de estimadores, indexados por el tamaño de la muestra n .
A partir de las propiedades de la distribución normal, conocemos la distribución muestral de este estadístico: T n es en sí mismo una distribución normal, con media μ y varianza σ 2 / n . Equivalentemente,tiene una distribución normal estándar:
cuando n tiende a infinito, para cualquier ε > 0 fijo . Por lo tanto, la secuencia T n de medias muestrales es consistente para la media poblacional μ (recordando que es la distribución acumulativa de la distribución normal estándar).
Establecer coherencia
La noción de consistencia asintótica es muy similar, casi sinónima, a la de convergencia en probabilidad. Por lo tanto, cualquier teorema, lema o propiedad que establezca la convergencia en probabilidad puede utilizarse para demostrar la consistencia. Existen muchas herramientas de este tipo:
- Para demostrar la consistencia directamente a partir de la definición se puede utilizar la desigualdad [ 3 ].
La opción más común para la función h es el valor absoluto (en cuyo caso se conoce como desigualdad de Markov ) o la función cuadrática (respectivamente, la desigualdad de Chebyshev ).
- Otro resultado útil es el teorema de la aplicación continua : si T n es consistente para θ y g (·) es una función de valor real continua en el punto θ , entonces g ( T n ) será consistente para g ( θ ): [ 4 ]
- El teorema de Slutsky se puede utilizar para combinar varios estimadores diferentes, o un estimador con una secuencia convergente no aleatoria. Si T n → d α , y S n → p β , entonces [ 5 ]
- Si el estimador T n viene dado por una fórmula explícita, entonces lo más probable es que la fórmula emplee sumas de variables aleatorias, y entonces se puede utilizar la ley de los grandes números : para una secuencia { X n } de variables aleatorias y bajo condiciones adecuadas,
- Si el estimador T n se define implícitamente, por ejemplo como un valor que maximiza cierta función objetivo (véase estimador extremo ), entonces debe utilizarse un argumento más complejo que involucre la equicontinuidad estocástica . [ 6 ]
Sesgo versus coherencia
Imparcial pero no coherente
Un estimador puede ser insesgado pero no consistente. Por ejemplo, para una muestra i.i.d. { x1 ,...,xn } uno puede usarTn (X) =xn como el estimador de la media E[X]. Nótese que aquí la distribución muestral deTn es lo mismo que la distribución subyacente (para cualquiern,ya que ignora todos los puntos excepto el último). Entonces E[Tn (X)] = E[X] para cualquiern,por lo tanto es insesgado, pero no converge a ningún valor.
Sin embargo, si una secuencia de estimadores es insesgada y converge a un valor, entonces es consistente, ya que debe converger al valor correcto.
Parcial pero coherente
Alternativamente, un estimador puede ser sesgado pero consistente. Por ejemplo, si la media se estima mediantees parcial, pero comoSe aproxima al valor correcto y, por lo tanto, es consistente.
Ejemplos importantes incluyen la varianza muestral y la desviación estándar muestral . Sin la corrección de Bessel (es decir, cuando se utiliza el tamaño de la muestra).en lugar de los grados de libertad), ambos son estimadores con sesgo negativo pero consistentes. Con la corrección, la varianza muestral corregida es insesgada, mientras que la desviación estándar muestral corregida sigue estando sesgada, pero en menor medida, y ambas siguen siendo consistentes: el factor de corrección converge a 1 a medida que aumenta el tamaño de la muestra.
Aquí hay otro ejemplo. Dejemosser una secuencia de estimadores para.
Podemos ver que,y el sesgo no converge a cero.
Véase también
- Estimador eficiente
- Consistencia de Fisher : concepto alternativo, aunque raramente utilizado, de consistencia para los estimadores.
- dilución de regresión
- Pruebas de hipótesis estadísticas
- Estimación mediante variables instrumentales
Notas
- ↑ Amemiya 1985 , Definición 3.4.2.
- ↑ Lehman y Casella 1998 , pág. 332.
- ↑ Amemiya 1985 , ecuación (3.2.5).
- ^ Amemiya 1985 , Teorema 3.2.6.
- ^ Amemiya 1985 , Teorema 3.2.7.
- ^ Newey y McFadden 1994 , Capítulo 2.
Referencias
- Amemiya, Takeshi (1985). Econometría avanzada . Harvard University Press . ISBN 0-674-00560-0.
- Lehmann, EL ; Casella, G. (1998). Teoría de la estimación puntual (2.ª ed.). Springer. ISBN 0-387-98502-6.
- Newey, WK; McFadden, D. (1994). «Capítulo 36: Estimación de muestras grandes y contraste de hipótesis». En Robert F. Engle; Daniel L. McFadden (eds.). Manual de econometría . Vol. 4. Elsevier Science. ISBN 0-444-88766-0. S2CID 29436457 .
- Nikulin, MS (2001) [1994], "Estimador consistente" , Enciclopedia de Matemáticas , EMS Press
- Sober, E. (1988), "Probabilidad y convergencia", Filosofía de la Ciencia , 55 (2): 228– 237, doi : 10.1086/289429.
Enlaces externos
- Clase de econometría (tema: imparcial vs. consistente) en YouTube por Mark Thoma
- Estimador
- Teoría asintótica (estadística)