Articulo de referencia

Teoría de la estimación

La teoría de la estimación es una rama de la estadística que se ocupa de estimar los valores de los parámetros a partir de datos empíricos medidos que tienen un componente aleat...

La teoría de la estimación es una rama de la estadística que se ocupa de estimar los valores de los parámetros a partir de datos empíricos medidos que tienen un componente aleatorio. Los parámetros describen un entorno físico subyacente de tal manera que su valor afecta la distribución de los datos medidos. Un estimador intenta aproximar los parámetros desconocidos utilizando las mediciones. En la teoría de la estimación, generalmente se consideran dos enfoques: [ 1 ]

  • El enfoque probabilístico (descrito en este artículo) supone que los datos medidos son aleatorios con una distribución de probabilidad que depende de los parámetros de interés.
  • El enfoque de pertenencia a conjuntos supone que el vector de datos medidos pertenece a un conjunto que depende del vector de parámetros.

Ejemplos

Por ejemplo, se desea estimar la proporción de votantes que votarán por un candidato en particular. Dicha proporción es el parámetro buscado; la estimación se basa en una pequeña muestra aleatoria de votantes. Alternativamente, se desea estimar la probabilidad de que un votante vote por un candidato en particular, basándose en algunas características demográficas, como la edad.

Por ejemplo, en el radar , el objetivo es determinar la distancia de los objetos (aviones, barcos, etc.) analizando el tiempo de tránsito bidireccional de los ecos recibidos de los pulsos transmitidos. Dado que los pulsos reflejados están inevitablemente inmersos en ruido eléctrico, sus valores medidos se distribuyen aleatoriamente, por lo que es necesario estimar el tiempo de tránsito.

Como otro ejemplo, en la teoría de la comunicación eléctrica, las mediciones que contienen información sobre los parámetros de interés suelen estar asociadas a una señal ruidosa .

Lo esencial

Para un modelo dado, se necesitan varios "ingredientes" estadísticos para que el estimador pueda implementarse. El primero es una muestra estadística : un conjunto de puntos de datos tomados de un vector aleatorio (VR) de tamaño N. Colocado en un vector , incógnita=[incógnita[0]incógnita[1]incógnita[norte1]].{\displaystyle \mathbf {x} ={\begin{bmatrix}x[0]\\x[1]\\\vdots \\x[N-1]\end{bmatrix}}.} En segundo lugar, hay M parámetros θ=[θ1θ2θMETRO],{\displaystyle {\boldsymbol {\theta }}={\begin{bmatrix}\theta _{1}\\\theta _{2}\\\vdots \\\theta _{M}\end{bmatrix}},} cuyos valores deben estimarse. En tercer lugar, la función de densidad de probabilidad continua (pdf) o su contraparte discreta, la función de masa de probabilidad (pmf), de la distribución subyacente que generó los datos debe expresarse en función de los valores de los parámetros: pag(incógnita|θ).{\displaystyle p(\mathbf {x} |{\boldsymbol {\theta }}).\,} También es posible que los propios parámetros tengan una distribución de probabilidad (por ejemplo, estadística bayesiana ). En ese caso, es necesario definir la probabilidad bayesiana.π(θ).{\displaystyle \pi ({\boldsymbol {\theta }}).\,} Una vez formado el modelo, el objetivo es estimar los parámetros, cuyas estimaciones se suelen denotarθ^{\displaystyle {\hat {\boldsymbol {\theta }}}}donde el "sombrero" indica la estimación.

Un estimador común es el estimador de mínimo error cuadrático medio (MMSE), que utiliza el error entre los parámetros estimados y el valor real de los parámetros. mi=θ^θ{\displaystyle \mathbf {e} ={\hat {\boldsymbol {\theta }}}-{\boldsymbol {\theta }}} como base para la optimalidad. Este término de error se eleva al cuadrado y se minimiza el valor esperado de este valor al cuadrado para el estimador MMSE.

Estimadores

Entre los estimadores (métodos de estimación) de uso común y los temas relacionados con ellos se incluyen:

Ejemplos

Constante desconocida en el ruido gaussiano blanco aditivo

Consideremos una señal discreta recibida ,incógnita[norte]{\displaystyle x[n]}, denorte{\displaystyle N}muestras independientes que consisten en una constante desconocidaA{\displaystyle A}con ruido gaussiano blanco aditivo (AWGN)w[norte]{\displaystyle w[n]}con media cero y varianza conocidaσ2{\displaystyle \sigma ^{2}}( es decir ,norte(0,σ2){\displaystyle {\mathcal {N}}(0,\sigma ^{2})}). Dado que se conoce la varianza, el único parámetro desconocido esA{\displaystyle A}.

El modelo para la señal es entonces incógnita[norte]=A+w[norte]norte=0,1,,norte1{\displaystyle x[n]=A+w[n]\quad n=0,1,\dots ,N-1}

Dos posibles (de muchos) estimadores para el parámetroA{\displaystyle A}son:

  • A^1=incógnita[0]{\displaystyle {\hat {A}}_{1}=x[0]}
  • A^2=1nortenorte=0norte1incógnita[norte]{\displaystyle {\hat {A}}_{2}={\frac {1}{N}}\sum _{n=0}^{N-1}x[n]}que es la media de la muestra

Ambos estimadores tienen una media deA{\displaystyle A}, lo cual se puede demostrar tomando el valor esperado de cada estimador mi[A^1]=mi[incógnita[0]]=A{\displaystyle \mathrm {E} \left[{\hat {A}}_{1}\right]=\mathrm {E} \left[x[0]\right]=A} y mi[A^2]=mi[1nortenorte=0norte1incógnita[norte]]=1norte[norte=0norte1mi[incógnita[norte]]]=1norte[norteA]=A{\displaystyle \mathrm {E} \left[{\hat {A}}_{2}\right]=\mathrm {E} \left[{\frac {1}{N}}\sum _{n=0}^{N-1}x[n]\right]={\frac {1}{N}}\left[\sum _{n=0}^{N-1}\mathrm {E} \left[x[n]\right]\right]={\frac {1}{N}}\left[NA\right]=A}

En este punto, ambos estimadores parecerían tener el mismo rendimiento. Sin embargo, la diferencia entre ellos se hace evidente al comparar las varianzas. var(A^1)=var(incógnita[0])=σ2{\displaystyle \mathrm {var} \left({\hat {A}}_{1}\right)=\mathrm {var} \left(x[0]\right)=\sigma ^{2}} y var(A^2)=var(1nortenorte=0norte1incógnita[norte])=independencia1norte2[norte=0norte1var(incógnita[norte])]=1norte2[norteσ2]=σ2norte{\displaystyle \mathrm {var} \left({\hat {A}}_{2}\right)=\mathrm {var} \left({\frac {1}{N}}\sum _{n=0}^{N-1}x[n]\right){\overset {\text{independence}}{=}}{\frac {1}{N^{2}}}\left[\sum _{n=0}^{N-1}\mathrm {var} (x[n])\right]={\frac {1}{N^{2}}}\left[N\sigma ^{2}\right]={\frac {\sigma ^{2}}{N}}}

Parecería que la media muestral es un mejor estimador ya que su varianza es menor para cada N > 1.   

Máxima probabilidad

Continuando con el ejemplo utilizando el estimador de máxima verosimilitud , la función de densidad de probabilidad (pdf) del ruido para una muestraw[norte]{\displaystyle w[n]}es pag(w[norte])=1σ2πexp(12σ2w[norte]2){\displaystyle p(w[n])={\frac {1}{\sigma {\sqrt {2\pi }}}}\exp \left(-{\frac {1}{2\sigma ^{2}}}w[n]^{2}\right)} y la probabilidad deincógnita[norte]{\displaystyle x[n]}se convierte (incógnita[norte]{\displaystyle x[n]}puede pensarse en unnorte(A,σ2){\displaystyle {\mathcal {N}}(A,\sigma ^{2})}) pag(incógnita[norte];A)=1σ2πexp(12σ2(incógnita[norte]A)2){\displaystyle p(x[n];A)={\frac {1}{\sigma {\sqrt {2\pi }}}}\exp \left(-{\frac {1}{2\sigma ^{2}}}(x[n]-A)^{2}\right)} Por independencia , la probabilidad deincógnita{\displaystyle \mathbf {x} }se convierte pag(incógnita;A)=norte=0norte1pag(incógnita[norte];A)=1(σ2π)norteexp(12σ2norte=0norte1(incógnita[norte]A)2){\displaystyle p(\mathbf {x} ;A)=\prod _{n=0}^{N-1}p(x[n];A)={\frac {1}{\left(\sigma {\sqrt {2\pi }}\right)^{N}}}\exp \left(-{\frac {1}{2\sigma ^{2}}}\sum _{n=0}^{N-1}(x[n]-A)^{2}\right)} Tomando el logaritmo natural de la función de densidad de probabilidad lnpag(incógnita;A)=norteln(σ2π)12σ2norte=0norte1(incógnita[norte]A)2{\displaystyle \ln p(\mathbf {x} ;A)=-N\ln \left(\sigma {\sqrt {2\pi }}\right)-{\frac {1}{2\sigma ^{2}}}\sum _{n=0}^{N-1}(x[n]-A)^{2}} y el estimador de máxima verosimilitud es A^=argmáximolnpag(incógnita;A){\displaystyle {\hat {A}}=\arg \max \ln p(\mathbf {x} ;A)}

Tomando la primera derivada de la función de log-verosimilitud Alnpag(incógnita;A)=1σ2[norte=0norte1(incógnita[norte]A)]=1σ2[norte=0norte1incógnita[norte]norteA]{\displaystyle {\frac {\partial }{\partial A}}\ln p(\mathbf {x} ;A)={\frac {1}{\sigma ^{2}}}\left[\sum _{n=0}^{N-1}(x[n]-A)\right]={\frac {1}{\sigma ^{2}}}\left[\sum _{n=0}^{N-1}x[n]-NA\right]} y poniéndolo a cero 0=1σ2[norte=0norte1incógnita[norte]norteA]=norte=0norte1incógnita[norte]norteA{\displaystyle 0={\frac {1}{\sigma ^{2}}}\left[\sum _{n=0}^{N-1}x[n]-NA\right]=\sum _{n=0}^{N-1}x[n]-NA}

Esto da como resultado el estimador de máxima verosimilitud. A^=1nortenorte=0norte1incógnita[norte]{\displaystyle {\hat {A}}={\frac {1}{N}}\sum _{n=0}^{N-1}x[n]} que es simplemente la media muestral. A partir de este ejemplo, se encontró que la media muestral es el estimador de máxima verosimilitud paranorte{\displaystyle N}muestras de un parámetro fijo y desconocido corrompidas por ruido blanco gaussiano aditivo (AWGN).

Límite inferior de Cramér-Rao

Para hallar la cota inferior de Cramér-Rao (CRLB) del estimador de la media muestral, primero es necesario hallar el número de información de Fisher.I(A)=mi([Alnpag(incógnita;A)]2)=mi[2A2lnpag(incógnita;A)]{\displaystyle {\mathcal {I}}(A)=\mathrm {E} \left(\left[{\frac {\partial }{\partial A}}\ln p(\mathbf {x} ;A)\right]^{2}\right)=-\mathrm {E} \left[{\frac {\partial ^{2}}{\partial A^{2}}}\ln p(\mathbf {x} ;A)\right]} y copiando de arriba Alnpag(incógnita;A)=1σ2[norte=0norte1incógnita[norte]norteA]{\displaystyle {\frac {\partial }{\partial A}}\ln p(\mathbf {x} ;A)={\frac {1}{\sigma ^{2}}}\left[\sum _{n=0}^{N-1}x[n]-NA\right]}

Tomando la segunda derivada 2A2lnpag(incógnita;A)=1σ2(norte)=norteσ2{\displaystyle {\frac {\partial ^{2}}{\partial A^{2}}}\ln p(\mathbf {x} ;A)={\frac {1}{\sigma ^{2}}}(-N)={\frac {-N}{\sigma ^{2}}}} y hallar el valor esperado negativo es trivial ya que ahora es una constante determinista. mi[2A2lnpag(incógnita;A)]=norteσ2{\displaystyle -\mathrm {E} \left[{\frac {\partial ^{2}}{\partial A^{2}}}\ln p(\mathbf {x} ;A)\right]={\frac {N}{\sigma ^{2}}}}

Finalmente, colocando la información de Fisher en var(A^)1I{\displaystyle \mathrm {var} \left({\hat {A}}\right)\geq {\frac {1}{\mathcal {I}}}} resultados en var(A^)σ2norte{\displaystyle \mathrm {var} \left({\hat {A}}\right)\geq {\frac {\sigma ^{2}}{N}}}

Al comparar esto con la varianza de la media muestral (determinada previamente) se observa que la media muestral es igual al límite inferior de Cramér-Rao para todos los valores denorte{\displaystyle N}yA{\displaystyle A}En otras palabras, la media muestral es el estimador eficiente (necesariamente único) y, por lo tanto, también el estimador insesgado de mínima varianza (MVUE), además de ser el estimador de máxima verosimilitud .

Máximo de una distribución uniforme

Uno de los ejemplos más sencillos pero complejos de estimación es la estimación del máximo de una distribución uniforme. Se utiliza como ejercicio práctico en clase y para ilustrar los principios básicos de la teoría de la estimación. Además, en el caso de la estimación basada en una sola muestra, demuestra cuestiones filosóficas y posibles malentendidos en el uso de estimadores de máxima verosimilitud y funciones de verosimilitud .

Dada una distribución uniforme discreta1,2,,norte{\displaystyle 1,2,\dots ,N}Con un máximo desconocido, el estimador UMVU para el máximo viene dado por k+1kmetro1=metro+metrok1{\displaystyle {\frac {k+1}{k}}m-1=m+{\frac {m}{k}}-1} donde m es el máximo de la muestra y k es el tamaño de la muestra , muestreando sin reemplazo. [ 2 ] [ 3 ] Este problema se conoce comúnmente como el problema del tanque alemán , debido a la aplicación de la estimación máxima a las estimaciones de la producción de tanques alemanes durante la Segunda Guerra Mundial .

La fórmula puede entenderse intuitivamente como:

"El valor máximo de la muestra más la diferencia promedio entre las observaciones de la muestra",

La brecha se añade para compensar el sesgo negativo del máximo de la muestra como estimador del máximo de la población. [ nota 1 ]

Esto tiene una varianza de [ 2 ]1k(nortek)(norte+1)(k+2)norte2k2 para muestras pequeñas knorte{\displaystyle {\frac {1}{k}}{\frac {(N-k)(N+1)}{(k+2)}}\approx {\frac {N^{2}}{k^{2}}}{\text{ for small samples }}k\ll N} por lo que una desviación estándar de aproximadamentenorte/k{\displaystyle N/k}, el tamaño promedio (poblacional) de una brecha entre muestras; compararmetrok{\displaystyle {\frac {m}{k}}}arriba. Esto puede verse como un caso muy simple de estimación de espaciamiento máximo .

El máximo de la muestra es el estimador de máxima verosimilitud para el máximo de la población, pero, como se mencionó anteriormente, está sesgado.

Aplicaciones

Numerosos campos requieren el uso de la teoría de la estimación. Algunos de estos campos incluyen:

Es probable que los datos medidos estén sujetos a ruido o incertidumbre, y es a través de la probabilidad estadística que se buscan soluciones óptimas para extraer la mayor cantidad de información posible de los datos.

Véase también

Notas

  1. El máximo de la muestra nunca es mayor que el máximo de la población, pero puede ser menor, por lo tanto es un estimador sesgado : tenderá a subestimar el máximo de la población.

Referencias

Citas

  1. Walter, E.; Pronzato, L. (1997). Identificación de modelos paramétricos a partir de datos experimentales . Londres, Inglaterra: Springer-Verlag.
  2. 1 2 Johnson, Roger (1994), "Estimating the Size of a Population", Teaching Statistics , 16 (2 (Verano)): 50– 52, doi : 10.1111/j.1467-9639.1994.tb00688.x
  3. Johnson, Roger (2006), "Estimating the Size of a Population" , Getting the Best from Teaching Statistics , archivado del original el 20 de noviembre de 2008.

Fuentes

  • EL Lehmann y G. Casella (1998). Teoría de la estimación puntual . Springer. ISBN 0387985026.
  • Dale Shermon (2009). Ingeniería de costos de sistemas . Gower Publishing. ISBN 978-0-566-08861-2.
  • John Rice (1995). Estadística matemática y análisis de datos . Duxbury Press. ISBN 0-534-209343.
  • Steven M. Kay (1993). Fundamentos del procesamiento estadístico de señales: Teoría de la estimación . PTR Prentice-Hall. ISBN 0-13-345711-7.
  • H. Vincent Poor (1998). Introducción a la detección y estimación de señales . Springer. ISBN 0-387-94173-8.
  • Harry L. Van Trees (2001). Detección, estimación y teoría de la modulación, parte 1. Wiley. ISBN 0-471-09517-6Archivado del original el 28 de abril de 2005.
  • Dan Simon (2006). Estimación óptima del estado: Kalman, H-infinito y enfoques no lineales . Wiley. Archivado del original el 30 de diciembre de 2010.
  • Ali H. Sayed (2003). Fundamentos del filtrado adaptativo . NJ: Wiley. ISBN 0-471-46126-1.
  • Yaakov Bar-Shalom ; X. Rong Li; Thiagalingam Kirubarajan (2004). Estimación con aplicaciones al seguimiento y la navegación: teoría, algoritmos y software . Wiley.
  • Logotipo de Wikimedia CommonsContenido multimedia relacionado con la teoría de la estimación en Wikimedia Commons.