Articulo de referencia

Empirical Bayes method

Empirical Bayes methods are procedures for statistical inference in which the prior probability distribution is estimated from the data. This approach stands in contrast to stan...

Empirical Bayes methods are procedures for statistical inference in which the prior probability distribution is estimated from the data. This approach stands in contrast to standard Bayesian methods, for which the prior distribution is fixed before any data are observed. Despite this difference in perspective, empirical Bayes may be viewed as an approximation to a fully Bayesian treatment of a hierarchical model wherein the parameters at the highest level of the hierarchy are set to their most likely values, instead of being integrated out.[1]

Introduction

Empirical Bayes methods can be seen as an approximation to a fully Bayesian treatment of a hierarchical Bayes model.

In, for example, a two-stage hierarchical Bayes model, observed data y={y1,y2,,yn}{\displaystyle y=\{y_{1},y_{2},\dots,y_{n}\}} are assumed to be generated from an unobserved set of parameters θ={θ1,θ2,,θn}{\displaystyle \theta =\{\theta _{1},\theta _{2},\dots ,\theta _{n}\}} according to a probability distribution p(yθ){\displaystyle p(y\mid \theta )\,}. In turn, the parameters θ{\displaystyle \theta } can be considered samples drawn from a population characterised by hyperparametersη{\displaystyle \eta \,} according to a probability distribution p(θη){\displaystyle p(\theta \mid \eta )\,}. In the hierarchical Bayes model, though not in the empirical Bayes approximation, the hyperparameters η{\displaystyle \eta \,} are considered to be drawn from an unparameterized distribution p(η){\displaystyle p(\eta )\,}.

Information about a particular quantity of interest θi{\displaystyle \theta _{i}\;} therefore comes not only from the properties of those data y{\displaystyle y} that directly depend on it, but also from the properties of the population of parameters θ{\displaystyle \theta \;} as a whole, inferred from the data as a whole, summarised by the hyperparameters η{\displaystyle \eta \;}.

Using Bayes' theorem,

p(θy)=p(yθ)p(θ)p(y)=p(yθ)p(y)p(θη)p(η)dη.{\displaystyle p(\theta \mid y)={\frac {p(y\mid \theta )p(\theta )}{p(y)}}={\frac {p(y\mid \theta )}{p(y)}}\int p(\theta \mid \eta )p(\eta )\,d\eta \,.}

In general, this integral will not be tractable analytically or symbolically and must be evaluated by numerical methods. Stochastic (random) or deterministic approximations may be used. Example stochastic methods are Markov Chain Monte Carlo and Monte Carlo sampling. Deterministic approximations are discussed in quadrature.

Alternatively, the expression can be written as

p(θy)=p(θη,y)p(ηy)dη=p(yθ)p(θη)p(yη)p(ηy)dη,{\displaystyle p(\theta \mid y)=\int p(\theta \mid \eta ,y)p(\eta \mid y)\;d\eta =\int {\frac {p(y\mid \theta )p(\theta \mid \eta )}{p(y\mid \eta )}}p(\eta \mid y)\;d\eta \,,}

and the final factor in the integral can in turn be expressed as

p(ηy)=p(ηθ)p(θy)dθ.{\displaystyle p(\eta \mid y)=\int p(\eta \mid \theta )p(\theta \mid y)\;d\theta .}

These suggest an iterative scheme, qualitatively similar in structure to a Gibbs sampler, to evolve successively improved approximations to p(θy){\displaystyle p(\theta \mid y)\;} and p(ηy){\displaystyle p(\eta \mid y)\;}. First, calculate an initial approximation to p(θy){\displaystyle p(\theta \mid y)\;} ignoring the η{\displaystyle \eta } dependence completely; then calculate an approximation to p(ηy){\displaystyle p(\eta \mid y)\;} based upon the initial approximate distribution of p(θy){\displaystyle p(\theta \mid y)\;}; then use this p(ηy){\displaystyle p(\eta \mid y)\;} to update the approximation for p(θy){\displaystyle p(\theta \mid y)\;}; then update p(ηy){\displaystyle p(\eta \mid y)\;}; and so on.

When the true distribution p(ηy){\displaystyle p(\eta \mid y)\;} is sharply peaked, the integral determining p(θy){\displaystyle p(\theta \mid y)\;} may be not much changed by replacing the probability distribution over η{\displaystyle \eta \;} with a point estimate η{\displaystyle \eta ^{*}\;} representing the distribution's peak (or, alternatively, its mean),

p(θy)p(yθ)p(θη)p(yη).{\displaystyle p(\theta \mid y)\simeq {\frac {p(y\mid \theta )\;p(\theta \mid \eta ^{*})}{p(y\mid \eta ^{*})}}\,.}

Con esta aproximación, el esquema iterativo anterior se convierte en el algoritmo EM .

El término "Bayes empírico" puede abarcar una amplia variedad de métodos, pero la mayoría pueden considerarse una versión truncada del esquema anterior o algo muy similar. Normalmente se utilizan estimaciones puntuales, en lugar de la distribución completa, para el/los parámetro(s).η{\displaystyle \eta \;}Las estimaciones paraη{\displaystyle \eta ^{*}\;}se suelen realizar a partir de la primera aproximación apag(θy){\displaystyle p(\theta \mid y)\;}sin refinamiento posterior. Estas estimaciones paraη{\displaystyle \eta ^{*}\;}Por lo general, se realizan sin considerar una distribución previa adecuada paraη{\displaystyle \eta }.

Estimación puntual

Método de Robbins: Bayes empírico no paramétrico (NPEB)

Robbins [ 2 ] consideró un caso de muestreo de una distribución mixta , donde la probabilidad para cadayi{\displaystyle y_{i}}(condicionado aθi{\displaystyle \theta _{i}}) se especifica mediante una distribución de Poisson ,

pag(yiθi)=θiyimiθiyi¡{\displaystyle p(y_{i}\mid \theta _{i})={{\theta _{i}}^{y_{i}}e^{-\theta _{i}} \over {y_{i}}!}}

mientras que la distribución a priori de θ no está especificada excepto que también es i.i.d. de una distribución desconocida, con función de distribución acumulativaGRAMO(θ){\displaystyle G(\theta )}El muestreo compuesto surge en una variedad de problemas de estimación estadística, como tasas de accidentes y ensayos clínicos. Simplemente buscamos una predicción puntual deθi{\displaystyle \theta _{i}}dados todos los datos observados. Debido a que la distribución a priori no está especificada, buscamos hacer esto sin conocimiento de G. [ 3 ]

Bajo la pérdida de error cuadrático (SEL), la esperanza condicional E( θ i  | Y i = y i ) es una cantidad razonable para usar en la predicción. Para el modelo de muestreo compuesto de Poisson, esta cantidad es   

mi(θiyi)=(θyi+1miθ/yi¡)dGRAMO(θ)(θyimiθ/yi¡)dGRAMO(θ).{\displaystyle \operatorname {E} (\theta _{i}\mid y_{i})={\int (\theta ^{y_{i}+1}e^{-\theta }/{y_{i}}!)\,dG(\theta ) \over {\int (\theta ^{y_{i}}e^{-\theta }/{y_{i}}!)\,dG(\theta })}.}

Esto se puede simplificar multiplicando tanto el numerador como el denominador por(yi+1){\displaystyle ({y_{i}}+1)}, produciendo

mi(θiyi)=(yi+1)pagGRAMO(yi+1)pagGRAMO(yi),{\displaystyle \operatorname {E} (\theta _{i}\mid y_{i})={{(y_{i}+1)p_{G}(y_{i}+1)} \over {p_{G}(y_{i})}},}

donde p G es la función de masa de probabilidad marginal obtenida al integrar θ sobre G.

Para aprovechar esto, Robbins [ 2 ] sugirió estimar los marginales con sus frecuencias empíricas (#{Yj}{\displaystyle \#\{Y_{j}\}}), lo que da como resultado la estimación totalmente no paramétrica:

mi(θiyi)(yi+1)#{Yj=yi+1}#{Yj=yi},{\displaystyle \operatorname {E} (\theta _{i}\mid y_{i})\approx (y_{i}+1){{\#\{Y_{j}=y_{i}+1\}} \over {\#\{Y_{j}=y_{i}\}}},}

dónde#{\displaystyle \#}denota "número de". (Véase también Estimación de frecuencia de Good-Turing ).

Ejemplo: Tasas de accidentes

Supongamos que cada cliente de una compañía de seguros tiene una "tasa de accidentes" Θ y está asegurado contra accidentes; la distribución de probabilidad de Θ es la distribución subyacente y es desconocida. El número de accidentes sufridos por cada cliente en un período de tiempo determinado sigue una distribución de Poisson con un valor esperado igual a la tasa de accidentes de ese cliente en particular. El número real de accidentes experimentados por un cliente es la cantidad observable. Una forma aproximada de estimar la distribución de probabilidad subyacente de la tasa de accidentes Θ es estimar la proporción de miembros de la población total que sufren 0, 1, 2, 3, ... accidentes durante el período de tiempo especificado como la proporción correspondiente en la muestra aleatoria observada. Una vez hecho esto, se desea predecir la tasa de accidentes de cada cliente en la muestra. Como se mencionó anteriormente, se puede utilizar el valor esperado condicional de la tasa de accidentes Θ dado el número observado de accidentes durante el período de referencia. Así, si un cliente sufre seis accidentes durante el período de referencia, su tasa estimada de accidentes es 7 × [la proporción de la muestra que sufrió 7 accidentes] / [la proporción de la muestra que sufrió 6 accidentes]. Cabe destacar que si la proporción de personas que sufren k accidentes es una función decreciente de k , la tasa de accidentes prevista para el cliente suele ser inferior al número de accidentes observados.

Este efecto de contracción es típico de los análisis bayesianos empíricos.

Gaussiana

Suponerincógnita,Y{\displaystyle X,Y}son variables aleatorias, de tal manera queY{\displaystyle Y}se observa, peroincógnita{\displaystyle X}está oculto. El problema es encontrar la expectativa deincógnita{\displaystyle X}, condicionado aY{\displaystyle Y}Supongamos además queY|incógnitanorte(incógnita,Σ){\displaystyle Y|X\sim {\mathcal {N}}(X,\Sigma )}, eso es,Y=incógnita+Z{\displaystyle Y=X+Z}, dóndeZ{\displaystyle Z}es una gaussiana multivariada con varianzaΣ{\displaystyle \Sigma }.

Entonces, tenemos la fórmulaΣyρ(y|incógnita)=ρ(y|incógnita)(incógnitay){\displaystyle \Sigma \nabla _{y}\rho (y|x)=\rho (y|x)(xy)}mediante cálculo directo con la función de densidad de probabilidad de gaussianas multivariadas. Integrando sobreρ(incógnita)dincógnita{\displaystyle \rho (x)dx}, obtenemosΣyρ(y)=(mi[incógnita|y]y)ρ(y)mi[incógnita|y]=y+Σylnρ(y){\displaystyle \Sigma \nabla _ {y}\rho (y)=(\mathbb {E} [x|y]-y)\rho (y)\implica \mathbb {E} [x|y]=y+\Sigma \nabla _ {y}\ln \rho (y)}En particular, esto significa que se puede realizar una estimación bayesiana deincógnita{\displaystyle X}sin acceso a la densidad previa deincógnita{\displaystyle X}o la densidad posterior deY{\displaystyle Y}. El único requisito es tener acceso a la función de puntuación deY{\displaystyle Y}Esto tiene aplicaciones en el modelado generativo basado en puntuaciones . [ 4 ]

Bayes empírico paramétrico

Si la función de verosimilitud y su distribución a priori adoptan formas paramétricas simples (como funciones de verosimilitud unidimensionales o bidimensionales con distribuciones a priori conjugadas simples ), entonces el problema bayesiano empírico consiste únicamente en estimar la distribución marginal.metro(yη){\displaystyle m(y\mid \eta )}y los hiperparámetrosη{\displaystyle \eta }utilizando el conjunto completo de mediciones empíricas. Por ejemplo, un enfoque común, llamado estimación puntual bayesiana empírica paramétrica, consiste en aproximar la marginal utilizando la estimación de máxima verosimilitud (MLE), o una expansión de momentos , lo que permite expresar los hiperparámetros.η{\displaystyle \eta }en términos de la media y la varianza empíricas. Esta marginal simplificada permite sustituir los promedios empíricos en una estimación puntual para la distribución a priori.θ{\displaystyle \theta }. La ecuación resultante para el anteriorθ{\displaystyle \theta }se simplifica enormemente, como se muestra a continuación.

Existen varios modelos bayesianos empíricos paramétricos comunes, entre los que se incluyen el modelo Poisson-gamma (véase más abajo), el modelo beta-binomial , el modelo gaussiano-gaussiano , el modelo multinomial de Dirichlet , así como modelos específicos para la regresión lineal bayesiana (véase más abajo) y la regresión lineal multivariante bayesiana . Entre los enfoques más avanzados se incluyen los modelos bayesianos jerárquicos y los modelos de mezcla bayesiana .

modelo gaussiano-gaussiano

Para ver un ejemplo de estimación bayesiana empírica utilizando un modelo gaussiano-gaussiano, consulte Estimadores bayesianos empíricos .

modelo de Poisson-gamma

Por ejemplo, en el ejemplo anterior, sea la probabilidad una distribución de Poisson y sea la distribución a priori especificada ahora por la distribución a priori conjugada , que es una distribución gamma (GRAMO(α,β){\displaystyle G(\alpha ,\beta )}) (dóndeη=(α,β){\displaystyle \eta =(\alpha,\beta)}):

ρ(θα,β)dθ=(θ/β)α1miθ/βΓ(α)(dθ/β) para θ>0,α>0,β>0.{\displaystyle \rho (\theta \mid \alpha ,\beta )\,d\theta ={\frac {(\theta /\beta )^{\alpha -1}\,e^{-\theta /\beta }}{\Gamma (\alpha )}}\,(d\theta /\beta ){\text{ para }}\theta >0,\alpha >0,\beta >0\,\!.}

Es sencillo demostrar que la distribución posterior también es una distribución gamma. Escriba

ρ(θy)ρ(yθ)ρ(θα,β),{\displaystyle \rho (\theta \mid y)\propto \rho (y\mid \theta )\rho (\theta \mid \alpha ,\beta ),}

donde se ha omitido la distribución marginal ya que no depende explícitamente deθ{\displaystyle \theta }. Ampliar los términos que dependen deθ{\displaystyle \theta }da como resultado la distribución posterior:

ρ(θy)(θymiθ)(θα1miθ/β)=θy+α1miθ(1+1/β).{\displaystyle \rho (\theta \mid y)\propto (\theta ^{y}\,e^{-\theta })(\theta ^{\alpha -1}\,e^{-\theta /\beta })=\theta ^{y+\alpha -1}\,e^{-\theta (1+1/\beta )}.}

Por lo tanto, la densidad posterior también es una distribución gamma.GRAMO(α,β){\displaystyle G(\alpha ',\beta ')}, dóndeα=y+α{\displaystyle \alpha '=y+\alpha }, yβ=(1+1/β)1{\displaystyle \beta '=(1+1/\beta )^{-1}}. Nótese también que la marginal es simplemente la integral de la posterior sobre todas lasΘ{\displaystyle \Theta }, que resulta ser una distribución binomial negativa .

Para aplicar el método bayesiano empírico, aproximaremos la distribución marginal utilizando la estimación de máxima verosimilitud (EMV). Pero dado que la distribución posterior es una distribución gamma, la EMV de la distribución marginal resulta ser simplemente la media de la distribución posterior, que es la estimación puntual.mi(θy){\displaystyle \operatorname {E} (\theta \mid y)}lo necesitamos. Recordando que la mediaμ{\displaystyle \mu }de una distribución gammaGRAMO(α,β){\displaystyle G(\alpha ',\beta ')}es simplementeαβ{\displaystyle \alpha '\beta '}, tenemos

mi(θy)=αβ=y¯+α1+1/β=β1+βy¯+11+β(αβ).{\displaystyle \operatorname {E} (\theta \mid y)=\alpha '\beta '={\frac {{\bar {y}}+\alpha }{1+1/\beta }}={\frac {\beta }{1+\beta }}{\bar {y}}+{\frac {1}{1+\beta }}(\alpha \beta ).}

Para obtener los valores deα{\displaystyle \alpha }yβ{\displaystyle \beta }, el método bayesiano empírico prescribe la estimación de la mediaαβ{\displaystyle \alpha \beta }y varianzaαβ2{\displaystyle \alpha \beta ^{2}}utilizando el conjunto completo de datos empíricos.

La estimación puntual resultantemi(θy){\displaystyle \operatorname {E} (\theta \mid y)}es, por lo tanto, como un promedio ponderado de la media de la muestra.y¯{\displaystyle {\bar {y}}}y la media previaμ=αβ{\displaystyle \mu =\alpha \beta }Esto resulta ser una característica general del método bayesiano empírico; las estimaciones puntuales para la distribución a priori (es decir, la media) se verán como promedios ponderados de la estimación de la muestra y la estimación a priori (lo mismo ocurre con las estimaciones de la varianza).

Véase también

Referencias

  1. Carlin, Bradley P.; Louis, Thomas A. (2002). «Bayes empírico: pasado, presente y futuro». En Raftery, Adrian E.; Tanner, Martin A.; Wells, Martin T. (eds.). Estadística en el siglo XXI . Chapman & Hall. pp. 312–318 . ISBN  1-58488-272-7.
  2. 1 2 Robbins, Herbert (1956). "Un enfoque bayesiano empírico para la estadística" . Avances en estadística . Serie Springer en estadística. págs. 157–163 . doi : 10.1007/978-1-4612-0919-5_26 . ISBN  978-0-387-94037-3. SR 0084919 . {{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda )
  3. Carlin, Bradley P.; Louis, Thomas A. (2000). Métodos bayesianos y bayesianos empíricos para el análisis de datos (2.ª ed.). Chapman & Hall/CRC. págs. Sec. 3.2 y Apéndice B. ISBN   978-1-58488-170-4.
  4. ^ Saremi, Saeed; Hyvärinen, Aapo (2019). "Bayes neuronales empíricos" . Revista de investigación sobre aprendizaje automático . 20 (181): 1– 23. ISSN 1533-7928 . 

Lecturas adicionales

  • Peter E. Rossi; Greg M. Allenby; Rob McCulloch (14 de mayo de 2012). Estadística bayesiana y marketing . John Wiley & Sons. ISBN 978-0-470-86368-8.
  • Casella, George (mayo de 1985). "Una introducción al análisis de datos bayesiano empírico" ( PDF) . American Statistician . 39 (2): 83– 87. doi : 10.2307/2682801 . hdl : 1813/32886 . JSTOR 2682801. MR 0789118 .  
  • Nikulin, Mikhail (1987). "Las condiciones de regularidad de Bernstein en un problema del enfoque bayesiano empírico" . Journal of Soviet Mathematics . 36 (5): 596– 600. doi : 10.1007/BF01093293 . S2CID 122405908 . 
  • Uso del método bayesiano empírico para estimar la seguridad vial (Norteamérica)
  • Métodos bayesianos empíricos para el análisis de datos faltantes
  • Utilización de la distribución beta-binomial para evaluar el rendimiento de un dispositivo de identificación biométrica.
  • Clasificadores bayesianos ingenuos jerárquicos (para variables continuas y discretas ).