Articulo de referencia

Modelado jerárquico bayesiano

El modelado jerárquico bayesiano es un modelo estadístico escrito en múltiples niveles (forma jerárquica) que estima la distribución posterior de los parámetros del modelo media...

El modelado jerárquico bayesiano es un modelo estadístico escrito en múltiples niveles (forma jerárquica) que estima la distribución posterior de los parámetros del modelo mediante el método bayesiano . [ 1 ] Los submodelos se combinan para formar el modelo jerárquico, y el teorema de Bayes se utiliza para integrarlos con los datos observados y tener en cuenta toda la incertidumbre presente. Esta integración permite calcular la distribución posterior actualizada sobre los (hiper)parámetros, actualizando así las creencias previas a la luz de los datos observados.

La estadística frecuentista puede arrojar conclusiones aparentemente incompatibles con las ofrecidas por la estadística bayesiana debido al tratamiento bayesiano de los parámetros como variables aleatorias y su uso de información subjetiva para establecer supuestos sobre estos parámetros. [ 2 ] Dado que los enfoques responden a preguntas diferentes, los resultados formales no son técnicamente contradictorios, pero ambos enfoques discrepan sobre qué respuesta es relevante para aplicaciones particulares. Los bayesianos argumentan que la información relevante sobre la toma de decisiones y la actualización de creencias no puede ignorarse y que el modelado jerárquico tiene el potencial de superar los métodos clásicos en aplicaciones donde los encuestados proporcionan múltiples datos de observación. Además, el modelo ha demostrado ser robusto , con la distribución posterior menos sensible a las distribuciones previas jerárquicas más flexibles.

El modelado jerárquico, como su nombre lo indica, conserva una estructura de datos anidada y se utiliza cuando la información está disponible en varios niveles diferentes de unidades de observación. Por ejemplo, en el modelado epidemiológico para describir las trayectorias de infección en varios países, las unidades de observación son los países, y cada país tiene su propio perfil temporal de casos diarios infectados. [ 3 ] En el análisis de curvas de declive para describir la curva de declive de la producción de petróleo o gas en múltiples pozos, las unidades de observación son los pozos de petróleo o gas en una región de yacimiento, y cada pozo tiene su propio perfil temporal de tasas de producción de petróleo o gas (generalmente, barriles por mes). [ 4 ] El modelado jerárquico se utiliza para diseñar estrategias basadas en cálculos para problemas multiparamétricos. [ 5 ]

Filosofía

Los métodos y modelos estadísticos suelen involucrar múltiples parámetros que pueden considerarse relacionados o conectados de tal manera que el problema implica una dependencia del modelo de probabilidad conjunta para estos parámetros. [ 6 ] Los grados individuales de creencia, expresados ​​en forma de probabilidades, conllevan incertidumbre. [ 7 ] En medio de esto está el cambio de los grados de creencia a lo largo del tiempo. Como afirmaron el profesor José M. Bernardo y el profesor Adrian F. Smith , "La realidad del proceso de aprendizaje consiste en la evolución de las creencias individuales y subjetivas sobre la realidad". Estas probabilidades subjetivas están más directamente involucradas en la mente que las probabilidades físicas. [ 7 ] Por lo tanto, es con esta necesidad de actualizar las creencias que los bayesianos han formulado un modelo estadístico alternativo que toma en cuenta la ocurrencia previa de un evento particular. [ 8 ]

Teorema de Bayes

La supuesta ocurrencia de un evento del mundo real generalmente modificará las preferencias entre ciertas opciones. Esto se logra modificando el grado de creencia que un individuo asocia a los eventos que definen las opciones. [ 9 ]

Supongamos que en un estudio sobre la efectividad de los tratamientos cardíacos, los pacientes del hospital j tienen una probabilidad de supervivenciaθj{\displaystyle \theta _{j}}, la probabilidad de supervivencia se actualizará con la ocurrencia de y , el evento en el que se crea un suero controvertido que, según algunos, aumenta la supervivencia en pacientes cardíacos.

Para hacer afirmaciones de probabilidad actualizadas sobreθj{\displaystyle \theta _{j}}, dada la ocurrencia del evento y , debemos comenzar con un modelo que proporcione una distribución de probabilidad conjunta paraθj{\displaystyle \theta _{j}}y y . Esto se puede escribir como un producto de las dos distribuciones que a menudo se denominan distribución a priori.PAG(θ){\displaystyle P(\theta )}y la distribución del muestreoPAG(yθ){\displaystyle P(y\mid \theta )}respectivamente:

PAG(θ,y)=PAG(θ)PAG(yθ){\displaystyle P(\theta ,y)=P(\theta )P(y\mid \theta )}

Utilizando la propiedad básica de la probabilidad condicional , la distribución posterior dará como resultado:

PAG(θy)=PAG(θ,y)PAG(y)=PAG(yθ)PAG(θ)PAG(y){\displaystyle P(\theta \mid y)={\frac {P(\theta ,y)}{P(y)}}={\frac {P(y\mid \theta )P(\theta )}{P(y)}}}

Esta ecuación, que muestra la relación entre la probabilidad condicional y los eventos individuales, se conoce como el teorema de Bayes. Esta expresión simple encapsula el núcleo técnico de la inferencia bayesiana que tiene como objetivo deconstruir la probabilidad,PAG(θy){\displaystyle P(\theta \mid y)}, en relación con los subconjuntos resolubles de su evidencia de apoyo. [ 9 ]

Intercambiabilidad

El punto de partida habitual de un análisis estadístico es la suposición de que los valores ny1,y2,,ynorte{\displaystyle y_{1},y_{2},\ldots,y_{n}}son intercambiables. Si no hay información, aparte de los datos y , disponible para distinguir alguno de losθj{\displaystyle \theta _{j}}Dado que no se puede ordenar ni agrupar ningún parámetro, se debe asumir la simetría de los parámetros de la distribución previa. [ 10 ] Esta simetría se representa probabilísticamente mediante la intercambiabilidad. Generalmente, es útil y apropiado modelar los datos de una distribución intercambiable como independientes e idénticamente distribuidos , dado algún vector de parámetros desconocido .θ{\displaystyle \theta }, con distribuciónPAG(θ){\displaystyle P(\theta )}.

Intercambiabilidad finita

Para un número fijo n , el conjuntoy1,y2,,ynorte{\displaystyle y_{1},y_{2},\ldots,y_{n}} es intercambiable si la probabilidad conjuntaPAG(y1,y2,,ynorte){\displaystyle P(y_{1},y_{2},\ldots,y_{n})}es invariante bajo permutaciones de los índices. Es decir, para cada permutaciónπ{\displaystyle \pi }o(π1,π2,,πnorte){\displaystyle (\pi _{1},\pi _{2},\ldots ,\pi _{n})} de (1, 2, …, n ),PAG(y1,y2,,ynorte)=PAG(yπ1,yπ2,,yπnorte).{\displaystyle P(y_{1},y_{2},\ldots ,y_{n})=P(y_{\pi _{1}},y_{\pi _{2}},\ldots ,y_{\pi _{n}}).}[ 11 ]

El siguiente es un ejemplo intercambiable, pero no independiente e idéntico (iid): Considere una urna con una bola roja y una bola azul en su interior, con probabilidad12{\displaystyle {\frac {1}{2}}}de sacar cualquiera de las dos. Las bolas se sacan sin reemplazo, es decir, después de que se saca una bola de lanorte{\displaystyle n}bolas, habránorte1{\displaystyle n-1}Bolas restantes para el próximo sorteo.

Dejar Yi={1,si el iLa pelota es roja,0,de lo contrario.{\displaystyle {\text{Sea }}Y_{i}={\begin{cases}1,&{\text{si la }}i{\text{bola} es roja}},\\0,&{\text{en otro caso}}.\end{cases}}}

La probabilidad de seleccionar una bola roja en el primer sorteo y una bola azul en el segundo es igual a la probabilidad de seleccionar una bola azul en el primer sorteo y una roja en el segundo, ambas iguales a 1/2:

PAG(y1=1,y2=0)=PAG(y1=0,y2=1)=12{\displaystyle P(y_{1}=1,y_{2}=0)=P(y_{1}=0,y_{2}=1)={\frac {1}{2}}}.

Esto hace quey1{\displaystyle y_{1}}yy2{\displaystyle y_{2}}cambiable.

Pero la probabilidad de seleccionar una bola roja en el segundo sorteo, dado que la bola roja ya fue seleccionada en el primero, es 0. Esto no es igual a la probabilidad de que la bola roja sea seleccionada en el segundo sorteo, que es 1/2:

PAG(y2=1y1=1)=0PAG(y2=1)=12{\displaystyle P(y_{2}=1\mid y_{1}=1)=0\neq P(y_{2}=1)={\frac {1}{2}}}.

De este modo,y1{\displaystyle y_{1}}yy2{\displaystyle y_{2}}no son independientes.

Siincógnita1,,incógnitanorte{\displaystyle x_{1},\ldots ,x_{n}}Si son independientes e idénticamente distribuidas, entonces son intercambiables, pero lo contrario no es necesariamente cierto. [ 12 ]

Intercambiabilidad infinita

La intercambiabilidad infinita es la propiedad de que todo subconjunto finito de una secuencia infinitay1{\displaystyle y_{1}},y2,{\displaystyle y_{2},\ldots }es intercambiable. Para cualquier n , la secuenciay1,y2,,ynorte{\displaystyle y_{1},y_{2},\ldots,y_{n}}es intercambiable. [ 12 ]

Modelos jerárquicos

Componentes

El modelado jerárquico bayesiano utiliza dos conceptos importantes para derivar la distribución posterior, [ 1 ] a saber:

  1. Hiperparámetros : parámetros de la distribución a priori
  2. Hiperpriores : distribuciones de hiperparámetros

Supongamos que una variable aleatoria Y sigue una distribución normal con parámetroθ{\displaystyle \theta }como la media y 1 como la varianza , es decirYθnorte(θ,1){\displaystyle Y\mid \theta \sim N(\theta ,1)}La relación de la tilde{\displaystyle \sim }puede leerse como "tiene la distribución de" o "se distribuye como". Supongamos también que el parámetroθ{\displaystyle \theta }tiene una distribución dada por una distribución normal con mediaμ{\displaystyle \mu }y varianza 1, es decirθμnorte(μ,1){\displaystyle \theta \mid \mu \sim N(\mu,1)}. Además,μ{\displaystyle \mu }sigue otra distribución dada, por ejemplo, por la distribución normal estándar ,norte(0,1){\displaystyle {\text{N}}(0,1)}. El parámetroμ{\displaystyle \mu }se denomina hiperparámetro, mientras que su distribución viene dada pornorte(0,1){\displaystyle {\text{N}}(0,1)}es un ejemplo de una distribución hiperprior. La notación de la distribución de Y cambia a medida que se agrega otro parámetro, es decirYθ,μnorte(θ,1){\displaystyle Y\mid \theta ,\mu \sim N(\theta ,1)}. Si hay otra etapa, por ejemplo,μ{\displaystyle \mu }siguiendo otra distribución normal con una media deβ{\displaystyle \beta }y una variación deϵ{\displaystyle \epsilon }, entoncesμnorte(β,ϵ){\displaystyle \mu \sim N(\beta,\epsilon)}, {\displaystyle {\mbox{ }}}β{\displaystyle \beta }yϵ{\displaystyle \epsilon }También se les puede llamar hiperparámetros con distribuciones hiperprior. [ 6 ]

Estructura

Dejaryj{\displaystyle y_{j}}ser una observación yθj{\displaystyle \theta _{j}}un parámetro que rige el proceso de generación de datos parayj{\displaystyle y_{j}}Supongamos además que los parámetrosθ1,θ2,,θj{\displaystyle \theta _{1},\theta _{2},\ldots ,\theta _{j}}se generan de forma intercambiable a partir de una población común, con una distribución regida por un hiperparámetroϕ{\displaystyle \phi }El modelo jerárquico bayesiano consta de las siguientes etapas :

Etapa I: yjθj,ϕPAG(yjθj,ϕ){\displaystyle {\text{Etapa I: }}y_{j}\mid \theta _{j},\phi \sim P(y_{j}\mid \theta _{j},\phi )}
Etapa II: θjϕPAG(θjϕ){\displaystyle {\text{Etapa II: }}\theta _{j}\mid \phi \sim P(\theta _{j}\mid \phi )}
Etapa III: ϕPAG(ϕ){\displaystyle {\text{Etapa III: }}\phi \sim P(\phi )}

La probabilidad, como se observa en la etapa I esPAG(yjθj,ϕ){\displaystyle P(y_{j}\mid \theta _ {j},\phi )}, conPAG(θj,ϕ){\displaystyle P(\theta _ {j},\phi )}como su distribución previa. Tenga en cuenta que la probabilidad depende deϕ{\displaystyle \phi }solo a través deθj{\displaystyle \theta _{j}}.

La distribución previa de la etapa I se puede desglosar en:

PAG(θj,ϕ)=PAG(θjϕ)PAG(ϕ){\displaystyle P(\theta _{j},\phi )=P(\theta _{j}\mid \phi )P(\phi )}[de la definición de probabilidad condicional]

Conϕ{\displaystyle \phi }como su hiperparámetro con distribución hiperprior,PAG(ϕ){\displaystyle P(\phi )}.

Por lo tanto, la distribución posterior es proporcional a:

PAG(ϕ,θjy)PAG(yjθj,ϕ)PAG(θj,ϕ){\displaystyle P(\phi ,\theta _{j}\mid y)\propto P(y_{j}\mid \theta _{j},\phi )P(\theta _{j},\phi )}[utilizando el teorema de Bayes]
PAG(ϕ,θjy)PAG(yjθj)PAG(θjϕ)PAG(ϕ){\displaystyle P(\phi ,\theta _{j}\mid y)\propto P(y_{j}\mid \theta _{j})P(\theta _{j}\mid \phi )P(\phi )}[ 13 ]

Ejemplo de cálculo

Por ejemplo, un profesor quiere estimar el rendimiento de un estudiante en el SAT . El profesor utiliza el promedio de calificaciones actual (GPA) del estudiante para realizar la estimación. Su GPA actual, denotado porY{\displaystyle Y}, tiene una probabilidad dada por alguna función de probabilidad con parámetroθ{\displaystyle \theta }, es decirYθPAG(Yθ){\displaystyle Y\mid \theta \sim P(Y\mid \theta )}Este parámetroθ{\displaystyle \theta }es la puntuación SAT del estudiante. La puntuación SAT se considera una muestra proveniente de una distribución de población común indexada por otro parámetro.ϕ{\displaystyle \phi }, que es el grado de la escuela secundaria del estudiante (primer año, segundo año, tercer año o cuarto año). [ 14 ] Es decir,θϕPAG(θϕ){\displaystyle \theta \mid \phi \sim P(\theta \mid \phi )}. Además, el hiperparámetroϕ{\displaystyle \phi }sigue su propia distribución dada porPAG(ϕ){\displaystyle P(\phi )}, un hiperprior.

Estas relaciones pueden utilizarse para calcular la probabilidad de obtener una puntuación específica en el SAT en relación con un promedio de calificaciones determinado:

PAG(θ,ϕY)PAG(Yθ,ϕ)PAG(θ,ϕ){\displaystyle P(\theta ,\phi \mid Y)\propto P(Y\mid \theta ,\phi )P(\theta ,\phi )}
PAG(θ,ϕY)PAG(Yθ)PAG(θϕ)PAG(ϕ){\displaystyle P(\theta ,\phi \mid Y)\propto P(Y\mid \theta )P(\theta \mid \phi )P(\phi )}

Toda la información del problema se utilizará para calcular la distribución posterior. En lugar de resolverlo únicamente utilizando la distribución previa y la función de verosimilitud , el uso de hiperpriores permite una distinción más precisa de las relaciones entre las variables dadas. [ 15 ]

modelo jerárquico de 2 etapas

En general, la distribución posterior conjunta de interés en los modelos jerárquicos de dos etapas es:

PAG(θ,ϕY)=PAG(Yθ,ϕ)PAG(θ,ϕ)PAG(Y)=PAG(Yθ)PAG(θϕ)PAG(ϕ)PAG(Y){\displaystyle P(\theta ,\phi \mid Y)={P(Y\mid \theta ,\phi )P(\theta ,\phi ) \over P(Y)}={P(Y\mid \theta )P(\theta \mid \phi )P(\phi ) \over P(Y)}}
PAG(θ,ϕY)PAG(Yθ)PAG(θϕ)PAG(ϕ){\displaystyle P(\theta ,\phi \mid Y)\propto P(Y\mid \theta )P(\theta \mid \phi )P(\phi )}[ 15 ]

Modelo jerárquico de 3 etapas

Para los modelos jerárquicos de 3 etapas, la distribución posterior viene dada por:

PAG(θ,ϕ,incógnitaY)=PAG(Yθ)PAG(θϕ)PAG(ϕincógnita)PAG(incógnita)PAG(Y){\displaystyle P(\theta ,\phi ,X\mid Y)={P(Y\mid \theta )P(\theta \mid \phi )P(\phi \mid X)P(X) \over P(Y)}}
PAG(θ,ϕ,incógnitaY)PAG(Yθ)PAG(θϕ)PAG(ϕincógnita)PAG(incógnita){\displaystyle P(\theta ,\phi ,X\mid Y)\propto P(Y\mid \theta )P(\theta \mid \phi )P(\phi \mid X)P(X)}[ 15 ]

Modelo bayesiano no lineal de efectos mixtos

Ciclo de investigación bayesiana utilizando un modelo bayesiano de efectos mixtos no lineales: (a) ciclo de investigación estándar y (b) flujo de trabajo específico bayesiano. [ 16 ]

Se podría utilizar una versión de tres etapas del modelado jerárquico bayesiano para calcular la probabilidad en 1) un nivel individual, 2) a nivel de población y 3) la distribución a priori, que es una distribución de probabilidad supuesta que tiene lugar antes de que se adquiera la evidencia inicial:

Etapa 1: Modelo a nivel individual

yij=F(tij;θ1i,θ2i,,θli,,θKi)+ϵij,ϵijnorte(0,σ2),i=1,,norte,j=1,,METROi.{\displaystyle {y}_{ij}=f(t_{ij};\theta _{1i},\theta _{2i},\ldots ,\theta _{li},\ldots ,\theta _{Ki})+\epsilon _{ij},\quad \epsilon _{ij}\sim N(0,\sigma ^{2}),\quad i=1,\ldots ,N,\,j=1,\ldots ,M_{i}.}

Etapa 2: Modelo de población

θli=αl+b=1PAGβlbincógnitaib+ηli,ηlinorte(0,ωl2),i=1,,norte,l=1,,K.{\displaystyle \theta _{li}=\alpha _{l}+\sum _{b=1}^{P}\beta _{lb}x_{ib}+\eta _{li},\quad \eta _{li}\sim N(0,\omega _{l}^{2}),\quad i=1,\ldots ,N,\,l=1,\ldots ,K.}

Etapa 3: Previa

σ2π(σ2),αlπ(αl),(βl1,,βlb,,βlPAG)π(βl1,,βlb,,βlPAG),ωl2π(ωl2),l=1,,K.{\displaystyle \sigma ^{2}\sim \pi (\sigma ^{2}),\quad \alpha _{l}\sim \pi (\alpha _{l}),\quad (\beta _{l1},\ldots ,\beta _{lb},\ldots ,\beta _{lP})\sim \pi (\beta _{l1},\ldots ,\beta _{lb},\ldots ,\beta _{lP}),\quad \omega _{l}^{2}\sim \pi (\omega _{l}^{2}),\quad l=1,\ldots ,K.}

Aquí,yij{\displaystyle y_{ij}}denota la respuesta continua de lai{\displaystyle i}-ésimo sujeto en el momentotij{\displaystyle t_{ij}}, yincógnitaib{\displaystyle x_{ib}}es elb{\displaystyle b}-ésima covariable de lai{\displaystyle i}-ésimo sujeto. Los parámetros involucrados en el modelo están escritos en letras griegas. La variableF(t;θ1,,θK){\displaystyle f(t;\theta _{1},\ldots ,\theta _{K})}es una función conocida parametrizada por laK{\displaystyle K}vector de -dimensiones(θ1,,θK){\displaystyle (\theta _{1},\ldots ,\theta _{K})}.

Típicamente,F{\displaystyle f}es una función "no lineal" y describe la trayectoria temporal de los individuos. En el modelo,ϵij{\displaystyle \epsilon _{ij}}y ηli{\displaystyle \eta _{li}}describen la variabilidad intraindividual y la variabilidad interindividual, respectivamente. Si no se considera la distribución a priori, la relación se reduce a un modelo frecuentista no lineal de efectos mixtos.

Una tarea central en la aplicación de los modelos bayesianos no lineales de efectos mixtos es evaluar la densidad posterior:

π({θli}i=1,l=1norte,K,σ2,{αl}l=1K,{βlb}l=1,b=1K,PAG,{ωl}l=1K|{yij}i=1,j=1norte,METROi){\displaystyle \pi (\{\theta _{li}\}_{i=1,l=1}^{N,K},\sigma ^{2},\{\alpha _{l}\}_{l=1}^{K},\{\beta _{lb}\}_{l=1,b=1}^{K,P},\{\omega _{l}\}_{l=1}^{K}|\{y_{ij}\}_{i=1,j=1}^{N,M_{i}})}

π({yij}i=1,j=1norte,METROi,{θli}i=1,l=1norte,K,σ2,{αl}l=1K,{βlb}l=1,b=1K,PAG,{ωl}l=1K){\displaystyle \propto \pi (\{y_{ij}\}_{i=1,j=1}^{N,M_{i}},\{\theta _{li}\}_{i=1,l=1}^{N,K},\sigma ^{2},\{\alpha _{l}\}_{l=1}^{K},\{\beta _{lb}\}_{l=1,b=1}^{K,P},\{\omega _{l}\}_{l=1}^{K})}

=π({yij}i=1,j=1norte,METROi|{θli}i=1,l=1norte,K,σ2)Etapa 1: Modelo a nivel individual×π({θli}i=1,l=1norte,K|{αl}l=1K,{βlb}l=1,b=1K,PAG,{ωl}l=1K)Etapa 2: Modelo de población×pag(σ2,{αl}l=1K,{βlb}l=1,b=1K,PAG,{ωl}l=1K)Etapa 3: Previa{\displaystyle =\underbrace {\pi (\{y_{ij}\}_{i=1,j=1}^{N,M_{i}}|\{\theta _{li}\}_{i=1,l=1}^{N,K},\sigma ^{2})} _{\text{Stage 1: Individual-Level Model}}\times \underbrace {\pi (\{\theta _{li}\}_{i=1,l=1}^{N,K}|\{\alpha _{l}\}_{l=1}^{K},\{\beta _{lb}\}_{l=1,b=1}^{K,P},\{\omega _{l}\}_{l=1}^{K})} _{\text{Stage 2: Population Model}}\times \underbrace {p(\sigma ^{2},\{\alpha _{l}\}_{l=1}^{K},\{\beta _{lb}\}_{l=1,b=1}^{K,P},\{\omega _{l}\}_{l=1}^{K})} _{\text{Stage 3: Prior}}}

El panel de la derecha muestra el ciclo de investigación bayesiana utilizando el modelo bayesiano de efectos mixtos no lineales. [ 16 ] Un ciclo de investigación que utiliza el modelo bayesiano de efectos mixtos no lineales comprende dos pasos: (a) ciclo de investigación estándar y (b) flujo de trabajo específico bayesiano.

Un ciclo de investigación estándar implica 1) revisión de la literatura , 2) definición de un problema y 3) especificación de la pregunta de investigación y la hipótesis. El flujo de trabajo específico bayesiano estratifica este enfoque para incluir tres subpasos: (b)–(i) formalización de distribuciones previas basadas en el conocimiento previo y la obtención de información previa; (b)–(ii) determinación de la función de verosimilitud basada en una función no lineal.F{\displaystyle f}; y (b)–(iii) realizar una inferencia posterior. La inferencia posterior resultante puede utilizarse para iniciar un nuevo ciclo de investigación.

Aplicaciones

Los marcos bayesianos jerárquicos se han aplicado para modelar, por ejemplo, tareas de aprendizaje por refuerzo y toma de decisiones, [ 17 ] los efectos de la mutación de antígenos en el sistema inmunitario , [ 18 ] y procesos ecológicos que afectan la distribución de especies , [ 19 ] por mencionar algunos. PyMC es un paquete de Python de código abierto y flexible que admite este tipo de modelado. [ 20 ]

Referencias

  1. 1 2 Allenby, Rossi, McCulloch (enero de 2005). "Modelo bayesiano jerárquico: una guía práctica" . Journal of Bayesian Applications in Marketing , pp. 1–4. Recuperado el 26 de abril de 2014, p. 3
  2. Gelman, Andrew ; Carlin, John B.; Stern, Hal S. y Rubin, Donald B. (2004). Análisis de datos bayesianos (segunda  ed.). Boca Raton, Florida: CRC Press. págs. 4–5 . ISBN  1-58488-388-X.
  3. Lee, Se Yoon; Lei, Bowen; Mallick, Bani (2020). "Estimación de las curvas de propagación de COVID-19 integrando datos globales y tomando prestada información" . PLOS ONE . 15 (7) e0236860. arXiv : 2005.00662 . Bibcode : 2020PLoSO..1536860L . doi : 10.1371/journal.pone.0236860 . PMC 7390340. PMID 32726361 .  
  4. Lee, Se Yoon; Mallick, Bani (2021). "Modelado jerárquico bayesiano: aplicación a los resultados de producción en el esquisto Eagle Ford del sur de Texas" . Sankhya B. 84 : 1–43 . doi : 10.1007 /s13571-020-00245-8 .
  5. ^ Gelman y col. 2004 , pág. 6.
  6. ^ Gelman y cols. 2004 , pág. 117.
  7. ^ Bueno , IJ (1980). "Un poco de historia de la metodología bayesiana jerárquica" . Trabajos de Estadística y de Investigación Operativa . 31 : 489– 519. doi : 10.1007/BF02888365 . S2CID 121270218 . 
  8. Bernardo, Smith (1994). Teoría bayesiana . Chichester, Inglaterra: John Wiley & Sons, ISBN 0-471-92416-4pág. 23
  9. ^ Gelman y cols. 2004 , págs. 6–8.
  10. Bernardo, Degroot, Lindley (septiembre de 1983). «Actas de la Segunda Reunión Internacional de Valencia» . Bayesian Statistics 2. Ámsterdam: Elsevier Science Publishers BV, ISBN 0-444-87746-0págs. 167–168
  11. ^ Gelman y col. 2004 , págs. 121-125.
  12. 1 2 Diaconis, Freedman (1980). "Secuencias intercambiables finitas" . Anales de Probabilidad, págs. 745–747
  13. Bernardo, Degroot, Lindley (septiembre de 1983). «Actas de la Segunda Reunión Internacional de Valencia» . Bayesian Statistics 2. Ámsterdam: Elsevier Science Publishers BV, ISBN 0-444-87746-0págs. 371–372
  14. ^ Gelman y col. 2004 , págs. 120-121.
  15. 1 2 3 Box GEP , Tiao GC (1965). "Problema multiparamétrico desde un punto de vista bayesiano" . Problemas multiparamétricos desde un punto de vista bayesiano, volumen 36, número 5. Ciudad de Nueva York: John Wiley & Sons, ISBN 0-471-57428-7
  16. 1 2 Lee, Se Yoon (2022). "Modelos no lineales bayesianos para datos de mediciones repetidas: una descripción general, implementación y aplicaciones" . Matemáticas . 10 (6): 898. arXiv : 2201.12430 . doi : 10.3390/math10060898 .
  17. Ahn, Woo-Young; Haines, Nathaniel; Zhang, Lei (2017-10-01). "Revelando los mecanismos neurocomputacionales del aprendizaje por refuerzo y la toma de decisiones con el paquete hBayesDM" . Psiquiatría Computacional . 1 : 24. doi : 10.1162/CPSY_a_00002 . ISSN 2379-6227 . PMC 5869013. PMID 29601060 .   
  18. Banerjee, Amitava; Pattinson, David J.; Wincek, Cornelia L.; Bunk, Paul; Axhemi, Armend; Chapin, Sarah R.; Navlakha, Saket; Meyer, Hannah V. (2025-07-25). " Predicción de la reactividad cruzada del receptor de células T mejorada mediante una base de datos de escaneo mutacional integral" . Cell Systems . 0. doi : 10.1016/j.cels.2025.101345 . ISSN 2405-4712 . PMID 40713946 .  
  19. Gelfand, Alan E.; Holder, Mark; Latimer, Andrew; Lewis, Paul O.; Rebelo, Anthony G.; Silander, John A.; Wu, Shanshan (2006-03-01). "Explicación de los patrones de distribución de especies mediante modelado jerárquico". Bayesian Analysis . 1 (1). doi : 10.1214/06-ba102 . hdl : 1808/9215 . ISSN 1936-0975 . 
  20. Abril-Pla, Oriol; Andreani, Virgilio; Carroll, Colin; Dong, Larry; Fonnesbeck, Christopher J.; Kochúrov, Maxim; Kumar, Ravin; Laosiano, Junpeng; Luhmann, Christian C.; Martín, Osvaldo A.; Osthege, Michael; Vieira, Ricardo; Wiecki, Thomas; Zinkov, Robert (1 de septiembre de 2023). "PyMC: un marco de programación probabilística moderno y completo en Python" . PeerJ Ciencias de la Computación . 9 e1516. doi : 10.7717/peerj-cs.1516 . ISSN 2376-5992 . PMC 10495961 . PMID 37705656 .