Articulo de referencia

Distribución multinomial

n \\in \\{0, 1, 2, \\ldots\\} number of trials \n k > 0 number of mutually exclusive events (integer) \n p_1, \\ldots, p_k event probabilities, where p_1 + \\dots + p_k = 1 "},"...

En teoría de la probabilidad , la distribución multinomial es una generalización de la distribución binomial . Por ejemplo, modela la probabilidad de obtener resultados en cada cara de un dado de k caras lanzado n veces. Para n ensayos independientes , cada uno de los cuales resulta en un éxito en exactamente una de las k categorías, con una probabilidad de éxito fija para cada categoría, la distribución multinomial proporciona la probabilidad de cualquier combinación particular de números de éxitos para las distintas categorías.

Cuando k es 2 y n es 1, la distribución multinomial es la distribución de Bernoulli . Cuando k es 2 y n es mayor que 1, es la distribución binomial . Cuando k es mayor que 2 y n es 1, es la distribución categórica . El término "multinoulli" se usa a veces para la distribución categórica para enfatizar esta relación cuádruple (de modo que n determina el sufijo y k el prefijo).

La distribución de Bernoulli modela el resultado de un único ensayo de Bernoulli . En otras palabras, modela si lanzar una moneda (posiblemente sesgada ) una sola vez resultará en un éxito (obtener cara) o un fracaso (obtener cruz). La distribución binomial generaliza esto al número de caras obtenidas al realizar n lanzamientos independientes (ensayos de Bernoulli) de la misma moneda. La distribución multinomial modela el resultado de n experimentos, donde el resultado de cada ensayo tiene una distribución categórica , como lanzar un dado de k caras (posiblemente sesgado ) n veces.

Sea k un número finito fijo. Matemáticamente, tenemos k posibles resultados mutuamente excluyentes, con probabilidades correspondientes p 1 , ..., p k , y n ensayos independientes. Dado que los k resultados son mutuamente excluyentes y uno debe ocurrir, tenemos p i  0 para i  =  1,  ..., k y i=1kpagi=1{\textstyle \sum _{i=1}^{k}p_{i}=1}Si las variables aleatorias X i indican el número de veces que se observa el resultado número i en los n ensayos, el vector X  =  ( X 1 ,  ..., X k ) sigue una distribución multinomial con parámetros n y p , donde p = ( p 1 , ..., p k ). Si bien los ensayos son independientes, sus resultados X i son dependientes porque deben sumar n.     

Definiciones

Función de masa de probabilidad

Supongamos que se realiza un experimento extrayendo n bolas de k colores diferentes de una bolsa, reponiendo las bolas extraídas después de cada extracción. Las bolas del mismo color son equivalentes. Denotemos como X i la variable que representa el número de bolas extraídas del color i ( i = 1, ..., k ) , y como p i la probabilidad de que una extracción dada sea del color i . La función de probabilidad de esta distribución multinomial es:

F(incógnita1,,incógnitak;norte,pag1,,pagk)=Pr(incógnita1=incógnita1 y  y incógnitak=incógnitak)={norte¡incógnita1¡incógnitak¡pag1incógnita1××pagkincógnitak,cuando i=1kincógnitai=norte0de lo contrario,{\displaystyle {\begin{aligned}f(x_{1},\ldots ,x_{k};n,p_{1},\ldots ,p_{k})&{}=\Pr(X_{1}=x_{1}{\text{ y }}\dots {\text{ y }}X_{k}=x_{k})\\[1ex]&{}={\begin{cases}{\displaystyle {n! \over x_{1}!\cdots x_{k}!}p_{1}^{x_{1}}\times \cdots \times p_{k}^{x_{k}}},\quad &{\text{cuando }}\sum _{i=1}^{k}x_{i}=n\\\\0&{\text{en otro caso,}}\end{cases}}\end{aligned}}}

para enteros no negativos x 1 , ..., x k .

La función de probabilidad de masa se puede expresar utilizando la función gamma de la siguiente manera:

F(incógnita1,,incógnitak;pag1,,pagk)=Γ(iincógnitai+1)iΓ(incógnitai+1)i=1kpagiincógnitai.{\displaystyle f(x_{1},\dots ,x_{k};p_{1},\ldots ,p_{k})={\frac {\Gamma (\sum _{i}x_{i}+1)}{\prod _{i}\Gamma (x_{i}+1)}}\prod _{i=1}^{k}p_{i}^{x_{i}}.}

Esta forma muestra su semejanza con la distribución de Dirichlet , que es su distribución a priori conjugada .

Ejemplo

Supongamos que en una elección a tres bandas en un país grande, el candidato A obtuvo el 20% de los votos, el candidato B el 30% y el candidato C el 50%. Si se seleccionan seis votantes al azar, ¿cuál es la probabilidad de que haya exactamente un votante para el candidato A, dos para el candidato B y tres para el candidato C en la muestra?

Nota: Dado que asumimos que la población votante es grande, es razonable y permisible considerar que las probabilidades permanecen invariables una vez que se selecciona un votante para la muestra. Técnicamente hablando, esto es un muestreo sin reemplazo, por lo que la distribución correcta es la distribución hipergeométrica multivariada , pero las distribuciones convergen a medida que la población crece en comparación con un tamaño de muestra fijo . [ 1 ]

Pr(A=1,B=2,do=3)=6¡1¡2¡3¡(0,21)(0,32)(0,53)=0,135{\displaystyle \Pr(A{=}1,B{=}2,C{=}3)={\frac {6!}{1!2!3!}}\left(0.2^{1}\right)\left(0.3^{2}\right)\left(0.5^{3}\right)=0.135}

Propiedades

Normalización

La distribución multinomial se normaliza según:

j=1kincógnitaj=norteF(incógnita1,,incógnitak;norte,pag1,,pagk)=1{\displaystyle \sum _{\sum _{j=1}^{k}x_{j}=n}f(x_{1},\dots ,x_{k};n,p_{1},\dots ,p_{k})=1}

donde la suma se realiza sobre todas las permutaciones deincógnitaj{\displaystyle x_{j}}de tal manera quej=1kincógnitaj=norte{\textstyle \sum _ {j=1}^{k}x_ {j}=n}.

Valor esperado y varianza

El número esperado de veces que se observó el resultado i en n ensayos es

mi(incógnitai)=nortepagi.{\displaystyle \operatorname {E} (X_{i})=np_{i}.\,}

La matriz de covarianza es la siguiente. Cada elemento diagonal es la varianza de una variable aleatoria con distribución binomial y, por lo tanto, es

Var(incógnitai)=nortepagi(1pagi).{\displaystyle \operatorname {Var} (X_{i})=np_{i}(1-p_{i}).\,}

Las entradas fuera de la diagonal son las covarianzas :

Cov(incógnitai,incógnitaj)=nortepagipagj{\displaystyle \operatorname {Cov} (X_{i},X_{j})=-np_{i}p_{j}\,}

para i , j distintos.

Todas las covarianzas son negativas porque, para un n fijo , un aumento en un componente de un vector multinomial requiere una disminución en otro componente.

Cuando estas expresiones se combinan en una matriz con elementos i y jcobertura(incógnitai,incógnitaj),{\displaystyle \operatorname {cov} (X_ {i}, X_ {j}),}El resultado es una matriz de covarianza semidefinida positiva de k × k de rango k 1. En el caso especial donde k = n y donde todos los p i son iguales, la matriz de covarianza es la matriz de centrado .    

Las entradas de la matriz de correlación correspondiente son

ρ(incógnitai,incógnitai)=1ρ(incógnitai,incógnitaj)=Cov(incógnitai,incógnitaj)Var(incógnitai)Var(incógnitaj)=pagipagjpagi(1pagi)pagj(1pagj)=pagipagj(1pagi)(1pagj).{\displaystyle {\begin{aligned}\rho (X_{i},X_{i})&=1\\[1ex]\rho (X_{i},X_{j})&={\frac {\operatorname {Cov} (X_{i},X_{j})}{\sqrt {\operatorname {Var} (X_{i})\operatorname {Var} (X_{j})}}}\\&={\frac {-p_{i}p_{j}}{\sqrt {p_{i}(1-p_{i})p_{j}(1-p_{j})}}}\\&=-{\sqrt {\frac {p_{i}p_{j}}{(1-p_{i})(1-p_{j})}}}.\end{aligned}}}

Nótese que el número de ensayos n desaparece de esta expresión.

Cada uno de los k componentes por separado tiene una distribución binomial con parámetros n y p i , para el valor apropiado del subíndice i .

El soporte de la distribución multinomial es el conjunto

{(norte1,,nortek)norteknorte1++nortek=norte}.{\displaystyle \left\{(n_{1},\dots ,n_{k})\in \mathbb {N} ^{k}\mid n_{1}+\cdots +n_{k}=n\right\}.}

Su número de elementos es

(norte+k1k1).{\displaystyle {\binom {n+k-1}{k-1}}.}

Notación matricial

En notación matricial, mi(incógnita)=nortepag,{\displaystyle \operatorname {E} (\mathbf {X} )=n\mathbf {p} ,\,}

y Var(incógnita)=norte{diagnóstico(pag)pagpagT},{\displaystyle \operatorname {Var} (\mathbf {X} )=n\lbrace \operatorname {diag} (\mathbf {p} )-\mathbf {p} \mathbf {p} ^{\rm {T}}\rbrace ,\,}

donde p T = la transpuesta del vector fila del vector columna p .

Visualización

Como secciones del triángulo de Pascal generalizado

Así como se puede interpretar la distribución binomial como secciones unidimensionales (1D) (normalizadas) del triángulo de Pascal , también se puede interpretar la distribución multinomial como secciones bidimensionales (triangulares) de la pirámide de Pascal , o secciones tridimensionales/cuádruples/superiores (en forma de pirámide) de análogos de dimensiones superiores del triángulo de Pascal. Esto revela una interpretación del rango de la distribución: "pirámides" equiláteras discretizadas en una dimensión arbitraria, es decir, un simplex con una cuadrícula.

Como coeficientes polinómicos

De manera similar, al igual que se puede interpretar la distribución binomial como los coeficientes polinomiales de(pag+q)norte{\displaystyle (p+q)^{n}}Cuando se expande, se puede interpretar la distribución multinomial como los coeficientes de(pag1+pag2+pag3++pagk)norte{\displaystyle (p_{1}+p_{2}+p_{3}+\cdots +p_{k})^{n}}al expandirse, teniendo en cuenta que solo los coeficientes deben sumar 1.

teoría de grandes desviaciones

Asintótica

Según la fórmula de Stirling , en el límite denorte,incógnita1,,incógnitak{\displaystyle n,x_{1},\dots ,x_{k}\to \infty }, tenemosln(norteincógnita1,,incógnitak)+i=1kincógnitailnpagi=norteDKL(pag^pag)k12ln(2πnorte)12i=1kln(pag^i)+o(1){\displaystyle \ln {\binom {n}{x_{1},\dots ,x_{k}}}+\sum _{i=1}^{k}x_{i}\ln p_{i}=-nD_{\text{KL}}({\hat {p}}\|p)-{\frac {k-1}{2}}\ln(2\pi n)-{\frac {1}{2}}\sum _{i=1}^{k}\ln({\hat {p}}_{i})+o(1)}donde las frecuencias relativaspag^i=incógnitai/norte{\displaystyle {\hat {p}}_{i}=x_{i}/n}En los datos se pueden interpretar como probabilidades de la distribución empírica.pag^{\displaystyle {\hat {p}}}, yDKL{\displaystyle D_{\text{KL}}}es la divergencia de Kullback-Leibler .

Esta fórmula puede interpretarse de la siguiente manera.

ConsiderarΔk{\displaystyle \Delta _{k}}, el espacio de todas las distribuciones posibles sobre las categorías{1,2,,k}{\displaystyle \{1,2,\dots ,k\}}Es un simplex . Despuésnorte{\displaystyle n}muestras independientes de la distribución categóricapag{\displaystyle p}(que es como construimos la distribución multinomial), obtenemos una distribución empíricapag^{\displaystyle {\hat {p}}}.

Según la fórmula asintótica, la probabilidad de que la distribución empíricapag^{\displaystyle {\hat {p}}}se desvía de la distribución realpag{\displaystyle p}decae exponencialmente a medida que muestreamos más datos, a una tasa deDKL(pag^pag){\displaystyle D_{\text{KL}}({\hat {p}}\|p)}Cuantos más experimentos y más diferentespag^{\displaystyle {\hat {p}}}es depag{\displaystyle p}Cuanto menor sea la probabilidad de observar una distribución empírica de este tipo, menos probable será.

SiA{\displaystyle A}es un subconjunto cerrado deΔk{\displaystyle \Delta _{k}}, luego dividiendoA{\displaystyle A}en pedazos y razonando sobre la tasa de crecimiento dePAGr(pag^Aϵ){\displaystyle Pr({\hat {p}}\in A_{\epsilon })}en cada piezaAϵ{\displaystyle A_{\epsilon }}, obtenemos el teorema de Sanov , que establece que límitenorte1nortelnPr(pag^A)=infpag^ADKL(pag^pag){\displaystyle \lim _{n\to \infty }{\frac {1}{n}}\ln \Pr({\hat {p}}\in A)=-\inf _{{\hat {p}}\in A}D_{\text{KL}}({\hat {p}}\|p)}

Concentración en n grande

Debido al decaimiento exponencial , en grandesnorte{\displaystyle n}, casi toda la masa de probabilidad se concentra en un pequeño vecindario depag{\displaystyle p}. En este pequeño vecindario, podemos tomar el primer término no nulo en la expansión de Taylor deDKL{\displaystyle D_{KL}}para obtenerln(norteincógnita1,,incógnitak)pag1incógnita1pagkincógnitaknorte2i=1k(pag^ipagi)2pagi=12i=1k(incógnitainortepagi)2nortepagi{\displaystyle {\begin{aligned}\ln {\binom {n}{x_{1},\cdots ,x_{k}}}p_{1}^{x_{1}}\cdots p_{k}^{x_{k}}&\approx -{\frac {n}{2}}\sum _{i=1}^{k}{\frac {({\hat {p}}_{i}-p_{i})^{2}}{p_{i}}}\\&=-{\frac {1}{2}}\sum _{i=1}^{k}{\frac {(x_{i}-np_{i})^{2}}{np_{i}}}\end{aligned}}} Esto se asemeja a la distribución gaussiana, lo que sugiere el siguiente teorema:

Teorema. En elnorte{\displaystyle n\to \infty }límite,nortei=1k(pag^ipagi)2pagi=i=1k(incógnitainortepagi)2nortepagi{\displaystyle n\sum _{i=1}^{k}{\frac {({\hat {p}}_{i}-p_{i})^{2}}{p_{i}}}=\sum _{i=1}^{k}{\frac {(x_{i}-np_{i})^{2}}{np_{i}}}}converge en distribución a la distribución chi-cuadradoχ2(k1){\displaystyle \chi ^{2}(k-1)}.

Si tomamos una muestra de la distribución multinomialMETROltinorteometroial(norte;0,2,0,3,0,5){\displaystyle \mathrm {Multinomial} (n;0.2,0.3,0.5)}y trazamos el mapa de calor de las muestras dentro del simplex bidimensional (aquí mostrado como un triángulo negro), observamos que comonorte{\displaystyle n\to \infty }, la distribución converge a una gaussiana alrededor del punto(0,2,0,3,0,5){\displaystyle (0.2,0.3,0.5)}, con los contornos convergiendo en forma de elipses, con radios que convergen como1/norte{\displaystyle 1/{\sqrt {n}}}Mientras tanto, la separación entre los puntos discretos converge como1/norte{\displaystyle 1/n}y así, la distribución multinomial discreta converge a una distribución gaussiana continua.
[Prueba]

El espacio de todas las distribuciones sobre categorías{1,2,,k}{\displaystyle \{1,2,\ldots ,k\}}es un simplex :Δk={(y1,,yk):y1,,yk0,iyi=1}{\displaystyle \Delta _{k}=\left\{(y_{1},\ldots ,y_{k})\colon y_{1},\ldots ,y_{k}\geq 0,\sum _{i}y_{i}=1\right\}}y el conjunto de todas las posibles distribuciones empíricas después denorte{\displaystyle n}Los experimentos son un subconjunto del simplex:Δk,norte={(incógnita1/norte,,incógnitak/norte):incógnita1,,incógnitaknorte,iincógnitai=norte}{\displaystyle \Delta _{k,n}=\left\{(x_{1}/n,\ldots ,x_{k}/n)\colon x_{1},\ldots ,x_{k}\in \mathbb {N} ,\sum _{i}x_{i}=n\right\}}. Es decir, es la intersección entreΔk{\displaystyle \Delta _{k}}y la red(Zk)/norte{\displaystyle (\mathbb {Z} ^{k})/n}.

Comonorte{\displaystyle n}aumenta, la mayor parte de la masa de probabilidad se concentra en un subconjunto deΔk,norte{\displaystyle \Delta _{k,n}}cercapag{\displaystyle p}y la distribución de probabilidad cercapag{\displaystyle p}se aproxima bien mediante(norteincógnita1,,incógnitak)pag1incógnita1pagkincógnitakminorte2i(pag^ipagi)2pagi{\displaystyle {\binom {n}{x_{1},\cdots ,x_{k}}}p_{1}^{x_{1}}\cdots p_{k}^{x_{k}}\approx e^{-{\frac {n}{2}}\sum _{i}{\frac {\left({\hat {p}}_{i}-p_{i}\right)^{2}}{p_{i}}}}}De esto, vemos que el subconjunto sobre el cual se concentra la masa tiene un radio del orden de1/norte{\displaystyle 1/{\sqrt {n}}}, pero los puntos en el subconjunto están separados por una distancia del orden de1/norte{\displaystyle 1/n}, por lo tanto en generalnorte{\displaystyle n}, los puntos se fusionan en un continuo. Para convertir esto de una distribución de probabilidad discreta a una densidad de probabilidad continua, necesitamos multiplicar por el volumen ocupado por cada punto deΔk,norte{\displaystyle \Delta _{k,n}}enΔk{\displaystyle \Delta _{k}}Sin embargo, por simetría, cada punto ocupa exactamente el mismo volumen (excepto un conjunto insignificante en el límite), por lo que obtenemos una densidad de probabilidad.ρ(pag^)=dominorte2i(pag^ipagi)2pagi{\displaystyle \rho ({\hat {p}})=Ce^{-{\frac {n}{2}}\sum _{i}{\frac {\left({\hat {p}}_{i}-p_{i}\right)^{2}}{p_{i}}}}}, dóndedo{\displaystyle C}es una constante.

Finalmente, dado que el simplexΔk{\displaystyle \Delta _{k}}no es todoRk{\displaystyle \mathbb {R} ^{k}}, pero solo dentro de un(k1){\displaystyle (k-1)}En el plano -dimensional, obtenemos el resultado deseado.

Concentración condicional para n grande

El fenómeno de concentración descrito anteriormente puede generalizarse fácilmente al caso en que condicionamos a restricciones independientes. Esta es la justificación teórica de la prueba chi-cuadrado de Pearson .

Teorema.

  • Funciones dadasF1,,F{\displaystyle f_{1},\dots ,f_{\ell }}, de tal manera que sean continuamente diferenciables en un entorno depag{\displaystyle p}y los vectores(1,1,,1),F1(pag),,F(pag){\displaystyle (1,1,\dots ,1),\nabla f_{1}(p),\dots ,\nabla f_{\ell }(p)}son linealmente independientes;
  • secuencias dadasϵ1(norte),,ϵ(norte){\displaystyle \epsilon _{1}(n),\dots ,\epsilon _{\ell }(n)}, de tal manera que asintóticamente1norteϵi(norte)1norte{\displaystyle {\frac {1}{n}}\ll \epsilon _{i}(n)\ll {\frac {1}{\sqrt {n}}}}para cadai{1,,}{\displaystyle i\in \{1,\dots ,\ell \}};
  • luego para la distribución multinomial condicionada a restriccionesF1(pag^)[F1(pag)ϵ1(norte),F1(pag)+ϵ1(norte)],,F(pag^)[F(pag)ϵ(norte),F(pag)+ϵ(norte)]{\displaystyle f_{1}({\hat {p}})\in [f_{1}(p)-\epsilon _{1}(n),f_{1}(p)+\epsilon _{1}(n)],\dots ,f_{\ell }({\hat {p}})\in [f_{\ell }(p)-\epsilon _{\ell }(n),f_{\ell }(p)+\epsilon _{\ell }(n)]}, tenemos la cantidadnortei(pag^ipagi)2pagi=i(incógnitainortepagi)2nortepagi{\displaystyle n\sum _{i}{\frac {({\hat {p}}_{i}-p_{i})^{2}}{p_{i}}}=\sum _{i}{\frac {(x_{i}-np_{i})^{2}}{np_{i}}}}convergente en distribución aχ2(k1){\displaystyle \chi ^{2}(k-1-\ell )}alnorte{\displaystyle n\to \infty }límite.

En el caso de que todospag^i{\displaystyle {\hat {p}}_{i}}son iguales, esto se reduce a la concentración de entropías alrededor de la entropía máxima . [ 2 ] [ 3 ]

Este teorema se puede demostrar partiendo del caso anterior y luego tomando la condición sobre las restricciones.

En algunos campos, como el procesamiento del lenguaje natural , las distribuciones categóricas y multinomiales son sinónimas, y es común hablar de una distribución multinomial cuando en realidad se quiere decir una distribución categórica . Esto se debe a que a veces es conveniente expresar el resultado de una distribución categórica como un vector "1 de k" (un vector con un elemento que contiene un 1 y todos los demás elementos que contienen un 0) en lugar de como un número entero en el rango1k{\displaystyle 1\dots k}; en esta forma, una distribución categórica es equivalente a una distribución multinomial sobre un solo ensayo.

Inferencia estadística

Pruebas de equivalencia para distribuciones multinomiales

El objetivo de las pruebas de equivalencia es establecer la concordancia entre una distribución multinomial teórica y las frecuencias de conteo observadas. La distribución teórica puede ser una distribución multinomial completamente especificada o una familia paramétrica de distribuciones multinomiales.

Dejarq{\displaystyle q}denotemos una distribución multinomial teórica y seapag{\displaystyle p}ser una distribución subyacente verdadera. Las distribucionespag{\displaystyle p}yq{\displaystyle q}se consideran equivalentes sid(pag,q)<ε{\displaystyle d(p,q)<\varepsilon }a distanciad{\displaystyle d}y un parámetro de toleranciaε>0{\displaystyle \varepsilon >0}El problema de la prueba de equivalencia esH0={d(pag,q)ε}{\displaystyle H_{0}=\{d(p,q)\geq \varepsilon \}}versusH1={d(pag,q)<ε}{\displaystyle H_{1}=\{d(p,q)<\varepsilon \}}La verdadera distribución subyacentepag{\displaystyle p}es desconocido. En cambio, las frecuencias de conteopagnorte{\displaystyle p_{n}}se observan, dondenorte{\displaystyle n}es un tamaño de muestra. Una prueba de equivalencia utilizapagnorte{\displaystyle p_{n}}rechazarH0{\displaystyle H_{0}}. SiH0{\displaystyle H_{0}}entonces se puede rechazar la equivalencia entrepag{\displaystyle p}yq{\displaystyle q}se muestra a un nivel de significancia dado. La prueba de equivalencia para la distancia euclidiana se puede encontrar en el libro de texto de Wellek (2010). [ 4 ] La prueba de equivalencia para la distancia de variación total se desarrolla en Ostrovski (2017). [ 5 ] La prueba de equivalencia exacta para la distancia acumulativa específica se propone en Frey (2009). [ 6 ]

La distancia entre la distribución subyacente verdaderapag{\displaystyle p}y una familia de distribuciones multinomialesMETRO{\displaystyle {\mathcal {M}}}se define pord(pag,METRO)=minhMETROd(pag,h){\displaystyle d(p,{\mathcal {M}})=\min _{h\in {\mathcal {M}}}d(p,h)}. Entonces, el problema de la prueba de equivalencia viene dado porH0={d(pag,METRO)ε}{\displaystyle H_{0}=\{d(p,{\mathcal {M}})\geq \varepsilon \}}yH1={d(pag,METRO)<ε}{\displaystyle H_{1}=\{d(p,{\mathcal {M}})<\varepsilon \}}La distanciad(pag,METRO){\displaystyle d(p,{\mathcal {M}})}Generalmente se calcula mediante optimización numérica. Las pruebas para este caso se desarrollaron recientemente en Ostrovski (2018). [ 7 ]

Intervalos de confianza para la diferencia de dos proporciones

En el contexto de una distribución multinomial, la construcción de intervalos de confianza para la diferencia entre las proporciones de observaciones de dos eventos,pagipagj{\displaystyle p_{i}-p_{j}}requiere la incorporación de la covarianza negativa entre los estimadores de la muestra.pag^i=incógnitainorte{\displaystyle {\hat {p}}_{i}={\frac {X_{i}}{n}}}ypag^j=incógnitajnorte{\displaystyle {\hat {p}}_{j}={\frac {X_{j}}{n}}}.

Parte de la literatura sobre el tema se centró en el caso de uso de datos binarios de pares coincidentes, lo que requiere una atención cuidadosa al traducir las fórmulas al caso general depagipagj{\displaystyle p_{i}-p_{j}}para cualquier distribución multinomial. Las fórmulas de esta sección serán generalizadas, mientras que las de la siguiente sección se centrarán en el caso de uso de datos binarios de pares emparejados.

El error estándar (EE) de Wald de la diferencia de proporción se puede estimar utilizando: [ 8 ] : 378 [ 9 ]

SE^(pag^ipag^j)=(pag^i+pag^j)(pag^ipag^j)2norte{\displaystyle {\widehat {\operatorname {SE} }}({\hat {p}}_{i}-{\hat {p}}_{j})={\sqrt {\frac {\left({\hat {p}}_{i}+{\hat {p}}_{j}\right)-\left({\hat {p}}_{i}-{\hat {p}}_{j}\right)^{2}}{n}}}}

Para un100(1α)%{\displaystyle 100(1-\alpha )\%}Intervalo de confianza aproximado , el margen de error puede incorporar el cuantil apropiado de la distribución normal estándar , como sigue:

(pag^ipag^j)±zα/2SE^(pag^ipag^j){\displaystyle ({\hat {p}}_{i}-{\hat {p}}_{j})\pm z_{\alpha /2}\cdot {\widehat {\operatorname {SE} }}({\hat {p}}_{i}-{\hat {p}}_{j})}

[Prueba]

A medida que el tamaño de la muestra (norte{\displaystyle n}) aumenta, las proporciones de la muestra seguirán aproximadamente una distribución normal multivariada , gracias al teorema del límite central multidimensional (y también podría demostrarse utilizando el teorema de Cramér-Wold ). Por lo tanto, su diferencia también será aproximadamente normal. Además, estos estimadores son débilmente consistentes y al sustituirlos en el estimador SE también se vuelve débilmente consistente. Por lo tanto, gracias al teorema de Slutsky , la cantidad pivotal(pag^ipag^j)(pagipagj)SE(pag^ipag^j)^{\displaystyle {\frac {({\hat {p}}_{i}-{\hat {p}}_{j})-(p_{i}-p_{j})}{\widehat {\operatorname {SE} ({\hat {p}}_{i}-{\hat {p}}_{j})}}}} Sigue aproximadamente la distribución normal estándar . Y a partir de eso, se deriva directamente el intervalo de confianza aproximado anterior .

El SE se puede construir utilizando el cálculo de la varianza de la diferencia de dos variables aleatorias : SE^(pag^ipag^j)=pag^i(1pag^i)norte+pag^j(1pag^j)norte2(pag^ipag^jnorte)=1norte(pag^i+pag^jpag^i2pag^j2+2pag^ipag^j)=(pag^i+pag^j)(pag^ipag^j)2norte{\displaystyle {\begin{aligned}{\widehat {\operatorname {SE} }}({\hat {p}}_{i}-{\hat {p}}_{j})&={\sqrt {{\frac {{\hat {p}}_{i}(1-{\hat {p}}_{i})}{n}}+{\frac {{\hat {p}}_{j}(1-{\hat {p}}_{j})}{n}}-2\left(-{\frac {{\hat {p}}_{i}{\hat {p}}_{j}}{n}}\right)}}\\&={\sqrt {{\frac {1}{n}}\left({\hat {p}}_{i}+{\hat {p}}_{j}-{\hat {p}}_{i}^{2}-{\hat {p}}_{j}^{2}+2{\hat {p}}_{i}{\hat {p}}_{j}\right)}}\\&={\sqrt {\frac {({\hat {p}}_{i}+{\hat {p}}_{j})-({\hat {p}}_{i}-{\hat {p}}_{j})^{2}}{n}}}\end{aligned}}}

Una modificación que incluye una corrección de continuidad añade1norte{\displaystyle {\frac {1}{n}}}al margen de error de la siguiente manera: [ 10 ] : 102–103

(pag^ipag^j)±(zα/2SE^(pag^ipag^j)+1norte){\displaystyle ({\hat {p}}_{i}-{\hat {p}}_{j})\pm \left(z_{\alpha /2}\cdot {\widehat {\operatorname {SE} }}({\hat {p}}_{i}-{\hat {p}}_{j})+{\frac {1}{n}}\right)}

Otra alternativa es recurrir a un estimador bayesiano que utiliza la distribución a priori de Jeffreys , lo que lleva a utilizar una distribución de Dirichlet , con todos los parámetros iguales a 0,5, como distribución a priori. La distribución a posteriori serán los cálculos anteriores, pero después de sumar 1/2 a cada uno de los k elementos, lo que conlleva un aumento general del tamaño de la muestra enk2{\displaystyle {\frac {k}{2}}}. Este método se desarrolló originalmente para una distribución multinomial con cuatro eventos y se conoce como wald+2 , para analizar datos de pares emparejados (véase la siguiente sección para más detalles). [ 11 ]

Esto conduce al siguiente SE:

SE^(pag^ipag^j)wald+k2=(pag^i+pag^j+1norte)nortenorte+k2(pag^ipag^j)2(nortenorte+k2)2norte+k2{\displaystyle {\widehat {\operatorname {SE} }}{({\hat {p}}_{i}-{\hat {p}}_{j})}_{wald+{\frac {k}{2}}}={\sqrt {\frac {\left({\hat {p}}_{i}+{\hat {p}}_{j}+{\frac {1}{n}}\right){\frac {n}{n+{\frac {k}{2}}}}-\left({\hat {p}}_{i}-{\hat {p}}_{j}\right)^{2}\left({\frac {n}{n+{\frac {k}{2}}}}\right)^{2}}{n+{\frac {k}{2}}}}}}

[Prueba]

SE^(pag^ipag^j)wald+k2=(incógnitai+1/2norte+k2+incógnitaj+1/2norte+k2)(incógnitai+1/2norte+k2incógnitaj+1/2norte+k2)2norte+k2=(incógnitainorte+incógnitajnorte+1norte)nortenorte+k2(incógnitainorteincógnitajnorte)2(nortenorte+k2)2norte+k2=(pag^i+pag^j+1norte)nortenorte+k2(pag^ipag^j)2(nortenorte+k2)2norte+k2{\displaystyle {\begin{aligned}{\widehat {\operatorname {SE} }}{({\hat {p}}_{i}-{\hat {p}}_{j})}_{wald+{\frac {k}{2}}}&={\sqrt {\frac {\left({\frac {x_{i}+1/2}{n+{\frac {k}{2}}}}+{\frac {x_{j}+1/2}{n+{\frac {k}{2}}}}\right)-\left({\frac {x_{i}+1/2}{n+{\frac {k}{2}}}}-{\frac {x_{j}+1/2}{n+{\frac {k}{2}}}}\right)^{2}}{n+{\frac {k}{2}}}}}\\&={\sqrt {\frac {\left({\frac {x_{i}}{n}}+{\frac {x_{j}}{n}}+{\frac {1}{n}}\right){\frac {n}{n+{\frac {k}{2}}}}-\left({\frac {x_{i}}{n}}-{\frac {x_{j}}{n}}\right)^{2}\left({\frac {n}{n+{\frac {k}{2}}}}\right)^{2}}{n+{\frac {k}{2}}}}}\\&={\sqrt {\frac {\left({\hat {p}}_{i}+{\hat {p}}_{j}+{\frac {1}{n}}\right){\frac {n}{n+{\frac {k}{2}}}}-\left({\hat {p}}_{i}-{\hat {p}}_{j}\right)^{2}\left({\frac {n}{n+{\frac {k}{2}}}}\right)^{2}}{n+{\frac {k}{2}}}}}\end{aligned}}}

Lo cual se puede simplemente insertar en la fórmula original de Wald de la siguiente manera:

(pagipagj)nortenorte+k2±zα/2SE^(pag^ipag^j)wald+k2{\displaystyle \left(p_{i}-p_{j}\right){\frac {n}{n+{\frac {k}{2}}}}\pm z_{\alpha /2}\cdot {\widehat {\operatorname {SE} }}{({\hat {p}}_{i}-{\hat {p}}_{j})}_{wald+{\frac {k}{2}}}}

Ocurrencia y aplicaciones

Intervalos de confianza para la diferencia en datos binarios de pares emparejados (utilizando distribución multinomial con k=4 )

En el caso de datos binarios de pares emparejados, una tarea común es construir el intervalo de confianza de la diferencia en la proporción de los eventos emparejados. Por ejemplo, podríamos tener una prueba para detectar alguna enfermedad y querer verificar sus resultados en una población determinada en dos momentos (1 y 2) para comprobar si hubo un cambio en la proporción de casos positivos de la enfermedad durante ese período.

Estos escenarios se pueden representar mediante una tabla de contingencia de dos por dos con el número de elementos que tuvieron cada una de las combinaciones de eventos. Podemos usar una f pequeña para las frecuencias de muestreo:F11,F10,F01,F00{\displaystyle f_{11},f_{10},f_{01},f_{00}}y F mayúscula para frecuencias poblacionales:F11,F10,F01,F00{\displaystyle F_{11},F_{10},F_{01},F_{00}}Estas cuatro combinaciones podrían modelarse como provenientes de una distribución multinomial (con cuatro resultados posibles). Los tamaños de la muestra y la población pueden ser n y N respectivamente. En tal caso, resulta de interés construir un intervalo de confianza para la diferencia de proporciones a partir de las marginales de la siguiente tabla de contingencia (muestreada):

En este caso, comprobar la diferencia en las proporciones marginales significa que nos interesa utilizar las siguientes definiciones:pag1=F1norte=F11+F10norte{\displaystyle p_{1*}={\frac {F_{1*}}{N}}={\frac {F_{11}+F_{10}}{N}}},pag1=F1norte=F11+F01norte{\displaystyle p_{*1}={\frac {F_{*1}}{N}}={\frac {F_{11}+F_{01}}{N}}}Y la diferencia para la que queremos construir intervalos de confianza es:

pag1pag1=F11+F01norteF11+F10norte=F01norteF10norte=pag01pag10{\displaystyle p_{*1}-p_{1*}={\frac {F_{11}+F_{01}}{N}}-{\frac {F_{11}+F_{10}}{N}}={\frac {F_{01}}{N}}-{\frac {F_{10}}{N}}=p_{01}-p_{10}}

Por lo tanto, intervalos de confianza para las proporciones marginales positivas (pag1pag1{\displaystyle p_{*1}-p_{1*}}) es lo mismo que construir un intervalo de confianza para la diferencia de las proporciones de la diagonal secundaria de la tabla de contingencia de dos por dos (pag01pag10{\displaystyle p_{01}-p_{10}}).

El cálculo de un valor p para dicha diferencia se conoce como prueba de McNemar . La construcción de un intervalo de confianza a su alrededor se puede realizar utilizando los métodos descritos anteriormente para los intervalos de confianza para la diferencia de dos proporciones .

Los intervalos de confianza de Wald de la sección anterior se pueden aplicar a este contexto y aparecen en la literatura con notaciones alternativas. Específicamente, el error estándar (EE) que se suele presentar se basa en las frecuencias de la tabla de contingencia en lugar de las proporciones de la muestra. Por ejemplo, los intervalos de confianza de Wald, proporcionados anteriormente, se pueden escribir como: [ 10 ] : 102–103

SE^(pag1pag1)=SE^(pag01pag10)=norte(F10+F01)(F10F01)2nortenorte{\displaystyle {\begin{aligned}{\widehat {\operatorname {SE} }}(p_{*1}-p_{1*})&={\widehat {\operatorname {SE} }}(p_{01}-p_{10})\\[1ex]&={\frac {\sqrt {n\left(f_{10}+f_{01}\right)-\left(f_{10}-f_{01}\right)^{2}}}{n{\sqrt {n}}}}\end{aligned}}}

Investigaciones posteriores en la literatura han identificado varias deficiencias tanto en el método de Wald como en el método de Wald con corrección de continuidad, y se han propuesto otros métodos para su aplicación práctica. [ 10 ]

Una de estas modificaciones incluye el Wald+2 de Agresti y Min (similar a algunos de sus otros trabajos [ 12 ] ) en el que cada frecuencia celular tenía un extra12{\displaystyle {\frac {1}{2}}}añadido a ello. [ 11 ] Esto lleva a los intervalos de confianza Wald+2 . En una interpretación bayesiana, esto es como construir los estimadores tomando como prior una distribución de Dirichlet con todos los parámetros iguales a 0,5 (que es, de hecho, la prior de Jeffreys ). El +2 en el nombre wald+2 ahora puede tomarse como que en el contexto de una tabla de contingencia de dos por dos, que es una distribución multinomial con cuatro eventos posibles, entonces como agregamos 1/2 una observación a cada uno de ellos, entonces esto se traduce en una adición general de 2 observaciones (debido a la prior).

Esto da lugar al siguiente SE modificado para el caso de datos de pares coincidentes:

SE^(pag1pag1)=(norte+2)(F10+F01+1)(F10F01)2(norte+2)norte+2{\displaystyle {\widehat {\operatorname {SE} }}(p_{*1}-p_{1*})={\frac {\sqrt {\left(n+2\right)\left(f_{10}+f_{01}+1\right)-\left(f_{10}-f_{01}\right)^{2}}}{\left(n+2\right){\sqrt {n+2}}}}}

Lo cual se puede simplemente insertar en la fórmula original de Wald de la siguiente manera:

(pag1pag1)nortenorte+2±zα/2SE^(pag^ipag^j)wald+2{\displaystyle \left(p_{*1}-p_{1*}\right){\frac {n}{n+2}}\pm z_{\alpha /2}\cdot {\widehat {\operatorname {SE} }}({\hat {p}}_{i}-{\hat {p}}_{j})_{wald+2}}

Otras modificaciones incluyen el Wald ajustado de Bonett y Price , y la puntuación de Newcombe .

Métodos computacionales

generación de variables aleatorias

Primero, reordena los parámetros.pag1,,pagk{\displaystyle p_{1},\ldots ,p_{k}}de manera que estén ordenados en orden descendente (esto es solo para acelerar el cálculo y no es estrictamente necesario). Ahora, para cada ensayo, extraiga una variable auxiliar X de una  distribución uniforme (0, 1). El resultado resultante es el componente

j=min{j{1,,k}:(i=1jpagi)incógnita0}.{\displaystyle j=\min \left\{j'\in \{1,\dots ,k\}\colon \left(\sum _{i=1}^{j'}p_{i}\right)-X\geq 0\right\}.}

{ X j = 1, X k = 0 para k j } es una observación de la distribución multinomial con pag1,,pagk{\displaystyle p_{1},\ldots ,p_{k}}y n  =  1. La suma de repeticiones independientes de este experimento es una observación de una distribución multinomial con n igual al número de dichas repeticiones.

Muestreo mediante muestras binomiales condicionales repetidas

Dados los parámetrospag1,pag2,,pagk{\displaystyle p_{1},p_{2},\ldots ,p_{k}}y un total para la muestranorte{\displaystyle n}de tal manera quei=1kincógnitai=norte{\textstyle \sum _{i=1}^{k}X_{i}=n}, es posible muestrear secuencialmente para el número en un estado arbitrarioincógnitai{\displaystyle X_{i}}, dividiendo el espacio de estados eni{\displaystyle i}y no-i{\displaystyle i}, condicionado a cualquier muestra previa ya tomada, repetidamente.

Algoritmo: Muestreo binomial condicional secuencial

S = n rho = 1 para i en [ 1 ,k-1 ] : si rho ! = 0 : X [ i ] ~ Binom ( S,p [ i ] /rho ) sino X [ i ] = 0 S = S - X [ i ] rho = rho - p [ i ] X [ k ] = S 

De forma heurística, cada aplicación del muestreo binomial reduce el número disponible para muestrear y las probabilidades condicionales se actualizan igualmente para garantizar la coherencia lógica. [ 13 ]

Implementaciones de software

  • El paquete MultinomialCI de R permite el cálculo de intervalos de confianza simultáneos para las probabilidades de una distribución multinomial dado un conjunto de observaciones. [ 14 ]

Véase también

Referencias

  1. "probabilidad - muestreo de distribución multinomial" . Validado cruzadamente . Consultado el 28 de julio de 2022 .
  2. Loukas, Orestis; Chung, Ho Ryun (abril de 2022). "Distribuciones categóricas de entropía máxima bajo restricciones marginales". arXiv : 2204.03406 [ hep-th ].
  3. Loukas, Orestis; Chung, Ho Ryun (junio de 2022). "Caracterización basada en la entropía de las restricciones de modelado". arXiv : 2206.14105 [ stat.ME ].
  4. Wellek, Stefan (2010). Prueba de hipótesis estadísticas de equivalencia y no inferioridad . Chapman and Hall/CRC. ISBN 978-1439808184.
  5. Ostrovski, Vladimir (May 2017). "Testing equivalence of multinomial distributions". Statistics & Probability Letters. 124: 77–82. doi:10.1016/j.spl.2017.01.004. S2CID 126293429.Official web link (subscription required). Alternate, free web link.
  6. Frey, Jesse (March 2009). "An exact multinomial test for equivalence". The Canadian Journal of Statistics. 37: 47–59. doi:10.1002/cjs.10000. S2CID 122486567.Official web link (subscription required).
  7. Ostrovski, Vladimir (March 2018). "Testing equivalence to families of multinomial distributions with application to the independence model". Statistics & Probability Letters. 139: 61–66. doi:10.1016/j.spl.2018.03.014. S2CID 126261081.Official web link (subscription required). Alternate, free web link.
  8. Fleiss, Joseph L.; Levin, Bruce; Paik, Myunghee Cho (2003). Statistical Methods for Rates and Proportions (3rd ed.). Hoboken, N.J: J. Wiley. p. 760. ISBN 9780471526292.
  9. Newcombe, R. G. (1998). "Interval Estimation for the Difference Between Independent Proportions: Comparison of Eleven Methods". Statistics in Medicine. 17 (8): 873–890. doi:10.1002/(SICI)1097-0258(19980430)17:8<873::AID-SIM779>3.0.CO;2-I. PMID 9595617.
  10. 123"Confidence Intervals for the Difference Between Two Correlated Proportions"(PDF). NCSS. Retrieved 2022-03-22.
  11. 12Agresti, Alan; Min, Yongyi (2005). "Simple improved confidence intervals for comparing matched proportions"(PDF). Statistics in Medicine. 24 (5): 729–740. doi:10.1002/sim.1781. PMID 15696504.
  12. Agresti, A.; Caffo, B. (2000). "Intervalos de confianza simples y efectivos para proporciones y diferencias de proporciones resultan de la suma de dos éxitos y dos fracasos". The American Statistician . 54 (4): 280– 288. doi : 10.1080/00031305.2000.10474560 .
  13. "11.5: La distribución multinomial" . Statistics LibreTexts . 2020-05-05 . Consultado el 2023-09-13 .
  14. "MultinomialCI - Intervalos de confianza para proporciones multinomiales" . CRAN. 11 de mayo de 2021. Consultado el 23 de marzo de 2024 .

Lecturas adicionales