En teoría de la probabilidad , la distribución multinomial es una generalización de la distribución binomial . Por ejemplo, modela la probabilidad de obtener resultados en cada cara de un dado de k caras lanzado n veces. Para n ensayos independientes , cada uno de los cuales resulta en un éxito en exactamente una de las k categorías, con una probabilidad de éxito fija para cada categoría, la distribución multinomial proporciona la probabilidad de cualquier combinación particular de números de éxitos para las distintas categorías.
Cuando k es 2 y n es 1, la distribución multinomial es la distribución de Bernoulli . Cuando k es 2 y n es mayor que 1, es la distribución binomial . Cuando k es mayor que 2 y n es 1, es la distribución categórica . El término "multinoulli" se usa a veces para la distribución categórica para enfatizar esta relación cuádruple (de modo que n determina el sufijo y k el prefijo).
La distribución de Bernoulli modela el resultado de un único ensayo de Bernoulli . En otras palabras, modela si lanzar una moneda (posiblemente sesgada ) una sola vez resultará en un éxito (obtener cara) o un fracaso (obtener cruz). La distribución binomial generaliza esto al número de caras obtenidas al realizar n lanzamientos independientes (ensayos de Bernoulli) de la misma moneda. La distribución multinomial modela el resultado de n experimentos, donde el resultado de cada ensayo tiene una distribución categórica , como lanzar un dado de k caras (posiblemente sesgado ) n veces.
Sea k un número finito fijo. Matemáticamente, tenemos k posibles resultados mutuamente excluyentes, con probabilidades correspondientes p 1 , ..., p k , y n ensayos independientes. Dado que los k resultados son mutuamente excluyentes y uno debe ocurrir, tenemos p i ≥ 0 para i = 1, ..., k y Si las variables aleatorias X i indican el número de veces que se observa el resultado número i en los n ensayos, el vector X = ( X 1 , ..., X k ) sigue una distribución multinomial con parámetros n y p , donde p = ( p 1 , ..., p k ). Si bien los ensayos son independientes, sus resultados X i son dependientes porque deben sumar n.
Definiciones
Función de masa de probabilidad
Supongamos que se realiza un experimento extrayendo n bolas de k colores diferentes de una bolsa, reponiendo las bolas extraídas después de cada extracción. Las bolas del mismo color son equivalentes. Denotemos como X i la variable que representa el número de bolas extraídas del color i ( i = 1, ..., k ) , y como p i la probabilidad de que una extracción dada sea del color i . La función de probabilidad de esta distribución multinomial es:
para enteros no negativos x 1 , ..., x k .
La función de probabilidad de masa se puede expresar utilizando la función gamma de la siguiente manera:
Esta forma muestra su semejanza con la distribución de Dirichlet , que es su distribución a priori conjugada .
Ejemplo
Supongamos que en una elección a tres bandas en un país grande, el candidato A obtuvo el 20% de los votos, el candidato B el 30% y el candidato C el 50%. Si se seleccionan seis votantes al azar, ¿cuál es la probabilidad de que haya exactamente un votante para el candidato A, dos para el candidato B y tres para el candidato C en la muestra?
Nota: Dado que asumimos que la población votante es grande, es razonable y permisible considerar que las probabilidades permanecen invariables una vez que se selecciona un votante para la muestra. Técnicamente hablando, esto es un muestreo sin reemplazo, por lo que la distribución correcta es la distribución hipergeométrica multivariada , pero las distribuciones convergen a medida que la población crece en comparación con un tamaño de muestra fijo . [ 1 ]
Propiedades
Normalización
La distribución multinomial se normaliza según:
donde la suma se realiza sobre todas las permutaciones dede tal manera que.
Valor esperado y varianza
El número esperado de veces que se observó el resultado i en n ensayos es
La matriz de covarianza es la siguiente. Cada elemento diagonal es la varianza de una variable aleatoria con distribución binomial y, por lo tanto, es
Las entradas fuera de la diagonal son las covarianzas :
para i , j distintos.
Todas las covarianzas son negativas porque, para un n fijo , un aumento en un componente de un vector multinomial requiere una disminución en otro componente.
Cuando estas expresiones se combinan en una matriz con elementos i y jEl resultado es una matriz de covarianza semidefinida positiva de k × k de rango k − 1. En el caso especial donde k = n y donde todos los p i son iguales, la matriz de covarianza es la matriz de centrado .
Las entradas de la matriz de correlación correspondiente son
Nótese que el número de ensayos n desaparece de esta expresión.
Cada uno de los k componentes por separado tiene una distribución binomial con parámetros n y p i , para el valor apropiado del subíndice i .
El soporte de la distribución multinomial es el conjunto
Su número de elementos es
Notación matricial
En notación matricial,
y
donde p T = la transpuesta del vector fila del vector columna p .
Visualización
Como secciones del triángulo de Pascal generalizado
Así como se puede interpretar la distribución binomial como secciones unidimensionales (1D) (normalizadas) del triángulo de Pascal , también se puede interpretar la distribución multinomial como secciones bidimensionales (triangulares) de la pirámide de Pascal , o secciones tridimensionales/cuádruples/superiores (en forma de pirámide) de análogos de dimensiones superiores del triángulo de Pascal. Esto revela una interpretación del rango de la distribución: "pirámides" equiláteras discretizadas en una dimensión arbitraria, es decir, un simplex con una cuadrícula.
Como coeficientes polinómicos
De manera similar, al igual que se puede interpretar la distribución binomial como los coeficientes polinomiales deCuando se expande, se puede interpretar la distribución multinomial como los coeficientes deal expandirse, teniendo en cuenta que solo los coeficientes deben sumar 1.
teoría de grandes desviaciones
Asintótica
Según la fórmula de Stirling , en el límite de, tenemosdonde las frecuencias relativasEn los datos se pueden interpretar como probabilidades de la distribución empírica., yes la divergencia de Kullback-Leibler .
Esta fórmula puede interpretarse de la siguiente manera.
Considerar, el espacio de todas las distribuciones posibles sobre las categoríasEs un simplex . Despuésmuestras independientes de la distribución categórica(que es como construimos la distribución multinomial), obtenemos una distribución empírica.
Según la fórmula asintótica, la probabilidad de que la distribución empíricase desvía de la distribución realdecae exponencialmente a medida que muestreamos más datos, a una tasa deCuantos más experimentos y más diferenteses deCuanto menor sea la probabilidad de observar una distribución empírica de este tipo, menos probable será.
Sies un subconjunto cerrado de, luego dividiendoen pedazos y razonando sobre la tasa de crecimiento deen cada pieza, obtenemos el teorema de Sanov , que establece que
Concentración en n grande
Debido al decaimiento exponencial , en grandes, casi toda la masa de probabilidad se concentra en un pequeño vecindario de. En este pequeño vecindario, podemos tomar el primer término no nulo en la expansión de Taylor depara obtener Esto se asemeja a la distribución gaussiana, lo que sugiere el siguiente teorema:
Teorema. En ellímite,converge en distribución a la distribución chi-cuadrado.
El espacio de todas las distribuciones sobre categoríases un simplex :y el conjunto de todas las posibles distribuciones empíricas después deLos experimentos son un subconjunto del simplex:. Es decir, es la intersección entrey la red.
Comoaumenta, la mayor parte de la masa de probabilidad se concentra en un subconjunto decercay la distribución de probabilidad cercase aproxima bien medianteDe esto, vemos que el subconjunto sobre el cual se concentra la masa tiene un radio del orden de, pero los puntos en el subconjunto están separados por una distancia del orden de, por lo tanto en general, los puntos se fusionan en un continuo. Para convertir esto de una distribución de probabilidad discreta a una densidad de probabilidad continua, necesitamos multiplicar por el volumen ocupado por cada punto deenSin embargo, por simetría, cada punto ocupa exactamente el mismo volumen (excepto un conjunto insignificante en el límite), por lo que obtenemos una densidad de probabilidad., dóndees una constante.
Finalmente, dado que el simplexno es todo, pero solo dentro de unEn el plano -dimensional, obtenemos el resultado deseado.
Concentración condicional para n grande
El fenómeno de concentración descrito anteriormente puede generalizarse fácilmente al caso en que condicionamos a restricciones independientes. Esta es la justificación teórica de la prueba chi-cuadrado de Pearson .
Teorema.
- Funciones dadas, de tal manera que sean continuamente diferenciables en un entorno dey los vectoresson linealmente independientes;
- secuencias dadas, de tal manera que asintóticamentepara cada;
- luego para la distribución multinomial condicionada a restricciones, tenemos la cantidadconvergente en distribución aallímite.
En el caso de que todosson iguales, esto se reduce a la concentración de entropías alrededor de la entropía máxima . [ 2 ] [ 3 ]
Este teorema se puede demostrar partiendo del caso anterior y luego tomando la condición sobre las restricciones.
Distribuciones relacionadas
En algunos campos, como el procesamiento del lenguaje natural , las distribuciones categóricas y multinomiales son sinónimas, y es común hablar de una distribución multinomial cuando en realidad se quiere decir una distribución categórica . Esto se debe a que a veces es conveniente expresar el resultado de una distribución categórica como un vector "1 de k" (un vector con un elemento que contiene un 1 y todos los demás elementos que contienen un 0) en lugar de como un número entero en el rango; en esta forma, una distribución categórica es equivalente a una distribución multinomial sobre un solo ensayo.
- Cuando k = 2, la distribución multinomial es la distribución binomial .
- Distribución categórica , la distribución de cada ensayo; para k = 2, esta es la distribución de Bernoulli .
- La distribución de Dirichlet es la distribución a priori conjugada de la distribución multinomial en estadística bayesiana .
- Distribución de Dirichlet-multinomial .
- Distribución beta-binomial .
- Distribución multinomial negativa
- Principio de Hardy-Weinberg (una distribución trinomial con probabilidades)
Inferencia estadística
Pruebas de equivalencia para distribuciones multinomiales
El objetivo de las pruebas de equivalencia es establecer la concordancia entre una distribución multinomial teórica y las frecuencias de conteo observadas. La distribución teórica puede ser una distribución multinomial completamente especificada o una familia paramétrica de distribuciones multinomiales.
Dejardenotemos una distribución multinomial teórica y seaser una distribución subyacente verdadera. Las distribucionesyse consideran equivalentes sia distanciay un parámetro de toleranciaEl problema de la prueba de equivalencia esversusLa verdadera distribución subyacentees desconocido. En cambio, las frecuencias de conteose observan, dondees un tamaño de muestra. Una prueba de equivalencia utilizarechazar. Sientonces se puede rechazar la equivalencia entreyse muestra a un nivel de significancia dado. La prueba de equivalencia para la distancia euclidiana se puede encontrar en el libro de texto de Wellek (2010). [ 4 ] La prueba de equivalencia para la distancia de variación total se desarrolla en Ostrovski (2017). [ 5 ] La prueba de equivalencia exacta para la distancia acumulativa específica se propone en Frey (2009). [ 6 ]
La distancia entre la distribución subyacente verdaderay una familia de distribuciones multinomialesse define por. Entonces, el problema de la prueba de equivalencia viene dado poryLa distanciaGeneralmente se calcula mediante optimización numérica. Las pruebas para este caso se desarrollaron recientemente en Ostrovski (2018). [ 7 ]
Intervalos de confianza para la diferencia de dos proporciones
En el contexto de una distribución multinomial, la construcción de intervalos de confianza para la diferencia entre las proporciones de observaciones de dos eventos,requiere la incorporación de la covarianza negativa entre los estimadores de la muestra.y.
Parte de la literatura sobre el tema se centró en el caso de uso de datos binarios de pares coincidentes, lo que requiere una atención cuidadosa al traducir las fórmulas al caso general depara cualquier distribución multinomial. Las fórmulas de esta sección serán generalizadas, mientras que las de la siguiente sección se centrarán en el caso de uso de datos binarios de pares emparejados.
El error estándar (EE) de Wald de la diferencia de proporción se puede estimar utilizando: [ 8 ] : 378 [ 9 ]
Para unIntervalo de confianza aproximado , el margen de error puede incorporar el cuantil apropiado de la distribución normal estándar , como sigue:
A medida que el tamaño de la muestra () aumenta, las proporciones de la muestra seguirán aproximadamente una distribución normal multivariada , gracias al teorema del límite central multidimensional (y también podría demostrarse utilizando el teorema de Cramér-Wold ). Por lo tanto, su diferencia también será aproximadamente normal. Además, estos estimadores son débilmente consistentes y al sustituirlos en el estimador SE también se vuelve débilmente consistente. Por lo tanto, gracias al teorema de Slutsky , la cantidad pivotal Sigue aproximadamente la distribución normal estándar . Y a partir de eso, se deriva directamente el intervalo de confianza aproximado anterior .
El SE se puede construir utilizando el cálculo de la varianza de la diferencia de dos variables aleatorias :
Una modificación que incluye una corrección de continuidad añadeal margen de error de la siguiente manera: [ 10 ] : 102–103
Otra alternativa es recurrir a un estimador bayesiano que utiliza la distribución a priori de Jeffreys , lo que lleva a utilizar una distribución de Dirichlet , con todos los parámetros iguales a 0,5, como distribución a priori. La distribución a posteriori serán los cálculos anteriores, pero después de sumar 1/2 a cada uno de los k elementos, lo que conlleva un aumento general del tamaño de la muestra en. Este método se desarrolló originalmente para una distribución multinomial con cuatro eventos y se conoce como wald+2 , para analizar datos de pares emparejados (véase la siguiente sección para más detalles). [ 11 ]
Esto conduce al siguiente SE:
Lo cual se puede simplemente insertar en la fórmula original de Wald de la siguiente manera:
Ocurrencia y aplicaciones
Intervalos de confianza para la diferencia en datos binarios de pares emparejados (utilizando distribución multinomial con k=4 )
En el caso de datos binarios de pares emparejados, una tarea común es construir el intervalo de confianza de la diferencia en la proporción de los eventos emparejados. Por ejemplo, podríamos tener una prueba para detectar alguna enfermedad y querer verificar sus resultados en una población determinada en dos momentos (1 y 2) para comprobar si hubo un cambio en la proporción de casos positivos de la enfermedad durante ese período.
Estos escenarios se pueden representar mediante una tabla de contingencia de dos por dos con el número de elementos que tuvieron cada una de las combinaciones de eventos. Podemos usar una f pequeña para las frecuencias de muestreo:y F mayúscula para frecuencias poblacionales:Estas cuatro combinaciones podrían modelarse como provenientes de una distribución multinomial (con cuatro resultados posibles). Los tamaños de la muestra y la población pueden ser n y N respectivamente. En tal caso, resulta de interés construir un intervalo de confianza para la diferencia de proporciones a partir de las marginales de la siguiente tabla de contingencia (muestreada):
En este caso, comprobar la diferencia en las proporciones marginales significa que nos interesa utilizar las siguientes definiciones:,Y la diferencia para la que queremos construir intervalos de confianza es:
Por lo tanto, intervalos de confianza para las proporciones marginales positivas () es lo mismo que construir un intervalo de confianza para la diferencia de las proporciones de la diagonal secundaria de la tabla de contingencia de dos por dos ().
El cálculo de un valor p para dicha diferencia se conoce como prueba de McNemar . La construcción de un intervalo de confianza a su alrededor se puede realizar utilizando los métodos descritos anteriormente para los intervalos de confianza para la diferencia de dos proporciones .
Los intervalos de confianza de Wald de la sección anterior se pueden aplicar a este contexto y aparecen en la literatura con notaciones alternativas. Específicamente, el error estándar (EE) que se suele presentar se basa en las frecuencias de la tabla de contingencia en lugar de las proporciones de la muestra. Por ejemplo, los intervalos de confianza de Wald, proporcionados anteriormente, se pueden escribir como: [ 10 ] : 102–103
Investigaciones posteriores en la literatura han identificado varias deficiencias tanto en el método de Wald como en el método de Wald con corrección de continuidad, y se han propuesto otros métodos para su aplicación práctica. [ 10 ]
Una de estas modificaciones incluye el Wald+2 de Agresti y Min (similar a algunos de sus otros trabajos [ 12 ] ) en el que cada frecuencia celular tenía un extraañadido a ello. [ 11 ] Esto lleva a los intervalos de confianza Wald+2 . En una interpretación bayesiana, esto es como construir los estimadores tomando como prior una distribución de Dirichlet con todos los parámetros iguales a 0,5 (que es, de hecho, la prior de Jeffreys ). El +2 en el nombre wald+2 ahora puede tomarse como que en el contexto de una tabla de contingencia de dos por dos, que es una distribución multinomial con cuatro eventos posibles, entonces como agregamos 1/2 una observación a cada uno de ellos, entonces esto se traduce en una adición general de 2 observaciones (debido a la prior).
Esto da lugar al siguiente SE modificado para el caso de datos de pares coincidentes:
Lo cual se puede simplemente insertar en la fórmula original de Wald de la siguiente manera:
Otras modificaciones incluyen el Wald ajustado de Bonett y Price , y la puntuación de Newcombe .
Métodos computacionales
generación de variables aleatorias
Primero, reordena los parámetros.de manera que estén ordenados en orden descendente (esto es solo para acelerar el cálculo y no es estrictamente necesario). Ahora, para cada ensayo, extraiga una variable auxiliar X de una distribución uniforme (0, 1). El resultado resultante es el componente
{ X j = 1, X k = 0 para k ≠ j } es una observación de la distribución multinomial con y n = 1. La suma de repeticiones independientes de este experimento es una observación de una distribución multinomial con n igual al número de dichas repeticiones.
Muestreo mediante muestras binomiales condicionales repetidas
Dados los parámetrosy un total para la muestrade tal manera que, es posible muestrear secuencialmente para el número en un estado arbitrario, dividiendo el espacio de estados eny no-, condicionado a cualquier muestra previa ya tomada, repetidamente.
Algoritmo: Muestreo binomial condicional secuencial
S = n rho = 1 para i en [ 1 ,k-1 ] : si rho ! = 0 : X [ i ] ~ Binom ( S,p [ i ] /rho ) sino X [ i ] = 0 S = S - X [ i ] rho = rho - p [ i ] X [ k ] = S De forma heurística, cada aplicación del muestreo binomial reduce el número disponible para muestrear y las probabilidades condicionales se actualizan igualmente para garantizar la coherencia lógica. [ 13 ]
Implementaciones de software
- El paquete MultinomialCI de R permite el cálculo de intervalos de confianza simultáneos para las probabilidades de una distribución multinomial dado un conjunto de observaciones. [ 14 ]
Véase también
Referencias
- ↑ "probabilidad - muestreo de distribución multinomial" . Validado cruzadamente . Consultado el 28 de julio de 2022 .
- ↑ Loukas, Orestis; Chung, Ho Ryun (abril de 2022). "Distribuciones categóricas de entropía máxima bajo restricciones marginales". arXiv : 2204.03406 [ hep-th ].
- ↑ Loukas, Orestis; Chung, Ho Ryun (junio de 2022). "Caracterización basada en la entropía de las restricciones de modelado". arXiv : 2206.14105 [ stat.ME ].
- ↑ Wellek, Stefan (2010). Prueba de hipótesis estadísticas de equivalencia y no inferioridad . Chapman and Hall/CRC. ISBN 978-1439808184.
- ↑Ostrovski, Vladimir (May 2017). "Testing equivalence of multinomial distributions". Statistics & Probability Letters. 124: 77–82. doi:10.1016/j.spl.2017.01.004. S2CID 126293429.Official web link (subscription required). Alternate, free web link.
- ↑Frey, Jesse (March 2009). "An exact multinomial test for equivalence". The Canadian Journal of Statistics. 37: 47–59. doi:10.1002/cjs.10000. S2CID 122486567.Official web link (subscription required).
- ↑Ostrovski, Vladimir (March 2018). "Testing equivalence to families of multinomial distributions with application to the independence model". Statistics & Probability Letters. 139: 61–66. doi:10.1016/j.spl.2018.03.014. S2CID 126261081.Official web link (subscription required). Alternate, free web link.
- ↑Fleiss, Joseph L.; Levin, Bruce; Paik, Myunghee Cho (2003). Statistical Methods for Rates and Proportions (3rd ed.). Hoboken, N.J: J. Wiley. p. 760. ISBN 9780471526292.
- ↑Newcombe, R. G. (1998). "Interval Estimation for the Difference Between Independent Proportions: Comparison of Eleven Methods". Statistics in Medicine. 17 (8): 873–890. doi:10.1002/(SICI)1097-0258(19980430)17:8<873::AID-SIM779>3.0.CO;2-I. PMID 9595617.
- 123"Confidence Intervals for the Difference Between Two Correlated Proportions"(PDF). NCSS. Retrieved 2022-03-22.
- 12Agresti, Alan; Min, Yongyi (2005). "Simple improved confidence intervals for comparing matched proportions"(PDF). Statistics in Medicine. 24 (5): 729–740. doi:10.1002/sim.1781. PMID 15696504.
- ↑ Agresti, A.; Caffo, B. (2000). "Intervalos de confianza simples y efectivos para proporciones y diferencias de proporciones resultan de la suma de dos éxitos y dos fracasos". The American Statistician . 54 (4): 280– 288. doi : 10.1080/00031305.2000.10474560 .
- ↑ "11.5: La distribución multinomial" . Statistics LibreTexts . 2020-05-05 . Consultado el 2023-09-13 .
- ↑ "MultinomialCI - Intervalos de confianza para proporciones multinomiales" . CRAN. 11 de mayo de 2021. Consultado el 23 de marzo de 2024 .
Lecturas adicionales
- Evans, Morton; Hastings, Nicholas; Peacock, Brian (2000). Distribuciones estadísticas (3.ª ed.). Nueva York: Wiley. págs. 134-136 . ISBN 0-471-37124-6.
- Weisstein, Eric W. "Distribución multinomial" . MathWorld . Wolfram Research .
- Distribuciones discretas
- Distribuciones discretas multivariadas
- Temas factoriales y binomiales
- Distribuciones familiares exponenciales