Articulo de referencia

Principio de máxima entropía

El principio de máxima entropía establece que, entre todas las distribuciones de probabilidad compatibles con un conjunto dado de restricciones (como la normalización o valores ...

El principio de máxima entropía establece que, entre todas las distribuciones de probabilidad compatibles con un conjunto dado de restricciones (como la normalización o valores esperados específicos), debe seleccionarse la distribución que maximiza la entropía de Shannon . Esto da como resultado la distribución menos restrictiva compatible con las restricciones conocidas, sin introducir ninguna estructura más allá de lo que se deduce lógicamente de la información disponible.

La justificación reside en que la entropía mide el contenido informativo esperado (o la sorpresa logarítmica) de los resultados en relación con una medida de referencia específica. Maximizar la entropía garantiza que no se imponga ninguna estructura adicional más allá de las restricciones establecidas. Cualquier alternativa con menor entropía codificaría una regularidad extra no requerida por dichas restricciones y, por lo tanto, equivaldría a introducir información no justificada.

Es importante que la entropía se defina en relación con una medida o distribución a priori especificada. En casos discretos, la entropía de Shannon se define en relación con la medida de conteo (o una ponderación a priori especificada explícitamente). En casos continuos, la entropía diferencial depende de la elección de coordenadas y no es invariante bajo reparametrización. Por esta razón, la formulación continua basada en principios maximiza la entropía relativa (equivalentemente, minimiza la divergencia de Kullback-Leibler ) con respecto a una medida de referencia o densidad a priori m(x) especificada, típicamente maximizando

pag(incógnita)registropag(incógnita)metro(incógnita)dincógnita{\displaystyle -\int p(x)\,\log {\frac {p(x)}{m(x)}}\,dx}

Sujeto a las restricciones dadas. Esta formulación es invariante ante cambios de variables y explicita el papel de la medida previa subyacente.

Historia

El principio fue expuesto por primera vez por E. T. Jaynes en dos artículos en 1957, [ 1 ] [ 2 ] donde enfatizó una correspondencia natural entre la mecánica estadística y la teoría de la información . En particular, Jaynes argumentó que el método gibbsiano de la mecánica estadística es válido, al tiempo que sostuvo que la entropía de la mecánica estadística y la entropía de la información de la teoría de la información son el mismo concepto. En consecuencia, la mecánica estadística debe considerarse una aplicación particular de una herramienta general de inferencia lógica y teoría de la información.

Descripción general

En la mayoría de los casos prácticos, los datos previos o la información verificable se proporcionan mediante un conjunto de cantidades conservadas (valores promedio de ciertas funciones de momento), asociadas a la distribución de probabilidad en cuestión. Esta es la forma más frecuente de utilizar el principio de máxima entropía en termodinámica estadística . Otra posibilidad consiste en prescribir ciertas simetrías de la distribución de probabilidad. La equivalencia entre cantidades conservadas y grupos de simetría correspondientes implica una equivalencia similar para estas dos formas de especificar la información verificable en el método de máxima entropía.

El principio de máxima entropía también es necesario para garantizar la unicidad y la coherencia de las asignaciones de probabilidad obtenidas mediante diferentes métodos, en particular la mecánica estadística y la inferencia lógica .

El principio de máxima entropía explicita nuestra libertad para utilizar diferentes formas de datos previos . Como caso particular, se puede adoptar una densidad de probabilidad previa uniforme ( principio de indiferencia de Laplace , a veces llamado principio de razón insuficiente). Por lo tanto, el principio de máxima entropía no es simplemente una forma alternativa de ver los métodos habituales de inferencia de la estadística clásica, sino que representa una generalización conceptual significativa de dichos métodos.

Sin embargo, estas afirmaciones no implican que no sea necesario demostrar que los sistemas termodinámicos son ergódicos para justificar su tratamiento como un conjunto estadístico .

En lenguaje común, el principio de máxima entropía puede interpretarse como una pretensión de modestia epistémica o de máxima ignorancia. La distribución seleccionada es aquella que menos pretende estar informada más allá de los datos previos establecidos; es decir, aquella que admite la mayor ignorancia respecto de dichos datos.

Información comprobable

El principio de máxima entropía es útil explícitamente solo cuando se aplica a información comprobable . La información comprobable es una afirmación sobre una distribución de probabilidad cuya veracidad o falsedad está bien definida. Por ejemplo, las afirmaciones

la expectativa de la variableincógnita{\displaystyle x}es 2,87

y pag2+pag3>0,6{\displaystyle p_{2}+p_{3}>0,6}

(dóndepag2{\displaystyle p_{2}}ypag3{\displaystyle p_{3}}son probabilidades de eventos) son enunciados de información comprobable.

Dado que se dispone de información verificable, el procedimiento de máxima entropía consiste en buscar la distribución de probabilidad que maximiza la entropía de la información , sujeta a las restricciones de dicha información. Este problema de optimización con restricciones se resuelve típicamente mediante el método de los multiplicadores de Lagrange . [ 3 ]

La maximización de la entropía sin información comprobable respeta la "restricción" universal de que la suma de las probabilidades sea uno. Bajo esta restricción, la distribución de probabilidad discreta de máxima entropía es la distribución uniforme ,

pagi=1norte For all i{1,,norte}.{\displaystyle p_{i}={\frac {1}{n}}\ {\rm {para\ todo}}\ i\in \{\,1,\dots ,n\,\}.}

Aplicaciones

El principio de máxima entropía se aplica comúnmente de dos maneras a los problemas de inferencia:

Probabilidades previas

El principio de máxima entropía se utiliza a menudo para obtener distribuciones de probabilidad previas para la inferencia bayesiana . Jaynes fue un firme defensor de este enfoque, afirmando que la distribución de máxima entropía representaba la distribución menos informativa. [ 4 ] Actualmente, existe una gran cantidad de literatura dedicada a la obtención de distribuciones previas de máxima entropía y su relación con la codificación de canales . [ 5 ] [ 6 ] [ 7 ] [ 8 ]

Probabilidades posteriores

La entropía máxima es una regla de actualización suficiente para el probabilismo radical . La cinemática de probabilidad de Richard Jeffrey es un caso especial de inferencia de entropía máxima . Sin embargo, la entropía máxima no es una generalización de todas estas reglas de actualización suficientes. [ 9 ]

modelos de máxima entropía

Alternativamente, este principio se suele aplicar a la especificación de modelos: en este caso, se asume que los datos observados constituyen la información verificable. Estos modelos se utilizan ampliamente en el procesamiento del lenguaje natural . Un ejemplo de este tipo de modelo es la regresión logística , que corresponde al clasificador de máxima entropía para observaciones independientes.

El principio de máxima entropía también se ha aplicado en economía y asignación de recursos. Por ejemplo, el modelo de división justa de Boltzmann utiliza la distribución de máxima entropía (de Boltzmann) para asignar recursos o ingresos entre individuos, proporcionando un enfoque probabilístico para la justicia distributiva. [ 10 ]

Las familias exponenciales son una clase importante de modelos de probabilidad que se pueden derivar utilizando el principio de máxima entropía [ 11 ] .

Estimación de la densidad de probabilidad

Una de las principales aplicaciones del principio de máxima entropía se encuentra en la estimación de densidad discreta y continua . [ 12 ] [ 13 ] De forma similar a los estimadores de máquinas de vectores de soporte , el principio de máxima entropía puede requerir la solución de un problema de programación cuadrática y, por lo tanto, proporcionar un modelo de mezcla dispersa como estimador de densidad óptimo. Una ventaja importante del método es su capacidad para incorporar información previa en la estimación de densidad. [ 14 ]

Solución general para la distribución de máxima entropía con restricciones lineales.

Caso discreto

Tenemos información verificable I sobre una cantidad x que toma valores en { x 1 , x 2 ,..., x n }. Suponemos que esta información tiene la forma de m restricciones sobre las esperanzas de las funciones f k ; es decir, requerimos que nuestra distribución de probabilidad satisfaga las restricciones de desigualdad/igualdad de momentos:

i=1nortePr(incógnitai)Fk(incógnitai)Fkk=1,,metro.{\displaystyle \sum _{i=1}^{n}\Pr(x_{i})f_{k}(x_{i})\geq F_{k}\qquad k=1,\ldots ,m.}

donde elFk{\displaystyle F_{k}}son observables. También requerimos que la densidad de probabilidad sume uno, lo que puede verse como una restricción primitiva sobre la función identidad y un observable igual a 1 que da la restricción

i=1nortePr(incógnitai)=1.{\displaystyle \sum _{i=1}^{n}\Pr(x_{i})=1.}

La distribución de probabilidad con máxima entropía de información sujeta a estas restricciones de desigualdad/igualdad es de la forma: [ 12 ]

Pr(incógnitai)=1Z(λ1,,λmetro)exp[λ1F1(incógnitai)++λmetroFmetro(incógnitai)],{\displaystyle \Pr(x_{i})={\frac {1}{Z(\lambda _{1},\ldots ,\lambda _{m})}}\exp \left[\lambda _{1}f_{1}(x_{i})+\cdots +\lambda _{m}f_{m}(x_{i})\right],}

para algunosλ1,,λmetro{\displaystyle \lambda _{1},\ldots ,\lambda _{m}}A veces se la denomina distribución de Gibbs . La constante de normalización se determina mediante:

Z(λ1,,λmetro)=i=1norteexp[λ1F1(incógnitai)++λmetroFmetro(incógnitai)],{\displaystyle Z(\lambda _{1},\ldots ,\lambda _{m})=\sum _{i=1}^{n}\exp \left[\lambda _{1}f_{1}(x_{i})+\cdots +\lambda _{m}f_{m}(x_{i})\right],}

y se la denomina convencionalmente función de partición . (El teorema de Pitman-Koopman establece que la condición necesaria y suficiente para que una distribución de muestreo admita estadísticas suficientes de dimensión acotada es que tenga la forma general de una distribución de máxima entropía).

Los parámetros λ k son multiplicadores de Lagrange. En el caso de restricciones de igualdad, sus valores se determinan a partir de la solución de las ecuaciones no lineales.

Fk=λkregistroZ(λ1,,λmetro).{\displaystyle F_{k}={\frac {\partial }{\partial \lambda _{k}}}\log Z(\lambda _{1},\ldots ,\lambda _{m}).}

En el caso de restricciones de desigualdad, los multiplicadores de Lagrange se determinan a partir de la solución de un programa de optimización convexa con restricciones lineales. [ 12 ] En ambos casos, no hay una solución en forma cerrada , y el cálculo de los multiplicadores de Lagrange generalmente requiere métodos numéricos .

caso continuo

Para distribuciones continuas , no se puede utilizar la entropía de Shannon, ya que solo está definida para espacios de probabilidad discretos. En su lugar, Edwin Jaynes (1963, 1968, 2003) propuso la siguiente fórmula, que está estrechamente relacionada con la entropía relativa (véase también entropía diferencial ).

Hdo=pag(incógnita)registropag(incógnita)q(incógnita)dincógnita{\displaystyle H_{c}=-\int p(x)\log {\frac {p(x)}{q(x)}}\,dx}

donde q ( x ), que Jaynes denominó la " medida invariante ", es proporcional a la densidad límite de puntos discretos . Por ahora, asumiremos que q es conocida; la analizaremos con más detalle una vez que se presenten las ecuaciones de solución.

Una magnitud estrechamente relacionada, la entropía relativa, se define habitualmente como la divergencia de Kullback-Leibler de p respecto a q (aunque a veces, de forma confusa, se define como su opuesto). El principio de inferencia que consiste en minimizarla, debido a la divergencia de Kullback, se conoce como el Principio de Mínima Información Discriminatoria .

Tenemos información verificable I sobre una cantidad x que toma valores en un intervalo de los números reales (todas las integrales siguientes se realizan sobre este intervalo). Suponemos que esta información tiene la forma de m restricciones sobre las esperanzas de las funciones f k , es decir, requerimos que nuestra función de densidad de probabilidad satisfaga las restricciones de momentos de desigualdad (o puramente igualdad):

pag(incógnita)Fk(incógnita)dincógnitaFkk=1,,metro.{\displaystyle \int p(x)f_{k}(x)\,dx\geq F_{k}\qquad k=1,\dotsc ,m.}

donde elFk{\displaystyle F_{k}}son observables. También requerimos que la densidad de probabilidad se integre a uno, lo que puede verse como una restricción primitiva sobre la función identidad y un observable igual a 1 que da la restricción

pag(incógnita)dincógnita=1.{\displaystyle \int p(x)\,dx=1.}

La función de densidad de probabilidad con H c máximo sujeta a estas restricciones es: [ 15 ]

pag(incógnita)=q(incógnita)exp[λ1F1(incógnita)++λmetroFmetro(incógnita)]Z(λ1,,λmetro){\displaystyle p(x)={\frac {q(x)\exp \left[\lambda _{1}f_{1}(x)+\dotsb +\lambda _{m}f_{m}(x)\right]}{Z(\lambda _{1},\dotsc ,\lambda _{m})}}}

con la función de partición determinada por

Z(λ1,,λmetro)=q(incógnita)exp[λ1F1(incógnita)++λmetroFmetro(incógnita)]dincógnita.{\displaystyle Z(\lambda _{1},\dotsc ,\lambda _{m})=\int q(x)\exp \left[\lambda _{1}f_{1}(x)+\dotsb +\lambda _{m}f_{m}(x)\right]\,dx.}

Como en el caso discreto, en el caso en que todas las restricciones de momento son igualdades, los valores de losλk{\displaystyle \lambda _{k}}Los parámetros se determinan mediante el sistema de ecuaciones no lineales:

Fk=λkregistroZ(λ1,,λmetro).{\displaystyle F_{k}={\frac {\partial }{\partial \lambda _{k}}}\log Z(\lambda _{1},\dotsc ,\lambda _{m}).}

En el caso de restricciones de momentos de desigualdad, los multiplicadores de Lagrange se determinan a partir de la solución de un programa de optimización convexa . [ 13 ]

La función de medida invariante q ( x ) se puede comprender mejor suponiendo que se sabe que x toma valores solo en el intervalo acotado ( a , b ), y que no se proporciona ninguna otra información. Entonces, la función de densidad de probabilidad de entropía máxima es

pag(incógnita)=Aq(incógnita),a<incógnita<b{\displaystyle p(x)=A\cdot q(x),\qquad a<x<b}

donde A es una constante de normalización. La función de medida invariante es en realidad la función de densidad previa que codifica la "falta de información relevante". No puede determinarse mediante el principio de máxima entropía, y debe determinarse mediante algún otro método lógico, como el principio de grupos de transformación o la teoría de la marginalización .

Ejemplos

Para ver varios ejemplos de distribuciones de entropía máxima, consulte el artículo sobre distribuciones de probabilidad de entropía máxima .

Justificaciones del principio de máxima entropía

Los defensores del principio de máxima entropía justifican su uso en la asignación de probabilidades de diversas maneras, incluyendo los dos argumentos siguientes. Estos argumentos parten del supuesto de que se utiliza la probabilidad bayesiana y, por lo tanto, están sujetos a los mismos postulados.

La entropía de la información como medida de la "falta de información"

Consideremos una distribución de probabilidad discreta entremetro{\displaystyle m}proposiciones mutuamente excluyentes . La distribución más informativa se produciría cuando se supiera que una de las proposiciones es verdadera. En ese caso, la entropía de la información sería igual a cero. La distribución menos informativa se produciría cuando no haya razón para favorecer ninguna de las proposiciones sobre las demás. En ese caso, la única distribución de probabilidad razonable sería uniforme, y entonces la entropía de la información sería igual a su valor máximo posible.registrometro{\displaystyle \log m}Por lo tanto, la entropía de la información puede considerarse una medida numérica que describe cuán poco informativa es una distribución de probabilidad particular, que va desde cero (completamente informativa) hastaregistrometro{\displaystyle \log m}(completamente inútil).

Según este argumento, al elegir la distribución con la máxima entropía permitida por nuestra información, estamos eligiendo la distribución menos informativa posible. Elegir una distribución con menor entropía implicaría asumir información que no poseemos. Por lo tanto, la distribución de máxima entropía es la única distribución razonable. La dependencia de la solución con respecto a la medida dominante representada pormetro(incógnita){\displaystyle m(x)}Sin embargo, esto es una fuente de críticas al enfoque, ya que esta medida dominante es, de hecho, arbitraria. [ 16 ]

La derivación de Wallis

El siguiente argumento es el resultado de una sugerencia que Graham Wallis le hizo a E. T. Jaynes en 1962. [ 17 ] Es esencialmente el mismo argumento matemático utilizado para la estadística de Maxwell-Boltzmann en mecánica estadística , aunque el énfasis conceptual es bastante diferente. Tiene la ventaja de ser estrictamente combinatorio, sin hacer referencia a la entropía de la información como medida de «incertidumbre», «falta de información» o cualquier otro concepto definido de forma imprecisa. La función de entropía de la información no se asume a priori , sino que se encuentra en el transcurso del argumento; y este conduce naturalmente al procedimiento de maximizar la entropía de la información, en lugar de tratarla de alguna otra manera.

Supongamos que un individuo desea realizar una asignación de probabilidad entremetro{\displaystyle m}proposiciones mutuamente excluyentes . Tienen información comprobable, pero no están seguros de cómo incluirla en su evaluación de probabilidad. Por lo tanto, conciben el siguiente experimento aleatorio. Distribuiránnorte{\displaystyle N}cuantos de probabilidad (cada uno vale1/norte{\displaystyle 1/N}) al azar entre losmetro{\displaystyle m}posibilidades. (Uno podría imaginar que lanzaránnorte{\displaystyle N}bolas enmetro{\displaystyle m}lanzar cubos con los ojos vendados. Para que sea lo más justo posible, cada lanzamiento debe ser independiente de cualquier otro, y todos los cubos deben ser del mismo tamaño. Una vez realizado el experimento, comprobarán si la asignación de probabilidad obtenida es consistente con su información. (Para que este paso sea exitoso, la información debe ser una restricción dada por un conjunto abierto en el espacio de medidas de probabilidad). Si es inconsistente, la rechazarán e intentarán de nuevo. Si es consistente, su evaluación será

pagi=norteinorte{\displaystyle p_{i}={\frac {n_{i}}{N}}}

dóndepagi{\displaystyle p_{i}}es la probabilidad de lai{\displaystyle i}la proposición, mientras que n i es el número de cuantos que se asignaron a lai{\displaystyle i}La proposición (es decir, el número de bolas que terminaron en el cubo)i{\displaystyle i}).

Ahora, para reducir la "granularidad" de la asignación de probabilidad, será necesario utilizar un número bastante grande de cuantos de probabilidad. En lugar de realizar realmente, y posiblemente tener que repetir, el experimento aleatorio bastante largo, el protagonista decide simplemente calcular y utilizar el resultado más probable. La probabilidad de cualquier resultado particular es la distribución multinomial ,

PAGr(pag)=Wmetronorte{\displaystyle Pr(\mathbf {p} )=W\cdot m^{-N}}

dónde

W=norte¡norte1¡norte2¡nortemetro¡{\displaystyle W={\frac {N!}{n_{1}!\,n_{2}!\,\dotsb \,n_{m}!}}}

A veces se la conoce como la multiplicidad del resultado.

El resultado más probable es aquel que maximiza la multiplicidad.W{\displaystyle W}En lugar de maximizarW{\displaystyle W}directamente, el protagonista podría maximizar de forma equivalente cualquier función monótona creciente deW{\displaystyle W}Deciden maximizar

1norteregistroW=1norteregistronorte¡norte1¡norte2¡nortemetro¡=1norteregistronorte¡(nortepag1)¡(nortepag2)¡(nortepagmetro)¡=1norte(registronorte¡i=1metroregistro((nortepagi)¡)).{\displaystyle {\begin{aligned}{\frac {1}{N}}\log W&={\frac {1}{N}}\log {\frac {N!}{n_{1}!\,n_{2}!\,\dotsb \,n_{m}!}}\\[6pt]&={\frac {1}{N}}\log {\frac {N!}{(Np_{1})!\,(Np_{2})!\,\dotsb \,(Np_{m})!}}\\[6pt]&={\frac {1}{N}}\left(\log N!-\sum _{i=1}^{m}\log((Np_{i})!)\right).\end{aligned}}}

En este punto, para simplificar la expresión, el protagonista toma el límite comonorte{\displaystyle N\to \infty }, es decir, a medida que los niveles de probabilidad pasan de valores discretos granulados a valores continuos suaves. Usando la aproximación de Stirling , encuentran

límitenorte(1norteregistroW)=1norte(norteregistronortei=1metronortepagiregistro(nortepagi))=registronortei=1metropagiregistro(nortepagi)=registronorteregistronortei=1metropagii=1metropagiregistropagi=(1i=1metropagi)registronortei=1metropagiregistropagi=i=1metropagiregistropagi=H(pag).{\displaystyle {\begin{aligned}\lim _{N\to \infty }\left({\frac {1}{N}}\log W\right)&={\frac {1}{N}}\left(N\log N-\sum _{i=1}^{m}Np_{i}\log(Np_{i})\right)\\[6pt]&=\log N-\sum _{i=1}^{m}p_{i}\log(Np_{i})\\[6pt]&=\log N-\log N\sum _{i=1}^{m}p_{i}-\sum _{i=1}^{m}p_{i}\log p_{i}\\[6pt]&=\left(1-\sum _{i=1}^{m}p_{i}\right)\log N-\sum _{i=1}^{m}p_{i}\log p_{i}\\[6pt]&=-\sum _{i=1}^{m}p_{i}\log p_{i}\\[6pt]&=H(\mathbf {p} ).\end{aligned}}}

Lo único que le queda por hacer al protagonista es maximizar la entropía bajo las restricciones de la información verificable. Han descubierto que la distribución de máxima entropía es la más probable de todas las distribuciones aleatorias "justas", en el límite cuando los niveles de probabilidad pasan de discretos a continuos.

Compatibilidad con el teorema de Bayes

Giffin y Caticha (2007) afirman que el teorema de Bayes y el principio de máxima entropía son totalmente compatibles y pueden considerarse casos especiales del "método de máxima entropía relativa". Aseguran que este método reproduce todos los aspectos de los métodos de inferencia bayesiana ortodoxos. Además, este nuevo método permite abordar problemas que no podrían resolverse individualmente ni con el principio de máxima entropía ni con los métodos bayesianos ortodoxos. Asimismo, contribuciones recientes (Lazar 2003 y Schennach 2005) demuestran que los enfoques de inferencia frecuentistas basados ​​en la entropía relativa (como la verosimilitud empírica y la verosimilitud empírica con sesgo exponencial , véanse, por ejemplo, Owen 2001 y Kitamura 2006) pueden combinarse con información previa para realizar análisis bayesianos posteriores.

Jaynes afirmó que el teorema de Bayes era una forma de calcular una probabilidad, mientras que la entropía máxima era una forma de asignar una distribución de probabilidad previa. [ 18 ]

Sin embargo, conceptualmente es posible calcular una distribución posterior directamente a partir de una distribución previa dada, utilizando el principio de mínima entropía cruzada (o el principio de máxima entropía, que es un caso especial del uso de una distribución uniforme como distribución previa dada), independientemente de cualquier consideración bayesiana, al tratar el problema formalmente como un problema de optimización con restricciones, donde la función de entropía es la función objetivo. Para el caso de valores promedio dados como información verificable (promediados sobre la distribución de probabilidad buscada), la distribución buscada es formalmente la distribución de Gibbs (o Boltzmann), cuyos parámetros deben calcularse para lograr la mínima entropía cruzada y satisfacer la información verificable dada.

Relevancia para la física

El principio de máxima entropía guarda relación con una suposición clave de la teoría cinética de los gases conocida como caos molecular o Stosszahlansatz . Esta afirma que la función de distribución que caracteriza a las partículas que entran en una colisión puede factorizarse. Si bien esta afirmación puede entenderse como una hipótesis estrictamente física, también puede interpretarse como una hipótesis heurística sobre la configuración más probable de las partículas antes de la colisión. [ 19 ]

Véase también

Notas

  1. Jaynes, ET (1957). "Teoría de la información y mecánica estadística" (PDF) . Physical Review . Serie II. 106 (4): 620– 630. Bibcode : 1957PhRv..106..620J . doi : 10.1103/PhysRev.106.620 . MR 0087305 . 
  2. Jaynes, ET (1957). "Teoría de la información y mecánica estadística II" (PDF) . Physical Review . Serie II. 108 (2): 171– 190. Bibcode : 1957PhRv..108..171J . doi : 10.1103/PhysRev.108.171 . MR 0096414 . 
  3. Sivia, Devinderjit; Skilling, John (2 de junio de 2006). Análisis de datos: un tutorial bayesiano . OUP Oxford. ISBN 978-0-19-154670-9.
  4. Jaynes, ET (1968). "Probabilidades a priori" (PDF) . IEEE Transactions on Systems Science and Cybernetics . 4 (3): 227– 241. doi : 10.1109/TSSC.1968.300117 .
  5. Clarke, B. (2006). "Optimalidad de la información y modelado bayesiano". Journal of Econometrics . 138 (2): 405– 429. doi : 10.1016/j.jeconom.2006.05.003 .
  6. Soofi, ES (2000). "Enfoques teóricos de información principal". Journal of the American Statistical Association . 95 (452): 1349– 1353. doi : 10.2307/2669786 . JSTOR 2669786. MR 1825292 .  
  7. Bousquet, N. (2008). "Obtención de priors de entropía máxima vagos pero apropiados en experimentos bayesianos". Statistical Papers . 51 (3): 613– 628. doi : 10.1007/s00362-008-0149-9 . S2CID 119657859 . 
  8. Palmieri, Francesco AN; Ciuonzo, Domenico (2013-04-01). "Prioridades objetivas de máxima entropía en la clasificación de datos". Information Fusion . 14 (2): 186– 198. CiteSeerX 10.1.1.387.4515 . doi : 10.1016/j.inffus.2012.01.012 . 
  9. Skyrms, B (1987). "Actualización, suposición y MAXENT". Theory and Decision . 22 (3): 225– 46. doi : 10.1007/BF00134086 . S2CID 121847242 . 
  10. Park, J.-W., Kim, JU, Ghim, C.-M., & Kim, CU (2022). La división justa de Boltzmann para la justicia distributiva. Scientific Reports , 12(1), 16179. https://doi.org/10.1038/s41598-022-19792-3 Park, J.-W., & Kim, CU (2021). Hacia una igualdad de ingresos factible. PLOS ONE , 16(3), e0249204. https://doi.org/10.1371/journal.pone.0249204 Park, J.-W., Kim, CU, & Isard, W. (2012). Asignación de permisos en el comercio de emisiones utilizando la distribución de Boltzmann. Physica A , 391, 4883–4890. https://doi.org/10.1016/j.physa.2012.05.006
  11. Strimmer, K. (2026). De la física a la estadística: una ruta sencilla hacia las familias exponenciales mediante la entropía máxima. ArXiv:2604.22752. https://arxiv.org/abs/2604.22752
  12. 1 2 3 Botev, ZI; Kroese, DP (2008). "Selección de ancho de banda no asintótica para la estimación de densidad de datos discretos". Metodología y computación en probabilidad aplicada . 10 (3): 435. doi : 10.1007/s11009-007-9057-z . S2CID 122047337 . 
  13. 1 2 Botev, ZI; Kroese, DP (2011). "El método generalizado de entropía cruzada, con aplicaciones a la estimación de densidad de probabilidad" (PDF) . Metodología y computación en probabilidad aplicada . 13 (1): 1– 27. doi : 10.1007/s11009-009-9133-7 . S2CID 18155189 . 
  14. Kesavan, HK; Kapur, JN (1990). «Principios de entropía máxima y entropía cruzada mínima». En Fougère, PF (ed.). Métodos bayesianos y de entropía máxima . pp. 419–432 . doi : 10.1007/978-94-009-0683-9_29 . ISBN  978-94-010-6792-8.
  15. Jaynes, ET (1968). "Probabilidades a priori" . IEEE Trans. Syst. Sci. Cybern . 4 : 227–241 . doi : 10.1109/TSSC.1968.300117 .
  16. Druilhet, Pierre; Marin, Jean-Michel (2007). "Conjuntos creíbles {HPD} invariantes y estimadores {MAP}" . Bayesian Anal . 2 : 681–691 . doi : 10.1214/07-BA227 .
  17. Jaynes, ET (2003) Teoría de la probabilidad: La lógica de la ciencia , Cambridge University Press, págs. 351-355. ISBN 978-0521592710
  18. Jaynes, ET (1988) "La relación entre los métodos bayesianos y de máxima entropía" , en Métodos de máxima entropía y bayesianos en ciencia e ingeniería (Vol. 1) , Kluwer Academic Publishers, págs. 25-29.
  19. Chliamovitch, G.; Malaspinas, O.; Chopard, B. (2017). "Teoría cinética más allá del Stosszahlansatz" . Entropy . 19 (8): 381. Bibcode : 2017Entrp..19..381C . doi : 10.3390/e19080381 .

Referencias

  • Bajkova, AT (1992). "La generalización del método de máxima entropía para la reconstrucción de funciones complejas". Astronomical and Astrophysical Transactions . 1 (4): 313– 320. Bibcode : 1992A & AT....1..313B . doi : 10.1080/10556799208230532 .
  • Fornalski, KW; Parzych, G.; Pylak, M.; Satuła, D.; Dobrzyński, L. (2010). "Aplicación del razonamiento bayesiano y el método de máxima entropía a algunos problemas de reconstrucción" (PDF) . Acta Physica Polonica A. 117 ( 6): 892– 899. Bibcode : 2010AcPPA.117..892F . doi : 10.12693/APhysPolA.117.892 .
  • Giffin, A. y Caticha, A., 2007, Actualización de probabilidades con datos y momentos
  • Guiasu, S.; Shenitzer, A. (1985). "El principio de máxima entropía". The Mathematical Intelligencer . 7 (1): 42– 48. doi : 10.1007/bf03023004 . S2CID 53059968 . 
  • Harremoës, P.; Topsøe (2001). "Fundamentos de la entropía máxima" . Entropía . 3 (3): 191– 226. Bibcode : 2001Entrp...3..191H . doi : 10.3390/e3030191 .
  • Jaynes, ET (1963). "Teoría de la información y mecánica estadística" . En Ford, K. (ed.). Física estadística . Nueva York: Benjamin. pág.  181.
  • Jaynes, ET, 1986 (nueva versión en línea 1996), " Monos, canguros y N ", en Métodos de máxima entropía y bayesianos en estadística aplicada , JH Justice (ed.), Cambridge University Press, Cambridge, pág.  26.
  • Kapur, JN; y Kesavan, HK , 1992, Principios de optimización de la entropía con aplicaciones , Boston: Academic Press. ISBN 0-12-397670-7
  • Kitamura, Y., 2006, Métodos de verosimilitud empírica en econometría: teoría y práctica , Cowles Foundation Discussion Papers 1569, Cowles Foundation, Universidad de Yale.
  • Lazar, N (2003). "Verosimilitud empírica bayesiana". Biometrika . 90 (2): 319– 326. doi : 10.1093/biomet/90.2.319 .
  • Owen, AB, 2001, Probabilidad empírica , Chapman and Hall/CRC. ISBN 1-58-488071-6.
  • Schennach, SM (2005). "Verosimilitud empírica bayesiana con inclinación exponencial". Biometrika . 92 (1): 31– 46. doi : 10.1093/biomet/92.1.31 .
  • Uffink, Jos (1995). "¿Puede explicarse el principio de máxima entropía como un requisito de consistencia?" (PDF) . Estudios en historia y filosofía de la física moderna . 26B (3): 223–261 . Bibcode : 1995SHPMP..26..223U . CiteSeerX 10.1.1.27.6392 . doi : 10.1016/1355-2198(95)00015-1 . hdl : 1874/2649 . Archivado del original (PDF) el 3 de junio de 2006. 

Lecturas adicionales

  • Boyd, Stephen; Lieven Vandenberghe (2004). Optimización convexa (PDF) . Cambridge University Press . pág.  362. ISBN 0-521-83378-7. Consultado el 24 de agosto de 2008 .
  • Ratnaparkhi A. (1997) "Una introducción sencilla a los modelos de máxima entropía para el procesamiento del lenguaje natural". Informe técnico 97-08, Instituto de Investigación en Ciencias Cognitivas, Universidad de Pensilvania. Una introducción de fácil lectura a los métodos de máxima entropía en el contexto del procesamiento del lenguaje natural.
  • Tang, A.; Jackson, D.; Hobbs, J.; Chen, W.; Smith, JL; Patel, H.; Prieto, A.; Petrusca, D.; Grivich, MI; Sher, A.; Hottowy, P.; Dabrowski, W.; Litke, AM; Beggs, JM (2008). " Un modelo de entropía máxima aplicado a correlaciones espaciales y temporales de redes corticales in vitro" . Journal of Neuroscience . 28 (2): 505– 518. doi : 10.1523/JNEUROSCI.3359-07.2008 . PMC 6670549. PMID 18184793 .  Artículo de acceso abierto que contiene enlaces a diversos artículos y a implementaciones de software del Modelo de Máxima Entropía disponibles en internet.