Articulo de referencia

La desigualdad de Jensen

La desigualdad de Jensen generaliza la afirmación de que una recta secante de una función convexa se encuentra por encima de su gráfica. Visualización de la convexidad y la desi...

La desigualdad de Jensen generaliza la afirmación de que una recta secante de una función convexa se encuentra por encima de su gráfica.
Visualización de la convexidad y la desigualdad de Jensen

En matemáticas , la desigualdad de Jensen , que lleva el nombre del matemático danés Johan Jensen , relaciona el valor de una función convexa de una integral con la integral de la función convexa. Fue demostrada por Jensen en 1906, [ 1 ] basándose en una demostración anterior de la misma desigualdad para funciones doblemente diferenciables realizada por Otto Hölder en 1889. [ 2 ] Dada su generalidad, la desigualdad aparece en muchas formas según el contexto, algunas de las cuales se presentan a continuación. En su forma más simple, la desigualdad establece que la transformación convexa de una media es menor o igual que la media aplicada después de la transformación convexa (o, equivalentemente, la desigualdad opuesta para transformaciones cóncavas). [ 3 ]

La desigualdad de Jensen generaliza la afirmación de que la recta secante de una función convexa se encuentra por encima de la gráfica de la función , que es la desigualdad de Jensen para dos puntos: la recta secante consiste en medias ponderadas de la función convexa (para t  [0,1]),

tF(incógnita1)+(1t)F(incógnita2),{\displaystyle tf(x_{1})+(1-t)f(x_{2}),}

mientras que la gráfica de la función es la función convexa de las medias ponderadas,

F(tincógnita1+(1t)incógnita2).{\displaystyle f(tx_{1}+(1-t)x_{2}).}

Por lo tanto, la desigualdad de Jensen en este caso es

F(tincógnita1+(1t)incógnita2)tF(incógnita1)+(1t)F(incógnita2).{\displaystyle f(tx_{1}+(1-t)x_{2})\leq tf(x_{1})+(1-t)f(x_{2}).}

En el contexto de la teoría de la probabilidad , generalmente se enuncia de la siguiente forma: si X es una variable aleatoria y φ es una función convexa, entonces

φ(mi[incógnita])mi[φ(incógnita)].{\displaystyle \varphi (\operatorname {E} [X])\leq \operatorname {E} \left[\varphi (X)\right].}

La diferencia entre los dos lados de la desigualdad,mi[φ(incógnita)]φ(mi[incógnita]){\displaystyle \operatorname {E} \left[\varphi (X)\right]-\varphi \left(\operatorname {E} [X]\right)}, se denomina brecha de Jensen . [ 4 ]

Declaraciones

La forma clásica de la desigualdad de Jensen involucra varios números y ponderaciones. La desigualdad puede enunciarse de manera bastante general utilizando el lenguaje de la teoría de la medida o (equivalentemente) de la probabilidad. En el contexto probabilístico, la desigualdad puede generalizarse aún más hasta alcanzar su máxima expresión .

Forma finita

Para una función convexa realφ{\displaystyle \varphi }, númerosincógnita1,incógnita2,,incógnitanorte{\displaystyle x_{1},x_{2},\ldots ,x_{n}}en su dominio y pesos positivosai{\displaystyle a_{i}}La desigualdad de Jensen se puede enunciar como:

y la desigualdad se invierte siφ{\displaystyle \varphi }es cóncava , que es

La igualdad se cumple si y solo siincógnita1=incógnita2==incógnitanorte{\displaystyle x_{1}=x_{2}=\cdots =x_{n}}oφ{\displaystyle \varphi }es lineal en un dominio que contieneincógnita1,incógnita2,,incógnitanorte{\displaystyle x_{1},x_{2},\cdots ,x_{n}}.

Como caso particular, si los pesosai{\displaystyle a_{i}}son todos iguales, entonces ( 1 ) y ( 2 ) se convierten en

Por ejemplo, la función log( x ) es cóncava , por lo que al sustituirφ(incógnita)=registro(incógnita){\displaystyle \varphi (x)=\log(x)}En la fórmula anterior ( 4 ) se establece la desigualdad (logaritmo de la) conocida media aritmética/media geométrica :

registro(i=1norteincógnitainorte)i=1norteregistro(incógnitai)norte{\displaystyle \log \!\left({\frac {\sum _{i=1}^{n}x_{i}}{n}}\right)\geq {\frac {\sum _{i=1}^{n}\log \!\left(x_{i}\right)}{n}}}exp(registro(i=1norteincógnitainorte))exp(i=1norteregistro(incógnitai)norte){\displaystyle \exp \!\left(\log \!\left({\frac {\sum _{i=1}^{n}x_{i}}{n}}\right)\right)\geq \exp \!\left({\frac {\sum _{i=1}^{n}\log \!\left(x_{i}\right)}{n}}\right)}incógnita1+incógnita2++incógnitanortenorteincógnita1incógnita2incógnitanortenorte{\displaystyle {\frac {x_{1}+x_{2}+\cdots +x_{n}}{n}}\geq {\sqrt[{n}]{x_{1}\cdot x_{2}\cdots x_{n}}}}

Una aplicación común tiene x como función de otra variable (o conjunto de variables) t , es decir,incógnitai=gramo(ti){\displaystyle x_{i}=g(t_{i})}Todo esto se traslada directamente al caso continuo general: los pesos a i se reemplazan por una función integrable no negativa f ( x ) , como una distribución de probabilidad, y las sumas se reemplazan por integrales.

Forma teórica de la medida

Dejar(Ω,A,μ){\displaystyle (\Omega,A,\mu)}Sea un espacio de probabilidad .F:ΩR{\displaystyle f:\Omega \to \mathbb {R} }ser unμ{\displaystyle \mu }-función integrable yφ:RR{\displaystyle \varphi :\mathbb {R} \to \mathbb {R} } sea convexo. Entonces: [ 5 ]φ(ΩFdμ)ΩφFdμ{\displaystyle \varphi \left(\int _{\Omega }f\,\mathrm {d} \mu \right)\leq \int _{\Omega }\varphi \circ f\,\mathrm {d} \mu }

En un análisis real , podríamos necesitar una estimación de

φ(abF(incógnita)dincógnita){\displaystyle \varphi \left(\int _{a}^{b}f(x)\,dx\right)}

dóndea,bR{\displaystyle a,b\in \mathbb {R} }, yF:[a,b]R{\displaystyle f\colon [a,b]\to \mathbb {R} }es una función integrable de Lebesgue no negativa . En este caso, la medida de Lebesgue de[a,b]{\displaystyle [a,b]}no tiene por qué ser 1. Sin embargo, mediante la integración por sustitución, el intervalo puede reescalarse de modo que tenga medida 1. Entonces se puede aplicar la desigualdad de Jensen para obtener [ 6 ].

φ(1baabF(incógnita)dincógnita)1baabφ(F(incógnita))dincógnita.{\displaystyle \varphi \left({\frac {1}{b-a}}\int _{a}^{b}f(x)\,dx\right)\leq {\frac {1}{b-a}}\int _{a}^{b}\varphi (f(x))\,dx.}

Forma probabilística

El mismo resultado puede expresarse de forma equivalente en el contexto de la teoría de la probabilidad , mediante un simple cambio de notación. Sea(Ω,F,PAG){\displaystyle (\Omega ,{\mathfrak {F}},\operatorname {P} )}Sea X un espacio de probabilidad , X una variable aleatoria integrable de valor real yφ{\displaystyle \varphi }una función convexa . Entonces [ 7 ]φ(mi[incógnita])mi[φ(incógnita)].{\displaystyle \varphi {\big (}\operatorname {E} [X]{\big )}\leq \operatorname {E} [\varphi (X)].}

En este contexto de probabilidad, la medida μ se entiende como una probabilidad.PAG{\displaystyle \operatorname {P} }, la integral con respecto a μ como valor esperadomi{\displaystyle \operatorname {E} }y la funciónF{\displaystyle f}como una variable aleatoria X.

Tenga en cuenta que la igualdad se cumple si y solo siφ{\displaystyle \varphi }es una función lineal en algún conjunto convexoA{\displaystyle A}de tal manera quePAG(incógnitaA)=1{\displaystyle P(X\in A)=1}(lo cual se deduce al examinar la demostración teórica de la medida que se presenta a continuación).

Desigualdad general en un contexto probabilístico

De forma más general, sea T un espacio vectorial topológico real y X una variable aleatoria integrable con valores en T. En este contexto general, integrable significa que existe un elementomi[incógnita]{\displaystyle \operatorname {E} [X]}en T , de tal manera que para cualquier elemento z en el espacio dual de T :mi|z,incógnita|<{\displaystyle \operatorname {E} |\langle z,X\rangle |<\infty }, yz,mi[incógnita]=mi[z,incógnita]{\displaystyle \langle z,\operatorname {E} [X]\rangle =\operatorname {E} [\langle z,X\rangle ]}. Entonces, para cualquier función convexa medible φ y cualquier sub- σ-álgebraGRAMO{\displaystyle {\mathfrak {G}}}deF{\displaystyle {\mathfrak {F}}}:

φ(mi[incógnitaGRAMO])mi[φ(incógnita)GRAMO].{\displaystyle \varphi \left(\operatorname {E} \left[X\mid {\mathfrak {G}}\right]\right)\leq \operatorname {E} \left[\varphi (X)\mid {\mathfrak {G}}\right].}

Aquími[GRAMO]{\displaystyle \operatorname {E} [\cdot \mid {\mathfrak {G}}]}representa la esperanza condicionada al álgebra σGRAMO{\displaystyle {\mathfrak {G}}}. Esta afirmación general se reduce a las anteriores cuando el espacio vectorial topológico T es el eje real yGRAMO{\displaystyle {\mathfrak {G}}}es el álgebra σ trivial {∅, Ω} (donde es el conjunto vacío y Ω es el espacio muestral ). [ 8 ]

Una forma más aguda y generalizada

Sea X una variable aleatoria unidimensional con mediaμ{\displaystyle \mu }y varianzaσ20{\displaystyle \sigma ^{2}\geq 0}. Dejarφ(incógnita){\displaystyle \varphi (x)}Sea una función dos veces diferenciable y definamos la función.

h(incógnita)φ(incógnita)φ(μ)(incógnitaμ)2φ(μ)incógnitaμ.{\displaystyle h(x)\triangleq {\frac {\varphi \left(x\right)-\varphi \left(\mu \right)}{\left(x-\mu \right)^{2}}}-{\frac {\varphi '\left(\mu \right)}{x-\mu }}.}

Entonces [ 9 ]

σ2infφ(incógnita)2σ2infh(incógnita)mi[φ(incógnita)]φ(mi[incógnita])σ2sorberh(incógnita)σ2sorberφ(incógnita)2.{\displaystyle \sigma ^{2}\inf {\frac {\varphi ''(x)}{2}}\leq \sigma ^{2}\inf h(x)\leq E\left[\varphi \left(X\right)\right]-\varphi \left(E[X]\right)\leq \sigma ^{2}\sup h(x)\leq \sigma ^{2}\sup {\frac {\varphi ''(x)}{2}}.}

En particular, cuandoφ(incógnita){\displaystyle \varphi (x)}es convexo, entoncesφ(incógnita)0{\displaystyle \varphi ''(x)\geq 0}y la forma estándar de la desigualdad de Jensen se deduce inmediatamente para el caso en queφ(incógnita){\displaystyle \varphi (x)}Además, se supone que es dos veces diferenciable.

Pruebas

Demostración gráfica intuitiva

Una "prueba" gráfica de la desigualdad de Jensen para el caso probabilístico. La curva discontinua en el eje X representa la distribución hipotética de X , mientras que la curva discontinua en el eje Y representa la distribución correspondiente de los valores de Y. Nótese que la función convexa Y ( X ) " estira " cada vez más la distribución a medida que aumenta el valor de X.
Esta es una demostración sin palabras de la desigualdad de Jensen para n variables. Sin pérdida de generalidad, la suma de los pesos positivos es 1. De ello se deduce que el punto ponderado se encuentra en la envoltura convexa de los puntos originales, la cual se sitúa por encima de la función misma por definición de convexidad. La conclusión se deduce. [ 10 ]

La desigualdad de Jensen se puede demostrar de varias maneras, y se ofrecerán tres demostraciones diferentes correspondientes a las distintas afirmaciones anteriores. Sin embargo, antes de embarcarnos en estas derivaciones matemáticas, vale la pena analizar un argumento gráfico intuitivo basado en el caso probabilístico donde X es un número real (véase la figura). Suponiendo una distribución hipotética de los valores de X , se puede identificar inmediatamente la posición demi[incógnita]{\displaystyle \operatorname {E} [X]}y su imagenφ(mi[incógnita]){\displaystyle \varphi (\operatorname {E} [X])}en el gráfico. Observando que para aplicaciones convexas Y = φ ( x ) de algunos valores de x la distribución correspondiente de valores de Y se "estira" cada vez más hacia arriba para valores crecientes de X , es fácil ver que la distribución de Y es más amplia en el intervalo correspondiente a X > X 0 y más estrecha en X < X 0 para cualquier X 0 ; en particular, esto también es cierto paraincógnita0=mi[incógnita]{\displaystyle X_{0}=\operatorname {E} [X]}. En consecuencia, en esta imagen la expectativa de Y siempre se desplazará hacia arriba con respecto a la posición deφ(mi[incógnita]){\displaystyle \varphi (\operatorname {E} [X])}Un razonamiento similar se aplica si la distribución de X cubre una porción decreciente de la función convexa, o tanto una porción decreciente como una creciente de la misma. Esto "prueba" la desigualdad, es decir

φ(mi[incógnita])mi[φ(incógnita)]=mi[Y],{\displaystyle \varphi (\operatorname {E} [X])\leq \operatorname {E} [\varphi (X)]=\operatorname {E} [Y],}

con igualdad cuando φ ( X ) no es estrictamente convexa, por ejemplo, cuando es una línea recta o cuando X sigue una distribución degenerada (es decir, es una constante).

Las demostraciones que se presentan a continuación formalizan esta noción intuitiva.

Demostración 1 (forma finita)

Si λ 1 y λ 2 son dos números reales no negativos arbitrarios tales que λ 1 + λ 2 = 1 , entonces la convexidad de φ implica

incógnita1,incógnita2:φ(λ1incógnita1+λ2incógnita2)λ1φ(incógnita1)+λ2φ(incógnita2).{\displaystyle \forall x_{1},x_{2}:\qquad \varphi \left(\lambda _{1}x_{1}+\lambda _{2}x_{2}\right)\leq \lambda _{1}\,\varphi (x_{1})+\lambda _{2}\,\varphi (x_{2}).}

Esto se puede generalizar: si λ 1 , ..., λ n son números reales no negativos tales que λ 1 + ... + λ n = 1 , entonces

φ(λ1incógnita1+λ2incógnita2++λnorteincógnitanorte)λ1φ(incógnita1)+λ2φ(incógnita2)++λnorteφ(incógnitanorte),{\displaystyle \varphi (\lambda _{1}x_{1}+\lambda _{2}x_{2}+\cdots +\lambda _{n}x_{n})\leq \lambda _{1}\,\varphi (x_{1})+\lambda _{2}\,\varphi (x_{2})+\cdots +\lambda _{n}\,\varphi (x_{n}),}

para cualquier x 1 , ..., x n .

La forma finita de la desigualdad de Jensen se puede demostrar por inducción : por hipótesis de convexidad, la afirmación es verdadera para n  =  2. Supongamos que la afirmación es verdadera para algún n , entonces

φ(i=1norteλiincógnitai)i=1norteλiφ(incógnitai){\displaystyle \varphi \left(\sum _{i=1}^{n}\lambda _{i}x_{i}\right)\leq \sum _{i=1}^{n}\lambda _{i}\varphi \left(x_{i}\right)}

para cualquier λ 1 , ..., λ n tal que λ 1 + ... + λ n = 1 .

Es necesario demostrarlo para n + 1. Al menos uno de los λ i es estrictamente menor que1{\displaystyle 1}, digamos λ n +1 ; por lo tanto, por desigualdad de convexidad:

φ(i=1norte+1λiincógnitai)=φ((1λnorte+1)i=1norteλi1λnorte+1incógnitai+λnorte+1incógnitanorte+1)(1λnorte+1)φ(i=1norteλi1λnorte+1incógnitai)+λnorte+1φ(incógnitanorte+1).{\displaystyle {\begin{aligned}\varphi \left(\sum _{i=1}^{n+1}\lambda _{i}x_{i}\right)&=\varphi \left((1-\lambda _{n+1})\sum _{i=1}^{n}{\frac {\lambda _{i}}{1-\lambda _{n+1}}}x_{i}+\lambda _{n+1}x_{n+1}\right)\\&\leq (1-\lambda _{n+1})\varphi \left(\sum _{i=1}^{n}{\frac {\lambda _{i}}{1-\lambda _{n+1}}}x_{i}\right)+\lambda _{n+1}\,\varphi (x_{n+1}).\end{aligned}}}

Dado que λ 1 + ... + λ n + λ n +1 = 1 ,

i=1norteλi1λnorte+1=1{\displaystyle \sum _{i=1}^{n}{\frac {\lambda _{i}}{1-\lambda _{n+1}}}=1},

aplicando la hipótesis inductiva se obtiene

φ(i=1norteλi1λnorte+1incógnitai)i=1norteλi1λnorte+1φ(incógnitai){\displaystyle \varphi \left(\sum _{i=1}^{n}{\frac {\lambda _{i}}{1-\lambda _{n+1}}}x_{i}\right)\leq \sum _{i=1}^{n}{\frac {\lambda _{i}}{1-\lambda _{n+1}}}\varphi (x_{i})}

por lo tanto

φ(i=1norte+1λiincógnitai)(1λnorte+1)i=1norteλi1λnorte+1φ(incógnitai)+λnorte+1φ(incógnitanorte+1)=i=1norte+1λiφ(incógnitai){\displaystyle {\begin{aligned}\varphi \left(\sum _{i=1}^{n+1}\lambda _{i}x_{i}\right)&\leq (1-\lambda _{n+1})\sum _{i=1}^{n}{\frac {\lambda _{i}}{1-\lambda _{n+1}}}\varphi (x_{i})+\lambda _{n+1}\,\varphi (x_{n+1})=\sum _{i=1}^{n+1}\lambda _{i}\varphi (x_{i})\end{aligned}}}

Deducimos que la desigualdad es verdadera para n + 1 , por inducción se sigue que el resultado también es verdadero para todo entero n mayor que 2.

Para obtener la desigualdad general a partir de esta forma finita, es necesario utilizar un argumento de densidad. La forma finita se puede reescribir como:

φ(incógnitadμnorte(incógnita))φ(incógnita)dμnorte(incógnita),{\displaystyle \varphi \left(\int x\,d\mu _{n}(x)\right)\leq \int \varphi (x)\,d\mu _{n}(x),}

donde μ n es una medida dada por una combinación convexa arbitraria de deltas de Dirac :

μnorte=i=1norteλiδincógnitai.{\displaystyle \mu _{n}=\sum _{i=1}^{n}\lambda _{i}\delta _{x_{i}}.}

Dado que las funciones convexas son continuas , y dado que las combinaciones convexas de deltas de Dirac son débilmente densas en el conjunto de medidas de probabilidad (como se puede verificar fácilmente), la afirmación general se obtiene simplemente mediante un procedimiento de límite.

Demostración 2 (forma teórica de la medida)

Dejargramo{\displaystyle g}ser un valor realμ{\displaystyle \mu }-función integrable en un espacio de probabilidadΩ{\displaystyle \Omega }y dejarφ{\displaystyle \varphi }sea ​​una función convexa en los números reales. Dado queφ{\displaystyle \varphi }es convexa, en cada número realincógnita{\displaystyle x}tenemos un conjunto no vacío de subderivadas , que pueden pensarse como líneas que tocan la gráfica deφ{\displaystyle \varphi }enincógnita{\displaystyle x}, pero que se encuentran debajo del gráfico deφ{\displaystyle \varphi }en todos los puntos (líneas de soporte del gráfico).

Ahora bien, si definimos

incógnita0:=Ωgramodμ,{\displaystyle x_{0}:=\int _{\Omega }g\,d\mu ,}

Debido a la existencia de subderivadas para funciones convexas, podemos elegira{\displaystyle a}yb{\displaystyle b}de tal manera que

aincógnita+bφ(incógnita),{\displaystyle ax+b\leq \varphi (x),}

para todos los realesincógnita{\displaystyle x}y

aincógnita0+b=φ(incógnita0).{\displaystyle ax_{0}+b=\varphi (x_{0}).}

Pero luego tenemos eso

φgramo(ω)agramo(ω)+b{\displaystyle \varphi \circ g(\omega )\geq ag(\omega )+b}

para casi todosωΩ{\displaystyle \omega \in \Omega }. Dado que tenemos una medida de probabilidad, la integral es monótona conμ(Ω)=1{\displaystyle \mu (\Omega )=1}de modo que

ΩφgramodμΩ(agramo+b)dμ=aΩgramodμ+bΩdμ=aincógnita0+b=φ(incógnita0)=φ(Ωgramodμ),{\displaystyle \int _{\Omega }\varphi \circ g\,d\mu \geq \int _{\Omega }(ag+b)\,d\mu =a\int _{\Omega }g\,d\mu +b\int _{\Omega }d\mu =ax_{0}+b=\varphi (x_{0})=\varphi \left(\int _{\Omega }g\,d\mu \right),}

como se desee.

Demostración 3 (desigualdad general en un contexto probabilístico)

Sea X una variable aleatoria integrable que toma valores en un espacio vectorial topológico real T. Dado queφ:TR{\displaystyle \varphi :T\to \mathbb {R} }es convexa, para cualquierincógnita,yT{\displaystyle x,y\in T}la cantidad

φ(incógnita+θy)φ(incógnita)θ,{\displaystyle {\frac {\varphi (x+\theta \,y)-\varphi (x)}{\theta }},}

está disminuyendo a medida que θ se acerca a 0 + . En particular, el subgradiente deφ{\displaystyle \varphi }evaluado en x en la dirección y está bien definido por

(Dφ)(incógnita)y:=límiteθ0φ(incógnita+θy)φ(incógnita)θ=infθ0φ(incógnita+θy)φ(incógnita)θ.{\displaystyle (D\varphi )(x)\cdot y:=\lim _{\theta \downarrow 0}{\frac {\varphi (x+\theta \,y)-\varphi (x)}{\theta }}=\inf _{\theta \neq 0}{\frac {\varphi (x+\theta \,y)-\varphi (x)}{\theta }}.}

Es fácil ver que el subgradiente es lineal en y (lo cual es falso y la afirmación requiere que se demuestre el teorema de Hahn-Banach) y, dado que el ínfimo tomado en el lado derecho de la fórmula anterior es menor que el valor del mismo término para θ = 1 , se obtiene

φ(incógnita)φ(incógnita+y)(Dφ)(incógnita)y.{\displaystyle \varphi (x)\leq \varphi (x+y)-(D\varphi )(x)\cdot y.}

En particular, para un subálgebra σ arbitrariaGRAMO{\displaystyle {\mathfrak {G}}}podemos evaluar la última desigualdad cuandoincógnita=mi[incógnitaGRAMO],y=incógnitami[incógnitaGRAMO]{\displaystyle x=\operatorname {E} [X\mid {\mathfrak {G}}],\,y=X-\operatorname {E} [X\mid {\mathfrak {G}}]}para obtener

φ(mi[incógnitaGRAMO])φ(incógnita)(Dφ)(mi[incógnitaGRAMO])(incógnitami[incógnitaGRAMO]).{\displaystyle \varphi (\operatorname {E} [X\mid {\mathfrak {G}}])\leq \varphi (X)-(D\varphi )(\operatorname {E} [X\mid {\mathfrak {G}}])\cdot (X-\operatorname {E} [X\mid {\mathfrak {G}}]).}

Ahora, si tomamos la expectativa condicionada aGRAMO{\displaystyle {\mathfrak {G}}}En ambos lados de la expresión anterior, obtenemos el resultado ya que:

mi[[(Dφ)(mi[incógnitaGRAMO])(incógnitami[incógnitaGRAMO])]GRAMO]=(Dφ)(mi[incógnitaGRAMO])mi[(incógnitami[incógnitaGRAMO])GRAMO]=0,{\displaystyle \operatorname {E} \left[\left[(D\varphi )(\operatorname {E} [X\mid {\mathfrak {G}}])\cdot (X-\operatorname {E} [X\mid {\mathfrak {G}}])\right]\mid {\mathfrak {G}}\right]=(D\varphi )(\operatorname {E} [X\mid {\mathfrak {G}}])\cdot \operatorname {E} [\left(X-\operatorname {E} [X\mid {\mathfrak {G}}]\right)\mid {\mathfrak {G}}]=0,}

por la linealidad del subgradiente en la variable y , y la siguiente propiedad bien conocida de la esperanza condicional :

mi[(mi[incógnitaGRAMO])GRAMO]=mi[incógnitaGRAMO].{\displaystyle \operatorname {E} \left[\left(\operatorname {E} [X\mid {\mathfrak {G}}]\right)\mid {\mathfrak {G}}\right]=\operatorname {E} [X\mid {\mathfrak {G}}].}

Aplicaciones y casos especiales

Forma que involucra una función de densidad de probabilidad

Supongamos que Ω es un subconjunto medible de la recta real y f ( x ) es una función no negativa tal que

F(incógnita)dincógnita=1.{\displaystyle \int _{-\infty }^{\infty }f(x)\,dx=1.}

En lenguaje probabilístico, f es una función de densidad de probabilidad .

Entonces, la desigualdad de Jensen se convierte en la siguiente afirmación sobre integrales convexas:

Si g es cualquier función medible de valor real yφ{\textstyle \varphi }es convexa en el rango de g , entonces

φ(gramo(incógnita)F(incógnita)dincógnita)φ(gramo(incógnita))F(incógnita)dincógnita.{\displaystyle \varphi \left(\int _{-\infty }^{\infty }g(x)f(x)\,dx\right)\leq \int _{-\infty }^{\infty }\varphi (g(x))f(x)\,dx.}

Si g ( x ) = x , entonces esta forma de la desigualdad se reduce a un caso especial de uso común:

φ(incógnitaF(incógnita)dincógnita)φ(incógnita)F(incógnita)dincógnita.{\displaystyle \varphi \left(\int _{-\infty }^{\infty }x\,f(x)\,dx\right)\leq \int _{-\infty }^{\infty }\varphi (x)\,f(x)\,dx.}

Esto se aplica en los métodos bayesianos variacionales .

Ejemplo: momentos pares de una variable aleatoria

Si g ( x ) = x 2n , y X es una variable aleatoria, entonces g es convexa como

d2gramodincógnita2(incógnita)=2norte(2norte1)incógnita2norte20 incógnitaR{\displaystyle {\frac {d^{2}g}{dx^{2}}}(x)=2n(2n-1)x^{2n-2}\geq 0\quad \forall \ x\in \mathbb {R} }

y entonces

gramo(mi[incógnita])=(mi[incógnita])2nortemi[incógnita2norte].{\displaystyle g(\operatorname {E} [X])=(\operatorname {E} [X])^{2n}\leq \operatorname {E} [X^{2n}].}

En particular, si algún momento par 2n de X es finito, X tiene una media finita. Una extensión de este argumento muestra que X tiene momentos finitos de cada orden.lnorte{\displaystyle l\in \mathbb {N} }dividiendo n .

Forma finita alternativa

Sea Ω = { x 1 , ... x n }, y tomemos μ como la medida de conteo en Ω , entonces la forma general se reduce a una afirmación sobre sumas:

φ(i=1nortegramo(incógnitai)λi)i=1norteφ(gramo(incógnitai))λi,{\displaystyle \varphi \left(\sum _{i=1}^{n}g(x_{i})\lambda _{i}\right)\leq \sum _{i=1}^{n}\varphi (g(x_{i}))\lambda _{i},}

siempre que λ i ≥ 0 y

λ1++λnorte=1.{\displaystyle \lambda _{1}+\cdots +\lambda _{n}=1.}

También existe una forma discreta infinita.

Física estadística

La desigualdad de Jensen es de particular importancia en la física estadística cuando la función convexa es una exponencial, dando como resultado:

mimi[incógnita]mi[miincógnita],{\displaystyle e^{\operatorname {E} [X]}\leq \operatorname {E} \left[e^{X}\right],}

donde los valores esperados son con respecto a alguna distribución de probabilidad en la variable aleatoria X.

teoría de la información

Si p ( x ) es la verdadera densidad de probabilidad para X , y q ( x ) es otra densidad, entonces al aplicar la desigualdad de Jensen para la variable aleatoria Y ( X ) = q ( X )/ p ( X ) y la función convexa φ ( y ) = −log( y ) se obtiene

mi[φ(Y)]φ(mi[Y]){\displaystyle \operatorname {E} [\varphi (Y)]\geq \varphi (\operatorname {E} [Y])}

Por lo tanto:

D(pag(incógnita)q(incógnita))=pag(incógnita)registro(q(incógnita)pag(incógnita))dincógnitaregistro(pag(incógnita)q(incógnita)pag(incógnita)dincógnita)=registro(q(incógnita)dincógnita)=0{\displaystyle -D(p(x)\|q(x))=\int p(x)\log \left({\frac {q(x)}{p(x)}}\right)\,dx\leq \log \left(\int p(x){\frac {q(x)}{p(x)}}\,dx\right)=\log \left(\int q(x)\,dx\right)=0}

un resultado llamado desigualdad de Gibbs .

Muestra que la longitud promedio del mensaje se minimiza cuando los códigos se asignan en función de las probabilidades verdaderas p en lugar de cualquier otra distribución q . La cantidad que es no negativa se llama divergencia de Kullback-Leibler de q con respecto a p , dondeD(pag(incógnita)q(incógnita))=pag(incógnita)registro(pag(incógnita)q(incógnita))dincógnita{\displaystyle D(p(x)\|q(x))=\int p(x)\log \left({\frac {p(x)}{q(x)}}\right)dx}.

Dado que −log( x ) es una función estrictamente convexa para x > 0 , se deduce que la igualdad se cumple cuando p ( x ) es igual a q ( x ) casi en todas partes.

Teorema de Rao-Blackwell

Si L es una función convexa yGRAMO{\displaystyle {\mathfrak {G}}}una subsigma-álgebra, entonces, a partir de la versión condicional de la desigualdad de Jensen, obtenemos

L(mi[δ(incógnita)GRAMO])mi[L(δ(incógnita))GRAMO]mi[L(mi[δ(incógnita)GRAMO])]mi[L(δ(incógnita))].{\displaystyle L(\operatorname {E} [\delta (X)\mid {\mathfrak {G}}])\leq \operatorname {E} [L(\delta (X))\mid {\mathfrak {G}}]\quad \Longrightarrow \quad \operatorname {E} [L(\operatorname {E} [\delta (X)\mid {\mathfrak {G}}])]\leq \operatorname {E} [L(\delta (X))].}

Entonces, si δ( X ) es algún estimador de un parámetro no observado θ dado un vector de observables X ; y si T ( X ) es una estadística suficiente para θ; entonces se puede obtener un estimador mejorado, en el sentido de tener una pérdida esperada L menor , calculando

δ1(incógnita)=miθ[δ(incógnita)T(incógnita)=T(incógnita)],{\displaystyle \delta _{1}(X)=\operatorname {E} _{\theta }[\delta (X')\mid T(X')=T(X)],}

el valor esperado de δ con respecto a θ, tomado sobre todos los posibles vectores de observaciones X compatibles con el mismo valor de T ( X ) que el observado. Además, debido a que T es una estadística suficiente,δ1(incógnita){\displaystyle \delta _{1}(X)}no depende de θ, por lo tanto, se convierte en una estadística.

Este resultado se conoce como el teorema de Rao-Blackwell .

aversión al riesgo

La relación entre la aversión al riesgo y la utilidad marginal decreciente para resultados escalares se puede expresar formalmente con la desigualdad de Jensen: la aversión al riesgo se puede expresar como la preferencia por un resultado determinado.(mi[incógnita]){\displaystyle u(E[x])}a una apuesta justa con un resultado potencialmente mayor pero incierto de(incógnita){\displaystyle u(x)}:

(mi[incógnita])>mi[(incógnita)]{\displaystyle u(E[x])>E[u(x)]}.

Pero esta es simplemente la desigualdad de Jensen para una superficie cóncava.(incógnita){\displaystyle u(x)}: una función de utilidad que presenta una utilidad marginal decreciente. [ 11 ]

Generalizaciones

Más allá de su formulación clásica para números reales y funciones convexas, la desigualdad de Jensen se ha extendido al ámbito de la teoría de operadores . En este contexto no conmutativo, la desigualdad se expresa en términos de funciones convexas de operadores, es decir, funciones definidas en un intervalo I que satisfacen

F(λincógnita+(1λ)y)λF(incógnita)+(1λ)F(y){\displaystyle f{\bigl (}\lambda x+(1-\lambda )y{\bigr )}\leq \lambda f(x)+(1-\lambda )f(y)}

para cada par de operadores autoadjuntos x e y (con espectros en I) y cada escalarλ[0,1]{\displaystyle \lambda \in [0,1]}. Hansen y Pedersen [ 12 ] establecieron una versión definitiva de esta desigualdad al considerar combinaciones convexas genuinas no conmutativas. En particular, si se tiene una n-tupla de operadores autoadjuntos acotadosincógnita1,,incógnitanorte{\displaystyle x_{1},\dots ,x_{n}}con espectros en I y una n-tupla de operadoresa1,,anorte{\displaystyle a_{1},\dots ,a_{n}}satisfactorio

i=1norteaiai=I,{\displaystyle \sum _{i=1}^{n}a_{i}^{*}a_{i}=I,}

Entonces se cumple la siguiente desigualdad de Jensen de operadores:

F(i=1norteaiincógnitaiai)i=1norteaiF(incógnitai)ai.{\displaystyle f{\Bigl (}\sum _{i=1}^{n}a_{i}^{*}x_{i}a_{i}{\Bigr )}\leq \sum _{i=1}^{n}a_{i}^{*}f(x_{i})a_{i}.}

Este resultado muestra que la transformación convexa “respeta” las combinaciones convexas no conmutativas, extendiendo así la desigualdad clásica a operadores sin necesidad de restricciones adicionales en el intervalo de definición. [ 12 ] Una extensión estrechamente relacionada viene dada por la desigualdad de traza de Jensen. Para una función convexa continua f definida en I, si se consideran matrices autoadjuntasincógnita1,,incógnitanorte{\displaystyle x_{1},\dots ,x_{n}}(con espectros en I) y matricesa1,,anorte{\displaystyle a_{1},\dots ,a_{n}}satisfactorioi=1norteaiai=I{\displaystyle \sum _{i=1}^{n}a_{i}^{*}a_{i}=I}, entonces uno tiene

Tran(F(i=1norteaiincógnitaiai))Tran(i=1norteaiF(incógnitai)ai).{\displaystyle \operatorname {Tr} {\Bigl (}f{\Bigl (}\sum _{i=1}^{n}a_{i}^{*}x_{i}a_{i}{\Bigr )}{\Bigr )}\leq \operatorname {Tr} {\Bigl (}\sum _{i=1}^{n}a_{i}^{*}f(x_{i})a_{i}{\Bigr )}.}

Esta desigualdad se extiende naturalmente a las C*-álgebras equipadas con una traza finita y es particularmente útil en aplicaciones que van desde la mecánica estadística cuántica hasta la teoría de la información. Además, existen versiones contractivas de estas desigualdades de operadores cuando solo se asumei=1norteaitaiI{\displaystyle \sum _{i=1}^{n}a_{i}^{t}a_{i}\leq I}, siempre que existan condiciones adicionales comoF(0)0{\displaystyle f(0)\leq 0}(cuando 0 ∈ I) se imponen. Las extensiones a campos continuos de operadores y a entornos que involucran expectativas condicionales en C-álgebras ilustran aún más la amplia aplicabilidad de estas generalizaciones.

Véase también

Notas

  1. ^ Jensen, JLWV (1906). "Sur les fonctions convexes et les inégalités entre les valeurs moyennes" . Acta Matemática . 30 (1): 175– 193. doi : 10.1007/BF02418571 .
  2. Guessab, A.; Schmeisser, G. (2013). "Condiciones necesarias y suficientes para la validez de la desigualdad de Jensen". Archiv der Mathematik . 100 (6): 561– 570. doi : 10.1007/s00013-013-0522-3 . MR 3069109 . S2CID 56372266 .  
  3. Dekking, FM; Kraaikamp, ​​C.; Lopuhaa, HP; Meester, LE (2005). Una introducción moderna a la probabilidad y la estadística: comprender el porqué y el cómo . Textos de Springer en estadística. Londres: Springer. doi : 10.1007/1-84628-168-7 . ISBN 978-1-85233-896-1.
  4. Gao, Xiang; Sitharam, Meera; Roitberg, Adrian (2019). "Límites de la brecha de Jensen e implicaciones para las distribuciones de media concentrada" (PDF) . The Australian Journal of Mathematical Analysis and Applications . 16 (2). arXiv : 1712.05267 .
  5. pág. 25 de Rick Durrett (2019). Probabilidad: Teoría y ejemplos (5.ª ed.). Cambridge University Press. ISBN  978-1108473682.
  6. Niculescu, Constantin P. "Desigualdades integrales" , p.12.
  7. Rick Durrett (2019). Probabilidad: Teoría y ejemplos (5.ª ed.). Cambridge University Press. pág. 5. ISBN   978-1108473682.
  8. Atención: En esta generalidad se necesitan supuestos adicionales sobre la función convexa y/o el espacio vectorial topológico, véase el Ejemplo (1.3) en la pág. 53 de Perlman, Michael D. (1974). "Desigualdad de Jensen para una función vectorial convexa en un espacio de dimensión infinita" . Journal of Multivariate Analysis . 4 (1): 52– 65. doi : 10.1016/0047-259X(74)90005-0 . hdl : 11299/199167 .
  9. Liao, J.; Berg, A (2018). "Afilando la desigualdad de Jensen". American Statistician . 73 (3): 278– 281. arXiv : 1707.08644 . doi : 10.1080/00031305.2017.1419145 . S2CID 88515366 . 
  10. Bradley, CJ (2006). Introducción a las desigualdades . Leeds, Reino Unido: United Kingdom Mathematics Trust. pág. 97. ISBN  978-1-906001-11-7.
  11. Back, Kerry (2010). Teoría de la valoración de activos y la elección de cartera . Oxford University Press. pág. 5. ISBN  978-0-19-538061-3.
  12. 1 2 Hansen, Frank; Pedersen, Gert K. (2003). "La desigualdad del operador de Jensen". Boletín de la Sociedad Matemática de Londres . 35 (4). Cambridge University Press: 553– 564.

Referencias

  • David Chandler (1987). Introducción a la mecánica estadística moderna . Oxford. ISBN 0-19-504277-8.
  • Tristan Needham (1993) "Una explicación visual de la desigualdad de Jensen", American Mathematical Monthly 100(8):768–71.
  • Nicolás Fusco ; Paolo Marcellini ; Carlo Sbordone (1996). Analisi Matematica Debido . Ligorio. ISBN 978-88-207-2675-1.
  • Walter Rudin (1987). Análisis real y complejo . McGraw-Hill. ISBN 0-07-054234-1.
  • Rick Durrett (2019). Probabilidad: Teoría y ejemplos (5.ª  ed.). Cambridge University Press. pág.  430. ISBN 978-1108473682. Consultado el 21 de diciembre de 2020 .
  • Sam Savage (2012) El error de los promedios: por qué subestimamos el riesgo ante la incertidumbre (1.ª ed.). Wiley. ISBN 978–0471381976