Articulo de referencia

paradoja de Borel-Kolmogorov

En teoría de la probabilidad , la paradoja de Borel-Kolmogorov (a veces conocida como paradoja de Borel ) es una paradoja relacionada con la probabilidad condicional respecto a ...

En teoría de la probabilidad , la paradoja de Borel-Kolmogorov (a veces conocida como paradoja de Borel ) es una paradoja relacionada con la probabilidad condicional respecto a un evento de probabilidad cero (también conocido como conjunto nulo ). Recibe su nombre de Émile Borel y Andrey Kolmogorov .

Un rompecabezas de círculo máximo

Supongamos que una variable aleatoria tiene una distribución uniforme en una esfera unitaria . ¿Cuál es su distribución condicional en un círculo máximo ? Debido a la simetría de la esfera, cabría esperar que la distribución fuera uniforme e independiente de la elección de coordenadas. Sin embargo, dos análisis dan resultados contradictorios. Primero, observemos que elegir un punto uniformemente en la esfera es equivalente a elegir la longitud.λ{\displaystyle \lambda }uniformemente desde[π,π]{\displaystyle [-\pi ,\pi ]}y eligiendo la latitudφ{\displaystyle \varphi }de[π2,π2]{\textstyle [-{\frac {\pi }{2}},{\frac {\pi }{2}}]}con densidad12porqueφ{\textstyle {\frac {1}{2}}\cos \varphi }. [ 1 ] Entonces podemos observar dos círculos máximos diferentes:

  1. Si las coordenadas se eligen de modo que el círculo máximo sea un ecuador (latitudφ=0{\displaystyle \varphi =0}), la densidad condicional para una longitudλ{\displaystyle \lambda }definido en el intervalo[π,π]{\displaystyle [-\pi ,\pi ]}esF(λφ=0)=12π.{\displaystyle f(\lambda \mid \varphi =0)={\frac {1}{2\pi }}.}
  2. Si el círculo máximo es una línea de longitud conλ=0{\displaystyle \lambda =0}, la densidad condicional para φ{\displaystyle \varphi }en el intervalo[π2,π2]{\textstyle [-{\frac {\pi }{2}},{\frac {\pi }{2}}]}esF(φλ=0)=12porqueφ.{\displaystyle f(\varphi \mid \lambda =0)={\frac {1}{2}}\cos \varphi .}

Una distribución es uniforme sobre el círculo, la otra no. Sin embargo, ambas parecen referirse al mismo círculo máximo en diferentes sistemas de coordenadas.

Se han producido numerosas discusiones bastante inútiles —entre probabilistas por lo demás competentes— sobre cuál de estos resultados es el "correcto".

Explicación e implicaciones

En el caso (1) anterior, la probabilidad condicional de que la longitud λ se encuentre en un conjunto E dado que φ = 0 se puede escribir P ( λE | φ = 0 ). La teoría elemental de la probabilidad sugiere que esto se puede calcular como P ( λE y φ = 0)/ P ( φ = 0 ), pero esa expresión no está bien definida ya que P ( φ = 0) = 0. La teoría de la medida proporciona una forma de definir una probabilidad condicional, utilizando el límite de eventos R ab = { φ  : a < φ < b } que son anillos horizontales (zonas de superficie curvas de segmentos esféricos ) que consisten en todos los puntos con latitud entre a y b .

La resolución de la paradoja consiste en observar que, en el caso (2), P ( φF | λ = 0) se define utilizando un límite de los eventos L cd = { λ  : c < λ < d }, que son lunas (cuñas verticales), que consisten en todos los puntos cuya longitud varía entre c y d . Así, aunque P ( λE | φ = 0) y P ( φF | λ = 0) proporcionan cada una una distribución de probabilidad en un círculo máximo, una de ellas se define utilizando límites de anillos y la otra utilizando límites de lunas. Dado que los anillos y las lunas tienen formas diferentes, debería ser menos sorprendente que P ( λE | φ = 0) y P ( φF | λ = 0) tengan distribuciones diferentes.

El concepto de probabilidad condicional con respecto a una hipótesis aislada cuya probabilidad es igual a 0 es inadmisible. Porque podemos obtener una distribución de probabilidad para [la latitud] en el círculo meridiano solo si consideramos este círculo como un elemento de la descomposición de toda la superficie esférica en círculos meridianos con los polos dados.

… el término «círculo máximo» es ambiguo hasta que especifiquemos qué operación límite lo produce. El argumento intuitivo de la simetría presupone el límite ecuatorial; sin embargo, comer rodajas de naranja podría presuponer lo contrario.

Explicación matemática

Perspectiva teórica de la medida

Para comprender el problema, debemos reconocer que una distribución de una variable aleatoria continua se describe mediante una función de densidad f únicamente con respecto a alguna medida μ . Ambas son importantes para la descripción completa de la distribución de probabilidad. O, equivalentemente, necesitamos definir completamente el espacio en el que queremos definir f .

Sean Φ y Λ dos variables aleatorias que toman valores en Ω 1 =[π2,π2]{\textstyle \left[-{\frac {\pi }{2}},{\frac {\pi }{2}}\right]}respectivamente Ω 2 = [− π , π ]. Un evento {Φ  = φ , Λ = λ } da un punto en la esfera S ( r ) con radio r . Definimos la transformación de coordenadas    

incógnita=rporqueφporqueλy=rporqueφpecadoλz=rpecadoφ{\displaystyle {\begin{aligned}x&=r\cos \varphi \cos \lambda \\y&=r\cos \varphi \sin \lambda \\z&=r\sin \varphi \end{aligned}}}

para el cual obtenemos el elemento de volumen

ωr(φ,λ)=(incógnita,y,z)φ×(incógnita,y,z)λ=r2porqueφ .{\displaystyle \omega _{r}(\varphi ,\lambda )=\left\|{\partial (x,y,z) \over \partial \varphi }\times {\partial (x,y,z) \over \partial \lambda }\right\|=r^{2}\cos \varphi \ .}

Además, si φ o λ están fijos, obtenemos los elementos de volumen.

ωr(λ)=(incógnita,y,z)φ=r ,respectivamenteωr(φ)=(incógnita,y,z)λ=rporqueφ .{\displaystyle {\begin{aligned}\omega _{r}(\lambda )&=\left\|{\partial (x,y,z) \over \partial \varphi }\right\|=r\ ,\quad {\text{respectively}}\\[3pt]\omega _{r}(\varphi )&=\left\|{\partial (x,y,z) \over \partial \lambda }\right\|=r\cos \varphi \ .\end{aligned}}}

Dejar

μΦ,Λ(dφ,dλ)=FΦ,Λ(φ,λ)ωr(φ,λ)dφdλ{\displaystyle \mu _{\Phi ,\Lambda }(d\varphi ,d\lambda )=f_{\Phi ,\Lambda }(\varphi ,\lambda )\omega _{r}(\varphi ,\lambda )\,d\varphi \,d\lambda }

denotamos la medida conjunta enB(Ω1×Ω2){\displaystyle {\mathcal {B}}(\Omega _{1}\times \Omega _{2})}, que tiene una densidadFΦ,Λ{\displaystyle f_{\Phi ,\Lambda }}con respecto aωr(φ,λ)dφdλ{\displaystyle \omega _{r}(\varphi ,\lambda )\,d\varphi \,d\lambda }y dejar

μΦ(dφ)=λΩ2μΦ,Λ(dφ,dλ) ,μΛ(dλ)=φΩ1μΦ,Λ(dφ,dλ) .{\displaystyle {\begin{aligned}\mu _{\Phi }(d\varphi )&=\int _{\lambda \in \Omega _{2}}\mu _{\Phi ,\Lambda }(d\varphi ,d\lambda )\ ,\\\mu _{\Lambda }(d\lambda )&=\int _{\varphi \in \Omega _{1}}\mu _{\Phi ,\Lambda }(d\varphi ,d\lambda )\ .\end{aligned}}}

Si asumimos que la densidadFΦ,Λ{\displaystyle f_{\Phi ,\Lambda }}es uniforme, entonces

μΦΛ(dφλ)=μΦ,Λ(dφ,dλ)μΛ(dλ)=12rωr(φ)dφ ,yμΛΦ(dλφ)=μΦ,Λ(dφ,dλ)μΦ(dφ)=12rπωr(λ)dλ .{\displaystyle {\begin{aligned}\mu _{\Phi \mid \Lambda }(d\varphi \mid \lambda )&={\mu _{\Phi ,\Lambda }(d\varphi ,d\lambda ) \over \mu _{\Lambda }(d\lambda )}={\frac {1}{2r}}\omega _{r}(\varphi )\,d\varphi \ ,\quad {\text{and}}\\[3pt]\mu _{\Lambda \mid \Phi }(d\lambda \mid \varphi )&={\mu _{\Phi ,\Lambda }(d\varphi ,d\lambda ) \over \mu _{\Phi }(d\varphi )}={\frac {1}{2r\pi }}\omega _{r}(\lambda )\,d\lambda \ .\end{aligned}}}

Por eso,μΦΛ{\displaystyle \mu _{\Phi \mid \Lambda }}tiene una densidad uniforme con respecto aωr(φ)dφ{\displaystyle \omega _{r}(\varphi )\,d\varphi }pero no con respecto a la medida de Lebesgue . Por otro lado,μΛΦ{\displaystyle \mu _{\Lambda \mid \Phi }}tiene una densidad uniforme con respecto aωr(λ)dλ{\displaystyle \omega _{r}(\lambda )\,d\lambda }y la medida Lebesgue.

Prueba de contradicción

Consideremos un vector aleatorio(incógnita,Y,Z){\displaystyle (X,Y,Z)}que se distribuye uniformemente en la esfera unitariaS2{\displaystyle S^{2}}.

Comenzamos parametrizando la esfera con las coordenadas polares esféricas habituales :

incógnita=porque(φ)porque(θ)y=porque(φ)pecado(θ)z=pecado(φ){\displaystyle {\begin{aligned}x&=\cos(\varphi )\cos(\theta )\\y&=\cos(\varphi )\sin(\theta )\\z&=\sin(\varphi )\end{aligned}}}

dóndeπ2φπ2{\textstyle -{\frac {\pi }{2}}\leq \varphi \leq {\frac {\pi }{2}}}yπθπ{\displaystyle -\pi \leq \theta \leq \pi }.

Podemos definir variables aleatoriasΦ{\displaystyle \Phi },Θ{\displaystyle \Theta }como los valores de(incógnita,Y,Z){\displaystyle (X,Y,Z)} bajo la inversa de esta parametrización, o más formalmente usando la función arctan2 :

Φ=arcoseno(Z)Θ=arctan2(Y1Z2,incógnita1Z2){\displaystyle {\begin{aligned}\Phi &=\arcsin(Z)\\\Theta &=\arctan _{2}\left({\frac {Y}{\sqrt {1-Z^{2}}}},{\frac {X}{\sqrt {1-Z^{2}}}}\right)\end{aligned}}}

Utilizando las fórmulas para el área de superficie de una calota esférica y una cuña esférica , la superficie de una cuña de calota esférica viene dada por

Área(Θθ,Φφ)=(1+pecado(φ))(θ+π){\displaystyle \operatorname {Area} (\Theta \leq \theta ,\Phi \leq \varphi )=(1+\sin(\varphi ))(\theta +\pi )}

Desde(incógnita,Y,Z){\displaystyle (X,Y,Z)}Si se distribuye uniformemente, la probabilidad es proporcional al área de la superficie, lo que da como resultado la función de distribución acumulativa conjunta.

FΦ,Θ(φ,θ)=PAG(Θθ,Φφ)=14π(1+pecado(φ))(θ+π){\displaystyle F_{\Phi ,\Theta }(\varphi ,\theta )=P(\Theta \leq \theta ,\Phi \leq \varphi )={\frac {1}{4\pi }}(1+\sin(\varphi ))(\theta +\pi )}

La función de densidad de probabilidad conjunta viene dada por

FΦ,Θ(φ,θ)=2φθFΦ,Θ(φ,θ)=14πporque(φ){\displaystyle f_{\Phi ,\Theta }(\varphi ,\theta )={\frac {\partial ^{2}}{\partial \varphi \partial \theta }}F_{\Phi ,\Theta }(\varphi ,\theta )={\frac {1}{4\pi }}\cos(\varphi )}

Tenga en cuenta queΦ{\displaystyle \Phi }yΘ{\displaystyle \Theta }son variables aleatorias independientes.

Para simplificar, no calcularemos la distribución condicional completa en un círculo máximo, sino solo la probabilidad de que el vector aleatorio se encuentre en el primer octante. Es decir, intentaremos calcular la probabilidad condicional.PAG(A|B){\displaystyle \mathbb {P} (A|B)}con

A={0<Θ<π4}={0<incógnita<1,0<Y<incógnita}B={Φ=0}={Z=0}{\displaystyle {\begin{aligned}A&=\left\{0<\Theta <{\frac {\pi }{4}}\right\}&&=\{0<X<1,0<Y<X\}\\B&=\{\Phi =0\}&&=\{Z=0\}\end{aligned}}}

Intentamos evaluar la probabilidad condicional como un límite de condicionamiento en los eventos.

Bε={|Φ|<ε}{\displaystyle B_{\varepsilon }=\{|\Phi |<\varepsilon \}}

ComoΦ{\displaystyle \Phi }yΘ{\displaystyle \Theta }son independientes, al igual que los eventos.A{\displaystyle A}yBε{\displaystyle B_{\varepsilon }}, por lo tanto

PAG(AB)=¿límiteε0PAG(ABε)PAG(Bε)=límiteε0PAG(A)=PAG(0<Θ<π4)=18.{\displaystyle P(A\mid B)\mathrel {\stackrel {?}{=}} \lim _{\varepsilon \to 0}{\frac {P(A\cap B_{\varepsilon })}{P(B_{\varepsilon })}}=\lim _{\varepsilon \to 0}P(A)=P\left(0<\Theta <{\frac {\pi }{4}}\right)={\frac {1}{8}}.}

Ahora repetimos el proceso con una parametrización diferente de la esfera:

incógnita=pecado(φ)y=porque(φ)pecado(θ)z=porque(φ)porque(θ){\displaystyle {\begin{aligned}x&=\sin(\varphi )\\y&=\cos(\varphi )\sin(\theta )\\z&=-\cos(\varphi )\cos(\theta )\end{aligned}}}

Esto es equivalente a la parametrización anterior rotada 90 grados alrededor del eje y .

Definir nuevas variables aleatorias

Φ=arcoseno(incógnita)Θ=arctan2(Y1incógnita2,Z1incógnita2).{\displaystyle {\begin{aligned}\Phi '&=\arcsin(X)\\\Theta '&=\arctan _{2}\left({\frac {Y}{\sqrt {1-X^{2}}}},{\frac {-Z}{\sqrt {1-X^{2}}}}\right).\end{aligned}}}

La rotación conserva la medida, por lo que la densidad deΦ{\displaystyle \Phi '}y Θ{\displaystyle \Theta '}es lo mismo:

FΦ,Θ(φ,θ)=14πporque(φ){\displaystyle f_{\Phi ',\Theta '}(\varphi ,\theta )={\frac {1}{4\pi }}\cos(\varphi )}.

Las expresiones para A y B son:

A={0<Θ<π4}={0<incógnita<1, 0<Y<incógnita}={0<Θ<π, 0<Φ<π2, pecado(Θ)<broncearse(Φ)}B={Φ=0}={Z=0}={Θ=π2}{Θ=π2}.{\displaystyle {\begin{aligned}A&=\left\{0<\Theta <{\frac {\pi }{4}}\right\}&&=\{0<X<1,\ 0<Y<X\}&&=\left\{0<\Theta '<\pi ,\ 0<\Phi '<{\frac {\pi }{2}},\ \sin(\Theta ')<\tan(\Phi ')\right\}\\B&=\{\Phi =0\}&&=\{Z=0\}&&=\left\{\Theta '=-{\frac {\pi }{2}}\right\}\cup \left\{\Theta '={\frac {\pi }{2}}\right\}.\end{aligned}}}

Intentando nuevamente evaluar la probabilidad condicional como un límite de condicionamiento en los eventos

Bε={|Θ+π2|<ε}{|Θπ2|<ε}.{\displaystyle B_{\varepsilon }^{\prime }=\left\{\left|\Theta '+{\frac {\pi }{2}}\right|<\varepsilon \right\}\cup \left\{\left|\Theta '-{\frac {\pi }{2}}\right|<\varepsilon \right\}.}

Utilizando la regla de L'Hôpital y la diferenciación bajo el signo integral :

PAG(AB)=¿límiteε0PAG(ABε)PAG(Bε)=límiteε014ε2πPAG(π2ε<Θ<π2+ε, 0<Φ<π2, pecado(Θ)<broncearse(Φ))=π2límiteε0επ/2ϵπ/2+ϵ0π/21pecado(θ)<broncearse(φ)FΦ,Θ(φ,θ)dφdθ=π0π/211<broncearse(φ)FΦ,Θ(φ,π2)dφ=ππ/4π/214πporque(φ)dφ=14(112)18{\displaystyle {\begin{aligned}P(A\mid B)&\mathrel {\stackrel {?}{=}} \lim _{\varepsilon \to 0}{\frac {P(A\cap B_{\varepsilon }^{\prime })}{P(B_{\varepsilon }^{\prime })}}\\&=\lim _{\varepsilon \to 0}{\frac {1}{\frac {4\varepsilon }{2\pi }}}P\left({\frac {\pi }{2}}-\varepsilon <\Theta '<{\frac {\pi }{2}}+\varepsilon ,\ 0<\Phi '<{\frac {\pi }{2}},\ \sin(\Theta ')<\tan(\Phi ')\right)\\&={\frac {\pi }{2}}\lim _{\varepsilon \to 0}{\frac {\partial }{\partial \varepsilon }}\int _{{\pi }/{2}-\epsilon }^{{\pi }/{2}+\epsilon }\int _{0}^{{\pi }/{2}}1_{\sin(\theta )<\tan(\varphi )}f_{\Phi ',\Theta '}(\varphi ,\theta )\mathrm {d} \varphi \mathrm {d} \theta \\&=\pi \int _{0}^{{\pi }/{2}}1_{1<\tan(\varphi )}f_{\Phi ',\Theta '}\left(\varphi ,{\frac {\pi }{2}}\right)\mathrm {d} \varphi \\&=\pi \int _{\pi /4}^{\pi /2}{\frac {1}{4\pi }}\cos(\varphi )\mathrm {d} \varphi \\&={\frac {1}{4}}\left(1-{\frac {1}{\sqrt {2}}}\right)\neq {\frac {1}{8}}\end{aligned}}}

Esto demuestra que la densidad condicional no puede tratarse como condicionada a un evento de probabilidad cero, como se explica en Probabilidad condicional#Condicionamiento a un evento de probabilidad cero .

Véase también

Notas

  1. 1 2 3 Jaynes 2003 , págs. 1514–1517 
  2. Originalmente de Kolmogorov (1933) , traducido en Kolmogorov (1956) . Fuente: Pollard (2002).

Referencias

  • Jaynes, ET (2003). «15.7 La paradoja de Borel-Kolmogorov». Teoría de la probabilidad: La lógica de la ciencia . Cambridge University Press. pp. 467–470 . ISBN  0-521-59271-2. MR 1992316 . 
    • Edición fragmentaria (1994) (págs.  1514-1517 ) Archivada el 30 de septiembre de 2018 en Wayback Machine ( formato PostScript )
  • Kolmogorov, Andrey (1933). Grundbegriffe der Wahrscheinlichkeitsrechnung (en alemán). Berlín: Julius Springer.
    • Traducción: Kolmogorov, Andrey (1956). «Capítulo V, §2. Explicación de una paradoja de Borel» . Fundamentos de la teoría de la probabilidad (2.ª ed.). Nueva York: Chelsea. págs. 50-51 . ISBN   0-8284-0023-7Archivado del original el 14 de septiembre de 2018. Consultado el 12 de marzo de 2009 .{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda )
  • Pollard, David (2002). «Capítulo 5. Condicionamiento, Ejemplo 17.». Guía del usuario para la probabilidad basada en la teoría de la medida . Cambridge University Press. págs. 122-123 . ISBN  0-521-00289-3. SR 1873379 . 
  • Mosegaard, Klaus; Tarantola, Albert (2002). "16 Enfoque probabilístico para problemas inversos". Manual internacional de sismología de terremotos e ingeniería . Geofísica internacional. Vol.  81. pp. 237–265 . doi : 10.1016/S0074-6142(02)80219-4 . ISBN  9780124406520.
  • Gal, Yarin. "La paradoja de Borel-Kolmogorov" (PDF) .