Articulo de referencia

Probabilidad condicional

En teoría de la probabilidad , la probabilidad condicional es una medida de la probabilidad de que ocurra un evento , dado que se sabe que otro evento (por suposición, presunció...

En teoría de la probabilidad , la probabilidad condicional es una medida de la probabilidad de que ocurra un evento , dado que se sabe que otro evento (por suposición, presunción, afirmación o evidencia) ya ha ocurrido. [ 1 ] Este método particular se basa en que el evento A ocurra con algún tipo de relación con otro evento B. En esta situación, el evento A puede analizarse mediante una probabilidad condicional con respecto a B. Si el evento de interés es A y se sabe o se supone que el evento B ha ocurrido, "la probabilidad condicional de A dado B ", o "la probabilidad de A bajo la condición B ", se suele escribir como P( A | B ) [ 2 ] o, en ocasiones, P B ( A ) . Esto también puede entenderse como la fracción de probabilidad B que se cruza con A, o la razón de las probabilidades de que ocurran ambos eventos con respecto a que ocurra el "dado" (cuántas veces ocurre A en lugar de no suponer que B ha ocurrido):

PAG(AB)=PAG(AB)PAG(B){\displaystyle P(A\mid B)={\frac {P(A\cap B)}{P(B)}}}. [ 3 ]

Por ejemplo, la probabilidad de que una persona tenga tos en un día cualquiera puede ser solo del 5%. Pero si sabemos o suponemos que la persona está enferma, entonces es mucho más probable que tosa. Por ejemplo, la probabilidad condicional de que alguien enfermo tosa podría ser del 75%, en cuyo caso tendríamos que P(Tos) = 5% y P(Tos|Enfermo) = 75%. Si bien existe una relación entre A y B en este ejemplo, dicha relación o dependencia entre A y B no es necesaria, ni tampoco tienen que ocurrir simultáneamente.

P( A | B ) puede ser igual o no a P( A ) , es decir, la probabilidad incondicional o absoluta de A. Si P( A | B ) = P( A ) , entonces se dice que los eventos A y B son independientes : en tal caso, el conocimiento de uno de los eventos no altera la probabilidad del otro. P( A | B ) (la probabilidad condicional de A dado B ) generalmente difiere de P( B | A ) . Por ejemplo, si una persona tiene dengue , podría tener un 90% de probabilidad de dar positivo en la prueba de la enfermedad. En este caso, lo que se mide es que si el evento B ( tener dengue ) ha ocurrido, la probabilidad de A ( dar positivo en la prueba ) dado que B ocurrió es del 90%, simplemente escribiendo P( A | B ) = 90%. Alternativamente, si una persona da positivo en la prueba de dengue, puede tener solo un 15% de probabilidad de tener realmente esta enfermedad rara debido a las altas tasas de falsos positivos . En este caso, la probabilidad del evento B ( tener dengue ) dado que el evento A ( dar positivo en la prueba ) ha ocurrido es del 15%, o P( B | A ) = 15%. Ahora debería ser evidente que igualar erróneamente ambas probabilidades puede conducir a diversos errores de razonamiento, como las falacias de la tasa base .

Si bien las probabilidades condicionales pueden proporcionar información extremadamente útil, a menudo se dispone de información limitada. Por lo tanto, puede ser útil invertir o convertir una probabilidad condicional utilizando el teorema de Bayes :PAG(AB)=PAG(BA)PAG(A)PAG(B){\displaystyle P(A\mid B)={{P(B\mid A)P(A)} \over {P(B)}}}. [ 4 ] Otra opción es mostrar probabilidades condicionales en una tabla de probabilidad condicional para ilustrar la relación entre eventos.

Definición

Ilustración de probabilidades condicionales con un diagrama de Euler . La probabilidad incondicional P( A ) = 0,30 + 0,10 + 0,12 = 0,52. Sin embargo, la probabilidad condicional P ( A | B1 ) = 1, P ( A | B2 ) = 0,12 ÷ (0,12 + 0,04) = 0,75 y P( A | B3 ) = 0.
En un diagrama de árbol , las probabilidades de las ramas dependen del evento asociado al nodo padre. (Aquí, las barras superiores indican que el evento no ocurre).
Diagrama circular de Venn que describe probabilidades condicionales

Condicionamiento en un evento

Definición de Kolmogorov

Dados dos eventos A y B del campo sigma de un espacio de probabilidad , con la probabilidad incondicional de B siendo mayor que cero (es decir, P( B ) > 0) , la probabilidad condicional de A dado B (PAG(AB){\displaystyle P(A\mid B)}) es la probabilidad de que ocurra A si B ha ocurrido o se supone que ha ocurrido. [ 5 ] Se supone que A es el conjunto de todos los resultados posibles de un experimento o ensayo aleatorio que tiene un espacio muestral restringido o reducido. La probabilidad condicional se puede encontrar mediante el cociente de la probabilidad de la intersección conjunta de los eventos A y B , es decir,PAG(AB){\displaystyle P(A\cap B)}, la probabilidad de que A y B ocurran juntos, y la probabilidad de B : [ 2 ] [ 6 ] [ 7 ]

PAG(AB)=PAG(AB)PAG(B).{\displaystyle P(A\mid B)={\frac {P(A\cap B)}{P(B)}}.}

Para un espacio muestral que consta de resultados de igual probabilidad, la probabilidad del evento A se entiende como la fracción del número de resultados en A con respecto al número de todos los resultados en el espacio muestral. Entonces, esta ecuación se entiende como la fracción del conjuntoAB{\displaystyle A\cap B}al conjunto B. Nótese que la ecuación anterior es una definición, no solo un resultado teórico. Denotamos la cantidadPAG(AB)PAG(B){\displaystyle {\frac {P(A\cap B)}{P(B)}}}comoPAG(AB){\displaystyle P(A\mid B)}y la llamamos la "probabilidad condicional de A dado B ".

Como axioma de probabilidad

Algunos autores, como de Finetti , prefieren introducir la probabilidad condicional como un axioma de probabilidad :

PAG(AB)=PAG(AB)PAG(B).{\displaystyle P(A\cap B)=P(A\mid B)P(B).}

Esta ecuación para una probabilidad condicional, aunque matemáticamente equivalente, puede ser intuitivamente más fácil de entender. Puede interpretarse como "la probabilidad de que ocurra B multiplicada por la probabilidad de que ocurra A , siempre que B haya ocurrido, es igual a la probabilidad de que ocurran A y B juntas, aunque no necesariamente al mismo tiempo". Además, esto puede ser preferible desde un punto de vista filosófico; bajo las principales interpretaciones de la probabilidad , como la teoría subjetiva , la probabilidad condicional se considera una entidad primitiva. Además, esta "regla de multiplicación" puede ser prácticamente útil para calcular la probabilidad deAB{\displaystyle A\cap B}e introduce una simetría con el axioma de suma para la fórmula de Poincaré:

PAG(AB)=PAG(A)+PAG(B)PAG(AB){\displaystyle P(A\cup B)=P(A)+P(B)-P(A\cap B)}
De este modo, las ecuaciones pueden combinarse para encontrar una nueva representación de la  :
PAG(AB)=PAG(A)+PAG(B)PAG(AB)=PAG(AB)PAG(B){\displaystyle P(A\cap B)=P(A)+P(B)-P(A\cup B)=P(A\mid B)P(B)}
PAG(AB)=PAG(A)+PAG(B)PAG(AB)PAG(B){\displaystyle P(A\cup B)={P(A)+P(B)-P(A\mid B){P(B)}}}

Como la probabilidad de un evento condicional

La probabilidad condicional se puede definir como la probabilidad de un evento condicional.AB{\displaystyle A_{B}}El evento condicional de Goodman-Nguyen-Van Fraassen se puede definir como:

AB=i1(j<iB¯j,AiBi),{\displaystyle A_{B}=\bigcup _{i\geq 1}\left(\bigcap _{j<i}{\overline {B}}_{j},A_{i}B_{i}\right),}dóndeAi{\displaystyle A_{i}}yBi{\displaystyle B_{i}}representan estados o elementos de A o B. [ 8 ]

Se puede demostrar que

PAG(AB)=PAG(AB)PAG(B){\displaystyle P(A_{B})={\frac {P(A\cap B)}{P(B)}}}

que cumple con la definición de probabilidad condicional de Kolmogorov. [ 9 ]

Condicionamiento a un evento de probabilidad cero

SiPAG(B)=0{\displaystyle P(B)=0}, entonces según la definición,PAG(AB){\displaystyle P(A\mid B)}no está definido .

El caso de mayor interés es el de una variable aleatoria Y , condicionada a una variable aleatoria continua X que resulta en un resultado particular x . El eventoB={incógnita=incógnita}{\displaystyle B=\{X=x\}}tiene probabilidad cero y, como tal, no se puede condicionar.

En lugar de condicionar a que X sea exactamente x , podríamos condicionar a que esté más cerca que la distanciaε{\displaystyle \varepsilon }lejos de x . El eventoB={incógnitaε<incógnita<incógnita+ε}{\displaystyle B=\{x-\varepsilon <X<x+\varepsilon \}}En general, tendrá una probabilidad distinta de cero y, por lo tanto, se puede condicionar. Entonces podemos tomar el límite.

Por ejemplo, si dos variables aleatorias continuas X e Y tienen una densidad conjuntaFincógnita,Y(incógnita,y){\displaystyle f_{X,Y}(x,y)}, luego por la regla de L'Hôpital y la regla integral de Leibniz , al diferenciar con respecto aε{\displaystyle \varepsilon }:

límiteε0PAG(YUincógnita0ε<incógnita<incógnita0+ε)=límiteε0incógnita0εincógnita0+εUFincógnita,Y(incógnita,y)dydincógnitaincógnita0εincógnita0+εRFincógnita,Y(incógnita,y)dydincógnita=UFincógnita,Y(incógnita0,y)dyRFincógnita,Y(incógnita0,y)dy.{\displaystyle {\begin{aligned}\lim _{\varepsilon \to 0}P(Y\in U\mid x_{0}-\varepsilon <X<x_{0}+\varepsilon )&=\lim _{\varepsilon \to 0}{\frac {\int _{x_{0}-\varepsilon }^{x_{0}+\varepsilon }\int _{U}f_{X,Y}(x,y)\,\mathrm {d} y\,\mathrm {d} x}{\int _{x_{0}-\varepsilon }^{x_{0}+\varepsilon }\int _{\mathbb {R} }f_{X,Y}(x,y)\,\mathrm {d} y\,\mathrm {d} x}}\\[6pt]&={\frac {\int _{U}f_{X,Y}(x_{0},y)\,\mathrm {d} y}{\int _{\mathbb {R} }f_{X,Y}(x_{0},y)\,\mathrm {d} y}}.\end{aligned}}}

El límite resultante es la distribución de probabilidad condicional de Y dado X y existe cuando el denominador, la densidad de probabilidadFincógnita(incógnita0){\displaystyle f_{X}(x_{0})}, es estrictamente positivo.

Resulta tentador definir la probabilidad indefinida.PAG(Aincógnita=incógnita){\displaystyle P(A\mid X=x)}utilizando limit( 1 ), pero esto no se puede hacer de manera consistente. En particular, es posible encontrar variables aleatorias X y W y valores x , w tales que los eventos{incógnita=incógnita}{\displaystyle \{X=x\}}y{W=w}{\displaystyle \{W=w\}}son idénticos, pero los límites resultantes no lo son:

límiteε0PAG(Aincógnitaεincógnitaincógnita+ε)límiteε0PAG(AwεWw+ε).{\displaystyle \lim _{\varepsilon \to 0}P(A\mid x-\varepsilon \leq X\leq x+\varepsilon )\neq \lim _{\varepsilon \to 0}P(A\mid w-\varepsilon \leq W\leq w+\varepsilon ).}

La paradoja de Borel-Kolmogorov lo demuestra mediante un argumento geométrico.

Condicionamiento sobre una variable aleatoria discreta

Sea X una variable aleatoria discreta y sus posibles resultados denotemos V. Por ejemplo, si X representa el valor de un dado lanzado, entonces V es el conjunto{1,2,3,4,5,6}{\displaystyle \{1,2,3,4,5,6\}}Supongamos, a efectos de presentación, que X es una variable aleatoria discreta, de modo que cada valor en V tiene una probabilidad distinta de cero.

Para un valor x en V y un evento A , la probabilidad condicional viene dada porPAG(Aincógnita=incógnita){\displaystyle P(A\mid X=x)}. Escribiendo

do(incógnita,A)=PAG(Aincógnita=incógnita){\displaystyle c(x,A)=P(A\mid X=x)}

En resumen, vemos que es una función de dos variables, x y A.

Para un A fijo , podemos formar la variable aleatoriaY=do(incógnita,A){\displaystyle Y=c(X,A)}Representa un resultado dePAG(Aincógnita=incógnita){\displaystyle P(A\mid X=x)}siempre que se observe un valor x de X.

La probabilidad condicional de A dado X puede tratarse, por lo tanto, como una variable aleatoria Y con resultados en el intervalo[0,1]{\displaystyle [0,1]}. Según la ley de probabilidad total , su valor esperado es igual a la probabilidad incondicional de A.

Probabilidad condicional parcial

La probabilidad condicional parcial PAG(AB1b1,,Bmetrobmetro){\displaystyle P(A\mid B_{1}\equiv b_{1},\ldots ,B_{m}\equiv b_{m})} se trata de la probabilidad de un evento A{\displaystyle A}dado que cada uno de los eventos de condición Bi{\displaystyle B_{i}}ha ocurrido en cierta medida bi{\displaystyle b_{i}}(grado de creencia, grado de experiencia) que podría ser diferente del 100%. Frecuentísticamente, la probabilidad condicional parcial tiene sentido si las condiciones se prueban en repeticiones experimentales de duración apropiada. norte{\displaystyle n}. [ 10 ] Tal norte{\displaystyle n}La probabilidad condicional parcial acotada se puede definir como la ocurrencia promedio esperada condicionalmente del evento.A{\displaystyle A}en bancos de prueba de longitud norte{\displaystyle n}que se ajustan a todas las especificaciones de probabilidad Bibi{\displaystyle B_{i}\equiv b_{i}}, es decir:

PAGnorte(AB1b1,,Bmetrobmetro)=mi(A¯norteB¯1norte=b1,,B¯metronorte=bmetro){\displaystyle P^{n}(A\mid B_{1}\equiv b_{1},\ldots ,B_{m}\equiv b_{m})=\operatorname {E} ({\overline {A}}^{n}\mid {\overline {B}}_{1}^{n}=b_{1},\ldots ,{\overline {B}}_{m}^{n}=b_{m})}[ 10 ]

Sobre esa base, la probabilidad condicional parcial se puede definir como

PAG(AB1b1,,Bmetrobmetro)=límitenortePAGnorte(AB1b1,,Bmetrobmetro),{\displaystyle P(A\mid B_{1}\equiv b_{1},\ldots ,B_{m}\equiv b_{m})=\lim _{n\to \infty }P^{n}(A\mid B_{1}\equiv b_{1},\ldots ,B_{m}\equiv b_{m}),}

dóndebinortenorte{\displaystyle b_{i}n\in \mathbb {N} }[ 10 ]

La condicionalización de Jeffrey [ 11 ] [ 12 ] es un caso especial de probabilidad condicional parcial, en el que los eventos de condición deben formar una partición :

PAG(AB1b1,,Bmetrobmetro)=i=1metrobiPAG(ABi){\displaystyle P(A\mid B_{1}\equiv b_{1},\ldots ,B_{m}\equiv b_{m})=\sum _{i=1}^{m}b_{i}P(A\mid B_{i})}

Ejemplo

Supongamos que alguien lanza en secreto dos dados justos de seis caras , y queremos calcular la probabilidad de que el valor de la cara superior del primero sea 2, sabiendo que su suma no es mayor que 5.

  • Sea D 1 el valor obtenido al lanzar el dado 1.
  • Sea D2 el valor obtenido al lanzar el dado 2.

Probabilidad de que D 1  =  2

La Tabla 1 muestra el espacio muestral de 36 combinaciones de valores obtenidos al lanzar los dos dados, cada una de las cuales ocurre con una probabilidad de 1/36, siendo los números mostrados en las celdas rojas y gris oscuro D 1 + D 2 .

D 1  =  2 en exactamente 6 de los 36 resultados; por lo tanto, P ( D 1 = 2)  = 6 36 = 1 6 :   

Probabilidad de que D 1  + D 2 ≤ 5   

La tabla 2 muestra que D 1  + D 2 ≤ 5 para exactamente 10 de los 36 resultados, por lo tanto P ( D 1 + D 2 ≤ 5) = 10 36 :         

Probabilidad de que D 1  =  2 dado que D 1  + D 2 ≤ 5   

La tabla 3 muestra que para 3 de estos 10 resultados, D 1  =  2.

Por lo tanto, la probabilidad condicional P( D 1  =  2  | D 1 + D 2 ≤ 5) = 3 10 = 0,3:       

Aquí, en la notación anterior para la definición de probabilidad condicional, el evento condicionante B es que D 1  + D 2 ≤ 5, y el evento A es D 1 = 2. Tenemos     PAG(AB)=PAG(AB)PAG(B)=3/3610/36=310,{\displaystyle P(A\mid B)={\tfrac {P(A\cap B)}{P(B)}}={\tfrac {3/36}{10/36}}={\tfrac {3}{10}},}como se puede ver en la tabla.

Uso en inferencia

En inferencia estadística , la probabilidad condicional es una actualización de la probabilidad de un evento basada en nueva información. [ 13 ] La nueva información se puede incorporar de la siguiente manera: [ 1 ]

  • Sea A , el evento de interés, en el espacio muestral , digamos ( X , P ).
  • La ocurrencia del evento A sabiendo que el evento B ha ocurrido o habrá ocurrido, significa la ocurrencia de A tal como está restringida a B , es decirAB{\displaystyle A\cap B}.
  • Sin el conocimiento de la ocurrencia de B , la información sobre la ocurrencia de A sería simplemente P ( A ).
  • La probabilidad de que A sepa que el evento B ha ocurrido o habrá ocurrido, será la probabilidad deAB{\displaystyle A\cap B}en relación con P ( B ), la probabilidad de que B haya ocurrido.
  • Esto da como resultadoPAG(AB)=PAG(AB)/PAG(B){\textstyle P(A\mid B)=P(A\cap B)/P(B)}siempre que P ( B )  >  0 y 0 en caso contrario.

Este enfoque da como resultado una medida de probabilidad consistente con la medida de probabilidad original y que satisface todos los axiomas de Kolmogorov . Esta medida de probabilidad condicional también podría haberse obtenido asumiendo que la magnitud relativa de la probabilidad de A con respecto a X se conserva con respecto a B (véase la Derivación Formal a continuación).

El término «evidencia» o «información» se utiliza generalmente en la interpretación bayesiana de la probabilidad . El evento condicionante se interpreta como evidencia del evento condicionado. Es decir, P ( A ) es la probabilidad de A antes de considerar la evidencia E , y P ( A | E ) es la probabilidad de A después de considerar la evidencia E o después de actualizar P ( A ). Esto es coherente con la interpretación frecuentista, que es la primera definición mencionada anteriormente.

Ejemplo

Cuando se transmite código Morse , existe cierta probabilidad de que el punto o la raya recibida sea errónea. Esto suele interpretarse como interferencia en la transmisión del mensaje. Por lo tanto, al enviar un punto, es importante considerar, por ejemplo, la probabilidad de que se reciba un punto. Esto se representa mediante:PAG(punto enviado | punto recibido)=PAG(punto recibido | punto enviado)PAG(punto enviado)PAG(punto recibido).{\displaystyle P({\text{dot sent }}|{\text{ dot received}})=P({\text{dot received }}|{\text{ dot sent}}){\frac {P({\text{dot sent}})}{P({\text{dot received}})}}.}En el código Morse, la proporción de puntos a rayas es de 3:4 en el momento de la transmisión, por lo que las probabilidades de un "punto" y una "raya" sonPAG(punto enviado)=37 y PAG(dash enviado)=47{\displaystyle P({\text{dot sent}})={\frac {3}{7}}{\text{ and }}P({\text{dash sent}})={\frac {4}{7}}}Si se supone que la probabilidad de que un punto se transmita como una raya es 1/10, y que la probabilidad de que una raya se transmita como un punto es igualmente 1/10, entonces se puede utilizar la regla de Bayes para calcularPAG(punto recibido){\displaystyle P({\text{dot received}})}.

PAG(punto recibido)=PAG(punto recibidopunto enviado)+PAG(punto recibidodash enviado){\displaystyle P({\text{dot received}})=P({\text{dot received}}\cap {\text{dot sent}})+P({\text{dot received}}\cap {\text{dash sent}})}
PAG(punto recibido)=PAG(punto recibidopunto enviado)PAG(punto enviado)+PAG(punto recibidodash enviado)PAG(dash enviado){\displaystyle P({\text{dot received}})=P({\text{dot received}}\mid {\text{dot sent}})P({\text{dot sent}})+P({\text{dot received}}\mid {\text{dash sent}})P({\text{dash sent}})}
PAG(punto recibido)=910×37+110×47=3170{\displaystyle P({\text{dot received}})={\frac {9}{10}}\times {\frac {3}{7}}+{\frac {1}{10}}\times {\frac {4}{7}}={\frac {31}{70}}}

Ahora,PAG(punto enviadopunto recibido){\displaystyle P({\text{dot sent}}\mid {\text{dot received}})}se puede calcular:

PAG(punto enviadopunto recibido)=PAG(punto recibidopunto enviado)PAG(punto enviado)PAG(punto recibido)=910×373170=2731{\displaystyle P({\text{dot sent}}\mid {\text{dot received}})=P({\text{dot received}}\mid {\text{dot sent}}){\frac {P({\text{dot sent}})}{P({\text{dot received}})}}={\frac {9}{10}}\times {\frac {\frac {3}{7}}{\frac {31}{70}}}={\frac {27}{31}}}[ 14 ]

Información, probabilidad condicional e independencia estadística

Los conceptos de probabilidad condicional e independencia estadística pueden entenderse a través de la idea de cómo la nueva información cambia la incertidumbre de un individuo sobre un evento.

Ejemplo 1

Eventos dependientes (Dado de seis caras)

Consideremos el experimento de lanzar un dado justo de seis caras, donde el espacio muestral esS={1,2,3,4,5,6}{\displaystyle S=\{1,2,3,4,5,6\}}. Sea A el evento que denota la ocurrencia de un número par, entoncesA={2,4,6}{\displaystyle A=\{2,4,6\}}y sea el evento B la ocurrencia de un número menor o igual a 3 , por lo tantoB={1,2,3}{\displaystyle B=\{1,2,3\}}. Antes de que se disponga de información adicional, las probabilidades de estos eventos sonPAG(A)=36=12{\displaystyle P(A)={\frac {3}{6}}={\frac {1}{2}}}yPAG(B)=36=12{\displaystyle P(B)={\frac {3}{6}}={\frac {1}{2}}}La intersección de los dos eventos esAB={2}{\displaystyle A\cap B=\{2\}}y por lo tantoPAG(AB)=16{\displaystyle P(A\cap B)={\frac {1}{6}}}Si los eventos fueran estadísticamente independientes, esperaríamosPAG(AB)=PAG(A)PAG(B){\displaystyle P(A\cap B)=P(A)P(B)}. Sin embargo,1612×12=14{\displaystyle {\frac {1}{6}}\neq {\frac {1}{2}}\times {\frac {1}{2}}={\frac {1}{4}}}, lo que indica que los eventos A y B no son independientes, sino que son estadísticamente dependientes.

Ahora supongamos que un observador revela que ha ocurrido el evento A ; es decir, se sabe que el resultado es un número par. Esta nueva información reduce el espacio muestral efectivo deS={1,2,3,4,5,6}{\displaystyle S=\{1,2,3,4,5,6\}}aA={2,4,6}{\displaystyle A=\{2,4,6\}}Dentro de este espacio de muestra reducido, el evento B solo puede ocurrir cuando el resultado es 2 , por lo que el evento relevante se convierte enAB={2}{\displaystyle A\cap B=\{2\}}. En consecuencia, la probabilidad condicional del evento B dado que el evento A ha ocurrido esPAG(BA)=PAG(AB)PAG(A)=1/61/2=13{\displaystyle P(B\mid A)={\frac {P(A\cap B)}{P(A)}}={\frac {1/6}{1/2}}={\frac {1}{3}}}. Por lo tanto, la probabilidad del evento B cambia de12{\displaystyle {\frac {1}{2}}}a13{\displaystyle {\frac {1}{3}}}Tras proporcionar la información adicional, este cambio en la probabilidad demuestra que el conocimiento del evento A afecta la probabilidad del evento B , confirmando así la dependencia estadística entre ambos eventos. En tales situaciones, la información adicional reduce la incertidumbre y puede influir significativamente en la toma de decisiones racionales, la predicción y el comportamiento en las apuestas.

Ejemplo 2

Eventos independientes (dado de ocho caras)

Consideremos el experimento de lanzar un dado justo de ocho caras con espacio muestralS={1,2,3,4,5,6,7,8}{\displaystyle S=\{1,2,3,4,5,6,7,8\}}. Sea el evento A el resultado menor que 5 , de modo queA={1,2,3,4}{\displaystyle A=\{1,2,3,4\}}y sea el evento B el resultado que sea 3, 4, 5 o 6 , de modo queB={3,4,5,6}{\displaystyle B=\{3,4,5,6\}}Inicialmente, las probabilidades de estos eventos sonPAG(A)=48=12{\displaystyle P(A)={\frac {4}{8}}={\frac {1}{2}}}yPAG(B)=48=12{\displaystyle P(B)={\frac {4}{8}}={\frac {1}{2}}}La intersección de los dos eventos esAB={3,4}{\displaystyle A\cap B=\{3,4\}}y por lo tantoPAG(AB)=28=14{\displaystyle P(A\cap B)={\frac {2}{8}}={\frac {1}{4}}}. DesdePAG(A)PAG(B=12×12=14{\displaystyle P(A)P(B={\frac {1}{2}}\times {\frac {1}{2}}={\frac {1}{4}}}, obtenemosPAG(AB)=PAG(A)PAG(B){\displaystyle P(A\cap B)=P(A)P(B)}, lo que confirma que los eventos A y B son estadísticamente independientes.

Ahora supongamos que un observador revela que el evento (A) ha ocurrido. Esta información reduce el espacio muestral efectivo deS={1,2,3,4,5,6,7,8}{\displaystyle S=\{1,2,3,4,5,6,7,8\}}aA={1,2,3,4}{\displaystyle A=\{1,2,3,4\}}Dentro de este espacio de muestra reducido, los resultados que también satisfacen el evento B son:AB={3,4}{\displaystyle A\cap B=\{3,4\}}. En consecuencia, la probabilidad condicional del evento B dado que el evento A ha ocurrido es PAG(BA)=PAG(AB)PAG(A)=1/41/2=12{\displaystyle P(B\mid A)={\frac {P(A\cap B)}{P(A)}}={\frac {1/4}{1/2}}={\frac {1}{2}}}. Nótese que esta probabilidad condicional es igual a la probabilidad original del evento B , es decir,PAG(BA)=PAG(B){\displaystyle P(B\mid A)=P(B)}Por lo tanto, saber que ha ocurrido el evento A no cambia la probabilidad del evento B. La información proporcionada por el evento A no afecta la incertidumbre asociada al evento B , lo que demuestra la propiedad fundamental de la independencia estadística: el conocimiento de un evento no altera la probabilidad del otro.

Interpretación

Por lo tanto, la independencia estadística puede interpretarse como la ausencia de valor informativo entre eventos. Si el conocimiento de un evento modifica la probabilidad de otro, los eventos son dependientes. Por el contrario, si la probabilidad permanece inalterada tras obtener nueva información, los eventos son independientes.

Formalmente, dos eventos A y B son independientes si y solo si:

PAG(BA)=PAG(B),{\displaystyle P(B\mid A)=P(B),}lo cual es equivalente a:PAG(AB)=PAG(A)PAG(B).{\displaystyle P(A\cap B)=P(A)P(B).}

En este sentido, la independencia implica que la observación de un evento no proporciona información adicional sobre la ocurrencia del otro evento.

Independencia estadística

Los eventos A y B se definen como estadísticamente independientes si la probabilidad de la intersección de A y B es igual al producto de las probabilidades de A y B:

PAG(AB)=PAG(A)PAG(B).{\displaystyle P(A\cap B)=P(A)P(B).}

Si P ( B ) no es cero, entonces esto es equivalente a la afirmación de que

PAG(AB)=PAG(A).{\displaystyle P(A\mid B)=P(A).}

De manera similar, si P ( A ) no es cero, entonces

PAG(BA)=PAG(B){\displaystyle P(B\mid A)=P(B)}

También es equivalente. Aunque las formas derivadas puedan parecer más intuitivas, no son la definición preferida, ya que las probabilidades condicionales pueden ser indefinidas, y la definición preferida es simétrica en A y B. La independencia no se refiere a un evento disjunto. [ 15 ]

También cabe señalar que, dado el par de eventos independientes [ A , B ] y un evento C , el par se define como condicionalmente independiente si [ 16 ]

PAG(ABdo)=PAG(Ado)PAG(Bdo).{\displaystyle P(AB\mid C)=P(A\mid C)P(B\mid C).}

Este teorema resulta útil en aplicaciones donde se observan múltiples eventos independientes.

Eventos independientes frente a eventos mutuamente excluyentes

Los conceptos de eventos mutuamente independientes y eventos mutuamente excluyentes son distintos e independientes. La siguiente tabla compara los resultados para ambos casos (siempre que la probabilidad del evento condicionante no sea cero).

De hecho, los eventos mutuamente excluyentes no pueden ser estadísticamente independientes (a menos que ambos sean imposibles), ya que saber que uno ocurre proporciona información sobre el otro (en particular, que este último ciertamente no ocurrirá).

Asociación independiente frente a asociación positiva frente a asociación negativa de eventos

falacias comunes

Estas falacias no deben confundirse con la "falacia condicional" de Robert K. Shope de 1978 , que trata sobre ejemplos contrafactuales que incurren en una petición de principio .

Suponiendo que la probabilidad condicional es de un tamaño similar a su inversa

Una visualización geométrica del teorema de Bayes. En la tabla, los valores 2, 3, 6 y 9 dan los pesos relativos de cada condición y caso correspondiente. Las figuras denotan las celdas de la tabla involucradas en cada métrica, siendo la probabilidad la fracción de cada figura que está sombreada. Esto muestra quePAG(AB)PAG(B)=PAG(BA)PAG(A){\displaystyle P(A\mid B)P(B)=P(B\mid A)P(A)}es decirPAG(AB)=PAG(BA)PAG(A)PAG(B){\displaystyle P(A\mid B)={\frac {P(B\mid A)P(A)}{P(B)}}}. Se puede utilizar un razonamiento similar para demostrar quePAG(A¯B)=PAG(BA¯)PAG(A¯)PAG(B){\displaystyle P({\bar {A}}\mid B)={\frac {P(B\mid {\bar {A}})P({\bar {A}})}{P(B)}}}etc.

En general, no se puede asumir que P ( A | B )  P ( B | A ). Esto puede ser un error insidioso, incluso para aquellos que están muy familiarizados con la estadística. [ 17 ] La relación entre P ( A | B ) y P ( B | A ) viene dada por el teorema de Bayes : 

PAG(BA)=PAG(AB)PAG(B)PAG(A)PAG(BA)PAG(AB)=PAG(B)PAG(A){\displaystyle {\begin{aligned}P(B\mid A)&={\frac {P(A\mid B)P(B)}{P(A)}}\\\Leftrightarrow {\frac {P(B\mid A)}{P(A\mid B)}}&={\frac {P(B)}{P(A)}}\end{aligned}}}

Es decir, P ( A | B )  P ( B | A ) solo si P ( B )/ P ( A ) ≈ 1, o equivalentemente, P ( A ) ≈ P ( B ).     

Suponiendo que las probabilidades marginales y condicionales son de tamaño similar.

En general, no se puede asumir que P ( A )  P ( A | B ). Estas probabilidades están vinculadas a través de la ley de la probabilidad total : 

PAG(A)=nortePAG(ABnorte)=nortePAG(ABnorte)PAG(Bnorte).{\displaystyle P(A)=\sum _{n}P(A\cap B_{n})=\sum _{n}P(A\mid B_{n})P(B_{n}).}

donde los eventos(Bnorte){\displaystyle (B_{n})}formar una partición contable deΩ{\displaystyle \Omega }.

This fallacy may arise through selection bias.[18] For example, in the context of a medical claim, let SC be the event that a sequela (chronic disease) S occurs as a consequence of circumstance (acute condition) C. Let H be the event that an individual seeks medical help. Suppose that in most cases, C does not cause S (so that P(SC) is low). Suppose also that medical attention is only sought if S has occurred due to C. From experience of patients, a doctor may therefore erroneously conclude that P(SC) is high. The actual probability observed by the doctor is P(SC|H).

Over- or under-weighting priors

Not taking prior probability into account partially or completely is called base rate neglect. The reverse, insufficient adjustment from the prior probability is conservatism.

Formal derivation

Formally, P(A | B) is defined as the probability of A according to a new probability function on the sample space, such that outcomes not in B have probability 0 and that it is consistent with all original probability measures.[19][20]

Let Ω be a discrete sample space with elementary events {ω}, and let P be the probability measure with respect to the σ-algebra of Ω. Suppose we are told that the event B  Ω has occurred. A new probability distribution (denoted by the conditional notation) is to be assigned on {ω} to reflect this. All events that are not in B will have null probability in the new distribution. For events in B, two conditions must be met: the probability of B is one and the relative magnitudes of the probabilities must be preserved. The former is required by the axioms of probability, and the latter stems from the fact that the new probability measure has to be the analog of P in which the probability of B is one—and every event that is not in B, therefore, has a null probability. Hence, for some scale factor α, the new distribution must satisfy:

  1. ωB:P(ωB)=αP(ω){\displaystyle \omega \in B:P(\omega \mid B)=\alpha P(\omega )}
  2. ωB:P(ωB)=0{\displaystyle \omega \notin B:P(\omega \mid B)=0}
  3. ωΩP(ωB)=1.{\displaystyle \sum _{\omega \in \Omega }{P(\omega \mid B)}=1.}

Substituting 1 and 2 into 3 to select α:

1=ωΩP(ωB)=ωBP(ωB)+ωBP(ωB)0=αωBP(ω)=αP(B)α=1P(B){\displaystyle {\begin{aligned}1&=\sum _{\omega \in \Omega }{P(\omega \mid B)}\\&=\sum _{\omega \in B}{P(\omega \mid B)}+{\cancelto {0}{\sum _{\omega \notin B}P(\omega \mid B)}}\\&=\alpha \sum _{\omega \in B}{P(\omega )}\\[5pt]&=\alpha \cdot P(B)\\[5pt]\Rightarrow \alpha &={\frac {1}{P(B)}}\end{aligned}}}

So the new probability distribution is

  1. ωB:P(ωB)=P(ω)P(B){\displaystyle \omega \in B:P(\omega \mid B)={\frac {P(\omega )}{P(B)}}}
  2. ωB:P(ωB)=0{\displaystyle \omega \notin B:P(\omega \mid B)=0}

Now for a general event A,

P(AB)=ωABP(ωB)+ωABcP(ωB)0=ωABP(ω)P(B)=P(AB)P(B){\displaystyle {\begin{aligned}P(A\mid B)&=\sum _{\omega \in A\cap B}{P(\omega \mid B)}+{\cancelto {0}{\sum _{\omega \in A\cap B^{c}}P(\omega \mid B)}}\\&=\sum _{\omega \in A\cap B}{\frac {P(\omega )}{P(B)}}\\[5pt]&={\frac {P(A\cap B)}{P(B)}}\end{aligned}}}

See also

References

  1. 12Gut, Allan (2013). Probability: A Graduate Course (Second ed.). New York, NY: Springer. ISBN 978-1-4614-4707-8.
  2. 12"Conditional Probability". www.mathsisfun.com. Retrieved 2020-09-11.
  3. Dekking, Frederik Michel; Kraaikamp, Cornelis; Lopuhaä, Hendrik Paul; Meester, Ludolf Erwin (2005). "A Modern Introduction to Probability and Statistics". Springer Texts in Statistics: 26. doi:10.1007/1-84628-168-7. ISBN 978-1-85233-896-1. ISSN 1431-875X.
  4. Dekking, Frederik Michel; Kraaikamp, Cornelis; Lopuhaä, Hendrik Paul; Meester, Ludolf Erwin (2005). "A Modern Introduction to Probability and Statistics". Springer Texts in Statistics: 25–40. doi:10.1007/1-84628-168-7. ISBN 978-1-85233-896-1. ISSN 1431-875X.
  5. Reichl, Linda Elizabeth (2016). "2.3 Probability". A Modern Course in Statistical Physics (4th revised and updated ed.). WILEY-VCH. ISBN 978-3-527-69049-7.
  6. Kolmogorov, Andrey (1956), Foundations of the Theory of Probability, Chelsea
  7. "Conditional Probability". www.stat.yale.edu. Retrieved 2020-09-11.
  8. Flaminio, Tommaso; Godo, Lluis; Hosni, Hykel (2020-09-01). "Boolean algebras of conditionals, probability and logic". Artificial Intelligence. 286 103347. arXiv:2006.04673. doi:10.1016/j.artint.2020.103347. ISSN 0004-3702. S2CID 214584872.
  9. Van Fraassen, Bas C. (1976), "Probabilities of Conditionals", in Harper, William L.; Hooker, Clifford Alan (eds.), Foundations of Probability Theory, Statistical Inference, and Statistical Theories of Science: Volume I Foundations and Philosophy of Epistemic Applications of Probability Theory, The University of Western Ontario Series in Philosophy of Science, Dordrecht: Springer Netherlands, pp. 261–308, doi:10.1007/978-94-010-1853-1_10, ISBN 978-94-010-1853-1, retrieved 2021-12-04
  10. 123Draheim, Dirk (2017). "Generalized Jeffrey Conditionalization (A Frequentist Semantics of Partial Conditionalization)". Springer. Retrieved December 19, 2017.
  11. Jeffrey, Richard C. (1983), The Logic of Decision (2nd ed.), University of Chicago Press, ISBN 9780226395821
  12. "Bayesian Epistemology". Stanford Encyclopedia of Philosophy. 2017. Retrieved December 29, 2017.
  13. Casella, George; Berger, Roger L. (2002). Statistical Inference. Duxbury Press. ISBN 0-534-24312-6.
  14. "Conditional Probability and Independence"(PDF). Retrieved 2021-12-22.
  15. Tijms, Henk (2012). Understanding Probability (3rd ed.). Cambridge: Cambridge University Press. doi:10.1017/cbo9781139206990. ISBN 978-1-107-65856-1.
  16. Pfeiffer, Paul E. (1978). Conditional Independence in Applied Probability. Boston, MA: Birkhäuser Boston. ISBN 978-1-4612-6335-7. OCLC 858880328.
  17. Paulos, J. A. (1988). Innumeracy: Mathematical Illiteracy and its Consequences. Hill and Wang. p. 63 et seq. ISBN 0-8090-7447-8.
  18. Bruss, F. Thomas (2007). "Der Wyatt-Earp-Effekt oder die betörende Macht kleiner Wahrscheinlichkeiten". Spektrum der Wissenschaft (in German). 2: 110–113.
  19. George Casella and Roger L. Berger (1990), Statistical Inference, Duxbury Press, ISBN 0-534-11958-1 (p. 18 et seq.)
  20. Grinstead and Snell's Introduction to Probability, p. 134