Articulo de referencia

Variables aleatorias independientes e idénticamente distribuidas

Un gráfico que muestra una distribución uniforme En teoría de la probabilidad y estadística , un conjunto de variables aleatorias es independiente e idénticamente distribuida ( ...

Un gráfico que muestra una distribución uniforme. Los puntos del gráfico están dispersos aleatoriamente, sin ningún patrón ni agrupamiento.
Un gráfico que muestra una distribución uniforme

En teoría de la probabilidad y estadística , un conjunto de variables aleatorias es independiente e idénticamente distribuida ( iid , iid o IID ) si cada variable aleatoria tiene la misma distribución de probabilidad que las demás y todas son mutuamente independientes . [ 1 ] IID se definió por primera vez en estadística y encuentra aplicación en muchos campos, como la minería de datos y el procesamiento de señales .

Introducción

La estadística suele trabajar con muestras aleatorias. Una muestra aleatoria puede considerarse como un conjunto de objetos elegidos al azar. Formalmente, se define como "una secuencia de datos aleatorios independientes e idénticamente distribuidos (IID) ".

En otras palabras, los términos muestra aleatoria e IID son sinónimos. En estadística, " muestra aleatoria " es la terminología habitual, pero en probabilidad es más común decir " IID ".

  • La distribución idéntica significa que no existen tendencias generales; la distribución no fluctúa y todos los elementos de la muestra provienen de la misma distribución de probabilidad .
  • Independiente significa que los elementos de la muestra son todos eventos independientes. En otras palabras, no están conectados entre sí de ninguna manera; [ 2 ] el conocimiento del valor de una variable no proporciona información sobre el valor de la otra y viceversa.

Solicitud

A menudo se utilizan variables aleatorias independientes e idénticamente distribuidas como supuesto, lo que tiende a simplificar las matemáticas subyacentes. Sin embargo, en las aplicaciones prácticas del modelado estadístico , este supuesto puede o no ser realista. [ 3 ]

La suposición i.i.d. también se utiliza en el teorema del límite central , que establece que la distribución de probabilidad de la suma (o promedio) de variables i.i.d. con varianza finita se aproxima a una distribución normal . [ 4 ]

La suposición i.i.d. surge frecuentemente en el contexto de secuencias de variables aleatorias. Entonces, "independientes e idénticamente distribuidas" implica que un elemento en la secuencia es independiente de las variables aleatorias que lo preceden. De esta manera, una secuencia i.i.d. es diferente de una secuencia de Markov , donde la distribución de probabilidad para la n -ésima variable aleatoria es una función de la variable aleatoria anterior en la secuencia (para una secuencia de Markov de primer orden). Una secuencia i.i.d. no implica que las probabilidades para todos los elementos del espacio muestral o del espacio de eventos deban ser las mismas. [ 5 ] Por ejemplo, lanzamientos repetidos de dados trucados producirán una secuencia i.i.d., a pesar de que los resultados estén sesgados.

En el procesamiento de señales y el procesamiento de imágenes , la noción de transformación a iid implica dos especificaciones, la parte "id" y la parte "i.":

id . – El nivel de la señal debe estar equilibrado en el eje del tiempo.

i . – El espectro de la señal debe aplanarse, es decir, transformarse mediante filtrado (como la deconvolución ) en una señal de ruido blanco (es decir, una señal donde todas las frecuencias están presentes por igual).

Definición

Definición para dos variables aleatorias

Supongamos que las variables aleatoriasincógnita{\displaystyle X}yY{\displaystyle Y}se definen para asumir valores enIR{\displaystyle I\subseteq \mathbb {R} }. DejarFincógnita(incógnita)=PAG(incógnitaincógnita){\displaystyle F_{X}(x)=\operatorname {P} (X\leq x)}yFY(y)=PAG(Yy){\displaystyle F_{Y}(y)=\operatorname {P} (Y\leq y)}sean las funciones de distribución acumulativa deincógnita{\displaystyle X}yY{\displaystyle Y}y denotan, respectivamente, su función de distribución acumulativa conjunta porFincógnita,Y(incógnita,y)=PAG(incógnitaincógnitaYy){\displaystyle F_{X,Y}(x,y)=\operatorname {P} (X\leq x\land Y\leq y)}.

Dos variables aleatoriasincógnita{\displaystyle X}yY{\displaystyle Y}son independientes si y solo siFincógnita,Y(incógnita,y)=Fincógnita(incógnita)FY(y){\displaystyle F_{X,Y}(x,y)=F_{X}(x)\cdot F_{Y}(y)}a pesar deincógnita,yI{\displaystyle x,y\in I}. (Para el caso más simple de eventos, dos eventosA{\displaystyle A}yB{\displaystyle B}son independientes si y solo siPAG(AB)=PAG(A)PAG(B){\displaystyle P(A\land B)=P(A)\cdot P(B)}(Véase también Independencia (teoría de la probabilidad) §  Dos variables aleatorias .)

Dos variables aleatoriasincógnita{\displaystyle X}yY{\displaystyle Y}están idénticamente distribuidas si y solo siFincógnita(incógnita)=FY(incógnita){\displaystyle F_{X}(x)=F_{Y}(x)}a pesar deincógnitaI{\displaystyle x\in I}. [ 6 ]

Dos variables aleatoriasincógnita{\displaystyle X}yY{\displaystyle Y}son iid si son independientes e idénticamente distribuidas, es decir, si y solo si

Fincógnita(incógnita)=FY(incógnita)incógnitaIFincógnita,Y(incógnita,y)=Fincógnita(incógnita)FY(y)incógnita,yI{\displaystyle {\begin{aligned}&F_{X}(x)=F_{Y}(x)\,&\forall x\in I\\&F_{X,Y}(x,y)=F_{X}(x)\cdot F_{Y}(y)\,&\forall x,y\in I\end{aligned}}}

Definición para más de dos variables aleatorias

La definición se extiende naturalmente a más de dos variables aleatorias. Decimos quenorte{\displaystyle n}variables aleatoriasincógnita1,,incógnitanorte{\displaystyle X_{1},\ldots ,X_{n}}son iid si son independientes (véase más adelante Independencia (teoría de la probabilidad) §  Más de dos variables aleatorias ) e idénticamente distribuidas, es decir, si y solo si

Fincógnita1(incógnita)=Fincógnitak(incógnita)k{1,,norte} y incógnitaIFincógnita1,,incógnitanorte(incógnita1,,incógnitanorte)=Fincógnita1(incógnita1)Fincógnitanorte(incógnitanorte)incógnita1,,incógnitanorteI{\displaystyle {\begin{aligned}&F_{X_{1}}(x)=F_{X_{k}}(x)\,&\forall k\in \{1,\ldots ,n\}{\text{ y }}\forall x\in I\\&F_{X_{1},\ldots ,X_{n}}(x_{1},\ldots ,x_{n})=F_{X_{1}}(x_{1})\cdot \ldots \cdot F_{X_{n}}(x_{n})\,&\forall x_{1},\ldots ,x_{n}\in I\end{aligned}}}

dóndeFincógnita1,,incógnitanorte(incógnita1,,incógnitanorte)=PAG(incógnita1incógnita1incógnitanorteincógnitanorte){\displaystyle F_{X_{1},\ldots ,X_{n}}(x_{1},\ldots ,x_{n})=\operatorname {P} (X_{1}\leq x_{1}\land \ldots \land X_{n}\leq x_{n})}denota la función de distribución acumulativa conjunta deincógnita1,,incógnitanorte{\displaystyle X_{1},\ldots ,X_{n}}.

Ejemplos

Ejemplo 1

Una secuencia de resultados de giros de una ruleta justa o injusta es i.i.d. Una implicación de esto es que si la bola de la ruleta cae en "rojo", por ejemplo, 20 veces seguidas, la siguiente tirada no tiene más ni menos probabilidades de ser "negra" que cualquier otra tirada (véase la falacia del jugador ).

Ejemplo 2

Lanza una moneda 10 veces y anota los resultados en variables.A1,,A10{\displaystyle A_{1},\ldots ,A_{10}}.

  1. Independiente : Cada resultadoAi{\displaystyle A_{i}}no afectará el otro resultadoAj{\displaystyle A_{j}}(paraij{\displaystyle i\neq j}de 1 a 10), lo que significa que las variablesA1,,A10{\displaystyle A_{1},\ldots ,A_{10}}son independientes entre sí.
  2. Distribución idéntica : independientemente de si la moneda es justa (con una probabilidad de 1/2 de obtener cara) o está trucada, siempre que se utilice la misma moneda en cada lanzamiento, la probabilidad de obtener cara se mantiene constante en todos los lanzamientos.

Dicha secuencia de variables i.i.d. también se denomina proceso de Bernoulli .

Ejemplo 3

Lanza un dado 10 veces y guarda los resultados en variables.A1,,A10{\displaystyle A_{1},\ldots ,A_{10}}.

  1. Independientes : Cada resultado de la tirada del dado no afectará al siguiente, lo que significa que las 10 variables son independientes entre sí.
  2. Distribución idéntica : Independientemente de si el dado es justo o trucado, cada lanzamiento tendrá la misma probabilidad de obtener cada resultado que cualquier otro lanzamiento. En cambio, lanzar 10 dados diferentes, algunos trucados y otros no, no produciría variables aleatorias independientes e idénticamente distribuidas (i.i.d.).

Ejemplo 4

Elige una carta de una baraja estándar de 52 cartas y vuelve a colocarla en la baraja. Repite este proceso 52 veces. Observa cuándo aparece un rey.

  1. Independientes : Cada observación no afectará a la siguiente, lo que significa que los 52 resultados son independientes entre sí. Por el contrario, si cada carta extraída se mantiene fuera de la baraja, las extracciones posteriores se verían afectadas (extraer un rey haría menos probable extraer un segundo rey), y las observaciones no serían independientes.
  2. Distribución idéntica : Después de sacar una carta (y luego devolverla a la baraja), la probabilidad de obtener un rey es de 4/52, lo que significa que la probabilidad es idéntica en cada ocasión.

Generalizaciones

Muchos resultados que se demostraron inicialmente bajo el supuesto de que las variables aleatorias son i.i.d. se han demostrado válidos incluso bajo un supuesto de distribución más débil .

Variables aleatorias intercambiables

La noción más general que comparte las propiedades principales de las variables i.i.d. son las variables aleatorias intercambiables , introducidas por Bruno de Finetti . La intercambiabilidad significa que, si bien las variables pueden no ser independientes, las futuras se comportan como las pasadas —formalmente, cualquier valor de una secuencia finita es tan probable como cualquier permutación de esos valores— la distribución de probabilidad conjunta es invariante bajo el grupo simétrico .

Esto proporciona una generalización útil; por ejemplo, el muestreo sin reemplazo no es independiente, pero sí intercambiable.

Proceso de Lévy

En cálculo estocástico , las variables i.i.d. se consideran un proceso de Lévy de tiempo discreto : cada variable indica cuánto cambia de un momento a otro. Por ejemplo, una secuencia de ensayos de Bernoulli se interpreta como el proceso de Bernoulli .

Esto podría generalizarse para incluir procesos de Lévy de tiempo continuo , y muchos procesos de Lévy pueden verse como límites de variables i.i.d.; por ejemplo, el proceso de Wiener es el límite del proceso de Bernoulli.

En el aprendizaje automático

El aprendizaje automático (AA) implica aprender relaciones estadísticas dentro de los datos. Para entrenar modelos de AA de manera efectiva, es fundamental utilizar datos que sean ampliamente generalizables. Si los datos de entrenamiento no son suficientemente representativos de la tarea, el rendimiento del modelo con datos nuevos y desconocidos puede ser deficiente.

La hipótesis i.i.d. permite una reducción significativa en el número de casos individuales necesarios en la muestra de entrenamiento, simplificando los cálculos de optimización. En los problemas de optimización, la suposición de distribuciones independientes e idénticas simplifica el cálculo de la función de verosimilitud. Debido a esta suposición, la función de verosimilitud se puede expresar como:

l(θ)=PAG(incógnita1,incógnita2,incógnita3,...,incógnitanorte|θ)=PAG(incógnita1|θ)PAG(incógnita2|θ)PAG(incógnita3|θ)...PAG(incógnitanorte|θ){\displaystyle l(\theta )=P(x_{1},x_{2},x_{3},...,x_{n}|\theta )=P(x_{1}|\theta )P(x_{2}|\theta )P(x_{3}|\theta )...P(x_{n}|\theta )}

Para maximizar la probabilidad del evento observado, se aplica la función logarítmica para maximizar el parámetro.θ{\textstyle \theta }En concreto, calcula:

argramometroaincógnitaθregistro(l(θ)){\displaystyle \mathop {\rm {argmax}} \limits _{\theta }\log(l(\theta ))}

dónde

registro(l(θ))=registro(PAG(incógnita1|θ))+registro(PAG(incógnita2|θ))+registro(PAG(incógnita3|θ))+...+registro(PAG(incógnitanorte|θ)){\displaystyle \log(l(\theta ))=\log(P(x_{1}|\theta ))+\log(P(x_{2}|\theta ))+\log(P(x_{3}|\theta ))+...+\log(P(x_{n}|\theta ))}

Las computadoras son muy eficientes para realizar sumas múltiples, pero no tanto para realizar multiplicaciones. Esta simplificación mejora la eficiencia computacional. La transformación logarítmica, en el proceso de maximización, convierte muchas funciones exponenciales en funciones lineales.

Existen dos razones principales por las que esta hipótesis resulta prácticamente útil con el teorema del límite central (TLC):

  1. Aunque la muestra provenga de una distribución compleja no gaussiana , se puede aproximar bien porque el teorema del límite central permite simplificarla a una distribución gaussiana.
  2. La segunda razón es que la precisión del modelo depende de la simplicidad y la capacidad de representación de la unidad del modelo, así como de la calidad de los datos. La simplicidad de la unidad facilita su interpretación y escalabilidad, mientras que la capacidad de representación y la escalabilidad mejoran la precisión del modelo. En una red neuronal profunda , por ejemplo, cada neurona es simple pero potente en su representación, capa por capa, capturando características más complejas para mejorar la precisión del modelo.

Véase también

Referencias

  1. Clauset, Aaron (2011). "Una breve introducción a las distribuciones de probabilidad" (PDF) . Instituto Santa Fe . Archivado del original (PDF) el 20 de enero de 2012. Consultado el 29 de noviembre de 2011 .
  2. Stephanie (11 de mayo de 2016). "Estadísticas IID: definición y ejemplos de variables independientes e idénticamente distribuidas" . Statistics How To . Consultado el 9 de diciembre de 2021 .
  3. Hampel, Frank (1998), "¿Es demasiado difícil la estadística?", Canadian Journal of Statistics , 26 (3): 497– 513, doi : 10.2307/3315772 , hdl : 20.500.11850/145503 , JSTOR 3315772 , S2CID 53117661  (§8).
  4. Blum, JR; Chernoff, H.; Rosenblatt, M.; Teicher, H. (1958). "Teoremas del límite central para procesos intercambiables" . Revista canadiense de matemáticas . 10 : 222–229 . doi : 10.4153/CJM-1958-026-0 . S2CID 124843240 . 
  5. Cover, TM; Thomas, JA (2006). Elements Of Information Theory . Wiley-Interscience . pp. 57–58 . ISBN  978-0-471-24195-9.
  6. Casella y Berger 2002 , Teorema 1.5.10 

Lecturas adicionales