Articulo de referencia

Independent and identically distributed random variables

A chart showing a uniform distribution In probability theory and statistics , a collection of random variables is independent and identically distributed ( i.i.d. , iid , or IID...

Un gráfico que muestra una distribución uniforme. Los puntos del gráfico están dispersos aleatoriamente, sin ningún patrón ni agrupamiento.
A chart showing a uniform distribution

In probability theory and statistics, a collection of random variables is independent and identically distributed (i.i.d., iid, or IID) if each random variable has the same probability distribution as the others and all are mutually independent.[1] IID was first defined in statistics and finds application in many fields, such as data mining and signal processing.

Introduction

Statistics commonly deals with random samples. A random sample can be thought of as a set of objects that are chosen randomly. More formally, it is "a sequence of independent, identically distributed (IID) random data points."

In other words, the terms random sample and IID are synonymous. In statistics, "random sample" is the typical terminology, but in probability, it is more common to say "IID."

  • Identically distributed means that there are no overall trends — the distribution does not fluctuate and all items in the sample are taken from the same probability distribution.
  • Independent means that the sample items are all independent events. In other words, they are not connected to each other in any way;[2] knowledge of the value of one variable gives no information about the value of the other and vice versa.

Application

Independent and identically distributed random variables are often used as an assumption, which tends to simplify the underlying mathematics. In practical applications of statistical modeling, however, this assumption may or may not be realistic.[3]

The i.i.d. assumption is also used in the central limit theorem, which states that the probability distribution of the sum (or average) of i.i.d. variables with finite variance approaches a normal distribution.[4]

La suposición i.i.d. surge frecuentemente en el contexto de secuencias de variables aleatorias. Entonces, "independientes e idénticamente distribuidas" implica que un elemento en la secuencia es independiente de las variables aleatorias que lo preceden. De esta manera, una secuencia i.i.d. es diferente de una secuencia de Markov , donde la distribución de probabilidad para la n -ésima variable aleatoria es una función de la variable aleatoria anterior en la secuencia (para una secuencia de Markov de primer orden). Una secuencia i.i.d. no implica que las probabilidades para todos los elementos del espacio muestral o del espacio de eventos deban ser las mismas. [ 5 ] Por ejemplo, lanzamientos repetidos de dados trucados producirán una secuencia i.i.d., a pesar de que los resultados estén sesgados.

En el procesamiento de señales y el procesamiento de imágenes , la noción de transformación a iid implica dos especificaciones, la parte "id" y la parte "i.":

id . – El nivel de la señal debe estar equilibrado en el eje del tiempo.

i . – El espectro de la señal debe aplanarse, es decir, transformarse mediante filtrado (como la deconvolución ) en una señal de ruido blanco (es decir, una señal donde todas las frecuencias están presentes por igual).

Definición

Definición para dos variables aleatorias

Supongamos que las variables aleatoriasincógnita{\displaystyle X}yY{\displaystyle Y}se definen para asumir valores enIR{\displaystyle I\subseteq \mathbb {R} }. DejarFincógnita(incógnita)=PAG(incógnitaincógnita){\displaystyle F_{X}(x)=\operatorname {P} (X\leq x)}yFY(y)=PAG(Yy){\displaystyle F_{Y}(y)=\operatorname {P} (Y\leq y)}sean las funciones de distribución acumulativa deincógnita{\displaystyle X}yY{\displaystyle Y}y denotan, respectivamente, su función de distribución acumulativa conjunta porFincógnita,Y(incógnita,y)=PAG(incógnitaincógnitaYy){\displaystyle F_{X,Y}(x,y)=\operatorname {P} (X\leq x\land Y\leq y)}.

Dos variables aleatoriasincógnita{\displaystyle X}yY{\displaystyle Y}son independientes si y solo siFincógnita,Y(incógnita,y)=Fincógnita(incógnita)FY(y){\displaystyle F_{X,Y}(x,y)=F_{X}(x)\cdot F_{Y}(y)}a pesar deincógnita,yI{\displaystyle x,y\in I}. (Para el caso más simple de eventos, dos eventosA{\displaystyle A}yB{\displaystyle B}son independientes si y solo siPAG(AB)=PAG(A)PAG(B){\displaystyle P(A\land B)=P(A)\cdot P(B)}(Véase también Independencia (teoría de la probabilidad) §  Dos variables aleatorias .)

Dos variables aleatoriasincógnita{\displaystyle X}yY{\displaystyle Y}están distribuidas idénticamente si y solo siFincógnita(incógnita)=FY(incógnita){\displaystyle F_{X}(x)=F_{Y}(x)}a pesar deincógnitaI{\displaystyle x\in I}. [ 6 ]

Dos variables aleatoriasincógnita{\displaystyle X}yY{\displaystyle Y}son iid si son independientes e idénticamente distribuidas, es decir, si y solo si

Fincógnita(incógnita)=FY(incógnita)incógnitaIFincógnita,Y(incógnita,y)=Fincógnita(incógnita)FY(y)incógnita,yI{\displaystyle {\begin{aligned}&F_{X}(x)=F_{Y}(x)\,&\forall x\in I\\&F_{X,Y}(x,y)=F_{X}(x)\cdot F_{Y}(y)\,&\forall x,y\in I\end{aligned}}}

Definición para más de dos variables aleatorias

La definición se extiende naturalmente a más de dos variables aleatorias. Decimos quenorte{\displaystyle n}variables aleatoriasincógnita1,,incógnitanorte{\displaystyle X_{1},\ldots ,X_{n}}son iid si son independientes (véase más adelante Independencia (teoría de la probabilidad) §  Más de dos variables aleatorias ) e idénticamente distribuidas, es decir, si y solo si

Fincógnita1(incógnita)=Fincógnitak(incógnita)k{1,,norte} y incógnitaIFincógnita1,,incógnitanorte(incógnita1,,incógnitanorte)=Fincógnita1(incógnita1)Fincógnitanorte(incógnitanorte)incógnita1,,incógnitanorteI{\displaystyle {\begin{aligned}&F_{X_{1}}(x)=F_{X_{k}}(x)\,&\forall k\in \{1,\ldots ,n\}{\text{ y }}\forall x\in I\\&F_{X_{1},\ldots ,X_{n}}(x_{1},\ldots ,x_{n})=F_{X_{1}}(x_{1})\cdot \ldots \cdot F_{X_{n}}(x_{n})\,&\forall x_{1},\ldots ,x_{n}\in I\end{aligned}}}

dóndeFincógnita1,,incógnitanorte(incógnita1,,incógnitanorte)=PAG(incógnita1incógnita1incógnitanorteincógnitanorte){\displaystyle F_{X_{1},\ldots ,X_{n}}(x_{1},\ldots ,x_{n})=\operatorname {P} (X_{1}\leq x_{1}\land \ldots \land X_{n}\leq x_{n})}denota la función de distribución acumulativa conjunta deincógnita1,,incógnitanorte{\displaystyle X_{1},\ldots ,X_{n}}.

Ejemplos

Ejemplo 1

Una secuencia de resultados de giros de una ruleta justa o injusta es i.i.d. Una implicación de esto es que si la bola de la ruleta cae en "rojo", por ejemplo, 20 veces seguidas, la siguiente tirada no tiene más ni menos probabilidades de ser "negra" que cualquier otra tirada (véase la falacia del jugador ).

Ejemplo 2

Lanza una moneda 10 veces y anota los resultados en variables.A1,,A10{\displaystyle A_{1},\ldots ,A_{10}}.

  1. Independiente : Cada resultadoAi{\displaystyle A_{i}}no afectará el otro resultadoAj{\displaystyle A_{j}}(paraij{\displaystyle i\neq j}de 1 a 10), lo que significa que las variablesA1,,A10{\displaystyle A_{1},\ldots ,A_{10}}son independientes entre sí.
  2. Distribución idéntica : independientemente de si la moneda es justa (con una probabilidad de 1/2 de obtener cara) o está trucada, siempre que se utilice la misma moneda en cada lanzamiento, la probabilidad de obtener cara se mantiene constante en todos los lanzamientos.

Dicha secuencia de variables i.i.d. también se denomina proceso de Bernoulli .

Ejemplo 3

Lanza un dado 10 veces y guarda los resultados en variables.A1,,A10{\displaystyle A_{1},\ldots ,A_{10}}.

  1. Independientes : Cada resultado de la tirada del dado no afectará al siguiente, lo que significa que las 10 variables son independientes entre sí.
  2. Distribución idéntica : Independientemente de si el dado es justo o trucado, cada lanzamiento tendrá la misma probabilidad de obtener cada resultado que cualquier otro lanzamiento. En cambio, lanzar 10 dados diferentes, algunos trucados y otros no, no produciría variables aleatorias independientes e idénticamente distribuidas (i.i.d.).

Ejemplo 4

Elige una carta de una baraja estándar de 52 cartas y vuelve a colocarla en la baraja. Repite este proceso 52 veces. Observa cuándo aparece un rey.

  1. Independientes : Cada observación no afectará a la siguiente, lo que significa que los 52 resultados son independientes entre sí. Por el contrario, si cada carta extraída se mantiene fuera de la baraja, las extracciones posteriores se verían afectadas (extraer un rey haría menos probable extraer un segundo rey), y las observaciones no serían independientes.
  2. Distribución idéntica : Después de sacar una carta (y luego devolverla a la baraja), la probabilidad de obtener un rey es de 4/52, lo que significa que la probabilidad es idéntica en cada ocasión.

Generalizaciones

Muchos resultados que se demostraron inicialmente bajo el supuesto de que las variables aleatorias son i.i.d. se han demostrado válidos incluso bajo un supuesto de distribución más débil .

Variables aleatorias intercambiables

La noción más general que comparte las propiedades principales de las variables i.i.d. son las variables aleatorias intercambiables , introducidas por Bruno de Finetti . La intercambiabilidad significa que, si bien las variables pueden no ser independientes, las futuras se comportan como las pasadas —formalmente, cualquier valor de una secuencia finita es tan probable como cualquier permutación de esos valores— la distribución de probabilidad conjunta es invariante bajo el grupo simétrico .

Esto proporciona una generalización útil; por ejemplo, el muestreo sin reemplazo no es independiente, pero sí intercambiable.

Proceso de Lévy

En cálculo estocástico , las variables i.i.d. se consideran un proceso de Lévy de tiempo discreto : cada variable indica cuánto cambia de un momento a otro. Por ejemplo, una secuencia de ensayos de Bernoulli se interpreta como el proceso de Bernoulli .

Esto podría generalizarse para incluir procesos de Lévy de tiempo continuo , y muchos procesos de Lévy pueden verse como límites de variables i.i.d.; por ejemplo, el proceso de Wiener es el límite del proceso de Bernoulli.

En el aprendizaje automático

El aprendizaje automático (AA) implica aprender relaciones estadísticas dentro de los datos. Para entrenar modelos de AA de manera efectiva, es fundamental utilizar datos que sean ampliamente generalizables. Si los datos de entrenamiento no son suficientemente representativos de la tarea, el rendimiento del modelo con datos nuevos y desconocidos puede ser deficiente.

La hipótesis i.i.d. permite una reducción significativa en el número de casos individuales necesarios en la muestra de entrenamiento, simplificando los cálculos de optimización. En los problemas de optimización, la suposición de distribuciones independientes e idénticas simplifica el cálculo de la función de verosimilitud. Debido a esta suposición, la función de verosimilitud se puede expresar como:

l(θ)=PAG(incógnita1,incógnita2,incógnita3,...,incógnitanorte|θ)=PAG(incógnita1|θ)PAG(incógnita2|θ)PAG(incógnita3|θ)...PAG(incógnitanorte|θ){\displaystyle l(\theta )=P(x_{1},x_{2},x_{3},...,x_{n}|\theta )=P(x_{1}|\theta )P(x_{2}|\theta )P(x_{3}|\theta )...P(x_{n}|\theta )}

Para maximizar la probabilidad del evento observado, se aplica la función logarítmica para maximizar el parámetro.θ{\textstyle \theta }En concreto, calcula:

argramometroaincógnitaθregistro(l(θ)){\displaystyle \mathop {\rm {argmax}} \limits _{\theta }\log(l(\theta ))}

dónde

registro(l(θ))=registro(PAG(incógnita1|θ))+registro(PAG(incógnita2|θ))+registro(PAG(incógnita3|θ))+...+registro(PAG(incógnitanorte|θ)){\displaystyle \log(l(\theta ))=\log(P(x_{1}|\theta ))+\log(P(x_{2}|\theta ))+\log(P(x_{3}|\theta ))+...+\log(P(x_{n}|\theta ))}

Las computadoras son muy eficientes para realizar sumas múltiples, pero no tanto para realizar multiplicaciones. Esta simplificación mejora la eficiencia computacional. La transformación logarítmica, en el proceso de maximización, convierte muchas funciones exponenciales en funciones lineales.

Existen dos razones principales por las que esta hipótesis resulta prácticamente útil con el teorema del límite central (TLC):

  1. Aunque la muestra provenga de una distribución compleja no gaussiana , se puede aproximar bien porque el teorema del límite central permite simplificarla a una distribución gaussiana.
  2. La segunda razón es que la precisión del modelo depende de la simplicidad y la capacidad de representación de la unidad del modelo, así como de la calidad de los datos. La simplicidad de la unidad facilita su interpretación y escalabilidad, mientras que la capacidad de representación y la escalabilidad mejoran la precisión del modelo. En una red neuronal profunda , por ejemplo, cada neurona es simple pero potente en su representación, capa por capa, capturando características más complejas para mejorar la precisión del modelo.

Véase también

Referencias

  1. Clauset, Aaron (2011). "Una breve introducción a las distribuciones de probabilidad" (PDF) . Instituto Santa Fe . Archivado del original (PDF) el 20 de enero de 2012. Consultado el 29 de noviembre de 2011 .
  2. Stephanie (11 de mayo de 2016). "Estadísticas IID: definición y ejemplos de variables independientes e idénticamente distribuidas" . Statistics How To . Consultado el 9 de diciembre de 2021 .
  3. Hampel, Frank (1998), "¿Es demasiado difícil la estadística?", Canadian Journal of Statistics , 26 (3): 497– 513, doi : 10.2307/3315772 , hdl : 20.500.11850/145503 , JSTOR 3315772 , S2CID 53117661  (§8).
  4. Blum, JR; Chernoff, H.; Rosenblatt, M.; Teicher, H. (1958). "Teoremas del límite central para procesos intercambiables" . Revista canadiense de matemáticas . 10 : 222–229 . doi : 10.4153/CJM-1958-026-0 . S2CID 124843240 . 
  5. Cover, TM; Thomas, JA (2006). Elements Of Information Theory . Wiley-Interscience . pp. 57–58 . ISBN  978-0-471-24195-9.
  6. Casella y Berger 2002 , Teorema 1.5.10 

Lecturas adicionales