Articulo de referencia

Teorema del límite central

En teoría de la probabilidad , el teorema del límite central ( TLC ) establece que, bajo ciertas condiciones, la distribución de una versión normalizada de la media muestral con...

En teoría de la probabilidad , el teorema del límite central ( TLC ) establece que, bajo ciertas condiciones, la distribución de una versión normalizada de la media muestral converge a una distribución normal estándar . Esto se cumple incluso si las variables originales no siguen una distribución normal . Existen varias versiones del TLC, cada una aplicable en diferentes contextos.

Este teorema es un concepto clave en la teoría de la probabilidad porque implica que los métodos probabilísticos y estadísticos que funcionan para las distribuciones normales pueden aplicarse a muchos problemas que involucran otros tipos de distribuciones.

Este teorema ha sufrido muchos cambios durante el desarrollo formal de la teoría de la probabilidad. Las versiones anteriores del teorema datan de 1811, pero su formulación moderna no se presentó con precisión hasta la década de 1920. [ 1 ]

En estadística , el TLC se puede enunciar como: seaincógnita1,incógnita2,,incógnitanorte{\displaystyle X_{1},X_{2},\dots ,X_{n}}denota una muestra estadística de tamañonorte{\displaystyle n}de una población con valor esperado (promedio)μ{\displaystyle \mu }y varianza positiva finitaσ2{\displaystyle \sigma ^{2}}y dejarincógnita¯norte{\displaystyle {\bar {X}}_{n}}denotemos la media muestral (que es en sí misma una variable aleatoria ). Entonces el límite cuandonorte{\displaystyle n\to \infty }de la distribución de(incógnita¯norteμ)norte{\displaystyle ({\bar {X}}_{n}-\mu ){\sqrt {n}}}es una distribución normal con media0{\displaystyle 0}y varianzaσ2{\displaystyle \sigma ^{2}}. [ 2 ]

En otras palabras, supongamos que se obtiene una muestra grande de observaciones , cada una generada aleatoriamente de manera independiente de los valores de las demás, y se calcula la media ( media aritmética ) de los valores observados. Si este procedimiento se repite muchas veces, obteniendo así un conjunto de medias observadas, el teorema del límite central establece que, si el tamaño de la muestra es suficientemente grande, la distribución de probabilidad de estas medias se aproximará mucho a una distribución normal.

El teorema del límite central tiene varias variantes. En su forma común, las variables aleatorias deben ser independientes e idénticamente distribuidas (i.i.d.). Este requisito puede flexibilizarse; la convergencia de la media a la distribución normal también se produce para distribuciones no idénticas o para observaciones no independientes si cumplen ciertas condiciones.

La versión más antigua de este teorema, que establece que la distribución normal puede utilizarse como una aproximación a la distribución binomial , es el teorema de De Moivre-Laplace .

secuencias independientes

Cualquiera que sea la forma de la distribución de la población, la distribución muestral tiende a una gaussiana, y su dispersión viene dada por el teorema del límite central. [ 3 ]

CLT clásico

Dejar(incógnitanorte)norte1{\displaystyle (X_{n})_{n\geq 1}}sea ​​una secuencia de variables aleatorias i.i.d. que tienen una distribución con valor esperado dado porμ{\displaystyle \mu }y varianza finita dada porσ2.{\displaystyle \sigma ^{2}.}Supongamos que estamos interesados ​​en el promedio de la muestra.

incógnita¯norteincógnita1++incógnitanortenorte.{\displaystyle {\bar {X}}_{n}\equiv {\frac {X_{1}+\cdots +X_{n}}{n}}.}

Según la ley de los grandes números , la media muestral converge casi con seguridad (y por lo tanto también converge en probabilidad ) al valor esperado.μ{\displaystyle \mu }comonorte.{\displaystyle n\to \infty .}

El teorema clásico del límite central describe el tamaño y la forma de distribución de las fluctuaciones estocásticas alrededor del número determinista.μ{\displaystyle \mu }durante esta convergencia. Más precisamente, afirma que comonorte{\displaystyle n}A medida que aumenta la distribución de la media normalizadanorte(incógnita¯norteμ){\displaystyle {\sqrt {n}}({\bar {X}}_{n}-\mu )}, es decir, la diferencia entre el promedio de la muestraincógnita¯norte{\displaystyle {\bar {X}}_{n}}y su límiteμ,{\displaystyle \mu ,}escalado por el factornorte{\displaystyle {\sqrt {n}}}, se aproxima a la distribución normal con media0{\displaystyle 0}y varianzaσ2.{\displaystyle \sigma ^{2}.}Para lo suficientemente grandenorte,{\displaystyle n,}la distribución deincógnita¯norte{\displaystyle {\bar {X}}_{n}}se acerca arbitrariamente a la distribución normal con mediaμ{\displaystyle \mu }y varianzaσ2/norte.{\displaystyle \sigma ^{2}/n.}

La utilidad del teorema radica en que la distribución denorte(incógnita¯norteμ){\displaystyle {\sqrt {n}}({\bar {X}}_{n}-\mu )}se aproxima a la normalidad independientemente de la forma de la distribución del individuoincógnitai.{\displaystyle X_{i}.}Formalmente, el teorema se puede enunciar de la siguiente manera:

Lindeberg-Lévy CLT Supongamosincógnita1,incógnita2,incógnita3{\displaystyle X_{1},X_{2},X_{3}\ldots }es una secuencia de variables aleatorias i.i.d. conmi[incógnitai]=μ{\displaystyle \operatorname {E} [X_{i}]=\mu }yVar[incógnitai]=σ2<.{\displaystyle \operatorname {Var} [X_{i}]=\sigma ^{2}<\infty .}Entonces, comonorte{\displaystyle n}se aproxima al infinito, las variables aleatoriasnorte(incógnita¯norteμ){\displaystyle {\sqrt {n}}({\bar {X}}_{n}-\mu )}convergen en distribución a una normalnorte(0,σ2){\displaystyle {\mathcal {N}}(0,\sigma ^{2})}: [ 4 ]

norte(incógnita¯norteμ)dnorte(0,σ2).{\displaystyle {\sqrt {n}}\left({\bar {X}}_{n}-\mu \right)\mathrel {\overset {d}{\longrightarrow }} {\mathcal {N}}\left(0,\sigma ^{2}\right).}

En el casoσ>0,{\displaystyle \sigma >0,}La convergencia en la distribución significa que las funciones de distribución acumulativa denorte(incógnita¯norteμ){\displaystyle {\sqrt {n}}({\bar {X}}_{n}-\mu )}convergen puntualmente a la función de distribución acumulada de lanorte(0,σ2){\displaystyle {\mathcal {N}}(0,\sigma ^{2})}distribución: para cada número realz,{\displaystyle z,}

límitenortePAG[norte(incógnita¯norteμ)z]=límitenortePAG[norte(incógnita¯norteμ)σzσ]=Φ(zσ),{\displaystyle \lim _{n\to \infty }\mathbb {P} \left[{\sqrt {n}}({\bar {X}}_{n}-\mu )\leq z\right]=\lim _{n\to \infty }\mathbb {P} \left[{\frac {{\sqrt {n}}({\bar {X}}_{n}-\mu )}{\sigma }}\leq {\frac {z}{\sigma }}\right]=\Phi \left({\frac {z}{\sigma }}\right),}

dóndeΦ(z){\displaystyle \Phi (z)}es la función de distribución acumulada normal estándar evaluada enz.{\displaystyle z.}La convergencia es uniforme enz{\displaystyle z}en el sentido de que

límitenortesorberzR|PAG[norte(incógnita¯norteμ)z]Φ(zσ)|=0 ,{\displaystyle \lim _{n\to \infty }\;\sup _{z\in \mathbb {R} }\;\left|\mathbb {P} \left[{\sqrt {n}}({\bar {X}}_{n}-\mu )\leq z\right]-\Phi \left({\frac {z}{\sigma }}\right)\right|=0~,}

dóndesorber{\displaystyle \sup }denota el supremo (es decir, el límite superior mínimo) del conjunto. [ 5 ]

Lyapunov CLT

En esta variante del teorema del límite central, las variables aleatoriasincógnitai{\textstyle X_{i}}deben ser independientes, pero no necesariamente idénticamente distribuidas. El teorema también requiere que las variables aleatorias|incógnitai|{\textstyle \left|X_{i}\right|}tener momentos de algún orden(2+δ){\textstyle (2+\delta )}y que la tasa de crecimiento de estos momentos está limitada por la condición de Lyapunov que se indica a continuación.

Límite central de Lyapunov [ 6 ] Supongamos{incógnita1,,incógnitanorte,}{\textstyle \{X_{1},\ldots ,X_{n},\ldots \}}es una secuencia de variables aleatorias independientes, cada una con un valor esperado finito.μi{\textstyle \mu _{i}}y varianzaσi2{\textstyle \sigma _{i}^{2}}. Definir

snorte2=i=1norteσi2.{\displaystyle s_{n}^{2}=\sum _{i=1}^{n}\sigma _{i}^{2}.}

Si para algunosδ>0{\textstyle \delta >0}, condición de Lyapunov

límitenorte1snorte2+δi=1nortemi[|incógnitaiμi|2+δ]=0{\displaystyle \lim _{n\to \infty }\;{\frac {1}{s_{n}^{2+\delta }}}\,\sum _{i=1}^{n}\operatorname {E} \left[\left|X_{i}-\mu _{i}\right|^{2+\delta }\right]=0}

Si se satisface, entonces una suma deincógnitaiμisnorte{\textstyle {\frac {X_{i}-\mu _{i}}{s_{n}}}}converge en distribución a una variable aleatoria normal estándar, comonorte{\textstyle n}va hasta el infinito:

1snortei=1norte(incógnitaiμi)dnorte(0,1).{\displaystyle {\frac {1}{s_{n}}}\,\sum _{i=1}^{n}\left(X_{i}-\mu _{i}\right)\mathrel {\overset {d}{\longrightarrow }} {\mathcal {N}}(0,1).}

En la práctica, suele ser más fácil comprobar la condición de Lyapunov paraδ=1{\textstyle \delta =1}.

Si una secuencia de variables aleatorias satisface la condición de Lyapunov, también satisface la condición de Lindeberg. Sin embargo, la implicación inversa no se cumple.

Lindeberg (-Feller) CLT

En el mismo contexto y con la misma notación que la anterior, la condición de Lyapunov puede reemplazarse por la siguiente, más débil (de Lindeberg en 1920).

Supongamos que para cadaε>0{\textstyle \varepsilon >0},

límitenorte1snorte2i=1nortemi[(incógnitaiμi)21{|incógnitaiμi|>εsnorte}]=0{\displaystyle \lim _{n\to \infty }{\frac {1}{s_{n}^{2}}}\sum _{i=1}^{n}\operatorname {E} \left[(X_{i}-\mu _{i})^{2}\cdot \mathbf {1} _{\left\{\left|X_{i}-\mu _{i}\right|>\varepsilon s_{n}\right\}}\right]=0}

dónde1{}{\textstyle \mathbf {1} _{\{\ldots \}}}es la función indicadora . Luego, la distribución de las sumas estandarizadas

1snortei=1norte(incógnitaiμi){\displaystyle {\frac {1}{s_{n}}}\sum _{i=1}^{n}\left(X_{i}-\mu _{i}\right)}

converge hacia la distribución normal estándarnorte(0,1){\textstyle {\mathcal {N}}(0,1)}.

Teorema del límite central para la suma de un número aleatorio de variables aleatorias

En lugar de sumar un número enteronorte{\displaystyle n}de variables aleatorias y tomandonorte{\displaystyle n\to \infty }La suma puede ser de un número aleatorio.norte{\displaystyle N}de variables aleatorias, con condiciones sobrenorte{\displaystyle N}Por ejemplo, el siguiente teorema es el Corolario 4 de Robbins (1948). Supone quenorte{\displaystyle N}es asintóticamente normal (Robbins también desarrolló otras condiciones que conducen al mismo resultado).

Robbins CLT [ 7 ] [ 8 ] Deje{incógnitai,i1}{\displaystyle \{X_{i},i\geq 1\}}sean variables aleatorias independientes e idénticamente distribuidas conmi(incógnitai)=μ{\displaystyle E(X_{i})=\mu }yVar(incógnitai)=σ2{\displaystyle {\text{Var}}(X_{i})=\sigma ^{2}}y dejar{nortenorte,norte1}{\displaystyle \{N_{n},n\geq 1\}}sea ​​una secuencia de variables aleatorias con valores enteros no negativos que son independientes de{incógnitai,i1}{\displaystyle \{X_{i},i\geq 1\}}. Supongamos que para cadanorte=1,2,{\displaystyle n=1,2,\dots }esomi(nortenorte2)<{\displaystyle E(N_{n}^{2})<\infty }y

nortenortemi(nortenorte)Var(nortenorte)dnorte(0,1){\displaystyle {\frac {N_{n}-E(N_{n})}{\sqrt {{\text{Var}}(N_{n})}}}\xrightarrow {\quad d\quad } {\mathcal {N}}(0,1)}

dónded{\displaystyle \xrightarrow {\,d\,} }denota convergencia en la distribución ynorte(0,1){\displaystyle {\mathcal {N}}(0,1)}es la distribución normal con media 0, varianza 1. Entonces

i=1nortenorteincógnitaiμmi(nortenorte)σ2mi(nortenorte)+μ2Var(nortenorte)dnorte(0,1){\displaystyle {\frac {\sum _{i=1}^{N_{n}}X_{i}-\mu E(N_{n})}{\sqrt {\sigma ^{2}E(N_{n})+\mu ^{2}{\text{Var}}(N_{n})}}}\xrightarrow {\quad d\quad } {\mathcal {N}}(0,1)}

CLT multidimensional

Las demostraciones que utilizan funciones características pueden extenderse a casos en los que cada individuoincógnitai{\textstyle \mathbf {X} _{i}}es un vector aleatorio enRk{\textstyle \mathbb {R} ^{k}}, con vector medioμ=mi[incógnitai]{\textstyle {\boldsymbol {\mu }}=\operatorname {E} [\mathbf {X} _{i}]}y matriz de covarianzaΣ{\textstyle \mathbf {\Sigma } }(entre los componentes del vector), y estos vectores aleatorios son independientes e idénticamente distribuidos. El teorema del límite central multidimensional establece que, al escalarse, las sumas convergen a una distribución normal multivariada . [ 9 ] La suma de estos vectores se realiza componente por componente.

Parai=1,2,3,,{\displaystyle i=1,2,3,\ldots ,}dejar

incógnitai=[incógnitai(1)incógnitai(k)]{\displaystyle \mathbf {X} _{i}={\begin{bmatrix}X_{i}^{(1)}\\\vdots \\X_{i}^{(k)}\end{bmatrix}}}

sean vectores aleatorios independientes. La suma de los vectores aleatoriosincógnita1,,incógnitanorte{\displaystyle \mathbf {X} _{1},\ldots ,\mathbf {X} _{n}}es

i=1norteincógnitai=[incógnita1(1)incógnita1(k)]+[incógnita2(1)incógnita2(k)]++[incógnitanorte(1)incógnitanorte(k)]=[i=1norteincógnitai(1)i=1norteincógnitai(k)]{\displaystyle \sum _{i=1}^{n}\mathbf {X} _{i}={\begin{bmatrix}X_{1}^{(1)}\\\vdots \\X_{1}^{(k)}\end{bmatrix}}+{\begin{bmatrix}X_{2}^{(1)}\\\vdots \\X_{2}^{(k)}\end{bmatrix}}+\cdots +{\begin{bmatrix}X_{n}^{(1)}\\\vdots \\X_{n}^{(k)}\end{bmatrix}}={\begin{bmatrix}\sum _{i=1}^{n}X_{i}^{(1)}\\\vdots \\\sum _{i=1}^{n}X_{i}^{(k)}\end{bmatrix}}}

y su promedio es

incógnita¯norte=[incógnita¯i(1)incógnita¯i(k)]=1nortei=1norteincógnitai.{\displaystyle \mathbf {{\bar {X}}_{n}} ={\begin{bmatrix}{\bar {X}}_{i}^{(1)}\\\vdots \\{\bar {X}}_{i}^{(k)}\end{bmatrix}}={\frac {1}{n}}\sum _{i=1}^{n}\mathbf {X} _{i}.}

Por lo tanto,

1nortei=1norte[incógnitaimi(incógnitai)]=1nortei=1norte(incógnitaiμ)=norte(incógnita¯norteμ).{\displaystyle {\frac {1}{\sqrt {n}}}\sum _{i=1}^{n}\left[\mathbf {X} _{i}-\operatorname {E} \left(\mathbf {X} _{i}\right)\right]={\frac {1}{\sqrt {n}}}\sum _{i=1}^{n}(\mathbf {X} _{i}-{\boldsymbol {\mu }})={\sqrt {n}}\left({\overline {\mathbf {X} }}_{n}-{\boldsymbol {\mu }}\right).}

El teorema del límite central multivariable establece que

norte(incógnita¯norteμ)dnortek(0,Σ),{\displaystyle {\sqrt {n}}\left({\overline {\mathbf {X} }}_{n}-{\boldsymbol {\mu }}\right)\mathrel {\overset {d}{\longrightarrow }} {\mathcal {N}}_{k}(0,{\boldsymbol {\Sigma }}),} donde la matriz de covarianzaΣ{\displaystyle {\boldsymbol {\Sigma }}}es igual a Σ=[Var(incógnita1(1))Cov(incógnita1(1),incógnita1(2))Cov(incógnita1(1),incógnita1(3))Cov(incógnita1(1),incógnita1(k))Cov(incógnita1(2),incógnita1(1))Var(incógnita1(2))Cov(incógnita1(2),incógnita1(3))Cov(incógnita1(2),incógnita1(k))Cov(incógnita1(3),incógnita1(1))Cov(incógnita1(3),incógnita1(2))Var(incógnita1(3))Cov(incógnita1(3),incógnita1(k))Cov(incógnita1(k),incógnita1(1))Cov(incógnita1(k),incógnita1(2))Cov(incógnita1(k),incógnita1(3))Var(incógnita1(k))] .{\displaystyle {\boldsymbol {\Sigma }}={\begin{bmatrix}{\operatorname {Var} \left(X_{1}^{(1)}\right)}&\operatorname {Cov} \left(X_{1}^{(1)},X_{1}^{(2)}\right)&\operatorname {Cov} \left(X_{1}^{(1)},X_{1}^{(3)}\right)&\cdots &\operatorname {Cov} \left(X_{1}^{(1)},X_{1}^{(k)}\right)\\\operatorname {Cov} \left(X_{1}^{(2)},X_{1}^{(1)}\right)&\operatorname {Var} \left(X_{1}^{(2)}\right)&\operatorname {Cov} \left(X_{1}^{(2)},X_{1}^{(3)}\right)&\cdots &\operatorname {Cov} \left(X_{1}^{(2)},X_{1}^{(k)}\right)\\\operatorname {Cov} \left(X_{1}^{(3)},X_{1}^{(1)}\right)&\operatorname {Cov} \left(X_{1}^{(3)},X_{1}^{(2)}\right)&\operatorname {Var} \left(X_{1}^{(3)}\right)&\cdots &\operatorname {Cov} \left(X_{1}^{(3)},X_{1}^{(k)}\right)\\\vdots &\vdots &\vdots &\ddots &\vdots \\\operatorname {Cov} \left(X_{1}^{(k)},X_{1}^{(1)}\right)&\operatorname {Cov} \left(X_{1}^{(k)},X_{1}^{(2)}\right)&\operatorname {Cov} \left(X_{1}^{(k)},X_{1}^{(3)}\right)&\cdots &\operatorname {Var} \left(X_{1}^{(k)}\right)\\\end{bmatrix}}~.}

El teorema del límite central multivariable se puede demostrar utilizando el teorema de Cramér-Wold . [ 9 ]

La tasa de convergencia viene dada por el siguiente resultado de tipo Berry-Esseen :

Teorema [ 10 ] Seaincógnita1,,incógnitanorte,{\displaystyle X_{1},\dots ,X_{n},\dots }ser independienteRd{\displaystyle \mathbb {R} ^{d}}Vectores aleatorios con valores , cada uno con media cero. EscribeS=i=1norteincógnitai{\displaystyle S=\sum _{i=1}^{n}X_{i}}y asumirΣ=Cov[S]{\displaystyle \Sigma =\operatorname {Cov} [S]}es invertible. SeaZnorte(0,Σ){\displaystyle Z\sim {\mathcal {N}}(0,\Sigma )}ser und{\displaystyle d}Gaussiana de dimensión con la misma media y la misma matriz de covarianza queS{\displaystyle S}Entonces, para todos los conjuntos convexosURd{\displaystyle U\subseteq \mathbb {R} ^{d}},

|PAG[SU]PAG[ZU]|dod1/4γ ,{\displaystyle \left|\mathbb {P} [S\in U]-\mathbb {P} [Z\in U]\right|\leq C\,d^{1/4}\gamma ~,} dóndedo{\displaystyle C}es una constante universal,γ=i=1nortemi[Σ1/2incógnitai23]{\displaystyle \gamma =\sum _{i=1}^{n}\operatorname {E} \left[\left\|\Sigma ^{-1/2}X_{i}\right\|_{2}^{3}\right]}, y2{\displaystyle \|\cdot \|_{2}}denota la norma euclidiana enRd{\displaystyle \mathbb {R} ^{d}}.

Se desconoce si el factord1/4{\textstyle d^{1/4}}es necesario. [ 11 ]

El teorema del límite central generalizado

El teorema del límite central generalizado (TLCG) fue un esfuerzo de varios matemáticos ( Sergei Bernstein , Jarl Waldemar Lindeberg , Paul Lévy , William Feller , Andrey Kolmogorov y otros) durante el período de 1920 a 1937. [ 12 ] La primera demostración completa publicada del TLCG fue en 1937 por Paul Lévy en francés. [ 13 ] Una versión en inglés de la demostración completa del TLCG está disponible en la traducción del libro de Boris Vladimirovich Gnedenko y Kolmogorov de 1954. [ 14 ]

La declaración del GCLT es la siguiente: [ 15 ]

Enunciado del GCLT : Una variable aleatoria no degenerada Z es α- estable para algún 0 < α ≤ 2 si y solo si existe una secuencia independiente e idénticamente distribuida de variables aleatorias X 1 , X 2 , X 3 ,  ..., y constantes a n > 0 , b n ∈ ℝ con anorte(incógnita1++incógnitanorte)bnorteZ.{\displaystyle a_{n}(X_{1}+\dots +X_{n})-b_{n}\to Z.} Aquí, ' ' significa que la secuencia de sumas de variables aleatorias converge en distribución; es decir, las distribuciones correspondientes satisfacen F n ( y ) → F ( y ) en todos los puntos de continuidad de F .

En otras palabras, si las sumas de variables aleatorias independientes e idénticamente distribuidas convergen en distribución a alguna Z , entonces Z debe ser una distribución estable .

Procesos dependientes

CLT bajo dependencia débil

Una generalización útil de una secuencia de variables aleatorias independientes e idénticamente distribuidas es un proceso aleatorio de mezcla en tiempo discreto; "mezcla" significa, aproximadamente, que las variables aleatorias temporalmente distantes entre sí son casi independientes. Varios tipos de mezcla se utilizan en la teoría ergódica y la teoría de la probabilidad. Véase especialmente la mezcla fuerte (también llamada α-mezcla) definida porα(norte)0{\textstyle \alpha (n)\to 0}dóndeα(norte){\textstyle \alpha (n)}es el llamado coeficiente de mezcla fuerte .

Una formulación simplificada del teorema del límite central bajo mezcla fuerte es: [ 16 ]

Teorema Supongamos que{incógnita1,,incógnitanorte,}{\textstyle \{X_{1},\ldots ,X_{n},\ldots \}}es estacionario yα{\displaystyle \alpha }-mezclando conαnorte=O(norte5){\textstyle \alpha _{n}=O\left(n^{-5}\right)}y esomi[incógnitanorte]=0{\textstyle \operatorname {E} [X_{n}]=0}ymi[incógnitanorte12]<{\textstyle \operatorname {E} [X_{n}^{12}]<\infty }. DenotarSnorte=incógnita1++incógnitanorte{\textstyle S_{n}=X_{1}+\cdots +X_{n}}, entonces el límite

σ2=límitenortemi(Snorte2)norte{\displaystyle \sigma ^{2}=\lim _{n\rightarrow \infty }{\frac {\operatorname {E} \left(S_{n}^{2}\right)}{n}}}

existe, y siσ0{\textstyle \sigma \neq 0}entoncesSnorteσnorte{\textstyle {\frac {S_{n}}{\sigma {\sqrt {n}}}}}converge en distribución anorte(0,1){\textstyle {\mathcal {N}}(0,1)}.

De hecho,

σ2=mi(incógnita12)+2k=1mi(incógnita1incógnita1+k),{\displaystyle \sigma ^{2}=\operatorname {E} \left(X_{1}^{2}\right)+2\sum _{k=1}^{\infty }\operatorname {E} \left(X_{1}X_{1+k}\right),}

donde la serie converge absolutamente.

La asunciónσ0{\textstyle \sigma \neq 0}no se puede omitir, ya que la normalidad asintótica falla paraincógnitanorte=YnorteYnorte1{\textstyle X_{n}=Y_{n}-Y_{n-1}}dóndeYnorte{\textstyle Y_{n}}son otra secuencia estacionaria .

Existe una versión más fuerte del teorema: [ 17 ] la suposiciónmi[incógnitanorte12]<{\textstyle \operatorname {E} \left[X_{n}^{12}\right]<\infty }es reemplazado pormi[|incógnitanorte|2+δ]<{\textstyle \operatorname {E} \left[{\left|X_{n}\right|}^{2+\delta }\right]<\infty }y la suposiciónαnorte=O(norte5){\textstyle \alpha _{n}=O\left(n^{-5}\right)}es reemplazado por

norteαnorteδ2(2+δ)<.{\displaystyle \sum _{n}\alpha _{n}^{\frac {\delta }{2(2+\delta )}}<\infty .}

Existencia de talδ>0{\textstyle \delta >0}asegura la conclusión. Para un tratamiento enciclopédico de los teoremas límite bajo condiciones de mezcla, véase ( Bradley 2007 ) .

Diferencia de martingala CLT

Teorema Sea una martingalaMETROnorte{\textstyle M_{n}}satisfacer

  • 1nortek=1nortemi[(METROkMETROk1)2METRO1,,METROk1]1{\displaystyle {\frac {1}{n}}\sum _{k=1}^{n}\operatorname {E} \left[\left(M_{k}-M_{k-1}\right)^{2}\mid M_{1},\dots ,M_{k-1}\right]\to 1} en probabilidad cuando n → ∞ ,
  • para cada ε > 0 ,1nortek=1nortemi[(METROkMETROk1)21[|METROkMETROk1|>εnorte]]0{\displaystyle {\frac {1}{n}}\sum _{k=1}^{n}{\operatorname {E} \left[\left(M_{k}-M_{k-1}\right)^{2}\mathbf {1} \left[|M_{k}-M_{k-1}|>\varepsilon {\sqrt {n}}\right]\right]}\to 0} cuando n → ∞ ,

entoncesMETROnortenorte{\textstyle {\frac {M_{n}}{\sqrt {n}}}}converge en distribución anorte(0,1){\textstyle {\mathcal {N}}(0,1)}comonorte{\textstyle n\to \infty }. [ 18 ] [ 19 ]

Observaciones

Demostración del teorema clásico del teorema del límite

El teorema del límite central tiene una demostración que utiliza funciones características . [ 20 ] Es similar a la demostración de la ley (débil) de los grandes números .

Asumir{incógnita1,,incógnitanorte,}{\textstyle \{X_{1},\ldots ,X_{n},\ldots \}}son variables aleatorias independientes e idénticamente distribuidas, cada una con mediaμ{\textstyle \mu }y varianza finitaσ2{\textstyle \sigma ^{2}}. La sumaincógnita1++incógnitanorte{\textstyle X_{1}+\cdots +X_{n}}tiene significanorteμ{\textstyle n\mu }y varianzanorteσ2{\textstyle n\sigma ^{2}}. Consideremos la variable aleatoria

Znorte=incógnita1++incógnitanortenorteμnorteσ2=i=1norteincógnitaiμnorteσ2=:i=1norte1norteYi,{\displaystyle Z_{n}={\frac {X_{1}+\cdots +X_{n}-n\mu }{\sqrt {n\sigma ^{2}}}}=\sum _{i=1}^{n}{\frac {X_{i}-\mu }{\sqrt {n\sigma ^{2}}}}=:\sum _{i=1}^{n}{\frac {1}{\sqrt {n}}}Y_{i},}

donde el último paso define las nuevas variables aleatoriasYi:=incógnitaiμσ{\textstyle Y_{i}:={\frac {X_{i}-\mu }{\sigma }}}, cada uno con media cero y varianza unitaria (var(Y)=1{\textstyle \operatorname {var} (Y)=1}). La función característica deZnorte{\textstyle Z_{n}}es dado por

φZnorte(t)=φi=1norte1norteYi(t) = φY1(tnorte)φY2(tnorte)φYnorte(tnorte)= [φY1(tnorte)]norte,{\displaystyle {\begin{aligned}\varphi _{Z_{n}}\!(t)=\varphi _{\sum _{i=1}^{n}{{\frac {1}{\sqrt {n}}}Y_{i}}}\!(t)\ &=\ \varphi _{Y_{1}}\!\!\left({\frac {t}{\sqrt {n}}}\right)\varphi _{Y_{2}}\!\!\left({\frac {t}{\sqrt {n}}}\right)\cdots \varphi _{Y_{n}}\!\!\left({\frac {t}{\sqrt {n}}}\right)\\[1ex]&=\ \left[\varphi _{Y_{1}}\!\!\left({\frac {t}{\sqrt {n}}}\right)\right]^{n},\end{aligned}}}

donde el último paso se basa en el hecho de que todos losYi{\textstyle Y_{i}}están idénticamente distribuidas. La función característica deY1{\textstyle Y_{1}}es, por el teorema de Taylor , φY1(tnorte)=1t22norte+o(t2norte),(tnorte)0{\displaystyle \varphi _{Y_{1}}\!\left({\frac {t}{\sqrt {n}}}\right)=1-{\frac {t^{2}}{2n}}+o\!\left({\frac {t^{2}}{n}}\right),\quad \left({\frac {t}{\sqrt {n}}}\right)\to 0}

dóndeo(t2/norte){\textstyle o(t^{2}/n)}es " nota o minúscula " para alguna función det{\textstyle t}que se reduce a cero más rápidamente quet2/norte{\textstyle t^{2}/n}. Por el límite de la función exponencial (miincógnita=límitenorte(1+incógnitanorte)norte{\textstyle e^{x}=\lim _{n\to \infty }\left(1+{\frac {x}{n}}\right)^{n}}), la función característica deZnorte{\displaystyle Z_{n}}igual

φZnorte(t)=(1t22norte+o(t2norte))nortemi12t2,norte.{\displaystyle \varphi _{Z_{n}}(t)=\left(1-{\frac {t^{2}}{2n}}+o\left({\frac {t^{2}}{n}}\right)\right)^{n}\rightarrow e^{-{\frac {1}{2}}t^{2}},\quad n\to \infty .}

Todos los términos de orden superior se desvanecen en el límite.norte{\textstyle n\to \infty }El lado derecho es igual a la función característica de una distribución normal estándar .norte(0,1){\textstyle {\mathcal {N}}(0,1)}, lo que implica a través del teorema de continuidad de Lévy que la distribución deZnorte{\textstyle Z_{n}}se acercaránorte(0,1){\textstyle {\mathcal {N}}(0,1)}comonorte{\textstyle n\to \infty }Por lo tanto , el promedio de la muestra

incógnita¯norte=incógnita1++incógnitanortenorte{\displaystyle {\bar {X}}_{n}={\frac {X_{1}+\cdots +X_{n}}{n}}}

es tal que

norteσ(incógnita¯norteμ)=Znorte{\displaystyle {\frac {\sqrt {n}}{\sigma }}\left({\bar {X}}_{n}-\mu \right)=Z_{n}}

converge a la distribución normalnorte(0,1){\textstyle {\mathcal {N}}(0,1)}, de donde se deduce el teorema del límite central.

Convergencia al límite

El teorema del límite central solo proporciona una distribución asintótica . Como aproximación para un número finito de observaciones, ofrece una aproximación razonable únicamente cuando se encuentra cerca del pico de la distribución normal; requiere un número muy grande de observaciones para abarcar los extremos.

La convergencia en el teorema del límite central es uniforme porque la función de distribución acumulativa límite es continua. Si el tercer momento centralmi[(incógnita1μ)3]{\textstyle \operatorname {E} \left[(X_{1}-\mu )^{3}\right]}Si existe y es finito, entonces la velocidad de convergencia es al menos del orden de1/norte{\textstyle 1/{\sqrt {n}}}(véase el teorema de Berry-Esseen ). El método de Stein [ 21 ] puede utilizarse no solo para demostrar el teorema del límite central, sino también para proporcionar cotas en las tasas de convergencia para métricas seleccionadas. [ 22 ]

La convergencia a la distribución normal es monótona, en el sentido de que la entropía deZnorte{\textstyle Z_{n}}aumenta monótonamente hasta alcanzar la distribución normal. [ 23 ]

El teorema del límite central se aplica en particular a sumas de variables aleatorias discretas independientes e idénticamente distribuidas . Una suma de variables aleatorias discretas sigue siendo una variable aleatoria discreta , de modo que nos encontramos ante una secuencia de variables aleatorias discretas cuya función de distribución de probabilidad acumulada converge hacia una función de distribución de probabilidad acumulada correspondiente a una variable continua (es decir, la de la distribución normal ). Esto significa que si construimos un histograma de las realizaciones de la suma de n variables discretas independientes e idénticamente distribuidas, la curva lineal a trozos que une los centros de las caras superiores de los rectángulos que forman el histograma converge hacia una curva gaussiana cuando n tiende a infinito; esta relación se conoce como teorema de De Moivre-Laplace . El artículo sobre la distribución binomial detalla dicha aplicación del teorema del límite central en el caso simple de una variable discreta que toma solo dos valores posibles.

conceptos erróneos comunes

Los estudios han demostrado que el teorema del límite central está sujeto a varias ideas erróneas comunes pero graves, algunas de las cuales aparecen en libros de texto ampliamente utilizados. [ 24 ] [ 25 ] [ 26 ] Estas incluyen:

  • La creencia errónea de que el teorema se aplica al muestreo aleatorio de cualquier variable, en lugar de a los valores medios (o sumas) de variables aleatorias independientes e idénticamente distribuidas (i.i.d.) extraídas de una población mediante muestreo repetido. Es decir, el teorema presupone que el muestreo aleatorio produce una distribución muestral formada por diferentes valores medios (o sumas) de dichas variables aleatorias.
  • La creencia errónea de que el teorema garantiza que el muestreo aleatorio conduce a la aparición de una distribución normal para muestras suficientemente grandes de cualquier variable aleatoria, independientemente de la distribución de la población. En realidad, dicho muestreo reproduce asintóticamente las propiedades de la población, un resultado intuitivo respaldado por el teorema de Glivenko-Cantelli .
  • La creencia errónea de que el teorema proporciona una buena aproximación de la distribución normal para tamaños de muestra mayores a 30, [ 27 ] permitiendo inferencias fiables independientemente de la naturaleza de la población. En realidad, esta regla empírica carece de justificación válida y puede conducir a inferencias gravemente erróneas. Véase la prueba Z para determinar dónde se cumple la aproximación.

Relación con la ley de los grandes números.

La ley de los grandes números, así como el teorema del límite central, son soluciones parciales a un problema general: "¿Cuál es el comportamiento límite de S n cuando n tiende a infinito?". En análisis matemático, las series asintóticas son una de las herramientas más utilizadas para abordar este tipo de cuestiones.

Supongamos que tenemos una expansión asintótica deF(norte){\textstyle f(n)}:

F(norte)=a1φ1(norte)+a2φ2(norte)+O(φ3(norte))(norte).{\displaystyle f(n)=a_{1}\varphi _{1}(n)+a_{2}\varphi _{2}(n)+O{\big (}\varphi _{3}(n){\big )}\qquad (n\to \infty ).}

Dividiendo ambas partes por φ 1 ( n ) y tomando el límite se obtendrá a 1 , el coeficiente del término de orden más alto en la expansión, que representa la tasa a la que f ( n ) cambia en su término principal.

límitenorteF(norte)φ1(norte)=a1.{\displaystyle \lim _{n\to \infty }{\frac {f(n)}{\varphi _{1}(n)}}=a_{1}.}

De manera informal, se puede decir: " f ( n ) crece aproximadamente como a 1 φ 1 ( n ) ". Tomando la diferencia entre f ( n ) y su aproximación y luego dividiendo por el siguiente término en la expansión, llegamos a una afirmación más precisa sobre f ( n ) :

límitenorteF(norte)a1φ1(norte)φ2(norte)=a2.{\displaystyle \lim _{n\to \infty }{\frac {f(n)-a_{1}\varphi _{1}(n)}{\varphi _{2}(n)}}=a_{2}.}

Aquí se puede decir que la diferencia entre la función y su aproximación crece aproximadamente como a 2 φ 2 ( n ) . La idea es que dividir la función por funciones de normalización apropiadas y observar el comportamiento límite del resultado puede revelar mucho sobre el comportamiento límite de la función original.

De manera informal, algo parecido sucede cuando se estudia la suma, S n , de variables aleatorias independientes idénticamente distribuidas, X 1 , ..., X n , en la teoría clásica de la probabilidad. Si cada X i tiene una media finita μ , entonces por la ley de los grandes números, S n / nμ . [ 28 ] Si además cada X i tiene una varianza finita σ 2 , entonces por el teorema del límite central,

Snortenorteμnorteξ,{\displaystyle {\frac {S_{n}-n\mu }{\sqrt {n}}}\to \xi ,}

donde ξ se distribuye como N (0, σ 2 ) . Esto proporciona los valores de las dos primeras constantes en la expansión informal.

Snorteμnorte+ξnorte.{\displaystyle S_{n}\approx \mu n+\xi {\sqrt {n}}.}

En el caso de que las X i no tengan media o varianza finita, la convergencia de la suma desplazada y reescalada también puede ocurrir con diferentes factores de centrado y escalado:

SnorteanortebnorteΞ,{\displaystyle {\frac {S_{n}-a_{n}}{b_{n}}}\rightarrow \Xi ,}

o informalmente

Snorteanorte+Ξbnorte.{\displaystyle S_{n}\approx a_{n}+\Xi b_{n}.}

Las distribuciones Ξ que pueden surgir de esta manera se denominan estables . [ 29 ] Claramente, la distribución normal es estable, pero también existen otras distribuciones estables, como la distribución de Cauchy , para las cuales no se definen la media ni la varianza. El factor de escala b n puede ser proporcional a n c , para cualquier c1 / 2 ; también puede multiplicarse por una función de n que varía lentamente . [ 30 ] [ 31 ]

La ley del logaritmo iterado especifica lo que ocurre "entre" la ley de los grandes números y el teorema del límite central. En concreto, establece que la función normalizadora n log log n , de tamaño intermedio entre n de la ley de los grandes números y n del teorema del límite central, proporciona un comportamiento límite no trivial.

Enunciados alternativos del teorema

Funciones de densidad

La densidad de la suma de dos o más variables independientes es la convolución de sus densidades (si estas existen). Por lo tanto, el teorema del límite central puede interpretarse como una afirmación sobre las propiedades de las funciones de densidad bajo convolución: la convolución de varias funciones de densidad tiende a la densidad normal a medida que el número de funciones de densidad aumenta indefinidamente. Estos teoremas requieren hipótesis más fuertes que las formas del teorema del límite central presentadas anteriormente. Los teoremas de este tipo se denominan a menudo teoremas de límite local. Véase Petrov [ 32 ] para un teorema de límite local particular para sumas de variables aleatorias independientes e idénticamente distribuidas .

Funciones características

Dado que la función característica de una convolución es el producto de las funciones características de las densidades involucradas, el teorema del límite central se reformula de nuevo: el producto de las funciones características de varias funciones de densidad se aproxima a la función característica de la densidad normal a medida que el número de funciones de densidad aumenta indefinidamente, bajo las condiciones antes mencionadas. En concreto, es necesario aplicar un factor de escala adecuado al argumento de la función característica.

Se puede hacer una afirmación equivalente sobre las transformadas de Fourier , ya que la función característica es esencialmente una transformada de Fourier.

Cálculo de la varianza

Sea S n la suma de n variables aleatorias. Muchos teoremas del límite central proporcionan condiciones tales que S n / Var( S n ) converge en distribución a N (0,1) (la distribución normal con media 0, varianza 1) cuando n → ∞ . En algunos casos, es posible encontrar una constante σ 2 y una función f(n) tales que S n /(σ n⋅f ( n ) ) converge en distribución a N (0,1) cuando n → ∞ .

Lema [ 33 ] Supongamosincógnita1,incógnita2,{\displaystyle X_{1},X_{2},\dots }es una secuencia de variables aleatorias de valor real y estrictamente estacionarias conmi(incógnitai)=0{\displaystyle \operatorname {E} (X_{i})=0}a pesar dei{\displaystyle i},gramo:[0,1]R{\displaystyle g:[0,1]\to \mathbb {R} }, ySnorte=i=1nortegramo(inorte)incógnitai{\displaystyle S_{n}=\sum _{i=1}^{n}g\left({\tfrac {i}{n}}\right)X_{i}}Construir

σ2=mi(incógnita12)+2i=1mi(incógnita1incógnita1+i){\displaystyle \sigma ^{2}=\operatorname {E} (X_{1}^{2})+2\sum _{i=1}^{\infty }\operatorname {E} (X_{1}X_{1+i})}

  1. Sii=1mi(incógnita1incógnita1+i){\displaystyle \sum _{i=1}^{\infty }\operatorname {E} (X_{1}X_{1+i})}es absolutamente convergente,|01gramo(incógnita)gramo(incógnita)dincógnita|<{\displaystyle \left|\int _{0}^{1}g(x)g'(x)\,dx\right|<\infty }, y0<01(gramo(incógnita))2dincógnita<{\displaystyle 0<\int _{0}^{1}(g(x))^{2}dx<\infty }entoncesVar(Snorte)/(norteγnorte)σ2{\displaystyle \mathrm {Var} (S_{n})/(n\gamma _{n})\to \sigma ^{2}}comonorte{\displaystyle n\to \infty }dóndeγnorte=1nortei=1norte(gramo(inorte))2{\displaystyle \gamma _{n}={\frac {1}{n}}\sum _{i=1}^{n}\left(g\left({\tfrac {i}{n}}\right)\right)^{2}}.
  2. Si ademásσ>0{\displaystyle \sigma >0}ySnorte/Var(Snorte){\displaystyle S_{n}/{\sqrt {\mathrm {Var} (S_{n})}}}converge en distribución anorte(0,1){\displaystyle {\mathcal {N}}(0,1)}comonorte{\displaystyle n\to \infty }entoncesSnorte/(σnorteγnorte){\displaystyle S_{n}/(\sigma {\sqrt {n\gamma _{n}}})}también converge en distribución anorte(0,1){\displaystyle {\mathcal {N}}(0,1)}comonorte{\displaystyle n\to \infty }.

Extensiones

Productos de variables aleatorias positivas

El logaritmo de un producto es simplemente la suma de los logaritmos de sus factores. Por lo tanto, cuando el logaritmo de un producto de variables aleatorias que solo toman valores positivos se aproxima a una distribución normal, el producto en sí se aproxima a una distribución log-normal . Muchas magnitudes físicas (especialmente la masa o la longitud, que son una cuestión de escala y no pueden ser negativas) son productos de diferentes factores aleatorios , por lo que siguen una distribución log-normal. Esta versión multiplicativa del teorema del límite central se conoce a veces como la ley de Gibrat .

Mientras que el teorema del límite central para sumas de variables aleatorias requiere la condición de varianza finita, el teorema correspondiente para productos requiere la condición correspondiente de que la función de densidad sea de cuadrado integrable. [ 34 ]

Más allá del marco clásico

La normalidad asintótica, es decir, la convergencia a la distribución normal tras un ajuste y reescalamiento adecuados, es un fenómeno mucho más general que el marco clásico descrito anteriormente, a saber, las sumas de variables aleatorias (o vectores) independientes. Constantemente surgen nuevos marcos; por el momento, no existe un marco unificador.

Cuerpo convexo

Teorema Existe una sucesión ε n ↓ 0 para la cual se cumple lo siguiente. Sea n ≥ 1 y sean variables aleatorias X 1 , ..., X n con una densidad conjunta log-cóncava f tal que f ( x 1 , ..., x n ) = f ( | x 1 | , ..., | x n | ) para todo x 1 , ..., x n , y E( X 2 k ) = 1 para todo k = 1, ..., n . Entonces la distribución de

incógnita1++incógnitanortenorte{\displaystyle {\frac {X_{1}+\cdots +X_{n}}{\sqrt {n}}}}

es ε n -cercano anorte(0,1){\textstyle {\mathcal {N}}(0,1)}en la distancia de variación total . [ 35 ]

Estas dos distribuciones ε n -cercanas tienen densidades (de hecho, densidades logarítmicamente cóncavas); por lo tanto, la distancia de varianza total entre ellas es la integral del valor absoluto de la diferencia entre las densidades. La convergencia en la variación total es más fuerte que la convergencia débil.

Un ejemplo importante de densidad logarítmicamente cóncava es una función constante dentro de un cuerpo convexo dado y que se anula fuera de él; corresponde a la distribución uniforme en el cuerpo convexo, lo que explica el término "teorema del límite central para cuerpos convexos".

Otro ejemplo: f ( x 1 , ..., x n ) = const · exp(−( | x 1 | α + ⋯ + | x n | α ) β ) donde α > 1 y αβ > 1 . Si β = 1 entonces f ( x 1 , ..., x n ) se factoriza en const · exp (− | x 1 | α ) ... exp(− | x n | α ), lo que significa que X 1 , ..., X n son independientes. En general, sin embargo, son dependientes.

La condición f ( x 1 , ..., x n ) = f ( | x 1 | , ..., | x n | ) garantiza que X 1 , ..., X n tengan media cero y no estén correlacionados ; sin embargo, no es necesario que sean independientes, ni siquiera independientes por pares . Por cierto, la independencia por pares no puede reemplazar la independencia en el teorema clásico del límite central. [ 36 ]

Aquí tenemos un resultado del tipo Berry-Esseen .

Teorema Sean X 1 , ..., X n que satisfacen las suposiciones del teorema anterior, entonces [ 37 ]

|PAG(aincógnita1++incógnitanortenorteb)12πabmi12t2dt|donorte{\displaystyle \left|\mathbb {P} \left(a\leq {\frac {X_{1}+\cdots +X_{n}}{\sqrt {n}}}\leq b\right)-{\frac {1}{\sqrt {2\pi }}}\int _{a}^{b}e^{-{\frac {1}{2}}t^{2}}\,dt\right|\leq {\frac {C}{n}}}

para todo a < b ; aquí C es una constante universal (absoluta) . Además, para cada c 1 , ..., c nR tal que c 2 1 + ⋯ + c 2 n = 1 ,

|PAG(ado1incógnita1++donorteincógnitanorteb)12πabmi12t2dt|do(do14++donorte4).{\displaystyle \left|\mathbb {P} \left(a\leq c_{1}X_{1}+\cdots +c_{n}X_{n}\leq b\right)-{\frac {1}{\sqrt {2\pi }}}\int _{a}^{b}e^{-{\frac {1}{2}}t^{2}}\,dt\right|\leq C\left(c_{1}^{4}+\dots +c_{n}^{4}\right).}

La distribución de X 1 + ⋯ + X n / n no tiene por qué ser aproximadamente normal (de hecho, puede ser uniforme). [ 38 ] Sin embargo, la distribución de c 1 X 1 + ⋯ + c n X n es cercana anorte(0,1){\textstyle {\mathcal {N}}(0,1)}(en la distancia de variación total) para la mayoría de los vectores ( c 1 , ..., c n ) de acuerdo con la distribución uniforme en la esfera c 2 1 + ⋯ + c 2 n = 1 .

Series trigonométricas lacunares

Teorema ( SalemZygmund ) Sea U una variable aleatoria distribuida uniformemente en (0,2π) , y X k = r k cos( n k U + a k ) , donde

  • n k satisfacen la condición de lacunaridad: existe q > 1 tal que n k + 1qn k para todo k ,
  • r k son tales quer12+r22+= y rk2r12++rk20,{\displaystyle r_{1}^{2}+r_{2}^{2}+\cdots =\infty \quad {\text{ and }}\quad {\frac {r_{k}^{2}}{r_{1}^{2}+\cdots +r_{k}^{2}}}\to 0,}
  • 0 ≤ a k < 2π .

Entonces [ 39 ] [ 40 ]

incógnita1++incógnitakr12++rk2{\displaystyle {\frac {X_{1}+\cdots +X_{k}}{\sqrt {r_{1}^{2}+\cdots +r_{k}^{2}}}}}

converge en distribución anorte(0,12){\textstyle {\mathcal {N}}{\big (}0,{\frac {1}{2}}{\big )}}.

politopos gaussianos

Teorema Sean A 1 , ..., A n puntos aleatorios independientes en el plano R 2 cada uno con distribución normal estándar bidimensional. Sea K n la envoltura convexa de estos puntos, y X n el área de K n Entonces [ 41 ]

incógnitanortemi(incógnitanorte)Var(incógnitanorte){\displaystyle {\frac {X_{n}-\operatorname {E} (X_{n})}{\sqrt {\operatorname {Var} (X_{n})}}}} converge en distribución anorte(0,1){\textstyle {\mathcal {N}}(0,1)}cuando n tiende a infinito.

Lo mismo se aplica a todas las dimensiones mayores que 2.

El politopo K n se denomina politopo aleatorio gaussiano .

Un resultado similar se cumple para el número de vértices (del politopo gaussiano), el número de aristas y, de hecho, las caras de todas las dimensiones. [ 42 ]

Funciones lineales de matrices ortogonales

Una función lineal de una matriz M es una combinación lineal de sus elementos (con coeficientes dados), M ↦ tr( AM ) donde A es la matriz de los coeficientes; véase Traza (álgebra lineal)#Producto interno .

Se dice que una matriz ortogonal aleatoria está distribuida uniformemente si su distribución es la medida de Haar normalizada en el grupo ortogonal O( n , R ) ; véase Matriz de rotación#Matrices de rotación aleatorias uniformes .

Teorema Sea M una matriz ortogonal aleatoria n × n distribuida uniformemente, y A una matriz fija n × n tal que tr( AA *) = n , y sea X = tr( AM ) . Entonces [ 43 ] la distribución de X es cercana anorte(0,1){\textstyle {\mathcal {N}}(0,1)}en la métrica de variación total hasta 2 3 / n − 1 .

Subsecuencias

Teorema Sean variables aleatorias X 1 , X 2 , ... ∈ L 2 (Ω) tales que X n → 0 débilmente en L 2 (Ω) y Xn → 1débilmente enL1(Ω). Entonces existen enterosn1<n2< ⋯tales que

incógnitanorte1++incógnitanortekk{\displaystyle {\frac {X_{n_{1}}+\cdots +X_{n_{k}}}{\sqrt {k}}}}

converge en distribución anorte(0,1){\textstyle {\mathcal {N}}(0,1)}cuando k tiende a infinito. [ 44 ]

Paseo aleatorio sobre una red cristalina

El teorema del límite central puede establecerse para el paseo aleatorio simple en una red cristalina (un grafo de recubrimiento abeliano de pliegue infinito sobre un grafo finito) y se utiliza para el diseño de estructuras cristalinas. [ 45 ] [ 46 ]

Aplicaciones y ejemplos

Un ejemplo sencillo del teorema del límite central es lanzar muchos dados idénticos y sin sesgo. La distribución de la suma (o promedio) de los números obtenidos se aproximará bien a una distribución normal. Dado que las cantidades del mundo real suelen ser la suma equilibrada de muchos eventos aleatorios no observados, el teorema del límite central también proporciona una explicación parcial de la prevalencia de la distribución de probabilidad normal. Asimismo, justifica la aproximación de las estadísticas de muestras grandes a la distribución normal en experimentos controlados.

Comparación de las funciones de densidad de probabilidad p ( k ) para la suma de n dados justos de 6 caras para mostrar su convergencia a una distribución normal al aumentar n , de acuerdo con el teorema del límite central. En el gráfico inferior derecho, los perfiles suavizados de los gráficos anteriores se reescalan, se superponen y se comparan con una distribución normal (curva negra).
Esta figura demuestra el teorema del límite central. Las medias muestrales se generan mediante un generador de números aleatorios, que extrae números entre 0 y 100 de una distribución de probabilidad uniforme. Ilustra que, al aumentar el tamaño de la muestra, las 500 medias muestrales medidas se distribuyen más cerca de la media poblacional (50 en este caso). También compara las distribuciones observadas con las distribuciones esperadas para una distribución gaussiana normalizada y muestra los valores de chi-cuadrado que cuantifican la bondad del ajuste (el ajuste es bueno si el valor de chi-cuadrado reducido es menor o aproximadamente igual a uno). La entrada a la función gaussiana normalizada es la media de las medias muestrales (~50) y la desviación estándar media muestral dividida por la raíz cuadrada del tamaño de la muestra (~28,87/ √n ) , que se denomina desviación estándar de la media (ya que se refiere a la dispersión de las medias muestrales).

Regresión

El análisis de regresión , y en particular el de mínimos cuadrados ordinarios , especifica que una variable dependiente depende, según una función determinada, de una o más variables independientes , con un término de error aditivo . Diversos tipos de inferencia estadística sobre la regresión asumen que el término de error sigue una distribución normal. Esta suposición se justifica al considerar que el término de error es, en realidad, la suma de muchos términos de error independientes; incluso si los términos de error individuales no siguen una distribución normal, según el teorema del límite central, su suma puede aproximarse bien mediante una distribución normal.

Otras ilustraciones

Dada su importancia para la estadística, existen numerosos artículos y paquetes informáticos que demuestran la convergencia implicada en el teorema del límite central. [ 47 ]

Historia

El matemático holandés Henk Tijms escribe: [ 48 ]

El teorema del límite central tiene una historia interesante. La primera versión de este teorema fue postulada por el matemático francés Abraham de Moivre , quien, en un notable artículo publicado en 1733, utilizó la distribución normal para aproximar la distribución del número de caras resultantes de muchos lanzamientos de una moneda justa. Este hallazgo se adelantó a su tiempo y estuvo a punto de caer en el olvido hasta que el famoso matemático francés Pierre-Simon Laplace lo rescató de la oscuridad en su monumental obra Théorie analytique des probabilités , publicada en 1812. Laplace amplió el hallazgo de De Moivre aproximando la distribución binomial con la distribución normal. Pero, al igual que con De Moivre, el hallazgo de Laplace recibió poca atención en su época. No fue hasta finales del siglo XIX que se comprendió la importancia del teorema del límite central, cuando, en 1901, el matemático ruso Aleksandr Lyapunov lo definió en términos generales y demostró con precisión su funcionamiento matemático. Hoy en día, el teorema del límite central se considera el principio fundamental de la teoría de la probabilidad.

Sir Francis Galton describió el Teorema del Límite Central de esta manera: [ 49 ]

Conozco pocas cosas que impresionen tanto la imaginación como la maravillosa forma de orden cósmico expresada por la «Ley de la Frecuencia del Error». Los griegos la habrían personificado y deificado si la hubieran conocido. Reina con serenidad y en completa discreción, en medio de la más salvaje confusión. Cuanto mayor es la multitud y mayor la aparente anarquía, más perfecto es su dominio. Es la ley suprema de la irracionalidad. Siempre que se toma una gran muestra de elementos caóticos y se ordena según su magnitud, se revela una forma de regularidad insospechada y bellísima que ha permanecido latente todo el tiempo.

El término real "teorema del límite central" (en alemán: "zentraler Grenzwertsatz") fue utilizado por primera vez por George Pólya en 1920 en el título de un artículo. [ 50 ] [ 51 ] Pólya se refirió al teorema como "central" debido a su importancia en la teoría de la probabilidad. Según Le Cam, la escuela francesa de probabilidad interpreta la palabra central en el sentido de que "describe el comportamiento del centro de la distribución en contraposición a sus colas". [ 51 ] El resumen del artículo Sobre el teorema del límite central del cálculo de probabilidad y el problema de los momentos de Pólya [ 50 ] en 1920 se traduce como sigue.

La aparición de la densidad de probabilidad gaussiana 1 = e x 2 en experimentos repetidos, en errores de medición que resultan de la combinación de muchos errores elementales muy pequeños, en procesos de difusión, etc., puede explicarse, como es bien sabido, mediante el mismo teorema límite, que desempeña un papel central en el cálculo de probabilidades. El verdadero descubridor de este teorema límite es Laplace; es probable que su demostración rigurosa la haya dado por primera vez Tschebyscheff y su formulación más precisa se encuentra, hasta donde sé, en un artículo de Liapounoff .

Hald proporciona un relato exhaustivo de la historia del teorema, detallando el trabajo fundamental de Laplace, así como las contribuciones de Cauchy , Bessel y Poisson . [ 52 ] Hans Fischer ofrece dos relatos históricos, uno que abarca el desarrollo desde Laplace hasta Cauchy, y el segundo las contribuciones de von Mises , Pólya , Lindeberg , Lévy y Cramér durante la década de 1920. [ 53 ] Le Cam describe un período alrededor de 1935. [ 51 ] Bernstein [ 54 ] presenta una discusión histórica centrada en el trabajo de Pafnuty Chebyshev y sus estudiantes Andrey Markov y Aleksandr Lyapunov que condujo a las primeras demostraciones del CLT en un contexto general.

Una anécdota curiosa en la historia del Teorema del Límite Central es que una demostración de un resultado similar al Teorema del Límite Central de Lindeberg de 1922 fue el tema de la tesis doctoral de Alan Turing de 1934 para el King's College de la Universidad de Cambridge . Turing solo se enteró, tras presentar el trabajo, de que ya había sido demostrado. Por consiguiente, su tesis no se publicó. [ 55 ]

Véase también

Notas

  1. Fischer (2011) , p.. 
  2. Montgomery, Douglas C.; Runger, George C. (2014). Estadística aplicada y probabilidad para ingenieros (6.ª  ed.). Wiley. pág.  241. ISBN 9781118539712.
  3. Rouaud, Mathieu (2013). Probabilidad, estadística y estimación (PDF) . pág. 10. Archivado (PDF) del original el 9 de octubre de 2022. 
  4. Billingsley (1995) , pág. 357.
  5. Bauer (2001) , pág. 199, teorema 30.13.
  6. Billingsley (1995) , pág. 362.
  7. Robbins, Herbert (1948). "La distribución asintótica de la suma de un número aleatorio de variables aleatorias" . Bull. Amer. Math. Soc . 54 (12): 1151– 1161. doi : 10.1090/S0002-9904-1948-09142-X .
  8. Chen, Louis HY; Goldstein, Larry; Shao, Qi-Man (2011). Aproximación normal mediante el método de Stein . Berlín Heidelberg: Springer-Verlag. págs. 270–271 . 
  9. ^ van der Vaart, AW (1998) . Estadísticas asintóticas . Nueva York, Nueva York: Cambridge University Press. ISBN 978-0-521-49603-2. LCCN 98015176 . 
  10. O'Donnell, Ryan (2014). "Teorema 5.38" . Archivado del original el 8 de abril de 2019. Recuperado el 18 de octubre de 2017 . 
  11. Bentkus, V. (2005). "Una cota de tipo Lyapunov enRd{\displaystyle \mathbb {R} ^{d}}". Theory Probab. Appl . 49 (2): 311– 323. doi : 10.1137/S0040585X97981123 .
  12. Le Cam, L. (febrero de 1986). "El teorema del límite central alrededor de 1935". Statistical Science . 1 (1): 78– 91. JSTOR 2245503 . 
  13. ^ Levy, Paul (1937). Theorie de l'addition des variables aleatoires [ Teoría de combinación de variables impredecibles ] (en francés). París: Gauthier-Villars.
  14. Gnedenko, Boris Vladimirovich; Kologorov, Andreĭ Nikolaevich; Doob, Joseph L.; Hsu, Pao-Lu (1968). Distribuciones límite para sumas de variables aleatorias independientes . Reading, MA: Addison-wesley.
  15. Nolan, John P. (2020). Distribuciones estables univariadas, modelos para datos con colas pesadas . Springer Series in Operations Research and Financial Engineering. Suiza: Springer. doi : 10.1007/978-3-030-52915-4 . ISBN 978-3-030-52914-7. S2CID 226648987 . 
  16. Billingsley (1995) , Teorema 27.4.
  17. Durrett (2004) , Sec. 7.7(c), Teorema 7.8.
  18. Durrett (2004) , Sec. 7.7, Teorema 7.4.
  19. Billingsley (1995) , Teorema 35.12.
  20. Lemons, Don (2003). Introducción a los procesos estocásticos en física . Johns Hopkins University Press. doi : 10.56021/9780801868665 . ISBN 9780801876387. Consultado el 11 de agosto de 2016 .
  21. Stein, C. (1972). "Una cota para el error en la aproximación normal a la distribución de una suma de variables aleatorias dependientes" . Actas del Sexto Simposio de Berkeley sobre Estadística Matemática y Probabilidad . 6 ( 2): 583– 602. MR 0402873. Zbl 0278.60026 .  
  22. Chen, LHY; Goldstein, L.; Shao, QM (2011). Aproximación normal mediante el método de Stein . Springer. ISBN 978-3-642-15006-7.
  23. Artstein, S. ; Ball, K. ; Barthe, F. ; Naor, A. (2004). "Solución del problema de Shannon sobre la monotonicidad de la entropía" . Journal of the American Mathematical Society . 17 (4): 975– 982. doi : 10.1090/S0894-0347-04-00459-X .
  24. Brewer, JK (1985). "Libros de texto de estadística del comportamiento: ¿Fuente de mitos y conceptos erróneos?". Journal of Educational Statistics . 10 (3): 252– 268. doi : 10.3102/10769986010003252 . S2CID 119611584 . 
  25. Yu, C.; Behrens, J.; Spencer, A. Identificación de ideas erróneas en el teorema del límite central y conceptos relacionados, conferencia de la Asociación Estadounidense de Investigación Educativa, 19 de abril de 1995
  26. Sotos, AEC; Vanhoof, S.; Van den Noortgate, W.; Onghena, P. (2007). "Concepciones erróneas de los estudiantes sobre la inferencia estadística: una revisión de la evidencia empírica de la investigación sobre la enseñanza de la estadística" . Educational Research Review . 2 (2): 98– 113. doi : 10.1016/j.edurev.2007.04.001 .
  27. "Distribución muestral de la media muestral" . Khan Academy . 2 de junio de 2023. Archivado del original (vídeo) el 2 de junio de 2023. Consultado el 8 de octubre de 2023 .
  28. Rosenthal, Jeffrey Seth (2000). Una primera mirada a la teoría rigurosa de la probabilidad . World Scientific. Teorema 5.3.4, pág. 47. ISBN 981-02-4322-7.
  29. Johnson, Oliver Thomas (2004). Teoría de la información y el teorema del límite central . Imperial College Press. pág. 88. ISBN  1-86094-473-6.
  30. Uchaikin, Vladimir V.; Zolotarev, VM (1999). Chance and Stability: Stable distributions and their applications . VSP. pp. 61– 62. ISBN  90-6764-301-7.
  31. Borodin, AN; Ibragimov, IA; Sudakov, VN (1995). Teoremas límite para funcionales de caminatas aleatorias . Librería AMS. Teorema 1.1, pág. 8. ISBN 0-8218-0438-3.
  32. Petrov, VV (1976). Sumas de variables aleatorias independientes . Nueva York-Heidelberg: Springer-Verlag. Cap. 7. ISBN 9783642658099.
  33. Hew, Patrick Chisan (2017). "Distribución asintótica de las recompensas acumuladas por procesos de renovación alternados". Statistics and Probability Letters . 129 : 355–359 . doi : 10.1016/j.spl.2017.06.027 .
  34. Rempala, G.; Wesolowski, J. (2002). "Asintótica de productos de sumas y estadísticas U " (PDF) . Comunicaciones electrónicas en probabilidad . 7 : 47–54 . doi : 10.1214/ecp.v7-1046 .
  35. Klartag (2007) , Teorema 1.2.
  36. Durrett (2004) , Sección 2.4, Ejemplo 4.5.
  37. Klartag (2008) , Teorema 1.
  38. Klartag (2007) , Teorema 1.1.
  39. Zygmund, Antoni (2003) [1959]. Series trigonométricas . Cambridge University Press. vol. II, sect. XVI.5, Teorema 5-5. ISBN 0-521-89053-5.
  40. Gaposhkin (1966) , Teorema 2.1.13.
  41. Bárány & Vu (2007) , Teorema 1.1.
  42. Bárány & Vu (2007) , Teorema 1.2.
  43. Meckes, Elizabeth (2008). "Funciones lineales en los grupos de matrices clásicas". Transactions of the American Mathematical Society . 360 (10): 5355– 5366. arXiv : math/0509441 . doi : 10.1090/S0002-9947-08-04444-9 . S2CID 11981408 . 
  44. Gaposhkin (1966) , Sec. 1.5.
  45. Kotani, M.; Sunada, Toshikazu (2003). Geometría espectral de redes cristalinas . Vol. 338. Contemporary Math. pp. 271–305 . ISBN   978-0-8218-4269-0.
  46. Sunada, Toshikazu (2012). Cristalografía topológica: una perspectiva hacia el análisis geométrico discreto . Encuestas y tutoriales en ciencias matemáticas aplicadas. Vol. 6. Springer. ISBN  978-4-431-54177-6.
  47. Marasinghe, M.; Meeker, W.; Cook, D.; Shin, TS (agosto de 1994). Uso de gráficos y simulación para enseñar conceptos estadísticos . Reunión anual de la Asociación Estadounidense de Estadísticos, Toronto, Canadá.
  48. Henk, Tijms (2004). Comprender la probabilidad: las reglas del azar en la vida cotidiana . Cambridge: Cambridge University Press. pág. 169. ISBN  0-521-54036-4.
  49. Galton, F. (1889). Herencia natural . pág. 66. 
  50. ^ Pólya , George (1920). "Über den zentralen Grenzwertsatz der Wahrscheinlichkeitsrechnung und das Momentenproblem" [ Sobre el teorema del límite central del cálculo de probabilidades y el problema de los momentos ] . Mathematische Zeitschrift (en alemán). 8 ( 3– 4): 171– 181. doi : 10.1007/BF01206525 . S2CID 123063388 . 
  51. 1 2 3 Le Cam, Lucien (1986). "El teorema del límite central alrededor de 1935" . Statistical Science . 1 (1): 78– 91. doi : 10.1214/ss/1177013818 .
  52. Hald, Andreas (22 de abril de 1998). Historia de la estadística matemática desde 1750 hasta 1930 (PDF) . Wiley. Capítulo 17. ISBN 978-0471179122Archivado (PDF) del original el 09/10/2022 .
  53. Fischer (2011) , Capítulo 2; Capítulo 5.2.
  54. Bernstein, SN (1945). "Sobre la obra de P. L. Chebyshev en teoría de la probabilidad". En Bernstein, SN (ed.). Nauchnoe Nasledie P. L. Chebyshev. Vypusk Pervyi: Matematika [ El legado científico de P. L. Chebyshev. Parte I: Matemáticas ] (en ruso). Moscú y Leningrado: Academia de Ciencias de la URSS. pág. 174. 
  55. Zabell, SL (1995). "Alan Turing y el teorema del límite central". American Mathematical Monthly . 102 (6): 483– 494. doi : 10.1080/00029890.1995.12004608 .
  56. Jørgensen, Bent (1997). The Theory of Dispersion Models . Chapman & Hall. ISBN 978-0412997112.

Referencias

  • Bárány, Imre ; Vu, Van (2007). "Teoremas del límite central para politopos gaussianos". Annals of Probability . 35 (4). Institute of Mathematical Statistics: 1593–1621 . arXiv : math/0610192 . doi : 10.1214/009117906000000791 . S2CID 9128253 . 
  • Bauer, Heinz (2001). Teoría de la medida y la integración . Berlín: de Gruyter. ISBN 3110167190.
  • Billingsley, Patrick (1995). Probabilidad y medida (3.ª  ed.). John Wiley & Sons. ISBN 0-471-00710-2.
  • Bradley, Richard (2005). "Propiedades básicas de las condiciones de mezcla fuerte. Una revisión y algunas preguntas abiertas". Probability Surveys . 2 : 107–144 . arXiv : math/0511078 . Bibcode : 2005math.....11078B . doi : 10.1214/154957805100000104 . S2CID 8395267 . 
  • Bradley, Richard (2007). Introducción a las condiciones de mezcla intensa (1.ª  ed.). Heber City, UT: Kendrick Press. ISBN 978-0-9740427-9-4.
  • Dinov, Ivo; Christou, Nicolas; Sanchez, Juana (2008). "Teorema del límite central: nuevo applet SOCR y actividad de demostración" . Journal of Statistics Education . 16 (2). ASA: 1– 15. doi : 10.1080/10691898.2008.11889560 . PMC 3152447. PMID 21833159. Archivado del original el 3 de marzo de 2016. Recuperado el 23 de agosto de 2008 .  
  • Durrett, Richard (2004). Probabilidad: teoría y ejemplos (3.ª  ed.). Cambridge University Press. ISBN 0521765390.
  • Fischer, Hans (2011). Historia del teorema del límite central: de la teoría clásica a la moderna de la probabilidad (PDF) . Fuentes y estudios en la historia de las matemáticas y las ciencias físicas. Nueva York: Springer. doi : 10.1007/978-0-387-87857-7 . ISBN 978-0-387-87856-0. MR 2743162 . Zbl 1226.60004 . Archivado (PDF) del original el 31-10-2017.  
  • Gaposhkin, VF (1966). "Series lacunares y funciones independientes". Russian Mathematical Surveys . 21 (6): 1– 82. Bibcode : 1966RuMaS..21....1G . doi : 10.1070/RM1966v021n06ABEH001196 . S2CID 250833638 . .
  • Klartag, Bo'az (2007). "Un teorema del límite central para conjuntos convexos". Inventiones Mathematicae . 168 (1): 91– 131. arXiv : math/0605014 . Bibcode : 2007InMat.168...91K . doi : 10.1007/s00222-006-0028-8 . S2CID 119169773 . 
  • Klartag, Bo'az (2008). "Una desigualdad de tipo Berry-Esseen para cuerpos convexos con una base incondicional". Probability Theory and Related Fields . 145 ( 1– 2): 1– 33. arXiv : 0705.0832 . doi : 10.1007/s00440-008-0158-6 . S2CID 10163322 . 
  • Teorema del límite central en la Academia Khan
  • "Teorema del límite central" . Enciclopedia de Matemáticas . EMS Press. 2001 [1994].
  • Weisstein, Eric W. "Teorema del límite central" . MathWorld .
  • Un video musical que demuestra el teorema del límite central con un tablero de Galton, por Carl McTague.