Articulo de referencia

Distribución chi-cuadrado

\\chi^2(k)\\; or \\chi^2_k\\! "},"parameters":{"wt":" k \\in \\mathbb{N}^{*}~~ (known as \"degrees of freedom\")"},"support":{"wt":" x \\in (0, +\\infty)\\; "},"pdf":{"wt":" \\f...

En teoría de la probabilidad y estadística , laχ2{\displaystyle \chi ^{2}}-distribución conk{\displaystyle k}grados de libertad es la distribución de una suma de los cuadrados dek{\displaystyle k} variables aleatorias normales estándar independientes . [ 2 ]

La distribución chi-cuadradoχk2{\displaystyle \chi _{k}^{2}}es un caso especial de la distribución gamma y la distribución univariada de Wishart . Específicamente siincógnitaχk2{\displaystyle X\sim \chi _{k}^{2}}entoncesincógnitaGama(α=k2,θ=2){\textstyle X\sim {\text{Gamma}}(\alpha ={\frac {k}{2}},\theta =2)}(dóndeα{\displaystyle \alpha }es el parámetro de forma yθ{\displaystyle \theta }el parámetro de escala de la distribución gamma) yincógnitaW1(1,k){\displaystyle X\sim {\text{W}}_{1}(1,k)}.

La distribución chi-cuadrado escaladas2χk2{\displaystyle s^{2}\chi _{k}^{2}}es una reparametrización de la distribución gamma y la distribución univariada de Wishart . Específicamente siincógnitas2χk2{\displaystyle X\sim s^{2}\chi _{k}^{2}}entoncesincógnitaGama(α=k2,θ=2s2){\textstyle X\sim {\text{Gamma}}(\alpha ={\frac {k}{2}},\theta =2s^{2})}yincógnitaW1(s2,k){\displaystyle X\sim {\text{W}}_{1}(s^{2},k)}.

La distribución chi-cuadrado es una de las distribuciones de probabilidad más utilizadas en estadística inferencial , especialmente en pruebas de hipótesis y en la construcción de intervalos de confianza . [ 3 ] [ 4 ] [ 5 ] [ 6 ] Esta distribución a veces se denomina distribución chi-cuadrado central , un caso especial de la distribución chi-cuadrado no central más general . [ 7 ]

La distribución chi-cuadrado se utiliza en las pruebas chi-cuadrado comunes para evaluar la bondad de ajuste de una distribución observada a una teórica, la independencia de dos criterios de clasificación de datos cualitativos y para hallar el intervalo de confianza para estimar la desviación estándar poblacional de una distribución normal a partir de la desviación estándar muestral. Muchas otras pruebas estadísticas también utilizan esta distribución, como el análisis de varianza por rangos de Friedman .

Definiciones

Si Z 1 , ..., Z k son variables aleatorias normales estándar independientes , entonces la suma de sus cuadrados, incógnita =i=1kZi2,{\displaystyle X\ =\sum _{i=1}^{k}Z_{i}^{2},} se distribuye según la distribución chi-cuadrado con k grados de libertad.

Esto se suele denotar como incógnita  χ2(k)  o  incógnita  χk2.{\displaystyle X\ \sim \ \chi ^{2}(k)\ \ {\text{or}}\ \ X\ \sim \ \chi _{k}^{2}.}

La distribución chi-cuadrado tiene un parámetro: un entero positivo k que especifica el número de grados de libertad (el número de variables aleatorias Z i que se suman).

Introducción

La distribución chi-cuadrado se utiliza principalmente en pruebas de hipótesis y, en menor medida, para intervalos de confianza de la varianza poblacional cuando la distribución subyacente es normal. A diferencia de distribuciones más conocidas, como la distribución normal y la exponencial , la distribución chi-cuadrado no se aplica con tanta frecuencia en la modelización directa de fenómenos naturales. Surge, entre otras cosas, en las siguientes pruebas de hipótesis:

También es un componente de la definición de la distribución t y la distribución F utilizadas en las pruebas t , el análisis de varianza y el análisis de regresión.

La principal razón por la que la distribución chi-cuadrado se utiliza ampliamente en las pruebas de hipótesis es su relación con la distribución normal. Muchas pruebas de hipótesis utilizan un estadístico de prueba, como el estadístico t en una prueba t . Para estas pruebas de hipótesis, a medida que aumenta el tamaño de la muestra, n , la distribución muestral del estadístico de prueba se aproxima a la distribución normal ( teorema del límite central ). Dado que el estadístico de prueba (como t ) se distribuye asintóticamente de forma normal, siempre que el tamaño de la muestra sea suficientemente grande, la distribución utilizada para las pruebas de hipótesis puede aproximarse mediante una distribución normal. Probar hipótesis utilizando una distribución normal es un método bien conocido y relativamente sencillo. La distribución chi-cuadrado más simple es el cuadrado de una distribución normal estándar. Por lo tanto, siempre que se pueda utilizar una distribución normal para una prueba de hipótesis, se puede utilizar una distribución chi-cuadrado.

Supongamos queZ{\displaystyle Z}es una variable aleatoria muestreada de la distribución normal estándar, donde la media es0{\displaystyle 0}y la varianza es1{\displaystyle 1}:Znorte(0,1){\displaystyle Z\sim N(0,1)}Ahora, consideremos la variable aleatoriaincógnita=Z2{\displaystyle X=Z^{2}}. La distribución de la variable aleatoriaincógnita{\displaystyle X}es un ejemplo de distribución chi-cuadrado: incógnita  χ12{\displaystyle \ X\ \sim \ \chi _{1}^{2}}El subíndice 1 indica que esta distribución chi-cuadrado en particular se construye a partir de una sola distribución normal estándar. Se dice que una distribución chi-cuadrado construida elevando al cuadrado una única distribución normal estándar tiene 1 grado de libertad. Por lo tanto, a medida que aumenta el tamaño de la muestra para una prueba de hipótesis, la distribución del estadístico de prueba se aproxima a una distribución normal. Así como los valores extremos de la distribución normal tienen baja probabilidad (y dan valores p pequeños), los valores extremos de la distribución chi-cuadrado también tienen baja probabilidad.

Una razón adicional por la que la distribución chi-cuadrado se usa ampliamente es que aparece como la distribución de muestra grande de las pruebas de razón de verosimilitud generalizadas (LRT). [ 8 ] Las LRT tienen varias propiedades deseables; en particular, las LRT simples suelen proporcionar la mayor potencia para rechazar la hipótesis nula ( lema de Neyman-Pearson ) y esto también conduce a las propiedades de optimalidad de las LRT generalizadas. Sin embargo, las aproximaciones normal y chi-cuadrado solo son válidas asintóticamente. Por esta razón, es preferible usar la distribución t en lugar de la aproximación normal o la aproximación chi-cuadrado para un tamaño de muestra pequeño. De manera similar, en los análisis de tablas de contingencia, la aproximación chi-cuadrado será deficiente para un tamaño de muestra pequeño, y es preferible usar la prueba exacta de Fisher . Ramsey muestra que la prueba binomial exacta siempre es más potente que la aproximación normal. [ 9 ]

Lancaster muestra las conexiones entre las distribuciones binomial, normal y chi-cuadrado, como sigue. [ 10 ] De Moivre y Laplace establecieron que una distribución binomial podía aproximarse mediante una distribución normal. Específicamente, demostraron la normalidad asintótica de la variable aleatoria.

χ=metronortepagnortepagq{\displaystyle \chi ={\frac {m-Np}{\sqrt {Npq}}}}

dóndemetro{\displaystyle m}es el número observado de éxitos ennorte{\displaystyle N}ensayos, donde la probabilidad de éxito espag{\displaystyle p}, yq=1pag{\displaystyle q=1-p}.

Elevando al cuadrado ambos lados de la ecuación se obtiene

χ2=(metronortepag)2nortepagq{\displaystyle \chi ^{2}={\frac {\left(m-Np\right)^{2}}{Npq}}}

Usandonorte=nortepag+norte(1pag){\displaystyle N=Np+N(1-p)},norte=metro+(nortemetro){\displaystyle N=m+(N-m)}, yq=1pag{\displaystyle q=1-p}, esta ecuación se puede reescribir como

χ2=(metronortepag)2nortepag+(nortemetronorteq)2norteq{\displaystyle \chi ^{2}={\frac {\left(m-Np\right)^{2}}{Np}}+{\frac {\left(N-m-Nq\right)^{2}}{Nq}}}

La expresión de la derecha es de la forma que Karl Pearson generalizaría a la forma

χ2=i=1norte(Oimii)2mii{\displaystyle \chi ^{2}=\sum _{i=1}^{n}{\frac {\left(O_{i}-E_{i}\right)^{2}}{E_{i}}}}

dónde

  • χ2{\displaystyle \chi ^{2}}= Estadístico de prueba acumulativo de Pearson, que se aproxima asintóticamente a unχ2{\displaystyle \chi ^{2}}distribución;
  • Oi{\displaystyle O_{i}}= el número de observaciones de tipoi{\displaystyle i};
  • mii=nortepagi{\displaystyle E_{i}=Np_{i}}= la frecuencia esperada (teórica) de tipoi{\displaystyle i}, afirmado por la hipótesis nula de que la fracción de tipoi{\displaystyle i}en la población espagi{\displaystyle p_{i}}; y
  • norte{\displaystyle n}= el número de celdas en la tabla.

En el caso de un resultado binomial (lanzar una moneda), la distribución binomial puede aproximarse mediante una distribución normal (para valores suficientemente grandes).norte{\displaystyle n}Dado que el cuadrado de una distribución normal estándar es la distribución chi-cuadrado con un grado de libertad, la probabilidad de un resultado como 1 cara en 10 ensayos puede aproximarse utilizando directamente la distribución normal o la distribución chi-cuadrado para la diferencia al cuadrado normalizada entre el valor observado y el esperado. Sin embargo, muchos problemas involucran más de los dos resultados posibles de una distribución binomial y requieren 3 o más categorías, lo que lleva a la distribución multinomial. Así como de Moivre y Laplace buscaron y encontraron la aproximación normal a la binomial, Pearson buscó y encontró una aproximación normal multivariada degenerada a la distribución multinomial (los números en cada categoría suman el tamaño total de la muestra, que se considera fijo). Pearson demostró que la distribución chi-cuadrado surgió de dicha aproximación normal multivariada a la distribución multinomial, teniendo en cuenta cuidadosamente la dependencia estadística (correlaciones negativas) entre los números de observaciones en diferentes categorías. [ 10 ]

Función de densidad de probabilidad

La función de densidad de probabilidad (pdf) de la distribución chi-cuadrado es F(incógnita;k)={incógnitak/21miincógnita/22k/2Γ(k2),incógnita>0;0,de lo contrario.{\displaystyle f(x;\,k)={\begin{cases}{\dfrac {x^{k/2-1}e^{-x/2}}{2^{k/2}\,\Gamma {\left({\frac {k}{2}}\right)}}},&x>0;\\0,&{\text{otherwise}}.\end{cases}}} dóndeΓ(k/2){\textstyle \Gamma (k/2)}denota la función gamma , que tiene valores de forma cerrada para enterosk{\displaystyle k}.

Para las derivaciones de la pdf en los casos de uno, dos yk{\displaystyle k}grados de libertad, véase Pruebas relacionadas con la distribución chi-cuadrado .

Función de distribución acumulativa

Cota de Chernoff para la función de distribución acumulada (CDF ) y la cola (1-CDF) de una variable aleatoria chi-cuadrado con diez grados de libertad (k=10{\displaystyle k=10})

Su función de distribución acumulativa es: F(incógnita;k)=γ(k2,incógnita2)Γ(k2)=PAG(k2,incógnita2),{\displaystyle F(x;\,k)={\frac {\gamma {\left({\frac {k}{2}},\,{\frac {x}{2}}\right)}}{\Gamma {\left({\frac {k}{2}}\right)}}}=P{\left({\frac {k}{2}},\,{\frac {x}{2}}\right)},} dóndeγ(s,t){\displaystyle \gamma (s,t)}es la función gamma incompleta inferior yPAG(s,t){\textstyle P(s,t)}es la función gamma regularizada .

En un caso especial dek=2{\displaystyle k=2}Esta función tiene la forma simple: F(incógnita;2)=1miincógnita/2{\displaystyle F(x;\,2)=1-e^{-x/2}} que se puede obtener fácilmente integrandoF(incógnita;2)=12miincógnita/2{\textstyle f(x;\,2)={\frac {1}{2}}e^{-x/2}}directamente. La recurrencia entera de la función gamma facilita el cálculo.F(incógnita;k){\displaystyle F(x;\,k)}para otros pequeños, inclusok{\displaystyle k}.

Las tablas de la función de distribución acumulativa chi-cuadrado están ampliamente disponibles y la función está incluida en muchas hojas de cálculo y en todos los paquetes estadísticos .

Alquilerzincógnita/k{\displaystyle z\equiv x/k}Se pueden obtener cotas de Chernoff en las colas inferior y superior de la CDF. [ 11 ] Para los casos en que0<z<1{\displaystyle 0<z<1}(que incluyen todos los casos en los que esta CDF es menor a la mitad): F(zk;k)(zmi1z)k/2.{\displaystyle F(zk;\,k)\leq (ze^{1-z})^{k/2}.}

El límite de cola para los casos en quez>1{\displaystyle z>1}De manera similar, es 1F(zk;k)(zmi1z)k/2.{\displaystyle 1-F(zk;\,k)\leq (ze^{1-z})^{k/2}.}

Para otra aproximación de la función de distribución acumulada (CDF) modelada a partir del cubo de una distribución gaussiana, consulte la sección Distribución chi-cuadrada no central .

Propiedades

Teorema de Cochran

El siguiente es un caso especial del teorema de Cochran.

Teorema. SiZ1,...,Znorte{\displaystyle Z_{1},...,Z_{n}}son variables aleatorias normales estándar , independientes e idénticamente distribuidas (iid) , entonces t=1norte(ZtZ¯)2χnorte12{\textstyle \sum _{t=1}^{n}\left(Z_{t}-{\bar {Z}}\right)^{2}\sim \chi _{n-1}^{2}} dóndeZ¯=1nortet=1norteZt.{\textstyle {\bar {Z}}={\frac {1}{n}}\sum _{t=1}^{n}Z_{t}.}

[Prueba]

Prueba. DejemosZnorte(0¯,11){\displaystyle Z\sim {\mathcal {N}}({\bar {0}},1\!\!1)}ser un vector denorte{\displaystyle n}variables aleatorias independientes con distribución normal, yZ¯{\displaystyle {\bar {Z}}}su promedio. Entonces t=1norte(ZtZ¯)2 = t=1norteZt2norteZ¯2 = Z[111norte1¯1¯]Z =: ZMETROZ{\displaystyle \sum _{t=1}^{n}(Z_{t}-{\bar {Z}})^{2}~=~\sum _{t=1}^{n}Z_{t}^{2}-n{\bar {Z}}^{2}~=~Z^{\top }[1\!\!1-{\textstyle {\frac {1}{n}}}{\bar {1}}{\bar {1}}^{\top }]Z~=:~Z^{\top }\!MZ} dónde11{\displaystyle 1\!\!1}es la matriz identidad y1¯{\displaystyle {\bar {1}}}el vector de todos unos. METRO{\displaystyle M}tiene un vector propiob1:=1norte1¯{\displaystyle b_{1}:={\textstyle {\frac {1}{\sqrt {n}}}}{\bar {1}}}con valor propio0{\displaystyle 0}, ynorte1{\displaystyle n-1}vectores propiosb2,...,bnorte{\displaystyle b_{2},...,b_{n}}(todos ortogonales ab1{\displaystyle b_{1}}) con valor propio1{\displaystyle 1}, que se puede elegir de modo queQ:=(b1,...,bnorte){\displaystyle Q:=(b_{1},...,b_{n})}es una matriz ortogonal. Dado que tambiénincógnita:=QZnorte(0¯,Q11Q)=norte(0¯,11){\displaystyle X:=Q^{\top }\!Z\sim {\mathcal {N}}({\bar {0}},Q^{\top }\!1\!\!1Q)={\mathcal {N}}({\bar {0}},1\!\!1)}, tenemos t=1norte(ZtZ¯)2 = ZMETROZ = incógnitaQMETROQincógnita = incógnita22+...+incógnitanorte2  χnorte12,{\displaystyle \sum _{t=1}^{n}(Z_{t}-{\bar {Z}})^{2}~=~Z^{\top }\!MZ~=~X^{\top }\!Q^{\top }\!MQX~=~X_{2}^{2}+...+X_{n}^{2}~\sim ~\chi _{n-1}^{2},} lo cual prueba la afirmación.

Aditividad

De la definición de la distribución chi-cuadrado se deduce que la suma de variables chi-cuadrado independientes también sigue una distribución chi-cuadrado. Específicamente, siincógnitai,i=1,norte¯{\displaystyle X_{i},i={\overline {1,n}}}son variables chi-cuadrado independientes conki{\displaystyle k_{i}},i=1,norte¯{\displaystyle i={\overline {1,n}}}grados de libertad, respectivamente, entoncesY=incógnita1++incógnitanorte{\displaystyle Y=X_{1}+\cdots +X_{n}}se distribuye chi-cuadrado conk1++knorte{\displaystyle k_{1}+\cdots +k_{n}}grados de libertad.

Media de la muestra

La media muestral denorte{\displaystyle n}variables chi-cuadrado iid de gradok{\displaystyle k}se distribuye según una distribución gamma con formaα{\displaystyle \alpha }y escalaθ{\displaystyle \theta }parámetros: incógnita¯=1nortei=1norteincógnitaiGama(α=nortek2,θ=2norte)dónde incógnitaiχ2(k){\displaystyle {\overline {X}}={\frac {1}{n}}\sum _{i=1}^{n}X_{i}\sim \operatorname {Gamma} \left(\alpha {=}{\tfrac {nk}{2}},\,\theta {=}{\tfrac {2}{n}}\right)\qquad {\text{where }}X_{i}\sim \chi ^{2}(k)}

Asintóticamente , dado que para un parámetro de formaα{\displaystyle \alpha }Al tender al infinito, una distribución Gamma converge hacia una distribución normal con una esperanzaμ=αθ{\displaystyle \mu =\alpha \theta }y varianzaσ2=αθ2{\displaystyle \sigma ^{2}=\alpha \theta ^{2}}, la media muestral converge hacia:

incógnita¯nortenorte(μ=k,σ2=2knorte){\displaystyle {\overline {X}}\xrightarrow {n\to \infty } N{\left(\mu {=}k,\,\sigma ^{2}{=}{\tfrac {2k}{n}}\right)}}

Nótese que habríamos obtenido el mismo resultado invocando en cambio el teorema del límite central , teniendo en cuenta que para cada variable chi-cuadrado de gradok{\displaystyle k}la expectativa esk{\displaystyle k}y su varianza2k{\displaystyle 2k}(y por lo tanto la varianza de la media muestral)incógnita¯{\displaystyle {\overline {X}}}serσ2=2knorte{\textstyle \sigma ^{2}={\tfrac {2k}{n}}}).

Entropía

La entropía diferencial viene dada por h=0F(incógnita;k)lnF(incógnita;k)dincógnita=k2+ln[2Γ(k2)]+(1k2)ψ(k2),{\displaystyle {\begin{aligned}h&=\int _{0}^{\infty }f(x;\,k)\ln f(x;\,k)\,dx\\&={\frac {k}{2}}+\ln \left[2\,\Gamma {\left({\frac {k}{2}}\right)}\right]+\left(1-{\frac {k}{2}}\right)\psi \!\left({\frac {k}{2}}\right),\end{aligned}}} dóndeψ(incógnita){\displaystyle \psi (x)}es la función Digamma .

La distribución chi-cuadrado es la distribución de probabilidad de máxima entropía para una variable aleatoria.incógnita{\displaystyle X}para quémi(incógnita)=k{\displaystyle \operatorname {E} (X)=k}ymi(ln(incógnita))=ψ(k/2)+ln(2){\displaystyle \operatorname {E} (\ln(X))=\psi (k/2)+\ln(2)}son fijos. Dado que la chi-cuadrado pertenece a la familia de las distribuciones gamma, esto se puede derivar sustituyendo los valores apropiados en la esperanza del momento logarítmico de gamma . Para la derivación a partir de principios más básicos, véase la derivación en la función generadora de momentos del estadístico suficiente .

momentos no centrales

Los momentos no centrales (momentos brutos) de una distribución chi-cuadrado conk{\displaystyle k}Los grados de libertad vienen dados por [ 12 ] [ 13 ]mi(incógnitametro)=k(k+2)(k+4)(k+2metro2)=2metroΓ(metro+k2)Γ(k2).{\displaystyle {\begin{aligned}\operatorname {E} (X^{m})&=k(k+2)(k+4)\cdots (k+2m-2)\\[1ex]&=2^{m}{\frac {\Gamma {\left(m+{\frac {k}{2}}\right)}}{\Gamma {\left({\frac {k}{2}}\right)}}}.\end{aligned}}}

Cumulantes

Los cumulantes se obtienen fácilmente mediante un desarrollo en serie de potencias del logaritmo de la función característica: κnorte=2norte1(norte1)¡k{\displaystyle \kappa _{n}=2^{n-1}(n-1)!\,k} con función generadora de cumulanteslnmi[mitincógnita]=k2ln(12t){\textstyle \ln \operatorname {E} [e^{tX}]=-{\frac {k}{2}}\ln(1-2t)}.

Concentración

La distribución chi-cuadrado muestra una fuerte concentración alrededor de su media. Los límites estándar de Laurent-Massart [ 14 ] son: Pr(incógnitak2kincógnita+2incógnita)miincógnita{\displaystyle \Pr(X-k\geq 2{\sqrt {kx}}+2x)\leq e^{-x}}Pr(kincógnita2kincógnita)miincógnita{\displaystyle \Pr(k-X\geq 2{\sqrt {kx}})\leq e^{-x}} Una consecuencia es que, siZnorte(0,1)k{\displaystyle Z\sim N(0,1)^{k}}es un vector aleatorio gaussiano enRk{\displaystyle \mathbb {R} ^{k}}, entonces como la dimensiónk{\displaystyle k}crece, la longitud al cuadrado del vector se concentra fuertemente alrededork{\displaystyle k}con un anchok1/2+α{\displaystyle k^{1/2+\alpha }}:Pr(Z2[k2k1/2+α,k+2k1/2+α+2kα])1mikα{\displaystyle \Pr \left(\left\|Z\right\|^{2}\in \left[k-2k^{1/2+\alpha },\;k+2k^{1/2+\alpha }+2k^{\alpha }\right]\right)\geq 1-e^{-k^{\alpha }}}donde el exponenteα{\displaystyle \alpha }puede elegirse como cualquier valor enR{\displaystyle \mathbb {R} }.

Dado que la función generadora de cumulantes paraχ2(k){\displaystyle \chi ^{2}(k)}esK(t)=k2ln(12t){\textstyle K(t)=-{\frac {k}{2}}\ln(1-2t)}y su dual convexo esK(q)=12(qk+klnkq){\textstyle K^{*}(q)={\frac {1}{2}}\left(q-k+k\ln {\frac {k}{q}}\right)}, el límite estándar de Chernoff producelnPr(incógnita(1+ε)k)k2(εln(1+ε))lnPr(incógnita(1ε)k)k2(εln(1ε)){\displaystyle {\begin{aligned}\ln \Pr(X\geq (1+\varepsilon )k)&\leq -{\frac {k}{2}}\left(\varepsilon -\ln(1+\varepsilon )\right)\\\ln \Pr(X\leq (1-\varepsilon )k)&\leq -{\frac {k}{2}}\left(-\varepsilon -\ln(1-\varepsilon )\right)\end{aligned}}}dónde0<ε<1{\displaystyle 0<\varepsilon <1}. Por el vínculo de unión,PAGr(incógnita(1±ε)k)12mik2(12ε213ε3){\displaystyle Pr(X\in (1\pm \varepsilon )k)\geq 1-2e^{-{\frac {k}{2}}({\frac {1}{2}}\varepsilon ^{2}-{\frac {1}{3}}\varepsilon ^{3})}}Este resultado se utiliza para demostrar el lema de Johnson-Lindenstrauss . [ 15 ]

Propiedades asintóticas

Fórmula aproximada para la mediana (a partir de la transformación de Wilson-Hilferty) comparada con el cuantil numérico (arriba); y diferencia ( azul ) y diferencia relativa ( rojo ) entre el cuantil numérico y la fórmula aproximada (abajo). Para la distribución chi-cuadrado, solo los números enteros positivos de grados de libertad (círculos) son relevantes.

Por el teorema del límite central , dado que la distribución chi-cuadrado es la suma dek{\displaystyle k}variables aleatorias independientes con media y varianza finitas, converge a una distribución normal para valores grandesk{\displaystyle k}. Para muchos fines prácticos, parak>50{\displaystyle k>50}La distribución es suficientemente cercana a una distribución normal , por lo que la diferencia es despreciable. [ 16 ] Específicamente, siincógnitaχ2(k){\displaystyle X\sim \chi ^{2}(k)}, entonces comok{\displaystyle k}tiende al infinito, la distribución de(incógnitak)/2k{\displaystyle (X-k)/{\sqrt {2k}}}tiende a una distribución normal estándar. Sin embargo, la convergencia es lenta ya que la asimetría es8/k{\textstyle {\sqrt {8/k}}}y la curtosis en exceso es12/k{\displaystyle 12/k}.

La distribución muestral deln(χ2){\displaystyle \ln(\chi ^{2})}converge a la normalidad mucho más rápido que la distribución muestral deχ2{\displaystyle \chi ^{2}}, [ 17 ] ya que la transformación logarítmica elimina gran parte de la asimetría. [ 18 ]

Otras funciones de la distribución chi-cuadrado convergen más rápidamente a una distribución normal. Algunos ejemplos son:

  • Siincógnitaχ2(k){\displaystyle X\sim \chi ^{2}(k)}entonces2incógnita{\displaystyle {\sqrt {2X}}}se distribuye aproximadamente de forma normal con media2k1{\displaystyle {\sqrt {2k-1}}}y varianza unitaria (1922, por RA Fisher , véase (18.23), pág.  426 de Johnson). [ 5 ]
  • Siincógnitaχ2(k){\displaystyle X\sim \chi ^{2}(k)}entoncesincógnita/k3{\textstyle {\sqrt[{3}]{X/k}}}se distribuye aproximadamente de forma normal con media129k{\displaystyle 1-{\frac {2}{9k}}}y varianza29k.{\displaystyle {\frac {2}{9k}}.}[ 19 ] Esto se conoce como latransformación de Wilson-Hilferty, véase (18.24), pág. 426 de Johnson. [ 5 ]
    • Esta transformación de normalización conduce directamente a la aproximación de la mediana comúnmente utilizada.k(129k)3{\displaystyle k{\bigg (}1-{\frac {2}{9k}}{\bigg )}^{3}\;}mediante la transformación inversa a partir de la media, que también es la mediana, de la distribución normal.
  • Comok{\displaystyle k\to \infty },(χk2k)/2k d norte(0,1){\displaystyle (\chi _{k}^{2}-k)/{\sqrt {2k}}~{\xrightarrow {d}}\ N(0,1)\,}( distribución normal )
  • χk2χk2(0){\displaystyle \chi _{k}^{2}\sim {\chi '}_{k}^{2}(0)}( distribución chi-cuadrado no central con parámetro de no centralidadλ=0{\displaystyle \lambda =0})
  • SiYF(ν1,ν2){\displaystyle Y\sim \mathrm {F} (\nu _{1},\nu _{2})}entoncesincógnita=límiteν2ν1Y{\displaystyle X=\lim _{\nu _{2}\to \infty }\nu _{1}Y}tiene la distribución chi-cuadradoχν12{\displaystyle \chi _{\nu _{1}}^{2}}
    • Como caso especial, siYF(1,ν2){\displaystyle Y\sim \mathrm {F} (1,\nu _{2})\,}entoncesincógnita=límiteν2Y{\displaystyle X=\lim _{\nu _{2}\to \infty }Y\,}tiene la distribución chi-cuadradoχ12{\displaystyle \chi _{1}^{2}}
  • nortei=1,,k(0,1)2χk2{\displaystyle \left\|{\boldsymbol {N}}_{i=1,\ldots ,k}(0,1)\right\|^{2}\sim \chi _{k}^{2}}(La norma al cuadrado de k variables con distribución normal estándar es una distribución chi-cuadrado con k grados de libertad ).
  • Siincógnitaχν2{\displaystyle X\sim \chi _{\nu }^{2}\,}ydo>0{\displaystyle c>0\,}, entoncesdoincógnitaΓ(k=ν/2,θ=2do){\displaystyle cX\sim \Gamma (k=\nu /2,\theta =2c)\,}( Distribución gamma )
  • Siincógnitaχk2{\displaystyle X\sim \chi _{k}^{2}}entoncesincógnitaχk{\displaystyle {\sqrt {X}}\sim \chi _{k}}( distribución chi )
  • Siincógnitaχ22{\displaystyle X\sim \chi _{2}^{2}}, entoncesincógnitaexp(1/2){\displaystyle X\sim \operatorname {exp} (1/2)}es una distribución exponencial . (Para más información, consulte la distribución gamma ).
  • Siincógnitaχ2k2{\displaystyle X\sim \chi _{2k}^{2}}, entoncesincógnitaErlang(k,1/2){\displaystyle X\sim \operatorname {Erlang} (k,1/2)}es una distribución de Erlang .
  • SiincógnitaErlang(k,λ){\displaystyle X\sim \operatorname {Erlang} (k,\lambda )}, entonces2λincógnitaχ2k2{\displaystyle 2\lambda X\sim \chi _{2k}^{2}}
  • SiincógnitaRayleigh(1){\displaystyle X\sim \operatorname {Rayleigh} (1)\,}( Distribución de Rayleigh ) entoncesincógnita2χ22{\displaystyle X^{2}\sim \chi _{2}^{2}\,}
  • SiincógnitaMaxwell(1){\displaystyle X\sim \operatorname {Maxwell} (1)\,}( Distribución de Maxwell ) entoncesincógnita2χ32{\displaystyle X^{2}\sim \chi _{3}^{2}\,}
  • Siincógnitaχν2{\displaystyle X\sim \chi _{\nu }^{2}}entonces1incógnitaInortev-χν2{\displaystyle {\tfrac {1}{X}}\sim \operatorname {Inv-} \chi _{\nu }^{2}\,}( Distribución chi-cuadrado inversa )
  • La distribución chi-cuadrado es un caso especial de la distribución de Pearson de tipo III.
  • Siincógnitaχν12{\displaystyle X\sim \chi _{\nu _{1}}^{2}\,}yYχν22{\displaystyle Y\sim \chi _{\nu _{2}}^{2}\,}son independientes entoncesincógnitaincógnita+YBeta(ν12,ν22){\displaystyle {\tfrac {X}{X+Y}}\sim \operatorname {Beta} ({\tfrac {\nu _{1}}{2}},{\tfrac {\nu _{2}}{2}})\,}( distribución beta )
  • SiincógnitaU(0,1){\displaystyle X\sim \operatorname {U} (0,1)\,}( distribución uniforme ) entonces2registro(incógnita)χ22{\displaystyle -2\log(X)\sim \chi _{2}^{2}\,}
  • SiincógnitaiLaplace(μ,β){\displaystyle X_{i}\sim \operatorname {Laplace} (\mu ,\beta )\,}entoncesi=1norte2|incógnitaiμ|βχ2norte2{\displaystyle \sum _{i=1}^{n}{\frac {2|X_{i}-\mu |}{\beta }}\sim \chi _{2n}^{2}\,}
  • Siincógnitai{\displaystyle X_{i}}sigue la distribución normal generalizada (versión 1) con parámetrosμ,α,β{\displaystyle \mu ,\alpha ,\beta }entoncesi=1norte2|incógnitaiμ|βαχ2norte/β2{\displaystyle \sum _{i=1}^{n}{\frac {2|X_{i}-\mu |^{\beta }}{\alpha }}\sim \chi _{2n/\beta }^{2}\,}[ 20 ]
  • La distribución chi-cuadrado es una transformación de la distribución de Pareto.
  • La distribución t de Student es una transformación de la distribución chi-cuadrado.
  • La distribución t de Student se puede obtener a partir de la distribución chi-cuadrado y la distribución normal.
  • La distribución beta no central se puede obtener como una transformación de la distribución chi-cuadrado y la distribución chi-cuadrado no central.
  • La distribución t no central se puede obtener a partir de la distribución normal y la distribución chi-cuadrado.

Una variable chi-cuadrado conk{\displaystyle k}Los grados de libertad se definen como la suma de los cuadrados dek{\displaystyle k}variables aleatorias normales estándar independientes .

SiY{\displaystyle Y}es unk{\displaystyle k}vector aleatorio gaussiano de dimensión con vector medioμ{\displaystyle \mu }y rangok{\displaystyle k}matriz de covarianzado{\displaystyle C}, entoncesincógnita=(Yμ)Tdo1(Yμ){\displaystyle X=(Y-\mu )^{\mathsf {T}}C^{-1}(Y-\mu )}se distribuye chi-cuadrado conk{\displaystyle k}grados de libertad.

La suma de cuadrados de variables gaussianas estadísticamente independientes con varianza unitaria que no tienen media cero produce una generalización de la distribución chi-cuadrado llamada distribución chi-cuadrado no central .

SiY{\displaystyle Y}es un vector dek{\displaystyle k}variables aleatorias normales estándar i.i.d. yA{\displaystyle A}es unk×k{\displaystyle k\times k}matriz simétrica e idempotente con rangoknorte{\displaystyle k-n}, entonces la forma cuadráticaYTAY{\displaystyle Y^{\mathsf {T}}\!AY}es chi cuadrado distribuido conknorte{\displaystyle k-n}grados de libertad.

SiΣ{\displaystyle \Sigma }es unpag×pag{\displaystyle p\times p}matriz de covarianza semidefinida positiva con entradas diagonales estrictamente positivas, entonces paraincógnitanorte(0,Σ){\displaystyle X\sim N(0,\Sigma )}yw{\displaystyle w}un aleatoriopag{\displaystyle p}-vector independiente deincógnita{\displaystyle X}de tal manera quew1++wpag=1{\displaystyle w_{1}+\cdots +w_{p}=1}ywi0,i=1,,pag,{\displaystyle w_{i}\geq 0,i=1,\ldots ,p,}entonces [ 18 ]

1w~TΣw~χ12.{\displaystyle {\frac {1}{{\tilde {w}}^{\mathsf {T}}\Sigma {\tilde {w}}}}\sim \chi _{1}^{2}.}dóndew~=(w1/incógnita1,,wpag/incógnitapag){\displaystyle {\tilde {w}}=(w_{1}/X_{1},\dots ,w_{p}/X_{p})}.

La distribución chi-cuadrado también está relacionada naturalmente con otras distribuciones derivadas de la gaussiana. En particular,

  • Y{\displaystyle Y}es F distribuida ,YF(k1,k2){\displaystyle Y\sim F(k_{1},k_{2})}siY=incógnita1/k1incógnita2/k2{\displaystyle Y={\frac {{X_{1}}/{k_{1}}}{{X_{2}}/{k_{2}}}}}, dóndeincógnita1χk12{\displaystyle X_{1}\sim \chi _{k_{1}}^{2}}yincógnita2χk22{\displaystyle X_{2}\sim \chi _{k_{2}}^{2}}son estadísticamente independientes.
  • Siincógnita1χk12{\displaystyle X_{1}\sim \chi _{k_{1}}^{2}}yincógnita2χk22{\displaystyle X_{2}\sim \chi _{k_{2}}^{2}}son estadísticamente independientes, entoncesincógnita1+incógnita2χk1+k22{\displaystyle X_{1}+X_{2}\sim \chi _{k_{1}+k_{2}}^{2}}. Siincógnita1{\displaystyle X_{1}}yincógnita2{\displaystyle X_{2}}no son independientes, entoncesincógnita1+incógnita2{\displaystyle X_{1}+X_{2}}no tiene distribución chi-cuadrado.

Generalizaciones

La distribución chi-cuadrado se obtiene como la suma de los cuadrados de k variables aleatorias gaussianas independientes, con media cero y varianza unitaria. Se pueden obtener generalizaciones de esta distribución sumando los cuadrados de otros tipos de variables aleatorias gaussianas. A continuación se describen varias de estas distribuciones.

Combinación lineal

Siincógnita1,,incógnitanorte{\displaystyle X_{1},\ldots ,X_{n}}son variables aleatorias chi cuadrado ya1,,anorteR>0{\displaystyle a_{1},\ldots ,a_{n}\in \mathbb {R} _{>0}}, entonces la distribución deincógnita=i=1norteaiincógnitai{\textstyle X=\sum _{i=1}^{n}a_{i}X_{i}}es un caso especial de la distribución chi-cuadrado generalizada . No se conoce una expresión cerrada para esta distribución. Sin embargo, puede aproximarse de manera eficiente utilizando la propiedad de las funciones características de las variables aleatorias chi-cuadrado. [ 21 ]

Distribuciones chi-cuadrado

Distribución chi-cuadrado no central

La distribución chi-cuadrado no central se obtiene a partir de la suma de los cuadrados de variables aleatorias gaussianas independientes con varianza unitaria y media distinta de cero .

Distribución chi-cuadrado generalizada

La distribución chi-cuadrado generalizada se obtiene a partir de la forma cuadrática z'Az, donde z es un vector gaussiano de media cero con una matriz de covarianza arbitraria, y A es una matriz arbitraria.

La distribución chi-cuadradoincógnitaχk2{\displaystyle X\sim \chi _{k}^{2}}es un caso especial de la distribución gamma , en el sentido de queincógnitaΓ(k2,12){\textstyle X\sim \Gamma {\left({\tfrac {k}{2}},{\tfrac {1}{2}}\right)}}utilizando la parametrización de la tasa de la distribución gamma (oincógnitaΓ(k2,2){\textstyle X\sim \Gamma {\left({\tfrac {k}{2}},2\right)}}utilizando la parametrización de escala de la distribución gamma), donde k es un número entero.

Debido a que la distribución exponencial también es un caso especial de la distribución gamma, también tenemos que siincógnitaχ22{\displaystyle X\sim \chi _{2}^{2}}, entoncesincógnitaexp(12){\textstyle X\sim \operatorname {exp} \left({\tfrac {1}{2}}\right)}es una distribución exponencial .

La distribución de Erlang también es un caso especial de la distribución gamma y por lo tanto también tenemos que siincógnitaχk2{\displaystyle X\sim \chi _{k}^{2}}inclusok{\displaystyle k}, entoncesincógnita{\displaystyle X}es Erlang distribuido con parámetro de formak/2{\displaystyle k/2}y parámetro de escala1/2{\displaystyle 1/2}.

Ocurrencia y aplicaciones

La distribución chi-cuadrado tiene numerosas aplicaciones en estadística inferencial , por ejemplo, en pruebas chi-cuadrado y en la estimación de varianzas . Se introduce en el problema de estimar la media de una población con distribución normal y en el problema de estimar la pendiente de una línea de regresión a través de su papel en la distribución t de Student . Se introduce en todos los problemas de análisis de varianza a través de su papel en la distribución F , que es la distribución de la razón de dos variables aleatorias chi-cuadrado independientes , cada una dividida por sus respectivos grados de libertad.

A continuación se presentan algunas de las situaciones más comunes en las que la distribución chi-cuadrado surge de una muestra con distribución gaussiana.

  • siincógnita1,...,incógnitanorte{\displaystyle X_{1},...,X_{n}}son iidnorte(μ,σ2){\displaystyle N(\mu ,\sigma ^{2})}variables aleatorias , entoncesi=1norte(incógnitaiincógnita¯)2σ2χnorte12{\textstyle \sum _{i=1}^{n}\left(X_{i}-{\bar {X}}\right)^{2}\sim \sigma ^{2}\chi _{n-1}^{2}}dóndeincógnita¯=1nortei=1norteincógnitai{\textstyle {\bar {X}}={\frac {1}{n}}\sum _{i=1}^{n}X_{i}}.
  • El cuadro a continuación muestra algunas estadísticas basadas enincógnitainorte(μi,σi2),i=1,,k{\displaystyle X_{i}\sim N(\mu _{i},\sigma _{i}^{2}),i=1,\ldots ,k}Variables aleatorias independientes cuyas distribuciones de probabilidad están relacionadas con la distribución chi-cuadrado:

La distribución chi-cuadrado también se encuentra frecuentemente en imágenes de resonancia magnética . [ 22 ]

Métodos computacionales

Tabla de valores de χ² frente a valores p

Elpag{\textstyle p}El valor p es la probabilidad de observar un estadístico de prueba al menos tan extremo en una distribución chi-cuadrado. Por consiguiente, dado que la función de distribución acumulativa (FDA) para los grados de libertad (gl) apropiados proporciona la probabilidad de haber obtenido un valor menos extremo que este punto, al restar el valor de la FDA de 1 se obtiene el valor p . Un valor p bajo , por debajo del nivel de significancia elegido, indica significancia estadística , es decir, evidencia suficiente para rechazar la hipótesis nula. Un nivel de significancia de 0,05 se utiliza a menudo como umbral entre resultados significativos y no significativos.

La tabla a continuación proporciona una serie de valores p que coinciden conχ2{\displaystyle \chi ^{2}}para los primeros 10 grados de libertad.

Estos valores se pueden calcular evaluando la función cuantil (también conocida como "CDF inversa" o "ICDF") de la distribución chi-cuadrado; [ 24 ] por ejemplo, la χ 2 ICDF para p = 0,05 y gl = 7 produce 2,1673 ≈ 2,17 como en la tabla anterior, teniendo en cuenta que 1 – p es el valor p de la tabla.

Historia

Esta distribución fue descrita por primera vez por el geodesta y estadístico alemán Friedrich Robert Helmert en artículos de 1875-1876, [ 25 ] [ 26 ] donde calculó la distribución muestral de la varianza muestral de una población normal. Por lo tanto, en alemán se la conocía tradicionalmente como la " distribución de Helmert " ("de Helmert") o "distribución de Helmert".

La distribución fue redescubierta independientemente por el matemático inglés Karl Pearson en el contexto de la bondad de ajuste , para lo cual desarrolló su prueba chi-cuadrado de Pearson , publicada en 1900, con una tabla de valores calculados publicada en ( Elderton 1902 ) , recopilada en ( Pearson 1914 , pp. xxxi–xxxiii, 26–28, Tabla XII) . El nombre "chi-cuadrado" deriva en última instancia de la abreviatura de Pearson para el exponente en una distribución normal multivariada con la letra griega Chi , escribiendo 1 2 χ 2 para lo que aparecería en notación moderna como 1 2 x T Σ −1 x ( siendo Σ la matriz de covarianza ). [ 27 ] Sin embargo, la idea de una familia de "distribuciones chi-cuadrado" no se debe a Pearson, sino que surgió como un desarrollo posterior debido a Fisher en la década de 1920. [ 25 ] 

Véase también

Referencias

  1. MA Sanders. "Función característica de la distribución chi-cuadrado central" (PDF) . Archivado del original (PDF) el 15 de julio de 2011. Consultado el 6 de marzo de 2009 .
  2. Weisstein, Eric W. "Distribución chi-cuadrada" . mathworld.wolfram.com . Consultado el 11 de octubre de 2024 .
  3. Abramowitz, Milton ; Stegun, Irene Ann , eds. (1983) [junio de 1964]. «Capítulo 26» . Manual de funciones matemáticas con fórmulas, gráficas y tablas matemáticas . Serie de Matemáticas Aplicadas. Vol. 55 (novena reimpresión con correcciones adicionales de la décima edición original con correcciones (diciembre de 1972); primera ed.). Washington D. C.; Nueva York: Departamento de Comercio de los Estados Unidos, Oficina Nacional de Normas; Dover Publications. pág. 940. ISBN    978-0-486-61272-0. LCCN 64-60036 . MR 0167642 . LCCN 65-12253 .   
  4. NIST (2006). Manual de estadística para ingeniería: distribución chi-cuadrado.
  5. 1 2 3 Johnson, NL; Kotz, S.; Balakrishnan, N. (1994). "Distribuciones chi-cuadrado, incluidas chi y Rayleigh". Distribuciones univariadas continuas . Vol. 1 (Segunda edición). John Wiley and Sons. págs. 415–493 . ISBN    978-0-471-58495-7.
  6. Mood, Alexander; Graybill, Franklin A.; Boes, Duane C. (1974). Introducción a la teoría de la estadística (Tercera ed.). McGraw-Hill. págs. 241–246 . ISBN   978-0-07-042864-5.
  7. "La distribución chi-cuadrado" (PDF) . Universidad de Regina .
  8. Westfall, Peter H. (2013). Comprensión de los métodos estadísticos avanzados . Boca Raton, FL: CRC Press. ISBN 978-1-4665-1210-8.
  9. Ramsey, PH (1988). "Evaluación de la aproximación normal a la prueba binomial". Journal of Educational Statistics . 13 (2): 173– 82. doi : 10.2307/1164752 . JSTOR 1164752 . 
  10. 1 2 Lancaster, HO (1969), La distribución chi-cuadrado , Wiley
  11. Dasgupta, Sanjoy DA; Gupta, Anupam K. (enero de 2003). "Una demostración elemental de un teorema de Johnson y Lindenstrauss" (PDF) . Random Structures and Algorithms . 22 (1): 60– 65. doi : 10.1002/rsa.10073 . S2CID 10327785. Consultado el 1 de mayo de 2012 . 
  12. Distribución chi-cuadrado , de MathWorld , consultado el 11 de febrero de 2009.
  13. MK Simon, Distribuciones de probabilidad que involucran variables aleatorias gaussianas , Nueva York: Springer, 2002, ec. (2.35), ISBN 978-0-387-34657-1
  14. Laurent, B.; Massart, P. (2000-10-01). "Estimación adaptativa de un funcional cuadrático mediante selección de modelos" . The Annals of Statistics . 28 (5). doi : 10.1214/aos/1015957395 . ISSN 0090-5364 . S2CID 116945590 .  
  15. MIT 18.S096 (Otoño de 2015): Temas de matemáticas aplicadas a la ciencia de datos, Lección 5, Lema de Johnson-Lindenstrauss y Teorema de Gordon
  16. Box, Hunter y Hunter (1978). Estadística para experimentadores . Wiley. pág . 118. ISBN  978-0-471-09315-2.
  17. Bartlett, MS; Kendall, DG (1946). "El análisis estadístico de la heterogeneidad de la varianza y la transformación logarítmica". Suplemento del Journal of the Royal Statistical Society . 8 (1): 128– 138. doi : 10.2307/2983618 . JSTOR 2983618 . 
  18. 1 2 Pillai, Natesh S. (2016). "Un encuentro inesperado con Cauchy y Lévy". Annals of Statistics . 44 (5): 2089– 2097. arXiv : 1505.01957 . doi : 10.1214/15-aos1407 . S2CID 31582370 . 
  19. Wilson, EB; Hilferty, MM (1931). "La distribución de chi-cuadrado" . Proc. Natl. Acad. Sci. USA . 17 (12): 684– 688. Bibcode : 1931PNAS...17..684W . doi : 10.1073 / pnas.17.12.684 . PMC 1076144. PMID 16577411 .  
  20. Bäckström, T.; Fischer, J. (enero de 2018). "Aleatorización rápida para codificación distribuida de baja tasa de bits de voz y audio" (PDF) . IEEE/ACM Transactions on Audio, Speech, and Language Processing . 26 (1): 19– 30. doi : 10.1109/TASLP.2017.2757601 . S2CID 19777585 . 
  21. Bausch, J. (2013). "Sobre el cálculo eficiente de una combinación lineal de variables aleatorias chi-cuadrado con una aplicación en el conteo de vacíos de cuerdas". J. Phys. A: Math. Theor . 46 (50) 505202. arXiv : 1208.2691 . Bibcode : 2013JPhA...46X5202B . doi : 10.1088/1751-8113/46/50/505202 . S2CID 119721108 . 
  22. den Dekker, AJ; Sijbers, J. (2014). "Distribuciones de datos en imágenes de resonancia magnética: una revisión" . Physica Medica . 30 (7): 725– 741. doi : 10.1016/j.ejmp.2014.05.002 .
  23. Prueba de chi-cuadrado archivada el 18/11/2013 en Wayback Machine Tabla B.2. Dra. Jacqueline S. McLaughlin en la Universidad Estatal de Pensilvania. Citando a su vez: RA Fisher y F. Yates, Tablas estadísticas para la investigación biológica, agrícola y médica, 6.ª ed., Tabla IV. Se han corregido dos valores: 7,82 con 7,81 y 4,60 con 4,61.
  24. " Distribución Chi-cuadrado | Tutorial de R" . www.r-tutor.com
  25. 1 2 Hald 1998 , pp. 633–692, 27. Distribuciones de muestreo bajo normalidad.
  26. FR Helmert , " Ueber die Wahrscheinlichkeit der Potenzsummen der Beobachtungsfehler und über einige damit im Zusammenhange stehende Fragen ", Zeitschrift für Mathematik und Physik 21 , 1876, págs.
  27. RL Plackett, Karl Pearson y la prueba de chi-cuadrado , International Statistical Review, 1983, 61 y ss. Véase también Jeff Miller, Primeros usos conocidos de algunas palabras de las matemáticas .

Fuentes

  • Hald, Anders (1998). Historia de la estadística matemática desde 1750 hasta 1930. Nueva York: Wiley. ISBN 978-0-471-17912-2.
  • Elderton, William Palin (1902). "Tablas para probar la bondad de ajuste de la teoría a la observación" . Biometrika . 1 (2): 155– 163. doi : 10.1093/biomet/1.2.155 .
  • Pearson, Karl (1914). "Sobre la probabilidad de que dos distribuciones independientes de frecuencia sean realmente muestras de la misma población, con especial referencia a trabajos recientes sobre la identidad de cepas de tripanosomas". Biometrika . 10 : 85–154 . doi : 10.1093/biomet/10.1.85 .

Lecturas adicionales

  • Clay, Henry (1852). Guía para expertos sobre la prueba de chi-cuadrado (Probabilidad y estadística) . Washington, DC: Ashland. ISBN 978-0-060173-22-7.{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda )
  • "Distribución chi-cuadrado" , Enciclopedia de Matemáticas , EMS Press , 2001 [1994]
  • Primeros usos de algunos términos matemáticos: la entrada sobre chi cuadrado tiene una breve historia.
  • Apuntes del curso sobre la prueba de bondad de ajuste de chi-cuadrado de la asignatura Estadística 101 de la Universidad de Yale.
  • Demostración en Mathematica que muestra la distribución muestral chi-cuadrado de varias estadísticas, por ejemplo, Σ x ², para una población normal.
  • Algoritmo sencillo para aproximar la función de distribución acumulada (FDA) y la función de distribución acumulada inversa (FDA inversa) para la distribución chi-cuadrado con una calculadora de bolsillo.
  • Valores de la distribución chi-cuadrado