Articulo de referencia

Teorema de Cochran

En estadística , el teorema de Cochran , ideado por William G. Cochran , [ 1 ] es un teorema que se utiliza para justificar los resultados relacionados con las distribuciones de...

En estadística , el teorema de Cochran , ideado por William G. Cochran , [ 1 ] es un teorema que se utiliza para justificar los resultados relacionados con las distribuciones de probabilidad de las estadísticas que se utilizan en el análisis de varianza . [ 2 ]

Declaración

DejarU1,,Unorte{\displaystyle U_{1},\cdots ,U_{N}}sean variables aleatorias independientes e idénticamente distribuidas con distribución normal estándar , yU=[U1,...,Unorte]T{\displaystyle U=[U_{1},...,U_{N}]^{T}}. DejarB(1),B(2),,B(k){\displaystyle B^{(1)},B^{(2)},\ldots ,B^{(k)}}sean matrices simétricas . Definimos r i como el rango deB(i){\displaystyle B^{(i)}}. DefinirQi=UTB(i)U{\displaystyle Q_{i}=U^{T}B^{(i)}U}, de modo que las Q i son formas cuadráticas . Supongamos además queiQi=UTU{\displaystyle \sum _{i}Q_{i}=U^{T}U}.

El teorema de Cochran establece que lo siguiente es equivalente:

A menudo se dice comoiAi=A{\displaystyle \sum _{i}A_{i}=A}, dóndeA{\displaystyle A}es idempotente yiri=norte{\displaystyle \sum _{i}r_{i}=N}es reemplazado poriri=rango(A){\displaystyle \sum _{i}r_{i}=\operatorname {rank} (A)}. Pero después de una transformación ortogonal,A=diagnóstico(IMETRO,0){\displaystyle A=\operatorname {diag} (I_{M},0)}, y así nos reducimos al teorema anterior. Aquí,diagnóstico{\displaystyle \operatorname {diag} }denota la transformación diagonal.

Formulación alternativa

La siguiente versión se ve a menudo al considerar la regresión lineal. [ 4 ] Supongamos queYnortenorte(0,σ2Inorte){\displaystyle Y\sim N_{n}(0,\sigma ^{2}I_{n})}es un vector aleatorio normal multivariado estándar (aquíInorte{\displaystyle I_{n}}denota la matriz identidad de n por n ), y siA1,,Ak{\displaystyle A_{1},\ldots ,A_{k}}son todas matrices simétricas n por n coni=1kAi=Inorte{\displaystyle \sum _{i=1}^{k}A_{i}=I_{n}}. Luego, al definirri=rango(Ai){\displaystyle r_{i}=\operatorname {rank} (A_{i})}Cualquiera de las siguientes condiciones implica las otras dos:

  • i=1kri=norte,{\displaystyle \sum _{i=1}^{k}r_{i}=n,}
  • YTAiYσ2χri2{\displaystyle Y^{T}A_{i}Y\sim \sigma ^{2}\chi _{r_{i}}^{2}} (por lo tanto elAi{\displaystyle A_{i}}son semidefinidas positivas )
  • YTAiY{\displaystyle Y^{T}A_{i}Y}es independiente deYTAjY{\displaystyle Y^{T}A_{j}Y}paraij.{\displaystyle i\neq j.}

Ejemplos

Media muestral y varianza muestral

Si X 1 , ..., X n son variables aleatorias independientes con distribución normal, media μ y desviación estándar σ, entonces

Ui=incógnitaiμσ{\displaystyle U_{i}={\frac {X_{i}-\mu }{\sigma }}}

es normal estándar para cada i . Nótese que el Q total es igual a la suma de los cuadrados de U como se muestra aquí:

iQi=jikUjBjk(i)Uk=jkUjUkiBjk(i)=jkUjUkδjk=jUj2{\displaystyle \sum _{i}Q_{i}=\sum _{jik}U_{j}B_{jk}^{(i)}U_{k}=\sum _{jk}U_{j}U_{k}\sum _{i}B_{jk}^{(i)}=\sum _{jk}U_{j}U_{k}\delta _{jk}=\sum _{j}U_{j}^{2}}

lo cual se deriva de la suposición original de queB1+B2=I{\displaystyle B_{1}+B_{2}\ldots =I}. Entonces, en su lugar, calcularemos esta cantidad y luego la separaremos en Q i . Es posible escribir

i=1norteUi2=i=1norte(incógnitaiincógnita¯σ)2+norte(incógnita¯μσ)2{\displaystyle \sum _{i=1}^{n}U_{i}^{2}=\sum _{i=1}^{n}\left({\frac {X_{i}-{\overline {X}}}{\sigma }}\right)^{2}+n\left({\frac {{\overline {X}}-\mu }{\sigma }}\right)^{2}}

(aquíincógnita¯{\displaystyle {\overline {X}}}es la media muestral ). Para ver esta identidad, multiplique todo porσ2{\displaystyle \sigma ^{2}}y tenga en cuenta que

(incógnitaiμ)2=(incógnitaiincógnita¯+incógnita¯μ)2{\displaystyle \sum (X_{i}-\mu )^{2}=\sum (X_{i}-{\overline {X}}+{\overline {X}}-\mu )^{2}}

y expandirse para dar

(incógnitaiμ)2=(incógnitaiincógnita¯)2+(incógnita¯μ)2+2(incógnitaiincógnita¯)(incógnita¯μ).{\displaystyle \sum (X_{i}-\mu )^{2}=\sum (X_{i}-{\overline {X}})^{2}+\sum ({\overline {X}}-\mu )^{2}+2\sum (X_{i}-{\overline {X}})({\overline {X}}-\mu ).}

El tercer término es cero porque es igual a una constante por

(incógnita¯incógnitai)=0,{\displaystyle \sum ({\overline {X}}-X_{i})=0,}

y el segundo término tiene simplemente n términos idénticos sumados. Por lo tanto

(incógnitaiμ)2=(incógnitaiincógnita¯)2+norte(incógnita¯μ)2,{\displaystyle \sum (X_{i}-\mu )^{2}=\sum (X_{i}-{\overline {X}})^{2}+n({\overline {X}}-\mu )^{2},}

y por lo tanto

(incógnitaiμσ)2=(incógnitaiincógnita¯σ)2+norte(incógnita¯μσ)2=i(Ui1nortejUj)2Q1+1norte(jUj)2Q2=Q1+Q2.{\displaystyle \sum \left({\tfrac {X_{i}-\mu }{\sigma }}\right)^{2}=\sum \left({\tfrac {X_{i}-{\overline {X}}}{\sigma }}\right)^{2}+n\left({\tfrac {{\overline {X}}-\mu }{\sigma }}\right)^{2}=\overbrace {\sum _{i}\left(U_{i}-{\tfrac {1}{n}}\sum _{j}{U_{j}}\right)^{2}} ^{Q_{1}}+\overbrace {{\tfrac {1}{n}}\left(\sum _{j}{U_{j}}\right)^{2}} ^{Q_{2}}=Q_{1}+Q_{2}.}

AhoraB(2)=Jnortenorte{\displaystyle B^{(2)}={\frac {J_{n}}{n}}}conJnorte{\displaystyle J_{n}}la matriz de unos que tiene rango 1. A su vez B(1)=InorteJnortenorte{\displaystyle B^{(1)}=I_{n}-{\frac {J_{n}}{n}}}dado queInorte=B(1)+B(2){\displaystyle I_{n}=B^{(1)}+B^{(2)}}Esta expresión también se puede obtener mediante expansión.Q1{\displaystyle Q_{1}}en notación matricial. Se puede demostrar que el rango deB(1){\displaystyle B^{(1)}}esnorte1{\displaystyle n-1}ya que la suma de todas sus filas es igual a cero. Por lo tanto, se cumplen las condiciones del teorema de Cochran.

El teorema de Cochran establece que Q1 y Q2 son independientes, con distribuciones chi-cuadrado con n 1 y 1 grado de libertad respectivamente. Esto demuestra que la media muestral y la varianza muestral son independientes. Esto también se puede demostrar mediante el teorema de Basu , y de hecho esta propiedad caracteriza la distribución normal, ya que en ninguna otra distribución la media muestral y la varianza muestral son independientes. [ 5 ]

Distribuciones

El resultado de las distribuciones se escribe simbólicamente como

(incógnitaiincógnita¯)2σ2χnorte12.{\displaystyle \sum \left(X_{i}-{\overline {X}}\right)^{2}\sim \sigma ^{2}\chi _{n-1}^{2}.}
norte(incógnita¯μ)2σ2χ12,{\displaystyle n({\overline {X}}-\mu )^{2}\sim \sigma ^{2}\chi _{1}^{2},}

Ambas variables aleatorias son proporcionales a la varianza verdadera pero desconocida σ² . Por lo tanto , su razón no depende de σ² y, dado que son estadísticamente independientes, la distribución de su razón viene dada por :

norte(incógnita¯μ)21norte1(incógnitaiincógnita¯)2χ121norte1χnorte12F1,norte1{\displaystyle {\frac {n\left({\overline {X}}-\mu \right)^{2}}{{\frac {1}{n-1}}\sum \left(X_{i}-{\overline {X}}\right)^{2}}}\sim {\frac {\chi _{1}^{2}}{{\frac {1}{n-1}}\chi _{n-1}^{2}}}\sim F_{1,n-1}}

donde F 1, n 1   es la distribución F con 1 y n 1 grados de libertad (véase también la distribución t de Student ). El último paso consiste, en efecto, en la definición de una variable aleatoria que sigue la distribución F.  

Estimación de la varianza

Para estimar la varianza σ² , un estimador que a veces se utiliza es el estimador de máxima verosimilitud de la varianza de una distribución normal .

σ^2=1norte(incógnitaiincógnita¯)2.{\displaystyle {\widehat {\sigma }}^{2}={\frac {1}{n}}\sum \left(X_{i}-{\overline {X}}\right)^{2}.}

El teorema de Cochran demuestra que

norteσ^2σ2χnorte12{\displaystyle {\frac {n{\widehat {\sigma }}^{2}}{\sigma ^{2}}}\sim \chi _{n-1}^{2}}

y las propiedades de la distribución chi-cuadrado muestran que

mi(norteσ^2σ2)=mi(χnorte12)norteσ2mi(σ^2)=(norte1)mi(σ^2)=σ2(norte1)norte{\displaystyle {\begin{aligned}E\left({\frac {n{\widehat {\sigma }}^{2}}{\sigma ^{2}}}\right)&=E\left(\chi _{n-1}^{2}\right)\\{\frac {n}{\sigma ^{2}}}E\left({\widehat {\sigma }}^{2}\right)&=(n-1)\\E\left({\widehat {\sigma }}^{2}\right)&={\frac {\sigma ^{2}(n-1)}{n}}\end{aligned}}}

Prueba

Reclamación : Dejarincógnita{\displaystyle X}ser una gaussiana estándar enRnorte{\displaystyle \mathbb {R} ^{n}}, entonces para cualquier matriz simétricaQ,Q{\displaystyle Q,Q'}, siincógnitaTQincógnita{\displaystyle X^{T}QX}yincógnitaTQincógnita{\displaystyle X^{T}Q'X}tienen la misma distribución, entoncesQ,Q{\displaystyle Q,Q'}tienen los mismos autovalores (salvo multiplicidad).

Prueba

Sean los valores propios deQ{\displaystyle Q}serλ1,...,λnorte{\displaystyle \lambda _{1},...,\lambda _{n}}, luego calcula la función característica deincógnitaTQincógnita{\displaystyle X^{T}QX}Resulta que

ϕ(t)=(j(12iλjt))1/2{\displaystyle \phi (t)=\left(\prod _{j}(1-2i\lambda _{j}t)\right)^{-1/2}}

(Para calcularlo, primero diagonalice)Q{\displaystyle Q}(cambiar a ese marco de referencia y luego usar el hecho de que la función característica de la suma de variables independientes es el producto de sus funciones características).

ParaincógnitaTQincógnita{\displaystyle X^{T}QX}yincógnitaTQincógnita{\displaystyle X^{T}Q'X}Para ser iguales, sus funciones características deben ser iguales, por lo tantoQ,Q{\displaystyle Q,Q'}tienen los mismos autovalores (salvo multiplicidad).

Afirmar :I=iBi{\displaystyle I=\sum _{i}B_{i}}.

Prueba

UT(IiBi)U=0{\displaystyle U^{T}(I-\sum _{i}B_{i})U=0}. Desde(IiBi){\displaystyle (I-\sum _{i}B_{i})}es simétrico yUT(IiBi)U=dUT0U{\displaystyle U^{T}(I-\sum _{i}B_{i})U=^{d}U^{T}0U}, por la afirmación anterior,(IiBi){\displaystyle (I-\sum _{i}B_{i})}tiene los mismos valores propios que 0.

Lema : SiiMETROi=I{\displaystyle \sum _{i}M_{i}=I}, todoMETROi{\displaystyle M_{i}}Si son simétricas y tienen valores propios 0 y 1, entonces son diagonalizables simultáneamente.

Prueba

Fijemos i y consideremos los autovectores v deMETROi{\displaystyle M_{i}}de tal manera queMETROiv=v{\displaystyle M_{i}v=v}. Entonces tenemosvTv=vTIv=vTv+jivTMETROjv{\displaystyle v^{T}v=v^{T}Iv=v^{T}v+\sum _{j\neq i}v^{T}M_{j}v}Observamos que elMETROj{\displaystyle M_{j}}s son semidefinidas positivas, ya que sus autovectores son todos no negativos; por lo tanto, para todoj{\displaystyle j}debemos tenervTMETROjv=0{\displaystyle v^{T}M_{j}v=0}. Así obtenemos una división deRnorte{\displaystyle \mathbb {R} ^{N}}enVV{\displaystyle V\oplus V^{\perp }}, de tal manera que el 1-espacio propioV{\displaystyle V}deMETROi{\displaystyle M_{i}}está contenido en los espacios propios 0 deMETROj{\displaystyle M_{j}}paraji{\displaystyle j\neq i}. Ahora induzca moviéndose haciaV{\displaystyle V^{\perp }}. SiMETROi0{\displaystyle M_{i}\neq 0}a pesar dei{\displaystyle i}s, entonces una base diagonalizando simultáneamente cadaMETROi{\displaystyle M_{i}}es dado por(v1,1,,vr1,1,,v1,k,,vrk,k){\displaystyle (v_{1,1},\dots ,v_{r_{1},1},\dots ,v_{1,k},\dots ,v_{r_{k},k})}, dónde(v1,i,,vri,i){\displaystyle (v_{1,i},\dots ,v_{r_{i},i})}es una base del 1-espacio propio deMETROi{\displaystyle M_{i}}.

Ahora demostramos el teorema original. Demostramos que los tres casos son equivalentes demostrando que cada caso implica el siguiente en un ciclo (1231{\displaystyle 1\to 2\to 3\to 1}).

Prueba

Caso : TodosQi{\displaystyle Q_{i}}son independientes

Arregla algunosi{\displaystyle i}, definirdoi=IBi=jiBj{\displaystyle C_{i}=I-B_{i}=\sum _{j\neq i}B_{j}}y diagonalizarBi{\displaystyle B_{i}}mediante una transformación ortogonalO{\displaystyle O}. Entonces considereOdoiOT=IOBiOT{\displaystyle OC_{i}O^{T}=I-OB_{i}O^{T}}También está diagonalizado.

DejarW=OU{\displaystyle W=OU}, entonces también es gaussiana estándar. Entonces tenemos

Qi=WT(OBiOT)W;jiQj=WT(IOBiOT)W{\displaystyle Q_{i}=W^{T}(OB_{i}O^{T})W;\quad \sum _{j\neq i}Q_{j}=W^{T}(I-OB_{i}O^{T})W}

Inspeccione sus entradas diagonales para ver queQijiQj{\displaystyle Q_{i}\perp \sum _{j\neq i}Q_{j}}implica que sus entradas diagonales no nulas son disjuntas.

Por lo tanto, todos los valores propios deBi{\displaystyle B_{i}}son 0, 1, así queQi{\displaystyle Q_{i}}es unχ2{\displaystyle \chi ^{2}}distribución conri{\displaystyle r_{i}}grados de libertad.

Caso : CadaQi{\displaystyle Q_{i}}es unχ2(ri){\displaystyle \chi ^{2}(r_{i})}distribución.

Reparar cualquieri{\displaystyle i}diagonalízalo mediante una transformación ortogonal.O{\displaystyle O}y reindexar, de modo queOBiOT=diagramo(λ1,...,λri,0,...,0){\displaystyle OB_{i}O^{T}=diag(\lambda _{1},...,\lambda _{r_{i}},0,...,0)}. EntoncesQi=jλjUj2{\displaystyle Q_{i}=\sum _{j}\lambda _{j}{U'}_{j}^{2}}para algunosUj{\displaystyle U'_{j}}, una rotación esférica deUi{\displaystyle U_{i}}.

DesdeQiχ2(ri){\displaystyle Q_{i}\sim \chi ^{2}(r_{i})}, obtenemos todoλj=1{\displaystyle \lambda _{j}=1}. Así que todosBi0{\displaystyle B_{i}\succeq 0}y tienen valores propios0,1{\displaystyle 0,1}.

Entonces diagonalízalos simultáneamente, súmalos, para encontrariri=norte{\displaystyle \sum _{i}r_{i}=N}.

Caso :r1++rk=norte{\displaystyle r_{1}+\cdots +r_{k}=N}.

Primero demostramos que las matrices B ( i ) pueden diagonalizarse simultáneamente mediante una matriz ortogonal y que sus autovalores no nulos son todos iguales a +1. Una vez demostrado esto, aplicamos esta transformación ortogonal a esta base de autovalores simultáneos , en la que el vector aleatorio[U1,...,Unorte]T{\displaystyle [U_{1},...,U_{N}]^{T}}se convierte[U1,...,Unorte]T{\displaystyle [U'_{1},...,U'_{N}]^{T}}pero todosUi{\displaystyle U_{i}'}siguen siendo independientes y gaussianas estándar. Entonces se obtiene el resultado.

Cada una de las matrices B ( i ) tiene rango r i y, por lo tanto , r i autovalores distintos de cero . Para cada i , la sumado(i)jiB(j){\displaystyle C^{(i)}\equiv \sum _{j\neq i}B^{(j)}}tiene como máximo rangojirj=norteri{\displaystyle \sum _{j\neq i}r_{j}=N-r_{i}}. DesdeB(i)+do(i)=Inorte×norte{\displaystyle B^{(i)}+C^{(i)}=I_{N\times N}}, de ello se deduce que C ( i ) tiene exactamente rango N r i .  

Por lo tanto, B ( i ) y C ( i ) pueden diagonalizarse simultáneamente . Esto se puede demostrar diagonalizando primero B ( i ) mediante el teorema espectral . En esta base, tiene la forma:

[λ10000λ20000λri00000].{\displaystyle {\begin{bmatrix}\lambda _{1}&0&0&\cdots &\cdots &&0\\0&\lambda _{2}&0&\cdots &\cdots &&0\\0&0&\ddots &&&&\vdots \\\vdots &\vdots &&\lambda _{r_{i}}&&\\\vdots &\vdots &&&0&\\0&\vdots &&&&\ddots \\0&0&\ldots &&&&0\end{bmatrix}}.}

Por lo tanto, el menor(norteri){\displaystyle (N-r_{i})}Las filas son cero. Dado quedo(i)=IB(i){\displaystyle C^{(i)}=I-B^{(i)}}, se deduce que estas filas en C ( i ) en esta base contienen un bloque derecho que es un(norteri)×(norteri){\displaystyle (N-r_{i})\times (N-r_{i})}matriz identidad, con ceros en el resto de estas filas. Pero como C ( i ) tiene rango N r i , debe ser cero en cualquier otro lugar. Por lo tanto, también es diagonal en esta base. De ello se deduce que todos los autovalores no nulos de B ( i ) y C ( i ) son +1. Este argumento se aplica a todo i , por lo que todas las B ( i ) son semidefinidas positivas.  

Además, el análisis anterior puede repetirse en la base diagonal parado(1)=B(2)+j>2B(j){\displaystyle C^{(1)}=B^{(2)}+\sum _{j>2}B^{(j)}}. Sobre esta basedo(1){\displaystyle C^{(1)}}es la identidad de un(norter1)×(norter1){\displaystyle (N-r_{1})\times (N-r_{1})}espacio vectorial, por lo que se deduce que tanto B (2) comoj>2B(j){\displaystyle \sum _{j>2}B^{(j)}}son simultáneamente diagonalizables en este espacio vectorial (y por lo tanto también junto con B (1) ). Por iteración se deduce que todos los B son simultáneamente diagonalizables.

Por lo tanto, existe una matriz ortogonal.S{\displaystyle S}de tal manera que para todosi{\displaystyle i},STB(i)SB(i){\displaystyle S^{\mathrm {T} }B^{(i)}S\equiv B^{(i)\prime }}es diagonal, donde cualquier entradaBincógnita,y(i){\displaystyle B_{x,y}^{(i)\prime }}con índicesincógnita=y{\displaystyle x=y},j=1i1rj<incógnita=yj=1irj{\displaystyle \sum _{j=1}^{i-1}r_{j}<x=y\leq \sum _{j=1}^{i}r_{j}}, es igual a 1, mientras que cualquier entrada con otros índices es igual a 0.

Véase también

Referencias

  1. 1 2 Cochran, WG (abril de 1934). "La distribución de formas cuadráticas en un sistema normal, con aplicaciones al análisis de covarianza". Actas Matemáticas de la Sociedad Filosófica de Cambridge . 30 (2): 178– 191. Bibcode : 1934PCPS...30..178C . doi : 10.1017/S0305004100016595 .
  2. Bapat, RB (2000). Álgebra lineal y modelos lineales (Segunda ed.). Springer. ISBN  978-0-387-98871-9.
  3. Upton, Graham; Cook, Ian (1 de enero de 2008), "Teorema de Cochran" , Diccionario de Estadística , Oxford University Press, doi : 10.1093/acref/9780199541454.001.0001 , ISBN 978-0-19-954145-4, consultado el 18 de mayo de 2022
  4. "Teorema de Cochran (Un tutorial rápido)" (PDF) .
  5. Geary, RC (1936). "La distribución de la razón de Student para muestras no normales". Suplemento del Journal of the Royal Statistical Society . 3 (2): 178– 184. doi : 10.2307/2983669 . JFM 63.1090.03 . JSTOR 2983669 .