Articulo de referencia

Función de varianza

En estadística , la función de varianza es una función suave que describe la varianza de una cantidad aleatoria como una función de su media . La función de varianza es una medi...

En estadística , la función de varianza es una función suave que describe la varianza de una cantidad aleatoria como una función de su media . La función de varianza es una medida de heterocedasticidad y juega un papel importante en muchos contextos de modelado estadístico. Es un ingrediente principal en el marco del modelo lineal generalizado y una herramienta utilizada en regresión no paramétrica , [ 1 ] regresión semiparamétrica [ 1 ] y análisis de datos funcionales . [ 2 ] En el modelado paramétrico, las funciones de varianza toman una forma paramétrica y describen explícitamente la relación entre la varianza y la media de una cantidad aleatoria. En un contexto no paramétrico, se supone que la función de varianza es una función suave .

Intuición

En un modelo de regresión, el objetivo es determinar si existe una relación entre una variable de respuesta y un conjunto de variables predictoras. Si existe dicha relación, el objetivo es describirla de la mejor manera posible. Un supuesto fundamental en la regresión lineal es la varianza constante (o homocedasticidad), lo que significa que las diferentes variables de respuesta presentan la misma varianza en sus errores, en cada nivel de las variables predictoras. Este supuesto funciona bien cuando la variable de respuesta y la variable predictora siguen una distribución normal conjunta . Como veremos más adelante, la función de varianza en el contexto de la distribución normal es constante; sin embargo, debemos encontrar una manera de cuantificar la heterocedasticidad (varianza no constante) en ausencia de normalidad conjunta.

Cuando es probable que la respuesta siga una distribución exponencial, un modelo lineal generalizado puede ser más apropiado. Además, si no deseamos imponer un modelo paramétrico a nuestros datos, un enfoque de regresión no paramétrica puede resultar útil. La importancia de poder modelar la varianza en función de la media radica en la mejora de la inferencia (en un contexto paramétrico) y, en general, en la estimación de la función de regresión, para cualquier situación.

Las funciones de varianza desempeñan un papel muy importante en la estimación e inferencia de parámetros. En general, la estimación de máxima verosimilitud requiere la definición de una función de verosimilitud. Este requisito implica que primero se debe especificar la distribución de las variables de respuesta observadas. Sin embargo, para definir una cuasi-verosimilitud, basta con especificar una relación entre la media y la varianza de las observaciones para poder utilizar la función de cuasi-verosimilitud en la estimación. [ 3 ] La estimación de cuasi-verosimilitud es particularmente útil cuando existe sobredispersión . La sobredispersión se produce cuando hay más variabilidad en los datos de la que cabría esperar según la distribución supuesta de los datos.

En resumen, para garantizar una inferencia eficiente de los parámetros de regresión y la función de regresión, es necesario tener en cuenta la heterocedasticidad. Las funciones de varianza cuantifican la relación entre la varianza y la media de los datos observados y, por lo tanto, desempeñan un papel importante en la estimación e inferencia de la regresión.

Tipos

La función de varianza y sus aplicaciones aparecen en muchas áreas del análisis estadístico. Un uso muy importante de esta función se encuentra en el marco de los modelos lineales generalizados y la regresión no paramétrica .

Modelo lineal generalizado

Cuando se ha especificado un miembro de la familia exponencial , la función de varianza se puede derivar fácilmente. [ 4 ] : 29 Se presenta la forma general de la función de varianza en el contexto de la familia exponencial, así como formas específicas para las distribuciones Normal, Bernoulli, Poisson y Gamma. Además, se describen las aplicaciones y el uso de las funciones de varianza en la estimación de máxima verosimilitud y la estimación de cuasi-verosimilitud.

Derivación

El modelo lineal generalizado (GLM) es una generalización del análisis de regresión convencional que se extiende a cualquier miembro de la familia exponencial . Resulta especialmente útil cuando la variable de respuesta es categórica, binaria o está sujeta a una restricción (por ejemplo, solo tienen sentido las respuestas positivas). En esta página se presenta un resumen de los componentes de un GLM, pero para obtener más detalles e información, consulte la página sobre modelos lineales generalizados .

Un GLM consta de tres ingredientes principales:

1. Componente aleatorio: una distribución de y de la familia exponencial,mi[yincógnita]=μ{\displaystyle E[y\mid X]=\mu }
2. Predictor lineal: η=incógnitaB=j=1pagincógnitaijTBj{\displaystyle \eta =XB=\sum _{j=1}^{p}X_{ij}^{T}B_{j}}
3. Función de enlace:η=gramo(μ),μ=gramo1(η){\displaystyle \eta =g(\mu ),\mu =g^{-1}(\eta )}

En primer lugar, es importante deducir un par de propiedades clave de la familia exponencial.

Cualquier variable aleatoriay{\displaystyle {\textit {y}}}en la familia exponencial tiene una función de densidad de probabilidad de la forma,

F(y,θ,ϕ)=exp(yθb(θ)ϕdo(y,ϕ)){\displaystyle f(y,\theta ,\phi )=\exp \left({\frac {y\theta -b(\theta )}{\phi }}-c(y,\phi )\right)}

con log-verosimilitud,

(θ,y,ϕ)=registro(F(y,θ,ϕ))=yθb(θ)ϕdo(y,ϕ){\displaystyle \ell (\theta ,y,\phi )=\log(f(y,\theta ,\phi ))={\frac {y\theta -b(\theta )}{\phi }}-c(y,\phi )}

Aquí,θ{\displaystyle \theta }es el parámetro canónico y el parámetro de interés, yϕ{\displaystyle \phi }es un parámetro de perturbación que juega un papel en la varianza. Usamos las identidades de Bartlett para derivar una expresión general para la función de varianza . El primer y segundo resultado de Bartlett aseguran que bajo condiciones adecuadas (ver regla integral de Leibniz ), para una función de densidad que depende deθ,Fθ(){\displaystyle \theta ,f_{\theta }()},

miθ[θregistro(Fθ(y))]=0{\displaystyle \operatorname {E} _{\theta }\left[{\frac {\partial }{\partial \theta }}\log(f_{\theta }(y))\right]=0}
Varθ[θregistro(Fθ(y))]+miθ[2θ2registro(Fθ(y))]=0{\displaystyle \operatorname {Var} _{\theta }\left[{\frac {\partial }{\partial \theta }}\log(f_{\theta }(y))\right]+\operatorname {E} _{\theta }\left[{\frac {\partial ^{2}}{\partial \theta ^{2}}}\log(f_{\theta }(y))\right]=0}

Estas identidades permiten realizar cálculos sencillos del valor esperado y la varianza de cualquier variable aleatoria.y{\displaystyle {\textit {y}}}en la familia exponencialmiθ[y],Varθ[y]{\displaystyle E_{\theta }[y],Var_{\theta }[y]}.

Valor esperado de Y : Tomando la primera derivada con respecto aθ{\displaystyle \theta }del logaritmo de la densidad en la forma de la familia exponencial descrita anteriormente, tenemos

θregistro(F(y,θ,ϕ))=θ[yθb(θ)ϕdo(y,ϕ)]=yb(θ)ϕ{\displaystyle {\frac {\partial }{\partial \theta }}\log(f(y,\theta ,\phi ))={\frac {\partial }{\partial \theta }}\left[{\frac {y\theta -b(\theta )}{\phi }}-c(y,\phi )\right]={\frac {y-b'(\theta )}{\phi }}}

Luego, al tomar el valor esperado y establecerlo igual a cero, se obtiene:

miθ[yb(θ)ϕ]=miθ[y]b(θ)ϕ=0{\displaystyle \operatorname {E} _{\theta }\left[{\frac {y-b'(\theta )}{\phi }}\right]={\frac {\operatorname {E} _{\theta }[y]-b'(\theta )}{\phi }}=0}
miθ[y]=b(θ){\displaystyle \operatorname {E} _{\theta }[y]=b'(\theta )}

Varianza de Y: Para calcular la varianza utilizamos la segunda identidad de Bartlett,

Varθ[θ(yθb(θ)ϕdo(y,ϕ))]+miθ[2θ2(yθb(θ)ϕdo(y,ϕ))]=0{\displaystyle \operatorname {Var} _{\theta }\left[{\frac {\partial }{\partial \theta }}\left({\frac {y\theta -b(\theta )}{\phi }}-c(y,\phi )\right)\right]+\operatorname {E} _{\theta }\left[{\frac {\partial ^{2}}{\partial \theta ^{2}}}\left({\frac {y\theta -b(\theta )}{\phi }}-c(y,\phi )\right)\right]=0}
Varθ[yb(θ)ϕ]+miθ[b(θ)ϕ]=0{\displaystyle \operatorname {Var} _{\theta }\left[{\frac {y-b'(\theta )}{\phi }}\right]+\operatorname {E} _{\theta }\left[{\frac {-b''(\theta )}{\phi }}\right]=0}
Varθ[y]=b(θ)ϕ{\displaystyle \operatorname {Var} _{\theta }\left[y\right]=b''(\theta )\phi }

Ahora tenemos una relación entreμ{\displaystyle \mu }yθ{\displaystyle \theta }, es decir

μ=b(θ){\displaystyle \mu =b'(\theta )}yθ=b1(μ){\displaystyle \theta =b'^{-1}(\mu )}, lo que permite una relación entreμ{\displaystyle \mu }y la varianza,
V(θ)=b(θ)=la parte de la varianza que depende de θ{\displaystyle V(\theta )=b''(\theta )={\text{the part of the variance that depends on }}\theta }
V(μ)=b(b1(μ)).{\displaystyle \operatorname {V} (\mu )=b''(b'^{-1}(\mu )).\,}

Tenga en cuenta que porqueVarθ[y]>0,b(θ)>0{\displaystyle \operatorname {Var} _{\theta }\left[y\right]>0,b''(\theta )>0}, entoncesb:θμ{\displaystyle b':\theta \rightarrow \mu }es invertible. Derivamos la función de varianza para algunas distribuciones comunes.

Ejemplo – normal

La distribución normal es un caso especial donde la función de varianza es constante.ynorte(μ,σ2){\displaystyle y\sim N(\mu ,\sigma ^{2})}Luego, expresamos la función de densidad de y en la forma de la familia exponencial descrita anteriormente:

F(y)=exp(yμμ22σ2y22σ212ln2πσ2){\displaystyle f(y)=\exp \left({\frac {y\mu -{\frac {\mu ^{2}}{2}}}{\sigma ^{2}}}-{\frac {y^{2}}{2\sigma ^{2}}}-{\frac {1}{2}}\ln {2\pi \sigma ^{2}}\right)}

dónde

θ=μ,{\displaystyle \theta =\mu ,}
b(θ)=μ22,{\displaystyle b(\theta )={\frac {\mu ^{2}}{2}},}
ϕ=σ2,{\displaystyle \phi =\sigma ^{2},}
do(y,ϕ)=y22σ212ln2πσ2{\displaystyle c(y,\phi )=-{\frac {y^{2}}{2\sigma ^{2}}}-{\frac {1}{2}}\ln {2\pi \sigma ^{2}}}

Para calcular la función de varianzaV(μ){\displaystyle V(\mu )}, primero expresamosθ{\displaystyle \theta }como función deμ{\displaystyle \mu }Luego transformamosV(θ){\displaystyle V(\theta )}en una función deμ{\displaystyle \mu }

θ=μ{\displaystyle \theta =\mu }
b(θ)=θ=mi[y]=μ{\displaystyle b'(\theta )=\theta =\operatorname {E} [y]=\mu }
V(θ)=b(θ)=1{\displaystyle V(\theta )=b''(\theta )=1}

Por lo tanto, la función de varianza es constante.

Ejemplo – Bernoulli

DejaryBernoulli(pag){\displaystyle y\sim {\text{Bernoulli}}(p)}, luego expresamos la densidad de la distribución de Bernoulli en forma de familia exponencial,

F(y)=exp(ylnpag1pag+ln(1pag)){\displaystyle f(y)=\exp \left(y\ln {\frac {p}{1-p}}+\ln(1-p)\right)}
θ=lnpag1pag={\displaystyle \theta =\ln {\frac {p}{1-p}}=}logit (p), lo que nos dapag=miθ1+miθ={\displaystyle p={\frac {e^{\theta }}{1+e^{\theta }}}=}expit(θ){\displaystyle (\theta )}
b(θ)=ln(1+miθ){\displaystyle b(\theta )=\ln(1+e^{\theta })} y
b(θ)=miθ1+miθ={\displaystyle b'(\theta )={\frac {e^{\theta }}{1+e^{\theta }}}=}expit(θ)=pag=μ{\displaystyle (\theta )=p=\mu }
b(θ)=miθ1+miθ(miθ1+miθ)2{\displaystyle b''(\theta )={\frac {e^{\theta }}{1+e^{\theta }}}-\left({\frac {e^{\theta }}{1+e^{\theta }}}\right)^{2}}

Esto nos da

V(μ)=μ(1μ){\displaystyle V(\mu )=\mu (1-\mu )}

Ejemplo – Poisson

DejaryPoisson(λ){\displaystyle y\sim {\text{Poisson}}(\lambda )}, luego expresamos la densidad de la distribución de Poisson en forma de familia exponencial,

F(y)=exp(ylnλlnλ){\displaystyle f(y)=\exp(y\ln \lambda -\ln \lambda )}
θ=lnλ={\displaystyle \theta =\ln \lambda =}lo cual nos daλ=miθ{\displaystyle \lambda =e^{\theta }}
b(θ)=miθ{\displaystyle b(\theta )=e^{\theta }} y
b(θ)=miθ=λ=μ{\displaystyle b'(\theta )=e^{\theta }=\lambda =\mu }
b(θ)=miθ=μ{\displaystyle b''(\theta )=e^{\theta }=\mu }

Esto nos da

V(μ)=μ{\displaystyle V(\mu )=\mu }

Aquí vemos la propiedad central de los datos de Poisson: que la varianza es igual a la media.

Ejemplo – Gamma

La distribución gamma y la función de densidad pueden expresarse bajo diferentes parametrizaciones. Usaremos la forma de la gamma con parámetros(μ,ν){\displaystyle (\mu ,\nu )}

Fμ,ν(y)=1Γ(ν)y(νyμ)νmiνyμ{\displaystyle f_{\mu ,\nu }(y)={\frac {1}{\Gamma (\nu )y}}\left({\frac {\nu y}{\mu }}\right)^{\nu }e^{-{\frac {\nu y}{\mu }}}}

Entonces, en forma de familia exponencial, tenemos

Fμ,ν(y)=exp(1μy+ln(1μ)1ν+ln(ννyν1Γ(ν))){\displaystyle f_{\mu ,\nu }(y)=\exp \left({\frac {-{\frac {1}{\mu }}y+\ln({\frac {1}{\mu }})}{\frac {1}{\nu }}}+\ln \left({\frac {\nu ^{\nu }y^{\nu -1}}{\Gamma (\nu )}}\right)\right)}
θ=1μμ=1θ{\displaystyle \theta ={\frac {-1}{\mu }}\rightarrow \mu ={\frac {-1}{\theta }}}
ϕ=1ν{\displaystyle \phi ={\frac {1}{\nu }}}
b(θ)=ln(θ){\displaystyle b(\theta )=-\ln(-\theta )}
b(θ)=1θ=11μ=μ{\displaystyle b'(\theta )={\frac {-1}{\theta }}={\frac {-1}{\frac {-1}{\mu }}}=\mu }
b(θ)=1θ2=μ2{\displaystyle b''(\theta )={\frac {1}{\theta ^{2}}}=\mu ^{2}}

Y tenemosV(μ)=μ2{\displaystyle V(\mu )=\mu ^{2}}

Aplicación: mínimos cuadrados ponderados

Una aplicación muy importante de la función de varianza es su uso en la estimación e inferencia de parámetros cuando la variable de respuesta tiene la forma de la familia exponencial requerida, así como en algunos casos en los que no la tiene (lo que discutiremos en cuasi-verosimilitud ). Los mínimos cuadrados ponderados (WLS) son un caso especial de mínimos cuadrados generalizados. Cada término en el criterio WLS incluye un peso que determina la influencia de cada observación en las estimaciones finales de los parámetros. Al igual que en los mínimos cuadrados regulares, el objetivo es estimar los parámetros desconocidos en la función de regresión encontrando valores para las estimaciones de los parámetros que minimicen la suma de las desviaciones cuadráticas entre las respuestas observadas y la parte funcional del modelo.

Si bien el método de mínimos cuadrados ponderados (WLS) asume la independencia de las observaciones, no asume varianza igual y, por lo tanto, constituye una solución para la estimación de parámetros en presencia de heterocedasticidad. El teorema de Gauss-Markov y Aitken demuestran que el mejor estimador lineal insesgado (BLUE), el estimador insesgado con varianza mínima, tiene cada peso igual al recíproco de la varianza de la medición.

En el marco del GLM, nuestro objetivo es estimar los parámetros.β{\displaystyle \beta }, dóndeZ=gramo(mi[yincógnita])=incógnitaβ{\displaystyle Z=g(E[y\mid X])=X\beta }Por lo tanto, nos gustaría minimizar(ZincógnitaB)TW(ZincógnitaB){\displaystyle (Z-XB)^{T}W(Z-XB)}y si definimos la matriz de pesos W como

Wnorte×norte=[1ϕV(μ1)gramo(μ1)200001ϕV(μ2)gramo(μ2)20000001ϕV(μnorte)gramo(μnorte)2],{\displaystyle \underbrace {W} _{n\times n}={\begin{bmatrix}{\frac {1}{\phi V(\mu _{1})g'(\mu _{1})^{2}}}&0&\cdots &0&0\\0&{\frac {1}{\phi V(\mu _{2})g'(\mu _{2})^{2}}}&0&\cdots &0\\\vdots &\vdots &\vdots &\vdots &0\\\vdots &\vdots &\vdots &\vdots &0\\0&\cdots &\cdots &0&{\frac {1}{\phi V(\mu _{n})g'(\mu _{n})^{2}}}\end{bmatrix}},}

dóndeϕ,V(μ),gramo(μ){\displaystyle \phi ,V(\mu ),g(\mu )}Como se definió en la sección anterior, permite la estimación iterativa de mínimos cuadrados ponderados (IRLS) de los parámetros. Consulte la sección sobre mínimos cuadrados ponderados iterativos para obtener más información y detalles sobre su desarrollo.

Además, es importante señalar que cuando la matriz de pesos tiene la forma descrita aquí, minimizando la expresión(ZincógnitaB)TW(ZincógnitaB){\displaystyle (Z-XB)^{T}W(Z-XB)}También minimiza la distancia de Pearson. Consulte la sección Correlación de distancia para obtener más información.

La matriz W se obtiene directamente de las ecuaciones de estimación para la estimación deβ{\displaystyle \beta }Estimación de máxima verosimilitud para cada parámetroβr,1rpag{\displaystyle \beta _{r},1\leq r\leq p}, requiere

i=1norteliβr=0{\displaystyle \sum _{i=1}^{n}{\frac {\partial l_{i}}{\partial \beta _{r}}}=0}, dóndel(θ,y,ϕ)=registro(F(y,θ,ϕ))=yθb(θ)ϕdo(y,ϕ){\displaystyle \operatorname {l} (\theta ,y,\phi )=\log(\operatorname {f} (y,\theta ,\phi ))={\frac {y\theta -b(\theta )}{\phi }}-c(y,\phi )}es la log-verosimilitud.

Si observamos una sola observación, tenemos:

lβr=lθθμμηηβr{\displaystyle {\frac {\partial l}{\partial \beta _{r}}}={\frac {\partial l}{\partial \theta }}{\frac {\partial \theta }{\partial \mu }}{\frac {\partial \mu }{\partial \eta }}{\frac {\partial \eta }{\partial \beta _{r}}}}
ηβr=incógnitar{\displaystyle {\frac {\partial \eta }{\partial \beta _{r}}}=x_{r}}
lθ=yb(θ)ϕ=yμϕ{\displaystyle {\frac {\partial l}{\partial \theta }}={\frac {y-b'(\theta )}{\phi }}={\frac {y-\mu }{\phi }}}
θμ=b1(μ)μ=1b(b(μ))=1V(μ){\displaystyle {\frac {\partial \theta }{\partial \mu }}={\frac {\partial b'^{-1}(\mu )}{\mu }}={\frac {1}{b''(b'(\mu ))}}={\frac {1}{V(\mu )}}}

Esto nos da

lβr=yμϕV(μ)μηincógnitar{\displaystyle {\frac {\partial l}{\partial \beta _{r}}}={\frac {y-\mu }{\phi V(\mu )}}{\frac {\partial \mu }{\partial \eta }}x_{r}}y señalando que
ημ=gramo(μ){\displaystyle {\frac {\partial \eta }{\partial \mu }}=g'(\mu )}tenemos eso
lβr=(yμ)Wημincógnitar{\displaystyle {\frac {\partial l}{\partial \beta _{r}}}=(y-\mu )W{\frac {\partial \eta }{\partial \mu }}x_{r}}

La matriz hessiana se determina de manera similar y se puede demostrar que es:

H=incógnitaT(yμ)[βsWβr]incógnitaTWincógnita{\displaystyle H=X^{T}(y-\mu )\left[{\frac {\partial }{\beta _{s}}}W{\frac {\partial }{\beta _{r}}}\right]-X^{T}WX}

Observando que la información de Fisher (FI),

FI=mi[H]=incógnitaTWincógnita{\displaystyle {\text{FI}}=-E[H]=X^{T}WX}, permite la aproximación asintótica deβ^{\displaystyle {\hat {\beta }}}
β^nortepag(β,(incógnitaTWincógnita)1){\displaystyle {\hat {\beta }}\sim N_{p}(\beta ,(X^{T}WX)^{-1})}y, por lo tanto, se puede realizar la inferencia.

Aplicación – cuasi verosimilitud

Debido a que la mayoría de las características de los GLM solo dependen de los dos primeros momentos de la distribución, en lugar de la distribución completa, la cuasi-verosimilitud se puede desarrollar simplemente especificando una función de enlace y una función de varianza. Es decir, necesitamos especificar

  • la función de enlace,mi[y]=μ=gramo1(η){\displaystyle E[y]=\mu =g^{-1}(\eta )}
  • la función de varianza,V(μ){\displaystyle V(\mu )}, donde elVarθ(y)=σ2V(μ){\displaystyle \operatorname {Var} _{\theta }(y)=\sigma ^{2}V(\mu )}

Con una función de varianza y una función de enlace especificadas, podemos desarrollar, como alternativas a la función de log-verosimilitud , la función de puntuación y la información de Fisher , una cuasi-verosimilitud , una cuasi-puntuación y la cuasi-información . Esto permite una inferencia completa deβ{\displaystyle \beta }.

Cuasi-verosimilitud (QL)

Aunque se denomina cuasi-verosimilitud , en realidad se trata de una cuasi- log -verosimilitud. La QL para una observación es

Qi(μi,yi)=yiμiyitσ2V(t)dt{\displaystyle Q_{i}(\mu _{i},y_{i})=\int _{y_{i}}^{\mu _{i}}{\frac {y_{i}-t}{\sigma ^{2}V(t)}}\,dt}

Y por lo tanto, el QL para todas las n observaciones es

Q(μ,y)=i=1norteQi(μi,yi)=i=1norteyiμiytσ2V(t)dt{\displaystyle Q(\mu ,y)=\sum _{i=1}^{n}Q_{i}(\mu _{i},y_{i})=\sum _{i=1}^{n}\int _{y_{i}}^{\mu _{i}}{\frac {y-t}{\sigma ^{2}V(t)}}\,dt}

A partir del QL tenemos la cuasi-puntuación

Puntuación cuasi-puntuación (QS)

Recordemos la función de puntuación , U , para datos con log-verosimilitudl(μy){\displaystyle \operatorname {l} (\mu \mid y)}es

U=ldμ.{\displaystyle U={\frac {\partial l}{d\mu }}.}

Obtenemos la cuasi-puntuación de manera idéntica,

U=yμσ2V(μ){\displaystyle U={\frac {y-\mu }{\sigma ^{2}V(\mu )}}}

Observando que, para una observación, la puntuación es

Qμ=yμσ2V(μ){\displaystyle {\frac {\partial Q}{\partial \mu }}={\frac {y-\mu }{\sigma ^{2}V(\mu )}}}

Las dos primeras ecuaciones de Bartlett se satisfacen para la cuasi-puntuación, a saber:

mi[U]=0{\displaystyle E[U]=0}

y

Cov(U)+mi[Uμ]=0.{\displaystyle \operatorname {Cov} (U)+E\left[{\frac {\partial U}{\partial \mu }}\right]=0.}

Además, la cuasi-puntuación es lineal en y .

En última instancia, el objetivo es encontrar información sobre los parámetros de interés.β{\displaystyle \beta }. Tanto QS como QL son en realidad funciones deβ{\displaystyle \beta }. Recordar,μ=gramo1(η){\displaystyle \mu =g^{-1}(\eta )}, yη=incógnitaβ{\displaystyle \eta =X\beta }, por lo tanto,

μ=gramo1(incógnitaβ).{\displaystyle \mu =g^{-1}(X\beta ).}

Información cuasi-compleja (IC)

La cuasi-información es similar a la información de Fisher .

ib=mi[Uβ]{\displaystyle i_{b}=-\operatorname {E} \left[{\frac {\partial U}{\partial \beta }}\right]}

QL, QS, QI como funciones deβ{\displaystyle \beta }

QL, QS y QI proporcionan los bloques de construcción para la inferencia sobre los parámetros de interés y, por lo tanto, es importante expresar QL, QS y QI como funciones deβ{\displaystyle \beta }.

Recordando de nuevo queμ=gramo1(incógnitaβ){\displaystyle \mu =g^{-1}(X\beta )}, derivamos las expresiones para QL, QS y QI parametrizadas bajoβ{\displaystyle \beta }.

Cuasi verosimilitud enβ{\displaystyle \beta },

Q(β,y)=yμ(β)ytσ2V(t)dt{\displaystyle Q(\beta ,y)=\int _{y}^{\mu (\beta )}{\frac {y-t}{\sigma ^{2}V(t)}}\,dt}

El QS en función deβ{\displaystyle \beta }es por lo tanto

Uj(βj)=βjQ(β,y)=i=1norteμiβjyiμi(βj)σ2V(μi){\displaystyle U_{j}(\beta _{j})={\frac {\partial }{\partial \beta _{j}}}Q(\beta ,y)=\sum _{i=1}^{n}{\frac {\partial \mu _{i}}{\partial \beta _{j}}}{\frac {y_{i}-\mu _{i}(\beta _{j})}{\sigma ^{2}V(\mu _{i})}}}
U(β)=[U1(β)U2(β)Upag(β)]=DTV1(yμ)σ2{\displaystyle U(\beta )={\begin{bmatrix}U_{1}(\beta )\\U_{2}(\beta )\\\vdots \\\vdots \\U_{p}(\beta )\end{bmatrix}}=D^{T}V^{-1}{\frac {(y-\mu )}{\sigma ^{2}}}}

Dónde,

Dnorte×pag=[μ1β1μ1βpagμ2β1μ2βpagμmetroβ1μmetroβpag]Vnorte×norte=diagnóstico(V(μ1),V(μ2),,,V(μnorte)){\displaystyle \underbrace {D} _{n\times p}={\begin{bmatrix}{\frac {\partial \mu _{1}}{\partial \beta _{1}}}&\cdots &\cdots &{\frac {\partial \mu _{1}}{\partial \beta _{p}}}\\{\frac {\partial \mu _{2}}{\partial \beta _{1}}}&\cdots &\cdots &{\frac {\partial \mu _{2}}{\partial \beta _{p}}}\\\vdots \\\vdots \\{\frac {\partial \mu _{m}}{\partial \beta _{1}}}&\cdots &\cdots &{\frac {\partial \mu _{m}}{\partial \beta _{p}}}\end{bmatrix}}\underbrace {V} _{n\times n}=\operatorname {diag} (V(\mu _{1}),V(\mu _{2}),\ldots ,\ldots ,V(\mu _{n}))}

La matriz de cuasi-información enβ{\displaystyle \beta }es,

ib=Uβ=Cov(U(β))=DTV1Dσ2{\displaystyle i_{b}=-{\frac {\partial U}{\partial \beta }}=\operatorname {Cov} (U(\beta ))={\frac {D^{T}V^{-1}D}{\sigma ^{2}}}}

Obtención de la función de puntuación y la información deβ{\displaystyle \beta }permite la estimación de parámetros y la inferencia de manera similar a como se describe en Aplicación – mínimos cuadrados ponderados .

Análisis de regresión no paramétrica

Diagrama de dispersión que muestra los años en las ligas mayores en función del salario (en miles de dólares). La línea representa la tendencia de la media. El gráfico demuestra que la varianza no es constante.
La varianza condicional suavizada frente a la media condicional suavizada. La forma cuadrática es indicativa de la distribución Gamma. La función de varianza de una Gamma es V(μ{\displaystyle \mu }) =μ2{\displaystyle \mu ^{2}}

La estimación no paramétrica de la función de varianza y su importancia se han discutido ampliamente en la literatura [ 5 ] [ 6 ] [ 7 ] En el análisis de regresión no paramétrica , el objetivo es expresar el valor esperado de su variable de respuesta ( y ) como una función de sus predictores ( X ). Es decir, buscamos estimar una función media ,gramo(incógnita)=mi[yincógnita=incógnita]{\displaystyle g(x)=\operatorname {E} [y\mid X=x]}sin asumir una forma paramétrica. Existen muchas formas de métodos de suavizado no paramétricos para ayudar a estimar la función.gramo(incógnita){\displaystyle g(x)}. Un enfoque interesante es también observar una función de varianza no paramétrica ,gramov(incógnita)=Var(Yincógnita=incógnita){\displaystyle g_{v}(x)=\operatorname {Var} (Y\mid X=x)}Una función de varianza no paramétrica permite observar la función de media en relación con la función de varianza y detectar patrones en los datos.

gramov(incógnita)=Var(Yincógnita=incógnita)=mi[y2incógnita=incógnita][mi[yincógnita=incógnita]]2{\displaystyle g_{v}(x)=\operatorname {Var} (Y\mid X=x)=\operatorname {E} [y^{2}\mid X=x]-\left[\operatorname {E} [y\mid X=x]\right]^{2}}

Un ejemplo se detalla en las imágenes de la derecha. El objetivo del proyecto era determinar (entre otras cosas) si la variable predictora, el número de años en las ligas mayores (béisbol), tenía o no un efecto sobre la variable de respuesta, el salario , que percibía un jugador. Un diagrama de dispersión inicial de los datos indica que existe heterocedasticidad en los datos, ya que la varianza no es constante en cada nivel de la variable predictora. Dado que podemos detectar visualmente la varianza no constante, ahora resulta útil graficargramov(incógnita)=Var(Yincógnita=incógnita)=mi[y2incógnita=incógnita][mi[yincógnita=incógnita]]2{\displaystyle g_{v}(x)=\operatorname {Var} (Y\mid X=x)=\operatorname {E} [y^{2}\mid X=x]-\left[\operatorname {E} [y\mid X=x]\right]^{2}}y observar si la forma es indicativa de alguna distribución conocida. Se puede estimarmi[y2incógnita=incógnita]{\displaystyle \operatorname {E} [y^{2}\mid X=x]}y[mi[yincógnita=incógnita]]2{\displaystyle \left[\operatorname {E} [y\mid X=x]\right]^{2}}Utilizando un método de suavizado general , la gráfica de la función de varianza suavizada no paramétrica permite al investigador comprender la relación entre la varianza y la media. La imagen de la derecha muestra una relación cuadrática entre la media y la varianza. Como vimos anteriormente, la función de varianza Gamma es cuadrática con respecto a la media.

Notas

  1. 1 2 Muller y Zhao (1995). "Sobre un modelo de función de varianza semiparamétrico y una prueba de heterocedasticidad" . The Annals of Statistics . 23 (3): 946– 967. doi : 10.1214/aos/1176324630 . JSTOR 2242430 . 
  2. Muller, Stadtmuller y Yao (2006). "Procesos de varianza funcional". Journal of the American Statistical Association . 101 (475): 1007– 1018. doi : 10.1198/016214506000000186 . JSTOR 27590778. S2CID 13712496 .  
  3. Wedderburn, RWM (1974). "Funciones de cuasi-verosimilitud, modelos lineales generalizados y el método de Gauss-Newton". Biometrika . 61 (3): 439– 447. doi : 10.1093/biomet/61.3.439 . JSTOR 2334725 . 
  4. McCullagh, Peter; Nelder, John (1989). Modelos lineales generalizados (segunda ed.). Londres: Chapman and Hall. ISBN  0-412-31760-5.{{cite book}}: CS1 mantenimiento: ubicación del editor ( enlace )
  5. Muller y StadtMuller (1987). "Estimación de la heterocedasticidad en el análisis de regresión" . The Annals of Statistics . 15 (2): 610– 625. doi : 10.1214/aos/1176350364 . JSTOR 2241329 . 
  6. Cai y Wang, T.; Wang, Lie (2008). "Estimación adaptativa de la función de varianza en regresión no paramétrica heterocedástica". The Annals of Statistics . 36 (5): 2025– 2054. arXiv : 0810.4780 . Bibcode : 2008arXiv0810.4780C . doi : 10.1214/07-AOS509 . JSTOR 2546470 . S2CID 9184727 .  
  7. Rice y Silverman (1991). "Estimación de la media y la estructura de covarianza de forma no paramétrica cuando los datos son curvas". Journal of the Royal Statistical Society . 53 (1): 233– 243. JSTOR 2345738 . 

Referencias

  • McCullagh, Peter ; Nelder, John (1989). Modelos lineales generalizados (segunda  edición). Londres: Chapman and Hall. ISBN 0-412-31760-5.{{cite book}}: CS1 mantenimiento: ubicación del editor ( enlace )
  • Henrik Madsen y Poul Thyregod (2011). Introducción a los modelos lineales generales y generalizados . Chapman & Hall/CRC. ISBN 978-1-4200-9155-7.
  • Logotipo de Wikimedia CommonsContenido multimedia relacionado con la función de varianza en Wikimedia Commons.