En estadística , la función de varianza es una función suave que describe la varianza de una cantidad aleatoria como una función de su media . La función de varianza es una medida de heterocedasticidad y juega un papel importante en muchos contextos de modelado estadístico. Es un ingrediente principal en el marco del modelo lineal generalizado y una herramienta utilizada en regresión no paramétrica , [ 1 ] regresión semiparamétrica [ 1 ] y análisis de datos funcionales . [ 2 ] En el modelado paramétrico, las funciones de varianza toman una forma paramétrica y describen explícitamente la relación entre la varianza y la media de una cantidad aleatoria. En un contexto no paramétrico, se supone que la función de varianza es una función suave .
Intuición
En un modelo de regresión, el objetivo es determinar si existe una relación entre una variable de respuesta y un conjunto de variables predictoras. Si existe dicha relación, el objetivo es describirla de la mejor manera posible. Un supuesto fundamental en la regresión lineal es la varianza constante (o homocedasticidad), lo que significa que las diferentes variables de respuesta presentan la misma varianza en sus errores, en cada nivel de las variables predictoras. Este supuesto funciona bien cuando la variable de respuesta y la variable predictora siguen una distribución normal conjunta . Como veremos más adelante, la función de varianza en el contexto de la distribución normal es constante; sin embargo, debemos encontrar una manera de cuantificar la heterocedasticidad (varianza no constante) en ausencia de normalidad conjunta.
Cuando es probable que la respuesta siga una distribución exponencial, un modelo lineal generalizado puede ser más apropiado. Además, si no deseamos imponer un modelo paramétrico a nuestros datos, un enfoque de regresión no paramétrica puede resultar útil. La importancia de poder modelar la varianza en función de la media radica en la mejora de la inferencia (en un contexto paramétrico) y, en general, en la estimación de la función de regresión, para cualquier situación.
Las funciones de varianza desempeñan un papel muy importante en la estimación e inferencia de parámetros. En general, la estimación de máxima verosimilitud requiere la definición de una función de verosimilitud. Este requisito implica que primero se debe especificar la distribución de las variables de respuesta observadas. Sin embargo, para definir una cuasi-verosimilitud, basta con especificar una relación entre la media y la varianza de las observaciones para poder utilizar la función de cuasi-verosimilitud en la estimación. [ 3 ] La estimación de cuasi-verosimilitud es particularmente útil cuando existe sobredispersión . La sobredispersión se produce cuando hay más variabilidad en los datos de la que cabría esperar según la distribución supuesta de los datos.
En resumen, para garantizar una inferencia eficiente de los parámetros de regresión y la función de regresión, es necesario tener en cuenta la heterocedasticidad. Las funciones de varianza cuantifican la relación entre la varianza y la media de los datos observados y, por lo tanto, desempeñan un papel importante en la estimación e inferencia de la regresión.
Tipos
La función de varianza y sus aplicaciones aparecen en muchas áreas del análisis estadístico. Un uso muy importante de esta función se encuentra en el marco de los modelos lineales generalizados y la regresión no paramétrica .
Modelo lineal generalizado
Cuando se ha especificado un miembro de la familia exponencial , la función de varianza se puede derivar fácilmente. [ 4 ] : 29 Se presenta la forma general de la función de varianza en el contexto de la familia exponencial, así como formas específicas para las distribuciones Normal, Bernoulli, Poisson y Gamma. Además, se describen las aplicaciones y el uso de las funciones de varianza en la estimación de máxima verosimilitud y la estimación de cuasi-verosimilitud.
Derivación
El modelo lineal generalizado (GLM) es una generalización del análisis de regresión convencional que se extiende a cualquier miembro de la familia exponencial . Resulta especialmente útil cuando la variable de respuesta es categórica, binaria o está sujeta a una restricción (por ejemplo, solo tienen sentido las respuestas positivas). En esta página se presenta un resumen de los componentes de un GLM, pero para obtener más detalles e información, consulte la página sobre modelos lineales generalizados .
Un GLM consta de tres ingredientes principales:
- 1. Componente aleatorio: una distribución de y de la familia exponencial,
- 2. Predictor lineal:
- 3. Función de enlace:
En primer lugar, es importante deducir un par de propiedades clave de la familia exponencial.
Cualquier variable aleatoriaen la familia exponencial tiene una función de densidad de probabilidad de la forma,
con log-verosimilitud,
Aquí,es el parámetro canónico y el parámetro de interés, yes un parámetro de perturbación que juega un papel en la varianza. Usamos las identidades de Bartlett para derivar una expresión general para la función de varianza . El primer y segundo resultado de Bartlett aseguran que bajo condiciones adecuadas (ver regla integral de Leibniz ), para una función de densidad que depende de,
Estas identidades permiten realizar cálculos sencillos del valor esperado y la varianza de cualquier variable aleatoria.en la familia exponencial.
Valor esperado de Y : Tomando la primera derivada con respecto adel logaritmo de la densidad en la forma de la familia exponencial descrita anteriormente, tenemos
Luego, al tomar el valor esperado y establecerlo igual a cero, se obtiene:
Varianza de Y: Para calcular la varianza utilizamos la segunda identidad de Bartlett,
Ahora tenemos una relación entrey, es decir
- y, lo que permite una relación entrey la varianza,
Tenga en cuenta que porque, entonceses invertible. Derivamos la función de varianza para algunas distribuciones comunes.
Ejemplo – normal
La distribución normal es un caso especial donde la función de varianza es constante.Luego, expresamos la función de densidad de y en la forma de la familia exponencial descrita anteriormente:
dónde
Para calcular la función de varianza, primero expresamoscomo función deLuego transformamosen una función de
Por lo tanto, la función de varianza es constante.
Ejemplo – Bernoulli
Dejar, luego expresamos la densidad de la distribución de Bernoulli en forma de familia exponencial,
Esto nos da
Ejemplo – Poisson
Dejar, luego expresamos la densidad de la distribución de Poisson en forma de familia exponencial,
- lo cual nos da
- y
Esto nos da
Aquí vemos la propiedad central de los datos de Poisson: que la varianza es igual a la media.
Ejemplo – Gamma
La distribución gamma y la función de densidad pueden expresarse bajo diferentes parametrizaciones. Usaremos la forma de la gamma con parámetros
Entonces, en forma de familia exponencial, tenemos
Y tenemos
Aplicación: mínimos cuadrados ponderados
Una aplicación muy importante de la función de varianza es su uso en la estimación e inferencia de parámetros cuando la variable de respuesta tiene la forma de la familia exponencial requerida, así como en algunos casos en los que no la tiene (lo que discutiremos en cuasi-verosimilitud ). Los mínimos cuadrados ponderados (WLS) son un caso especial de mínimos cuadrados generalizados. Cada término en el criterio WLS incluye un peso que determina la influencia de cada observación en las estimaciones finales de los parámetros. Al igual que en los mínimos cuadrados regulares, el objetivo es estimar los parámetros desconocidos en la función de regresión encontrando valores para las estimaciones de los parámetros que minimicen la suma de las desviaciones cuadráticas entre las respuestas observadas y la parte funcional del modelo.
Si bien el método de mínimos cuadrados ponderados (WLS) asume la independencia de las observaciones, no asume varianza igual y, por lo tanto, constituye una solución para la estimación de parámetros en presencia de heterocedasticidad. El teorema de Gauss-Markov y Aitken demuestran que el mejor estimador lineal insesgado (BLUE), el estimador insesgado con varianza mínima, tiene cada peso igual al recíproco de la varianza de la medición.
En el marco del GLM, nuestro objetivo es estimar los parámetros., dóndePor lo tanto, nos gustaría minimizary si definimos la matriz de pesos W como
dóndeComo se definió en la sección anterior, permite la estimación iterativa de mínimos cuadrados ponderados (IRLS) de los parámetros. Consulte la sección sobre mínimos cuadrados ponderados iterativos para obtener más información y detalles sobre su desarrollo.
Además, es importante señalar que cuando la matriz de pesos tiene la forma descrita aquí, minimizando la expresiónTambién minimiza la distancia de Pearson. Consulte la sección Correlación de distancia para obtener más información.
La matriz W se obtiene directamente de las ecuaciones de estimación para la estimación deEstimación de máxima verosimilitud para cada parámetro, requiere
- , dóndees la log-verosimilitud.
Si observamos una sola observación, tenemos:
Esto nos da
- y señalando que
- tenemos eso
La matriz hessiana se determina de manera similar y se puede demostrar que es:
Observando que la información de Fisher (FI),
- , permite la aproximación asintótica de
- y, por lo tanto, se puede realizar la inferencia.
Aplicación – cuasi verosimilitud
Debido a que la mayoría de las características de los GLM solo dependen de los dos primeros momentos de la distribución, en lugar de la distribución completa, la cuasi-verosimilitud se puede desarrollar simplemente especificando una función de enlace y una función de varianza. Es decir, necesitamos especificar
- la función de enlace,
- la función de varianza,, donde el
Con una función de varianza y una función de enlace especificadas, podemos desarrollar, como alternativas a la función de log-verosimilitud , la función de puntuación y la información de Fisher , una cuasi-verosimilitud , una cuasi-puntuación y la cuasi-información . Esto permite una inferencia completa de.
Cuasi-verosimilitud (QL)
Aunque se denomina cuasi-verosimilitud , en realidad se trata de una cuasi- log -verosimilitud. La QL para una observación es
Y por lo tanto, el QL para todas las n observaciones es
A partir del QL tenemos la cuasi-puntuación
Puntuación cuasi-puntuación (QS)
Recordemos la función de puntuación , U , para datos con log-verosimilitudes
Obtenemos la cuasi-puntuación de manera idéntica,
Observando que, para una observación, la puntuación es
Las dos primeras ecuaciones de Bartlett se satisfacen para la cuasi-puntuación, a saber:
y
Además, la cuasi-puntuación es lineal en y .
En última instancia, el objetivo es encontrar información sobre los parámetros de interés.. Tanto QS como QL son en realidad funciones de. Recordar,, y, por lo tanto,
Información cuasi-compleja (IC)
La cuasi-información es similar a la información de Fisher .
QL, QS, QI como funciones de
QL, QS y QI proporcionan los bloques de construcción para la inferencia sobre los parámetros de interés y, por lo tanto, es importante expresar QL, QS y QI como funciones de.
Recordando de nuevo que, derivamos las expresiones para QL, QS y QI parametrizadas bajo.
Cuasi verosimilitud en,
El QS en función dees por lo tanto
Dónde,
La matriz de cuasi-información enes,
Obtención de la función de puntuación y la información depermite la estimación de parámetros y la inferencia de manera similar a como se describe en Aplicación – mínimos cuadrados ponderados .
Análisis de regresión no paramétrica


La estimación no paramétrica de la función de varianza y su importancia se han discutido ampliamente en la literatura [ 5 ] [ 6 ] [ 7 ] En el análisis de regresión no paramétrica , el objetivo es expresar el valor esperado de su variable de respuesta ( y ) como una función de sus predictores ( X ). Es decir, buscamos estimar una función media ,sin asumir una forma paramétrica. Existen muchas formas de métodos de suavizado no paramétricos para ayudar a estimar la función.. Un enfoque interesante es también observar una función de varianza no paramétrica ,Una función de varianza no paramétrica permite observar la función de media en relación con la función de varianza y detectar patrones en los datos.
Un ejemplo se detalla en las imágenes de la derecha. El objetivo del proyecto era determinar (entre otras cosas) si la variable predictora, el número de años en las ligas mayores (béisbol), tenía o no un efecto sobre la variable de respuesta, el salario , que percibía un jugador. Un diagrama de dispersión inicial de los datos indica que existe heterocedasticidad en los datos, ya que la varianza no es constante en cada nivel de la variable predictora. Dado que podemos detectar visualmente la varianza no constante, ahora resulta útil graficary observar si la forma es indicativa de alguna distribución conocida. Se puede estimaryUtilizando un método de suavizado general , la gráfica de la función de varianza suavizada no paramétrica permite al investigador comprender la relación entre la varianza y la media. La imagen de la derecha muestra una relación cuadrática entre la media y la varianza. Como vimos anteriormente, la función de varianza Gamma es cuadrática con respecto a la media.
Notas
- 1 2 Muller y Zhao (1995). "Sobre un modelo de función de varianza semiparamétrico y una prueba de heterocedasticidad" . The Annals of Statistics . 23 (3): 946– 967. doi : 10.1214/aos/1176324630 . JSTOR 2242430 .
- ↑ Muller, Stadtmuller y Yao (2006). "Procesos de varianza funcional". Journal of the American Statistical Association . 101 (475): 1007– 1018. doi : 10.1198/016214506000000186 . JSTOR 27590778. S2CID 13712496 .
- ↑ Wedderburn, RWM (1974). "Funciones de cuasi-verosimilitud, modelos lineales generalizados y el método de Gauss-Newton". Biometrika . 61 (3): 439– 447. doi : 10.1093/biomet/61.3.439 . JSTOR 2334725 .
- ↑ McCullagh, Peter; Nelder, John (1989). Modelos lineales generalizados (segunda ed.). Londres: Chapman and Hall. ISBN 0-412-31760-5.
{{cite book}}: CS1 mantenimiento: ubicación del editor ( enlace ) - ↑ Muller y StadtMuller (1987). "Estimación de la heterocedasticidad en el análisis de regresión" . The Annals of Statistics . 15 (2): 610– 625. doi : 10.1214/aos/1176350364 . JSTOR 2241329 .
- ↑ Cai y Wang, T.; Wang, Lie (2008). "Estimación adaptativa de la función de varianza en regresión no paramétrica heterocedástica". The Annals of Statistics . 36 (5): 2025– 2054. arXiv : 0810.4780 . Bibcode : 2008arXiv0810.4780C . doi : 10.1214/07-AOS509 . JSTOR 2546470 . S2CID 9184727 .
- ↑ Rice y Silverman (1991). "Estimación de la media y la estructura de covarianza de forma no paramétrica cuando los datos son curvas". Journal of the Royal Statistical Society . 53 (1): 233– 243. JSTOR 2345738 .
Referencias
- McCullagh, Peter ; Nelder, John (1989). Modelos lineales generalizados (segunda edición). Londres: Chapman and Hall. ISBN 0-412-31760-5.
{{cite book}}: CS1 mantenimiento: ubicación del editor ( enlace ) - Henrik Madsen y Poul Thyregod (2011). Introducción a los modelos lineales generales y generalizados . Chapman & Hall/CRC. ISBN 978-1-4200-9155-7.
Enlaces externos
Contenido multimedia relacionado con la función de varianza en Wikimedia Commons.
- Análisis funcional
- estadística no paramétrica
- regresión no paramétrica
- Ciencias actuariales
- Modelos lineales generalizados