Articulo de referencia

Estadístico chi-cuadrado reducido

En estadística , el estadístico chi-cuadrado reducido se utiliza ampliamente en las pruebas de bondad de ajuste . También se conoce como desviación cuadrática media ponderada ( ...

En estadística , el estadístico chi-cuadrado reducido se utiliza ampliamente en las pruebas de bondad de ajuste . También se conoce como desviación cuadrática media ponderada ( MSWD ) en la datación isotópica [ 1 ] y varianza de peso unitario en el contexto de mínimos cuadrados ponderados . [ 2 ] [ 3 ]

Su raíz cuadrada se llama error estándar de regresión , [ 4 ] error estándar de la regresión , [ 5 ] [ 6 ] o error estándar de la ecuación [ 7 ] (véase Mínimos cuadrados ordinarios §  Chi-cuadrado reducido )

Definición

Se define como chi-cuadrado por grado de libertad : [ 8 ] [ 9 ] [ 10 ] [ 11 ] : 85 [ 12 ] [ 13 ] [ 14 ] [ 15 ]χν2=χ2ν,{\displaystyle \chi _{\nu }^{2}={\frac {\chi ^{2}}{\nu }},} donde el chi-cuadrado es una suma ponderada de desviaciones al cuadrado : χ2=i(Oidoi)2σi2{\displaystyle \chi ^{2}=\sum _{i}{\frac {(O_{i}-C_{i})^{2}}{\sigma _{i}^{2}}}} con entradas: varianzaσi2{\displaystyle \sigma _{i}^{2}}, observaciones O y datos calculados C. [ 8 ] El grado de libertad,ν=nortemetro{\displaystyle \nu =nm}, es igual al número de observaciones n menos el número de parámetros ajustados m .

En mínimos cuadrados ponderados , la definición se escribe a menudo en notación matricial como χν2=rTWrν,{\displaystyle \chi _{\nu }^{2}={\frac {r^{\mathrm {T} }Wr}{\nu }},} donde r es el vector de residuos y W es la matriz de ponderación, la inversa de la matriz de covarianza (diagonal) de las observaciones de entrada. Si W no es diagonal, se aplica el método de mínimos cuadrados generalizados .

En el método de mínimos cuadrados ordinarios , la definición se simplifica a: χν2=RSSν,{\displaystyle \chi _{\nu }^{2}={\frac {\mathrm {RSS} }{\nu }},}RSS=r2,{\displaystyle \mathrm {RSS} =\sum r^{2},} donde el numerador es la suma residual de cuadrados (RSS).

Cuando el ajuste es simplemente una media ordinaria, entoncesχν2{\displaystyle \chi _{\nu }^{2}}es igual a la varianza de la muestra , la desviación estándar de la muestra al cuadrado .

Discusión

Como regla general, cuando la varianza del error de medición se conoce a priori ,χν21{\displaystyle \chi _{\nu }^{2}\gg 1}indica un ajuste deficiente del modelo.χν2>1{\displaystyle \chi _{\nu }^{2}>1}indica que el ajuste no ha capturado completamente los datos (o que la varianza del error se ha subestimado). En principio, un valor deχν2{\displaystyle \chi _{\nu }^{2}}alrededor 1{\displaystyle 1}indica que el grado de coincidencia entre las observaciones y las estimaciones está de acuerdo con la varianza del error. Aχν2<1{\displaystyle \chi _{\nu }^{2}<1}indica que el modelo está " sobreajustando " los datos: o bien el modelo no ajusta correctamente el ruido, o bien la varianza del error se ha sobreestimado. [ 11 ] : 89

Cuando la varianza del error de medición se conoce solo parcialmente, el chi-cuadrado reducido puede servir como una corrección estimada a posteriori .

Aplicaciones

Geocronología

En geocronología , el MSWD es una medida de bondad de ajuste que tiene en cuenta la importancia relativa de la reproducibilidad interna y externa, siendo su uso más común en la datación isotópica. [ 16 ] [ 17 ] [ 1 ] [ 18 ] [ 19 ] [ 20 ]

En general, cuando:

MSWD = 1 si los datos de edad se ajustan a una distribución normal univariada en el espacio t (para la edad media aritmética ) o log( t ) (para la edad media geométrica ), o si los datos de composición se ajustan a una distribución normal bivariada en el espacio [log( U / He ),log( Th /He)] (para la edad central).

MSWD < 1 si la dispersión observada es menor que la predicha por las incertidumbres analíticas. En este caso, se dice que los datos están "subdispersados", lo que indica que las incertidumbres analíticas se sobreestimaron.

MSWD > 1 si la dispersión observada excede la predicha por las incertidumbres analíticas. En este caso, se dice que los datos están "sobredispersados". Esta situación es la norma, no la excepción, en la geocronología (U-Th)/He, lo que indica una comprensión incompleta del sistema isotópico. Se han propuesto varias razones para explicar la sobredispersión de los datos (U-Th)/He, incluyendo distribuciones de U-Th no uniformes y daños por radiación.

A menudo, el geocronólogo determinará una serie de mediciones de edad en una sola muestra, con el valor medido.incógnitai{\displaystyle x_{i}}tener una ponderaciónwi{\displaystyle w_{i}}y un error asociadoσincógnitai{\displaystyle \sigma _{x_{i}}}para cada determinación de edad. En cuanto a la ponderación, se pueden ponderar todas las edades medidas por igual o según la proporción de la muestra que representan. Por ejemplo, si se utilizaron dos tercios de la muestra para la primera medición y un tercio para la segunda y última, se podría ponderar la primera medición el doble que la segunda.

La media aritmética de las determinaciones de edad es incógnita¯=i=1norteincógnitainorte,{\displaystyle {\overline {x}}={\frac {\sum _{i=1}^{N}x_{i}}{N}},} pero este valor puede resultar engañoso, a menos que cada determinación de la edad tenga la misma importancia.

Cuando se puede suponer que cada valor medido tiene la misma ponderación o significancia, los estimadores sesgados e insesgados (o de " muestra " y "población" respectivamente) de la varianza se calculan de la siguiente manera: σ2=i=1norte(incógnitaiincógnita¯)2norte y s2=nortenorte1σ2=1norte1i=1norte(incógnitaiincógnita¯)2.{\displaystyle \sigma ^{2}={\frac {\sum _{i=1}^{N}(x_{i}-{\overline {x}})^{2}}{N}}{\text{ y }}s^{2}={\frac {N}{N-1}}\cdot \sigma ^{2}={\frac {1}{N-1}}\cdot \sum _{i=1}^{N}(x_{i}-{\overline {x}})^{2}.}

La desviación estándar es la raíz cuadrada de la varianza.

Cuando las determinaciones individuales de una edad no tienen la misma importancia, es mejor utilizar una media ponderada para obtener una edad "promedio", como se muestra a continuación: incógnita¯=i=1nortewiincógnitaii=1nortewi.{\displaystyle {\overline {x}}^{*}={\frac {\sum _{i=1}^{N}w_{i}x_{i}}{\sum _{i=1}^{N}w_{i}}}.}

Se puede demostrar que el estimador ponderado sesgado de la varianza es σ2=i=1nortewi(incógnitaiincógnita¯)2i=1nortewi,{\displaystyle \sigma ^{2}={\frac {\sum _{i=1}^{N}w_{i}(x_{i}-{\overline {x}}^{*})^{2}}{\sum _{i=1}^{N}w_{i}}},} que se puede calcular como σ2=i=1nortewiincógnitai2i=1nortewi(i=1nortewiincógnitai)2(i=1nortewi)2.{\displaystyle \sigma ^{2}={\frac {\sum _{i=1}^{N}w_{i}x_{i}^{2}\cdot \sum _{i=1}^{N}w_{i}-{\big (}\sum _{i=1}^{N}w_{i}x_{i}{\big )}^{2}}{{\big (}\sum _{i=1}^{N}w_{i}{\big )}^{2}}}.}

El estimador ponderado insesgado de la varianza muestral se puede calcular de la siguiente manera: s2=i=1nortewi(i=1nortewi)2i=1nortewi2i=1nortewi(incógnitaiincógnita¯)2.{\displaystyle s^{2}={\frac {\sum _{i=1}^{N}w_{i}}{{\big (}\sum _{i=1}^{N}w_{i}{\big )}^{2}-\sum _{i=1}^{N}w_{i}^{2}}}\cdot {\sum _{i=1}^{N}w_{i}(x_{i}-{\overline {x}}^{*})^{2}}.} Nuevamente, la desviación estándar correspondiente es la raíz cuadrada de la varianza.

El estimador ponderado insesgado de la varianza muestral también se puede calcular sobre la marcha de la siguiente manera: s2=i=1nortewiincógnitai2i=1nortewi(i=1nortewiincógnitai)2(i=1nortewi)2i=1nortewi2.{\displaystyle s^{2}={\frac {\sum _{i=1}^{N}w_{i}x_{i}^{2}\cdot \sum _{i=1}^{N}w_{i}-{\big (}\sum _{i=1}^{N}w_{i}x_{i}{\big )}^{2}}{{\big (}\sum _{i=1}^{N}w_{i}{\big )}^{2}-\sum _{i=1}^{N}w_{i}^{2}}}.}

A continuación, se puede calcular la media cuadrática no ponderada de las desviaciones ponderadas (MSWD no ponderada), de la siguiente manera: MSWD=1norte1i=1norte(incógnitaiincógnita¯)2σincógnitai2.{\displaystyle {\text{MSWD}}_{u}={\frac {1}{N-1}}\cdot \sum _{i=1}^{N}{\frac {(x_{i}-{\overline {x}})^{2}}{\sigma _{x_{i}}^{2}}}.}

Por analogía, la media cuadrática ponderada de las desviaciones ponderadas (MSWD ponderada) se puede calcular de la siguiente manera: MSWDw=i=1nortewi(i=1nortewi)2i=1nortewi2i=1nortewi(incógnitaiincógnita¯)2(σincógnitai)2.{\displaystyle {\text{MSWD}}_{w}={\frac {\sum _{i=1}^{N}w_{i}}{{\big (}\sum _{i=1}^{N}w_{i}{\big )}^{2}-\sum _{i=1}^{N}w_{i}^{2}}}\cdot \sum _{i=1}^{N}{\frac {w_{i}(x_{i}-{\overline {x}}^{*})^{2}}{(\sigma _{x_{i}})^{2}}}.}

Análisis de Rasch

En el análisis de datos basado en el modelo de Rasch , el estadístico chi-cuadrado reducido se denomina estadístico cuadrático medio outfit, y el estadístico chi-cuadrado reducido ponderado por información se denomina estadístico cuadrático medio infit. [ 21 ]

Referencias

  1. 1 2 Wendt, I., y Carl, C., 1991, La distribución estadística de la desviación cuadrática media ponderada, Chemical Geology, 275–285.
  2. Strang, Gilbert; Borre, Kae (1997). Álgebra lineal, geodesia y GPS . Wellesley-Cambridge Press. pág.  301. ISBN 9780961408862.
  3. Koch, Karl-Rudolf (2013). Estimación de parámetros y prueba de hipótesis en modelos lineales . Springer Berlin Heidelberg. Sección 3.2.5. ISBN 9783662039762.
  4. Julian Faraway (2000), Regresión práctica y ANOVA usando R
  5. Kenney, J.; Keeping, ES (1963). Matemáticas de la estadística . van Nostrand. pág. 187. 
  6. Zwillinger, D. (1995). Tablas y fórmulas matemáticas estándar . Chapman&Hall/CRC. pág. 626. ISBN  0-8493-2479-3.
  7. Hayashi, Fumio (2000). Econometría . Princeton University Press. ISBN 0-691-01018-8.
  8. 1 2 Laub, Charlie; Kuhl, Tonya L. (s.f.), ¿ Qué tan malo es lo bueno? Una mirada crítica al ajuste de modelos de reflectividad utilizando la estadística chi-cuadrado reducida (PDF) , Universidad de California, Davis, archivado del original (PDF) el 6 de octubre de 2016 , recuperado el 30 de mayo de 2015.
  9. Taylor, John Robert (1997), Introducción al análisis de errores , University Science Books, pág. 268 
  10. Kirkman, TW (s.f.), Ajuste de curvas Chi-cuadrado , consultado el 30 de mayo de 2015.
  11. 1 2 Bevington, Philip R. (1969), Reducción de datos y análisis de errores para las ciencias físicas , Nueva York: McGraw-Hill
  12. Mediciones y sus incertidumbres: una guía práctica para el análisis de errores moderno, por Ifan Hughes y Thomas Hase
  13. Cómo afrontar las incertidumbres: una guía para el análisis de errores, por Manfred Drosg
  14. Estadística práctica para astrónomos, por JV Wall y CR Jenkins
  15. Métodos computacionales en física e ingeniería, por Samuel Shaw y Ming Wong
  16. Dickin, AP 1995. Geología de isótopos radiogénicos. Cambridge University Press, Cambridge, Reino Unido, 1995, ISBN 0-521-43151-4, ISBN 0-521-59891-5
  17. McDougall, I. y Harrison, TM 1988. Geocronología y termocronología mediante el método 40 Ar/ 39 Ar. Oxford University Press.
  18. ^ Lance P. Black, Sandra L. Kamo, Charlotte M. Allen, John N. Aleinikoff, Donald W. Davis, Russell J. Korsch, Chris Foudoulis 2003. TEMORA 1: un nuevo estándar de circón para la geocronología fanerozoica U-Pb. Geología química 200, 155-170.
  19. MJ Streule, RJ Phillips, MP Searle, DJ Waters y MSA Horstwood 2009. Evolución y cronología del Complejo Metamórfico de Pangong adyacente a la falla de Karakoram, Ladakh: modelado y geocronología U-Pb: restricciones a partir de termobarometría, modelado metamórfico y geocronología U-Pb. Journal of the Geological Society 166, 919–932 doi : 10.1144/0016-76492008-117
  20. Roger Powell, Janet Hergt , Jon Woodhead 2002. Mejora de los cálculos de isócronas con estadísticas robustas y el bootstrap. Chemical Geology 185, 191–204.
  21. Linacre, JM (2002). "¿Qué significan Infit y Outfit, Mean-square y Standardized?" . Rasch Measurement Transactions . 16 (2): 878.