Articulo de referencia

estadística no paramétrica

La estadística no paramétrica es un tipo de análisis estadístico que realiza suposiciones mínimas sobre la distribución subyacente de los datos estudiados. A menudo, estos model...

La estadística no paramétrica es un tipo de análisis estadístico que realiza suposiciones mínimas sobre la distribución subyacente de los datos estudiados. A menudo, estos modelos son de dimensión infinita, en lugar de dimensión finita, como en la estadística paramétrica . [ 1 ] La estadística no paramétrica puede utilizarse para estadística descriptiva o inferencia estadística . Las pruebas no paramétricas se utilizan con frecuencia cuando las suposiciones de las pruebas paramétricas se incumplen de forma evidente. [ 2 ]

Definiciones

El término "estadística no paramétrica" ​​se ha definido de forma imprecisa, entre otras, de las dos maneras siguientes:

El primer significado de no paramétrico implica técnicas que no dependen de datos que pertenezcan a ninguna familia paramétrica particular de distribuciones de probabilidad. Estas incluyen, entre otras:

  • Métodos que no dependen de la distribución , que no se basan en suposiciones de que los datos se extraen de una familia paramétrica determinada de distribuciones de probabilidad .
  • Estadísticas definidas como una función de una muestra, sin dependencia de un parámetro .

Un ejemplo son las estadísticas de orden , que se basan en la clasificación ordinal de las observaciones.

La discusión que sigue está tomada de la Teoría Avanzada de la Estadística de Kendall . [ 3 ]

Las hipótesis estadísticas se refieren al comportamiento de variables aleatorias observables... Por ejemplo, la hipótesis (a) de que una distribución normal tiene una media y una varianza especificadas es estadística; también lo es la hipótesis (b) de que tiene una media dada pero una varianza no especificada; también lo es la hipótesis (c) de que una distribución es de forma normal con media y varianza no especificadas; finalmente, también lo es la hipótesis (d) de que dos distribuciones continuas no especificadas son idénticas.

Se habrá notado que en los ejemplos (a) y (b) se tomó que la distribución subyacente a las observaciones era de una forma determinada (la normal) y la hipótesis se refería enteramente al valor de uno o ambos de sus parámetros. Dicha hipótesis, por razones obvias, se denomina paramétrica .

La hipótesis (c) era de naturaleza diferente, ya que no se especifican valores de parámetros en su enunciado; podríamos denominarla razonablemente no paramétrica . La hipótesis (d) también es no paramétrica, pero, además, ni siquiera especifica la forma subyacente de la distribución y ahora puede denominarse razonablemente libre de distribución . A pesar de estas distinciones, la literatura estadística suele aplicar la etiqueta de "no paramétrico" a procedimientos de prueba que acabamos de denominar "libres de distribución", perdiendo así una clasificación útil.

El segundo significado de no paramétrico se refiere a técnicas que no presuponen que la estructura de un modelo sea fija. Por lo general, el modelo aumenta de tamaño para adaptarse a la complejidad de los datos. En estas técnicas, se suele asumir que las variables individuales pertenecen a distribuciones paramétricas, y también se hacen suposiciones sobre los tipos de asociaciones entre variables. Estas técnicas incluyen, entre otras:

  • La regresión no paramétrica es un tipo de modelado en el que la estructura de la relación entre variables se trata de forma no paramétrica, pero donde, no obstante, pueden existir supuestos paramétricos sobre la distribución de los residuos del modelo.
  • modelos bayesianos jerárquicos no paramétricos , como los modelos basados ​​en el proceso de Dirichlet , que permiten que el número de variables latentes crezca según sea necesario para ajustarse a los datos, pero donde las variables individuales siguen distribuciones paramétricas e incluso el proceso que controla la tasa de crecimiento de las variables latentes sigue una distribución paramétrica.

Aplicaciones y propósito

Los métodos no paramétricos se utilizan ampliamente para estudiar poblaciones con un orden jerarquizado (como las reseñas de películas que reciben de una a cinco estrellas). El uso de métodos no paramétricos puede ser necesario cuando los datos tienen una clasificación pero carecen de una interpretación numérica clara , como al evaluar preferencias . En términos de niveles de medición , los métodos no paramétricos dan como resultado datos ordinales .

Dado que los métodos no paramétricos requieren menos supuestos, su aplicabilidad es mucho más general que la de los métodos paramétricos correspondientes. En particular, pueden aplicarse en situaciones donde se conoce menos sobre la aplicación en cuestión. Además, debido a que dependen de menos supuestos, los métodos no paramétricos son más robustos .

Los métodos no paramétricos a veces se consideran más sencillos de usar y más robustos que los paramétricos, incluso cuando se justifican los supuestos de estos últimos . Esto se debe a su naturaleza más general, que puede hacerlos menos propensos a un uso indebido y a malentendidos. Los métodos no paramétricos pueden considerarse una opción conservadora, ya que funcionan incluso cuando no se cumplen sus supuestos, mientras que los métodos paramétricos pueden producir resultados engañosos cuando estos se incumplen.

La mayor aplicabilidad y robustez de las pruebas no paramétricas conlleva un inconveniente: en los casos en que se cumplen los supuestos de una prueba paramétrica, las pruebas no paramétricas tienen menor potencia estadística . En otras palabras, puede ser necesario un tamaño de muestra mayor para llegar a conclusiones con el mismo grado de confianza.

Modelos no paramétricos

Los modelos no paramétricos se diferencian de los paramétricos en que su estructura no se especifica a priori, sino que se determina a partir de los datos. El término "no paramétrico" no implica que dichos modelos carezcan por completo de parámetros, sino que el número y la naturaleza de estos son flexibles y no están predeterminados.

pruebas no paramétricas

Los métodos estadísticos inferenciales no paramétricos (o libres de distribución ) son procedimientos matemáticos para la prueba de hipótesis estadísticas que, a diferencia de la estadística paramétrica , no hacen suposiciones sobre las distribuciones de probabilidad de las variables que se evalúan. Las pruebas más utilizadas incluyen:

Estadística matemática

En estadística matemática , los modelos no paramétricos se consideran modelos que no dependen de una suposición paramétrica de la distribución de datos desconocida (en problemas de estimación de densidad ) o de la función de regresión (en problemas de regresión ). Mientras que el objetivo de cualquier modelo paramétrico es la estimación de un número finito de parámetros.θ1,,θpagR{\displaystyle \theta _{1},\dots ,\theta _{p}\in \mathbb {R} }Los modelos no paramétricos buscan estimar directamente la distribución de datos/función de regresión. [ 5 ] [ 6 ]

Sin embargo, para el análisis matemático, los enfoques paramétricos y no paramétricos se ajustan al mismo contexto: Suponiendo que la función que se va a estimar (distribución de datos o función de regresión) pertenece a un conjunto de funciones parametrizadas por un conjuntoΘ{\displaystyle \Theta }, uno busca una función (medible)Tnorte:incógnitanorteΘ{\displaystyle T_{n}:{\mathcal {X}}^{n}\to \Theta }que estima el parámetro "verdadero" basándose en puntos de datosincógnita1,,incógnitanorteincógnita{\displaystyle x_{1},\dots ,x_{n}\in {\mathcal {X}}}La diferencia clave entre los enfoques paramétricos y no paramétricos es que en los primerosΘRd{\displaystyle \Theta \subset \mathbb {R} ^{d}}para algunosdnorte{\displaystyle d\in \mathbb {N} }, mientras que en el últimoΘ{\displaystyle \Theta }es típicamente el conjunto de posibles funciones objetivo en sí mismo, por ejemplo, el conjunto de funciones continuas o funciones diferenciables .

Las cuestiones relevantes en este campo se refieren a la construcción de estimadores razonables, la consistencia , las tasas de convergencia y su optimalidad, y la estimación adaptativa. [ 7 ]

Consistencia

Como en la estadística paramétrica , una propiedad deseable para un estimadorFnorte^{\displaystyle {\sombrero {f_{n}}}}es que converge a la función objetivoF{\displaystyle f}como el tamaño de la muestranorte{\displaystyle n}va al infinito, es decir, el error de aproximación converge a cero. Por lo general, la aproximación se mide en términos deL2{\displaystyle L^{2}}-distancia de norma entreFnorte^{\displaystyle {\sombrero {f_{n}}}}yF{\displaystyle f}Dado que el estimador es una función de los datos extraídos aleatoriamenteincógnita=(incógnita1,,incógnitanorte){\displaystyle X=(X_{1},\dots ,X_{n})}La aproximación también es una variable aleatoria, por lo que distinguimos dos modos de convergencia diferentes:

Consistencia débil:límitenortemi[Fnorte^(incógnita)FL22]=0{\displaystyle \lim _{n\to \infty }\mathbb {E} [\lVert {\hat {f_{n}}}(X)-f\rVert _{L^{2}}^{2}]=0}.

Gran consistencia:límitenorteFnorte^(incógnita)FL22=0{\displaystyle \lim _{n\to \infty }\lVert {\hat {f_{n}}}(X)-f\rVert _{L^{2}}^{2}=0}casi con seguridad .

Si un estimador es consistente para todos los números de cuadrado integrableF{\displaystyle f}, entonces se le llama universalmente consistente . [ 8 ]

Muchos estimadores no paramétricos comunes son débilmente universalmente consistentes bajo una elección adecuada de hiperparámetros del modelo, por ejemplo, el estimador de Nadarya-Watson , los kNN y ciertos estimadores polinomiales locales . [ 9 ]

Tasas de convergencia óptimas minimax

Un tema central en el análisis estadístico de los estimadores no paramétricos es su velocidad de convergencia hacia la función objetivo verdadera.F{\displaystyle f}y si la velocidad es óptima, es decir, la convergencia es lo más rápida posible. La forma más común de medir la velocidad de convergencia de un estimador es la tasa de convergencia minimax , que considera la pérdida esperada del estimador en el peor de los casos. Bajo ciertas suposiciones sobre la suavidad deF{\displaystyle f}Se puede demostrar que existe una tasa de convergencia mínima que ningún estimador puede superar, por lo que cualquier estimador que alcance esta tasa mínima se denomina óptimo.

Matemáticamente hablando, la función objetivoF{\displaystyle f}Se supone que pertenece a alguna clase de funcionesH{\displaystyle {\mathcal {H}}}, denominada clase de hipótesis , que induce una distribuciónPAGF{\displaystyle \mathbb {P} _{f}}enincógnita{\displaystyle {\mathcal {X}}}y la calidad de aproximación de un estimadorFnorte^:incógnitanorteH{\displaystyle {\hat {f_{n}}}:{\mathcal {X}}^{n}\to {\mathcal {H}}}se mide mediante alguna funciónL:H×H[0,){\displaystyle L:{\mathcal {H}}\times {\mathcal {H}}\to [0,\infty )}. La tasa de convergencia minimax deFnorte^{\displaystyle {\sombrero {f_{n}}}}es una secuencia(ψnorte)nortenorte{\displaystyle (\psi _{n})_{n\in \mathbb {N} }}de números reales para los que se sostienelímite superiornorte1ψnortesorberFHmiF[L(F,Fnorte^(incógnita1,,incógnitanorte))]<,límite inferiornorte1ψnortesorberFHmiF[L(F,Fnorte^(incógnita1,,incógnitanorte))]>0,{\displaystyle {\begin{aligned}\limsup _{n\to \infty }{\frac {1}{\psi _{n}}}\sup _{f\in {\mathcal {H}}}\mathbb {E} _{f}{\big [}L{\big (}f,{\hat {f_{n}}}(X_{1},\dots ,X_{n}){\big )}{\big ]}&<\infty ,\\\liminf _{n\to \infty }{\frac {1}{\psi _{n}}}\sup _{f\in {\mathcal {H}}}\mathbb {E} _{f}{\big [}L{\big (}f,{\hat {f_{n}}}(X_{1},\dots ,X_{n}){\big )}{\big ]}&>0,\end{aligned}}}dóndemiF[]{\displaystyle \mathbb {E} _{f}[\cdot ]}indica que las variables aleatoriasincógnita1,,incógnitanorte{\displaystyle X_{1},\dots ,X_{n}}, que dibujan los puntos de datos, tienen distribuciónPAGF{\displaystyle \mathbb {P} _{f}}.

Un límite inferior universal para la estimación de una clase de hipótesisH{\displaystyle {\mathcal {H}}}es una secuencia(ψnorte)nortenorte{\displaystyle (\psi _{n})_{n\in \mathbb {N} }}por lo cual se sostienelímite superiornorte1ψnorteinfρnorte^sorberFHmiF[L(F,ρ^norte(incógnita1,,incógnitanorte))]<,límite inferiornorte1ψnorteinfρnorte^sorberFHmiF[L(F,ρ^norte(incógnita1,,incógnitanorte))]>0,{\displaystyle {\begin{aligned}\limsup _{n\to \infty }{\frac {1}{\psi _{n}}}\inf _{\hat {\rho _{n}}}\sup _{f\in {\mathcal {H}}}\mathbb {E} _{f}{\big [}L{\big (}f,{\hat {\rho }}_{n}(X_{1},\dots ,X_{n}){\big )}{\big ]}&<\infty ,\\\liminf _{n\to \infty }{\frac {1}{\psi _{n}}}\inf _{\hat {\rho _{n}}}\sup _{f\in {\mathcal {H}}}\mathbb {E} _{f}{\big [}L{\big (}f,{\hat {\rho }}_{n}(X_{1},\dots ,X_{n}){\big )}{\big ]}&>0,\end{aligned}}}donde los ínfimos se toman sobre todos los estimadores posiblesρ^norte{\displaystyle {\hat {\rho }}_{n}}(es decir, funciones medibles ) basadas ennorte{\displaystyle n}observaciones.

El análisis detallado de los estimadores no paramétricos se divide luego en la estimación de densidades de probabilidad y funciones de regresión.

Estimación de densidad

El entorno de estimación de densidad generalmente implica un espacio normado de funciones.(F,){\displaystyle ({\mathcal {F}},\lVert \cdot \rVert )}, un subconjunto de funciones de densidadH={FF:F0,incógnitaF(incógnita)dincógnita=1,F1}{\displaystyle {\mathcal {H}}=\{f\in {\mathcal {F}}:f\geq 0,\int _{\mathcal {X}}f(x)dx=1,\lVert f\rVert \leq 1\}}y variables aleatorias independientesincógnita1,,incógnitanorteincógnitaRd{\displaystyle X_{1},\dots ,X_{n}\in {\mathcal {X}}\subset \mathbb {R} ^{d}}distribuidos según la medida con densidadFH{\displaystyle f\in {\mathcal {H}}}, que genera los datos.

Se conocen límites inferiores de minimax para diferentes pares de clases de funciones.F{\displaystyle {\mathcal {F}}}y métricas de comparaciónL{\displaystyle L}Opciones comunes paraF{\displaystyle {\mathcal {F}}}son:

  • F=doα(incógnita),α>0{\displaystyle {\mathcal {F}}=C^{\alpha }({\mathcal {X}}),\alpha >0}: El espacio deα{\displaystyle \lfloor \alpha \rfloor }-veces funciones diferenciables con la derivada más alta siendo(αα){\displaystyle (\alpha -\lfloor \alpha \rfloor )}- Sostener - suave.
  • F=Hs(incógnita)=Ws,2(incógnita),s>0{\displaystyle {\mathcal {F}}=H^{s}({\mathcal {X}})=W^{s,2}({\mathcal {X}}),s>0}: El espacio de funciones suaves de Sobolev con derivadas débiles de cuadrado integrable .
  • F=Bpag,qs(incógnita),s>0,pag,q(0,]{\displaystyle {\mathcal {F}}=B_{p,q}^{s}({\mathcal {X}}),s>0,p,q\in (0,\infty ]}: El espacio de funciones suaves de Besov .

De hecho, los espacios de Hölder y los espacios de Sobolev son casos especiales de algunos espacios de Besov, a saber:doα(incógnita)=B,α(incógnita){\displaystyle C^{\alpha }({\mathcal {X}})=B_{\infty ,\infty }^{\alpha }({\mathcal {X}})}paraαZ{\displaystyle \alpha \notin \mathbb {Z} }yHs(incógnita)=B2,2s(incógnita){\displaystyle H^{s}({\mathcal {X}})=B_{2,2}^{s}({\mathcal {X}})}. [ 10 ] Por lo tanto, a menudo basta con derivar límites inferiores bajo supuestos de suavidad de Besov.

Opciones comunes paraL{\displaystyle L}son:

  • L(F,gramo)=(F(incógnita0)gramo(incógnita0))2,incógnita0incógnita{\displaystyle L(f,g)=(f(x_{0})-g(x_{0}))^{2},x_{0}\in {\mathcal {X}}}: El error cuadrático medio (ECM) puntual.
  • L(F,gramo)=FgramoL2(incógnita)2{\displaystyle L(f,g)=\lVert f-g\rVert _{L^{2}({\mathcal {X}})}^{2}}: El error cuadrático medio integrado (MISE).
  • L(F,gramo)=FgramoL(incógnita){\displaystyle L(f,g)=\lVert f-g\rVert _{L^{\infty }({\mathcal {X}})}}: La distancia de norma suprema .
  • L(F,gramo)=KL(PAGFPAGgramo){\displaystyle L(f,g)=\mathrm {KL} (\mathbb {P} _{f}\lVert \mathbb {P} _{g})}: La divergencia de Kullback-Leibler de las distribuciones inducida porF{\displaystyle f}ygramo{\displaystyle g}.
  • L(F,gramo)=TV(PAGF,PAGgramo){\displaystyle L(f,g)=\mathrm {TV} (\mathbb {P} _{f},\mathbb {P} _{g})}: La distancia de variación total de las distribuciones inducida porF{\displaystyle f}ygramo{\displaystyle g}.
  • L(F,gramo)=Wβ(PAGF,PAGgramo),β1{\displaystyle L(f,g)=W_{\beta }(\mathbb {P} _{f},\mathbb {P} _{g}),\beta \geq 1}: El Wasserstein-β{\displaystyle \beta }distancia de las distribuciones inducidas porF{\displaystyle f}ygramo{\displaystyle g}.

Según el teorema de Scheffé, la distancia de variación totalTV(PAGF,PAGgramo){\displaystyle \mathrm {TV} (\mathbb {P} _{f},\mathbb {P} _{g})}es equivalente a laL1{\displaystyle L^{1}}-distancia deF{\displaystyle f}ygramo{\displaystyle g}.

El límite inferior del MISE se compara a veces con el límite de Cramér-Rao de la estadística paramétrica, que es un límite inferior para el error cuadrático medio de los estimadores insesgados regulares de un parámetro.θ{\displaystyle \theta }:sorberθΘmi[θθ^norte2]norte1sorberθΘtr(I(θ)1)=doonortest.,sorberFBpag,qs(incógnita)mi[FFnorte^L2(incógnita)2]donorte2s/(2s+d),{\displaystyle {\begin{aligned}\sup _{\theta \in \Theta }\mathbb {E} &[\lVert \theta -{\hat {\theta }}_{n}\rVert ^{2}]\geq n^{-1}\underbrace {\sup _{\theta \in \Theta }\mathrm {tr} (I(\theta )^{-1})} _{=const.},\\\sup _{f\in B_{p,q}^{s}({\mathcal {X}})}\mathbb {E} &[\lVert f-{\hat {f_{n}}}\rVert _{L^{2}({\mathcal {X}})}^{2}]\geq cn^{-2s/(2s+d)},\end{aligned}}}dóndeI(θ){\displaystyle I(\theta )}es la información de Fisher del modelo paramétrico ydo>0{\displaystyle c>0}es alguna constante. Por lo tanto, la tasa no paramétrica es más lenta que la tasa paramétrica.norte1{\displaystyle n^{-1}}, especialmente en grandes dimensiones, y se aproxima a la tasa paramétrica a medida que la suavidad de la densidad tiende al infinito.

Los estimadores de densidad de kernel , por ejemplo, alcanzan el límite inferior con respecto al MISE bajo una clase de hipótesis de Sobolev bajo una elección de ancho de banda apropiada y, por lo tanto, son óptimos minimax. [ 14 ] Más recientemente, también se ha demostrado que los modelos generativos basados ​​en puntuaciones alcanzan tasas de convergencia minimax en variación total y en distancia de Wasserstein-1 paraBpag,qs([0,1]d){\displaystyle B_{p,q}^{s}([0,1]^{d})}-distribuciones suaves,s>(1/pag1/2)+{\displaystyle s>(1/p-1/2)_{+}}, que están acotados inferiormente por un valor distinto de cero. [ 15 ]

Regresión

En el contexto de la regresión , los datos aparecen en pares.(incógnita1,Y1),,(incógnitanorte,Ynorte){\displaystyle (X_{1},Y_{1}),\dots ,(X_{n},Y_{n})}. Suponiendo que los datos son independientes e idénticamente distribuidos, ymi[|Y1|]<{\displaystyle \mathbb {E} [|Y_{1}|]<\infty }, siempre se puede escribirYi=F(incógnitai)+εi,{\displaystyle Y_{i}=f(X_{i})+\varepsilon _{i},}conF(incógnita)=mi[Y1incógnita1=incógnita]{\displaystyle f(x)=\mathbb {E} [Y_{1}\mid X_{1}=x]}siendo la función de regresión a estimar y una variable de ruido .εi{\displaystyle \varepsilon _{i}}gratificantemi[εi]=0{\displaystyle \mathbb {E} [\varepsilon _{i}]=0}ymi[ε2]=σ2>0{\displaystyle \mathbb {E} [\varepsilon ^{2}]=\sigma ^{2}>0}. Normalmente, las variables independientesincógnitai{\displaystyle X_{i}}Se supone que tienen valores en el cubo unitario.[0,1]d{\displaystyle [0,1]^{d}}y ser puntos deterministas en una cuadrícula (diseño determinista) o estar distribuidos uniformemente (diseño aleatorio). Por lo tanto,incógnita=[0,1]d×R{\displaystyle {\mathcal {X}}=[0,1]^{d}\times \mathbb {R} }.

La configuración anterior también se aplica a la clasificación binaria . En ese caso, las observaciones toman solo dos valores, digamos 0 y 1, de tal manera queF(incógnita)=mi[1{Y1=1}incógnita=incógnita]=PAG(Y1=1incógnita=incógnita){\displaystyle f(x)=\mathbb {E} [\mathbb {1} _{\{Y_{1}=1\}}\mid X=x]=\mathbb {P} (Y_{1}=1\mid X=x)}y dado un estimadorFnorte^{\displaystyle {\hat {f_{n}}}}deF{\displaystyle f}Se supone que los clasificadores tienen la formado(incógnita)=1[1/2,1](Fnorte^(incógnita)){\displaystyle C(x)=\mathbb {1} _{[1/2,1]}({\hat {f_{n}}}(x))}, es decir, clasifican un punto como 1 si la probabilidad estimada deY=1{\displaystyle Y=1}es mayor que1/2{\displaystyle 1/2}(y 0 en caso contrario). De hecho, muchos métodos de clasificación son de esa forma, por ejemplo la regresión logística , el análisis discriminante lineal , el análisis discriminante cuadrático , el algoritmo de k-vecinos más cercanos y las máquinas de vectores de soporte .

Luego, para el análisis estadístico, la clase de hipótesis es de la formaH={FF:F1}{\displaystyle {\mathcal {H}}=\{f\in {\mathcal {F}}:\lVert f\rVert \leq 1\}}para algún espacio normado de funciones(F,){\displaystyle ({\mathcal {F}},\lVert \cdot \rVert )}y expectativasmiF{\displaystyle \mathbb {E} _{f}}se toman con respecto a la distribución conjunta deincógnita{\displaystyle X}yY{\displaystyle Y}(o simplementeY{\displaystyle Y}si elincógnitai{\displaystyle X_{i}}son deterministas).

En la regresión no paramétrica , la clase de hipótesis requiere necesariamente algunos supuestos fuertes sobre la función de regresión; de lo contrario, el límite inferior minimax puede ser arbitrariamente lento. Por ejemplo, siF=L([0,1]){\displaystyle {\mathcal {F}}=L^{\infty }([0,1])}, es decir, el conjunto de funciones acotadas , entonces para cualquier estimadorFnorte^{\displaystyle {\hat {f_{n}}}}y cualquier secuencia cero(ψnorte)nortenorte{\displaystyle (\psi _{n})_{n\in \mathbb {N} }}, existeFH{\displaystyle f\in {\mathcal {H}}}de tal manera que [ 16 ]

límite superiornortemi[FFnorte^L2([0,1])2]ψnorte1.{\displaystyle \limsup _{n\to \infty }{\frac {\mathbb {E} [\lVert f-{\hat {f_{n}}}\rVert _{L^{2}([0,1])}^{2}]}{\psi _{n}}}\geq 1.}

Por lo tanto, las opciones comunes paraF{\displaystyle {\mathcal {F}}}son:

  • F=doα([0,1]d),α>0{\displaystyle {\mathcal {F}}=C^{\alpha }([0,1]^{d}),\alpha >0}: El espacio deα{\displaystyle \lfloor \alpha \rfloor }-veces funciones diferenciables con la derivada más alta siendo(αα){\displaystyle (\alpha -\lfloor \alpha \rfloor )}- Sostener - suave.
  • F=Wk,q([0,1]d),knorte,q>d{\displaystyle {\mathcal {F}}=W^{k,q}([0,1]^{d}),k\in \mathbb {N} ,q>d}: El espacio de funciones suaves de Sobolev conLq{\displaystyle L^{q}}-derivadas débiles integrables .

Opciones comunes paraL{\displaystyle L}son:

  • L(F,gramo)=(F(incógnita0)gramo(incógnita0))2,incógnita0[0,1]d{\displaystyle L(f,g)=(f(x_{0})-g(x_{0}))^{2},x_{0}\in [0,1]^{d}}: El error cuadrático medio (ECM) puntual.
  • L(F,gramo)=FgramoLpag([0,1]d),pag[1,){\displaystyle L(f,g)=\lVert f-g\rVert _{L^{p}([0,1]^{d})},p\in [1,\infty )}: Elpag{\displaystyle p}norma -ésima.
  • L(F,gramo)=FgramoL([0,1]d){\displaystyle L(f,g)=\lVert f-g\rVert _{L^{\infty }([0,1]^{d})}}: La distancia de norma suprema .

Bajo ciertas suposiciones técnicas, se conocen los siguientes límites inferiores.

Algunos estimadores polinomiales locales son óptimos minimax con respecto al MSE,L2{\displaystyle L^{2}}yL{\displaystyle L^{\infty }}bajoH=doα([0,1]d){\displaystyle {\mathcal {H}}=C^{\alpha }([0,1]^{d})}para arbitrarioα>0{\displaystyle \alpha >0}cuando el ancho de banda es de ordenO(norte12α+d){\displaystyle {\mathcal {O}}(n^{-{\frac {1}{2\alpha +d}}})}. [ 21 ] Los kNN también son óptimos minimax con respecto al MSE bajoH=do2([0,1]d){\displaystyle {\mathcal {H}}=C^{2}([0,1]^{d})}y con respectoL2{\displaystyle L^{2}}bajoH=do1([0,1]d){\displaystyle {\mathcal {H}}=C^{1}([0,1]^{d})}cuando el número de vecinos considerados es de ordenO(norte1d+4){\displaystyle {\mathcal {O}}(n^{\frac {1}{d+4}})}yO(norte1d+2){\displaystyle {\mathcal {O}}(n^{\frac {1}{d+2}})}respectivamente. [ 22 ]

Adaptabilidad

La elección de los hiperparámetros del modelo (por ejemplo, el ancho de banda para los métodos de núcleo o el número de vecinos para kNN) necesarios para lograr la tasa de convergencia óptima generalmente depende del parámetro de suavidad de la función objetivo desconocida, lo que significa que, en la práctica, sin una estimación adecuada de los hiperparámetros, los métodos mencionados anteriormente no son óptimos.

En cambio, interesan los métodos que logran las tasas de convergencia óptimas minimax no solo para un parámetro de suavidad específico, sino para diferentes valores. Sea la clase de hipótesis de la formaH=β>0Hβ{\displaystyle {\mathcal {H}}=\bigcup _{\beta >0}{\mathcal {H}}_{\beta }}(Por ejemploHβ=doβ([0,1]d){\displaystyle {\mathcal {H}}_{\beta }=C^{\beta }([0,1]^{d})}oHβ=Hβ([0,1]d){\displaystyle {\mathcal {H}}_{\beta }=H^{\beta }([0,1]^{d})}) y dejaψnorteβ{\displaystyle \psi _{n}^{\beta }}ser tasa de convergencia óptima enHβ{\displaystyle {\mathcal {H}}_{\beta }}. Luego, una familia de estimadores(Fnorte^)nortenorte{\displaystyle ({\hat {f_{n}}})_{n\in \mathbb {N} }}Se denomina adaptativo en el sentido minimax , si existe una constantedo(β){\displaystyle C(\beta )}dependiendo únicamente deβ{\displaystyle \beta }de tal manera que [ 23 ]

sorberFHβmi[L(Fnorte^,F)]do(β)ψnorteβ,β>0,nortenorte.{\displaystyle \sup _{f\in {\mathcal {H}}_{\beta }}\mathbb {E} [L({\hat {f_{n}}},f)]\leq C(\beta )\psi _{n}^{\beta },\quad \forall \beta >0,\quad \forall n\in \mathbb {N} .}

En otras palabras, se requiere un estimador adaptativo para lograr la tasa de convergencia minimax en todas las clases de hipótesis.Hβ{\displaystyle {\mathcal {H}}_{\beta }}pero sin tomar el parámetro desconocidoβ{\displaystyle \beta }como argumento. Los estimadores adaptativos a menudo se implementan tomando estimadores que son óptimos minimax para una familia de clases de hipótesis y estimando los hiperparámetros a través de un procedimiento de nivel superior, como la validación cruzada , o mediante penalización de complejidad. [ 24 ]

Historia

Las primeras estadísticas no paramétricas incluyen la mediana (siglo XIII o anterior, utilizada en la estimación por Edward Wright , 1599; véase Mediana §  Historia ) y la prueba de signos de John Arbuthnot (1710) para analizar la proporción de sexos humanos al nacer (véase Prueba de signos §  Historia ). [ 25 ] [ 26 ]

Véase también

Notas

  1. "Estadística no paramétrica" . Springer Texts in Statistics . 2006. doi : 10.1007/0-387-30623-4 . ISBN 978-0-387-25145-5.
  2. Pearce, J; Derrick, B (2019). "Pruebas preliminares: ¿El diablo de la estadística?" . Reinvention: An International Journal of Undergraduate Research . 12 (2). doi : 10.31273/reinvention.v12i2.339 .
  3. Stuart A., Ord JK, Arnold S. (1999), Teoría avanzada de la estadística de Kendall: Volumen 2A—Inferencia clásica y el modelo lineal , sexta edición, §20.2–20.3 ( Arnold ).
  4. Adikaram, KKLB; Hussein, MA; Effenberger, M.; Becker, T. (16 de noviembre de 2015). "Identificación de ajuste lineal universal: un método independiente de datos, valores atípicos y modelo de distribución de ruido y libre de imputación de datos faltantes o eliminados" . PLOS ONE . 10 (11) e0141486. ​​Bibcode : 2015PLoSO..1041486A . doi : 10.1371 / journal.pone.0141486 . ​​ISSN 1932-6203 . PMC 4646355. PMID 26571035 .   
  5. Györfi y otros. 2002 , pág. 9-12.
  6. Tsybakov 2009 , pág. 1.
  7. Tsybakov 2009 , pág. vii.
  8. Györfi y otros. 2002 , pág. 13.
  9. Györfi y otros. 2002 , pág. 72, 81, 88.
  10. ^ Triebel, Hans (1983). Teoría de los espacios funcionales . Monografías en matemáticas. Birkhäuser Verlag. ISBN 9783764313814.
  11. 1 2 Yang, Yuhong; Barron, Andrew (1999). "Determinación teórica de la información de las tasas de convergencia minimax" . Annals of Statistics . 27 (5): 1564– 1599.
  12. Niles-Weed, Jonathan; Berthet, Quentin (2022). "Estimación minimax de densidades suaves en la distancia de Wasserstein" . Annals of Statistics . 50 (3): 1519–1540 .
  13. Boyd, David W.; Steele, J. Michael (1978). "Límites inferiores para las tasas de estimación de densidad no paramétrica". Annals of Statistics . 6 (4): 932– 934.
  14. Tsybakov 2009 , pág. 15.
  15. Oko, Kazusato; Akiyama, Shunta; Suzuki, Taiji (2023). "Los modelos de difusión son estimadores de distribución óptimos minimax" . Actas de la 40.ª Conferencia Internacional sobre Aprendizaje Automático . 202 : 26517–26582 .
  16. Györfi y otros. 2002 , pág. 32.
  17. Tsybakov 2009 , pág. 95, 132.
  18. Tsybakov 2009 , pág. 107.
  19. 1 2 3 4 Nemirovski, Arkadi (2000). Temas de estadística no paramétrica . págs. 5–31 . 
  20. Tsybakov 2009 , págs. 110, 132.
  21. Tsybakov 2009 , págs. 40, 44.
  22. Györfi y otros. 2002 , págs. 93–96.
  23. Tsybakov 2009 , pág. 180.
  24. Györfi y otros. 2002 , pág. 14-15, 26-28.
  25. Conover, WJ (1999), "Capítulo 3.4: La prueba de signos", Estadística no paramétrica práctica (Tercera ed.), Wiley, págs. 157–176 , ISBN   0-471-16068-7
  26. Sprent, P. (1989), Métodos estadísticos no paramétricos aplicados (Segunda edición), Chapman & Hall, ISBN  0-412-44980-3

Referencias generales

  • Bagdonavicius, V., Kruopis, J., Nikulin, MS (2011). "Pruebas no paramétricas para datos completos", ISTE & WILEY: Londres y Hoboken. ISBN 978-1-84821-269-5.
  • Corder, GW; Foreman, DI (2014). Estadística no paramétrica: un enfoque paso a paso . Wiley. ISBN 978-1-118-84031-3.
  • Gibbons, Jean Dickinson ; Chakraborti, Subhabrata (2003). Inferencia estadística no paramétrica , 4.ª ed. CRC Press. ISBN 0-8247-4052-1.
  • Györfi, László; Kohler, Michael; Krzyzak, Adán; Paseo, Harro (2002). Una teoría de la regresión no paramétrica sin distribución . Saltador. ISBN 0-387-95441-4.
  • Hettmansperger, TP; McKean, JW (1998). Métodos estadísticos no paramétricos robustos . Biblioteca de estadística de Kendall. Vol.  5. Londres: Edward Arnold . ISBN 0-340-54937-8MR 1604954 .​ también ISBN 0-471-19479-4.
  • Hollander M., Wolfe DA, Chicken E. (2014). Métodos estadísticos no paramétricos , John Wiley & Sons.
  • Sheskin, David J. (2003) Manual de procedimientos estadísticos paramétricos y no paramétricos . CRC Press. ISBN 1-58488-440-1
  • Tsybakov, Alexandre B. (2009). Introducción a la estimación no paramétrica . Springer. ISBN 978-0-387-79051-0.
  • Wasserman, Larry (2007). Estadística no paramétrica completa , Springer. ISBN 0-387-25145-6.