Articulo de referencia

Estadística suficiente

En estadística , la suficiencia es una propiedad de un estadístico calculado sobre un conjunto de datos de muestra en relación con un modelo paramétrico de dicho conjunto. Un es...

En estadística , la suficiencia es una propiedad de un estadístico calculado sobre un conjunto de datos de muestra en relación con un modelo paramétrico de dicho conjunto. Un estadístico suficiente para un parámetro del modelo contiene toda la información que el conjunto de datos proporciona sobre ese parámetro. Está estrechamente relacionado con los conceptos de estadístico auxiliar, que no contiene información sobre los parámetros del modelo, y de estadístico completo, que solo contiene información sobre los parámetros y no información auxiliar.

Un concepto relacionado es el de suficiencia lineal , que es más débil que la suficiencia pero puede aplicarse en algunos casos donde no hay estadística suficiente, aunque está restringido a estimadores lineales. [ 1 ] La función de estructura de Kolmogorov trata con datos finitos individuales; la noción relacionada allí es la estadística suficiente algorítmica.

El concepto se debe a Sir Ronald Fisher en 1920. [ 2 ] Stephen Stigler señaló en 1973 que el concepto de suficiencia había caído en desuso en la estadística descriptiva debido a la fuerte dependencia de una suposición sobre la forma de la distribución (véase el teorema de Pitman-Koopman-Darmois más adelante), pero seguía siendo muy importante en el trabajo teórico. [ 3 ]

Fondo

Aproximadamente, dado un conjuntoincógnita{\displaystyle \mathbf {X} }de datos independientes e idénticamente distribuidos condicionados a un parámetro desconocidoθ{\displaystyle \theta }, una estadística suficiente es una funciónT(incógnita){\displaystyle T(\mathbf {X} )}cuyo valor contiene toda la información necesaria para calcular cualquier estimación del parámetro (por ejemplo, una estimación de máxima verosimilitud ). Debido al teorema de factorización ( véase más abajo ), para una estadística suficienteT(incógnita){\displaystyle T(\mathbf {X} )}, la densidad de probabilidad se puede escribir comoFincógnita(incógnita;θ)=h(incógnita)gramo(θ,T(incógnita)){\displaystyle f_{\mathbf {X} }(x;\theta )=h(x)\,g(\theta ,T(\mathbf {X} ))}. A partir de esta factorización, se puede ver fácilmente que la estimación de máxima verosimilitud deθ{\displaystyle \theta }interactuará conincógnita{\displaystyle \mathbf {X} }solo a través deT(incógnita){\displaystyle T(\mathbf {X} )}Normalmente, el estadístico suficiente es una función simple de los datos, por ejemplo, la suma de todos los puntos de datos.

En términos más generales, el "parámetro desconocido" puede representar un vector de cantidades desconocidas o todo lo que se desconoce o no está completamente especificado sobre el modelo. En tal caso, el estadístico suficiente puede ser un conjunto de funciones, denominado estadístico suficientemente conjunto . Normalmente, hay tantas funciones como parámetros. Por ejemplo, para una distribución gaussiana con media y varianza desconocidas , el estadístico suficientemente conjunto, a partir del cual se pueden estimar las estimaciones de máxima verosimilitud de ambos parámetros, consta de dos funciones: la suma de todos los puntos de datos y la suma de todos los puntos de datos al cuadrado (o, equivalentemente, la media muestral y la varianza muestral ).

En otras palabras, la distribución de probabilidad conjunta de los datos es condicionalmente independiente del parámetro dado el valor del estadístico suficiente para dicho parámetro . Tanto el estadístico como el parámetro subyacente pueden ser vectores.

Definición matemática

Un estadístico t  = T ( X ) es suficiente para el parámetro subyacente θ precisamente si la distribución de probabilidad condicional de los datos X , dado el estadístico t = T ( X ), no depende del parámetro θ . [ 4 ]   

Alternativamente, se puede decir que la estadística T ( X ) es suficiente para θ si, para todas las distribuciones previas de θ , la información mutua entre θ y T(X) es igual a la información mutua entre θ y X. [ 5 ] En otras palabras, la desigualdad del procesamiento de datos se convierte en una igualdad: 

I(θ;T(incógnita))=I(θ;incógnita){\displaystyle I{\bigl (}\theta ;T(X){\bigr )}=I(\theta ;X)}

Ejemplo

Por ejemplo, la media muestral es suficiente para la media (desconocida) μ de una distribución normal con varianza conocida. Una vez conocida la media muestral, no se puede obtener más información sobre μ a partir de la muestra misma. Por otro lado, para una distribución arbitraria, la mediana no es suficiente para la media: incluso si se conoce la mediana de la muestra, conocer la muestra misma proporcionaría información adicional sobre la media poblacional. Por ejemplo, si las observaciones menores que la mediana son solo ligeramente inferiores, pero las observaciones mayores que la superan la superan considerablemente, esto influiría en la inferencia sobre la media poblacional.

Teorema de factorización de Fisher-Neyman

El teorema de factorización de Fisher o criterio de factorización proporciona una caracterización conveniente de una estadística suficiente. Si la función de densidad de probabilidad es ƒ( x;θ ), donde θ es un parámetro, entonces T es suficiente para θ si y solo si se pueden encontrarfunciones no negativas g y h tales que

F(incógnita;θ)=h(incógnita)gramo(θ,T(incógnita)),{\displaystyle f(x;\theta )=h(x)\,g(\theta ,T(x)),}

Es decir, la densidad ƒ puede factorizarse en un producto tal que un factor, h , no depende de θ y el otro factor, que sí depende de θ , depende de x solo a través de T ( x ). Halmos y Savage [ 6 ] dieron una demostración general de esto y el teorema a veces se denomina teorema de factorización de Halmos-Savage. [ 7 ] Las demostraciones que siguen tratan casos especiales, pero se puede dar una demostración general alternativa en la misma línea. [ 8 ] En muchos casos simples, la función de densidad de probabilidad está completamente especificada porθ{\displaystyle \theta }yT(incógnita){\displaystyle T(x)}, yh(incógnita)=1{\displaystyle h(x)=1}(ver ejemplos ).

Es fácil ver que si F ( t ) es una función biyectiva y T es un estadístico suficiente, entonces F ( T ) también es un estadístico suficiente. En particular, podemos multiplicar un estadístico suficiente por una constante distinta de cero y obtener otro estadístico suficiente.

Interpretación del principio de verosimilitud

Una implicación del teorema es que, al utilizar la inferencia basada en la verosimilitud, dos conjuntos de datos que produzcan el mismo valor para el estadístico suficiente T ( X ) siempre darán lugar a las mismas inferencias sobre θ . Según el criterio de factorización, la dependencia de la verosimilitud con respecto a θ solo se da en conjunción con T ( X ). Como esto es igual en ambos casos, la dependencia con respecto a θ también será la misma, lo que dará lugar a inferencias idénticas.

Prueba

Debido a Hogg y Craig. [ 9 ] Dejeincógnita1,incógnita2,,incógnitanorte{\displaystyle X_{1},X_{2},\ldots ,X_{n}}, denotemos una muestra aleatoria de una distribución que tiene la función de densidad de probabilidad f ( x , θ ) para ι < θ < δ . Sea Y 1 = u 1 ( X 1 , X 2 , ..., X n ) un estadístico cuya función de densidad de probabilidad es g 1 ( y 1 ; θ ). Lo que queremos demostrar es que Y 1 = u 1 ( X 1 , X 2 , ..., X n ) es un estadístico suficiente para θ si y solo si, para alguna función H ,               

i=1norteF(incógnitai;θ)=gramo1[1(incógnita1,incógnita2,,incógnitanorte);θ]H(incógnita1,incógnita2,,incógnitanorte).{\displaystyle \prod _{i=1}^{n}f(x_{i};\theta )=g_{1}\left[u_{1}(x_{1},x_{2},\dots ,x_{n});\theta \right]H(x_{1},x_{2},\dots ,x_{n}).}

Primero, supongamos que

i=1norteF(incógnitai;θ)=gramo1[1(incógnita1,incógnita2,,incógnitanorte);θ]H(incógnita1,incógnita2,,incógnitanorte).{\displaystyle \prod _{i=1}^{n}f(x_{i};\theta )=g_{1}\left[u_{1}(x_{1},x_{2},\dots ,x_{n});\theta \right]H(x_{1},x_{2},\dots ,x_{n}).}

Realizaremos la transformación y i  = u i ( x 1 , x 2 , ..., x n ), para i = 1, ..., n , que tiene funciones inversas x i = w i ( y 1 , y 2 , ..., y n ), para i = 1, ..., n , y jacobiano                 J=[wi/yj]{\displaystyle J=\left[w_{i}/y_{j}\right]}. De este modo,

i=1norteF[wi(y1,y2,,ynorte);θ]=|J|gramo1(y1;θ)H[w1(y1,y2,,ynorte),,wnorte(y1,y2,,ynorte)].{\displaystyle \prod _{i=1}^{n}f\left[w_{i}(y_{1},y_{2},\dots ,y_{n});\theta \right]=|J|g_{1}(y_{1};\theta )H\left[w_{1}(y_{1},y_{2},\dots ,y_{n}),\dots ,w_{n}(y_{1},y_{2},\dots ,y_{n})\right].}

El miembro izquierdo es la pdf conjunta g ( y 1 , y 2 , ..., y n ; θ) de Y 1 = u 1 ( X 1 , ..., X n ), ..., Y n = u n ( X 1 , ..., X n ). En el miembro derecho,gramo1(y1;θ){\displaystyle g_{1}(y_{1};\theta )}es el pdf deY1{\displaystyle Y_{1}}, de modo queH[w1,,wnorte]|J|{\displaystyle H[w_{1},\dots ,w_{n}]|J|}es el cociente degramo(y1,,ynorte;θ){\displaystyle g(y_{1},\dots ,y_{n};\theta )}ygramo1(y1;θ){\displaystyle g_{1}(y_{1};\theta )}; es decir, es la PDF condicionalh(y2,,ynortey1;θ){\displaystyle h(y_{2},\dots ,y_{n}\mid y_{1};\theta )}deY2,,Ynorte{\displaystyle Y_{2},\dots ,Y_{n}}dadoY1=y1{\displaystyle Y_{1}=y_{1}}.

PeroH(incógnita1,incógnita2,,incógnitanorte){\displaystyle H(x_{1},x_{2},\dots ,x_{n})}y por lo tantoH[w1(y1,,ynorte),,wnorte(y1,,ynorte))]{\displaystyle H\left[w_{1}(y_{1},\dots ,y_{n}),\dots ,w_{n}(y_{1},\dots ,y_{n}))\right]}, se le dio para no depender deθ{\displaystyle \theta }. Desdeθ{\displaystyle \theta }no se introdujo en la transformación y, por consiguiente, no en el jacobiano.J{\displaystyle J}De ello se deduce queh(y2,,ynortey1;θ){\displaystyle h(y_{2},\dots ,y_{n}\mid y_{1};\theta )}no depende deθ{\displaystyle \theta }y esoY1{\displaystyle Y_{1}}es una estadística suficiente paraθ{\displaystyle \theta }.

Lo contrario se demuestra tomando:

gramo(y1,,ynorte;θ)=gramo1(y1;θ)h(y2,,ynortey1),{\displaystyle g(y_{1},\dots ,y_{n};\theta )=g_{1}(y_{1};\theta )h(y_{2},\dots ,y_{n}\mid y_{1}),}

dóndeh(y2,,ynortey1){\displaystyle h(y_{2},\dots ,y_{n}\mid y_{1})}no depende deθ{\displaystyle \theta }porqueY2...Ynorte{\displaystyle Y_{2}...Y_{n}}depender únicamente deincógnita1...incógnitanorte{\displaystyle X_{1}...X_{n}}, que son independientes deΘ{\displaystyle \Theta }cuando está condicionado porY1{\displaystyle Y_{1}}, una estadística suficiente por hipótesis. Ahora divide ambos miembros por el valor absoluto del jacobiano no nulo.J{\displaystyle J}y reemplazary1,,ynorte{\displaystyle y_{1},\dots ,y_{n}}por las funciones1(incógnita1,,incógnitanorte),,norte(incógnita1,,incógnitanorte){\displaystyle u_{1}(x_{1},\dots ,x_{n}),\dots ,u_{n}(x_{1},\dots ,x_{n})}enincógnita1,,incógnitanorte{\displaystyle x_{1},\dots ,x_{n}}Esto produce

gramo[1(incógnita1,,incógnitanorte),,norte(incógnita1,,incógnitanorte);θ]|J|=gramo1[1(incógnita1,,incógnitanorte);θ]h(2,,norte1)|J|{\displaystyle {\frac {g\left[u_{1}(x_{1},\dots ,x_{n}),\dots ,u_{n}(x_{1},\dots ,x_{n});\theta \right]}{|J^{*}|}}=g_{1}\left[u_{1}(x_{1},\dots ,x_{n});\theta \right]{\frac {h(u_{2},\dots ,u_{n}\mid u_{1})}{|J^{*}|}}}

dóndeJ{\displaystyle J^{*}}es el jacobiano cony1,,ynorte{\displaystyle y_{1},\dots ,y_{n}}reemplazados por su valor en términosincógnita1,,incógnitanorte{\displaystyle x_{1},\dots ,x_{n}}El miembro izquierdo es necesariamente la articulación pdfF(incógnita1;θ)F(incógnitanorte;θ){\displaystyle f(x_{1};\theta )\cdots f(x_{n};\theta )}deincógnita1,,incógnitanorte{\displaystyle X_{1},\dots ,X_{n}}. Desdeh(y2,,ynortey1){\displaystyle h(y_{2},\dots ,y_{n}\mid y_{1})}y por lo tantoh(2,,norte1){\displaystyle h(u_{2},\dots ,u_{n}\mid u_{1})}, no depende deθ{\displaystyle \theta }, entonces

H(incógnita1,,incógnitanorte)=h(2,,norte1)|J|{\displaystyle H(x_{1},\dots ,x_{n})={\frac {h(u_{2},\dots ,u_{n}\mid u_{1})}{|J^{*}|}}}

es una función que no depende deθ{\displaystyle \theta }.

Otra prueba

Una demostración más sencilla e ilustrativa es la siguiente, aunque solo se aplica en el caso discreto.

Utilizamos la notación abreviada para denotar la densidad de probabilidad conjunta de(incógnita,T(incógnita)){\displaystyle (X,T(X))}porFθ(incógnita,t){\displaystyle f_{\theta }(x,t)}. DesdeT{\displaystyle T}es una función determinista deincógnita{\displaystyle X}, tenemosFθ(incógnita,t)=Fθ(incógnita){\displaystyle f_{\theta }(x,t)=f_{\theta }(x)}, mientrast=T(incógnita){\displaystyle t=T(x)}y cero en caso contrario. Por lo tanto:

Fθ(incógnita)=Fθ(incógnita,t)=Fθ(incógnitat)Fθ(t)=F(incógnitat)Fθ(t){\displaystyle {\begin{aligned}f_{\theta }(x)&=f_{\theta }(x,t)\\[5pt]&=f_{\theta }(x\mid t)f_{\theta }(t)\\[5pt]&=f(x\mid t)f_{\theta }(t)\end{aligned}}}

siendo la última igualdad verdadera por definición de estadística suficiente. Por lo tanto,Fθ(incógnita)=a(incógnita)bθ(t){\displaystyle f_{\theta }(x)=a(x)b_{\theta }(t)}cona(incógnita)=Fincógnitat(incógnita){\displaystyle a(x)=f_{X\mid t}(x)}ybθ(t)=Fθ(t){\displaystyle b_{\theta }(t)=f_{\theta }(t)}.

Por el contrario, siFθ(incógnita)=a(incógnita)bθ(t){\displaystyle f_{\theta }(x)=a(x)b_{\theta }(t)}, tenemos

Fθ(t)=incógnita:T(incógnita)=tFθ(incógnita,t)=incógnita:T(incógnita)=tFθ(incógnita)=incógnita:T(incógnita)=ta(incógnita)bθ(t)=(incógnita:T(incógnita)=ta(incógnita))bθ(t).{\displaystyle {\begin{aligned}f_{\theta }(t)&=\sum _{x:T(x)=t}f_{\theta }(x,t)\\[5pt]&=\sum _{x:T(x)=t}f_{\theta }(x)\\[5pt]&=\sum _{x:T(x)=t}a(x)b_{\theta }(t)\\[5pt]&=\left(\sum _{x:T(x)=t}a(x)\right)b_{\theta }(t).\end{aligned}}}

Con la primera igualdad por la definición de pdf para múltiples variables , la segunda por la observación anterior, la tercera por hipótesis y la cuarta porque la suma no es mayor quet{\displaystyle t}.

DejarFincógnitat(incógnita){\displaystyle f_{X\mid t}(x)}denotamos la densidad de probabilidad condicional deincógnita{\displaystyle X}dadoT(incógnita){\displaystyle T(X)}Entonces podemos derivar una expresión explícita para esto:

Fincógnitat(incógnita)=Fθ(incógnita,t)Fθ(t)=Fθ(incógnita)Fθ(t)=a(incógnita)bθ(t)(incógnita:T(incógnita)=ta(incógnita))bθ(t)=a(incógnita)incógnita:T(incógnita)=ta(incógnita).{\displaystyle {\begin{aligned}f_{X\mid t}(x)&={\frac {f_{\theta }(x,t)}{f_{\theta }(t)}}\\[5pt]&={\frac {f_{\theta }(x)}{f_{\theta }(t)}}\\[5pt]&={\frac {a(x)b_{\theta }(t)}{\left(\sum _{x:T(x)=t}a(x)\right)b_{\theta }(t)}}\\[5pt]&={\frac {a(x)}{\sum _{x:T(x)=t}a(x)}}.\end{aligned}}}

Con la primera igualdad por definición de densidad de probabilidad condicional, la segunda por la observación anterior, la tercera por la igualdad demostrada anteriormente y la cuarta por simplificación. Esta expresión no depende deθ{\displaystyle \theta }y por lo tantoT{\displaystyle T}es una estadística suficiente. [ 10 ]

Suficiencia mínima

Un estadístico suficiente es suficientemente mínimo si puede representarse como una función de cualquier otro estadístico suficiente. En otras palabras, S ( X ) es suficientemente mínimo si y solo si [ 11 ]

  1. S ( X ) es suficiente, y
  2. Si T ( X ) es suficiente, entonces existe una función f tal que S ( X ) = f ( T ( X )).

Intuitivamente, una estadística suficiente mínima captura de manera más eficiente toda la información posible sobre el parámetro θ .

Una caracterización útil de la suficiencia mínima es que cuando existe la densidad f θ , S ( X ) es mínimamente suficiente si

Fθ(incógnita)Fθ(y){\displaystyle {\frac {f_{\theta }(x)}{f_{\theta }(y)}}}es independiente de θ  :{\displaystyle \Longleftrightarrow }S ( x ) = S ( y )

Esto se deduce como consecuencia del teorema de factorización de Fisher mencionado anteriormente.

Bahadur, 1954, demostró un caso en el que no existe un estadístico suficiente mínimo. [ 12 ] Sin embargo, bajo condiciones leves, siempre existe un estadístico suficiente mínimo. En particular, en el espacio euclidiano, estas condiciones siempre se cumplen si las variables aleatorias (asociadas conPAGθ{\displaystyle P_{\theta }}) son todas discretas o son todas continuas.

Si existe un estadístico suficiente mínimo, lo cual suele ser el caso, entonces todo estadístico suficiente completo es necesariamente suficiente mínimo [ 13 ] (nótese que esta afirmación no excluye un caso patológico en el que exista un estadístico suficiente completo pero no un estadístico suficiente mínimo). Si bien es difícil encontrar casos en los que no exista un estadístico suficiente mínimo, no es tan difícil encontrar casos en los que no exista un estadístico suficiente completo.

La colección de razones de verosimilitud{L(incógnitaθi)L(incógnitaθ0)}{\displaystyle \left\{{\frac {L(X\mid \theta _{i})}{L(X\mid \theta _{0})}}\right\}}parai=1,...,k{\displaystyle i=1,...,k}es una estadística suficiente mínima si el espacio de parámetros es discreto{θ0,...,θk}{\displaystyle \left\{\theta _{0},...,\theta _{k}\right\}}.

Ejemplos

Distribución de Bernoulli

Si X 1 ,  ..., X n son variables aleatorias independientes con distribución de Bernoulli y valor esperado p , entonces la suma T ( X ) = X 1 + ... + X n es una estadística suficiente para p (aquí 'éxito' corresponde a X i = 1 y 'fracaso' a X i = 0; por lo tanto, T es el número total de éxitos).          

Esto se observa al considerar la distribución de probabilidad conjunta:

Pr{incógnita=incógnita}=Pr{incógnita1=incógnita1,incógnita2=incógnita2,,incógnitanorte=incógnitanorte}.{\displaystyle \Pr\{X=x\}=\Pr\{X_{1}=x_{1},X_{2}=x_{2},\ldots ,X_{n}=x_{n}\}.}

Debido a que las observaciones son independientes, esto se puede escribir como

pagincógnita1(1pag)1incógnita1pagincógnita2(1pag)1incógnita2pagincógnitanorte(1pag)1incógnitanorte{\displaystyle p^{x_{1}}(1-p)^{1-x_{1}}p^{x_{2}}(1-p)^{1-x_{2}}\cdots p^{x_{n}}(1-p)^{1-x_{n}}}

y, agrupando potencias de p y 1  p , se obtiene 

pagincógnitai(1pag)norteincógnitai=pagT(incógnita)(1pag)norteT(incógnita){\displaystyle p^{\sum x_{i}}(1-p)^{n-\sum x_{i}}=p^{T(x)}(1-p)^{n-T(x)}}

que satisface el criterio de factorización, siendo h ( x )  =  1 simplemente una constante.

Nótese la característica crucial: el parámetro desconocido p interactúa con los datos x solo a través de la estadística T ( x ) =  Σ x i . 

Como aplicación concreta, esto proporciona un procedimiento para distinguir una moneda justa de una moneda trucada .

Distribución uniforme

Si X 1 , ..., X n son independientes y están distribuidos uniformemente en el intervalo [0, θ ], entonces T ( X ) = max( X 1 , ..., X n ) es suficiente para θ — el máximo de la muestra es una estadística suficiente para el máximo de la población.

Para ver esto, consideremos la función de densidad de probabilidad conjunta de X ( X 1 ,..., X n ). Debido a que las observaciones son independientes, la pdf se puede escribir como un producto de densidades individuales.  

Fθ(incógnita1,,incógnitanorte)=1θ1{0incógnita1θ}1θ1{0incógnitanorteθ}=1θnorte1{0min{incógnitai}}1{máximo{incógnitai}θ}{\displaystyle {\begin{aligned}f_{\theta }(x_{1},\ldots ,x_{n})&={\frac {1}{\theta }}\mathbf {1} _{\{0\leq x_{1}\leq \theta \}}\cdots {\frac {1}{\theta }}\mathbf {1} _{\{0\leq x_{n}\leq \theta \}}\\[5pt]&={\frac {1}{\theta ^{n}}}\mathbf {1} _{\{0\leq \min\{x_{i}\}\}}\mathbf {1} _{\{\max\{x_{i}\}\leq \theta \}}\end{aligned}}}

donde 1 { ... } es la función indicadora . Por lo tanto, la densidad toma la forma requerida por el teorema de factorización de Fisher-Neyman, donde h ( x )  = 1 {min{ x i }≥0} , y el resto de la expresión es una función solo de θ y T ( x ) = max{ x i }.   

De hecho, el estimador insesgado de mínima varianza (MVUE) para θ es

norte+1norteT(incógnita).{\displaystyle {\frac {n+1}{n}}T(X).}

Este es el máximo de la muestra, escalado para corregir el sesgo , y es MVUE según el teorema de Lehmann-Scheffé . El máximo de la muestra sin escalar T ( X ) es el estimador de máxima verosimilitud para θ .

Distribución uniforme (con dos parámetros)

Siincógnita1,...,incógnitanorte{\displaystyle X_{1},...,X_{n}}son independientes y están distribuidas uniformemente en el intervalo[α,β]{\displaystyle [\alpha ,\beta ]}(dóndeα{\displaystyle \alpha }yβ{\displaystyle \beta }son parámetros desconocidos), entoncesT(incógnita1norte)=(min1inorteincógnitai,máximo1inorteincógnitai){\displaystyle T(X_{1}^{n})=\left(\min _{1\leq i\leq n}X_{i},\max _{1\leq i\leq n}X_{i}\right)}es una estadística suficiente bidimensional para(α,β){\displaystyle (\alpha \,,\,\beta )}.

Para ver esto, consideremos la función de densidad de probabilidad conjunta deincógnita1norte=(incógnita1,,incógnitanorte){\displaystyle X_{1}^{n}=(X_{1},\ldots ,X_{n})}. Debido a que las observaciones son independientes, la pdf se puede escribir como un producto de densidades individuales, es decir

Fincógnita1norte(incógnita1norte)=i=1norte(1βα)1{αincógnitaiβ}=(1βα)norte1{αincógnitaiβ,i=1,,norte}=(1βα)norte1{αmin1inorteincógnitai}1{máximo1inorteincógnitaiβ}.{\displaystyle {\begin{aligned}f_{X_{1}^{n}}(x_{1}^{n})&=\prod _{i=1}^{n}\left({1 \over \beta -\alpha }\right)\mathbf {1} _{\{\alpha \leq x_{i}\leq \beta \}}=\left({1 \over \beta -\alpha }\right)^{n}\mathbf {1} _{\{\alpha \leq x_{i}\leq \beta ,\,\forall \,i=1,\ldots ,n\}}\\&=\left({1 \over \beta -\alpha }\right)^{n}\mathbf {1} _{\{\alpha \,\leq \,\min _{1\leq i\leq n}X_{i}\}}\mathbf {1} _{\{\max _{1\leq i\leq n}X_{i}\,\leq \,\beta \}}.\end{aligned}}}

La densidad conjunta de la muestra toma la forma requerida por el teorema de factorización de Fisher-Neyman, al dejar

h(incógnita1norte)=1,gramo(α,β)(incógnita1norte)=(1βα)norte1{αmin1inorteincógnitai}1{máximo1inorteincógnitaiβ}.{\displaystyle {\begin{aligned}h(x_{1}^{n})=1,\quad g_{(\alpha ,\beta )}(x_{1}^{n})=\left({1 \over \beta -\alpha }\right)^{n}\mathbf {1} _{\{\alpha \,\leq \,\min _{1\leq i\leq n}X_{i}\}}\mathbf {1} _{\{\max _{1\leq i\leq n}X_{i}\,\leq \,\beta \}}.\end{aligned}}}

Desdeh(incógnita1norte){\displaystyle h(x_{1}^{n})}no depende del parámetro(α,β){\displaystyle (\alpha ,\beta )}ygramo(α,β)(incógnita1norte){\displaystyle g_{(\alpha \,,\,\beta )}(x_{1}^{n})}depende únicamente deincógnita1norte{\displaystyle x_{1}^{n}}a través de la funciónT(incógnita1norte)=(min1inorteincógnitai,máximo1inorteincógnitai),{\displaystyle T(X_{1}^{n})=\left(\min _{1\leq i\leq n}X_{i},\max _{1\leq i\leq n}X_{i}\right),}

El teorema de factorización de Fisher-Neyman implicaT(incógnita1norte)=(min1inorteincógnitai,máximo1inorteincógnitai){\displaystyle T(X_{1}^{n})=\left(\min _{1\leq i\leq n}X_{i},\max _{1\leq i\leq n}X_{i}\right)}es una estadística suficiente para(α,β){\displaystyle (\alpha \,,\,\beta )}.

Distribución de Poisson

Si X 1 ,  ..., X n son independientes y tienen una distribución de Poisson con parámetro λ , entonces la suma T ( X ) = X 1 + ... + X n es una estadística suficiente para λ .       

Para ver esto, consideremos la distribución de probabilidad conjunta:

Pr(incógnita=incógnita)=PAG(incógnita1=incógnita1,incógnita2=incógnita2,,incógnitanorte=incógnitanorte).{\displaystyle \Pr(X=x)=P(X_{1}=x_{1},X_{2}=x_{2},\ldots ,X_{n}=x_{n}).}

Debido a que las observaciones son independientes, esto se puede escribir como

miλλincógnita1incógnita1¡miλλincógnita2incógnita2¡miλλincógnitanorteincógnitanorte¡{\displaystyle {e^{-\lambda }\lambda ^{x_{1}} \over x_{1}!}\cdot {e^{-\lambda }\lambda ^{x_{2}} \over x_{2}!}\cdots {e^{-\lambda }\lambda ^{x_{n}} \over x_{n}!}}

que puede escribirse como

minorteλλ(incógnita1+incógnita2++incógnitanorte)1incógnita1¡incógnita2¡incógnitanorte¡{\displaystyle e^{-n\lambda }\lambda ^{(x_{1}+x_{2}+\cdots +x_{n})}\cdot {1 \over x_{1}!x_{2}!\cdots x_{n}!}}

lo que demuestra que se cumple el criterio de factorización, donde h ( x ) es el recíproco del producto de los factoriales. Nótese que el parámetro λ interactúa con los datos solo a través de su suma T ( X ).

Distribución normal

Siincógnita1,,incógnitanorte{\displaystyle X_{1},\ldots ,X_{n}}son independientes y se distribuyen normalmente con un valor esperadoθ{\displaystyle \theta }(un parámetro) y varianza finita conocidaσ2,{\displaystyle \sigma ^{2},}entonces

T(incógnita1norte)=incógnita¯=1nortei=1norteincógnitai{\displaystyle T(X_{1}^{n})={\overline {x}}={\frac {1}{n}}\sum _{i=1}^{n}X_{i}}

es una estadística suficiente paraθ.{\displaystyle \theta .}

Para ver esto, consideremos la función de densidad de probabilidad conjunta deincógnita1norte=(incógnita1,,incógnitanorte){\displaystyle X_{1}^{n}=(X_{1},\dots ,X_{n})}. Debido a que las observaciones son independientes, la pdf se puede escribir como un producto de densidades individuales, es decir

Fincógnita1norte(incógnita1norte)=i=1norte12πσ2exp((incógnitaiθ)22σ2)=(2πσ2)norte2exp(i=1norte(incógnitaiθ)22σ2)=(2πσ2)norte2exp(i=1norte((incógnitaiincógnita¯)(θincógnita¯))22σ2)=(2πσ2)norte2exp(12σ2(i=1norte(incógnitaiincógnita¯)2+i=1norte(θincógnita¯)22i=1norte(incógnitaiincógnita¯)(θincógnita¯)))=(2πσ2)norte2exp(12σ2(i=1norte(incógnitaiincógnita¯)2+norte(θincógnita¯)2))i=1norte(incógnitaiincógnita¯)(θincógnita¯)=0=(2πσ2)norte2exp(12σ2i=1norte(incógnitaiincógnita¯)2)exp(norte2σ2(θincógnita¯)2){\displaystyle {\begin{aligned}f_{X_{1}^{n}}(x_{1}^{n})&=\prod _{i=1}^{n}{\frac {1}{\sqrt {2\pi \sigma ^{2}}}}\exp \left(-{\frac {(x_{i}-\theta )^{2}}{2\sigma ^{2}}}\right)\\[6pt]&=(2\pi \sigma ^{2})^{-{\frac {n}{2}}}\exp \left(-\sum _{i=1}^{n}{\frac {(x_{i}-\theta )^{2}}{2\sigma ^{2}}}\right)\\[6pt]&=(2\pi \sigma ^{2})^{-{\frac {n}{2}}}\exp \left(-\sum _{i=1}^{n}{\frac {\left(\left(x_{i}-{\overline {x}}\right)-\left(\theta -{\overline {x}}\right)\right)^{2}}{2\sigma ^{2}}}\right)\\[6pt]&=(2\pi \sigma ^{2})^{-{\frac {n}{2}}}\exp \left(-{1 \over 2\sigma ^{2}}\left(\sum _{i=1}^{n}(x_{i}-{\overline {x}})^{2}+\sum _{i=1}^{n}(\theta -{\overline {x}})^{2}-2\sum _{i=1}^{n}(x_{i}-{\overline {x}})(\theta -{\overline {x}})\right)\right)\\[6pt]&=(2\pi \sigma ^{2})^{-{\frac {n}{2}}}\exp \left(-{1 \over 2\sigma ^{2}}\left(\sum _{i=1}^{n}(x_{i}-{\overline {x}})^{2}+n(\theta -{\overline {x}})^{2}\right)\right)&&\sum _{i=1}^{n}(x_{i}-{\overline {x}})(\theta -{\overline {x}})=0\\[6pt]&=(2\pi \sigma ^{2})^{-{\frac {n}{2}}}\exp \left(-{1 \over 2\sigma ^{2}}\sum _{i=1}^{n}(x_{i}-{\overline {x}})^{2}\right)\exp \left(-{\frac {n}{2\sigma ^{2}}}(\theta -{\overline {x}})^{2}\right)\end{aligned}}}

La densidad conjunta de la muestra toma la forma requerida por el teorema de factorización de Fisher-Neyman, al dejar

h(incógnita1norte)=(2πσ2)norte2exp(12σ2i=1norte(incógnitaiincógnita¯)2)gramoθ(incógnita1norte)=exp(norte2σ2(θincógnita¯)2){\displaystyle {\begin{aligned}h(x_{1}^{n})&=(2\pi \sigma ^{2})^{-{\frac {n}{2}}}\exp \left(-{1 \over 2\sigma ^{2}}\sum _{i=1}^{n}(x_{i}-{\overline {x}})^{2}\right)\\[6pt]g_{\theta }(x_{1}^{n})&=\exp \left(-{\frac {n}{2\sigma ^{2}}}(\theta -{\overline {x}})^{2}\right)\end{aligned}}}

Desdeh(incógnita1norte){\displaystyle h(x_{1}^{n})}no depende del parámetroθ{\displaystyle \theta }ygramoθ(incógnita1norte){\displaystyle g_{\theta }(x_{1}^{n})}depende únicamente deincógnita1norte{\displaystyle x_{1}^{n}}a través de la función

T(incógnita1norte)=incógnita¯=1nortei=1norteincógnitai,{\displaystyle T(X_{1}^{n})={\overline {x}}={\frac {1}{n}}\sum _{i=1}^{n}X_{i},}

El teorema de factorización de Fisher-Neyman implicaT(incógnita1norte){\displaystyle T(X_{1}^{n})}es una estadística suficiente paraθ{\displaystyle \theta }.

Siσ2{\displaystyle \sigma ^{2}}es desconocido y desdes2=1norte1i=1norte(incógnitaiincógnita¯)2{\displaystyle s^{2}={\frac {1}{n-1}}\sum _{i=1}^{n}\left(x_{i}-{\overline {x}}\right)^{2}}, la probabilidad anterior se puede reescribir como

Fincógnita1norte(incógnita1norte)=(2πσ2)norte/2exp(norte12σ2s2)exp(norte2σ2(θincógnita¯)2).{\displaystyle {\begin{aligned}f_{X_{1}^{n}}(x_{1}^{n})=(2\pi \sigma ^{2})^{-n/2}\exp \left(-{\frac {n-1}{2\sigma ^{2}}}s^{2}\right)\exp \left(-{\frac {n}{2\sigma ^{2}}}(\theta -{\overline {x}})^{2}\right).\end{aligned}}}

El teorema de factorización de Fisher-Neyman sigue vigente e implica que(incógnita¯,s2){\displaystyle ({\overline {x}},s^{2})}es una estadística suficiente conjunta para(θ,σ2){\displaystyle (\theta ,\sigma ^{2})}.

Distribución exponencial

Siincógnita1,,incógnitanorte{\displaystyle X_{1},\dots ,X_{n}}son independientes y se distribuyen exponencialmente con un valor esperado θ (un parámetro positivo real desconocido), entoncesT(incógnita1norte)=i=1norteincógnitai{\displaystyle T(X_{1}^{n})=\sum _{i=1}^{n}X_{i}}es una estadística suficiente para θ.

Para ver esto, consideremos la función de densidad de probabilidad conjunta deincógnita1norte=(incógnita1,,incógnitanorte){\displaystyle X_{1}^{n}=(X_{1},\dots ,X_{n})}. Debido a que las observaciones son independientes, la pdf se puede escribir como un producto de densidades individuales, es decir

Fincógnita1norte(incógnita1norte)=i=1norte1θmi1θincógnitai=1θnortemi1θi=1norteincógnitai.{\displaystyle {\begin{aligned}f_{X_{1}^{n}}(x_{1}^{n})&=\prod _{i=1}^{n}{1 \over \theta }\,e^{{-1 \over \theta }x_{i}}={1 \over \theta ^{n}}\,e^{{-1 \over \theta }\sum _{i=1}^{n}x_{i}}.\end{aligned}}}

La densidad conjunta de la muestra toma la forma requerida por el teorema de factorización de Fisher-Neyman, al dejar

h(incógnita1norte)=1,gramoθ(incógnita1norte)=1θnortemi1θi=1norteincógnitai.{\displaystyle {\begin{aligned}h(x_{1}^{n})=1,\,\,\,g_{\theta }(x_{1}^{n})={1 \over \theta ^{n}}\,e^{{-1 \over \theta }\sum _{i=1}^{n}x_{i}}.\end{aligned}}}

Desdeh(incógnita1norte){\displaystyle h(x_{1}^{n})}no depende del parámetroθ{\displaystyle \theta }ygramoθ(incógnita1norte){\displaystyle g_{\theta }(x_{1}^{n})}depende únicamente deincógnita1norte{\displaystyle x_{1}^{n}}a través de la funciónT(incógnita1norte)=i=1norteincógnitai{\displaystyle T(X_{1}^{n})=\sum _{i=1}^{n}X_{i}}

El teorema de factorización de Fisher-Neyman implicaT(incógnita1norte)=i=1norteincógnitai{\displaystyle T(X_{1}^{n})=\sum _{i=1}^{n}X_{i}}es una estadística suficiente paraθ{\displaystyle \theta }.

Distribución gamma

Siincógnita1,,incógnitanorte{\displaystyle X_{1},\dots ,X_{n}}son independientes y se distribuyen como unΓ(α,β){\displaystyle \Gamma (\alpha \,,\,\beta )}, dóndeα{\displaystyle \alpha }yβ{\displaystyle \beta }son parámetros desconocidos de una distribución Gamma , entoncesT(incógnita1norte)=(i=1norteincógnitai,i=1norteincógnitai){\displaystyle T(X_{1}^{n})=\left(\prod _{i=1}^{n}{X_{i}},\sum _{i=1}^{n}X_{i}\right)}es una estadística suficiente bidimensional para(α,β){\displaystyle (\alpha ,\beta )}.

Para ver esto, consideremos la función de densidad de probabilidad conjunta deincógnita1norte=(incógnita1,,incógnitanorte){\displaystyle X_{1}^{n}=(X_{1},\dots ,X_{n})}. Debido a que las observaciones son independientes, la pdf se puede escribir como un producto de densidades individuales, es decir

Fincógnita1norte(incógnita1norte)=i=1norte(1Γ(α)βα)incógnitaiα1mi(1/β)incógnitai=(1Γ(α)βα)norte(i=1norteincógnitai)α1mi1βi=1norteincógnitai.{\displaystyle {\begin{aligned}f_{X_{1}^{n}}(x_{1}^{n})&=\prod _{i=1}^{n}\left({1 \over \Gamma (\alpha )\beta ^{\alpha }}\right)x_{i}^{\alpha -1}e^{(-1/\beta )x_{i}}\\[5pt]&=\left({1 \over \Gamma (\alpha )\beta ^{\alpha }}\right)^{n}\left(\prod _{i=1}^{n}x_{i}\right)^{\alpha -1}e^{{-1 \over \beta }\sum _{i=1}^{n}x_{i}}.\end{aligned}}}

La densidad conjunta de la muestra toma la forma requerida por el teorema de factorización de Fisher-Neyman, al dejar

h(incógnita1norte)=1,gramo(α,β)(incógnita1norte)=(1Γ(α)βα)norte(i=1norteincógnitai)α1mi1βi=1norteincógnitai.{\displaystyle {\begin{aligned}h(x_{1}^{n})=1,\,\,\,g_{(\alpha \,,\,\beta )}(x_{1}^{n})=\left({1 \over \Gamma (\alpha )\beta ^{\alpha }}\right)^{n}\left(\prod _{i=1}^{n}x_{i}\right)^{\alpha -1}e^{{-1 \over \beta }\sum _{i=1}^{n}x_{i}}.\end{aligned}}}

Desdeh(incógnita1norte){\displaystyle h(x_{1}^{n})}no depende del parámetro(α,β){\displaystyle (\alpha \,,\,\beta )}ygramo(α,β)(incógnita1norte){\displaystyle g_{(\alpha \,,\,\beta )}(x_{1}^{n})}depende únicamente deincógnita1norte{\displaystyle x_{1}^{n}}a través de la funciónT(incógnita1norte)=(i=1norteincógnitai,i=1norteincógnitai),{\displaystyle T(x_{1}^{n})=\left(\prod _{i=1}^{n}x_{i},\sum _{i=1}^{n}x_{i}\right),}

El teorema de factorización de Fisher-Neyman implicaT(incógnita1norte)=(i=1norteincógnitai,i=1norteincógnitai){\displaystyle T(X_{1}^{n})=\left(\prod _{i=1}^{n}X_{i},\sum _{i=1}^{n}X_{i}\right)}es una estadística suficiente para(α,β).{\displaystyle (\alpha \,,\,\beta ).}

Teorema de Rao-Blackwell

La suficiencia encuentra una aplicación útil en el teorema de Rao-Blackwell , que establece que si g ( X ) es cualquier tipo de estimador de θ , entonces, por lo general, la esperanza condicional de g ( X ) dado el estadístico suficiente T ( X ) es un mejor estimador de θ (en el sentido de tener menor varianza ) y nunca es peor. A veces, se puede construir fácilmente un estimador muy simple g ( X ) y luego evaluar ese valor esperado condicional para obtener un estimador que, en varios sentidos, es óptimo.

Familia exponencial

Según el teorema de Pitman-Koopman-Darmois, entre las familias de distribuciones de probabilidad cuyo dominio no varía con el parámetro que se estima, solo en las familias exponenciales existe un estadístico suficiente cuya dimensión permanece acotada a medida que aumenta el tamaño de la muestra. Intuitivamente, esto indica que las familias de distribuciones no exponenciales en la recta real requieren estadísticos no paramétricos para capturar completamente la información de los datos.

Menos concisamente, supongamosincógnitanorte,norte=1,2,3,{\displaystyle X_{n},n=1,2,3,\dots }son variables aleatorias reales independientes e idénticamente distribuidas cuya distribución se sabe que pertenece a alguna familia de distribuciones de probabilidad, parametrizadas porθ{\displaystyle \theta }, que satisface ciertas condiciones de regularidad técnica, entonces esa familia es una familia exponencial si y solo si existe unaRmetro{\displaystyle \mathbb {R} ^{m}}estadístico suficiente con valorT(incógnita1,,incógnitanorte){\displaystyle T(X_{1},\dots ,X_{n})}cuyo número de componentes escalaresmetro{\displaystyle m}no aumenta a medida que aumenta el tamaño de la muestra n . [ 14 ]

Este teorema muestra que la existencia de una estadística suficiente de dimensión finita y con valores vectoriales reales restringe drásticamente las posibles formas de una familia de distribuciones en la línea real .

Cuando los parámetros o las variables aleatorias ya no son de valor real, la situación es más compleja. [ 15 ]

Otros tipos de suficiencia

Suficiencia bayesiana

Una formulación alternativa de la condición de que un estadístico sea suficiente, establecida en un contexto bayesiano, involucra las distribuciones posteriores obtenidas al usar el conjunto de datos completo y al usar solo un estadístico. Por lo tanto, el requisito es que, para casi todo x ,

Pr(θincógnita=incógnita)=Pr(θT(incógnita)=t(incógnita)).{\displaystyle \Pr(\theta \mid X=x)=\Pr(\theta \mid T(X)=t(x)).}

De forma más general, sin asumir un modelo paramétrico, podemos decir que la estadística T es suficientemente predictiva si

Pr(incógnita=incógnitaincógnita=incógnita)=Pr(incógnita=incógnitaT(incógnita)=t(incógnita)).{\displaystyle \Pr(X'=x'\mid X=x)=\Pr(X'=x'\mid T(X)=t(x)).}

Resulta que esta "suficiencia bayesiana" es una consecuencia de la formulación anterior, [ 16 ] sin embargo, no son directamente equivalentes en el caso de dimensión infinita. [ 17 ] Existe una variedad de resultados teóricos sobre la suficiencia en un contexto bayesiano. [ 18 ]

Suficiencia lineal

Un concepto llamado "suficiencia lineal" puede formularse en un contexto bayesiano, [ 19 ] y de forma más general. [ 20 ] Primero definimos el mejor predictor lineal de un vector Y basado en X comomi^[Yincógnita]{\displaystyle {\hat {E}}[Y\mid X]}. Entonces, una estadística lineal T ( x ) es lineal suficiente [ 21 ] si

mi^[θincógnita]=mi^[θT(incógnita)].{\displaystyle {\hat {E}}[\theta \mid X]={\hat {E}}[\theta \mid T(X)].}

Véase también

Notas

  1. Dodge, Y. (2003) — entrada para suficiencia lineal
  2. Fisher, RA (1922). "Sobre los fundamentos matemáticos de la estadística teórica" . Philosophical Transactions of the Royal Society A. 222 ( 594–604 ) : 309–368 . Bibcode : 1922RSPTA.222..309F . doi : 10.1098/rsta.1922.0009 . hdl : 2440/15172 . JFM 48.1280.02 . JSTOR 91208 .  
  3. Stigler, Stephen (diciembre de 1973). "Estudios sobre la historia de la probabilidad y la estadística. XXXII: Laplace, Fisher y el descubrimiento del concepto de suficiencia". Biometrika . 60 ( 3): 439– 445. doi : 10.1093/biomet/60.3.439 . JSTOR 2334992. MR 0326872 .  
  4. Casella, George ; Berger, Roger L. (2002). Inferencia estadística, 2.ª ed . Duxbury Press.
  5. Cover, Thomas M. (2006). Elementos de la teoría de la información . Joy A. Thomas (2.ª ed.). Hoboken, NJ: Wiley-Interscience. p. 36. ISBN   0-471-24195-4OCLC 59879802 
  6. Halmos, PR; Savage, LJ (1949). "Aplicación del teorema de Radon-Nikodym a la teoría de la estadística suficiente" . The Annals of Mathematical Statistics . 20 (2): 225– 241. doi : 10.1214/aoms/1177730032 . ISSN 0003-4851 . 
  7. "Teorema de factorización - Enciclopedia de Matemáticas" . encyclopediaofmath.org . Consultado el 7 de septiembre de 2022 .
  8. Taraldsen, G. (2022). "El teorema de factorización para la suficiencia". Preimpresión . doi : 10.13140/RG.2.2.15068.87687 .
  9. Hogg, Robert V.; Craig, Allen T. (1995). Introducción a la estadística matemática . Prentice Hall. ISBN 978-0-02-355722-4.
  10. "El teorema de factorización de Fisher-Neyman" .Página web de Connexions (cnx.org)
  11. Dodge (2003) — entrada para estadísticas suficientes mínimas
  12. Lehmann y Casella (1998), Teoría de la estimación puntual , 2.ª edición, Springer, pág. 37
  13. Lehmann y Casella (1998), Teoría de la estimación puntual , 2.ª edición, Springer, página 42
  14. Tikochinsky, Y.; Tishby, NZ; Levine, RD (1984-11-01). "Enfoque alternativo para la inferencia de máxima entropía" . Physical Review A. 30 ( 5): 2638– 2644. Bibcode : 1984PhRvA..30.2638T . doi : 10.1103/physreva.30.2638 . ISSN 0556-2791 . 
  15. Andersen, Erling Bernhard (septiembre de 1970). "Suficiencia y familias exponenciales para espacios muestrales discretos" . Journal of the American Statistical Association . 65 (331): 1248– 1255. doi : 10.1080/01621459.1970.10481160 . ISSN 0162-1459 . 
  16. Bernardo, JM ; Smith, AFM (1994). "Sección 5.1.4". Teoría bayesiana . Wiley. ISBN 0-471-92416-4.
  17. Blackwell, D. ; Ramamoorthi, RV (1982). "Una estadística bayesiana pero no clásicamente suficiente" . Annals of Statistics . 10 (3): 1025– 1026. doi : 10.1214/aos/1176345895 . MR 0663456 . Zbl 0485.62004 .  
  18. Nogales, AG; Oyola, JA; Pérez, P. (2000). "Sobre la independencia condicional y la relación entre suficiencia e invariancia desde el punto de vista bayesiano" . Statistics & Probability Letters . 46 (1): 75– 84. doi : 10.1016/S0167-7152(99)00089-9 . MR 1731351. Zbl 0964.62003 .  
  19. Goldstein, M.; O'Hagan, A. (1996). "Suficiencia lineal bayesiana y sistemas de evaluaciones posteriores de expertos". Journal of the Royal Statistical Society . Serie B. 58 (2): 301– 316. doi : 10.1111/j.2517-6161.1996.tb02083.x . JSTOR 2345978 . 
  20. Godambe, VP (1966). "Un nuevo enfoque para el muestreo de poblaciones finitas. II Suficiencia libre de distribución". Journal of the Royal Statistical Society . Serie B. 28 (2): 320– 328. doi : 10.1111/j.2517-6161.1966.tb00645.x . JSTOR 2984375 . 
  21. Witting, T. (1987). "La propiedad lineal de Markov en la teoría de la credibilidad" . ASTIN Bulletin . 17 (1): 71– 84. doi : 10.2143/ast.17.1.2014984 . hdl : 20.500.11850/422507 .

Referencias

  • Kholevo, AS (2001) [1994], "Estadística suficiente" , Enciclopedia de Matemáticas , EMS Press
  • Lehmann, EL; Casella, G. (1998). Teoría de la estimación puntual (2.ª  ed.). Springer. Capítulo 4. ISBN 0-387-98502-6.
  • Dodge, Y. (2003) The Oxford Dictionary of Statistical Terms , OUP. ISBN 0-19-920613-9