En estadística , la suficiencia es una propiedad de un estadístico calculado sobre un conjunto de datos de muestra en relación con un modelo paramétrico de dicho conjunto. Un estadístico suficiente para un parámetro del modelo contiene toda la información que el conjunto de datos proporciona sobre ese parámetro. Está estrechamente relacionado con los conceptos de estadístico auxiliar, que no contiene información sobre los parámetros del modelo, y de estadístico completo, que solo contiene información sobre los parámetros y no información auxiliar.
Un concepto relacionado es el de suficiencia lineal , que es más débil que la suficiencia pero puede aplicarse en algunos casos donde no hay estadística suficiente, aunque está restringido a estimadores lineales. [ 1 ] La función de estructura de Kolmogorov trata con datos finitos individuales; la noción relacionada allí es la estadística suficiente algorítmica.
El concepto se debe a Sir Ronald Fisher en 1920. [ 2 ] Stephen Stigler señaló en 1973 que el concepto de suficiencia había caído en desuso en la estadística descriptiva debido a la fuerte dependencia de una suposición sobre la forma de la distribución (véase el teorema de Pitman-Koopman-Darmois más adelante), pero seguía siendo muy importante en el trabajo teórico. [ 3 ]
Fondo
Aproximadamente, dado un conjuntode datos independientes e idénticamente distribuidos condicionados a un parámetro desconocido, una estadística suficiente es una funcióncuyo valor contiene toda la información necesaria para calcular cualquier estimación del parámetro (por ejemplo, una estimación de máxima verosimilitud ). Debido al teorema de factorización ( véase más abajo ), para una estadística suficiente, la densidad de probabilidad se puede escribir como. A partir de esta factorización, se puede ver fácilmente que la estimación de máxima verosimilitud deinteractuará consolo a través deNormalmente, el estadístico suficiente es una función simple de los datos, por ejemplo, la suma de todos los puntos de datos.
En términos más generales, el "parámetro desconocido" puede representar un vector de cantidades desconocidas o todo lo que se desconoce o no está completamente especificado sobre el modelo. En tal caso, el estadístico suficiente puede ser un conjunto de funciones, denominado estadístico suficientemente conjunto . Normalmente, hay tantas funciones como parámetros. Por ejemplo, para una distribución gaussiana con media y varianza desconocidas , el estadístico suficientemente conjunto, a partir del cual se pueden estimar las estimaciones de máxima verosimilitud de ambos parámetros, consta de dos funciones: la suma de todos los puntos de datos y la suma de todos los puntos de datos al cuadrado (o, equivalentemente, la media muestral y la varianza muestral ).
En otras palabras, la distribución de probabilidad conjunta de los datos es condicionalmente independiente del parámetro dado el valor del estadístico suficiente para dicho parámetro . Tanto el estadístico como el parámetro subyacente pueden ser vectores.
Definición matemática
Un estadístico t = T ( X ) es suficiente para el parámetro subyacente θ precisamente si la distribución de probabilidad condicional de los datos X , dado el estadístico t = T ( X ), no depende del parámetro θ . [ 4 ]
Alternativamente, se puede decir que la estadística T ( X ) es suficiente para θ si, para todas las distribuciones previas de θ , la información mutua entre θ y T(X) es igual a la información mutua entre θ y X. [ 5 ] En otras palabras, la desigualdad del procesamiento de datos se convierte en una igualdad:
Ejemplo
Por ejemplo, la media muestral es suficiente para la media (desconocida) μ de una distribución normal con varianza conocida. Una vez conocida la media muestral, no se puede obtener más información sobre μ a partir de la muestra misma. Por otro lado, para una distribución arbitraria, la mediana no es suficiente para la media: incluso si se conoce la mediana de la muestra, conocer la muestra misma proporcionaría información adicional sobre la media poblacional. Por ejemplo, si las observaciones menores que la mediana son solo ligeramente inferiores, pero las observaciones mayores que la superan la superan considerablemente, esto influiría en la inferencia sobre la media poblacional.
Teorema de factorización de Fisher-Neyman
El teorema de factorización de Fisher o criterio de factorización proporciona una caracterización conveniente de una estadística suficiente. Si la función de densidad de probabilidad es ƒ( x;θ ), donde θ es un parámetro, entonces T es suficiente para θ si y solo si se pueden encontrarfunciones no negativas g y h tales que
Es decir, la densidad ƒ puede factorizarse en un producto tal que un factor, h , no depende de θ y el otro factor, que sí depende de θ , depende de x solo a través de T ( x ). Halmos y Savage [ 6 ] dieron una demostración general de esto y el teorema a veces se denomina teorema de factorización de Halmos-Savage. [ 7 ] Las demostraciones que siguen tratan casos especiales, pero se puede dar una demostración general alternativa en la misma línea. [ 8 ] En muchos casos simples, la función de densidad de probabilidad está completamente especificada pory, y(ver ejemplos ).
Es fácil ver que si F ( t ) es una función biyectiva y T es un estadístico suficiente, entonces F ( T ) también es un estadístico suficiente. En particular, podemos multiplicar un estadístico suficiente por una constante distinta de cero y obtener otro estadístico suficiente.
Interpretación del principio de verosimilitud
Una implicación del teorema es que, al utilizar la inferencia basada en la verosimilitud, dos conjuntos de datos que produzcan el mismo valor para el estadístico suficiente T ( X ) siempre darán lugar a las mismas inferencias sobre θ . Según el criterio de factorización, la dependencia de la verosimilitud con respecto a θ solo se da en conjunción con T ( X ). Como esto es igual en ambos casos, la dependencia con respecto a θ también será la misma, lo que dará lugar a inferencias idénticas.
Prueba
Debido a Hogg y Craig. [ 9 ] Deje, denotemos una muestra aleatoria de una distribución que tiene la función de densidad de probabilidad f ( x , θ ) para ι < θ < δ . Sea Y 1 = u 1 ( X 1 , X 2 , ..., X n ) un estadístico cuya función de densidad de probabilidad es g 1 ( y 1 ; θ ). Lo que queremos demostrar es que Y 1 = u 1 ( X 1 , X 2 , ..., X n ) es un estadístico suficiente para θ si y solo si, para alguna función H ,
Primero, supongamos que
Realizaremos la transformación y i = u i ( x 1 , x 2 , ..., x n ), para i = 1, ..., n , que tiene funciones inversas x i = w i ( y 1 , y 2 , ..., y n ), para i = 1, ..., n , y jacobiano . De este modo,
El miembro izquierdo es la pdf conjunta g ( y 1 , y 2 , ..., y n ; θ) de Y 1 = u 1 ( X 1 , ..., X n ), ..., Y n = u n ( X 1 , ..., X n ). En el miembro derecho,es el pdf de, de modo quees el cociente dey; es decir, es la PDF condicionaldedado.
Peroy por lo tanto, se le dio para no depender de. Desdeno se introdujo en la transformación y, por consiguiente, no en el jacobiano.De ello se deduce queno depende dey esoes una estadística suficiente para.
Lo contrario se demuestra tomando:
dóndeno depende deporquedepender únicamente de, que son independientes decuando está condicionado por, una estadística suficiente por hipótesis. Ahora divide ambos miembros por el valor absoluto del jacobiano no nulo.y reemplazarpor las funcionesenEsto produce
dóndees el jacobiano conreemplazados por su valor en términosEl miembro izquierdo es necesariamente la articulación pdfde. Desdey por lo tanto, no depende de, entonces
es una función que no depende de.
Otra prueba
Una demostración más sencilla e ilustrativa es la siguiente, aunque solo se aplica en el caso discreto.
Utilizamos la notación abreviada para denotar la densidad de probabilidad conjunta depor. Desdees una función determinista de, tenemos, mientrasy cero en caso contrario. Por lo tanto:
siendo la última igualdad verdadera por definición de estadística suficiente. Por lo tanto,cony.
Por el contrario, si, tenemos
Con la primera igualdad por la definición de pdf para múltiples variables , la segunda por la observación anterior, la tercera por hipótesis y la cuarta porque la suma no es mayor que.
Dejardenotamos la densidad de probabilidad condicional dedadoEntonces podemos derivar una expresión explícita para esto:
Con la primera igualdad por definición de densidad de probabilidad condicional, la segunda por la observación anterior, la tercera por la igualdad demostrada anteriormente y la cuarta por simplificación. Esta expresión no depende dey por lo tantoes una estadística suficiente. [ 10 ]
Suficiencia mínima
Un estadístico suficiente es suficientemente mínimo si puede representarse como una función de cualquier otro estadístico suficiente. En otras palabras, S ( X ) es suficientemente mínimo si y solo si [ 11 ]
- S ( X ) es suficiente, y
- Si T ( X ) es suficiente, entonces existe una función f tal que S ( X ) = f ( T ( X )).
Intuitivamente, una estadística suficiente mínima captura de manera más eficiente toda la información posible sobre el parámetro θ .
Una caracterización útil de la suficiencia mínima es que cuando existe la densidad f θ , S ( X ) es mínimamente suficiente si
- es independiente de θ :S ( x ) = S ( y )
Esto se deduce como consecuencia del teorema de factorización de Fisher mencionado anteriormente.
Bahadur, 1954, demostró un caso en el que no existe un estadístico suficiente mínimo. [ 12 ] Sin embargo, bajo condiciones leves, siempre existe un estadístico suficiente mínimo. En particular, en el espacio euclidiano, estas condiciones siempre se cumplen si las variables aleatorias (asociadas con) son todas discretas o son todas continuas.
Si existe un estadístico suficiente mínimo, lo cual suele ser el caso, entonces todo estadístico suficiente completo es necesariamente suficiente mínimo [ 13 ] (nótese que esta afirmación no excluye un caso patológico en el que exista un estadístico suficiente completo pero no un estadístico suficiente mínimo). Si bien es difícil encontrar casos en los que no exista un estadístico suficiente mínimo, no es tan difícil encontrar casos en los que no exista un estadístico suficiente completo.
La colección de razones de verosimilitudparaes una estadística suficiente mínima si el espacio de parámetros es discreto.
Ejemplos
Distribución de Bernoulli
Si X 1 , ..., X n son variables aleatorias independientes con distribución de Bernoulli y valor esperado p , entonces la suma T ( X ) = X 1 + ... + X n es una estadística suficiente para p (aquí 'éxito' corresponde a X i = 1 y 'fracaso' a X i = 0; por lo tanto, T es el número total de éxitos).
Esto se observa al considerar la distribución de probabilidad conjunta:
Debido a que las observaciones son independientes, esto se puede escribir como
y, agrupando potencias de p y 1 − p , se obtiene
que satisface el criterio de factorización, siendo h ( x ) = 1 simplemente una constante.
Nótese la característica crucial: el parámetro desconocido p interactúa con los datos x solo a través de la estadística T ( x ) = Σ x i .
Como aplicación concreta, esto proporciona un procedimiento para distinguir una moneda justa de una moneda trucada .
Distribución uniforme
Si X 1 , ..., X n son independientes y están distribuidos uniformemente en el intervalo [0, θ ], entonces T ( X ) = max( X 1 , ..., X n ) es suficiente para θ — el máximo de la muestra es una estadística suficiente para el máximo de la población.
Para ver esto, consideremos la función de densidad de probabilidad conjunta de X ( X 1 ,..., X n ). Debido a que las observaciones son independientes, la pdf se puede escribir como un producto de densidades individuales.
donde 1 { ... } es la función indicadora . Por lo tanto, la densidad toma la forma requerida por el teorema de factorización de Fisher-Neyman, donde h ( x ) = 1 {min{ x i }≥0} , y el resto de la expresión es una función solo de θ y T ( x ) = max{ x i }.
De hecho, el estimador insesgado de mínima varianza (MVUE) para θ es
Este es el máximo de la muestra, escalado para corregir el sesgo , y es MVUE según el teorema de Lehmann-Scheffé . El máximo de la muestra sin escalar T ( X ) es el estimador de máxima verosimilitud para θ .
Distribución uniforme (con dos parámetros)
Sison independientes y están distribuidas uniformemente en el intervalo(dóndeyson parámetros desconocidos), entonceses una estadística suficiente bidimensional para.
Para ver esto, consideremos la función de densidad de probabilidad conjunta de. Debido a que las observaciones son independientes, la pdf se puede escribir como un producto de densidades individuales, es decir
La densidad conjunta de la muestra toma la forma requerida por el teorema de factorización de Fisher-Neyman, al dejar
Desdeno depende del parámetroydepende únicamente dea través de la función
El teorema de factorización de Fisher-Neyman implicaes una estadística suficiente para.
Distribución de Poisson
Si X 1 , ..., X n son independientes y tienen una distribución de Poisson con parámetro λ , entonces la suma T ( X ) = X 1 + ... + X n es una estadística suficiente para λ .
Para ver esto, consideremos la distribución de probabilidad conjunta:
Debido a que las observaciones son independientes, esto se puede escribir como
que puede escribirse como
lo que demuestra que se cumple el criterio de factorización, donde h ( x ) es el recíproco del producto de los factoriales. Nótese que el parámetro λ interactúa con los datos solo a través de su suma T ( X ).
Distribución normal
Sison independientes y se distribuyen normalmente con un valor esperado(un parámetro) y varianza finita conocidaentonces
es una estadística suficiente para
Para ver esto, consideremos la función de densidad de probabilidad conjunta de. Debido a que las observaciones son independientes, la pdf se puede escribir como un producto de densidades individuales, es decir
La densidad conjunta de la muestra toma la forma requerida por el teorema de factorización de Fisher-Neyman, al dejar
Desdeno depende del parámetroydepende únicamente dea través de la función
El teorema de factorización de Fisher-Neyman implicaes una estadística suficiente para.
Sies desconocido y desde, la probabilidad anterior se puede reescribir como
El teorema de factorización de Fisher-Neyman sigue vigente e implica quees una estadística suficiente conjunta para.
Distribución exponencial
Sison independientes y se distribuyen exponencialmente con un valor esperado θ (un parámetro positivo real desconocido), entonceses una estadística suficiente para θ.
Para ver esto, consideremos la función de densidad de probabilidad conjunta de. Debido a que las observaciones son independientes, la pdf se puede escribir como un producto de densidades individuales, es decir
La densidad conjunta de la muestra toma la forma requerida por el teorema de factorización de Fisher-Neyman, al dejar
Desdeno depende del parámetroydepende únicamente dea través de la función
El teorema de factorización de Fisher-Neyman implicaes una estadística suficiente para.
Distribución gamma
Sison independientes y se distribuyen como un, dóndeyson parámetros desconocidos de una distribución Gamma , entonceses una estadística suficiente bidimensional para.
Para ver esto, consideremos la función de densidad de probabilidad conjunta de. Debido a que las observaciones son independientes, la pdf se puede escribir como un producto de densidades individuales, es decir
La densidad conjunta de la muestra toma la forma requerida por el teorema de factorización de Fisher-Neyman, al dejar
Desdeno depende del parámetroydepende únicamente dea través de la función
El teorema de factorización de Fisher-Neyman implicaes una estadística suficiente para
Teorema de Rao-Blackwell
La suficiencia encuentra una aplicación útil en el teorema de Rao-Blackwell , que establece que si g ( X ) es cualquier tipo de estimador de θ , entonces, por lo general, la esperanza condicional de g ( X ) dado el estadístico suficiente T ( X ) es un mejor estimador de θ (en el sentido de tener menor varianza ) y nunca es peor. A veces, se puede construir fácilmente un estimador muy simple g ( X ) y luego evaluar ese valor esperado condicional para obtener un estimador que, en varios sentidos, es óptimo.
Familia exponencial
Según el teorema de Pitman-Koopman-Darmois, entre las familias de distribuciones de probabilidad cuyo dominio no varía con el parámetro que se estima, solo en las familias exponenciales existe un estadístico suficiente cuya dimensión permanece acotada a medida que aumenta el tamaño de la muestra. Intuitivamente, esto indica que las familias de distribuciones no exponenciales en la recta real requieren estadísticos no paramétricos para capturar completamente la información de los datos.
Menos concisamente, supongamosson variables aleatorias reales independientes e idénticamente distribuidas cuya distribución se sabe que pertenece a alguna familia de distribuciones de probabilidad, parametrizadas por, que satisface ciertas condiciones de regularidad técnica, entonces esa familia es una familia exponencial si y solo si existe unaestadístico suficiente con valorcuyo número de componentes escalaresno aumenta a medida que aumenta el tamaño de la muestra n . [ 14 ]
Este teorema muestra que la existencia de una estadística suficiente de dimensión finita y con valores vectoriales reales restringe drásticamente las posibles formas de una familia de distribuciones en la línea real .
Cuando los parámetros o las variables aleatorias ya no son de valor real, la situación es más compleja. [ 15 ]
Otros tipos de suficiencia
Suficiencia bayesiana
Una formulación alternativa de la condición de que un estadístico sea suficiente, establecida en un contexto bayesiano, involucra las distribuciones posteriores obtenidas al usar el conjunto de datos completo y al usar solo un estadístico. Por lo tanto, el requisito es que, para casi todo x ,
De forma más general, sin asumir un modelo paramétrico, podemos decir que la estadística T es suficientemente predictiva si
Resulta que esta "suficiencia bayesiana" es una consecuencia de la formulación anterior, [ 16 ] sin embargo, no son directamente equivalentes en el caso de dimensión infinita. [ 17 ] Existe una variedad de resultados teóricos sobre la suficiencia en un contexto bayesiano. [ 18 ]
Suficiencia lineal
Un concepto llamado "suficiencia lineal" puede formularse en un contexto bayesiano, [ 19 ] y de forma más general. [ 20 ] Primero definimos el mejor predictor lineal de un vector Y basado en X como. Entonces, una estadística lineal T ( x ) es lineal suficiente [ 21 ] si
Véase también
- Integridad de una estadística
- El teorema de Basu sobre la independencia de las estadísticas completas suficientes y auxiliares.
- Teorema de Lehmann-Scheffé : un estimador suficiente completo es el mejor estimador de su esperanza.
- Teorema de Rao-Blackwell
- Teorema de Chentsov
- Reducción de dimensión suficiente
- Estadística auxiliar
Notas
- ↑ Dodge, Y. (2003) — entrada para suficiencia lineal
- ↑ Fisher, RA (1922). "Sobre los fundamentos matemáticos de la estadística teórica" . Philosophical Transactions of the Royal Society A. 222 ( 594–604 ) : 309–368 . Bibcode : 1922RSPTA.222..309F . doi : 10.1098/rsta.1922.0009 . hdl : 2440/15172 . JFM 48.1280.02 . JSTOR 91208 .
- ↑ Stigler, Stephen (diciembre de 1973). "Estudios sobre la historia de la probabilidad y la estadística. XXXII: Laplace, Fisher y el descubrimiento del concepto de suficiencia". Biometrika . 60 ( 3): 439– 445. doi : 10.1093/biomet/60.3.439 . JSTOR 2334992. MR 0326872 .
- ↑ Casella, George ; Berger, Roger L. (2002). Inferencia estadística, 2.ª ed . Duxbury Press.
- ↑ Cover, Thomas M. (2006). Elementos de la teoría de la información . Joy A. Thomas (2.ª ed.). Hoboken, NJ: Wiley-Interscience. p. 36. ISBN 0-471-24195-4OCLC 59879802
- ↑ Halmos, PR; Savage, LJ (1949). "Aplicación del teorema de Radon-Nikodym a la teoría de la estadística suficiente" . The Annals of Mathematical Statistics . 20 (2): 225– 241. doi : 10.1214/aoms/1177730032 . ISSN 0003-4851 .
- ↑ "Teorema de factorización - Enciclopedia de Matemáticas" . encyclopediaofmath.org . Consultado el 7 de septiembre de 2022 .
- ↑ Taraldsen, G. (2022). "El teorema de factorización para la suficiencia". Preimpresión . doi : 10.13140/RG.2.2.15068.87687 .
- ↑ Hogg, Robert V.; Craig, Allen T. (1995). Introducción a la estadística matemática . Prentice Hall. ISBN 978-0-02-355722-4.
- ↑ "El teorema de factorización de Fisher-Neyman" .Página web de Connexions (cnx.org)
- ↑ Dodge (2003) — entrada para estadísticas suficientes mínimas
- ↑ Lehmann y Casella (1998), Teoría de la estimación puntual , 2.ª edición, Springer, pág. 37
- ↑ Lehmann y Casella (1998), Teoría de la estimación puntual , 2.ª edición, Springer, página 42
- ↑ Tikochinsky, Y.; Tishby, NZ; Levine, RD (1984-11-01). "Enfoque alternativo para la inferencia de máxima entropía" . Physical Review A. 30 ( 5): 2638– 2644. Bibcode : 1984PhRvA..30.2638T . doi : 10.1103/physreva.30.2638 . ISSN 0556-2791 .
- ↑ Andersen, Erling Bernhard (septiembre de 1970). "Suficiencia y familias exponenciales para espacios muestrales discretos" . Journal of the American Statistical Association . 65 (331): 1248– 1255. doi : 10.1080/01621459.1970.10481160 . ISSN 0162-1459 .
- ↑ Bernardo, JM ; Smith, AFM (1994). "Sección 5.1.4". Teoría bayesiana . Wiley. ISBN 0-471-92416-4.
- ↑ Blackwell, D. ; Ramamoorthi, RV (1982). "Una estadística bayesiana pero no clásicamente suficiente" . Annals of Statistics . 10 (3): 1025– 1026. doi : 10.1214/aos/1176345895 . MR 0663456 . Zbl 0485.62004 .
- ↑ Nogales, AG; Oyola, JA; Pérez, P. (2000). "Sobre la independencia condicional y la relación entre suficiencia e invariancia desde el punto de vista bayesiano" . Statistics & Probability Letters . 46 (1): 75– 84. doi : 10.1016/S0167-7152(99)00089-9 . MR 1731351. Zbl 0964.62003 .
- ↑ Goldstein, M.; O'Hagan, A. (1996). "Suficiencia lineal bayesiana y sistemas de evaluaciones posteriores de expertos". Journal of the Royal Statistical Society . Serie B. 58 (2): 301– 316. doi : 10.1111/j.2517-6161.1996.tb02083.x . JSTOR 2345978 .
- ↑ Godambe, VP (1966). "Un nuevo enfoque para el muestreo de poblaciones finitas. II Suficiencia libre de distribución". Journal of the Royal Statistical Society . Serie B. 28 (2): 320– 328. doi : 10.1111/j.2517-6161.1966.tb00645.x . JSTOR 2984375 .
- ↑ Witting, T. (1987). "La propiedad lineal de Markov en la teoría de la credibilidad" . ASTIN Bulletin . 17 (1): 71– 84. doi : 10.2143/ast.17.1.2014984 . hdl : 20.500.11850/422507 .
Referencias
- Kholevo, AS (2001) [1994], "Estadística suficiente" , Enciclopedia de Matemáticas , EMS Press
- Lehmann, EL; Casella, G. (1998). Teoría de la estimación puntual (2.ª ed.). Springer. Capítulo 4. ISBN 0-387-98502-6.
- Dodge, Y. (2003) The Oxford Dictionary of Statistical Terms , OUP. ISBN 0-19-920613-9
- Teoría estadística
- Principios estadísticos
- Factorización