Articulo de referencia

El problema de los tanques alemanes

Durante la Segunda Guerra Mundial , la inteligencia aliada estimó con precisión la producción de tanques alemanes como el Panther utilizando métodos estadísticos. En la teoría e...

Durante la Segunda Guerra Mundial , la inteligencia aliada estimó con precisión la producción de tanques alemanes como el Panther utilizando métodos estadísticos.

En la teoría estadística de la estimación , el problema del tanque alemán consiste en estimar el máximo de una distribución uniforme discreta a partir de un muestreo sin reemplazo . En términos sencillos, supongamos que existe un número desconocido de elementos numerados secuencialmente del 1 al N. Se toma una muestra aleatoria de estos elementos y se observan sus números de secuencia; el problema consiste en estimar N a partir de estos números observados.

El problema puede abordarse mediante inferencia frecuentista o bayesiana , lo que conduce a resultados diferentes. Estimar el máximo poblacional a partir de una sola muestra produce resultados divergentes, mientras que la estimación basada en múltiples muestras es una cuestión práctica cuya respuesta es sencilla (sobre todo en el enfoque frecuentista) pero no obvia (sobre todo en el enfoque bayesiano).

El problema recibe su nombre de su aplicación histórica por parte de las fuerzas aliadas en la Segunda Guerra Mundial para estimar la tasa mensual de producción de tanques alemanes a partir de datos muy limitados. El método estadístico aprovechó la práctica de fabricación de asignar secuencias de números de serie ascendentes a los componentes del tanque (chasis, caja de cambios, motor, ruedas), y algunos de los tanques fueron capturados en combate por las fuerzas aliadas. Esto contrastaba con la inteligencia convencional, que a menudo sobreestimaba la producción nazi; este enfoque estadístico proporcionó una estimación muy precisa. [ 1 ]

Suposiciones

Se presume que el adversario fabricó una serie de tanques marcados con números enteros consecutivos, comenzando con el número de serie 1. Además, independientemente de la fecha de fabricación, el historial de servicio o el número de serie de un tanque, la distribución de los números de serie que se revelan al análisis es uniforme hasta el momento en que se realiza dicho análisis.

Ejemplo

Tamaño estimado de la población (N). El número de observaciones en la muestra es k . El número de serie de muestra más grande es m . El análisis frecuentista se muestra con líneas punteadas. El análisis bayesiano tiene líneas continuas con la media y sombreado para mostrar el rango desde el valor mínimo posible hasta la media más 1 desviación estándar). El ejemplo muestra que si se observan cuatro tanques y el número de serie más alto es "60", el análisis frecuentista predice 74, mientras que el análisis bayesiano predice una media de 88,5 y una desviación estándar de 138,72   88,5 =  50,22, y un mínimo de 60 tanques. En el archivo SVG , pase el cursor sobre un gráfico para resaltarlo.

Suponiendo que a los tanques se les asignan números de serie secuenciales que comienzan con el 1, supongamos que se capturan cuatro tanques y que tienen los números de serie: 19, 40, 42 y 60.

Un enfoque frecuentista (utilizando el estimador insesgado de varianza mínima ) predice que el número total de tanques producidos será:

norte74{\displaystyle N\approx 74}

Un enfoque bayesiano (utilizando una distribución a priori uniforme sobre los enteros en[4,Ω]{\displaystyle [4,\Omega ]}para cualquier tamaño suficientemente grandeΩ{\displaystyle \Omega }) predice que el número medio de tanques producidos será muy similar a la predicción frecuentista:

nortemetromid73.9{\displaystyle N_{med}\approx 73.9}

mientras que la media bayesiana predice que el número de tanques producidos sería:

norteav89{\displaystyle N_{av}\aproximadamente 89}

Sea N el número total de tanques que se predijo que se produjeron, m el número de serie más alto observado y k el número de tanques capturados.

La predicción frecuentista se calcula de la siguiente manera:

nortemetro+metrok1=74{\displaystyle N\approx m+{\frac {m}{k}}-1=74}

La mediana bayesiana se calcula de la siguiente manera:

nortemetromidmetro+metroln(2)k1=73.9{\displaystyle N_{med}\approx m+{\frac {m\ln(2)}{k-1}}=73.9}

La media bayesiana se calcula de la siguiente manera:

norteav(metro1)k1k2=89{\displaystyle N_{av}\approx (m-1){\frac {k-1}{k-2}}=89}

Estas cantidades bayesianas se derivan de la distribución posterior bayesiana:

Pr(norte=norte)={0si norte<metro,k1k(metro1k1)(nortek)si nortemetro.{\displaystyle \Pr(N=n)={\begin{cases}0&{\text{si }}n<m,\\{\frac {k-1}{k}}{\frac {\binom {m-1}{k-1}}{\binom {n}{k}}}&{\text{si }}n\geq m.\end{cases}}}

Esta función de masa de probabilidad tiene una asimetría positiva , relacionada con el hecho de que hay al menos 60 tanques. Debido a esta asimetría, la media puede no ser la estimación más significativa. La mediana en este ejemplo es 74,5, en estrecha concordancia con la fórmula frecuentista. Usando la aproximación de Stirling , la posterior puede aproximarse mediante una función de decaimiento exponencial de n ,

Pr(norte=norte){0si norte<metro(k1)metrok1norteksi nortemetro,{\displaystyle \Pr(N=n)\approx {\begin{cases}0&{\text{si }}n<m\\(k-1)m^{k-1}n^{-k}&{\text{si }}n\geq m,\end{cases}}}

lo que da como resultado la siguiente aproximación para la mediana:

nortemetromidmetro+metroln(2)k1{\displaystyle N_{med}\approx m+{\frac {m\ln(2)}{k-1}}}

y las siguientes aproximaciones para la media y la desviación estándar:

norteμ±σ=89±50,μ=(metro1)k1k2,σ=(k1)(metro1)(metrok+1)(k3)(k2)2.{\displaystyle {\begin{aligned}N&\approx \mu \pm \sigma =89\pm 50,\\[5pt]\mu &=(m-1){\frac {k-1}{k-2}},\\[5pt]\sigma &={\sqrt {\frac {(k-1)(m-1)(m-k+1)}{(k-3)(k-2)^{2}}}}.\end{aligned}}}

Ejemplo histórico del problema

Tanques Panther siendo cargados para su transporte a las unidades de primera línea, 1943.

Durante la Segunda Guerra Mundial, los Aliados occidentales realizaron esfuerzos constantes para determinar el alcance de la producción alemana, utilizando dos métodos principales: la recopilación de inteligencia convencional y la estimación estadística. En muchos casos, el análisis estadístico mejoró sustancialmente la inteligencia convencional. En algunos casos, la inteligencia convencional se utilizó junto con métodos estadísticos, como ocurrió en la estimación de la producción de tanques Panther justo antes del Día D.

La estructura de mando aliada había pensado que los tanques Panzer V (Panther) vistos en Italia, con sus  cañones de 75 mm/L70 de cañón largo y alta velocidad, eran tanques pesados ​​inusuales y que solo se verían en el norte de Francia en pequeñas cantidades, de forma muy similar a como se vio al Tiger I en Túnez. El Ejército de los EE. UU. confiaba en que el tanque Sherman seguiría teniendo un buen desempeño, como lo había hecho contra los tanques Panzer III y Panzer IV en el norte de África y Sicilia. [ a ] ​​Poco antes del Día D, los rumores indicaban que se estaban utilizando grandes cantidades de tanques Panzer V.

Para determinar si esto era cierto, los Aliados intentaron estimar la cantidad de tanques que se estaban produciendo. Para ello, utilizaron los números de serie de los tanques capturados o destruidos. Los números principales utilizados fueron los de la caja de cambios, ya que estos se presentaban en dos secuencias ininterrumpidas. También se utilizaron los números de chasis y motor, aunque su uso era más complejo. Se utilizaron otros componentes para contrastar el análisis. Se realizaron análisis similares en las ruedas, que se observó que estaban numeradas secuencialmente (es decir, 1,  2,  3,  ..., N ). [ 3 ] [ b ] [ 4 ] [ 5 ] 

El análisis de las ruedas de los tanques permitió estimar el número de moldes de ruedas en uso. Posteriormente, una conversación con fabricantes británicos de ruedas de carretera estimó el número de ruedas que se podían producir con esa cantidad de moldes, lo que a su vez permitió calcular el número de tanques que se producían mensualmente. El análisis de las ruedas de dos tanques (32 ruedas de carretera cada uno, 64 ruedas de carretera en total) arrojó una estimación de 270 tanques producidos en febrero de 1944, una cifra considerablemente mayor de la que se había sospechado anteriormente. [ 6 ]

Los registros alemanes posteriores a la guerra mostraron que la producción para el mes de febrero  de 1944 fue de 276. [ 7 ] [ c ] El enfoque estadístico demostró ser mucho más preciso que los métodos de inteligencia convencionales, y la frase "problema del tanque alemán" se aceptó como un descriptor para este tipo de análisis estadístico.

La estimación de la producción no fue el único uso de este análisis de números de serie. También se utilizó para comprender la producción alemana en general, incluyendo el número de fábricas, la importancia relativa de las mismas, la longitud de la cadena de suministro (basada en el desfase entre la producción y el consumo), los cambios en la producción y el uso de recursos como el caucho.

Datos específicos

Según las estimaciones de inteligencia aliadas convencionales, los alemanes producían alrededor de 1400  tanques al mes entre junio  de 1940 y septiembre  de 1942. Aplicando la fórmula que figura a continuación a los números de serie de los tanques capturados, se calculó que la cifra era de 246 al mes. Tras la guerra, las cifras de producción alemanas capturadas, procedentes del ministerio de Albert Speer, mostraron que la cifra real era de 245. [ 4 ]

Las estimaciones para algunos meses específicos se dan como: [ 8 ]

Análisis similares

La producción de cohetes V-2 se estimó con precisión mediante métodos estadísticos.

Se utilizó un análisis de números de serie similar para otros equipos militares durante  la Segunda Guerra Mundial, con mayor éxito para el cohete V-2 . [ 9 ]

Las marcas de fábrica en el equipo militar soviético fueron analizadas durante la Guerra de Corea y por la inteligencia alemana durante la  Segunda Guerra Mundial. [ 10 ]

En la década de 1980, algunos estadounidenses tuvieron acceso a la línea de producción de los tanques Merkava de Israel . Las cifras de producción eran clasificadas, pero los tanques tenían números de serie, lo que permitió estimar la producción. [ 11 ]

La fórmula se ha utilizado en contextos no militares, por ejemplo, para estimar el número de ordenadores Commodore 64 fabricados, donde el resultado (12,5  millones) coincide con las estimaciones más bajas. [ 12 ]

Contramedidas

Para dificultar el análisis de números de serie, estos pueden excluirse o la información auxiliar utilizable puede reducirse. Alternativamente, se pueden usar números de serie resistentes al criptoanálisis, siendo la forma más efectiva elegir números al azar sin reemplazo de una lista mucho mayor que la cantidad de objetos producidos, o generar números aleatorios y compararlos con la lista de números ya asignados; es probable que se produzcan colisiones a menos que la cantidad de dígitos posibles sea más del doble de la cantidad de dígitos en la cantidad de objetos producidos; esto es válido para números de serie en cualquier base. [ d ] Para esto, se puede usar un generador de números pseudoaleatorios criptográficamente seguro . Todos estos métodos requieren una tabla de búsqueda (o romper el cifrado) para obtener la orden de producción a partir del número de serie, lo que complica el uso de números de serie: por ejemplo, no se puede recuperar un rango de números de serie, sino que cada uno debe buscarse individualmente o generarse una lista.

Alternativamente, los números de serie secuenciales pueden cifrarse con un cifrado de sustitución simple , que permite una fácil decodificación, pero que también se puede romper fácilmente mediante análisis de frecuencia : incluso partiendo de un punto arbitrario, el texto plano tiene un patrón (es decir, los números están en secuencia). Un ejemplo se da en la novela Código a cero de Ken Follett , donde el cifrado de los números de serie del cohete Jupiter-C se da de la siguiente manera:

La palabra clave aquí es Huntsville (con letras repetidas omitidas) para obtener una clave de 10 letras. [ 13 ] El cohete número  13 era, por lo tanto, "HN", y el cohete número  24 era "UT".

Análisis frecuentista

Estimador insesgado de mínima varianza

Para la estimación puntual (estimar un único valor para el total,norte^{\displaystyle {\widehat {N}}}), el estimador insesgado de mínima varianza (MVUE, o estimador UMVU) viene dado por: [ e ]

norte^=metro(1+k1)1,{\displaystyle {\widehat {N}}=m(1+k^{-1})-1,}

donde m es el número de serie más grande observado ( máximo de la muestra ) y k es el número de tanques observados ( tamaño de la muestra ). [ 11 ] [ 14 ] Tenga en cuenta que una vez que se ha observado un número de serie, ya no está en el grupo y no se volverá a observar.

Esto tiene una varianza [ 11 ]

var(norte^)=1k(nortek)(norte+1)(k+2)norte2k2 para muestras pequeñas knorte,{\displaystyle \operatorname {var} \left({\widehat {N}}\right)={\frac {1}{k}}{\frac {(Nk)(N+1)}{(k+2)}}\approx {\frac {N^{2}}{k^{2}}}{\text{ para muestras pequeñas }}k\ll N,}

por lo que la desviación estándar es aproximadamente N / k , el tamaño esperado de la brecha entre las observaciones ordenadas en la muestra.

La fórmula puede entenderse intuitivamente como el máximo de la muestra más la diferencia promedio entre las observaciones de la muestra, siendo el máximo de la muestra elegido como estimador inicial, debido a que es el estimador de máxima verosimilitud , [ f ] con la diferencia añadida para compensar el sesgo negativo del máximo de la muestra como estimador del máximo de la población, [ g ] y escrito como

norte^=metro+metrokk=metro+metrok11=metro(1+k1)1.{\displaystyle {\widehat {N}}=m+{\frac {mk}{k}}=m+mk^{-1}-1=m(1+k^{-1})-1.}

Esto se puede visualizar imaginando que las observaciones en la muestra están espaciadas uniformemente en todo el rango, con observaciones adicionales justo fuera del rango en 0 y N  +  1. Si se comienza con un intervalo inicial entre 0 y la observación más baja en la muestra (el mínimo de la muestra), el intervalo promedio entre observaciones consecutivas en la muestra es(metrok)/k{\displaystyle (mk)/k}, elk{\displaystyle -k}ya que las observaciones mismas no se cuentan al calcular la brecha entre observaciones. [ h ] Una derivación del valor esperado y la varianza del máximo de la muestra se muestran en la página de la distribución uniforme discreta .

Esta filosofía se formaliza y generaliza en el método de estimación de espaciamiento máximo ; se utiliza una heurística similar para trazar la posición en un gráfico Q-Q , trazando puntos de muestra en k / ( n + 1) , que está uniformemente en la distribución uniforme, con un hueco al final.

Intervalos de confianza

En lugar de, o además de, la estimación puntual , se puede realizar una estimación por intervalos , como los intervalos de confianza . Estos se calculan fácilmente, basándose en la observación de que la probabilidad de que k observaciones de la muestra caigan en un intervalo que cubra p del rango (0  p ≤ 1) es p k (suponiendo en esta sección que las extracciones son con reemplazo, para simplificar los cálculos; si las extracciones son sin reemplazo, esto sobreestima la probabilidad y los intervalos serán demasiado conservadores).   

Así, la distribución muestral del cuantil del máximo de la muestra es la gráfica x 1/ k de 0 a 1: el cuantil p al q del máximo de la muestra m son el intervalo [ p 1/ k N , q 1/ k N ]. Invirtiendo esto se obtiene el intervalo de confianza correspondiente para el máximo de la población de [ m / q 1/ k , m / p 1/ k ].  

Por ejemplo, tomando el intervalo simétrico del 95% p = 2,5% y q = 97,5% para k = 5 se obtiene 0,025 1/5 ≈ 0,48, 0,975 1/5 ≈ 0,995, por lo que el intervalo de confianza es aproximadamente [1,005 m , 2,08 m ]. El límite inferior está muy cerca de m , por lo que es más informativo el intervalo de confianza asimétrico de p = 5% a 100%; para k = 5 esto produce 0,05 1/5 ≈ 0,55 y el intervalo [ m ,  1,82 m ].

En términos más generales, el intervalo de confianza del 95 % (sesgado a la baja) es [ m , m /0,05 1/ k ] = [ m , m ·20 1/k ]. Para un rango de valores de k , con el estimador puntual UMVU (más 1 para mayor legibilidad) como referencia, se obtiene:

Las observaciones inmediatas son:

  • Para tamaños de muestra pequeños, el intervalo de confianza es muy amplio, lo que refleja una gran incertidumbre en la estimación.
  • El rango se reduce rápidamente, lo que refleja la probabilidad, que disminuye exponencialmente, de que todas las observaciones de la muestra estén significativamente por debajo del máximo.
  • El intervalo de confianza presenta asimetría positiva, ya que N nunca puede estar por debajo del máximo de la muestra, pero puede ser potencialmente arbitrariamente alto por encima de él.

Tenga en cuenta que m / k no se puede usar ingenuamente (o más bien ( m  + m / k − 1) / k ) como una estimación del error estándar SE , ya que el error estándar de un estimador se basa en el máximo de la población (un parámetro), y usar una estimación para estimar el error en esa misma estimación es un razonamiento circular .   

análisis bayesiano

El enfoque bayesiano para el problema del tanque alemán [ 15 ] consiste en considerar la probabilidad posterior.(norte=norteMETRO=metro,K=k){\displaystyle (N=n\mid M=m,K=k)}que el número de tanques enemigosnorte{\displaystyle N}esnorte{\displaystyle n}, cuando el número de tanques observadosK{\displaystyle K}esk{\displaystyle k}y el número de serie máximo observadoMETRO{\displaystyle M}esmetro{\displaystyle m}. Tenga en cuenta que esto no descarta la información relevante contenida en las muestras, ya que veremos que la función de verosimilitud se puede construir utilizando solo el número de muestras y el valor máximo observado.

La respuesta a este problema depende de la elección de la distribución a priori paranorte{\displaystyle N}Se puede proceder utilizando una distribución a priori adecuada sobre los enteros positivos, por ejemplo, la distribución de Poisson o la distribución binomial negativa, donde se puede obtener una fórmula cerrada para la media y la varianza a posteriori. [ 16 ] Más adelante, en cambio, adoptaremos una distribución a priori uniforme acotada.

Para mayor brevedad, en lo que sigue,(norte=norteMETRO=metro,K=k){\displaystyle (N=n\mid M=m,K=k)}está escrito(nortemetro,k){\displaystyle (n\mid m,k)}.

Probabilidad condicional

La regla para la probabilidad condicional da

(nortemetro,k)(metrok)=(metronorte,k)(nortek)=(metro,nortek){\displaystyle (n\mid m,k)(m\mid k)=(m\mid n,k)(n\mid k)=(m,n\mid k)}

Probabilidad de que M conozca a N y K

La expresión

(metronorte,k)=(METRO=metronorte=norte,K=k){\displaystyle (m\mid n,k)=(M=m\mid N=n,K=k)}

es la probabilidad condicional de que el número de serie máximo observado,METRO{\displaystyle M}, es igual ametro{\displaystyle m}, cuando el número de tanques enemigos,norte{\displaystyle N}, se sabe que es igual anorte{\displaystyle n}y el número de tanques enemigos observados,K{\displaystyle K}, se sabe que es igual ak{\displaystyle k}.

Es

(metronorte,k)=(metro1k1)(nortek)1[kmetro][metronorte]{\displaystyle (m\mid n,k)={\binom {m-1}{k-1}}{\binom {n}{k}}^{-1}[k\leq m][m\leq n]}

dónde(nortek){\displaystyle {\binom {n}{k}}}es un coeficiente binomial y[knorte]{\displaystyle [k\leq n]}es un soporte Iverson .

La expresión se puede derivar de la siguiente manera: (metronorte,k){\displaystyle (m\mid n,k)}responde a la pregunta: "¿Cuál es la probabilidad de un número de serie específico?"metro{\displaystyle m}siendo el número más alto observado en una muestra dek{\displaystyle k}tanques, dado que haynorte{\displaystyle n}¿tanques en total?

Se puede pensar en la muestra de tamañok{\displaystyle k}ser el resultado dek{\displaystyle k}sorteos individuales sin reemplazo. Supongametro{\displaystyle m}se observa en el número de sorteod{\displaystyle d}La probabilidad de que esto ocurra es: metro1nortemetro2norte1metro3norte2metrod+1norted+2d1 veces1norted+1sorteo n.º dmetrodnortedmetrod1norted1metrod(kd1)norted(kd1)kd veces=(nortek)¡norte¡(metro1)¡(metrok)¡.{\displaystyle \underbrace {{\frac {m-1}{n}}\cdot {\frac {m-2}{n-1}}\cdot {\frac {m-3}{n-2}}\cdots {\frac {m-d+1}{n-d+2}}} _{d-1{\text{ times}}}\cdot \underbrace {\frac {1}{n-d+1}} _{{\text{draw no. }}d}\cdot \underbrace {{\frac {m-d}{n-d}}\cdot {\frac {m-d-1}{n-d-1}}\cdots {\frac {m-d-(k-d-1)}{n-d-(k-d-1)}}} _{k-d{\text{ times}}}={\frac {(n-k)!}{n!}}\cdot {\frac {(m-1)!}{(m-k)!}}.}

Como se puede observar en el lado derecho, esta expresión es independiente ded{\displaystyle d}y por lo tanto lo mismo para cada unodk{\displaystyle d\leq k}. Comometro{\displaystyle m}se puede dibujark{\displaystyle k}diferentes sorteos, la probabilidad de cualquier específicometro{\displaystyle m}siendo el más grande observado esk{\displaystyle k}veces la probabilidad anterior: (metronorte,k)=k(nortek)¡norte¡(metro1)¡(metrok)¡=(metro1k1)(nortek)1.{\displaystyle (m\mid n,k)=k\cdot {\frac {(n-k)!}{n!}}\cdot {\frac {(m-1)!}{(m-k)!}}={\binom {m-1}{k-1}}{\binom {n}{k}}^{-1}.}

Visto de otra manera, despuésk{\displaystyle k}sorteos sin reemplazo, un sorteo fue para objetometro{\displaystyle m}y el otrok1{\displaystyle k-1}eran para objetos en el rango1{\displaystyle 1}ametro1{\displaystyle m-1} ; hay(metro1k1){\displaystyle {\binom {m-1}{k-1}}}formas de lograr esto. Y hay(nortek){\displaystyle {\binom {n}{k}}} formas de dibujar sin reemplazok{\displaystyle k}objetos de una colección denorte{\displaystyle n}objetos.

Probabilidad de que M conozca solo K

La expresión(metrok)=(METRO=metroK=k){\displaystyle (m\mid k)=(M=m\mid K=k)}es la probabilidad de que el número de serie máximo sea igual ametro{\displaystyle m}una vezk{\displaystyle k}Se han observado los tanques, pero antes se han podido observar los números de serie.

La expresión(metrok){\displaystyle (m\mid k)}puede reescribirse en términos de las otras cantidades marginalizando sobre todas las posiblesnorte{\displaystyle n}.

(metrok)=norte=0(metro,nortek)=norte=0(metronorte,k)(nortek){\displaystyle {\begin{aligned}(m\mid k)&=\sum _{n=0}^{\infty }(m,n\mid k)\\&=\sum _{n=0}^{\infty }(m\mid n,k)(n\mid k)\end{aligned}}}

Probabilidad previa de que N conozca solo K

Suponemos quek{\displaystyle k}está fijado de antemano para que no tengamos que considerar ninguna distribución sobrek{\displaystyle k}Por lo tanto, nuestro a priori puede depender dek{\displaystyle k}.

La expresión

(nortek)=(norte=norteK=k){\displaystyle (n\mid k)=(N=n\mid K=k)}

es la credibilidad que el número total de tanques,norte{\displaystyle N}, es igual anorte{\displaystyle n}cuando el númeroK{\displaystyle K}Se sabe que los tanques observados sonk{\displaystyle k}pero antes de que se hayan observado los números de serie. Supongamos que se trata de una distribución uniforme discreta.

(nortek)=(Ωk)1[knorte][norte<Ω]{\displaystyle (n\mid k)=(\Omega -k)^{-1}[k\leq n][n<\Omega ]}

El límite superior Ω{\displaystyle \Omega }debe ser finito, porque la función

F(norte)=límiteΩ(Ωk)1[knorte][norte<Ω]=0{\displaystyle f(n)=\lim _{\Omega \rightarrow \infty }(\Omega -k)^{-1}[k\leq n][n<\Omega ]=0}

no es una función de distribución de masa. Nuestro resultado a continuación no dependerá deΩ{\displaystyle \Omega }.

Probabilidad posterior de que N conozca M y K

Siempre queΩ>metro{\displaystyle \Omega >m}, de modo que la distribución a priori sea consistente con los datos observados:

(nortemetro,k)=(metronorte,k)(norte=metroΩ1(metronorte,k))1[metronorte][norte<Ω]{\displaystyle (n\mid m,k)=(m\mid n,k)\left(\sum _{n=m}^{\Omega -1}(m\mid n,k)\right)^{-1}[m\leq n][n<\Omega ]}

ComoΩ{\displaystyle \Omega \rightarrow \infty }, los enfoques de sumanorte=metro(metronorte,k){\displaystyle \sum _{n=m}^{\infty }(m\mid n,k)}(que es finito si k  2). Por lo tanto, para valores suficientemente grandesΩ{\displaystyle \Omega }, tenemos

(nortemetro,k)(metronorte,k)(norte=metro(metronorte,k))1[metronorte]{\displaystyle (n\mid m,k)\approx (m\mid n,k)\left(\sum _{n=m}^{\infty }(m\mid n,k)\right)^{-1}[m\leq n]}

Para k  1, la moda de la distribución del número de tanques enemigos es m .

Para k  2, la probabilidad de que el número de tanques enemigos sea igual anorte{\displaystyle n}, es

(norte=nortemetro,k)=(k1)(metro1k1)k1(nortek)1[metronorte]{\displaystyle (N=n\mid m,k)=(k-1){\binom {m-1}{k-1}}k^{-1}{\binom {n}{k}}^{-1}[m\leq n]}

La probabilidad de que el número de tanques enemigos, N , sea mayor que n , es

(norte>nortemetro,k)={1si norte<metro(metro1k1)(nortek1)si nortemetro{\displaystyle (N>n\mid m,k)={\begin{cases}1&{\text{if }}n<m\\{\frac {\binom {m-1}{k-1}}{\binom {n}{k-1}}}&{\text{if }}n\geq m\end{cases}}}

Valor medio y desviación estándar

Para k  3, N tiene un valor medio finito :

(metro1)(k1)(k2)1{\displaystyle (m-1)(k-1)(k-2)^{-1}}

Para k  4, N tiene una desviación estándar finita :

(k1)1/2(k2)1(k3)1/2(metro1)1/2(metro+1k)1/2{\displaystyle (k-1)^{1/2}(k-2)^{-1}(k-3)^{-1/2}(m-1)^{1/2}(m+1-k)^{1/2}}

Estas fórmulas se derivan a continuación.

Fórmula de sumatoria

La siguiente identidad de coeficientes binomiales se utiliza a continuación para simplificar series relacionadas con el problema del tanque alemán.

norte=metro1(nortek)=kk11(metro1k1){\displaystyle \sum _{n=m}^{\infty }{\frac {1}{\binom {n}{k}}}={\frac {k}{k-1}}{\frac {1}{\binom {m-1}{k-1}}}}

Esta fórmula de suma es algo análoga a la fórmula integral.

norte=metrodnortenortek=1k11metrok1{\displaystyle \int _{n=m}^{\infty }{\frac {dn}{n^{k}}}={\frac {1}{k-1}}{\frac {1}{m^{k-1}}}}

Estas fórmulas son válidas para k  >  1.

Un tanque

Observar un tanque al azar de una población de n tanques da el número de serie m con probabilidad 1/ n para m n , y probabilidad cero para m > n . Usando la notación de corchetes de Iverson, esto se escribe   

(METRO=metronorte=norte,K=1)=(metronorte)=[metronorte]norte{\displaystyle (M=m\mid N=n,K=1)=(m\mid n)={\frac {[m\leq n]}{n}}}

Esta es la función de distribución de masa de probabilidad condicional demetro{\displaystyle m}.

Cuando se considera como una función de n para un m fijo , se trata de una función de verosimilitud.

L(norte)=[nortemetro]norte{\displaystyle {\mathcal {L}}(n)={\frac {[n\geq m]}{n}}}

La estimación de máxima verosimilitud para el número total de tanques es N 0  = m , claramente una estimación sesgada ya que el número real puede ser mayor que este, potencialmente mucho mayor, pero no puede ser menor. 

La verosimilitud marginal (es decir, marginalizada sobre todos los modelos) es infinita , siendo una cola de la serie armónica .

norteL(norte)=norte=metro1norte={\displaystyle \sum _{n}{\mathcal {L}}(n)=\sum _{n=m}^{\infty }{\frac {1}{n}}=\infty }

pero

norteL(norte)[norte<Ω]=norte=metroΩ11norte=HΩ1Hmetro1{\displaystyle {\begin{aligned}\sum _{n}{\mathcal {L}}(n)[n<\Omega ]&=\sum _{n=m}^{\Omega -1}{\frac {1}{n}}\\[5pt]&=H_{\Omega -1}-H_{m-1}\end{aligned}}}

dóndeHnorte{\displaystyle H_{n}}es el número armónico .

La función de distribución de masa de credibilidad depende del límite previo.Ω{\displaystyle \Omega }:

(norte=norteMETRO=metro,K=1)=(nortemetro)=[metronorte]norte[norte<Ω]HΩ1Hmetro1{\displaystyle {\begin{aligned}&(N=n\mid M=m,K=1)\\[5pt]={}&(n\mid m)={\frac {[m\leq n]}{n}}{\frac {[n<\Omega ]}{H_{\Omega -1}-H_{m-1}}}\end{aligned}}}

El valor medio de norte{\displaystyle N}es

nortenorte(nortemetro)=norte=metroΩ11HΩ1Hmetro1=ΩmetroHΩ1Hmetro1Ωmetroregistro(Ω1metro1){\displaystyle {\begin{aligned}\sum _{n}n\cdot (n\mid m)&=\sum _{n=m}^{\Omega -1}{\frac {1}{H_{\Omega -1}-H_{m-1}}}\\[5pt]&={\frac {\Omega -m}{H_{\Omega -1}-H_{m-1}}}\\[5pt]&\approx {\frac {\Omega -m}{\log \left({\frac {\Omega -1}{m-1}}\right)}}\end{aligned}}}

Dos tanques

Si se observan dos tanques en lugar de uno, entonces la probabilidad de que el mayor de los dos números de serie observados sea igual a m es

(METRO=metronorte=norte,K=2)=(metronorte)=[metronorte]metro1(norte2){\displaystyle (M=m\mid N=n,K=2)=(m\mid n)=[m\leq n]{\frac {m-1}{\binom {n}{2}}}}

Cuando se considera una función de n para un m fijo , se trata de una función de verosimilitud.

L(norte)=[nortemetro]metro1(norte2){\displaystyle {\mathcal {L}}(n)=[n\geq m]{\frac {m-1}{\binom {n}{2}}}}

La probabilidad total es

norteL(norte)=metro11norte=metro1(norte2)=metro112211(metro121)=2{\displaystyle {\begin{aligned}\sum _{n}{\mathcal {L}}(n)&={\frac {m-1}{1}}\sum _{n=m}^{\infty }{\frac {1}{\binom {n}{2}}}\\[4pt]&={\frac {m-1}{1}}\cdot {\frac {2}{2-1}}\cdot {\frac {1}{\binom {m-1}{2-1}}}\\[4pt]&=2\end{aligned}}}

y la función de distribución de masa de credibilidad es

(norte=norteMETRO=metro,K=2)=(nortemetro)=L(norte)norteL(norte)=[nortemetro]metro1norte(norte1){\displaystyle {\begin{aligned}&(N=n\mid M=m,K=2)\\[4pt]={}&(n\mid m)\\[4pt]={}&{\frac {{\mathcal {L}}(n)}{\sum _{n}{\mathcal {L}}(n)}}\\[4pt]={}&[n\geq m]{\frac {m-1}{n(n-1)}}\end{aligned}}}

La mediananorte~{\displaystyle {\tilde {N}}}Satisface

norte[nortenorte~](nortemetro)=12{\displaystyle \sum _{n}[n\geq {\tilde {N}}](n\mid m)={\frac {1}{2}}}

entonces

metro1norte~1=12{\displaystyle {\frac {m-1}{{\tilde {N}}-1}}={\frac {1}{2}}}

y por lo tanto la mediana es

norte~=2metro1{\displaystyle {\tilde {N}}=2m-1}

pero el valor medio denorte{\displaystyle N}es infinito

μ=nortenorte(nortemetro)=metro11norte=metro1norte1={\displaystyle \mu =\sum _{n}n\cdot (n\mid m)={\frac {m-1}{1}}\sum _{n=m}^{\infty }{\frac {1}{n-1}}=\infty }

Muchos tanques

Función de distribución de masa de credibilidad

La probabilidad condicional de que la mayor de las k observaciones tomadas de los números de serie {1,..., n } sea igual a m es

(METRO=metronorte=norte,K=k2)=(metronorte,k)=[metronorte](metro1k1)(nortek){\displaystyle {\begin{aligned}&(M=m\mid N=n,K=k\geq 2)\\={}&(m\mid n,k)\\={}&[m\leq n]{\frac {\binom {m-1}{k-1}}{\binom {n}{k}}}\end{aligned}}}

La función de verosimilitud de n es la misma expresión

L(norte)=[nortemetro](metro1k1)(nortek){\displaystyle {\mathcal {L}}(n)=[n\geq m]{\frac {\binom {m-1}{k-1}}{\binom {n}{k}}}}

La probabilidad total es finita para k ≥ 2:

norteL(norte)=(metro1k1)1norte=metro1(nortek)=(metro1k1)1kk11(metro1k1)=kk1{\displaystyle {\begin{aligned}\sum _{n}{\mathcal {L}}(n)&={\frac {\binom {m-1}{k-1}}{1}}\sum _{n=m}^{\infty }{1 \over {\binom {n}{k}}}\\&={\frac {\binom {m-1}{k-1}}{1}}\cdot {\frac {k}{k-1}}\cdot {\frac {1}{\binom {m-1}{k-1}}}\\&={\frac {k}{k-1}}\end{aligned}}}

La función de distribución de masa de credibilidad es

(norte=norteMETRO=metro,K=k2)=(nortemetro,k)=L(norte)norteL(norte)=[nortemetro]k1k(metro1k1)(nortek)=[nortemetro]metro1norte(metro2k2)(norte1k1)=[nortemetro]metro1nortemetro2norte1k1k2(metro3k3)(norte2k2){\displaystyle {\begin{aligned}&(N=n\mid M=m,K=k\geq 2)=(n\mid m,k)\\={}&{\frac {{\mathcal {L}}(n)}{\sum _{n}{\mathcal {L}}(n)}}\\={}&[n\geq m]{\frac {k-1}{k}}{\frac {\binom {m-1}{k-1}}{\binom {n}{k}}}\\={}&[n\geq m]{\frac {m-1}{n}}{\frac {\binom {m-2}{k-2}}{\binom {n-1}{k-1}}}\\={}&[n\geq m]{\frac {m-1}{n}}{\frac {m-2}{n-1}}{\frac {k-1}{k-2}}{\frac {\binom {m-3}{k-3}}{\binom {n-2}{k-2}}}\end{aligned}}}

La función de distribución acumulativa complementaria es la probabilidad de que N > x

(norte>incógnitaMETRO=metro,K=k)={1si incógnita<metronorte=incógnita+1(nortemetro,k)si incógnitametro=[incógnita<metro]+[incógnitametro]norte=incógnita+1k1k(metro1k1)(nortek)=[incógnita<metro]+[incógnitametro]k1k(metro1k1)1norte=incógnita+11(nortek)=[incógnita<metro]+[incógnitametro]k1k(metro1k1)1kk11(incógnitak1)=[incógnita<metro]+[incógnitametro](metro1k1)(incógnitak1){\displaystyle {\begin{aligned}&(N>x\mid M=m,K=k)\\[4pt]={}&{\begin{cases}1&{\text{if }}x<m\\\sum _{n=x+1}^{\infty }(n\mid m,k)&{\text{if }}x\geq m\end{cases}}\\={}&[x<m]+[x\geq m]\sum _{n=x+1}^{\infty }{\frac {k-1}{k}}{\frac {\binom {m-1}{k-1}}{\binom {N}{k}}}\\[4pt]={}&[x<m]+[x\geq m]{\frac {k-1}{k}}{\frac {\binom {m-1}{k-1}}{1}}\sum _{n=x+1}^{\infty }{\frac {1}{\binom {n}{k}}}\\[4pt]={}&[x<m]+[x\geq m]{\frac {k-1}{k}}{\frac {\binom {m-1}{k-1}}{1}}\cdot {\frac {k}{k-1}}{\frac {1}{\binom {x}{k-1}}}\\[4pt]={}&[x<m]+[x\geq m]{\frac {\binom {m-1}{k-1}}{\binom {x}{k-1}}}\end{aligned}}}

La función de distribución acumulativa es la probabilidad de que Nx

(norteincógnitaMETRO=metro,K=k)=1(norte>incógnitaMETRO=metro,K=k)=[incógnitametro](1(metro1k1)(incógnitak1)){\displaystyle {\begin{aligned}&(N\leq x\mid M=m,K=k)\\[4pt]={}&1-(N>x\mid M=m,K=k)\\[4pt]={}&[x\geq m]\left(1-{\frac {\binom {m-1}{k-1}}{\binom {x}{k-1}}}\right)\end{aligned}}}

Orden de magnitud

El orden de magnitud del número de tanques enemigos es

μ=nortenorte(norte=norteMETRO=metro,K=k)=nortenorte[nortemetro]metro1norte(metro2k2)(norte1k1)=metro11(metro2k2)1norte=metro1(norte1k1)=metro11(metro2k2)1k1k21(metro2k2)=metro11k1k2{\displaystyle {\begin{aligned}\mu &=\sum _{n}n\cdot (N=n\mid M=m,K=k)\\[4pt]&=\sum _{n}n[n\geq m]{\frac {m-1}{n}}{\frac {\binom {m-2}{k-2}}{\binom {n-1}{k-1}}}\\[4pt]&={\frac {m-1}{1}}{\frac {\binom {m-2}{k-2}}{1}}\sum _{n=m}^{\infty }{\frac {1}{\binom {n-1}{k-1}}}\\[4pt]&={\frac {m-1}{1}}{\frac {\binom {m-2}{k-2}}{1}}\cdot {\frac {k-1}{k-2}}{\frac {1}{\binom {m-2}{k-2}}}\\[4pt]&={\frac {m-1}{1}}{\frac {k-1}{k-2}}\end{aligned}}}

Incertidumbre estadística

La incertidumbre estadística es la desviación estándarσ{\displaystyle \sigma }, satisfaciendo la ecuación

σ2+μ2=nortenorte2(norte=norteMETRO=metro,K=k){\displaystyle \sigma ^{2}+\mu ^{2}=\sum _{n}n^{2}\cdot (N=n\mid M=m,K=k)}

Entonces

σ2+μ2μ=nortenorte(norte1)(norte=norteMETRO=metro,K=k)=norte=metronorte(norte1)metro1nortemetro2norte1k1k2(metro3k3)(norte2k2)=metro11metro21k1k2(metro3k3)1norte=metro1(norte2k2)=metro11metro21k1k2(metro3k3)1k2k31(metro3k3)=metro11metro21k1k3{\displaystyle {\begin{aligned}\sigma ^{2}+\mu ^{2}-\mu &=\sum _{n}n(n-1)\cdot (N=n\mid M=m,K=k)\\[4pt]&=\sum _{n=m}^{\infty }n(n-1){\frac {m-1}{n}}{\frac {m-2}{n-1}}{\frac {k-1}{k-2}}{\frac {\binom {m-3}{k-3}}{\binom {n-2}{k-2}}}\\[4pt]&={\frac {m-1}{1}}{\frac {m-2}{1}}{\frac {k-1}{k-2}}\cdot {\frac {\binom {m-3}{k-3}}{1}}\sum _{n=m}^{\infty }{\frac {1}{\binom {n-2}{k-2}}}\\[4pt]&={\frac {m-1}{1}}{\frac {m-2}{1}}{\frac {k-1}{k-2}}{\frac {\binom {m-3}{k-3}}{1}}{\frac {k-2}{k-3}}{\frac {1}{\binom {m-3}{k-3}}}\\[4pt]&={\frac {m-1}{1}}{\frac {m-2}{1}}{\frac {k-1}{k-3}}\end{aligned}}}

y

σ=metro11metro21k1k3+μμ2=(k1)(metro1)(metrok+1)(k3)(k2)2{\displaystyle {\begin{aligned}\sigma &={\sqrt {{\frac {m-1}{1}}{\frac {m-2}{1}}{\frac {k-1}{k-3}}+\mu -\mu ^{2}}}\\[4pt]&={\sqrt {\frac {(k-1)(m-1)(m-k+1)}{(k-3)(k-2)^{2}}}}\end{aligned}}}

La relación varianza-media es simplemente

σ2μ=metrok+1(k3)(k2){\displaystyle {\frac {\sigma ^{2}}{\mu }}={\frac {m-k+1}{(k-3)(k-2)}}}

Véase también

Lecturas adicionales

  • Grime, James (31 de julio de 2024). "La forma inteligente de contar tanques - Numberphile" (video) . YouTube . Brady Haran . Recuperado el 18 de octubre de 2024 .

Notas

  1. Una declaración de política de las Fuerzas Terrestres Blindadas de noviembre de 1943 concluía: «La recomendación de una proporción limitada de tanques equipados con un cañón de 90 mm no cuenta con el consenso por las siguientes razones: El tanque M4 ha sido ampliamente aclamado como el mejor tanque del campo de batalla actual. ... Al parecer, nuestras fuerzas no temen al tanque alemán Mark VI (Tigre). No existe fundamento alguno para el tanque T26, salvo la concepción de un duelo tanque contra tanque, lo cual se considera imprudente e innecesario». [ 2 ]
  2. Se desconocía el límite inferior, pero para simplificar la discusión, este detalle generalmente se omite, tomando como conocido el límite inferior como 1.
  3. Ruggles y Brodie es principalmente un análisis y resumen práctico, no matemático; el problema de la estimación solo se menciona en la nota al pie 3 de la página 82, donde estiman el máximo como "máximo de la muestra + brecha promedio".
  4. Como se explicó en el ataque de cumpleaños , se puede esperar una colisión después de 1,25H números, si se elige entre H posibles resultados. Esta raíz cuadrada corresponde a la mitad de los dígitos. Por ejemplo, en cualquier base, la raíz cuadrada de un número con 100 dígitos es aproximadamente un número con 50 dígitos.
  5. En una distribución continua, no hay término −1.
  6. Dado un conjunto particular de observaciones, es más probable que este conjunto ocurra si el máximo de la población es el máximo de la muestra, no un valor más alto (no puede ser más bajo).
  7. El máximo de la muestra nunca es mayor que el máximo de la población, pero puede ser menor, por lo tanto es un estimador sesgado : tenderá a subestimar el máximo de la población.
  8. Por ejemplo, la diferencia entre 2 y 7 es (7  2)  1 = 4, que consta de 3, 4, 5 y 6.

Referencias

  1. Sarasohn-Kahn, Jane (21 de octubre de 2010). "Cómo los Aliados utilizaron las matemáticas contra los tanques alemanes" . Wired . Consultado el 28 de junio de 2026 .
  2. Declaración de política de la AGF. Jefe de Estado Mayor de la AGF. Noviembre de 1943. MHI
  3. Ruggles y Brodie 1947 , págs. 73–74.
  4. 1 2 "Gavyn Davies hace los cálculos: cómo una fórmula estadística ganó la guerra" . The Guardian . 20 de julio de 2006. Consultado el 6 de julio de 2014 .
  5. Matthews, Robert (23 de mayo de 1998), "Los investigadores de datos van a la guerra", recuadro en el artículo "Verdades ocultas"" , New Scientist , archivado del original el 18 de abril de 2001
  6. Bob Carruthers (1 de marzo de 2012). Panther V en combate . Coda Books. págs. 94–. ISBN  978-1-908538-15-4.
  7. Ruggles y Brodie 1947 , págs. 82–83.
  8. Ruggles y Brodie 1947 , pág. 89.
  9. Ruggles y Brodie 1947 , págs. 90–91.
  10. Volz 2008 .
  11. 1 2 3 Johnson 1994 .
  12. "¿Cuántas computadoras Commodore 64 se vendieron realmente?" . pagetable.com . 1 de febrero de 2011. Archivado del original el 6 de marzo de 2016. Consultado el 6 de julio de 2014 . 
  13. "Cohetes y misiles" . www.spaceline.org .
  14. Joyce, Smart. "El problema de los tanques alemanes" . Logan High School . Archivado del original el 24 de abril de 2012. Recuperado el 8 de julio de 2014 .
  15. Simon, Cory (2023). " Un tratamiento bayesiano del problema del tanque alemán" . The Mathematical Intelligencer . 46 (2): 117– 127. arXiv : 2301.00046 . doi : 10.1007/s00283-023-10274-6 . PMC 11147940. PMID 38841650 .  
  16. Höhle, M.; Celebrado, L. (2006). "Estimación bayesiana del tamaño de una población" (PDF) . Informe técnico SFB 386, n.º 399, Departamento de Estadística, Universidad Ludwig-Maximilians-Universität München . Consultado el 17 de abril de 2016 .

Obras citadas

  • Johnson, RW (verano de 1994). "Estimación del tamaño de una población" (PDF) . Teaching Statistics . 16 (2): 50– 52. doi : 10.1111/j.1467-9639.1994.tb00688.x . Archivado del original (PDF) el 23 de febrero de 2014.
  • Ruggles, R.; Brodie, H. (1947). "Un enfoque empírico de la inteligencia económica en la Segunda Guerra Mundial". Journal of the American Statistical Association . 42 (237): 72. doi : 10.1080/01621459.1947.10501915 . JSTOR 2280189 . 
  • Volz, AG (julio de 2008). "Una estimación soviética de la producción de tanques alemanes". The Journal of Slavic Military Studies . 21 (3): 588– 590. doi : 10.1080/13518040802313902 . S2CID 144483708 .