Articulo de referencia

Problema de especies invisibles

El problema de las especies no observadas en ecología se refiere a la estimación del número de especies presentes en un ecosistema que no fueron observadas en las muestras. Más ...

El problema de las especies no observadas en ecología se refiere a la estimación del número de especies presentes en un ecosistema que no fueron observadas en las muestras. Más específicamente, se relaciona con cuántas especies nuevas se descubrirían si se tomaran más muestras en un ecosistema. El estudio de este problema comenzó a principios de la década de 1940, gracias a Alexander Steven Corbet . Pasó dos años en la Malasia británica capturando mariposas y tenía curiosidad por saber cuántas especies nuevas descubriría si dedicara otros dos años a ello. Se han desarrollado diversos métodos de estimación para determinar cuántas especies nuevas se descubrirían con un mayor número de muestras.

El problema de las especies no vistas también se aplica de forma más general, ya que los estimadores pueden utilizarse para estimar cualquier elemento nuevo de un conjunto que no se haya encontrado previamente en las muestras. Un ejemplo de esto es determinar cuántas palabras conocía William Shakespeare basándose en todas sus obras escritas. [ 1 ]

El problema de las especies no vistas se puede desglosar matemáticamente de la siguiente manera: Sinorte{\displaystyle n}Se toman muestras independientes,incógnitanorteincógnita1,,incógnitanorte{\displaystyle X^{n}\triangleq X_{1},\ldots ,X_{n}}y luego simetro{\displaystyle m}Se tomaron más muestras independientes, el número de especies no vistas que se descubrirán con las muestras adicionales viene dado por UU(incógnitanorte,incógnitanorte+1metro+norte)|{incógnitanorte+1metro+norte}{incógnitanorte}|,{\displaystyle U\triangleq U(X^{n},X_{n+1}^{m+n})\triangleq \left|\{X_{n+1}^{m+n}\}\setminus \{X^{n}\}\right|,} conincógnitanorte+1metro+norteincógnitanorte+1,,incógnitanorte+metro{\displaystyle X_{n+1}^{m+n}\triangleq X_{n+1},\ldots ,X_{n+m}}siendo el segundo conjunto demetro{\displaystyle m}muestras.

Historia

A principios de la década de 1940, Alexander Steven Corbet pasó dos  años en la Malasia británica capturando mariposas. [ 2 ] Llevó un registro de cuántas especies observó y cuántos ejemplares de cada especie capturó. Por ejemplo, había 74  especies diferentes de las cuales capturó solo dos  mariposas.

Cuando Corbet regresó al Reino Unido, se acercó al bioestadístico Ronald Fisher y le preguntó cuántas especies nuevas de mariposas podría esperar capturar si continuaba con la captura durante otros dos años; [ 3 ] .

Fisher respondió con una estimación simple: para 2  años adicionales de trampeo, Corbet podría esperar capturar 75  especies nuevas. Hizo esto usando una suma simple (datos proporcionados por Orlitsky [ 3 ] en la tabla del Ejemplo a continuación: U=i=1norte(1)i+1φi=11874+4424+12+6=75.{\displaystyle U=\sum _{i=1}^{n}(-1)^{i+1}\varphi _{i}=118-74+44-24+\cdots -12+6=75.} Aquíφi{\displaystyle \varphi _{i}}corresponde al número de especies individuales que fueron observadasi{\displaystyle i}veces. La suma de Fisher fue confirmada posteriormente por Good-Toulmin. [ 2 ]

Estimadores

Para estimar el número de especies no vistas, dejemostmetro/norte{\displaystyle t\triangleq m/n}sea ​​el número de muestras futuras (metro{\displaystyle m}) dividido por el número de muestras anteriores (norte{\displaystyle n}), ometro=tnorte{\displaystyle m=tn}. Dejarφi{\displaystyle \varphi _{i}}sea ​​el número de especies individuales observadasi{\displaystyle i}veces (por ejemplo, si hubiera 74 especies de mariposas con 2 miembros observados en todas las muestras, entoncesφ2=74{\displaystyle \varphi _{2}=74}).

Estimador de Good-Toulmin

El estimador de Good-Toulmin (GT) fue desarrollado por Good y Toulmin en 1953. [ 4 ] La estimación de las especies no vistas basada en el estimador de Good-Toulmin viene dada por UGTUGT(incógnitanorte,t)i=1(t)iφi.{\displaystyle U^{\text{GT}}\triangleq U^{\text{GT}}(X^{n},t)\triangleq -\sum _{i=1}^{\infty }(-t)^{i}\varphi _{i}.} Se ha demostrado que el estimador de Good-Toulmin es una buena estimación para valores det1.{\displaystyle t\leq 1.}El estimador de Good-Toulmin también satisface aproximadamente mi(UGTU)2nortet2.{\displaystyle \operatorname {\mathbb {E} } (U^{\text{GT}}-U)^{2}\lesssim nt^{2}.} Esto significa queUGT{\displaystyle U^{\text{GT}}}estimacionesU{\displaystyle U}a dentronortet,{\displaystyle {\sqrt {n}}\cdot t,}mientrast1.{\displaystyle t\leq 1.}

Sin embargo, parat>1,{\displaystyle t>1,}, el estimador de Good-Toulmin no logra capturar resultados precisos. Esto se debe a que, sit>1,{\displaystyle t>1,}UGT{\displaystyle U^{\text{GT}}}aumenta por(t)iφi{\displaystyle (-t)^{i}\varphi _{i}}parai{\displaystyle i}conφi>0,{\displaystyle \varphi _ {i}>0,}lo que significa que siφi>0,{\displaystyle \varphi _ {i}>0,}UGT{\displaystyle U^{\text{GT}}}crece de forma superlineal ent,{\displaystyle t,}peroU{\displaystyle U}puede crecer como máximo linealmente cont.{\displaystyle t.}Por lo tanto, cuandot>1,{\displaystyle t>1,}UGT{\displaystyle U^{\text{GT}}}crece más rápido queU{\displaystyle U}y no se aproxima al valor verdadero. [ 3 ]

Para compensar esto, Efron y Thisted en 1976 [ 1 ] demostraron que una transformada de Euler truncada también puede ser una estimación utilizable (la estimación "ET"): UETi=1nortehhETφi,{\displaystyle U^{\text{ET}}\triangleq \sum _{i=1}^{n}h_{h}^{\text{ET}}\cdot \varphi _{i},} con hiET(t)i+1PAG(incógnitai),{\displaystyle h_{i}^{\text{ET}}\triangleq (-t)^{i+1}\cdot \mathbb {P} (X\geq i),} dóndeincógnitaPapelera(k,11+t),{\displaystyle X\sim \operatorname {Bin} \left(k,{\frac {1}{1+t}}\right),}y PAG(incógnitai)={j=ik(kj)tkj(1+t)k para ik,0 para i>k,{\displaystyle \mathbb {P} (X\geq i)={\begin{cases}\displaystyle \sum _{j=i}^{k}{\binom {k}{j}}{\frac {t^{kj}}{(1+t)^{k}}}&{\text{ para }}i\leq k,\\0&{\text{ para }}i>k,\end{cases}}} dóndek{\displaystyle k}es la ubicación elegida para truncar la transformada de Euler.

Estimador suavizado de Good-Toulmin

De forma similar al enfoque de Efron y Thisted, Alon Orlitsky , Ananda Theertha Suresh y Yihong Wu desarrollaron el estimador suave de Good-Toulmin. Se dieron cuenta de que el estimador de Good-Toulmin fallaba debido al crecimiento exponencial, y no a su sesgo. [ 3 ] Por lo tanto, estimaron el número de especies no vistas truncando la serie Uli=1l(t)iφi.{\displaystyle U^{l}\triangleq -\sum _{i=1}^{l}(-t)^{i}\varphi _{i}.} Orlitsky, Suresh y Wu también señalaron que para las distribuciones cont>1{\displaystyle t>1}, el término impulsor en la estimación de sumatoria es ellel{\displaystyle l-{\text{o}}}término, independientemente de qué valor del{\displaystyle l}se elige. [ 2 ] Para resolver esto, seleccionaron un número entero no negativo aleatorio.L{\displaystyle L}, truncó la serie enL{\displaystyle L}y luego tomó el promedio sobre una distribución de aproximadamenteL{\displaystyle L}. [ 3 ] El estimador resultante es UL=miL[i=1L(t)iφi].{\displaystyle U^{L}=\operatorname {E} _{L}\left[-\sum _{i=1}^{L}(-t)^{i}\varphi _{i}\right].} Este método fue elegido debido al sesgo deUl{\displaystyle U^{l}}cambia las señales debido a la(t)i{\displaystyle (-t)^{i}}coeficiente. Promediando sobre una distribución deL{\displaystyle L}por lo tanto reduce el sesgo. Esto significa que el estimador puede escribirse como la combinación lineal de la prevalencia: [ 2 ]UL=miL[i1(t)iφi1iL]=i1(t)iPr(Li)φi.{\displaystyle U^{L}=\operatorname {E} _{L}\left[-\sum _{i\geq 1}(-t)^{i}\varphi _{i}\mathbf {1} _{i\leq L}\right]=-\sum _{i\geq 1}(-t)^{i}\Pr(L\geq i)\varphi _{i}.} Dependiendo de la distribución deL{\displaystyle L}elegido, los resultados variarán. Con este método, se pueden hacer estimaciones paratlnnorte{\displaystyle t\propto \ln n}y esto es lo mejor posible. [ 3 ]

Curva de descubrimiento de especies

También se puede utilizar la curva de descubrimiento de especies . Esta curva relaciona el número de especies encontradas en un área en función del tiempo. Estas curvas también se pueden crear utilizando estimadores (como el estimador de Good-Toulmin) y graficando el número de especies no vistas en cada valor det{\displaystyle t}. [ 5 ]

Una curva de descubrimiento de especies siempre es creciente, ya que nunca hay una muestra que pueda disminuir el número de especies descubiertas. Además, la curva de descubrimiento de especies también se desacelera : cuantas más muestras se toman, menos especies no vistas se espera descubrir. La curva de descubrimiento de especies tampoco se estabilizará, ya que se supone que, aunque la tasa de descubrimiento podría volverse infinitamente lenta, nunca se detendrá por completo. [ 5 ] Dos modelos comunes para una curva de descubrimiento de especies son la función logarítmica y la exponencial . 

Ejemplo: Las mariposas de Corbet

Como ejemplo, consideremos los datos que Corbet proporcionó a Fisher en la década de 1940. [ 3 ] Utilizando el modelo de Good-Toulmin, se encuentra el número de especies no vistas utilizando U=i=1(t)iφi.{\displaystyle U=-\sum _{i=1}^{\infty }(-t)^{i}\varphi _{i}.} Esto puede utilizarse entonces para crear una relación entret{\displaystyle t}yU{\displaystyle U}.

Esta relación se muestra en el gráfico a continuación.

Número de especies no observadas en función de t, la relación entre las muestras nuevas y las muestras anteriores.

Del gráfico se observa que ent=1{\displaystyle t=1}, que era el valor det{\displaystyle t}que Corbet llevó a Fisher, la estimación resultante deU{\displaystyle U}es 75, coincidiendo con lo que encontró Fisher. Este gráfico también actúa como una curva de descubrimiento de especies para este ecosistema y define cuántas especies nuevas se descubrirán comot{\displaystyle t}aumenta (y se toman más muestras).

Otros usos

El algoritmo predictivo tiene numerosas aplicaciones. Sabiendo que los estimadores son precisos, permite a los científicos extrapolar con exactitud los resultados de las encuestas, multiplicándolos por un factor de 2. Pueden predecir el número de respuestas únicas basándose en el número de personas que han respondido de forma similar. El método también puede utilizarse para determinar el nivel de conocimiento de una persona.

Ejemplo: ¿Cuántas palabras conocía Shakespeare?

Según la investigación de las obras conocidas de Shakespeare realizada por Thisted y Efron, hay un total de 884.647 palabras. [ 1 ] La investigación también encontró que hay un total denorte=864{\displaystyle N=864}palabras diferentes que aparecen más de 100 veces. Por lo tanto, se encontró que el número total de palabras únicas era 31.534. [ 1 ] Aplicando el modelo Good-Toulmin, si se descubriera un número igual de obras de Shakespeare, entonces se estima queUpalabras11.460{\displaystyle U^{\text{palabras}}\approx 11{,}460}Se encontrarían palabras únicas. El objetivo sería derivarUpalabras{\displaystyle U^{\text{palabras}}}parat={\displaystyle t=\infty }Thisted y Efron estiman queUpalabras(t)35.000{\displaystyle U^{\text{palabras}}(t\to \infty )\approx 35{}000}, lo que significa que Shakespeare probablemente conocía más del doble de palabras de las que realmente usó en todos sus escritos. [ 1 ]

Véase también

Referencias

  1. 1 2 3 4 5 Efron, Bradley; Thisted, Ronald (1976). "Estimando el número de especies invisibles: ¿Cuántas palabras conocía Shakespeare?". Biometrika . 63 (3): 435– 447. doi : 10.2307/2335721 . JSTOR 2335721 . 
  2. 1 2 3 4 Orlitsky, Alon; Suresh, Ananda Theertha; Wu, Yihong (22-11-2016). "Predicción óptima del número de especies no vistas" . Actas de la Academia Nacional de Ciencias . 113 (47): 13283– 13288. Bibcode : 2016PNAS..11313283O . doi : 10.1073/pnas.1607774113 . PMC 5127330. PMID 27830649 .  
  3. 1 2 3 4 5 6 7 8 Orlitsky, Alon; Suresh, Ananda Theertha; Wu, Yihong (2015-11-23). ​​"Estimating the number of unseen species: A bird in the hand is worth log n in the bush". arXiv : 1511.07428 [ math.ST ].
  4. Good, IJ; Toulmin, GH (1956). "El número de especies nuevas y el aumento de la cobertura poblacional al aumentar el tamaño de la muestra" . Biometrika . 43 ( 1–2 ): 45–63 . doi : 10.1093/biomet/43.1-2.45 . ISSN 0006-3444 . 
  5. 1 2 Bebber, D. P; Marriott, FHC; Gaston, K. J; Harris, S. A; Scotland, R. W (7 de julio de 2007). "Predicción de números de especies desconocidas mediante curvas de descubrimiento" . Proceedings of the Royal Society B: Biological Sciences . 274 (1618): 1651– 1658. doi : 10.1098/rspb.2007.0464 . PMC 2169286. PMID 17456460 .