Articulo de referencia

Estadísticas N50, L50 y relacionadas

En biología computacional , N50 y L50 son estadísticas que miden la longitud de un conjunto de contigs o andamios . El N50 es similar a la media o mediana de longitudes, pero ot...

En biología computacional , N50 y L50 son estadísticas que miden la longitud de un conjunto de contigs o andamios . El N50 es similar a la media o mediana de longitudes, pero otorga mayor peso a los contigs más largos. Se utiliza ampliamente en el ensamblaje de genomas , especialmente para medir la longitud de los contigs en un ensamblaje preliminar. También existen las estadísticas relacionadas U50 , UL50 , UG50 , UG50% , N90 , NG50 y D50 .

Para proporcionar una mejor evaluación del resultado del ensamblaje para conjuntos de datos virales y microbianos, se debe utilizar una nueva métrica llamada U50 . La U50 identifica contigs únicos y específicos del objetivo utilizando un genoma de referencia como línea base, con el fin de sortear algunas limitaciones inherentes a la métrica N50 . El uso de la métrica U50 permite una medición más precisa del rendimiento del ensamblaje al analizar solo los contigs únicos y no superpuestos. La mayoría de las secuencias virales y microbianas tienen un alto ruido de fondo (es decir, del huésped y otros no objetivos), lo que contribuye a tener un valor N50 sesgado y mal representado ; esto se corrige con la U50 . [ 1 ]

Definición

N50

La estadística N50 define la calidad del ensamblaje en términos de contigüidad . Dado un conjunto de contigs, el N50 se define como la longitud de secuencia del contig más corto que representa el 50% de la longitud total del ensamblaje. Puede considerarse como el punto medio de la distribución; el número de bases de todos los contigs más largos que el N50 será cercano al número de bases de todos los contigs más cortos que el N50 . Por ejemplo, consideremos 9 contigs con longitudes de 2, 3, 4, 5, 6, 7, 8, 9 y 10; su suma es 54, la mitad de la suma es 27, y el tamaño del genoma también es 54. Entonces, el 50% de este ensamblaje sería 10 + 9 + 8 = 27 (la mitad de la longitud de la secuencia). Por lo tanto, el N50 = 8, que es el tamaño del contig que, junto con los contigs más grandes, contiene la mitad de la secuencia de un genoma en particular. Nota: Al comparar los valores N50 de diferentes ensamblajes, los tamaños de los ensamblajes deben ser iguales para que el valor N50 sea significativo.

N50 puede describirse como una estadística de mediana ponderada, de modo que el 50% del ensamblaje completo está contenido en contigs o andamios iguales o mayores que este valor.

L50

Dado un conjunto de contigs, cada uno con su propia longitud, el L50 se define como el recuento del número más pequeño de contigs cuya suma de longitudes constituye la mitad del tamaño del genoma . Del ejemplo anterior, L50=3.

N90

El estadístico N90 es menor o igual que el estadístico N50 ; es la longitud para la cual el conjunto de todos los contigs de esa longitud o más largos contiene al menos el 90% de la suma de las longitudes de todos los contigs.

NG50

Cabe destacar que N50 se calcula en función del tamaño del ensamblaje, no del tamaño del genoma. Por lo tanto, las comparaciones de valores N50 derivados de ensamblajes de longitudes significativamente diferentes no suelen ser informativas, incluso para el mismo genoma. Para solucionar esto, los autores de la competición Assemblathon propusieron una nueva medida llamada NG50 . La estadística NG50 es igual que N50, excepto que representa el 50 % del tamaño del genoma conocido o estimado, que debe tener una longitud igual o superior a NG50. Esto permite realizar comparaciones significativas entre diferentes ensamblajes. En el caso típico de que el tamaño del ensamblaje no supere el tamaño del genoma, la estadística NG50 no será mayor que la estadística N50.

D50

El estadístico D50 (también denominado prueba D50 ) es similar al estadístico N50 en su definición, aunque generalmente no se utiliza para describir ensamblajes de genomas. El estadístico D50 es el valor más bajo d para el cual la suma de las longitudes de las d longitudes más grandes es al menos el 50% de la suma de todas las longitudes. [ 2 ]

U50

U50 es la longitud del contig más pequeño tal que el 50% de la suma de todos los contigs únicos y específicos del objetivo está contenido en contigs de tamaño U50 o mayor. [ 1 ]

UL50

UL50 es el número de contigs cuya suma de longitudes produce U50.

UG50

UG50 es la longitud del contig más pequeño tal que el 50% del genoma de referencia está contenido en contigs únicos y específicos del objetivo de tamaño UG50 o mayor.

UG50%

UG50% es el porcentaje estimado de cobertura de la longitud UG50 en relación directa con la longitud del genoma de referencia. El cálculo es (100 × (UG50/Longitud del genoma de referencia). UG50% , como métrica porcentual, puede utilizarse para comparar los resultados de ensamblaje de diferentes muestras o estudios.

Ejemplos

Consideremos dos ensamblajes genómicos ficticios y altamente simplificados, A y B, derivados de dos especies diferentes. El ensamblaje A contiene seis contigs de longitudes de 80 kbp , 70 kbp, 50 kbp, 40 kbp, 30 kbp y 20 kbp. El tamaño total del ensamblaje A es de 290 kbp, la longitud del contig N50 es de 70 kbp porque 80 + 70 es mayor que el 50% de 290, y el recuento de contigs L50 es de 2 contigs. Las longitudes de los contigs del ensamblaje B son las mismas que las del ensamblaje A, excepto por la presencia de dos contigs adicionales de longitudes de 10 kbp y 5 kbp. El tamaño del ensamblaje B es de 305 kbp, la longitud del contig N50 se reduce a 50 kbp porque 80 + 70 + 50 es mayor que el 50 % de 305, y el recuento de contigs L50 es de 3 contigs. Este ejemplo ilustra que a veces se puede aumentar la longitud N50 simplemente eliminando algunos de los contigs o andamios más cortos de un ensamblaje.                  

Si el tamaño estimado o conocido del genoma de la especie ficticia A es de 500  kbp, entonces la longitud del contig NG50  es de 30 kbp porque 80  +  70  +  50  +  40  +  30 es mayor que el 50% de 500. Por el contrario, si el tamaño estimado o conocido del genoma de la especie B es de 350  kbp, entonces tiene una longitud de contig NG50 de 50  kbp porque 80  +  70  +  50 es mayor que el 50% de 350.

Cálculo alternativo

N50 se puede encontrar matemáticamente para una lista L de enteros positivos de la siguiente manera:

  1. Crea otra lista L' , que sea idéntica a L , excepto que cada elemento n en L ha sido reemplazado por n copias de sí mismo.
  2. La mediana de L' es el N50 de L. (El percentil 10 de L' es el estadístico N90 ).

Por ejemplo: Si L = (2, 2, 2, 3, 3, 4, 8, 8), entonces L' consta de seis 2, seis 3, cuatro 4 y dieciséis 8. Es decir, L' tiene el doble de 2 que L ; tiene el triple de 3 que L ; tiene cuatro veces más 4; etc. La mediana del conjunto de 32 elementos L' es el promedio del 16.º elemento más pequeño, 4, y el 17.º elemento más pequeño, 8, por lo que el N50 es 6. Podemos ver que la suma de todos los valores en la lista L que son menores o iguales al N50 de 6 es 16  =  2+2+2+3+3+4 y la suma de todos los valores en la lista L que son mayores o iguales a 6 también es 16  =  8+8. Para comparar con el N50 de 6, observe que la media de la lista L es 4, mientras que la mediana es 3. Para recapitular de una manera más visual, tenemos:

Values of the list      L =  (2,    2,    2,    3,       3,       4,          8,                      8)

Values of the new list  L' = (2  2  2  2  2  2  3  3  3  3  3  3  4  4  4 4 8  8  8  8  8  8  8  8  8  8  8  8  8  8  8  8)

Ranks of L' values =       1  2  3  4  5  6  7  8  9  10 11 12 13 14 15 1617 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32

Véase también

Referencias

  1. 1 2 Castro, Christina J.; Ng, Terry Fei Fan (noviembre de 2017). "U50: una nueva métrica para medir la producción de ensamblaje basada en contigs específicos del objetivo y no superpuestos" . Journal of Computational Biology . 24 (11): 1071– 1080. doi : 10.1089/cmb.2017.0013 . PMC 5783553. PMID 28418726 .  
  2. Han, J.; Sanders, CM; Wang, C.; Yang, Q.; Wimbish, J.; Boone, BE; Thomas, SJ; Levy, SE (25 de septiembre de 2012). Medición de la diversidad del repertorio de células T en sangre periférica mediante nuevos métodos de PCR multiplex y secuenciación de alto rendimiento . MipTec . Basilea, Suiza. Archivado del original el 5 de octubre de 2015. Recuperado el 5 de octubre de 2015 .
  • Wiki de Aracne en el Broad Institute
  • Miller, JR; Koren, S; Sutton, G (2010). "Algoritmos de ensamblaje para datos de secuenciación de próxima generación" . Genomics . 95 (6): 315– 327. doi : 10.1016/j.ygeno.2010.03.001 . PMC 2874646. PMID 20211242 .  
  • Conde, D; Bradnam, K; San Juan, J; Cariño, A; Lin, D; Fass, J; Yu, HOK; Búfalo, V; Zerbino, DR; Diekhans, M; Nguyen, N; Ariyaratne, PN; Sung, WK; Ning, Z; Haimel, M; Simpson, JT; Fonseca, NA; Birol, yo; Atraque, TR; Ho, IY; Rokhsar, DS; Chikhi, R; Lavenier, D; Chapuis, G; Naquín, D; Maillet, N; Schatz, MC; Kelley, DR; Phillippy, AM; Koren, S (2011). "Assemblathon 1: una evaluación competitiva de los métodos de ensamblaje de lectura corta de novo" . Investigación del genoma . 21 (12): 2224– 2241. doi : 10.1101/gr.126599.111 . PMC 3227110 . PMID 21926179 .  
  • Entrada de blog L50 vs. N50 (07-oct-2015)
  • contig_info : Una herramienta para estimar estadísticas descriptivas estándar a partir de secuencias de contigs, por ejemplo N(G)50 , N(G)75, N(G)90 , L(G)50 , L(G)75, L(G)90, auN ...