El formato FASTQ es un formato de texto que almacena tanto una secuencia biológica (generalmente una secuencia de nucleótidos ) como su correspondiente puntuación de calidad. Tanto la letra de la secuencia como la puntuación de calidad se codifican con un único carácter ASCII para mayor brevedad.
Originalmente se desarrolló en el Wellcome Trust Sanger Institute para agrupar una secuencia en formato FASTA y sus datos de calidad, pero se ha convertido en el estándar de facto para almacenar la salida de instrumentos de secuenciación de alto rendimiento como el Illumina Genome Analyzer. [ 1 ]
Formato
Un archivo FASTQ tiene cuatro campos separados por líneas por secuencia:
- El campo 1 comienza con el carácter '@' y va seguido de un identificador de secuencia y una descripción opcional (como una línea de título FASTA ).
- El campo 2 es la secuencia de letras sin procesar.
- El campo 3 comienza con el carácter '+' y, opcionalmente, va seguido del mismo identificador de secuencia (y cualquier descripción).
- El campo 4 codifica los valores de calidad para la secuencia del campo 2 y debe contener el mismo número de símbolos que de letras en la secuencia.
Un archivo FASTQ que contiene una sola secuencia podría tener este aspecto:
@SEQ_ID GATTTGGGGTTCAAAGCAGTATCGATCAAATAGTAAATCCATTTGTTCAACTCACAGTTT + !''*((((***+))%%%++)(%%%%).1***-+*''))**55CCF>>>>>>CCCCCCC65
El byte que representa la calidad va desde 0x21 (calidad más baja; '!' en ASCII) hasta 0x7e (calidad más alta; '~' en ASCII). Aquí están los caracteres de valor de calidad en orden ascendente de izquierda a derecha ( ASCII ):
!"#$%&'()*+,-./0123456789:;<=>?@ABCDEFGHIJKLMNOPQRSTUVWXYZ[\]^_`abcdefghijklmnopqrstuvwxyz{|}~ Los archivos FASTQ originales de Sanger dividen las secuencias largas y las cadenas de calidad en varias líneas, como suele hacerse con los archivos FASTA . Esto complica el análisis debido a la elección de "@" y "+" como marcadores (ya que estos caracteres también pueden aparecer en la cadena de calidad). Los archivos FASTQ multilínea (y, por consiguiente, los analizadores FASTQ multilínea) son menos comunes ahora que la mayoría de las secuencias que se realizan son secuencias Illumina de lectura corta , con longitudes de secuencia típicas de alrededor de 100 pb.
identificadores de secuencia de Illumina
Las secuencias del software Illumina utilizan un identificador sistemático:
@HWUSI-EAS100R : 6 : 73 : 941 : 1973 #0/1Las versiones del pipeline de Illumina posteriores a la 1.4 parecen usar #NNNNNN en lugar de #0 para el ID de multiplexación, donde NNNNNN es la secuencia de la etiqueta de multiplexación.
Con Casava 1.8, el formato de la línea '@' ha cambiado:
@EAS139 : 136 : FC706VJ : 2 : 2104 : 15343 : 197393 1 : Y : 18 : ATCACG Tenga en cuenta que las versiones más recientes del software de Illumina generan un número de muestra (definido por el orden de las muestras en la hoja de muestras) en lugar de una secuencia de índice cuando no se especifica explícitamente una secuencia de índice para una muestra en la hoja de muestras. Por ejemplo, el siguiente encabezado podría aparecer en un archivo FASTQ perteneciente a la primera muestra de un lote de muestras:
@EAS139 : 136 : FC706VJ : 2 : 2104 : 15343 : 197393 1 : N : 18 : 1Archivo de lectura de secuencias del NCBI
Los archivos FASTQ del Archivo de Lectura de Secuencias del INSDC a menudo incluyen una descripción, por ejemplo:
@SRR001666.1 071112_SLXA-EAS1_s_7 : 5 : 1 : 817 : 345 longitud =36 GGGTGATGGCCGCTGCCGATGGCGTCAAATCCCACC +SRR001666.1 071112_SLXA-EAS1_s_7 : 5 : 1 : 817 : 345 longitud =36 IIIIIIIIIIIIIIIIIIIIIIIIIIIIII9IG9IC En este ejemplo, se incluye un identificador asignado por NCBI, y la descripción contiene el identificador original de Solexa/Illumina (como se describió anteriormente) más la longitud de lectura. La secuenciación se realizó en modo de extremos emparejados (tamaño de inserción de ~500 pb), véase SRR001666 . El formato de salida predeterminado de fastq-dump produce puntos completos, que contienen lecturas técnicas y, por lo general, lecturas biológicas de extremo único o emparejado.
$ fastq-dump.2.9.0 -Z -X 2 SRR001666 Se leyeron 2 lugares para SRR001666 Se escribieron 2 lugares para SRR001666 @SRR001666.1 071112_SLXA-EAS1_s_7:5:1:817:345 longitud=72 GGGTGATGGCCGCTGCCGATGGCGTCAAATCCCACCAAGTTACCCTTAACAACTTAAGGGTTTTCAAATAGA +SRR001666.1 071112_SLXA-EAS1_s_7:5:1:817:345 longitud=72 IIIIIIIIIIIIIIIIIIIIIIIIIIIIII9IG9ICIIIIIIIIIIIIIIIIIIIIIIIDIIIIIII>IIIIII/ @SRR001666.2 071112_SLXA-EAS1_s_7:5:1:801:338 longitud=72 GTTCAGGGATACGACGTTTGTATTTTAAGAATCTGAAGCAGAAGTCGATGATAATACGCGTCGTTTTATCAT +SRR001666.2 071112_SLXA-EAS1_s_7:5:1:801:338 longitud=72 IIIIIIIIIIIIIIIIIIIIIIIIIIIIIIII6IBIIIIIIIIIIIIIIIIIIIIIIIGII>IIIII-I)8IEl uso moderno de FASTQ casi siempre implica dividir la muestra en sus lecturas biológicas, como se describe en los metadatos proporcionados por el remitente:
$ fastq-dump -X 2 SRR001666 --split-3 Se leyeron 2 lugares para SRR001666 Se escribieron 2 lugares para SRR001666 $ head SRR001666_1.fastq SRR001666_2.fastq ==> SRR001666_1.fastq <== @SRR001666.1 071112_SLXA-EAS1_s_7:5:1:817:345 length=36 GGGTGATGGCCGCTGCCGATGGCGTCAAATCCCACC +SRR001666.1 071112_SLXA-EAS1_s_7:5:1:817:345 length=36 IIIIIIIIIIIIIIIIIIIIIIIIIIIIII9IG9IC @SRR001666.2 071112_SLXA-EAS1_s_7:5:1:801:338 longitud=36 GTTCAGGGATACGACGTTTGTATTTTAAGAATCTGA +SRR001666.2 071112_SLXA-EAS1_s_7:5:1:801:338 longitud=36 IIIIIIIIIIIIIIIIIIIIIIIIIIIIIIII6IBI==> SRR001666_2.fastq <== @SRR001666.1 071112_SLXA-EAS1_s_7:5:1:817:345 longitud=36 AAGTTACCCTTAACAACTTAAGGGTTTTCAAATAGA +SRR001666.1 071112_SLXA-EAS1_s_7:5:1:817:345 longitud=36 IIIIIIIIIIIIIIIIIIIIDIIIIIII>IIIIII/ @SRR001666.2 071112_SLXA-EAS1_s_7:5:1:801:338 longitud=36 AGCAGAAGTCGATGATAATACGCGTCGTTTTATCAT +SRR001666.2 071112_SLXA-EAS1_s_7:5:1:801:338 longitud=36 IIIIIIIIIIIIIIIIIIIIIIGII>IIIIII-I)8ICuando está presente en el archivo, fastq-dump puede intentar restaurar los nombres de lectura a su formato original. NCBI no almacena los nombres de lectura originales por defecto:
$ fastq-dump -X 2 SRR001666 --split-3 --origfmt Se leyeron 2 lugares para SRR001666 Se escribieron 2 lugares para SRR001666 $ head SRR001666_1.fastq SRR001666_2.fastq ==> SRR001666_1.fastq <== @071112_SLXA-EAS1_s_7:5:1:817:345 GGGTGATGGCCGCTGCCGATGGCGTCAAATCCCACC +071112_SLXA-EAS1_s_7:5:1:817:345 IIIIIIIIIIIIIIIIIIIIIIIIIIIIII9IG9IC @071112_SLXA-EAS1_s_7:5:1:801:338 GTTCAGGGATACGACGTTTGTATTTTAAGAATCTGA +071112_SLXA-EAS1_s_7:5:1:801:338 IIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIII6IBI==> SRR001666_2.fastq <== @071112_SLXA-EAS1_s_7:5:1:817:345 AAGTTACCCTTAACAACTTAAGGGTTTTCAAATAGA +071112_SLXA-EAS1_s_7:5:1:817:345 IIIIIIIIIIIIIIIIIIIIDIIIIIII>IIIIII/ @071112_SLXA-EAS1_s_7:5:1:801:338 AGCAGAAGTCGATGATAATACGCGTCGTTTTATCAT +071112_SLXA-EAS1_s_7:5:1:801:338 IIIIIIIIIIIIIIIIIIIIIIGII>IIII-I)8IEn el ejemplo anterior, se utilizaron los nombres de lectura originales en lugar del nombre de lectura registrado. El NCBI registra las secuencias y las lecturas que contienen. Los nombres de lectura originales, asignados por los secuenciadores, pueden funcionar como identificadores únicos locales de una lectura y transmiten la misma información que un número de serie. Los identificadores anteriores se asignaron algorítmicamente en función de la información de la secuencia y las coordenadas geométricas. Los primeros cargadores SRA analizaban estos identificadores y almacenaban internamente sus componentes descompuestos. El NCBI dejó de registrar los nombres de lectura porque se modifican con frecuencia respecto al formato original de los proveedores para asociar información adicional relevante para un proceso específico, lo que provocaba errores en el formato de los nombres y, como consecuencia, un elevado número de envíos rechazados. Sin un esquema claro para los nombres de lectura, su función sigue siendo la de un identificador único de lectura, que transmite la misma información que un número de serie de lectura. Consulte los distintos problemas del SRA Toolkit para obtener más detalles y participar en debates.
Tenga en cuenta también que fastq-dump convierte estos datos FASTQ de la codificación original Solexa/Illumina al estándar Sanger (consulte las codificaciones a continuación). Esto se debe a que SRA sirve como repositorio para información NGS, en lugar de formato . Las diversas herramientas *-dump son capaces de producir datos en varios formatos a partir de la misma fuente. Los requisitos para hacerlo han sido dictados por los usuarios a lo largo de varios años, y la mayor parte de la demanda inicial provino del Proyecto 1000 Genomas .
Variaciones
Calidad
Un valor de calidad Q es una función entera que asigna p (es decir, la probabilidad de que la llamada a la base correspondiente sea incorrecta). Se han utilizado dos ecuaciones diferentes. La primera es la variante estándar de Sanger para evaluar la fiabilidad de una llamada a la base, también conocida como puntuación de calidad Phred :
El pipeline Solexa (es decir, el software suministrado con el analizador de genoma Illumina) anteriormente utilizaba un mapeo diferente, codificando las probabilidades p /(1- p ) en lugar de la probabilidad p :
Aunque ambas correspondencias son asintóticamente idénticas para valores de calidad más altos, difieren en niveles de calidad más bajos (es decir, aproximadamente p > 0,05, o equivalentemente, Q < 13).

En ocasiones ha habido desacuerdo sobre qué mapeo utiliza realmente Illumina. La guía del usuario (Apéndice B, página 122) para la versión 1.4 del pipeline de Illumina establece que: "Las puntuaciones se definen como [ sic ] , donde p es la probabilidad de una llamada de base correspondiente a la base en cuestión". [ 2 ] En retrospectiva, esta entrada en el manual parece haber sido un error. La guía del usuario (Novedades, página 5) para la versión 1.5 del pipeline de Illumina enumera esta descripción en su lugar: "Cambios importantes en Pipeline v1.3 [ sic ] . El esquema de puntuación de calidad ha cambiado al esquema de puntuación Phred [es decir, Sanger], codificado como un carácter ASCII sumando 64 al valor Phred. Una puntuación Phred de una base es:, donde e es la probabilidad estimada de que una base sea incorrecta. [ 3 ]
Codificación
- El formato Sanger puede codificar una puntuación de calidad Phred de 0 a 93 usando ASCII 33 a 126 (aunque en datos de lectura sin procesar la puntuación de calidad Phred rara vez supera 60, son posibles puntuaciones más altas en ensamblajes o mapas de lectura). También se usa en formato SAM. [ 4 ] A finales de febrero de 2011, la versión más reciente (1.8) de la plataforma CASAVA de Illumina producirá directamente fastq en formato Sanger, según el anuncio en el foro seqanswers.com. [ 5 ]
- Las lecturas AVITI de Element Biosciences se codifican siguiendo la convención de Sanger: las puntuaciones de calidad Phred de 0 a 93 se codifican utilizando ASCII 33 a 126. Las lecturas sin procesar suelen presentar puntuaciones de calidad de base en el rango de [0, 55]. [ 6 ]
- Las lecturas PacBio HiFi, que normalmente se almacenan en formato SAM/BAM, utilizan la convención de Sanger: las puntuaciones de calidad Phred de 0 a 93 se codifican utilizando ASCII 33 a 126. Las sublecturas PacBio sin procesar utilizan la misma convención, pero normalmente asignan una calidad de base de marcador de posición (Q0) a todas las bases de la lectura. [ 7 ]
- Las lecturas dúplex de Oxford Nanopore, llamadas mediante el llamador de bases dorado, se almacenan normalmente en formato SAM/BAM. Tras cambiar a una representación de calidad interna de 16 bits, el límite de calidad de base informado es q50 (S). [ 8 ]
- El formato Solexa/Illumina 1.0 puede codificar una puntuación de calidad Solexa/Illumina de -5 a 62 utilizando ASCII 59 a 126 (aunque en los datos de lectura sin procesar solo se esperan puntuaciones Solexa de -5 a 40).
- A partir de Illumina 1.3 y antes de Illumina 1.8, el formato codificaba una puntuación de calidad Phred de 0 a 62 utilizando ASCII 64 a 126 (aunque en los datos de lectura sin procesar solo se esperan puntuaciones Phred de 0 a 40).
- A partir de Illumina 1.5 y antes de Illumina 1.8, las puntuaciones Phred de 0 a 2 tienen un significado ligeramente diferente. Los valores 0 y 1 ya no se utilizan y el valor 2, codificado por ASCII 66 "B", también se utiliza al final de las lecturas como un indicador de control de calidad del segmento de lectura . [ 9 ] El manual de Illumina [ 10 ] (página 30) establece lo siguiente: Si una lectura termina con un segmento de calidad mayoritariamente baja (Q15 o inferior), entonces todos los valores de calidad en el segmento se reemplazan con un valor de 2 (codificado como la letra B en la codificación basada en texto de las puntuaciones de calidad de Illumina)... Este indicador Q2 no predice una tasa de error específica, sino que indica que una porción final específica de la lectura no debe utilizarse en análisis posteriores. Además, la puntuación de calidad codificada como la letra "B" puede aparecer internamente dentro de las lecturas al menos hasta la versión 1.6 del pipeline, como se muestra en el siguiente ejemplo:
@HWI-EAS209_0006_FC706VJ:5:58:5894:21141#ATCACG/1 TTAATTGGTAAATAAATCTCCTAATAGCTTAGATNTTACCTTNNNNNNNNNNTAGTTTCTTGAGATTTGTTGGGGGAGACATTTTTGTGATTGCCTTGAT +HWI-EAS209_0006_FC706VJ:5:58:5894:21141#ATCACG/1 efcfffffcfeefffcffffffddf`feed]`]_Ba_^__[YBBBBBBBBBBBRTT\]][]dddd`ddd^dddadd^BBBBBBBBBBBBBBBBBBBBBBBB
Se ha propuesto una interpretación alternativa de esta codificación ASCII. [ 11 ] Además, en ejecuciones de Illumina que utilizan controles PhiX, se observó que el carácter 'B' representaba una "puntuación de calidad desconocida". La tasa de error de las lecturas 'B' era aproximadamente 3 puntuaciones Phred menor que la puntuación media observada en una ejecución determinada.
- A partir de Illumina 1.8, las puntuaciones de calidad han vuelto básicamente al uso del formato Sanger (Phred+33).
Para lecturas sin procesar, el rango de puntuaciones dependerá de la tecnología y del identificador de bases utilizado, pero generalmente será de hasta 41 para la química reciente de Illumina. Dado que la puntuación de calidad máxima observada anteriormente era de solo 40, varios scripts y herramientas fallan cuando encuentran datos con valores de calidad superiores a 40. Para lecturas procesadas, las puntuaciones pueden ser incluso más altas. Por ejemplo, se observan valores de calidad de 45 en lecturas del Servicio de Secuenciación de Lecturas Largas de Illumina (anteriormente Moleculo).
SSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSS .................................................. .......................... XXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXX ...................... ................................. IIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIII ............. ................................. J JJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJ .................... LLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLL .................................................... NNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNN.................................. EEEEEE EEEEEE EEEEEE EEEEEE EEEEEE EEEEEE EEEEEE EEEEEE EEEEEE EE PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPP !"#$%&'()*+,-./0123456789:;<=>?@ABCDEFGHIJKLMNOPQRSTUVWXYZ[\]^_`abcdefghijklmnopqrstuvwxyz{|}~ | | | | | | | 33 59 64 73 88 104 126 0........................26...31.......40 -5....0........9.............................40 0........9.............................40 3.....9..............................41 0.2......................26...31........41 0..................20........30........40........50 0..................20........30........40........50...55 0..................20........30........40........50..........................................93
S - Sanger Phred+33, lecturas sin procesar típicamente (0, 40) X - Solexa Solexa+64, lecturas sin procesar típicamente (-5, 40) I - Illumina 1.3+ Phred+64, lecturas sin procesar típicamente (0, 40) J - Illumina 1.5+ Phred+64, lecturas sin procesar típicamente (3, 41) donde 0=sin usar, 1=sin usar, 2=Leer indicador de control de calidad del segmento (en negrita) (Nota: Véase la discusión anterior). L - Illumina 1.8+ Phred+33, lecturas sin procesar típicamente (0, 41) N - Nanopore Phred+33, lecturas dúplex típicamente (0, 50) E - ElemBio AVITI Phred+33, lecturas sin procesar típicamente (0, 55) P - PacBio Phred+33, lecturas HiFi típicamente (0, 93)
Espacio de color
Para los datos SOLiD, el formato se modifica a una secuencia FASTQ de espacio de color (CSFASTQ), donde las bases de la secuencia se combinan con los números 0, 1, 2 y 3, que indican cómo se modifican las bases en relación con la base anterior en la secuencia (0: sin cambios; 1: transición; 2: transversión no complementaria; 3: transversión complementaria). [ 1 ] Este formato coincidía con la diferente química de secuenciación utilizada por los secuenciadores SOLiD. Las representaciones iniciales solo utilizaban bases de nucleótidos al comienzo de la secuencia, pero las versiones posteriores incluyeron bases insertadas a intervalos periódicos para mejorar la precisión de la identificación y el mapeo de bases.
Los valores de calidad de CSFASTQ son idénticos a los del formato Sanger. Las herramientas de alineación difieren en la versión que prefieren para estos valores: algunas incluyen una puntuación de calidad (establecida en 0, es decir, '!') para el nucleótido inicial, mientras que otras no. El archivo de lecturas de secuencia incluye esta puntuación de calidad.
Evoluciones de FAST5 y HDF5
El formato FAST4 se creó como una derivación del formato FASTQ, donde cada una de las 4 bases (A, C, G, T) tenía probabilidades separadas almacenadas. Formaba parte de Swift basecaller, un paquete de código abierto para el análisis de datos primarios en datos de secuenciación de nueva generación, "desde imágenes hasta llamadas de bases".
El formato FAST5 se inventó como una extensión del formato FAST4. Los archivos FAST5 son archivos del formato de datos jerárquicos 5 (HDF5) con un esquema específico definido por Oxford Nanopore Technologies (ONT). [ 12 ]
Simulación
La simulación de lectura FASTQ se ha abordado mediante varias herramientas. [ 13 ] [ 14 ] Una comparación de esas herramientas se puede ver aquí. [ 15 ]
Compresión
Compresores generales
Las herramientas de propósito general, como Gzip y bzip2, consideran los archivos FASTQ como archivos de texto plano, lo que resulta en índices de compresión subóptimos. El Archivo de Lecturas de Secuencias del NCBI codifica los metadatos mediante el esquema LZ-77. Los compresores FASTQ generales suelen comprimir los distintos campos (nombres de lectura, secuencias, comentarios y puntuaciones de calidad) de un archivo FASTQ por separado; entre ellos se incluyen DSRC y DSRC2, FQC, LFQC, Fqzcomp y Slimfastq.
Lecturas
Disponer de un genoma de referencia es conveniente porque, en lugar de almacenar las secuencias de nucleótidos, basta con alinear las lecturas con el genoma de referencia y almacenar las posiciones (punteros) y las discrepancias; los punteros se pueden ordenar según su posición en la secuencia de referencia y codificar, por ejemplo, con codificación de longitud de ejecución. Cuando la cobertura o el contenido de repeticiones del genoma secuenciado es alto, esto da lugar a una alta tasa de compresión. A diferencia de los formatos SAM /BAM, los archivos FASTQ no especifican un genoma de referencia. Los compresores FASTQ basados en alineación admiten el uso de referencias proporcionadas por el usuario o ensambladas de novo : LW-FQZip utiliza un genoma de referencia proporcionado y Quip, Leon, k-Path y KIC realizan el ensamblaje de novo utilizando un enfoque basado en el grafo de De Bruijn .
El mapeo explícito de lecturas y el ensamblaje de novo suelen ser lentos. Los compresores FASTQ basados en reordenamiento agrupan primero las lecturas que comparten subcadenas largas y luego comprimen independientemente las lecturas de cada grupo tras reordenarlas o ensamblarlas en contigs más largos , logrando quizás el mejor equilibrio entre el tiempo de ejecución y la tasa de compresión. SCALCE es la primera herramienta de este tipo, seguida de Orcom y Mince. BEETL utiliza una transformación generalizada de Burrows-Wheeler para reordenar las lecturas, y HARC logra un mejor rendimiento con el reordenamiento basado en hash. AssemblTrie, en cambio, ensambla las lecturas en árboles de referencia con el menor número total de símbolos posible en la referencia. [ 16 ] [ 17 ]
Existen puntos de referencia para estas herramientas. [ 18 ]
Valores de calidad
Los valores de calidad representan aproximadamente la mitad del espacio en disco requerido en el formato FASTQ (antes de la compresión), por lo que la compresión de estos valores puede reducir significativamente los requisitos de almacenamiento y acelerar el análisis y la transmisión de datos de secuenciación. En la literatura se están considerando tanto la compresión sin pérdida como la compresión con pérdida. Por ejemplo, el algoritmo QualComp [ 19 ] realiza una compresión con pérdida con una tasa (número de bits por valor de calidad) especificada por el usuario. Basándose en los resultados de la teoría de la tasa-distorsión, asigna el número de bits para minimizar el MSE (error cuadrático medio) entre los valores de calidad originales (sin comprimir) y los reconstruidos (después de la compresión). Otros algoritmos para la compresión de valores de calidad incluyen SCALCE [ 20 ] y Fastqz [ 21 ] . Ambos son algoritmos de compresión sin pérdida que ofrecen un enfoque opcional de transformación con pérdida controlada. Por ejemplo, SCALCE reduce el tamaño del alfabeto basándose en la observación de que los valores de calidad "vecinos" son similares en general. Para una evaluación comparativa, véase [ 22 ] .
A partir del HiSeq 2500, Illumina ofrece la opción de generar calidades que se han agrupado en intervalos de calidad. Las puntuaciones agrupadas se calculan directamente a partir de la tabla de puntuación de calidad empírica, que a su vez está vinculada al hardware, el software y la química utilizados durante el experimento de secuenciación. [ 23 ]
Extensión de archivo
No existe una extensión de archivo estándar para un archivo FASTQ, pero las extensiones .fq y .fastq son de uso común.
convertidores de formato
- Biopython versión 1.51 en adelante (convierte Sanger, Solexa e Illumina 1.3+)
- EMBOSS versión 6.1.0 parche 1 en adelante (convierte Sanger, Solexa e Illumina 1.3+)
- BioPerl versión 1.6.1 en adelante (convierte Sanger, Solexa e Illumina 1.3+)
- BioRuby versión 1.4.0 en adelante (convierte Sanger, Solexa e Illumina 1.3+)
- BioJava versión 1.7.1 en adelante (convierte Sanger, Solexa e Illumina 1.3+)
Véase también
Referencias
- 1 2 Cock, PJA; Fields, CJ; Goto, N.; Heuer, ML; Rice, PM (2009). "El formato de archivo FASTQ de Sanger para secuencias con puntuaciones de calidad y las variantes FASTQ de Solexa/Illumina" . Nucleic Acids Research . 38 (6): 1767– 1771. doi : 10.1093/nar/ gkp1137 . PMC 2847217. PMID 20015970 .
- ↑ Guía del usuario del software de análisis de secuencias: Para Pipeline versión 1.4 y CASAVA versión 1.0, con fecha de abril de 2009. PDF archivado el 10 de junio de 2010 en Wayback Machine .
- ↑ Guía del usuario del software de análisis de secuencias: Para Pipeline versión 1.5 y CASAVA versión 1.0, con fecha de agosto de 2009 (PDF)
- ↑ Formato de mapa de secuencia/alineación Versión 1.0, con fecha de agosto de 2009 PDF
- ↑ Tema de Seqanswer sobre skruglyak, sitio web de enero de 2011
- ↑ Especificación del formato Elembio AVITI FASTQ https://docs.elembio.io/docs/bases2fastq/outputs/#quality-scores
- ↑ Especificación del formato PacBio BAM 10.0.0 https://pacbiofileformats.readthedocs.io/en/10.0/BAM.html#qual
- ↑ Guía de llamadas de bases dúplex de Dorado [duplex-tools: uso con Dorado https://github.com/nanoporetech/duplex-tools#usage-with-dorado-recommended ]
- ↑ Puntuaciones de calidad de Illumina, Tobias Mann, Bioinformática, San Diego, Illumina http://seqanswers.com/forums/showthread.php?t=4721
- ↑ Uso del software de control de secuenciación Genome Analyzer, versión 2.6, número de catálogo SY-960-2601, número de pieza 15009921 Rev. A, noviembre de 2009
- ↑ Sitio web del proyecto SolexaQA
- ↑ "Introducción_a_los_archivos_Fast5" . labs.epi2me.io . Consultado el 19-05-2022 .
- ↑ Huang, W; Li, L; Myers, JR; Marth, GT (2012). "ART: Un simulador de lectura de secuenciación de próxima generación" . Bioinformatics . 28 ( 4): 593–4 . doi : 10.1093/bioinformatics/btr708 . PMC 3278762. PMID 22199392 .
- ↑ Pratas, D; Pinho, AJ; Rodrigues, JM (2014). "XS: un simulador de lectura FASTQ" . Notas de investigación de BMC . 7 : 40. doi : 10.1186/1756-0500-7-40 . PMC 3927261 . PMID 24433564 .
- ↑ Escalona, Merly; Rocha, Sara; Posada, David (2016). "Una comparación de herramientas para la simulación de datos de secuenciación genómica de próxima generación" . Nature Reviews Genetics . 17 (8): 459– 69. doi : 10.1038/nrg.2016.57 . PMC 5224698. PMID 27320129 .
- ↑ Ginart AA, Hui J, Zhu K, Numanagić I, Courtade TA, Sahinalp SC; et al. (2018). " Representación comprimida óptima de datos de secuencia de alto rendimiento mediante ensamblaje ligero" . Nat Commun . 9 (1): 566. Bibcode : 2018NatCo...9..566G . doi : 10.1038/s41467-017-02480-6 . PMC 5805770. PMID 29422526 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Zhu, Kaiyuan; Numanagić, Ibrahim; Sahinalp, S. Cenk (2018). «Compresión de datos genómicos». Enciclopedia de tecnologías de macrodatos . Cham: Springer International Publishing. pp. 779–783 . doi : 10.1007/978-3-319-63962-8_55-1 . ISBN 978-3-319-63962-8. S2CID 61153904 .
- ↑ Numanagić, Ibrahim; Bonfield, James K; Hach, Faraz; Voges, Jan; Ostermann, Jörn; Alberti, Claudio; Mattavelli, Marco; Sahinalp, S Cenk (2016-10-24). "Comparación de herramientas de compresión de datos de secuenciación de alto rendimiento". Nature Methods . 13 (12). Springer Science and Business Media LLC: 1005– 1008. doi : 10.1038/nmeth.4037 . ISSN 1548-7091 . PMID 27776113 . S2CID 205425373 .
- ↑ Ochoa, Idoia; Asnani, Himanshu; Bharadia, Dinesh; Chowdhury, Mainak; Weissman, Tsachy; Yona, Golan (2013). " Qual Comp : Un nuevo compresor con pérdida para puntuaciones de calidad basado en la teoría de distorsión de tasa" . BMC Bioinformatics . 14 : 187. doi : 10.1186/1471-2105-14-187 . PMC 3698011. PMID 23758828 .
- ↑ Hach, F; Numanagic, I; Alkan, C; Sahinalp, SC (2012). "SCALCE: Impulsando algoritmos de compresión de secuencias mediante codificación localmente consistente" . Bioinformatics . 28 ( 23): 3051–7 . doi : 10.1093/bioinformatics/bts593 . PMC 3509486. PMID 23047557 .
- ^ rápidoqz. http://mattmahoney.net/dc/fastqz/
- ↑ M. Hosseini, D. Pratas y A. Pinho. 2016. Un estudio sobre métodos de compresión de datos para secuencias biológicas. Information 7 (4):(2016): 56
- ↑ Nota técnica de Illumina. http://www.illumina.com/content/dam/illumina-marketing/documents/products/technotes/technote_understanding_quality_scores.pdf
Enlaces externos
- Página web de MAQ que analiza las variantes de FASTQ.
- Bioinformática
- Formato de secuencia biológica