Articulo de referencia

formato FASTA

[[William Pearson (scientist)|William R. Pearson]] {{cite journal | vauthors = Lipman DJ, Pearson WR | title = Rapid and sensitive protein similarity searches | journal = Scienc...

En bioinformática y bioquímica , el formato FASTA es un formato basado en texto para representar secuencias de nucleótidos o secuencias de aminoácidos (proteínas), en el que los nucleótidos o aminoácidos se representan mediante códigos de una sola letra.

El formato permite que los nombres de las secuencias y los comentarios precedan a las secuencias. Se originó a partir del paquete de software FASTA y desde entonces se ha convertido en un estándar casi universal en bioinformática . [ 4 ]

La sencillez del formato FASTA facilita la manipulación y el análisis de secuencias mediante herramientas de procesamiento de texto y lenguajes de scripting .

Descripción general

Una secuencia comienza con el signo mayor que (">") seguido de una descripción de la secuencia (todo en una sola línea). Las líneas que siguen inmediatamente a la línea de descripción representan la secuencia, con una letra por cada aminoácido o ácido nucleico, y generalmente no superan los 80 caracteres.

Por ejemplo:

>MCHU - Calmodulina - Humana, de conejo, bovina, de rata y de pollo MADQLTEEQIAEFKEAFSLFDKDGDGTITTKELGTVMRSLGQNPTEAELQDMINEVDADGNGTID FPEFLTMMARKMKDTDSEEEIREAFRVFDKDGNGYISAAELRHVMTNLGEKLTDEEVDEMIREA DIDGDGQVNYEEFVQMMTAK* 

Formato original

El formato FASTA/ Pearson original se describe en la documentación del paquete de programas FASTA . Puede descargarse con cualquier distribución gratuita de FASTA (consulte fasta20.doc, fastaVN.doc o fastaVN.me, donde VN es el número de versión).

En el formato original, una secuencia se representaba como una serie de líneas, cada una de las cuales no superaba los 120 caracteres y, por lo general, no excedía los 80. Esto probablemente se debía a la necesidad de preasignar tamaños de línea fijos en el software: en aquel entonces, la mayoría de los usuarios utilizaban terminales VT220 (o compatibles) de Digital Equipment Corporation (DEC) , que podían mostrar 80 o 132 caracteres por línea. [ 5 ] [ 6 ] La mayoría prefería la fuente más grande en los modos de 80 caracteres, por lo que se convirtió en la norma utilizar 80 caracteres o menos (a menudo 70) en las líneas FASTA. Además, el ancho de una página impresa estándar es de 70 a 80 caracteres (dependiendo de la fuente). Por lo tanto, 80 caracteres se convirtieron en la norma. [ 7 ]

La primera línea de un archivo FASTA comenzaba con el símbolo ">" (mayor que) o, con menos frecuencia, con un ";" [ 8 ] (punto y coma), que se interpretaba como comentario. Las líneas subsiguientes que comenzaban con punto y coma eran ignoradas por el software. Dado que el único comentario utilizado era el primero, este pronto se empleó para contener una descripción resumida de la secuencia, a menudo comenzando con un número de acceso único de la biblioteca, y con el tiempo se ha vuelto común usar siempre ">" para la primera línea y no usar comentarios ";" (que de otro modo serían ignorados).

Tras la línea inicial (utilizada para una descripción única de la secuencia), aparecía la secuencia propiamente dicha en una cadena de caracteres estándar de una sola letra. Cualquier carácter que no fuera válido se ignoraba (incluidos espacios, tabulaciones, asteriscos, etc.). También era común finalizar la secuencia con un asterisco (*) (de forma análoga a su uso en secuencias con formato PIR) y, por la misma razón, dejar una línea en blanco entre la descripción y la secuencia. A continuación se muestran algunos ejemplos de secuencias:

LCBO - Precursor de prolactina - Bovino ; una secuencia de muestra en formato FASTA MDSKGSSQKGSRLLLLLVVSNLLLCQGVVSTPVCPNGPGNCQVSLRDLFDRAVMVSHYIHDLSS EMFNEFDKRYAQGKGFITMALNSCHTSSLPTPEDKEQAQQTHHEVLMSLILGLLRSWNDPLYHL VTEVRGMKGAPDAILSRAIEIEEENKRLLEGMEMIFGQVIPGAKETEPYPVWSGLPSLQTKDED ARYSAFYNLLHCLRRDSSKIDTYLKLLNCRIIYNNNC* >MCHU - Calmodulina - Humana, de conejo, bovina, de rata y de pollo MADQLTEEQIAEFKEAFSLFDKDGDGTITTKELGTVMRSLGQNPTEAELQDMINEVDADGNGTID FPEFLTMMARKMKDTDSEEEIREAFRVFDKDGNGYISAAELRHVMTNLGEKLTDEEVDEMIREA DIDGDGQVNYEEFVQMMTAK* >gi|5524211|es|AAD44166.1| citocromo b [Elephas maximus maximus] LCLYTHIGRNIYYGSYLYSETWNTGIMLLLITMATAFMGYVLPWGQMSFWGATVITNLFSAIPYIGTNLV EWIWGGFSVDKATLNRFFAFHFILPFTMVALAGVHLTFLHETGSNNPLGLTSDSDKIPFHPYYTIKDFLG LLILILLLLLLALLSPDMLGDPDNHMPADPLNTPLHIKPEWYFLFAYAILRSVPNKLGGVLALFLSIVIL GLMPFLHTSKHRSMMLRPLSQALFWTLTMDLLTLTWIGSQPVEYPYTIIGQMASILYFSIILAFLPIAGX ENEY 

Un formato FASTA de secuencias múltiples, o formato multi-FASTA, se obtendría concatenando varios archivos FASTA de secuencia única en un solo archivo. Esto no implica una contradicción con el formato, ya que solo la primera línea de un archivo FASTA puede comenzar con un punto y coma (;) o dos puntos (">), lo que obliga a que todas las secuencias subsiguientes comiencen con dos puntos (">) para que se consideren secuencias separadas (y, además, obliga a reservar exclusivamente dos puntos para la línea de definición de secuencia). Por lo tanto, los ejemplos anteriores, si se consideran en conjunto, conformarían un archivo multi-FASTA.

Los programas bioinformáticos modernos que utilizan el formato FASTA esperan que los encabezados de secuencia vayan precedidos de ">". La secuencia se representa generalmente de forma "intercalada", es decir, en varias líneas como en el ejemplo anterior, pero también puede representarse de forma "secuencial", es decir, en una sola línea. La ejecución de diferentes programas bioinformáticos puede requerir conversiones entre los formatos FASTA "secuencial" e "intercalado".

Línea de descripción

La línea de descripción (defline) o línea de encabezado/identificador, que comienza con ">", proporciona un nombre y/o un identificador único para la secuencia, y también puede contener información adicional. En una práctica obsoleta, la línea de encabezado a veces contenía más de un encabezado, separados por el carácter ^A (Control-A). En el formato FASTA original de Pearson , uno o más comentarios, distinguidos por un punto y coma al principio de la línea, pueden aparecer después del encabezado. Algunas bases de datos y aplicaciones bioinformáticas no reconocen estos comentarios y siguen la especificación FASTA del NCBI . A continuación se muestra un ejemplo de un archivo FASTA de secuencias múltiples:

>SECUENCIA_1 MTEITAAMVKELRESTGAGMMDCKNALSETNGDFDKAVQLLREKGLGKAAKKADRLAAEG LVSVKVSDDFTIAAMRPSYLSYEDLDMTFVENEYKALVAELEKENEERRRLKDPNKPEHK IPQFASRKQLSDAILKEAEEKIKEELKAQGKPEKIWDNIIPGKMNSFIADNSQLDSKLTL MGQFYVMDDKKTVEQVIAEKEKEFGGKIKIVEFICFEVGEGLEKKTEDFAAEVAAQL >SECUENCIA_2 SATVSEINSETDFVAKNDQFIALTKDTTAHIQSNSLQSVEELHSSTINGVKFEEYLKSQI ATIGENLVVRRFATLKAGANGVVNGYIHTNGRVGVVIAAACDSAEVASKSRDLLRQICMH 

identificadores de NCBI

El NCBI definió un estándar para el identificador único utilizado para la secuencia (SeqID) en la línea de encabezado. Esto permite etiquetar una secuencia obtenida de una base de datos con una referencia a su registro en dicha base de datos. El formato del identificador de base de datos es reconocido por las herramientas del NCBI, como makeblastdby table2asn. La siguiente lista describe el formato FASTA definido por el NCBI para los identificadores de secuencia. [ 9 ]

Las barras verticales ("|") en la lista anterior no son separadores en el sentido de la notación Backus-Naur , sino que forman parte del formato. Se pueden concatenar varios identificadores, separados también por barras verticales.

Representación de secuencias

Después de la línea de encabezado, se representa la secuencia real. Las secuencias pueden ser secuencias de proteínas o secuencias de ácidos nucleicos , y pueden contener huecos o caracteres de alineación (véase alineación de secuencias ). Se espera que las secuencias se representen en los códigos estándar de aminoácidos y ácidos nucleicos de la IUB / IUPAC , con las siguientes excepciones: se aceptan letras minúsculas y se asignan a mayúsculas; se puede usar un guion simple para representar un carácter de hueco; y en las secuencias de aminoácidos, U y * son letras aceptables (véase más abajo). No se permiten dígitos numéricos, pero se utilizan en algunas bases de datos para indicar la posición en la secuencia. Los códigos de ácidos nucleicos admitidos son: [ 10 ] [ 11 ] [ 12 ]

Los códigos de aminoácidos admitidos (22 aminoácidos y 3 códigos especiales) son:

Archivo FASTA

extensión de nombre de archivo

No existe una extensión de archivo estándar para los archivos de texto que contienen secuencias en formato FASTA. La siguiente tabla muestra cada extensión y su significado correspondiente.

Extensiones

El formato FASTQ es una variante del formato FASTA que se extiende para indicar información relacionada con la secuenciación. Fue creado por el Centro Sanger en Cambridge. [ 3 ]

A2M/A3M son una familia de formatos derivados de FASTA que se utilizan para alineamientos de secuencias . En las secuencias A2M/A3M, los caracteres en minúscula se interpretan como inserciones, que luego se indican en las demás secuencias con el carácter de punto (" . "). Los puntos se pueden descartar para mayor compacidad sin pérdida de información. Al igual que con los archivos FASTA típicos utilizados en alineamientos, el hueco (" - ") se interpreta como una posición exacta. [ 14 ] A3M es similar a A2M, con la regla adicional de que los huecos alineados con inserciones también se pueden descartar. [ 15 ]

Trabajar con archivos FASTA

Existe una gran cantidad de scripts fáciles de usar disponibles en la comunidad para manipular archivos FASTA. También se encuentran disponibles herramientas en línea, como FaBox [ 16 ] o FASTX-Toolkit en los servidores Galaxy [ 17 ] . Estas se pueden usar para separar encabezados/identificadores de secuencia, renombrarlos, acortarlos o extraer secuencias de interés de archivos FASTA grandes a partir de una lista de identificadores deseados (entre otras funciones disponibles). También existe un método basado en árboles para ordenar archivos multi-FASTA (TREE2FASTA [ 18 ] ) basado en el coloreado y/o la anotación de secuencias de interés en el visor FigTree. Además, el paquete Bioconductor Biostrings se puede usar para leer y manipular archivos FASTA en R [ 19 ] .

Existen varios convertidores de formato en línea para reformatear rápidamente archivos multi-FASTA a diferentes formatos (por ejemplo, NEXUS, PHYLIP) para su uso con diferentes programas filogenéticos, como el convertidor disponible en phylogeny.fr. [ 20 ]

Véase también

  • El formato FASTQ se utiliza para representar las lecturas del secuenciador de ADN junto con las puntuaciones de calidad.
  • Los formatos SAM y CRAM se utilizan para representar las lecturas del secuenciador del genoma que se han alineado con las secuencias del genoma.
  • El formato GVF (Genome Variation Format), una extensión basada en el formato GFF3 .

Referencias

  1. Lipman DJ, Pearson WR (marzo de 1985). "Búsquedas rápidas y sensibles de similitud de proteínas". Science . 227 (4693): 1435– 41. Bibcode : 1985Sci...227.1435L . doi : 10.1126/science.2983426 . PMID 2983426 . Icono de acceso cerrado
  2. Pearson WR, Lipman DJ (abril de 1988). "Herramientas mejoradas para la comparación de secuencias biológicas" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 85 ( 8): 2444– 8. Bibcode : 1988PNAS...85.2444P . doi : 10.1073/pnas.85.8.2444 . PMC 280013. PMID 3162770 .  
  3. 1 2 Cock PJ, Fields CJ, Goto N, Heuer ML, Rice PM (abril de 2010). "El formato de archivo FASTQ de Sanger para secuencias con puntuaciones de calidad y las variantes FASTQ de Solexa/Illumina" . Nucleic Acids Research . 38 (6): 1767– 71. doi : 10.1093/nar/ gkp1137 . PMC 2847217. PMID 20015970 .  
  4. "¿Qué es el formato FASTA?" . Laboratorio Zhang . Archivado del original el 04-12-2022 . Recuperado el 04-12-2022 .
  5. Landsteiner, mass:werk, Norbert (2019-02-20). "(¡Ahora Go Bang!) Tipografía CRT rasterizada (según DEC)" . ¡Ahora Go Bang! — mass:werk / Blog . Recuperado el 15 de marzo de 2024 .{{cite web}}: CS1 maint: varios nombres: lista de autores ( enlace )
  6. "Glifos incorporados VT220" . VT100 . Consultado el 15 de marzo de 2024 .
  7. "¿Por qué 80 caracteres es el límite 'estándar' para el ancho del código?" . Software Engineering Stack Exchange . Consultado el 15 de marzo de 2024 .
  8. «Formato de Base de Datos FASTA» . www.loc.gov . 2023-08-01 . Consultado el 15 de marzo de 2024 .
  9. Libro del kit de herramientas C++ del NCBI . Centro Nacional de Información Biotecnológica . Consultado el 19 de diciembre de 2018 .
  10. Tao Tao (24 de agosto de 2011). "Códigos de una sola letra para nucleótidos" . [Centro de aprendizaje del NCBI] . Centro Nacional de Información Biotecnológica . Archivado del original el 14 de septiembre de 2012. Consultado el 15 de marzo de 2012 .
  11. "Tabla de códigos IUPAC" . Banco de ADN del NIAS. Archivado del original el 11 de agosto de 2011.
  12. "cualquier símbolo" . MAFFT: un programa de alineación de secuencias múltiples .
  13. "Formatos de archivo de alineación" . 22 de mayo de 2019. Consultado el 22 de mayo de 2019 .
  14. "Descripción del formato de alineación A2M" . SAMtools . Archivado del original el 15 de agosto de 2022.
  15. "soedinglab/hh-suite: reformat.pl" . GitHub . 20 de noviembre de 2022.
  16. Villesen, P. (2007). "FaBox: una caja de herramientas en línea para secuencias fasta" . Molecular Ecology Notes . 7 (6): 965– 968. doi : 10.1111/j.1471-8286.2007.01821.x . ISSN 1471-8278 . 
  17. Blankenberg D, Von Kuster G, Bouvier E, Baker D, Afgan E, Stoler N, Galaxy Team, Taylor J, Nekrutenko A (2014). " Difusión de software científico con Galaxy ToolShed" . Genome Biology . 15 (2): 403. doi : 10.1186/gb4161 . PMC 4038738. PMID 25001293 .  
  18. Sauvage T, Plouviez S, Schmidt WE, Fredericq S (marzo de 2018). "TREE2FASTA: un script Perl flexible para la extracción por lotes de secuencias FASTA de árboles filogenéticos exploratorios" . BMC Research Notes . 11 (1): 403. doi : 10.1186/s13104-018-3268-y . PMC 5838971. PMID 29506565 .  
  19. Pagès, H; Aboyoun, P; Gentleman, R; DebRoy, S (2018). " Biostrings: Manipulación eficiente de cadenas biológicas " . Bioconductor.org . Paquete R versión 2.48.0. doi : 10.18129/B9.bioc.Biostrings .
  20. Dereeper A, Guignon V, Blanc G, Audic S, Buffet S, Chevenet F, Dufayard JF, Guindon S, Lefort V, Lescot M, Claverie JM, Gascuel O (julio de 2008). "Phylogeny.fr: análisis filogenético robusto para el no especialista" . Nucleic Acids Research . 36 (número especial de servidor web): W465–9. doi : 10.1093/nar/gkn180 . PMC 2447785. PMID 18424797 .  
  • Bioconductor
  • Kit de herramientas FASTX
  • Visor de FigTree
  • Filogenia.fr
  • GTO