El formato BED ( Browser Extensible Data ) es un formato de archivo de texto utilizado para almacenar regiones genómicas como coordenadas y anotaciones asociadas . Los datos se presentan en forma de columnas separadas por espacios o tabulaciones. Este formato fue desarrollado durante el Proyecto Genoma Humano [1] y luego adoptado por otros proyectos de secuenciación. Como resultado de este uso cada vez más amplio, este formato ya se había convertido en un estándar de facto en bioinformática antes de que se escribiera una especificación formal.
Una de las ventajas de este formato es la manipulación de coordenadas en lugar de secuencias de nucleótidos , lo que optimiza la potencia y el tiempo de cálculo a la hora de comparar todo o parte de genomas. Además, su simplicidad hace que sea fácil manipular y leer (o analizar ) coordenadas o anotaciones mediante lenguajes de procesamiento de textos y scripts como Python , Ruby o Perl o herramientas más especializadas como BEDTools.
Historia
A finales del siglo XX surgieron los primeros proyectos de secuenciación de genomas completos . Entre estos proyectos, el Proyecto Genoma Humano fue el más ambicioso en su momento, ya que pretendía secuenciar por primera vez un genoma de varias gigabases . Esto requirió que los centros de secuenciación llevaran a cabo un importante desarrollo metodológico con el fin de automatizar el procesamiento de las secuencias y sus análisis. Así, se crearon muchos formatos, como FASTQ , [2] GFF y BED. [1] Sin embargo, en ese momento no se publicaron especificaciones oficiales, lo que afectó a algunos formatos como FASTQ cuando los proyectos de secuenciación se multiplicaron a principios del siglo XXI.
Su amplio uso dentro de los navegadores genómicos ha permitido definir este formato de una manera relativamente estable ya que esta descripción es utilizada por muchas herramientas.
Formato
Inicialmente, el formato BED no contaba con ninguna especificación oficial, sino que se ha utilizado ampliamente como referencia la descripción proporcionada por el UCSC Genome Browser [3] .
En 2021 se publicó una especificación BED formal [4] [5] bajo los auspicios de la Alianza Global para Genómica y Salud .
Descripción
Un archivo BED consta de un mínimo de tres columnas a las que se pueden añadir nueve columnas opcionales para un total de doce columnas. Las tres primeras columnas contienen los nombres de los cromosomas o andamiajes , las coordenadas de inicio y fin de las secuencias consideradas. Las siguientes nueve columnas contienen anotaciones relacionadas con estas secuencias. Estas columnas deben estar separadas por espacios o tabuladores , siendo estos últimos los recomendados por razones de compatibilidad entre programas. [6] Cada fila de un archivo debe tener el mismo número de columnas. Se debe respetar el orden de las columnas: si se utilizan columnas de números altos, se deben completar las columnas de números intermedios.
Encabezamiento
Un archivo BED puede contener opcionalmente un encabezado . Sin embargo, no existe una descripción oficial del formato del encabezado. Puede contener una o más líneas y estar representado por diferentes palabras o símbolos, [6] dependiendo de su función o simplemente de su carácter descriptivo. Por lo tanto, una línea de encabezado puede comenzar con estas palabras o símbolos:
- "browser": encabezado funcional utilizado por el UCSC Genome Browser para configurar opciones relacionadas con él,
- "track": encabezado funcional utilizado por los navegadores de genoma para especificar las opciones de visualización relacionadas con él,
- "#": encabezado descriptivo para agregar comentarios como el nombre de cada columna.
Sistema de coordenadas
A diferencia del sistema de coordenadas utilizado por otros estándares como GFF , el sistema utilizado por el formato BED está basado en cero para la coordenada inicial y en uno para la coordenada final. [6] Por lo tanto, el nucleótido con la coordenada 1 en un genoma tendrá un valor de 0 en la columna 2 y un valor de 1 en la columna 3.
Un intervalo BED de mil bases con el siguiente inicio y final:
chr7 0 1000
se convertiría a las siguientes coordenadas del genoma "humano" basadas en 1, tal como las utiliza un explorador de genoma como UCSC:
chr7 1 1000
Esta elección se justifica por el método de cálculo de las longitudes de las regiones genómicas consideradas, que se basa en la simple resta de las coordenadas finales (columna 3) por las iniciales (columna 2): . Cuando el sistema de coordenadas se basa en el uso de 1 para designar la primera posición, el cálculo se vuelve ligeramente más complejo: . Esta ligera diferencia puede tener un impacto relativamente importante en términos de tiempo de cálculo cuando se utilizan conjuntos de datos con varios miles a cientos de miles de líneas.
Como alternativa, podemos considerar ambas coordenadas como de base cero, donde la posición final no es inclusiva. En otras palabras, la posición final de base cero denota el índice de la primera posición después de la característica. Para el ejemplo anterior, la posición final de base cero de 1000 marca la primera posición después de la característica, incluidas las posiciones 0 a 999.
Ejemplos
He aquí un ejemplo mínimo:
chr7 127471196 127472363 chr7 127472363 127473530 chr7 127473530 127474697
A continuación se muestra un ejemplo típico con nueve columnas del UCSC Genome Browser . Las primeras tres líneas son configuraciones para el UCSC Genome Browser y no están relacionadas con los datos especificados en formato BED:
Posición del navegador chr7:127471196-127495720 Navegador ocultar todo nombre de la pista="ItemRGBDemo" descripción="Demostración del elemento RGB" visibilidad=2 itemRgb="Activado" chr7 127471196 127472363 Pos1 0 + 127471196 127472363 255,0,0 chr7 127472363 127473530 Pos2 0 + 127472363 127473530 255,0,0 chr7 127473530 127474697 Pos3 0 + 127473530 127474697 255,0,0 chr7 127474697 127475864 Pos4 0 + 127474697 127475864 255,0,0 chr7 127475864 127477031 Negativo 1 0 - 127475864 127477031 0,0,255 chr7 127477031 127478198 Neg2 0 - 127477031 127478198 0,0,255 chr7 127478198 127479365 Negativo 3 0 - 127478198 127479365 0,0,255 chr7 127479365 127480532 Pos5 0 + 127479365 127480532 255,0,0 chr7 127480532 127481699 Negativo 4 0 - 127480532 127481699 0,0,255
Extensión de archivo
Actualmente no existe una extensión de archivo estándar para los archivos BED, pero la extensión ".bed" es la que se utiliza con más frecuencia. El número de columnas a veces se indica en la extensión del archivo, por ejemplo: ".bed3", ".bed4", ".bed6", ".bed12". [7]
Uso
El uso de archivos BED se ha extendido rápidamente con la aparición de nuevas técnicas de secuenciación y la manipulación de archivos de secuencias cada vez más grandes . La comparación de secuencias genómicas o incluso de genomas completos mediante la comparación de las secuencias en sí puede requerir rápidamente recursos computacionales significativos y convertirse en una tarea que consume mucho tiempo. El manejo de archivos BED hace que este trabajo sea más eficiente al utilizar coordenadas para extraer secuencias de interés de conjuntos de secuenciación o para comparar y manipular directamente dos conjuntos de coordenadas.
Para realizar estas tareas, se pueden utilizar varios programas para manipular archivos BED, incluidos, entre otros, los siguientes:
- Navegadores de genomas : a partir de archivos BED se permite la visualización y extracción de secuencias de genomas de mamíferos actualmente secuenciados (por ejemplo, la función Administrar pistas personalizadas en el Navegador de genomas de UCSC ). [3]
- Galaxy : plataforma basada en web . [7]
- Herramientas de línea de comandos:
- BEDTools: programa que permite la manipulación de conjuntos de coordenadas y la extracción de secuencias de un archivo BED. [6]
- BEDOPS: un conjunto de herramientas para operaciones booleanas rápidas en archivos BED. [8]
- BedTk: una alternativa más rápida a BEDTools para un subconjunto limitado y especializado de operaciones. [9]
- covtobed: una herramienta para convertir un archivo BAM en una pista de cobertura BED. [10]
Archivos .genome
BEDtools también utiliza .genomearchivos para determinar los límites cromosómicos y garantizar que las operaciones de relleno no se extiendan más allá de los límites cromosómicos. Los archivos del genoma tienen el formato que se muestra a continuación: un archivo de dos columnas separadas por tabulaciones con un encabezado de una línea.
tamaño de cromo Cr1 248956422 Cr2 242193529 chr3 198295559 Cr4 190214555 chr5 181538259 chr6 170805979 chr7 159345973 ...
Referencias
- ^ ab Kent, W. James; Sugnet, Charles W.; Furey, Terrence S.; Roskin, Krishna M.; Pringle, Tom H.; Zahler, Alan M.; Haussler, David (1 de junio de 2002). "El navegador del genoma humano en la UCSC". Genome Research . 12 (6): 996– 1006. doi : 10.1101/gr.229102 . ISSN 1088-9051. PMC 186604 . PMID 12045153.
- ^ Cock, Peter JA; Fields, Christopher J.; Goto, Naohisa; Heuer, Michael L.; Rice, Peter M. (abril de 2010). "El formato de archivo Sanger FASTQ para secuencias con puntuaciones de calidad y las variantes Solexa/Illumina FASTQ". Nucleic Acids Research . 38 (6): 1767– 1771. doi : 10.1093/nar/gkp1137 . ISSN 1362-4962. PMC 2847217 . PMID 20015970.
- ^ ab "Preguntas frecuentes: formatos de archivos de datos. Formato BED". UCSC Genome Browser . Instituto de Genómica de la Universidad de California en Santa Cruz . Consultado el 2 de octubre de 2019 .
- ^ "El formato de datos extensibles del navegador (BED)" (PDF) . samtools.github.io .
- ^ "GA4GH BED v1.0: Un estándar formal establece reglas básicas para las características genómicas". www.ga4gh.org . 2022-03-30.
- ^ abcd Quinlan, AR; Hall, IM (21 de septiembre de 2010). Manual de BEDTools (PDF) . Consultado el 3 de octubre de 2019 .
- ^ ab "Tipos de datos". Galaxy Community Hub . Consultado el 3 de octubre de 2019 .
- ^ Neph, S; Kuehn, MS; Reynolds, AP; Haugen, E; Thurman, RE; Johnson, AK; Rynes, E; Maurano, MT; Vierstra, J; Thomas, S; Sandstrom, R; Humbert, R; Stamatoyannopoulos, JA (15 de julio de 2012). "BEDOPS: operaciones de características genómicas de alto rendimiento". Bioinformática . 28 (14): 1919–20 . doi : 10.1093/bioinformatics/bts277 . PMC 3389768 . PMID 22576172.
- ^ Li, Heng; Rong, Jiazhen (9 de junio de 2021). "Bedtk: búsqueda de superposición de intervalos con árbol de intervalos implícito". Bioinformática . 37 (9): 1315– 1316. doi :10.1093/bioinformatics/btaa827. PMC 8189672 .
- ^ Birolo, Giovanni; Telatin, Andrea (6 de marzo de 2020). "covtobed: una herramienta sencilla y rápida para extraer pistas de cobertura de archivos BAM". Journal of Open Source Software . 5 (47): 2119. Bibcode :2020JOSS....5.2119B. doi : 10.21105/joss.02119 .