La empresa Parabricks fue fundada en la Universidad de Michigan por Mehrzad Samadi , Ankit Sethia y Scott Mahlke . Fue adquirida por Nvidia en 2020.
Nvidia Parabricks es un conjunto de software gratuito para análisis de genoma desarrollado por Nvidia, diseñado para ofrecer un alto rendimiento mediante la aceleración de la unidad de procesamiento gráfico (GPU). [ 1 ]
Parabricks ofrece flujos de trabajo para análisis de ADN y ARN , así como para la detección de mutaciones germinales y somáticas , utilizando herramientas de código abierto . [ 1 ] Está diseñado para mejorar el tiempo de cálculo del análisis de datos genómicos, manteniendo la flexibilidad necesaria para diversos experimentos bioinformáticos . [ 1 ] Junto con la velocidad del procesamiento basado en GPU, Parabricks garantiza una alta precisión , el cumplimiento de los formatos genómicos estándar y la capacidad de escalar para manejar conjuntos de datos muy grandes. [ 1 ]
Los usuarios pueden descargar y ejecutar pipelines de Parabricks localmente o implementarlos directamente en proveedores de nube, como Amazon Web Services , Google Cloud , Oracle Cloud Infrastructure y Microsoft Azure . [ 1 ]
Fundamentos del análisis acelerado del genoma


La reducción masiva de los costos de secuenciación [ 2 ] resultó en un aumento significativo del tamaño y la disponibilidad de datos genómicos [ 3 ] con el potencial de revolucionar muchos campos, desde la medicina hasta el diseño de fármacos . [ 4 ]
Partiendo de una muestra biológica (por ejemplo, saliva o sangre ), es posible extraer el ADN del individuo y secuenciarlo con maquinaria de secuenciación para traducir la información biológica en una secuencia textual de bases . [ 5 ] Luego, una vez que se obtiene el genoma completo mediante el proceso de ensamblaje del genoma , el ADN puede analizarse para extraer información clave en varios ámbitos, incluyendo la medicina personalizada y el diagnóstico médico . [ 6 ]
Por lo general, el análisis de datos genómicos se realiza con herramientas basadas en unidades centrales de procesamiento (CPU) para su procesamiento. [ 7 ] Recientemente, varios investigadores en este campo han subrayado los desafíos en términos de potencia de cálculo que ofrecen estas herramientas y han centrado sus esfuerzos en encontrar formas de aumentar el rendimiento de las aplicaciones. [ 7 ] El problema se ha abordado de dos maneras: desarrollando algoritmos más eficientes o acelerando la parte computacionalmente intensiva mediante aceleradores de hardware . Ejemplos de aceleradores utilizados en el dominio son las GPU, las FPGA y los ASIC. [ 8 ]
En este contexto, las GPU han revolucionado la genómica al explotar su potencia de procesamiento paralelo para acelerar tareas computacionalmente intensivas. [ 9 ] [ 10 ] Las GPU ofrecen resultados prometedores en estos escenarios gracias a su arquitectura, compuesta por miles de pequeños núcleos capaces de realizar cálculos en paralelo. [ 11 ] Este paralelismo permite a las GPU procesar múltiples tareas simultáneamente, acelerando significativamente los cálculos que pueden dividirse en unidades independientes. [ 11 ] Por ejemplo, alinear millones de lecturas de secuenciación contra un genoma de referencia o realizar análisis estadísticos en grandes conjuntos de datos genómicos puede completarse mucho más rápido en GPU que cuando se utilizan CPU. [ 10 ] Esto facilita el análisis rápido de datos genómicos de diversas fuentes, que van desde genomas individuales hasta estudios de poblaciones a gran escala , [ 12 ] acelerando la comprensión de enfermedades genéticas , diversidad genética y sistemas biológicos más complejos . [ 10 ]
Tuberías destacadas
Parabricks ofrece a los usuarios finales diversas colecciones de herramientas organizadas secuencialmente para analizar los datos brutos según sus requisitos, denominadas pipelines . [ 1 ] No obstante, los usuarios pueden optar por ejecutar las herramientas de Parabricks de forma independiente, aprovechando la aceleración por GPU para superar posibles cuellos de botella computacionales. Solo algunas de las herramientas incluidas en el paquete se basan en GPU. [ 13 ]

En general, todos los pipelines comparten una estructura estándar. La mayoría están diseñados para analizar datos FASTQ provenientes de diversas tecnologías de secuenciación (por ejemplo, lectura corta o larga ). Las secuencias genómicas de entrada se alinean primero y luego se someten a un proceso de control de calidad. Estos dos procesos generan un archivo BAM o CRAM como resultado intermedio. A partir de estos datos, la tarea de detección de variantes que sigue emplea herramientas de alta precisión ampliamente utilizadas. Como resultado, estos pipelines proporcionan las mutaciones identificadas en un archivo VCF (o gVCF). [ 13 ]
Pipeline de línea germinal
El pipeline de línea germinal ofrecido por Parabricks sigue las mejores prácticas [ 14 ] propuestas por el Broad Institute en su Genome Analysis ToolKit (GATK). [ 15 ] El pipeline de línea germinal opera sobre los archivos FASTQ proporcionados como entrada por el usuario para llamar a las variantes que, al pertenecer a la línea germinal , pueden heredarse. [ 13 ]
Este pipeline analiza los datos calculando la alineación de lecturas con BWA-MEM [ 16 ] [ 17 ] y llamando variantes usando GATK HaplotypeCaller, [ 18 ] una de las herramientas más relevantes en el dominio para la llamada de variantes de la línea germinal. [ 13 ]
Pipeline de línea germinal DeepVariant
Además del pipeline que recurre a HaplotypeCaller para llamar variantes, Parabricks también ofrece un pipeline alternativo que también llama variantes de la línea germinal pero está basado en DeepVariant. [ 19 ] [ 20 ] DeepVariant es un llamador de variantes, desarrollado y mantenido por Google , capaz de identificar mutaciones utilizando un enfoque basado en aprendizaje profundo . El núcleo de DeepVariant [ 19 ] es una red neuronal convolucional (CNN) que identifica variantes transformando esta tarea en una operación de clasificación de imágenes . En Parabricks, el proceso de inferencia se acelera en hardware. Para este pipeline, solo se admiten las GPU T4, V100 y A100 . [ 13 ]
Los análisis realizados según este proceso son compatibles con el uso de BWA-MEM [ 16 ] para la alineación por parte de la CNN de Google para la detección de variantes. [ 13 ]
Canalización Human_par
Aún en conformidad con las mejores prácticas de GATK, [ 14 ] la canalización human_par permite a los usuarios identificar mutaciones en todo el genoma humano, incluidos los cromosomas sexuales X e Y , y, por lo tanto, es compatible con su ploidía . Para muestras masculinas, primero, la canalización ejecuta HaplotypeCaller [ 18 ] en todas las regiones que no pertenecen a los cromosomas X e Y y en la región pseudoautosómica con ploidía igual a 1. Luego, HaplotypeCaller analiza las regiones X e Y sin la región pseudoautosómica con ploidía 2. En cuanto a las muestras femeninas, en cambio, la canalización ejecuta HaplotypeCaller en todo el genoma, con ploidía 2. [ 13 ]
El sexo de la muestra se puede determinar de dos maneras principales:
- Configurado manualmente con la
--sample-sexopción; - Especifique la relación X vs. Y con opciones de rango
--range-maley--range-femaledeje que la herramienta infiera automáticamente el sexo de las muestras basándose en el recuento de lecturas X e Y.
La canalización requiere que el usuario especifique al menos una de estas tres opciones. [ 13 ]
En cuanto al caso de la línea germinal, dado que este pipeline se dirige a las variantes de la línea germinal, el pipeline recurre a BWA-MEM [ 16 ] para el alineamiento, seguido de HaplotypeCaller [ 18 ] para la llamada de variantes. [ 13 ]
Tubería somática
El pipeline somático de Parabricks está diseñado para detectar variantes somáticas , es decir, aquellas mutaciones que afectan a células no reproductivas (somáticas). Este pipeline puede analizar genomas tanto tumorales como no tumorales, ofreciendo análisis solo de tumores o análisis tumorales/normales para exámenes exhaustivos. [ 13 ]
Al igual que en el proceso de análisis de la línea germinal, la tarea de alineación se lleva a cabo utilizando BWA-MEM [ 16 ] seguido de GATK Mutect [ 21 ] para identificar las posibles mutaciones. Se utiliza Mutect en lugar de HaplotypeCaller debido a que se centra en mutaciones somáticas, a diferencia de las mutaciones de la línea germinal que detecta HaplotypeCaller. [ 21 ]
canalización de ARN
Este pipeline está optimizado para el descubrimiento de variantes cortas (es decir, polimorfismos de un solo nucleótido (SNP) e inserciones/deleciones ) en datos de RNAseq . Sigue las mejores prácticas del Broad Institute para este tipo de análisis. [ 13 ]
Se basa en el alineador STAR, [ 22 ] un alineador de lecturas especializado para secuencias de ARN para alinear las lecturas, y HaplotypeCaller [ 18 ] para llamar variantes. [ 13 ]
Herramientas Parabricks
Parabricks proporciona un conjunto de herramientas para realizar análisis genómicos, clasificadas en seis categorías principales relacionadas con su tarea. [ 13 ] Estas herramientas combinadas constituyen las canalizaciones de Parabricks y también pueden utilizarse tal cual.
Para el procesamiento de archivos FASTQ y BAM, las herramientas propuestas son: [ 13 ]
- applybsqr
- bam2fq
- bamsort
- bqsr
- fq2bam
- fq2bamfast
- fq2bam_meth
- margen de beneficio
- minimapa2 (beta)
Para llamar a variantes, las herramientas propuestas son: [ 13 ]
- somático profundo
- variante profunda
- línea germinal variante profunda
- línea germinal (GATK Germline Pipeline)
- llamador de haplotipos
- silenciar llamadas
- pacbio_germline (beta)
- posponer
- prepon
- somático (llamador de variantes somáticas)
Para el procesamiento de ARN, las herramientas propuestas son: [ 13 ]
- rna_fq2bam
- fusión estelar
Para el control de calidad de los resultados, las herramientas propuestas son: [ 13 ]
- bammetrics
- recopilarmúltiplesmétricas
Para procesar variantes, las herramientas propuestas son: [ 13 ]
- dbsnp
Para procesar archivos gVCF, las herramientas propuestas son: [ 13 ]
- genotipo gvcf
- índicegvcf
No todas las herramientas enumeradas están aceleradas en GPU. [ 13 ]
Soporte de hardware
Los usuarios pueden descargar y ejecutar pipelines de Parabricks en sus servidores locales, lo que permite el procesamiento y análisis de datos privados in situ. También pueden implementar pipelines de Parabricks en plataformas en la nube, con una escalabilidad mejorada para conjuntos de datos más grandes. Los proveedores de nube compatibles incluyen AWS , GCP , OCI y Azure . [ 1 ]
En la última versión (v4.3.1-1), Parabricks incluye soporte para el superchip Nvidia Grace Hopper . [ 23 ] El superchip Nvidia GH200 Grace Hopper es una plataforma heterogénea diseñada para computación de alto rendimiento e inteligencia artificial , que combina un Nvidia Grace y un Hopper en un solo chip . [ 24 ] Esta plataforma mejora el rendimiento de las aplicaciones utilizando tanto GPU como CPU, ofreciendo un modelo de programación orientado a mejorar el rendimiento, la portabilidad y la productividad . [ 23 ]
Aplicaciones
Debido a la potencia computacional requerida por las cargas de trabajo genómicas, Parabricks ha encontrado aplicación en varios estudios de investigación con diferentes dominios de aplicación, especialmente en la investigación del cáncer . [ 25 ] [ 26 ] [ 27 ]
Científicos de la Universidad de Washington utilizaron el pipeline Parabricks DeepVariant para identificar variantes (por ejemplo, SNP y pequeñas inserciones/deleciones) en datos de secuenciación de genoma completo (WGS) de alta fidelidad y lectura larga generados con la tecnología Revio SMRT Cell de PacBio . [ 28 ]
Además de las canalizaciones, los componentes individuales de Parabricks se han utilizado como herramientas independientes en entornos académicos. Por ejemplo, el DeepVariant acelerado se ha empleado en un proceso novedoso para reducir aún más el tiempo de procesamiento de los datos WGS Nanopore . [ 29 ]
En 2022, Nvidia anunció una colaboración con el Broad Institute para brindar a los investigadores los beneficios de la computación acelerada. Esta asociación incluye el conjunto completo de software acelerado por hardware biomédico de Nvidia llamado Clara, que incluye Parabricks y MONAI . [ 30 ] De manera similar, el Centro de Genética de Regeneron utiliza Parabricks para agilizar el análisis secundario de los exomas que secuencian en su centro de secuenciación de alto rendimiento , aprovechando la plataforma DeepVariant Germline dentro de sus flujos de trabajo. [ 31 ]
Véase también
Referencias
- 1 2 3 4 5 6 7 "Clara para genómica" . NVIDIA . Consultado el 8 de julio de 2024 .
- ↑ "Costos de secuenciación de ADN: Datos" . www.genome.gov . Consultado el 10 de julio de 2024 .
- ↑ Langmead B, Nellore A (abril de 2018). " Computación en la nube para el análisis y la colaboración de datos genómicos" . Nature Reviews. Genetics . 19 (4): 208– 219. doi : 10.1038/nrg.2017.113 . PMC 6452449. PMID 29379135 .
- ↑ Ombrello MJ, Sikora KA, Kastner DL (abril de 2014). "Genética, genómica y su relevancia para la patología y la terapia" . Best Practice & Research. Clinical Rheumatology . Advances in Paediatric Rheumatology and Translation of Research to Targeted Therapies. 28 (2): 175– 189. doi : 10.1016/j.berh.2014.05.001 . PMC 4149217. PMID 24974057 .
- ↑ Alser M, Lindegger J, Firtina C, Almadhoun N, Mao H, Singh G, et al. (2022). " De las moléculas a las variaciones genómicas: Acelerando el análisis del genoma mediante algoritmos y arquitecturas inteligentes" . Computational and Structural Biotechnology Journal . 20 : 4579–4599 . doi : 10.1016/j.csbj.2022.08.019 . PMC 9436709. PMID 36090814 .
- ↑ Jain KK (2009). «Fundamentos de la medicina personalizada». En Jain KK (ed.). Libro de texto de medicina personalizada . Nueva York, NY: Springer. pp. 1–27 . doi : 10.1007/978-1-4419-0769-1_1 . ISBN 978-1-4419-0769-1.
- 1 2 Alser M, Bingol Z, Cali DS, Kim J, Ghose S, Alkan C, et al. (septiembre de 2020). "Acelerando el análisis del genoma: una introducción a un viaje en curso". IEEE Micro . 40 (5): 65– 75. arXiv : 2008.00961 . Bibcode : 2020IMicr..40e..65A . doi : 10.1109/MM.2020.3013728 . ISSN 0272-1732 .
- ↑ Alser M, Rotman J, Deshpande D, Taraszka K, Shi H, Baykal PI, et al. (agosto de 2021). " La tecnología dicta los algoritmos: desarrollos recientes en alineación de lecturas" . Genome Biology . 22 (1) 249. doi : 10.1186/s13059-021-02443-7 . PMC 8390189. PMID 34446078 .
- ↑ Taylor-Weiner A, Aguet F, Haradhvala NJ, Gosai S, Anand S, Kim J, et al. (noviembre de 2019). " Escalando la genómica computacional a millones de individuos con GPU" . Genome Biology . 20 (1) 228. doi : 10.1186/s13059-019-1836-7 . PMC 6823959. PMID 31675989 .
- 1 2 3 Nobile MS, Cazzaniga P, Tangherloni A, Besozzi D (septiembre de 2017). "Unidades de procesamiento gráfico en bioinformática, biología computacional y biología de sistemas" . Briefings in Bioinformatics . 18 (5): 870– 885. doi : 10.1093/bib/bbw058 . PMC 5862309. PMID 27402792 .
- 1 2 Cheng J, Grossman M, McKercher T (2014-09-09). Programación profesional en CUDA C. John Wiley & Sons. ISBN 978-1-118-73932-7.
- ↑ Zhou C, Lang X, Wang Y, Zhu C (2015-08-06). "gPGA: GPU Accelerated Population Genetics Analyses" . PLOS ONE . 10 (8) e0135028. Bibcode : 2015PLoSO..1035028Z . doi : 10.1371/journal.pone.0135028 . PMC 4527771. PMID 26248314 .
- 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 "Bienvenido a NVIDIA Parabricks v4.3.1" . Documentación de NVIDIA . Consultado el 10 de julio de 2024 .
- 1 2 "Mejores prácticas para la llamada de variantes con GATK" . @broadinstitute . 19 de marzo de 2015. Consultado el 9 de julio de 2024 .
- ↑ "Genome Analysis Toolkit (GATK)" . @broadinstitute . 8 de junio de 2010. Consultado el 9 de julio de 2024 .
- 1 2 3 4 Li H (2013-05-26), Alineación de lecturas de secuencia, secuencias de clones y contigs de ensamblaje con BWA-MEM , arXiv : 1303.3997
- ↑ "Alineador Burrows-Wheeler" . bio-bwa.sourceforge.net . Consultado el 9 de julio de 2024 .
- 1 2 3 4 Poplin R, Ruano-Rubio V, DePristo MA, Fennell TJ, Carneiro MO, Van der Auwera GA, et al. (2018-07-24). "Escalando el descubrimiento preciso de variantes genéticas a decenas de miles de muestras". bioRxiv 10.1101/201178 .
- 1 2 Poplin R, Chang PC, Alexander D, Schwartz S, Colthurst T, Ku A, et al. (noviembre de 2018). "Un detector universal de variantes SNP y pequeñas indel mediante redes neuronales profundas". Nature Biotechnology . 36 (10): 983– 987. doi : 10.1038/nbt.4235 . PMID 30247488 .
- ↑ google/deepvariant , Google, 4 de julio de 2024 , consultado el 9 de julio de 2024
- 1 2 Cibulskis K, Lawrence MS, Carter SL, Sivachenko A, Jaffe D, Sougnez C, et al. (marzo de 2013). "Detección sensible de mutaciones puntuales somáticas en muestras de cáncer impuras y heterogéneas" . Nature Biotechnology . 31 (3): 213– 219. Bibcode : 2013NatBi..31..213C . doi : 10.1038/nbt.2514 . PMC 3833702. PMID 23396013 .
- ↑ Dobin A, Davis CA, Schlesinger F, Drenkow J, Zaleski C, Jha S, et al. (enero de 2013). "STAR: alineador universal ultrarrápido de RNA-seq" . Bioinformatics . 29 (1): 15–21 . doi : 10.1093/bioinformatics/bts635 . PMC 3530905. PMID 23104886 .
- 1 2 "Grace Hopper Superchip" . Documentación de NVIDIA . Consultado el 10 de julio de 2024 .
- ↑ Simakov NA, Jones MD, Furlani TR, Siegmann E, Harrison RJ (11 de enero de 2024). «Primeras impresiones del superchip NVIDIA Grace CPU y el superchip NVIDIA Grace Hopper para cargas de trabajo científicas» . Actas de los talleres de la Conferencia Internacional sobre Computación de Alto Rendimiento en la Región Asia-Pacífico . Talleres HPCAsia '24. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 36–44 . doi : 10.1145/3636480.3637097 . ISBN 979-8-4007-1652-2.
- ↑ Crowgey EL, Vats P, Franke K, Burnett G, Sethia A, Harkins T, et al. (julio de 2021). "Resumen 165: Procesamiento mejorado de datos de secuenciación genómica para cánceres pediátricos: GPU y técnicas de aprendizaje automático para la detección de variantes" . Cancer Research . 81 (13_Suplemento): 165. doi : 10.1158/1538-7445.AM2021-165 . ISSN 0008-5472 .
- ↑ Ng JK, Vats P, Fritz-Waters E, Sarkar S, Sams EI, Padhi EM, et al. (diciembre de 2022). " La llamada de variantes de novo identifica firmas de mutación del cáncer en el Proyecto 1000 Genomas" . Human Mutation . 43 (12): 1979– 1993. doi : 10.1002/humu.24455 . PMC 9771978. PMID 36054329 .
- ↑ Lee TH, Jang BS, Chang JH, Kim E, Park JH, Chie EK (julio de 2023). "Panorama genómico del adenocarcinoma rectal localmente avanzado: comparación entre antes y después de la quimiorradiación neoadyuvante y efectos de los biomarcadores genéticos en los resultados clínicos y la respuesta tumoral" . Cancer Medicine . 12 (14): 15664– 15675. doi : 10.1002/cam4.6169 . PMC 10417181. PMID 37260182 .
- ↑ Manuel JG, Heins HB, Crocker S, Neidich JA, Sadzewicz L, Tallon L, et al. (junio de 2023). "Secuenciación de lectura larga de alta cobertura y alta precisión de una línea celular neuronal de ratón utilizando el secuenciador PacBio Revio". bioRxiv 10.1101/2023.06.06.543940 .
- ↑ Goenka SD, Gorzynski JE, Shafin K, Fisk DG, Pesout T, Jensen TD, et al. (julio de 2022). "Identificación acelerada de variantes causantes de enfermedades con secuenciación genómica de nanoporos ultrarrápida" . Nature Biotechnology . 40 (7): 1035– 1041. doi : 10.1038/s41587-022-01221-5 . PMC 9287171. PMID 35347328 .
- ↑ "El Broad Institute y NVIDIA llevan NVIDIA Clara a la plataforma Terra Cloud, que presta servicios a 25 000 investigadores que impulsan el descubrimiento biomédico" . Sala de prensa de NVIDIA . Consultado el 9 de julio de 2024 .
- ↑ "El Biobanco del Reino Unido impulsa la investigación genómica con NVIDIA Clara Parabricks" . NVIDIA . Consultado el 9 de julio de 2024 .
Lecturas adicionales
- Franke KR, Crowgey EL (marzo de 2020). "Aceleración del análisis de datos de secuenciación de próxima generación: una evaluación de las mejores prácticas optimizadas para los algoritmos de Genome Analysis Toolkit" . Genomics & Informatics . 18 (1) e10. BMC. doi : 10.5808/GI.2020.18.1.e10 . PMC 7120354. PMID 32224843 .
- O'Connell KA, Yosufzai ZB, Campbell RA, Lobb CJ, et al. Gorrell LM, et al. (mayo de 2023). " Aceleración de flujos de trabajo genómicos mediante NVIDIA Parabricks" . BMC Bioinformatics . 24 (1) 221. doi : 10.1186/s12859-023-05292-2 . PMC 10230726. PMID 37259021 .
Enlaces externos
- NVIDIA Clara
- NVIDIA Clara para genómica
- Software de Nvidia
- Software de bioinformática
- Software médico