
La construcción de un grafo pan-genómico es el proceso de crear una representación gráfica del genoma colectivo (el pan-genoma ) de una especie o un grupo de organismos. En estos grafos, los nodos suelen representar secuencias genómicas (por ejemplo, segmentos de ADN o k-meros) y las aristas representan relaciones de adyacencia tal como se presentan en los genomas individuales dentro de una población. De este modo, un pan-genoma permite encapsular todos los datos genómicos de una especie o clado, en lugar de un único representante de dicha especie o clado. Esto significa que puede capturar simultáneamente múltiples versiones de cualquier locus dado . [ 2 ]
Los genomas de referencia lineales tradicionales representan únicamente una secuencia genómica de consenso, que captura solo una versión de cada locus genómico. [ 3 ] Este enfoque es inherentemente limitado, ya que no tiene en cuenta variaciones genéticas como los polimorfismos de un solo nucleótido (SNP), las inserciones y deleciones ( indels ) y las variantes estructurales más grandes que suelen existir en las poblaciones. Por lo tanto, los genomas de referencia lineales introducen sesgos al representar de forma inadecuada la diversidad genómica, lo que puede comprometer la precisión de análisis como la detección de variantes y el genotipado.
Los grafos pan-genómicos abordan estas limitaciones al incorporar todas las variaciones genéticas conocidas en su estructura. Esta representación inclusiva permite un análisis imparcial de los datos genómicos, mejorando significativamente la alineación de lecturas de secuenciación, la detección de variantes y la precisión del genotipado en diversos individuos. Los avances tanto en la calidad como en la longitud de la secuenciación, junto con la mejora de las técnicas de ensamblaje del genoma, han dado lugar a una colección en rápido crecimiento de ensamblajes genómicos de alta calidad, incluidos ensamblajes del genoma humano con resolución de haplotipos. Como resultado, los grafos pan-genómicos se han convertido en un paradigma importante en bioinformática para analizar datos genómicos poblacionales, mejorando la alineación de lecturas, la detección de variantes y el genotipado en diversos genomas. [ 4 ]
Desarrollo histórico

El concepto de pan-genoma fue introducido por primera vez en 2005 por Tettelin y sus colegas durante el análisis comparativo de múltiples genomas bacterianos de Streptococcus agalactiae . [ 5 ] En su estudio, Tettelin et al. definieron el pan-genoma como compuesto por un "genoma central" conservado presente en todas las cepas y un "genoma accesorio" variable que contiene genes presentes en una o un subconjunto de cepas, destacando la noción de que cualquier genoma individual contiene solo una fracción del repertorio genético total de una especie. Los primeros análisis pangenómicos en microbios se centraron en la presencia/ausencia de genes utilizando listas de genes o grupos ortólogos, en lugar de la variación a nivel de nucleótidos. A medida que se dispone de más genomas, los investigadores reconocieron la necesidad de modelar la variación genómica a nivel de pares de bases y no solo como listas de genes. [ 4 ]
La representación basada en grafos de secuencias múltiples tiene sus raíces en métodos bioinformáticos previos basados en grafos de secuencias . [ 6 ] Por ejemplo, a principios de la década de 2000, se utilizaron grafos de orden parcial [ 7 ] para representar alineamientos de secuencias múltiples y secuencias consenso, que pueden verse como una especie de grafo de secuencias que captura alelos alternativos. A principios de la década de 2010, aparecieron las primeras herramientas prácticas que aprovechaban modelos de grafos para pan-genomas. Un ejemplo notable fue el enfoque de grafo de De Bruijn coloreado utilizado por Cortex, que construyó un grafo de De Bruijn conjunto a partir de múltiples genomas o conjuntos de lecturas para detectar variaciones sin un genoma de referencia. [ 8 ] Casi al mismo tiempo, diferentes grupos de investigación como Dilthey et al. comenzaron a construir grafos para regiones genómicas específicas en humanos, como el locus del complejo mayor de histocompatibilidad (MHC) altamente variable y para colecciones de genomas microbianos para representar todas las variaciones en una estructura. [ 9 ] [ 2 ]
Recientemente, proyectos a gran escala han implementado la construcción de grafos pan-genómicos para genomas eucariotas . En 2023, el Consorcio de Referencia del Pangenoma Humano publicó un primer borrador del pangenoma humano, que contiene 47 genomas humanos diversos, con haplotipos resueltos y codificados en una estructura de grafo. [ 3 ] De manera similar, se han construido pangenomas de grafos para especies de cultivos como el tomate, a partir de 838 genomas, lo que permitió el descubrimiento de variantes de heredabilidad y ligadas a rasgos previamente "faltantes" que no eran detectables con una sola referencia. [ 10 ]
Metodologías basadas en grafos

El paso principal en la construcción de grafos de pan-genoma incluye el paso de alineación inicial y el procesamiento posterior para la representación. [ 11 ] Se han desarrollado varias metodologías basadas en grafos para construir representaciones de pan-genoma, cada una con una metodología de modelado y algoritmos de construcción de grafos diferentes. Los estudios comparativos distinguen los constructores guiados por referencia, como minigraph, que alinean iterativamente los ensamblajes a una plantilla de referencia, de los enfoques de alineación a nivel de base sin referencia, como Cactus y pggb; en las pruebas comparativas, estos últimos recuperaron más variaciones pequeñas y rutas de puntos de ruptura más precisas, pero a un costo computacional sustancialmente mayor. [ 12 ] [ 13 ] Estos métodos pueden capturar reordenamientos más complejos y representar eficientemente grandes colecciones de secuencias que los enfoques tradicionales, como las alineaciones de secuencias múltiples (MSA) y las estrategias basadas en K-meros. Además, los métodos de grafos se encuentran actualmente entre los más efectivos para gestionar datos de pan-genoma a gran escala, incluso soportando la representación simultánea de decenas a cientos de haplotipos humanos. [ 14 ]
Los grafos del pangenoma suelen ser bidireccionales, lo que significa que cada nodo tiene dos orientaciones (directa e inversa), y las aristas representan todas las combinaciones de estas orientaciones. [ 15 ] Las métricas del grafo, incluyendo el recuento de nodos, aristas y componentes conexas, ofrecen información valiosa sobre la granularidad de las variaciones representadas, así como sobre la complejidad y la accesibilidad de la información dentro del pangenoma. [ 16 ] === Grafos de De Bruijn ===

Los grafos de De Bruijn son una estructura de datos clásica del ensamblaje de genomas que se ha adaptado para la representación de pan-genomas. En un grafo de De Bruijn, las secuencias genómicas se dividen en k-meros de longitud fija (subcadenas de longitud k ). Cada k -mero único forma un nodo en el grafo, y existe una arista entre dos k -meros si se superponen en k -1 bases (como ocurre cuando son adyacentes en algún genoma). Este grafo codifica la secuencia de cada genoma a través de una ruta de nodos de k -meros. Para pan-genomas, se puede construir un único grafo de De Bruijn a partir de múltiples genomas tomando la unión de todos los k -meros presentes. Para conservar información sobre qué genoma(s) contiene(n) un k -mero determinado, se utilizan métodos que emplean grafos de De Bruijn coloreados, donde cada nodo está anotado con uno o más colores que indican las muestras o cepas en las que aparece ese k -mero. [ 4 ]
El principio que subyace al uso de grafos de De Bruijn para pan-genomas es que el grafo comprime inherentemente las regiones de secuencia idénticas y revela secuencias variantes como rutas alternativas. Esto hace que los métodos basados en grafos de De Bruijn sean naturalmente independientes de referencia; no requieren anclaje a un genoma conocido, lo cual es útil para descubrir genes o reordenamientos nuevos. [ 17 ] Una ventaja importante de los grafos de De Bruijn es su capacidad para manejar secuencias repetitivas y regiones de alta diversidad al dividir los genomas en fragmentos más pequeños de k -meros. Sin embargo, una limitación es que la elección de k puede afectar la resolución del grafo, donde un k fijo puede ser demasiado pequeño para capturar la variación estructural (que luego aparece como patrones de grafo complejos) o demasiado grande para incluir regiones altamente divergentes. [ 18 ]
Los grafos de De Bruijn han demostrado ser altamente escalables para conjuntos de datos masivos (por ejemplo, 600 000 genomas bacterianos) gracias a la compactación de k-meros. Sin embargo, tienen una capacidad limitada para representar variantes estructurales (SV) o grandes inserciones/deleciones (indels), y plantean desafíos de visualización e interpretación debido a sus estructuras cíclicas. Entre las aplicaciones comunes se incluyen los análisis de pan-genomas bacterianos, el ensamblaje de lecturas cortas y los estudios poblacionales basados en k-meros. Herramientas como Bifrost y mdbg optimizan el almacenamiento mediante grafos de De Bruijn compactados y coloreados. [ 12 ]
Gráficos de variación

Los grafos de variación (también conocidos como grafos de secuencia ) representan la homología y la variación de secuencias a nivel de nucleótido en una estructura gráfica. En un modelo de grafo de variación, los nodos representan secuencias contiguas (como un segmento de referencia o una secuencia de alelos ), y las aristas conectan los nodos para indicar adyacencias permitidas en algún genoma. El grafo puede verse como una fusión de muchos genomas individuales: cada genoma corresponde a una ruta que recorre los nodos en el orden de su secuencia. [ 3 ] A diferencia de los grafos de De Bruijn, que se derivan de k-meros de longitud fija, los grafos de variación a menudo se derivan de alineamientos o catálogos de variantes. Por ejemplo, se puede comenzar con un genoma de referencia y agregar alelos alternativos como ramas divergentes en sitios de variantes, o realizar un alineamiento de secuencias múltiples de varios genomas y construir un grafo que incorpore ese alineamiento. [ 2 ] Los grafos de variación capturan con precisión los SNP, las inserciones/deleciones y las variantes estructurales, y permiten una representación completa y sin pérdidas de genomas enteros, una característica relevante para la genómica clínica. Sin embargo, la complejidad del grafo crece rápidamente con la adición de haplotipos, y la mayoría de las implementaciones ofrecen soporte limitado para actualizaciones dinámicas. [ 12 ] Algunas aplicaciones incluyen el Pangenoma de Referencia Humano y la llamada de variantes de patógenos que integra tanto SNP como SV. [ 2 ] [ 19 ] Herramientas como pggb y Minigraph permiten pangenomas humanos a escala cromosómica. [ 20 ]
Gráficos de alineación de orden parcial
El alineamiento de orden parcial (POA) representa un alineamiento de secuencias múltiples como un grafo acíclico dirigido (DAG) en lugar de una secuencia de consenso lineal . En un grafo POA, cada secuencia en el pan-genoma es una ruta a través del grafo, y las posiciones alineadas se fusionan en nodos únicos. Esto preserva la información de alineación completa sin comprimirla en un único perfil lineal. [ 21 ] Los grafos POA capturan variantes pequeñas ( SNP e indels ) como rutas de ramificación y fusión en el DAG, evitando el sesgo de referencia ya que ningún genoma es privilegiado como referencia. Dicho esto, dado que el grafo POA debe permanecer acíclico, los grafos no pueden representar reordenamientos estructurales o variaciones genómicas complejas que violen un único orden de secuencias. [ 22 ] [ 2 ] Los grafos POA resuelven la complejidad a pequeña escala a través del suavizado iterativo, reduciendo los bucles espurios y el subalineamiento en los grafos. Además, son compatibles con la corrección de errores de secuenciación de lectura larga. Sin embargo, requieren una gran capacidad computacional debido a las repetidas pasadas de realineación y son menos eficaces para variaciones estructurales a gran escala. Algunas aplicaciones incluyen el refinamiento de la topología de grafos en regiones repetitivas y el pulido híbrido de pan-genomas de lectura corta/larga. Herramientas como abPOA generan secuencias consenso y visualizan grafos de alineación. [ 20 ] [ 23 ]
Gráficos de cactus
El grafo Cactus es una estructura basada en grafos diseñada específicamente para alineamientos múltiples de genomas completos con reordenamientos complejos. Un grafo Cactus se define como un grafo conectado en el que cada arista se encuentra, como máximo, en un ciclo simple. [ 24 ] En un modelo de grafo Cactus de un pan-genoma, los nodos suelen representar puntos de ruptura evolutivos o segmentos homólogos, y las aristas representan regiones alineadas contiguas entre esos puntos de ruptura. Cuando hay una inversión o un reordenamiento, aparece como un ciclo (bucle) en el grafo que conecta los segmentos, y debido a que cada arista está en un solo ciclo, cada reordenamiento es un evento aislado en la estructura del grafo. Aunque las variaciones más recientes, como Progressive Cactus, han mejorado significativamente, los requisitos computacionales siguen siendo altos para dichos grafos. [ 25 ] Los grafos Cactus minimizan el sesgo de referencia al tratar todos los genomas por igual y manejan grandes variantes estructurales y reordenamientos de manera eficiente (por ejemplo, la canalización Minigraph-Cactus). Sin embargo, requieren importantes recursos computacionales y su precisión depende de la calidad del alineamiento inicial. [ 12 ] [ 20 ] Las aplicaciones clave incluyen pangenomas a escala de vertebrados (por ejemplo, más de 90 haplotipos humanos) y estudios evolutivos de reordenamientos cromosómicos. Las implementaciones más utilizadas incluyen Cactus (del Navegador Genómico de UCSC ) y Minigraph-Cactus (para la construcción de pangenomas a gran escala). [ 20 ] [ 26 ]
Objetivos de las estructuras de datos
La representación del pan-genoma es desafiante no solo porque implica alinear cantidades masivas de datos de secuencia, potencialmente del orden de cientos de miles de millones de bases, sino también debido a la dificultad de decidir qué alineaciones deben incorporarse, particularmente para secuencias que se han duplicado recientemente o contienen elementos repetitivos.: [ 11 ] Escalar las estructuras de datos de grafos del pan-genoma para acomodar cientos de genomas exige una potencia computacional y experiencia en ingeniería sustanciales. [ 27 ] Sin embargo, cada estructura de datos del pan-genoma debe cumplir los siguientes objetivos [ 14 ]
- Construcción y mantenimiento: Debe poder construirse a partir de múltiples fuentes genómicas, incluidos genomas de referencia lineales, paneles de haplotipos y datos de secuenciación brutos, con la capacidad de actualizar la información almacenada de forma dinámica sin necesidad de una reconstrucción completa.
- Sistema de coordenadas: Debe proporcionar un sistema de coordenadas bien definido que permita la identificación inequívoca de los loci genéticos y las variaciones.
- Anotación de características biológicas: Debe admitir la anotación de características biológicas en genomas individuales, incluidos genes, intrones, sitios de unión de factores de transcripción , modificaciones epigenéticas y elementos reguladores.
- Recuperación de datos: Debe permitir la recuperación eficiente de secuencias genómicas, variantes genéticas y frecuencias alélicas, preservando al mismo tiempo la información de haplotipos.
- Mapeo de secuencias e identificación de variantes: Debe facilitar la comparación de secuencias cortas y largas con su base de datos.
- Genómica comparativa: Debe permitir comparaciones genómicas dentro de un mismo pangenoma y entre múltiples pangenomas.
- Eficiencia computacional: Debe minimizarse el uso de memoria sin dejar de ser compatible con herramientas computacionales que operen dentro de un tiempo de ejecución razonable.
Almacenamiento de gráficos
Aunque existen varios enfoques para construir grafos de pangenoma, en gran medida han convergido en un modelo de datos compartido conocido como formato de Ensamblaje de Fragmentos Gráficos (GFA). [ 28 ] Esta estandarización respalda el desarrollo de un conjunto unificado de herramientas diseñadas para operar dentro del marco del grafo de pangenoma. [ 29 ]
Formato GFA

GFA (Graphical Fragment Assembly) es un formato diseñado para codificar grafos de secuencias, ya sean provenientes de ensamblajes, variación genómica, patrones de empalme genético o incluso solapamientos entre secuencias de lectura larga. Utiliza un formato de texto delimitado por tabulaciones para registrar secuencias y sus relaciones, basándose en la codificación UTF-8 restringida a puntos de código no mayores de 127. Los campos incluyen H para encabezados, que indican la versión del archivo; S para segmentos, que representan fragmentos de ADN o nucleótidos; L para enlaces, que conectan segmentos orientados, con su solapamiento representado por una cadena CIGAR; J para saltos, que definen conexiones entre segmentos que no pueden asociarse con un solapamiento o secuencia específicos (principalmente huecos debidos a regiones no ensambladas); y P para rutas, que contienen una lista ordenada de segmentos orientados respaldados por un enlace o un salto. [ 28 ]
El formato GFA ofrece una forma estandarizada de codificar nodos de secuencia y sus enlaces en grafos de variación. Si bien otros formatos como el Variant Call Format (VCF) se integran para incorporar información de variantes directamente en el modelo de grafo, y existen estructuras de índice concisas como GCSA/GCSA2, la fortaleza de GFA radica en proporcionar una base tanto para la conectividad estructural como para los datos de variación poblacional. [ 30 ]
Aplicaciones
Genómica microbiana
Las especies microbianas, como las bacterias, suelen tener altos niveles de plasticidad genómica, con altos niveles de transferencia horizontal de genes , variación en el contenido genético y reordenamientos. Por lo tanto, el pan-genoma de una especie microbiana puede abarcar un conjunto central de genes más un gran conjunto de genes accesorios que varían según la cepa. [ 31 ] En genómica microbiana, se utilizan grafos de pan-genoma a nivel genético para analizar el repertorio de genes. Por ejemplo, los nodos que representan genes pueden ayudar a identificar qué vías son centrales o accesorias, y las aristas pueden mostrar vecindarios genéticos conservados o islas genómicas . En esta descripción, los grafos se pueden utilizar para rastrear la ganancia o pérdida de islas de patogenicidad, genes de resistencia a antibióticos o elementos móviles entre cepas. [ 32 ] Más allá de la presencia de genes, los grafos a nivel de nucleótidos permiten la detección de microvariantes dentro de los genes centrales y el mapeo de lecturas de secuenciación de nuevas cepas a un grafo de todas las cepas conocidas. Los estudios han demostrado que el uso de un grafo de pan-genoma en lugar de una única referencia para la alineación de lecturas en patógenos puede mejorar las tasas de mapeo y la detección de variantes. [ 33 ]
Medicina personalizada
En genómica humana y medicina, los gráficos de pangenoma prometen hacer que los análisis genómicos sean más inclusivos y precisos para individuos de poblaciones diversas. La práctica actual de usar un único genoma de referencia humano (como la versión GRCh38 ) tiene sesgos bien conocidos. Por ejemplo, si una persona tiene variantes genéticas que no están presentes en la referencia, las lecturas que portan esas variantes pueden alinearse mal o no alinearse en absoluto, lo que lleva a variantes omitidas o mal identificadas. [ 34 ] Esto es particularmente problemático para variantes estructurales o para poblaciones subrepresentadas en el genoma de referencia. En consecuencia, un gráfico de pangenoma humano, que incorpora secuencias de muchos individuos, aborda esto al proporcionar alelos alternativos en muchos loci. [ 35 ] Los gráficos de pangenoma han transformado la genómica clínica y la medicina personalizada al proporcionar una visión integral de la diversidad genética, especialmente en regiones que están subrepresentadas en los genomas de referencia tradicionales. Esta resolución mejorada no solo facilita estrategias terapéuticas personalizadas, sino que también promueve la equidad en salud global, como lo demuestran las iniciativas centradas en las poblaciones de Oriente Medio y el sur de Asia. [ 36 ]
Genómica comparativa
La genómica comparativa implica el estudio de las similitudes y diferencias en el contenido y la organización del genoma entre diferentes especies o dentro de una misma especie. Los gráficos de pan-genoma son muy útiles en este campo, ya que proporcionan un marco unificador para comparar directamente múltiples genomas. Para comparaciones intraespecíficas, un gráfico puede representar polimorfismos y variantes estructurales (VE), lo que permite analizar la diversidad y la evolución del genoma. Por ejemplo, en genómica vegetal, un gráfico de muchos cultivares o accesiones silvestres puede revelar variaciones estructurales como la presencia o ausencia de duplicaciones o inversiones génicas que pueden subyacer a las diferencias en los rasgos. Por ejemplo, la construcción de un gráfico de pan-genoma de tomate a partir de 838 genomas permitió el descubrimiento de variantes de heredabilidad y ligadas a rasgos previamente "perdidas" que no eran detectables con una sola referencia. [ 10 ] Además, los gráficos de pan-genoma permiten la integración y el análisis de VE en un conjunto diverso de genomas, mejorando la precisión en la detección de VE raras que suelen pasarse por alto con genomas de referencia únicos. Por ejemplo, los gráficos pan-genómicos han mejorado sustancialmente el análisis de las variantes estructurales (SV) en enfermedades genéticas raras al integrar datos de SV de genomas haploides en una estructura gráfica unificada, lo que permite la delimitación precisa de alelos complejos y raros. Este enfoque no solo aumenta el intercambio de alelos entre individuos emparentados, confirmando tasas de error más bajas, sino que también facilita la identificación de SV ultrarraras (frecuencia del alelo menor <1%) que alteran secuencias codificantes en genes de enfermedades conocidas, como la nueva deleción diagnóstica en KMT2E , ofreciendo en última instancia un marco más robusto para los análisis genómicos poblacionales y el diagnóstico de enfermedades raras . [ 37 ]
Análisis del pan-transcriptoma
Al incorporar la variación genética a nivel poblacional, los gráficos de pan-genoma empalmado permiten identificar transcripciones únicas para haplotipos específicos . Esto aumenta la precisión de las mediciones de expresión génica, especialmente en casos complejos como la expresión alélica específica. En la práctica, las herramientas pueden combinar transcripciones conocidas con variantes genómicas para crear un gráfico de pan-genoma empalmado, generando transcripciones específicas de haplotipo (HST). Posteriormente, alineadores especializados mapean las lecturas de RNA-seq a este gráfico, capturando la gama completa de empalme y variación de manera más efectiva que los métodos tradicionales. Finalmente, se cuantifican los niveles de expresión de estas HST, reduciendo el sesgo y mejorando aún más la precisión. Como resultado, este enfoque puede lograr una precisión muy alta al emparejar las lecturas con los haplotipos específicos de un individuo. [ 38 ]
Genotipado
La precisión y la escalabilidad del genotipado , en particular para las variantes estructurales (VE), se han mejorado gracias a los grafos de pangenoma, ya que abordan las limitaciones de los genomas de referencia lineales. La integración de la diversidad poblacional en las estructuras de referencia de los grafos de pangenoma permite el genotipado de alto rendimiento. Por ejemplo, GraphTyper2 es un método para el genotipado de VE y variantes pequeñas en un marco de grafo de pangenoma, lo que allana el camino para análisis genómicos a escala poblacional más completos y con menor sesgo. Emplea alineación con reconocimiento de grafos a través de rutas de pangenoma, mitigando los sesgos inherentes a las referencias lineales y mejorando la representación de las VE en poblaciones diversas, como las VE patógenas en familias islandesas. [ 39 ]
Referencias
- ↑ Hickey, Glenn; et al. (2024). "Construcción de grafos de pangenoma a partir de alineaciones genómicas con Minigraph-Cactus" . Nature Biotechnology . 42 (4): 663– 673. doi : 10.1038/s41587-023-01793-w . PMC 10638906. PMID 37165083 .
- 1 2 3 4 5 Garrison, Erik; Sirén, Jouni; Novak, Adam M.; Hickey, Glenn; Eizenga, Jordan M.; Dawson, Eric T.; Jones, William; Garg, Shilpa; Markello, Charles; Lin, Michael F.; Paten, Benedict; Durbin, Richard (2018). "Variation graph toolkit improves read mapping by representation genetic variation in the reference" . Nature Biotechnology . 36 (9): 875–879 . doi : 10.1038/nbt.4227 . PMC 6126949. PMID 30125266 .
- 1 2 3 Liao, Wen-Wei; et al. (2023). "Un borrador de referencia del pangenoma humano" . Nature . 617 (7960): 312– 324. Bibcode : 2023Natur.617..312L . doi : 10.1038 / s41586-023-05896-x . PMC 10172123. PMID 37165242 .
- 1 2 3 Eizenga, Jordania M.; Novak, Adam M.; Sibbesen, Jonás A.; Heumos, Simón; Ghaffaari, Ali; Hickey, Glenn; Chang, Xian; Marinero, Josías D.; Roundwaite, Robin; Ebler, Jana; Rautiainen, Mikko; Garg, Shilpa; Patena, Benedicto; Marschall, Tobías; Sirén, Jouni; Garrison, Erik (2020). "Gráficos de pangenoma" . Revista Anual de Genómica y Genética Humana . 21 : 139– 162. doi : 10.1146/annurev-genom-120219-080406 . PMC 8006571 . PMID 32453966 .
- ↑ Tettelin, Hervé; et al. (2005). "Análisis del genoma de múltiples aislados patógenos de Streptococcus agalactiae: Implicaciones para el "pan-genoma" microbiano" " . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 102 (39): 13950– 13955. Bibcode : 2005PNAS..10213950T . doi : 10.1073/pnas.0506758102 . PMC 1216834 . PMID 16172379 .
- ↑ Paten, Benedict; Novak, Adam M.; Eizenga, Jordan M.; Garrison, Erik (2017). "Gráficos genómicos y la evolución de la inferencia genómica" . Genome Research . 27 (5): 665– 676. doi : 10.1101/gr.214155.116 . PMC 5411762. PMID 28360232 .
- ↑ Lee, Christopher; Grasso, Catherine; Sharlow, Mark F. (2002). "Alineamiento de secuencias múltiples mediante grafos de orden parcial". Bioinformatics . 18 (3): 452– 464. doi : 10.1093/bioinformatics/18.3.452 . PMID 11934745 .
- ^ Iqbal, Zamín; Caccamo, Mario; Turner, Isaac; Flicek, Paul; McVean, Gil (2012). "Ensamblaje de novo y genotipado de variantes mediante gráficos de Bruijn coloreados" . Nat Genet . 44 (2): 226– 232. doi : 10.1038/ng.1028 . PMC 3272472 . PMID 22231483 .
- ↑ Dilthey, Alexander; Cox, Charles; Iqbal, Zamin; Nelson, Matthew R.; McVean, Gil (2015). " Inferencia genómica mejorada en el MHC utilizando un gráfico de referencia poblacional" . Nat Genet . 47 (6): 682– 688. doi : 10.1038/ng.3257 . PMC 4449272. PMID 25915597 .
- 1 2 Zhou, Yao; Zhang, Zhiyang; Bao, Zhigui; Li, Hongbo; Lyu, Yaqing; Zan, Yanjun; Wu, Yaoyao; Cheng, Lin; Colmillo, Yuhan; Wu, Kun; Zhang, Jinzhe; Lyu, Hongjun; Lin, Tao; Gao, Qiang; Saha, Surya; Müller, Lucas; Fei, Zhangjun; Städler, Thomas; Xu, Shizhong; Zhang, Zhiwu; Velocidad, Doug; Huang, Sanwen (2022). "El gráfico pangenoma captura la heredabilidad faltante y potencia el mejoramiento del tomate" . Naturaleza . 606 (7914): 527– 534. Bibcode : 2022Natur.606..527Z . doi : 10.1038/s41586-022-04808-9 . PMC 9200638 . PMID 35676474 .
- 1 2 Liao, WW.; Asri, M.; Ebler, J. (2023). "Un borrador de referencia del pangenoma humano" . Nature . 617 ( 7960): 312– 324. Bibcode : 2023Natur.617..312L . doi : 10.1038/s41586-023-05896-x . PMC 10172123. PMID 37165242 .
- 1 2 3 4 Andreace, F; Lechat, P; Dufresne, Y; Chikhi, R (2023-11-30). "Comparación de métodos para construir y representar gráficos del pangenoma humano" . Genome Biol . 24 (1): 274. doi : 10.1186/s13059-023-03098-2 . PMC 10691155. PMID 38037131 .
- ↑ Crysnanto; Leonard; Pausch (2022). "Comparación de métodos para construir grafos de pangenoma" . Actas del XII Congreso Mundial de Genética Aplicada a la Producción Ganadera . Colección de Investigación de la ETH Zúrich.
- 1 2 El Consorcio de Pangenómica Computacional (enero de 2018). "Pangenómica computacional: estado, promesas y desafíos" . Briefings in Bioinformatics . 19 (1): 118– 135. doi : 10.1093 / bib/bbw089 . PMC 5862344. PMID 27769991 .
- ↑ Garrison, E; Guarracino, A (2023-01-01). "Gráficos de pangenoma imparciales" . Bioinformatics . 39 (1) btac743. doi : 10.1093/bioinformatics/btac743 . PMC 9805579. PMID 36448683 .
- ↑ Andreace, F.; Lechat, P.; Dufresne , Y. (2023). "Comparación de métodos para construir y representar gráficos del pangenoma humano" . Genome Biol . 24 (1): 274. doi : 10.1186/s13059-023-03098-2 . PMC 10691155. PMID 38037131 .
- ↑ Wittler, Roland (2020). "Filogenómica sin alineación ni referencia con grafos de De Bruijn coloreados" . Algorithms for Molecular Biology . 15 4. doi : 10.1186/s13015-020-00164-3 . PMC 7137503. PMID 32280365 .
- ↑ Compeau, PE; Pevzner, PA; Tesler, G. (2011). "¿Por qué son útiles los grafos de De Bruijn para el ensamblaje del genoma?" . Nat Biotechnol . 29 (11): 987– 991. doi : 10.1038/nbt.2023 . PMC 5531759 . PMID 22068540 .
- ↑ Yang, Z; Guarracino, A; Biggs, PJ; Black, MA; Ismail, N; Wold, JR; Merriman, TR; Prins, P; Garrison, E; de Ligt, J (2023-08-10). "Gráficos de pangenoma en enfermedades infecciosas: un análisis integral de la variación genética de Neisseria meningitidis aprovechando las lecturas largas de Oxford Nanopore" . Front Genet . 14 1225248. doi : 10.3389/fgene.2023.1225248 . PMC 10448961. PMID 37636268 .
- 1 2 3 4 Hickey G, Monlong J, Ebler J, Novak AM, Eizenga JM, Gao Y, Human Pangenome Reference Consortium, Marschall T, Li H, Paten B (2024). "Construcción de grafos de pangenoma a partir de alineaciones genómicas con Minigraph-Cactus" . Nat Biotechnol . 42 (4): 663– 673. doi : 10.1038/s41587-023-01793-w . PMC 10638906. PMID 37165083 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Van Dijk, Lucas R.; Manson, Abigail L.; Earl, Ashlee M.; Garimella, Kiran V.; Abeel, Thomas (2025). "Alineación de orden parcial afín a huecos rápida y exacta con POASTA" . Bioinformatics . 41 (1) btae757. doi : 10.1093/bioinformatics/btae757 . PMC 11755094. PMID 39752324 .
- ↑ Raphael, Benjamin; Zhi, Degui; Tang, Haixu; Pevzner, Pavel (2004). "Un nuevo método para el alineamiento múltiple de secuencias con elementos repetidos y reordenados" . Genome Res . 14 (11): 2336– 2346. doi : 10.1101/gr.2657504 . PMC 525693. PMID 15520295 .
- ^ Garrison, E.; Guarracino, A.; Heumos, S. (2024). "Construcción de gráficos de pangenomas". Métodos Nat . 21 (11): 2008–2012 . doi : 10.1038/s41592-024-02430-3 . PMID 39433878 .
- ↑ Paten, Benedict; Earl, Dent; Nguyen, Ngan; Diekhans, Mark; Zerbino, Daniel; Haussler, David (2011). "Cactus: Algoritmos para el alineamiento de secuencias múltiples del genoma" . Genome Res . 21 (9): 1512– 1528. doi : 10.1101/gr.123356.111 . PMC 3166836. PMID 21665927 .
- ^ Armstrong, Joel; Hickey, Glenn; Diekhans, Mark; Fiddes, Ian T.; Novak, Adam M.; Deran, Alden; Colmillo, Qi; Xie, dúo; Feng, Shaohong; Stiller, Josefina; Genereux, Diane; Johnson, Jeremy; Marinescu, Voichita Dana; Alföldi, Jessica; Harris, Robert S.; Lindblad-Toh, Kerstin; Haussler, David; Karlsson, Elinor; Jarvis, Erich D.; Zhang, Guojie; Paten, Benedicto (2020). "Progressive Cactus es un alineador de genomas múltiples para la era de los mil genomas" . Naturaleza . 587 (7833): 246– 251. Bibcode : 2020Natur.587..246A . doi : 10.1038/s41586-020-2871-y . PMC 7673649 . PMID 33177663 .
- ↑ Paten, B; Earl, D; Nguyen, N; Diekhans, M; Zerbino, D; Haussler, D (2011). "Cactus: Algoritmos para el alineamiento de secuencias múltiples del genoma" . Genome Res . 21 (9): 1512– 1528. doi : 10.1101/gr.123356.111 . PMC 3166836. PMID 21665927 .
- ↑ Garrison, E; Guarracino, A (1 de enero de 2023). "Gráficos de pangenoma imparciales" . Bioinformatics . 39 (1) btac743. doi : 10.1093/bioinformatics/btac743 . PMC 9805579. PMID 36448683 .
- 1 2 "GFA: Especificación del formato de ensamblaje de fragmentos gráficos (GFA)" . GitHub .
- ↑ Guarracino, Andrea; Heumos, Simon; Nahnsen, Sven; Prins, Pjotr; Garrison, Erik (julio de 2022). " ODGI: comprensión de los grafos del pangenoma" . Bioinformatics . 38 (13): 3319– 3326. doi : 10.1093/bioinformatics/btac308 . PMC 9237687. PMID 35552372 .
- ↑ Garrison, Erik Peter (2018). Pangenómica gráfica (tesis doctoral). Universidad de Cambridge, Wellcome Sanger Institute. doi : 10.17863/CAM.41621 .
- ↑ Juhas, Mario; Van Der Meer, Jan Roelof; Gaillard, Muriel; Harding, Rosalind M.; Hood, Derek W.; Crook, Derrick W. (2009). "Islas genómicas: herramientas de transferencia horizontal de genes bacterianos y evolución" . FEMS Microbiol Rev. 33 ( 2): 376– 393. doi : 10.1111/j.1574-6976.2008.00136.x . PMC 2704930. PMID 19178566 .
- ↑ Noll, Nicholas; Molari, Marco; Shaw, Liam P.; Neher, Richard A. (2023). "PanGraph: construcción escalable de grafos de pan-genomas bacterianos" . Microb Genom . 9 (6). doi : 10.1099/mgen.0.001034 . PMC 10327495. PMID 37278719 .
- ↑ Yang, Zuyu; Guarracino, Andrea; Biggs, Patrick J.; Black, Michael A.; Ismail, Nuzla; Wold, Jana Renee; Merriman, Tony R.; Prins, Pjotr; Garrison, Erik; De Ligt, Joep (2023). "Gráficos de pangenoma en enfermedades infecciosas: un análisis integral de la variación genética de Neisseria meningitidis aprovechando las lecturas largas de Oxford Nanopore" . Front . Genet . 14 1225248. doi : 10.3389/fgene.2023.1225248 . PMC 10448961. PMID 37636268 .
- ↑ Matthews, Chelsea A.; Watson-Haigh, Nathan S.; Burton, Rachel A.; Sheppard, Anna E. (2024). "Una introducción sencilla a la pangenómica" . Briefings in Bioinformatics . 25 (6) bbae588. doi : 10.1093/bib/ bbae588 . PMC 11570541. PMID 39552065 .
- ↑ Abondio, Paolo; Cilli, Elisabetta; Luiselli, Donata (2023). "Pangelómica humana: promesas y desafíos de una referencia genómica distribuida" . Life . 13 ( 6): 1360. Bibcode : 2023Life...13.1360A . doi : 10.3390/life13061360 . PMC 10304804. PMID 37374141 .
- ↑ Nassir, N.; Almarri, A.; Akter, H. (2025). "Avances en genómica clínica con pangenomas de Oriente Medio y Asia Meridional". Nat Med . 31 (3): 725– 727. doi : 10.1038/s41591-025-03544-7 . PMID 40038508 .
- ↑ Groza, C.; Schwendinger-Schreck, C.; Cheung, WA (2024). "Los gráficos de pangenoma mejoran el análisis de SV en enfermedades genéticas raras" . Nat Commun . 15 (1): 657. doi : 10.1038/s41467-024-44980-2 . PMC 10803329. PMID 38253606 .
- ↑ Sibbesen, Jonas A.; Eizenga, Jordan M.; Novak, Adam M. (1 de febrero de 2023). "Análisis del transcriptoma con conocimiento del pangenoma mediante gráficos de pangenoma empalmados" . Nature Methods . 20 (2): 239– 247. doi : 10.1038/s41592-022-01731-9 . ISSN 1548-7091 . PMID 36646895 .
- ↑ Eggertsson, HP; Kristmundsdottir, S.; Beyter, D. (2019). "GraphTyper2 permite la genotipificación a escala poblacional de la variación estructural mediante gráficos de pangenoma" . Nat Commun . 10 (1): 5402. Bibcode : 2019NatCo..10.5402E . doi : 10.1038/s41467-019-13341-9 . PMC 6881350. PMID 31776332 .
- Genómica