Articulo de referencia

Mapeo de la arquitectura del genoma

En biología molecular , el mapeo de la arquitectura del genoma (GAM) es un método de criosección para mapear regiones de ADN colocalizadas de manera independiente de la ligación...

En biología molecular , el mapeo de la arquitectura del genoma (GAM) es un método de criosección para mapear regiones de ADN colocalizadas de manera independiente de la ligación . [ 1 ] [ 2 ] [ 3 ] Supera algunas limitaciones de la captura de conformación cromosómica (3C), ya que estos métodos dependen de la digestión y la ligación para capturar segmentos de ADN interactuantes . [ 4 ] GAM es el primer método a nivel genómico para capturar proximidades tridimensionales entre cualquier número de loci genómicos sin ligación. [ 1 ]

Las secciones que se encuentran utilizando el método de criosección mencionado anteriormente se denominan perfiles nucleares . La información que proporcionan se relaciona con su cobertura en el genoma. Se puede generar un amplio conjunto de valores que representan la intensidad de la presencia de perfiles nucleares en el genoma. En función de la extensión de la cobertura en el genoma, se pueden realizar análisis sobre las interacciones de la cromatina , la ubicación del perfil nuclear dentro del núcleo sometido a criosección y los niveles de compactación de la cromatina. [ 5 ]

Para visualizar esta información, se pueden implementar ciertos métodos utilizando los datos brutos proporcionados por una tabla que muestra si se detectan o no perfiles nucleares en una ventana genómica, representadas dentro de un cromosoma específico. Con un 1 que representa la detección dentro de una ventana y un 0 que representa la ausencia de detección, se pueden obtener e interpretar subconjuntos de datos mediante la creación de gráficos, diagramas, mapas de calor y otros métodos de visualización que permiten observar estos subconjuntos de maneras distintas a los métodos de detección binaria. Al utilizar un enfoque más gráfico para interpretar los datos obtenidos mediante criosección, es posible observar interacciones que de otro modo no se habrían detectado.

Algunos ejemplos de cómo se pueden interpretar estas visualizaciones incluyen gráficos de barras que muestran la posición radial y los niveles de compactación de la cromatina de los perfiles nucleares, que se pueden dividir en categorías para dar una generalización de con qué frecuencia se detectan los perfiles nucleares dentro de una ventana genómica. Un gráfico de radar es un gráfico circular que representa los porcentajes de ocurrencia dentro de una serie de variables. En el sentido de la información genómica, los gráficos de radar se pueden usar para mostrar cómo se representan las ventanas genómicas dentro de las "características" del genoma que son parte de ciertas regiones que lo componen. Estos gráficos se pueden hacer para comparar grupos de perfiles nucleares entre sí y sus diferencias en cómo ocurren dentro de estas características se muestran gráficamente. Los mapas de calor son otra forma de representación visual donde los valores individuales en una tabla se muestran mediante celdas que toman diferentes colores según su valor. Esto permite ver tendencias dentro de una tabla mediante la visualización de grupos de colores similares o la falta de.

Este mapa de calor muestra la similitud entre los perfiles nucleares utilizando celdas que toman valores de 0 a 1.

El mapa de calor de la derecha representa la relación entre perfiles nucleares según el índice de Jaccard, donde los valores de 0 a 1 indican el grado de similitud entre dos perfiles nucleares. Esta similitud permite visualizar dónde son más comunes ciertos grupos de perfiles nucleares dentro de un genoma. En este mapa de calor, la línea diagonal blanca de celdas es la esperada, ya que estas celdas indican los puntos de intersección de los perfiles nucleares y, por lo tanto, su máxima similitud, lo que les otorga un valor de 1. Además de la línea diagonal blanca, se observa un grupo de celdas de color claro en la parte inferior derecha del mapa de calor. Este grupo de perfiles nucleares muestra una alta similitud según el índice de Jaccard. Esto significa que los perfiles nucleares están presentes en un mayor número de ventanas genómicas que otros.

Este gráfico de barras muestra cómo se distribuyen las posiciones radiales de los perfiles nucleares a lo largo de un clúster.

El gráfico de barras de la derecha representa el porcentaje de perfiles nucleares que pertenecen a una categoría de posición radial (donde 5 indica una posición ecuatorial fuerte y 1 una posición apical fuerte). El grupo de perfiles nucleares se calculó en función de su similitud mediante el método de agrupamiento k-means . Para comenzar, se eligieron aleatoriamente tres perfiles nucleares como los "centros" del grupo. Tras la elección aleatoria de los centros, cada perfil nuclear restante se asignó a un grupo según su distancia a cada centro, utilizando un valor de distancia calculado. Posteriormente, se eligieron nuevos centros para representar mejor el grupo. Este proceso se repitió hasta que los centros iniciales coincidieron con los finales. Si los centros de los grupos no han cambiado, se puede interpretar que se han elegido los grupos adecuados. Dentro de cada grupo, a los perfiles nucleares se les asigna un valor del 1 al 5 según su posición radial, y estos datos se introducen en un gráfico de barras para su visualización.

Este es un gráfico de radar que representa la presencia de 3 grupos en diferentes características del genoma del ratón.

Este gráfico de radar a la derecha muestra el porcentaje de aparición de tres grupos de perfiles nucleares dentro de ciertas características del genoma del ratón. Cada grupo de perfiles nucleares se calculó utilizando la técnica de agrupamiento k-means descrita anteriormente, en relación con el gráfico de barras que muestra las posiciones radiales de los perfiles nucleares. Se pueden realizar comparaciones entre los grupos y cómo aparecen con mayor o menor frecuencia en ciertas características en contraste entre sí. Para calcular la presencia de un grupo dentro de una característica determinada, se determina si un perfil nuclear está presente dentro de una ventana detectada dentro de dicha característica. El porcentaje de frecuencia con la que los perfiles nucleares dentro de un grupo aparecen dentro de las mismas ventanas detectadas dentro de una característica se muestra en el gráfico de radar.

Criosección y microdisección láser

Las criosecciones se producen según el método Tokuyasu, que implica una fijación rigurosa para preservar la arquitectura nuclear y celular, crioprotección con una solución de sacarosa-PBS, antes de la congelación en nitrógeno líquido. [ 6 ] En el mapeo de la arquitectura del genoma, la sección es un paso necesario para explorar la topología 3D del genoma, antes de la microdisección láser. Luego, la microdisección láser puede aislar cada perfil nuclear, antes de la extracción y secuenciación del ADN.

Análisis de datos - herramientas bioinformáticas

GAMtools

GAMtools es una colección de utilidades de software para datos de mapeo de arquitectura genómica desarrollada por Robert Beagrie. [ 7 ] Se requiere Bowtie2 antes de ejecutar GAMtools. La entrada requerida para este programa está en formato Fastq . Este software tiene una variedad de funciones y los comandos exactos a usar dependerán de lo que se quiera hacer con él; sin embargo, la mayoría de las funciones requieren generar una tabla de segregación, por lo que para la mayoría de los usuarios los primeros pasos serán descargar o crear datos de entrada y realizar el mapeo de secuencias. Esto generará una tabla de segregación, que luego se puede usar para realizar varias otras operaciones que se describen a continuación. Para obtener más información, consulte la documentación de GAMtools. [ 8 ]

Diagrama de flujo
Diagrama de flujo

Mapeo de los datos de secuenciación

El comando process_nps de GAMtools permite realizar el mapeo. Este mapea los datos de secuencia sin procesar de los perfiles nucleares. GAMtools también ofrece la opción de realizar controles de calidad en los perfiles nucleares. Esta opción se habilita añadiendo el parámetro -c/--do-qc al comando anterior. Al habilitar el control de calidad, GAMtools intentará excluir los perfiles nucleares de baja calidad.

El comando gamtools process_nps de GAMtools se utiliza para mapear datos de secuencias sin procesar de perfiles nucleares (PN) y generar una tabla de segregación. El control de calidad se puede habilitar con la opción -c o --do-qc para excluir los PN de baja calidad.

El comando GAMtools para este paso es:

gamtools process_nps --do-qc -g <ARCHIVO_GENÓMICO> <ARCHIVO_FASTQ> [<ARCHIVO_FASTQ> ...] 

Tabla de segregación y llamadas de Windows

Tras el mapeo, GAMtools cuenta el número de lecturas de cada perfil nuclear que se solapan con las ventanas genómicas, utilizando un tamaño de ventana predeterminado de 50  kb. Este paso se realiza mediante el mismo comando process_nps y genera una tabla de segregación que indica la presencia o ausencia de cada ventana en todos los perfiles.

Generación de matrices de proximidad

El comando de GAMtools para este proceso es `matrix` . El archivo de entrada es la tabla de segregación calculada a partir del paso de llamada de ventanas. GAMtools calcula estas matrices utilizando el desequilibrio de ligamiento normalizado, lo que significa que analiza cuántas veces cada par de ventanas es detectado por el mismo NP y luego normaliza los resultados en función de cuántas veces cada ventana fue detectada por todos los NP. La siguiente figura muestra un ejemplo de un mapa de calor de matriz de proximidad generado con GAMtools.

El comando GAMtools para este paso es:

gamtools matrix [OPCIONES] -s <ARCHIVO_SEGREGACIÓN> -r <REGIÓN> [<REGIÓN> ...] 
Ejemplo de una matriz de proximidad generada con GAMtools.
Ejemplo de una matriz de proximidad generada con GAMtools.

Cálculo de la compactación de la cromatina

Cómo la compactación genómica y la posición radial afectan la frecuencia de detección

El comando compaction de GAMtools se puede usar para calcular una estimación de la compactación de la cromatina. La compactación es un valor asignado a un gen que representa su tamaño. El nivel de compactación es inversamente proporcional al volumen del locus. Se dice que los loci genómicos con un volumen bajo tienen un alto nivel de compactación, y los loci con un volumen alto tienen un bajo nivel de compactación. Como se muestra en la figura, se espera que los loci con un bajo nivel de compactación sean interceptados con mayor frecuencia por las secciones de criosección. GAMtools usa esta información para asignar un valor de compactación a cada locus en función de su frecuencia de detección en muchos perfiles nucleares. La tasa de compactación de estos loci no es estática y cambia continuamente a lo largo de la vida de la célula. Se cree que los loci genómicos se descompactan cuando ese gen está activo. Esto permite a un investigador hacer suposiciones sobre qué genes están activos actualmente en una célula, utilizando los resultados de los datos de GAMtools. También se cree que un locus con baja compactación está relacionado con la actividad transcripcional . La complejidad temporal del comando de compactación es O ( m × n ), donde m es el número de ventanas genómicas y n es el número de perfiles nucleares.

El comando GAMtools para este paso es:

compactación de gamtools [OPCIONES] -s <ARCHIVO_SEGREGACIÓN> -o <ARCHIVO_SALIDA> 

Cálculo de la posición radial

GAMtools se puede usar para calcular la posición radial de los NP. La posición radial de un NP es una medida de qué tan cerca o lejos está ese NP del ecuador o centro del núcleo. Los NP que están cerca del centro del núcleo se consideran ecuatoriales, mientras que los NP que están más cerca del borde del núcleo se consideran apicales. El comando de GAMtools para calcular la posición radial es radial_pos . Esto requiere que haya generado previamente una tabla de segregación. La posición radial se estima a partir del tamaño promedio de los NP que contienen una región de cromatina determinada. La cromatina que está más cerca de la periferia generalmente estará intersectada por NP más pequeños y apicales, mientras que la cromatina central estará intersectada por NP más grandes y ecuatoriales.

Para estimar el tamaño de cada NP, GAMtools analiza el número de ventanas que cada NP detectó, ya que se puede asumir que los NP que detectaron más ventanas tienen un mayor volumen. Esto es muy similar al método utilizado para estimar la compactación de la cromatina. La figura de la derecha ilustra cómo GAMtools analiza la tasa de detección de cada NP para estimar el volumen y determinar la compactación o la posición radial. Si observamos el primer NP, vemos que intersecta las tres ventanas, por lo que podemos estimar que es uno de los NP más grandes. El segundo NP intersecta dos de las tres ventanas, por lo que podemos estimar que es más pequeño que el primero. El tercer NP solo intersecta una de las tres ventanas, por lo que podemos estimar que es el NP más pequeño. Ahora que tenemos una estimación del tamaño de cada NP, podemos estimar la posición radial. Si asumimos que los núcleos pulposos (NP) más grandes son más ecuatoriales, entonces encontramos que el primer NP es el más ecuatorial, el segundo NP es el segundo más ecuatorial y el tercer NP es el más apical.

El comando GAMtools para este paso es:

gamtools radial_pos [OPCIONES] -s <ARCHIVO_SEGREGACIÓN> -o <ARCHIVO_SALIDA> 

Aquí hay un pseudocódigo que ilustra cómo se podría calcular la posición radial de una lista de sintagmas nominales:

// Supongamos que tenemos una matriz 2D llamada data donde las filas corresponden a los NP y las columnas corresponden a las ventanas, entonces si data[1][2] es 1, eso significa que el NP 1 contiene la ventana 2. // Utilice esta variable para llevar un registro del mayor número de ventanas detectadas por un único NP. VENTANA MÁXIMA = 0 // Usa este array para llevar un registro del número de ventanas detectadas por cada NP, para que podamos determinar posteriormente la posición radial. SEA RADIAL_POS = [] // Recorrer todos los NP PARA NP DESDE 1 HASTA NUM_NPS: DEJE QUE WINCOUNT = 0 // Contar el número de ventanas que vio cada NP PARA WIN DESDE 1 HASTA NUM_WINDOWS: SI ( datos[NP][WIN] == 1 ) CONTADOR DE VICTORIAS = CONTADOR DE VICTORIAS + 1 // Comprueba si el NP actual ha visto la mayor cantidad de ventanas SI WINCOUNT > MAXWINDOW: VENTANA MÁXIMA = NÚMERO DE VICTORIAS // Agrega el conteo para el NP actual al array RADIAL_POS.APPEND( WINCOUNT ) // Divide el número de ventanas que vio cada NP por el mayor número de ventanas que vio cualquier NP para obtener una estimación de la posición radial. PARA NP DESDE 1 HASTA NUM_NPS: RADIAL_POS[NP] = RADIAL_POS[NP] / MAXWINDOW 

Este pseudocódigo creará una lista de posiciones radiales que van de 0 a 1 que proporcionan una estimación de la posición radial, donde 1 es la más ecuatorial y 0 la más apical. La complejidad temporal de este pseudocódigo es O(n * m), donde n es el número de NP y m es el número de ventanas. El primer bucle for realiza n iteraciones y tiene un bucle for interno que realiza m iteraciones, lo que significa que la complejidad temporal de ese bucle for es O(n * m). El segundo bucle for tiene n iteraciones, por lo que tiene una complejidad temporal O(n). Por lo tanto, la complejidad temporal total de este código es O(n * m + n), que se puede reducir a O(n * m).

métodos de análisis de datos

Descripción general

Diagrama de flujo que muestra un proceso general de análisis de datos GAM. Los círculos representan un proceso y los cuadrados representan los datos.
Diagrama de flujo que muestra un proceso general de análisis de datos GAM. Los círculos representan un proceso y los cuadrados representan los datos.

El diagrama de flujo anterior muestra un proceso general para obtener datos a partir del análisis GAM. Los círculos representan los procesos que se pueden realizar y los cuadrados representan los datos.

El primer paso del análisis GAM consiste en la criosección y el examen de las células. Este proceso genera una colección de cortes nucleares (perfiles nucleares) que contienen fragmentos de ADN (ventanas genómicas). Estos perfiles nucleares se examinan para generar una tabla de segregación. Las tablas de segregación son la base del análisis GAM y contienen información detallada sobre los loci genómicos presentes en cada perfil nuclear.

Un ejemplo de análisis de datos no incluido a continuación sería la agrupación. Por ejemplo, los perfiles nucleares que contienen loci genómicos similares podrían agruparse mediante la agrupación k-means o alguna variación. K-means funcionaría bien para este problema en particular, ya que agruparía cada perfil nuclear según una medida de similitud , pero también tiene inconvenientes. La complejidad temporal de la agrupación k-means es O(tknd), donde t es el número de iteraciones, k es el número de medias, n es el número de puntos de datos y d es el número de dimensiones para cada punto de datos. Esta complejidad la convierte en un problema NP-difícil . [ 9 ] Por lo tanto, no se adapta bien a grandes conjuntos de datos y es más adecuada para subconjuntos de datos.

Para un análisis más detallado, se puede utilizar GAMtools. [ 7 ] GAMtools es un conjunto de herramientas de software que se pueden utilizar para extrapolar datos de la tabla de segregación, algunos de cuyos resultados se discutirán más adelante.

La cosegregación, o ligamiento, se puede determinar observando con qué frecuencia aparecen juntos dos loci genómicos en el mismo perfil nuclear. Estos datos pueden mostrar qué loci están físicamente cerca entre sí en el espacio tridimensional y qué loci interactúan regularmente entre sí, lo que puede ayudar a explicar la transcripción del ADN. [ 1 ]

SLICE es un método para predecir interacciones específicas entre loci genómicos. Utiliza datos estadísticos derivados de datos de cosegregación. [ 1 ]

Finalmente, el análisis de grafos puede aplicarse a la tabla de segregación para localizar comunidades. Las comunidades pueden definirse de diversas maneras, como por ejemplo mediante camarillas [ 10 ] , pero en este artículo, el análisis de comunidades se centrará en la centralidad . Las comunidades basadas en la centralidad pueden considerarse análogas a las celebridades y sus bases de fans en una red social. Los fans pueden no interactuar mucho entre sí, pero sí interactúan con la celebridad, que es el "centro".

Existen varios tipos de centralidad, entre los que se incluyen la centralidad de grado, la centralidad de vector propio y la centralidad de intermediación, que pueden dar lugar a la definición de distintas comunidades. Cabe destacar que, en nuestra analogía de red social anterior, la centralidad de vector propio puede no ser precisa, ya que una persona que sigue a muchas celebridades puede no tener ninguna influencia sobre ellas. En ese caso, el grafo podría considerarse dirigido. En el análisis GAM, generalmente se asume que el grafo no está dirigido, por lo que, si se utilizara la centralidad de vector propio, sería precisa. Tanto el cálculo de cliques como el de centralidad son computacionalmente complejos. Al igual que la agrupación mencionada anteriormente, no se adaptan bien a problemas de gran tamaño.

REBANADA

SLICE ( Inferencia Estadística de Cosegregación) desempeña un papel fundamental en el análisis de datos GAM. [ 1 ] Fue desarrollado en el laboratorio de Mario Nicodemi para proporcionar un modelo matemático que permita identificar las interacciones más específicas entre loci a partir de datos de cosegregación GAM. Estima la proporción de interacción específica para cada par de loci en un momento dado. Se trata de un método de verosimilitud. El primer paso de SLICE consiste en proporcionar una función de la proporción esperada de perfiles nucleares GAM. A continuación, se busca el mejor resultado de probabilidad para explicar los datos experimentales. [ 1 ]

Diagrama de flujo de SLICE
Diagrama de flujo de SLICE

Modelo de rebanadas

El modelo SLICE se basa en la hipótesis de que la probabilidad de que loci no interactuantes se encuentren dentro del mismo perfil nuclear es predecible. Esta probabilidad depende de la distancia entre dichos loci. El modelo SLICE considera un par de loci como de dos tipos: uno interactuante y otro no interactuante. De acuerdo con la hipótesis, las proporciones de los estados de los perfiles nucleares pueden predecirse mediante análisis matemático. Al derivar una función de la probabilidad de interacción, estos datos GAM también pueden utilizarse para identificar interacciones prominentes y explorar la sensibilidad del modelo GAM.

Calcular la distribución en un único perfil nuclear.

SLICE considera que un par de loci pueden interactuar o no interactuar en toda la población celular. El primer paso de este cálculo es describir un único locus. Un par de loci, A y B , pueden tener dos estados posibles: uno es que A y B no interactúen entre sí. El otro es que sí interactúen. El primer problema es si se puede encontrar un único locus en un perfil nuclear.

La expresión matemática es:

Probabilidad de un solo locus:v0,v1{\displaystyle v_{0},v_{1}} - <v1{\displaystyle v_{1}}> probabilidad de que el locus se encuentre en un perfil nuclear. - <v0{\displaystyle v_{0}}>=1{\displaystyle =1-}<v1{\displaystyle v_{1}}> probabilidad de que el locus no se encuentre en un perfil nuclear. - <v1{\displaystyle v_{1}}>=VnortePAG/Vnortedolmis{\displaystyle V_{NP}/V_{núcleo}}

Estimación del radio nuclear promedio

Como se muestra en la ecuación anterior, el volumen del núcleo es un valor necesario para el cálculo. Los radios de estos perfiles nucleares se pueden usar para estimar el radio nuclear. La predicción de SLICE para el radio coincide con las simulaciones de Monte Carlo (se actualizará más información sobre este paso una vez que se obtenga la licencia de la figura en el artículo del autor original). Con el resultado del radio estimado, se puede estimar la probabilidad de que dos loci se encuentren en un estado no interactivo y la probabilidad de que estos dos loci se encuentren en un estado interactivo.

Aquí está la expresión matemática de no interacción:

<i{\displaystyle u_{i}}>,i = 0, 1, 2 representa: encontrar 0, 1 o 2 loci de un par de loci que no interactúan. Dos loci en un estado que no interactúa:i{\displaystyle u_{i}}<0>=<v02>,<1>=<v1v0>,<2>=<v12>{\displaystyle <u_{0}>=<v_{0}^{2}>,<u_{1}>=<v_{1}v_{0}>,<u_{2}>=<v_{1}^{2}>} Aquí está la expresión matemática de la interacción: Estimación del estado de interacción de dos loci:ti{\displaystyle t_{i}}probabilidad <t2>{\displaystyle <t_{2}>}~<v1>{\displaystyle <v_{1}>},<t1>{\displaystyle <t_{1}>}~0,<t0>{\displaystyle <t_{0}>}~<v0>=1<v1>{\displaystyle <v_{0}>=1-<v_{1}>}

Calcular la probabilidad de pares de loci en un perfil nuclear único.

Con los resultados de procesos anteriores, la probabilidad de ocurrencia de un par de loci en un perfil nuclear se puede calcular mediante un método estadístico. Un par de loci puede existir en tres estados diferentes. Cada uno de ellos tiene una probabilidad dePAGi,i=0,1,2{\displaystyle P_{i},i=0,1,2} Probabilidad de ocurrencia de pares de loci en perfiles nucleares individuales:PAG2,PAG1,PAG0{\ Displaystyle P_ {2}, P_ {1}, P_ {0}}PAG2{\displaystyle P_{2}}: probabilidad de que dos pares de loci estén en estado de interacción; PAG1{\displaystyle P_{1}}: probabilidad de que uno interactúe con el otro, pero el otro no interactúe; PAG0{\displaystyle P_{0}}: probabilidad de que los dos no interactúen. Análisis estadístico SLICE norte0,0/norte=<t02>PAG2+<t00>PAG1+<02>PAG0{\displaystyle N_{0,0}/N=<t_{0}^{2}>P_{2}+<t_{0}u_{0}>P_{1}+<u_{0}^{2}>P_{0}}norte2,0/norte=norte0,2=<t12>PAG2+<t11>PAG1+<12>PAG0{\displaystyle N_{2,0}/N=N_{0,2}=<t_{1}^{2}>P_{2}+<t_{1}u_{1}>P_{1}+<u_{1}^{2}>P_{0}}nortei,j{\displaystyle N_{i,j}}Representación: el número i corresponde a A. El número j corresponde a B. (i y j son iguales a 0, 1 o 2 loci).

Eficiencia de detección

En el mapeo de la arquitectura del genoma (GAM), la eficiencia de detección se refiere a la probabilidad de que un locus genómico se observe dentro de un perfil nuclear (PN). Esta probabilidad depende de varios factores, incluyendo la geometría del núcleo y el grado de compactación de la cromatina. Las regiones genómicas ubicadas cerca de la periferia nuclear o altamente condensadas tienen menos probabilidades de ser interceptadas por las secciones orientadas aleatoriamente utilizadas en GAM. Por el contrario, los loci que se encuentran en una posición más central o en un estado descondensado se detectan con mayor facilidad. Dado que no todos los loci presentes en una sección nuclear se observan de forma fiable, el modelo SLICE (Inferencia Estadística de Cosegregación) incorpora la eficiencia de detección para tener en cuenta limitaciones como el seccionamiento incompleto o la pérdida de ADN. Esto ayuda a distinguir entre la ausencia real de una señal y la imposibilidad de detectarla.

Diagrama de flujo que ilustra la implementación de la eficiencia de detección en el mapeo de la arquitectura del genoma (GAM).

Para evaluar la eficiencia de detección, investigadores que estudian células madre embrionarias de ratón (mESC) generaron mapas de contacto de todo el genoma a partir de más de 400 perfiles nucleares de alta calidad. Estos estudios examinaron la detección en varias resoluciones, como 30 kb, y encontraron que se requerían aproximadamente 400 000 lecturas mapeadas únicas por NP para detectar más del 80 % de las ventanas positivas. En promedio, cada NP capturó alrededor del 6 al 4 % del genoma, lo que concuerda con las expectativas basadas en el volumen nuclear. La validación con FISH ( hibridación in situ con fluorescencia ) confirmó que se podían detectar eficazmente regiones tan pequeñas como 40 kb. Para mejorar la precisión, se aplicó una normalización estadística para reducir los sesgos causados ​​por factores como el contenido de GC, la mapeabilidad y la variabilidad en las tasas de detección, produciendo matrices GAM con menos artefactos que los datos Hi-C tradicionales.

Para determinar qué ventanas genómicas representan realmente señales, se agregaron lecturas de secuenciación en ventanas con tamaños que oscilaban entre 10 kb y 1 Mb. Posteriormente, los investigadores modelaron el número de lecturas por NP utilizando una combinación de distribuciones binomial negativa y lognormal. Con base en este modelo, se estableció un umbral para cada NP: las ventanas se etiquetaron como positivas si el número de lecturas mapeadas superaba significativamente lo esperado debido únicamente al ruido de secuenciación. Esta combinación de rigor estadístico y corrección de la eficiencia de detección dentro del marco SLICE proporciona interpretaciones más precisas y biológicamente significativas de los datos GAM.

La figura 3 de la publicación original ilustra este modelo de eficiencia de detección y frecuencia de cosegregación entre ventanas genómicas. [ 11 ]

Estimación de las probabilidades de interacción entre pares

Basándose en la eficiencia de detección y las probabilidades definidas previamente0{\displaystyle u_{0}},1{\displaystyle u_{1}}, y2{\displaystyle u_{2}}SLICE estima la probabilidad de que un par de loci genómicos interactúen. Estos valores representan las probabilidades de detectar cero, uno o ambos loci en un perfil nuclear cuando los loci no interactúan: [ 1 ]

0=v02{\displaystyle u_{0}=v_{0}^{2}}: probabilidad de que no se detecte ninguno de los loci

1=2v1v0{\ Displaystyle u_ {1} = 2v_ {1} v_ {0}}: probabilidad de que se detecte solo un locus

2=v12{\ Displaystyle u_ {2} = v_ {1} ^ {2}}: probabilidad de que se detecten ambos loci

Al comparar estas probabilidades esperadas bajo el modelo sin interacción con los datos de cosegregación observados, SLICE infiere la probabilidad de interacción de cada par de loci. La inferencia estadística tiene en cuenta la eficiencia de detección y permite a los investigadores distinguir los contactos de cromatina reales de las codetecciones coincidentes debidas al corte nuclear.

Cosegregación y ligamiento normalizado

Al mapear un genoma, se puede observar la cosegregación entre diferentes ventanas genómicas y perfiles nucleares (PN) del genoma. Al tomar cortes y muestras de tejidos, se obtienen perfiles nucleares y se definen los rangos de ventanas presentes en el genoma. La cosegregación, en este caso, consiste en identificar el ligamiento entre ventanas específicas del genoma, así como el desequilibrio de ligamiento y el desequilibrio de ligamiento normalizado. Uno de los pasos para calcular la cosegregación y el ligamiento es determinar la frecuencia de detección de cada ventana. La frecuencia de detección se calcula dividiendo el número de PN presentes en la ventana específica entre el número total de PN. Cada uno de los valores calculados identifica diferencias y estadísticas importantes para el análisis del genoma. El desequilibrio de ligamiento normalizado es el cálculo final que determina el ligamiento real entre las ventanas genómicas. Una vez calculados todos los valores, cada resultado se utiliza para calcular el equilibrio de ligamiento normalizado para cada ventana específica del genoma. El valor de ligamiento normalizado puede estar entre 1,0 y -1,0, donde 1,0 indica un alto ligamiento entre las dos regiones y valores inferiores a 1,0 indican un menor ligamiento. La combinación de los valores de ligamiento normalizado de cada ventana en un gráfico o matriz permite mapear y analizar el genoma mediante un mapa de calor u otro tipo de gráfico. Los valores de cosegregación y ligamiento normalizado también pueden utilizarse para cálculos y análisis adicionales, como la centralidad y la detección de comunidades, que se abordan en la siguiente sección.

Para encontrar la cosegregación y las vinculaciones de las ventanas, se deben realizar los siguientes cálculos: frecuencia de detección, cosegregación, vinculación y vinculación normalizada.

Cálculo de vínculos y frecuencias

Cada paso del cálculo descrito anteriormente se muestra y explica en la tabla siguiente.

Visualización del enlace normalizado

Una vez completados los pasos de cálculo anteriores, los valores de ligamiento normalizados se organizan en una matriz simétrica . Para un conjunto específico de 81 ventanas genómicas, esto da como resultado una matriz de 81 x 81. Esta dimensión surge porque cada ventana se compara consigo misma y con todas las demás para calcular el conjunto completo de valores de ligamiento normalizados. A medida que se calcula el ligamiento de cada par, el valor se inserta en su fila y columna correspondientes. Por ejemplo, el valor de ligamiento entre la primera y la segunda ventana se coloca en la intersección de la primera columna y la segunda fila, así como de la segunda columna y la primera fila. Para facilitar la interpretación, esta matriz se suele visualizar como un mapa de calor bidimensional , como se muestra a continuación.

Visualización mediante mapa de calor de una matriz de ligamiento normalizada simétrica. El eje diagonal (rojo oscuro) representa el auto-ligamiento de las ventanas genómicas con la mayor intensidad, mientras que las áreas fuera de la diagonal ilustran la fuerza de la cosegregación y la proximidad física entre diferentes ventanas. Las bandas blancas en blanco indican regiones donde los datos fueron filtrados o no se pudieron mapear.

Al analizar el mapa de calor generado , la intensidad del color de cada bloque indica la fuerza del enlace. En el ejemplo del mapa de calor , la leyenda muestra que el valor máximo de enlace de 1,0 corresponde al rojo oscuro. Estos valores más altos aparecen prominentemente a lo largo de la línea diagonal, lo que representa la autointeracción donde cada ventana genómica se compara consigo misma. Las entradas fuera de la diagonal , que transitan del amarillo claro (que indica un bajo enlace) a tonos más oscuros de naranja y rojo, ilustran la probabilidad de cosegregación y proximidad física entre ventanas distintas. [ 13 ] Además, las bandas claras en blanco que se cruzan cerca del centro del mapa (alrededor de la ventana 44) indican regiones donde los datos fueron filtrados o no se pudieron mapear. Visualizar la matriz de enlace normalizada como un mapa de calor proporciona una base clara para analizar los contactos cromosómicos , lo que permite utilizar los datos para un modelado arquitectónico 3D más avanzado. [ 14 ]

Enfoque de análisis gráfico

El análisis de grafos puede utilizarse para identificar subconjuntos relacionados, o "comunidades", de ventanas genómicas después de que las relaciones por pares se hayan resumido en una matriz de vinculación normalizada.

Construcción de un gráfico a partir de datos de enlace normalizados

Una vez que las relaciones entre pares de ventanas genómicas se han resumido en una matriz de enlace normalizada, esta se puede convertir en una representación gráfica. Cada ventana genómica se trata como un nodo, y se añade una arista no dirigida entre dos ventanas cuando su enlace normalizado supera un umbral predefinido.

Ejemplo de construcción de un grafo a partir de datos de ligamiento normalizados. Cada ventana genómica se representa como un nodo, y se añade una arista no dirigida cuando el ligamiento normalizado entre dos ventanas supera un umbral predefinido. Las entradas diagonales se establecen en 0, ya que se excluyen las aristas propias.

En el ejemplo que se muestra aquí, este umbral se establece en el tercer cuartil (Q3) de los valores de enlace normalizados. Dado que una ventana genómica no está conectada consigo misma, las entradas diagonales se establecen en 0. Por lo tanto, la matriz de adyacencia resultante es simétrica, lo que concuerda con un grafo no dirigido. Esta representación gráfica puede utilizarse posteriormente para análisis como la medición de la centralidad y la detección de comunidades.

Evaluar la centralidad de las ventanas

Una vez establecida la matriz de adyacencia, las ventanas pueden evaluarse utilizando diversas medidas de centralidad . Las diferentes medidas de centralidad que pueden utilizarse para interpretar la matriz son la centralidad de intermediación , la centralidad de cercanía , la centralidad de vector propio y la centralidad de grado . Cada una de estas medidas puede resaltar diferentes áreas de la red y diferentes funciones estructurales de las ventanas genómicas dentro de ella. [ 15 ]

La centralidad de intermediación se calcula considerando las rutas más cortas entre pares de nodos y determinando cuántas de estas rutas pasan por el nodo observado, excluyendo los casos en los que este es un nodo final. Esta medida puede ayudar a identificar nodos que conectan diferentes partes de una red. [ 16 ]

La centralidad de cercanía se calcula sumando todos los nodos de una red menos uno y dividiendo ese número por la suma de las distancias más cortas a cada uno de los nodos del grafo. Se basa en las distancias de ruta más corta desde un nodo a todos los demás nodos de la red y puede ayudar a identificar los nodos que, en promedio, están más cerca del resto del grafo. Véase la Figura 1 adjunta para un ejemplo. [ 17 ] [ 18 ]

Figura 1. El número junto a cada nodo indica la distancia de su camino más corto hasta el nodo cuadrado rojo. Las aristas verdes muestran uno de los dos caminos más cortos entre el nodo circular rojo y el nodo cuadrado rojo. Para el nodo cuadrado rojo, la suma de las distancias de sus caminos más cortos a los otros cinco nodos es 1+1+1+2+2=7, por lo que su centralidad de cercanía es 5/7.

La centralidad de vector propio mide no solo cuántas conexiones tiene un nodo, sino también si está conectado a otros nodos altamente conectados. De esta manera, puede ayudar a identificar nodos que se encuentran en partes más influyentes o altamente interconectadas de la red. [ 19 ] [ 20 ]

La centralidad de grado se calcula dividiendo el número de aristas conectadas a un nodo entre el número total de nodos menos uno:

doD(i)=j=1norteaijnorte1{\displaystyle C_{D}(i)={\frac {\sum _{j=1}^{n}a_{ij}}{n-1}}}

dóndeaij{\displaystyle a_{ij}}representa si el nodoi{\displaystyle i}está conectado al nodoj{\displaystyle j}en la matriz de adyacencia ynorte{\displaystyle n}es el número total de nodos en el grafo. El numerador cuenta el número total de conexiones del nodo.i{\displaystyle i}y el denominador escala el valor por el número máximo posible de vecinos. Véase la Figura 2 adjunta para un ejemplo de este cálculo. [ 21 ]

Figura 2. Ejemplo de cálculo de la centralidad de grado a partir de un grafo simple y su matriz de adyacencia.

La centralidad de un nodo puede ser un buen indicador de su potencial para influir en el conjunto de datos, en función de su posición y conexiones dentro de la red.

detección de comunidades

Una vez calculados los valores de centralidad, es posible inferir subconjuntos relacionados de los datos. Estos subconjuntos relacionados se denominan "comunidades": grupos de nodos que están más estrechamente vinculados entre sí que con el resto de la red. [ 22 ] Si bien la detección de comunidades se utiliza comúnmente en el análisis de redes sociales y el mapeo de conexiones sociales, [ 23 ] también puede aplicarse a problemas como las interacciones genómicas.

Un método relativamente sencillo basado en grafos para aproximar comunidades consiste en identificar varios nodos significativos mediante medidas de centralidad, como la centralidad de grado, y luego construir comunidades a su alrededor. En un análisis sencillo basado en grafos de la red de interacción de Hist1, los cinco nodos con la mayor centralidad de grado se trataron como centros, y cada comunidad se definió como un centro junto con sus vecinos conectados directamente. Si un nodo estaba conectado a más de un centro, se le asignaba a la comunidad del centro con el que tenía el vínculo normalizado más fuerte. Este tipo de aproximación puede ayudar a identificar grupos de ventanas genómicas con patrones de interacción local relativamente fuertes y puede resaltar posibles interacciones de cromatina u otras relaciones que merecen un estudio más profundo.

Ejemplo de un subgrafo comunitario identificado alrededor de una ventana central en la red de interacción Hist1. El tamaño y el color de los nodos reflejan la centralidad de grado dentro de la red general, y las aristas representan las interacciones entre las ventanas asignadas a la comunidad.

Las comunidades resultantes pueden visualizarse como subgrafos centrados en ventanas centrales o como patrones locales en un mapa de calor de adyacencia. La vista de subgrafos resalta la estructura de nodos centrales y vecinos de la comunidad, mientras que la vista de mapa de calor muestra la misma comunidad en forma de matriz y destaca qué ventanas genómicas están conectadas dentro de la subred seleccionada.

Mapa de calor de adyacencia para la misma comunidad de ejemplo. Las celdas coloreadas indican las aristas entre las ventanas genómicas asignadas a la comunidad, mostrando el patrón de interacción local en forma de matriz.

Ventajas

En comparación con los métodos basados ​​en la captura de la conformación cromosómica (3C), como Hi-C, el mapeo de la arquitectura del genoma (GAM) ofrece varias ventajas: [ 24 ] [ 25 ]

Comparación de GAM, SPRITE y Hi-C en múltiples categorías
  • GAM permite la detección de interacciones de cromatina de orden superior, ya que no depende de la ligación por proximidad entre fragmentos de ADN. En cambio, los métodos basados ​​en 3C, como Hi-C, capturan principalmente contactos por pares, mientras que GAM puede inferir interacciones múltiples (por ejemplo, tripletes o asociaciones de orden superior) a partir de patrones de cosegregación en perfiles nucleares.
  • A diferencia de los métodos basados ​​en 3C, GAM es un método sin ligación, ya que no requiere digestión con enzimas de restricción ni ligación por proximidad. En cambio, se basa en la criosección de núcleos individuales seguida de la secuenciación de cortes nucleares, lo que reduce los sesgos asociados con la fragmentación enzimática y la eficiencia de la ligación.
  • GAM también puede aplicarse a un número reducido de células, lo que la hace idónea para condiciones experimentales donde el material biológico es limitado. Esto contrasta con algunos protocolos Hi-C, que generalmente requieren grandes poblaciones celulares para generar mapas de contacto de alta resolución.

Desventajas

A pesar de su capacidad para detectar interacciones de cromatina de orden superior, el mapeo de la arquitectura del genoma (GAM) tiene varias limitaciones en comparación con los enfoques basados ​​en la captura de la conformación cromosómica (3C), como Hi-C. [ 26 ] [ 27 ]

  • GAM es un método de menor rendimiento, ya que se basa en la secuenciación de ADN a partir de finas criosecciones de núcleos individuales, conocidas como perfiles nucleares. Cada perfil captura solo un subconjunto del genoma, lo que requiere un gran número de perfiles para reconstruir las probabilidades de contacto en todo el genoma. En comparación, Hi-C produce mapas de contacto densos en todo el genoma a partir de poblaciones celulares en masa en un solo experimento.
  • Además, GAM se basa en inferencias estadísticas en lugar de recuentos directos de ligación. Las probabilidades de contacto se estiman a partir de la cosegregación de loci genómicos en múltiples segmentos nucleares, y se requieren modelos computacionales como SLICE para reconstruir las frecuencias de interacción.
  • Finalmente, GAM tiene una escalabilidad y adopción limitadas en comparación con Hi-C. Se utiliza menos, tiene menos protocolos experimentales y computacionales estandarizados y carece de conjuntos de datos de referencia a gran escala, lo que puede reducir la reproducibilidad y complicar las comparaciones entre estudios.

Referencias

  1. 1 2 3 4 5 6 7 Beagrie RA, Scialdone A, Schueler M, Kraemer DC, Chotalia M, Xie SQ, Barbieri M, de Santiago I, Lavitas LM, Branco MR, Fraser J, Dostie J, Game L, Dillon N, Edwards PA, Nicodemi M, Pombo A (marzo de 2017). "Contactos complejos de múltiples potenciadores capturados por el mapeo de la arquitectura del genoma (GAM)" . Nature . 543 ( 7646): 519– 524. doi : 10.1038/nature21411 . PMC 5366070. PMID 28273065 .  
  2. "Proyecto genoma 4D" (PDF) .
  3. «Heming Xu 2025» .
  4. O'Sullivan, J. M; Hendy, M. D; Pichugina, T; Wake, G. C; Langowski, J (2013). " La mecánica estadística de la captura de la conformación cromosómica" . Nucleus . 4 (5): 390– 8. doi : 10.4161/nucl.26513 . PMC 3899129. PMID 24051548 .  
  5. Beagrie RA, Scialdone A, Schueler M, Kraemer DC, Chotalia M, Xie SQ, Barbieri M, de Santiago I, Lavitas LM, Branco MR, Fraser J, Dostie J, Game L, Dillon N, Edwards PA, Nicodemi M, Pombo A. Contactos complejos de múltiples potenciadores capturados mediante el mapeo de la arquitectura del genoma. Nature. 23 de marzo de 2017;543(7646):519-524.
  6. Pombo, Ana (2007). "Avances en la obtención de imágenes del núcleo en interfase mediante criosecciones finas". Histochemistry and Cell Biology . 128 (2): 97– 104. doi : 10.1007/s00418-007-0310-x . PMID 17636315. S2CID 7934012 .  
  7. 1 2 Beagrie, Robert. "GAMtools" . GAMtools . Consultado el 19 de abril de 2022 .
  8. Beagrie, Robert. "Documentación de GAMtools" . Documentación de GAMtools . Consultado el 19 de abril de 2022 .
  9. Dasgupta, Sanjoy. La dificultad del agrupamiento k-means (Informe n.° CS2008-0916). Recuperado de https://cseweb.ucsd.edu/~dasgupta/papers/kmeans.pdf
  10. Fortunato, Santo; Hric, Darko (noviembre de 2016). "Detección de comunidades en redes: una guía de usuario" . Informes de Física . 659 : 1– 44. arXiv : 1608.00163 . doi : 10.1016/j.physrep.2016.09.002 .
  11. Beagrie, Robert A; Scialdone, Antonio (29 de marzo de 2017). "Contactos complejos de múltiples potenciadores capturados por el mapeo de la arquitectura del genoma" . Nature . 543 (7646): 519– 524. doi : 10.1038/nature21411 . PMC 5366070. PMID 28358020 .  
  12. ^ Beagrie, Robert A.; Scialdone, Antonio; Schueler, Markus; Kraemer, Dorothee CA; Chotalia, Mita; Xie, Sheila Q.; Barbieri, Mariano; de Santiago, Inés; Lavitas, Liron-Mark; Branco, Miguel R.; Fraser, James (23 de marzo de 2017). "Contactos complejos de múltiples potenciadores capturados por Genome Architecture Mapping (GAM)" . Naturaleza . 543 (7646): 519– 524. doi : 10.1038/naturaleza21411 . ISSN 0028-0836 . PMC 5366070 . PMID 28273065 .   
  13. Liu, T., & Wang, Z. (2019). normGAM: un paquete de R para eliminar sesgos sistemáticos en datos de mapeo de arquitectura genómica. BMC Genomics , 20. https://doi.org/10.1186/s12864-019-6331-8
  14. Liu, L., Cao, X., Zhang, B., & Hyeon, C. (2022). Análisis de la probabilidad de cosegregación a partir del mapeo de la arquitectura del genoma. Biophysical Journal , 121(20), 3774–3784. https://doi.org/10.1016/j.bpj.2022.09.018
  15. Newman, Mark (2018). Redes (2.ª ed.). Oxford University Press. pp. 158–159 . doi : 10.1093/oso/9780198805090.001.0001 .  
  16. Newman, Mark (2018). Redes (2.ª ed.). Oxford University Press. pp. 173–177 . doi : 10.1093/oso/9780198805090.001.0001 .  
  17. Newman, Mark (2018). Redes (2.ª ed.). Oxford University Press. págs. 170–172 . doi : 10.1093/oso/9780198805090.001.0001 .  
  18. Hansen, Derek; Shneiderman, Ben; Smith, Marc (2011). Análisis de redes sociales con NodeXL . págs. 69–78 . doi : 10.1016/B978-0-12-382229-1.00005-9 . ISBN  978-0-12-382229-1.
  19. Newman, Mark (2018). Redes (2.ª ed.). Oxford University Press. págs. 159–163 . doi : 10.1093/oso/9780198805090.001.0001 .  
  20. Meghanathan, Natarajan (2 de junio de 2020). 2 3 Centralidad de vector propio .
  21. Newman, Mark (2018). Redes (2.ª ed.). Oxford University Press. p. 159. doi : 10.1093/oso/9780198805090.001.0001 .  
  22. Girvan, Michelle; Newman, MEJ (2002). " Estructura comunitaria en redes sociales y biológicas" . Actas de la Academia Nacional de Ciencias . 99 (12): 7821– 7826. doi : 10.1073/pnas.122653799 . PMC 122977. PMID 12060727 .  
  23. Grandjean, Martin (2016). "Análisis de redes sociales de Twitter: mapeando la comunidad de humanidades digitales". Cogent Arts & Humanities . 3 (1) 1171458. doi : 10.1080/23311983.2016.1171458 . S2CID 114999767 . 
  24. Beagrie, RA; Scialdone, A.; Schueler, M. (2017). "Contactos complejos de múltiples potenciadores capturados mediante el mapeo de la arquitectura del genoma" . Nature . 543 : 519–524 . doi : 10.1038/nature21411 . PMC 5366070 . 
  25. Kempfer, R.; Pombo, A. (2021). "Métodos para mapear la arquitectura del genoma 3D (comparación de GAM, Hi-C, SPRITE)" . Nature Methods . doi : 10.1038/s41592-021-01135-1 . PMC 8416658 . 
  26. Beagrie, RA; Scialdone, A.; Schueler, M. (2017). "Contactos complejos de múltiples potenciadores capturados mediante el mapeo de la arquitectura del genoma" . Nature . 543 : 519–524 . doi : 10.1038/nature21411 . PMC 5366070 . 
  27. Kempfer, R.; Pombo, A. (2021). "Métodos para mapear la arquitectura del genoma 3D (comparación de GAM, Hi-C, SPRITE)" . Nature Methods . doi : 10.1038/s41592-021-01135-1 . PMC 8416658 .