Articulo de referencia

Algoritmo de eliminación de ruido basado en la topología de red de relevancia

El algoritmo de eliminación de ruido basado en la topología de red de relevancia (DART) es un algoritmo no supervisado que estima una puntuación de actividad para una vía en una...

El algoritmo de eliminación de ruido basado en la topología de red de relevancia (DART) es un algoritmo no supervisado que estima una puntuación de actividad para una vía en una matriz de expresión génica, tras un paso de eliminación de ruido. [ 1 ] En DART, se utiliza un promedio ponderado donde los pesos reflejan el grado de los nodos en la red podada. [ 1 ] El paso de eliminación de ruido elimina la información previa que es inconsistente con un conjunto de datos. Esta estrategia mejora sustancialmente las predicciones no supervisadas de la actividad de la vía que se basan en un modelo previo, que fue aprendido de un sistema o contexto biológico diferente. [ 1 ]

Métodos preexistentes como el método de análisis de enriquecimiento de conjuntos de genes intentan inferir. [ 2 ] Sin embargo, no construyen una lista estructurada de genes. SPIA (Análisis de impacto de vías de señalización) [ 3 ] es un método que utiliza la información del fenotipo para evaluar la actividad de la vía entre dos fenotipos. Sin embargo, no identifica el subconjunto de genes de la vía que podría usarse para diferenciar muestras individuales. [ 3 ] CORG se utiliza para identificar un subconjunto de genes relevante. Es un método supervisado, que no se desempeña tan bien como DART en el análisis de conjuntos de datos independientes [ 1 ]

Comprender la actividad de las vías moleculares es crucial para la evaluación de riesgos, el diagnóstico clínico y el tratamiento. El metaanálisis de datos genómicos complejos suele presentar dificultades, como la extracción de información útil de grandes conjuntos de datos, la eliminación de factores de confusión y la obtención de una interpretación más precisa. Se han adoptado diferentes enfoques para identificar las vías relevantes y así mejorar la predicción de la expresión génica .

Método

Estrategia

  1. Construye una red de todos los genes que están involucrados en la vía
  2. Evaluar la coherencia de la información regulatoria previa.
  3. Eliminar información previa inconsistente: el paso de eliminación de ruido.
  4. Estimar la actividad de la vía

Primero se calcularon las correlaciones de Pearson entre los genes reguladores a nivel de transcripción y un conjunto de datos de expresión génica. Luego, el coeficiente de correlación se sometió a una transformación de Fisher :

γij=12registro1+doij1doij{\displaystyle \gamma _{ij}={\frac {1}{2}}\log {\frac {1+c_{ij}}{1-c_{ij}}}}

Donde c ij es el coeficiente de correlación entre los genes i y j, y donde γ ij es la variable que, bajo la hipótesis nula, tiene una media de cero y una desviación estándar de 1/ n_s-3 , donde ns es el número de muestras tumorales. El umbral del valor p se estableció en 0,0001. Los pares de genes con correlación significativa se considerarán relevantes en la red. Para predecir la puntuación de actividad, también se tienen en cuenta los genes cercanos:

SWAV=1inorteki2inorteσikiZi{\displaystyle {\vec {S}}_{W\;AV}={\frac {1}{\sqrt {\sum _{i\in N}k_{i}^{2}}}}\sum _{i\in N}\sigma _{i}k_{i}{\vec {Z}}_{i}}

Donde ki es el número de vecinos del gen i, zi es la puntuación z normalizada y σi es una variable binaria (es decir, 1 significa regulación positiva tras la activación y -1 significa regulación negativa). Este paso consiste en estimar el nivel de activación, en el que sw AV es la puntuación de actividad. A continuación, se aplicó un modelo de regresión lineal para estimar los niveles de activación de la vía. Así, tij y pij denotan los estadísticos t y el valor p asociados, mientras que p<0,05 indica significancia. Para evaluar la consistencia en un conjunto de datos de validación D, la medida de rendimiento Vij se denota como:

Vij=dDσij(d)|tij(d)|S(pagijd){\displaystyle V_{ij}=\sum _{d\in D}\sigma _{ij}^{(d)}\left|t_{ij}^{(d)}\right|S\left(p_{ij}^{d}\right)}

Donde S se define por

S(pagij)={1pagij0,050pagij>0,05{\displaystyle S(p_{ij})={\begin{cases}1&p_{ij}\leq 0.05\\0&p_{ij}>0.05\end{cases}}} S es la función umbral de un par de vías dado. Y donde

σij(d)={1sigramonorte(tij(trainorte))=sigramonorte(tij(d)),dD1sigramonorte(tij(trainorte))=sigramonorte(tij(d)),dD{\displaystyle \sigma _{ij}^{(d)}={\begin{cases}1&\mathrm {sign} \left(t_{ij}^{(train)}\right)=\mathrm {sign} \left(t_{ij}^{(d)}\right),\;d\in D\\-1&\mathrm {sign} \left(t_{ij}^{(train)}\right)=-\mathrm {sign} \left(t_{ij}^{(d)}\right),\;d\in D\end{cases}}}

σ ij es la puntuación que indica la direccionalidad de una correlación, en la que una predicción opuesta se panelizará asignándole un valor de -1. t ij es el estadístico t de la correlación entre vías. La medida de rendimiento Vij tiene en cuenta la significancia de la correlación entre vías, la dirección de la correlación y los pesos en la magnitud de la correlación. Se realiza una prueba de Wilcoxon pareada de dos colas para comparar la distribución bajo la hipótesis. Ventajas y limitaciones: DART proporciona un rendimiento mejorado y una mayor precisión en la inferencia de la actividad de la vía a partir de información previa de bases de datos de vías. Se necesita información preexistente y una base de datos grande para que DART se ejecute. En otras palabras, DART requiere datos de expresión génica previos bien establecidos para comenzar, y luego puede proceder a la evaluación de la consistencia y eliminar el ruido de cualquier información irrelevante.

Solicitud

DART es un algoritmo aplicable y utilizado con éxito en la genómica del cáncer. Se ha demostrado que el algoritmo DART es un método robusto para estimar la actividad de la vía y la actividad de la firma de perturbación en conjuntos de datos de expresión génica de cáncer de mama y pulmón. [ 1 ] Las características de imagen como la mamografía (la mamografía es el proceso de usar rayos X de baja energía para examinar el tejido mamario humano) juegan un papel importante en el diagnóstico de tumores cancerosos. Los estudios han demostrado que las mujeres con mayor densidad mamográfica tienen un mayor riesgo de desarrollar cáncer de mama . [ 4 ] El gen del receptor de estrógeno alfa 1 codifica el receptor de estrógeno alfa, que es activado por el estrógeno. Los polimorfismos en ESR1 están asociados con el riesgo de cáncer de mama a través de diferencias en diferentes niveles de densidad mamaria. DART predijo con éxito una correlación inversa entre la señalización de ESR1 y MMD. Puede utilizarse en datos genómicos multidimensionales de cáncer simulados y reales. Proporciona una predicción más fiable sobre la activación de la vía, lo que sería útil en estudios de asociación.

Referencias

  1. 1 2 3 4 5 Jiao, yan; Katherine Lawler (19 de octubre de 2011). "DART: Algoritmo de eliminación de ruido basado en la topología de red de relevancia mejora la inferencia de la actividad de la vía molecular" . BMC Bioinformatics . 12 : 403. doi : 10.1186/1471-2105-12-403 . PMC 3228554. PMID 22011170 .  
  2. Subramanian, Tamayo; Mukherjee, Ebert BL (30 de septiembre de 2005). "Análisis de enriquecimiento de conjuntos de genes: un enfoque basado en el conocimiento para interpretar perfiles de expresión genómica" . PNAS . 102 ( 43): 15545–50 . doi : 10.1073/pnas.0506580102 . PMC 1239896. PMID 16199517 .  
  3. 1 2 Tarca AL, Draghici; Khatri P; Hassan SS (2009). "Análisis del impacto de una nueva vía de señalización" . Bioinformatics . 25 (1): 75– 82. doi : 10.1093/bioinformatics/btn577 . PMC 2732297. PMID 18990722 .  
  4. Li J, Eriksson L; Humphreys K; Czene K (2010). "Variación genética en la vía metabólica de los estrógenos y densidad mamográfica como fenotipo intermedio del cáncer de mama" . Breast Cancer Res . 12 (2): R19. doi : 10.1186/bcr2488 . PMC 2879563. PMID 20214802 .