Articulo de referencia

GENSCAN

En bioinformática , GENSCAN es un programa para identificar estructuras genéticas completas en el ADN genómico . Es un programa basado en G HMM que puede utilizarse para predeci...

En bioinformática , GENSCAN es un programa para identificar estructuras genéticas completas en el ADN genómico . Es un programa basado en G HMM que puede utilizarse para predecir la ubicación de los genes y sus límites exón - intrón en secuencias genómicas de diversos organismos. El servidor web de GENSCAN se encuentra en el MIT . [ 1 ]

GENSCAN fue desarrollado por Christopher Burge en el grupo de investigación de Samuel Karlin en la Universidad de Stanford . [ 2 ] [ 3 ] [ 4 ]

Historia

En 2001, el mundo de la predicción de genes humanos entró en la genómica comparativa . Esto dio como resultado el desarrollo de un programa llamado TWINSCAN como una adaptación de GENSCAN con mayor precisión. Otros programas como N-SCAN se desarrollaron posteriormente mediante la adaptación del modelo GHMM. [ 5 ]

En 2002, GENSCAN seguía siendo una herramienta popular en bioinformática, convirtiéndose en una característica estándar para los genomas publicados en el navegador de genomas de la Universidad de California Santa Cruz y Ensembl . [ 5 ]

Implementación

Modelo genómico

El objetivo principal al desarrollar un modelo de secuencia genómica para GENSCAN fue identificar las propiedades generales y específicas que componen las unidades funcionales individuales de los genes eucariotas (p. ej. , exones , intrones , sitios de empalme , promotores ). Se hizo especial hincapié en las características reconocibles por la maquinaria general de transcripción, empalme y traducción que procesa la mayoría de los genes codificadores de proteínas , en contraposición a las señales asociadas con la transcripción o el empalme de genes y familias de genes (p. ej. , caja TATA ). Además, se utiliza un modelo de Markov general de quinto orden con tres periodos para las regiones codificantes, en contraposición a los modelos de motivos proteicos específicos o la información de homología de bases de datos . Asimismo, el modelo tiene en cuenta las diferencias estructurales y de densidad entre las regiones compositivas del genoma humano. [ 3 ]

Debido al uso de estos elementos, GENSCAN funciona sin necesidad de consultar bases de datos de secuencias de proteínas que muestren genes similares. En cambio, las predicciones generadas por GENSCAN complementan las obtenidas mediante métodos de identificación de genes basados ​​en homología (por ejemplo, consultando bases de datos de proteínas con BLASTX ). En general, la estructura del modelo utilizado en GENSCAN es similar al Modelo Oculto de Markov Generalizado . [ 3 ]

Características

La implementación de GENSCAN difiere de otros programas en múltiples aspectos. Una diferencia notable es que GENSCAN utiliza un modelo de secuencia genómica que se centra exclusivamente en el ADN de doble cadena, donde los genes presentes en ambas cadenas se analizan simultáneamente. Además, GENSCAN es capaz de analizar genomas con genes parciales o inexistentes, en lugar de limitarse a analizar secuencias de genes individuales y completas como otros programas de la época. Estos dos factores contribuyen a que GENSCAN sea particularmente útil para analizar genomas humanos más largos. Asimismo, GENSCAN emplea el concepto de Descomposición de Dependencia Máxima, lo que permite modelar señales funcionales en secuencias de ADN y proteínas, posibilitando que el programa considere las dependencias entre las posiciones de las señales. Esto se implementa en GENSCAN mediante la generación de un modelo de la señal de empalme donante, que captura las dependencias asociadas a los mecanismos de reconocimiento de los sitios de empalme donante en las secuencias de pre-ARNm . [ 3 ]

GENSCAN tiene la capacidad de calcular la precisión de cada una de sus predicciones utilizando el algoritmo de avance-retroceso . [ 3 ]

La predicción de la estructura y composición general de los genes humanos en relación con la ubicación de exones y genes en secuencias más largas es un componente adicionalmente útil de GENSCAN. Esto incluye varias características. Una de ellas es la capacidad de capturar diferencias en la estructura y composición de los genes entre regiones C + G en el genoma humano, utilizando conjuntos de parámetros de modelo generados empíricamente. Otra característica derivada es, como se mencionó anteriormente, la predicción de múltiples genes en una secuencia, además de la capacidad de trabajar con genes parciales y ADN de doble cadena. Por último, esto también permite a GENSCAN capturar dependencias entre posiciones de señales con nuevos modelos de sitios de empalme donadores y aceptores. [ 3 ]

Eficiencia

El tiempo de ejecución de GENSCAN aumenta casi linealmente cuando se proporcionan secuencias de tamaño realista (varios kilobits como mínimo), pero en el peor de los casos es cuadrático. [ 3 ]

Uso suplementario

GENSCAN, al igual que otros programas de predicción genómica, no produce resultados que coincidan totalmente con los de otros programas. Esto se debe a múltiples factores, entre los que se incluyen, pero no se limitan a: diferencias en los algoritmos, los parámetros y los conjuntos de entrenamiento. Por lo tanto, GENSCAN se ha utilizado para combinar los resultados de dos programas de predicción genética, de modo que si uno de los programas combinados confía en una predicción de secuencia, se utiliza dicha secuencia. Por otro lado, si ninguno de los programas confía en sus predicciones, la secuencia predicha solo se utiliza si ambos programas coinciden en ella. [ 6 ]

Exactitud

Se realizaron pruebas para evaluar la precisión de GENSCAN con conjuntos de datos cortos. Una de las pruebas se llevó a cabo con el conjunto de datos Burset/Guigó, que contiene 570 secuencias de genes multiexónicos de vertebrados. Los datos obtenidos en esta prueba se muestran en la tabla siguiente, junto con los datos generados al probar otros programas con el mismo conjunto de datos. En la tabla se observa que GENSCAN es, en general, más preciso que sus competidores a la hora de predecir secuencias con nucleótidos y exones. [ 3 ]

Además, la tabla que se muestra a continuación describe específicamente la precisión de GENSCAN con respecto a las secuencias genómicas organizadas por rangos de C + G y tipos de organismos. Podemos observar en los datos proporcionados que la variación en la precisión de GENSCAN fue bastante insensible al contenido de C + G y al tipo de organismo. Esto demuestra aún más la independencia de GENSCAN respecto a factores que habrían afectado los resultados de programas de predicción genómica comparables. [ 3 ]

Se realizó una prueba independiente sobre la precisión de GENSCAN utilizando dos conjuntos de datos de GeneParser a los que se les eliminaron todos los genes que presentaban una coincidencia de aminoácidos superior al 25 % con respecto a los de conjuntos de prueba de GeneParser anteriores. Los datos resultantes de esta prueba y de la misma prueba realizada en otros programas se muestran en la tabla siguiente. Podemos observar que existe poca variación entre la precisión de GENSCAN con el conjunto de datos de Burset/Guigó mencionado anteriormente y los conjuntos de datos de GeneParser. Sin embargo, ciertos puntos de datos con mayor fluctuación (por ejemplo, 98 % CC en nucleótidos altos de C + G en el conjunto II de GeneParser frente a 90 % CC en C + G > 60 nucleótidos en Burset/Guigó) pueden atribuirse a que los conjuntos de datos de GeneParser tienen un tamaño de muestra mucho menor. Las pruebas realizadas en los tres conjuntos de datos mencionados proporcionaron suficiente información para llegar a las conclusiones correspondientes. Sin embargo, estos conjuntos de datos no tienen un tamaño realista, por lo que su fiabilidad y alcance se ponen en duda justificadamente. [ 3 ]

En 1997, se descubrió que GENSCAN tenía una mayor precisión que los programas de predicción de genes anteriores. Sin embargo, aún quedaba trabajo por hacer, ya que se demostró que GENSCAN solo predecía con precisión entre el 10 % y el 15 % de los genes en conjuntos de datos realistas. [ 5 ] Debido a imprecisiones como esta, cualquier predicción proporcionada por GENSCAN y otros programas debe verificarse comparándola con una secuencia de ADN complementario , una secuencia de etiqueta de secuencia expresada (EST) o una secuencia de proteína conocida. [ 6 ]

Referencias

  1. http://genes.mit.edu/GENSCAN.html Archivado el 6 de septiembre de 2013 en Wayback Machine. El servidor web GENSCAN del MIT.
  2. Burge, CB (1998) Modelado de dependencias en señales de empalme de pre-ARNm. En Salzberg, S. , Searls, D. y Kasif, S., eds. Métodos computacionales en biología molecular, Elsevier Science, Ámsterdam, pp. 127-163. ISBN 978-0-444-50204-9
  3. 1 2 3 4 5 6 7 8 9 10 11 12 13 Burge, Christopher ; Karlin, Samuel (1997). "Predicción de estructuras genéticas completas en el ADN genómico humano" (PDF) . Journal of Molecular Biology . 268 (1): 78–94 . CiteSeerX 10.1.1.115.3107 . doi : 10.1006/jmbi.1997.0951 . PMID 9149143. Archivado del original (PDF) el 20 de junio de 2015.  
  4. Burge, C. ; Karlin, S. (1998). "Encontrando los genes en el ADN genómico" . Current Opinion in Structural Biology . 8 (3): 346– 354. doi : 10.1016/S0959-440X(98)80069-9 . PMID 9666331 . 
  5. 1 2 3 Flicek, Paul (2007). " Predicción genética: comparar y CONTRASTAR" . Genome Biology . 8 (12): 233. doi : 10.1186/gb-2007-8-12-233 . ISSN 1474-760X . PMC 2246255. PMID 18096089 .   
  6. 1 2 Rogic, S.; Ouellette, BFF; Mackworth, AK (2002-08-01). "Mejora de la precisión del reconocimiento de genes mediante la combinación de predicciones de dos programas de búsqueda de genes" . Bioinformatics . 18 (8): 1034– 1045. doi : 10.1093/bioinformatics/18.8.1034 . ISSN 1367-4803 . PMID 12176826 .