El Proyecto de Comparación de Genomas de Fiocruz es un esfuerzo de colaboración que involucra al Instituto Oswaldo Cruz de Brasil y a la Red Comunitaria Mundial de IBM , diseñado para producir una base de datos que compare los genes de muchos genomas entre sí utilizando SSEARCH. [ 1 ] El programa SSEARCH realiza una alineación rigurosa de Smith-Waterman entre una secuencia de proteína y otra secuencia de proteína, una base de datos de proteínas, un ADN o una biblioteca de ADN.
La naturaleza de los cálculos del proyecto permite aprovechar fácilmente la computación distribuida . Esto, junto con los probables beneficios humanitarios de la investigación, ha llevado a la World Community Grid (una red de computación distribuida que utiliza el tiempo de inactividad de los ordenadores) a ejecutar el proyecto Fiocruz. Todos los productos son de dominio público por contrato con la WCG.
Descripción
El problema radica en que las entradas de las bases de datos de proteínas contienen una gran cantidad de información (estructural, funcional, referencias cruzadas, etc.). Una vez introducida, esta información rara vez se actualiza o corrige. Esta anotación de la función proteica predicha suele ser incompleta, utiliza una nomenclatura no estándar o puede ser incorrecta al compararla con secuencias anteriores, a veces anotadas erróneamente. Además, muchos sistemas automatizados pasan por alto proteínas compuestas por varios dominios estructurales y/o funcionales. La información comparativa actual es enorme en comparación con los inicios de la genómica. Un solo error se acumula y se vuelve complejo.
El Proyecto de Comparación de Genomas realiza una comparación completa por pares entre todas las secuencias de proteínas predichas , obteniendo índices que se utilizan (junto con la Ontología Génica estandarizada [ 2 ] ) como repositorio de referencia para la comunidad de anotadores. El proyecto proporciona fuentes de datos invaluables para los biólogos. El programa de comparación de similitud de secuencias utilizado en el Proyecto de Comparación de Genomas se llama SSEARCH. Este programa encuentra matemáticamente la mejor alineación local entre pares de secuencias [ 3 ] y es una implementación de libre acceso del algoritmo de Smith-Waterman [ 4 ] .
El uso de SSEARCH permite una anotación precisa, la corrección de inconsistencias y la posible asignación de funciones a proteínas hipotéticas de función desconocida. Además, se identifican correctamente las proteínas con múltiples dominios y elementos funcionales. Incluso se detectan relaciones distantes.
Véase también
Notas
- ↑ Página web de SSEARCH archivada el 20/09/2012 en Wayback Machine .
- ↑ El sitio web de Gene Ontology
- ↑ Pearson, William R. (noviembre de 1991). "Búsqueda en bibliotecas de secuencias de proteínas: comparación de la sensibilidad y selectividad de los algoritmos Smith-Waterman y FASTA" . Genomics . 11 (3): 635– 650. doi : 10.1016/0888-7543(91)90071-l . ISSN 0888-7543 . PMID 1774068 .
- ↑ Smith, TF; Waterman, MS (marzo de 1981). "Identificación de subsecuencias moleculares comunes" . Journal of Molecular Biology . 147 (1): 195–197 . doi : 10.1016/0022-2836(81)90087-5 . ISSN 0022-2836 . PMID 7265238 .
Enlaces externos
- Proyecto de comparación de genomas
- Proyecto de Red Eléctrica Comunitaria Mundial
- Proyectos de infraestructura abierta de Berkeley para computación en red
- Genómica
- Proyectos informáticos de voluntariado