La evaluación crítica de la anotación funcional (CAFA) es un experimento diseñado para proporcionar una evaluación a gran escala de los métodos computacionales dedicados a predecir la función de las proteínas . [1] Se evalúan diferentes algoritmos por su capacidad para predecir los términos de ontología genética (GO) en las categorías de función molecular , proceso biológico y componente celular .
El experimento consta de dos etapas: (i) la etapa eucariota , (ii) la etapa procariota . En cada etapa, los organizadores proporcionan un conjunto de objetivos. Se espera que los participantes envíen sus predicciones antes de la fecha límite de presentación, después de lo cual se las evalúa de acuerdo con un conjunto de métricas específicas.
Motivación
El genoma de un organismo puede estar formado por cientos o decenas de miles de genes , que codifican cientos de miles de secuencias proteicas diferentes . Debido al coste relativamente bajo de la secuenciación genómica , determinar las secuencias de genes y proteínas es rápido y económico. Hasta ahora se han secuenciado miles de especies, pero muchas de las proteínas no están bien caracterizadas. [2] El proceso de determinar experimentalmente el papel de una proteína en la célula es una tarea costosa y que requiere mucho tiempo. Además, incluso cuando se realizan ensayos funcionales , es poco probable que proporcionen una visión completa de la función de las proteínas. Por lo tanto, se ha vuelto importante utilizar herramientas computacionales para anotar funcionalmente las proteínas. Existen varios métodos computacionales de predicción de la función de las proteínas que pueden inferir la función de las proteínas utilizando una variedad de datos biológicos y evolutivos, pero hay un margen significativo para la mejora. La predicción precisa de la función de las proteínas puede tener implicaciones de larga data en la investigación biomédica y farmacéutica.
El experimento CAFA está diseñado para proporcionar una evaluación imparcial de los métodos computacionales, estimular la investigación en la predicción de funciones computacionales y proporcionar información sobre el estado general del arte en la predicción de funciones.
Organización
El experimento consta de tres fases:
- Fase de predicción : ~4 meses
Los organizadores proporcionan secuencias de proteínas con función desconocida o incompleta a la comunidad y establecen la fecha límite para la presentación de predicciones.
- Acumulación de objetivos : 6 a 12 meses
Una vez que se almacenan todas las predicciones y el experimento entra en un período de espera en el que se espera que las funciones de las proteínas se acumulen en bases de datos públicas.
- Fase de análisis : 1 mes
Los predictores se clasifican según su desempeño. Los resultados se comparten públicamente en reuniones científicas y se publican después de una revisión por pares .
Historia
El experimento CAFA es llevado a cabo por el Grupo de Interés Especial de Predicción de Funciones Automatizadas (AFP, por sus siglas en inglés) (AFP/SIG). CAFA fue concebido por la Dra. Inbal (Halperin) Landsberg y organizado por ella junto con el Prof. Russ Altman y el Dr. Iddo Friedberg. Se ha celebrado una reunión del AFP/SIG junto con la conferencia de Sistemas Inteligentes para Biología Molecular en 2005, 2006, 2008, 2011 y 2012. [3] [4] [5]
CAFA 2010-2012
El primer experimento CAFA se organizó entre el otoño de 2010 y la primavera de 2012. Los organizadores proporcionaron 48.000 secuencias a la comunidad con la tarea de predecir las anotaciones de Gene Ontology para cada una de estas secuencias. De esas 48.000 proteínas, 866 se anotaron experimentalmente durante la fase de acumulación de objetivos. Los resultados mostraron que los algoritmos de predicción de funciones actuales funcionan significativamente mejor que una simple asignación de dominio o un uso directo del paquete BLAST . Sin embargo, también revelaron que la predicción precisa de la función biológica de una proteína sigue siendo un problema abierto y desafiante.
CAFA 2013-2014
El segundo experimento CAFA comenzó en el otoño de 2013. A partir de agosto, los interesados pudieron descargar más de 100.000 secuencias objetivo en 27 especies. Los equipos registrados tienen el reto de anotar las secuencias con términos de ontología genética, con un reto adicional de anotar las secuencias humanas con términos de ontología del fenotipo humano . La fecha límite para la presentación de las propuestas fue el 15 de enero de 2014. La evaluación de las predicciones se llevará a cabo en junio de 2014.
Véase también
CASP : Evaluación crítica de la predicción de la estructura de proteínas
CAPRI : Evaluación crítica de la predicción de interacciones
Referencias
- ^ Predrag, Radivojac; et al. (2013). "Una evaluación a gran escala de la predicción computacional de la función proteica". Nature Methods . 10 (3): 221–227. doi :10.1038/nmeth.2340. PMC 3584181 . PMID 23353650.
- ^ Bernal, Axel; Uy Ear; Nikos Kyrpides (2001). "Base de datos Genomes OnLine (GOLD): un monitor de proyectos de genoma en todo el mundo". Investigación de ácidos nucleicos . 29 (1): 126–127. doi :10.1093/nar/29.1.126. PMC 29859 . PMID 11125068.
- ^ Friedberg, Iddo; Martin Jambon; Adam Godzik (junio de 2006). "Nuevas vías en la predicción de la función de las proteínas". Protein Science . 15 (6): 1527–1529. doi :10.1110/ps.062158406. PMC 2242544 . PMID 16731984.
- ^ Rodrigues, Ana; Barry Grant; Adam Godzik; Iddo Friedberg (2007). "Reunión sobre predicción de funciones automatizadas de 2006". Bioinformática . 8 (Supl 4): S1–4. doi : 10.1186/1471-2105-8-s4-s1 . PMC 1892079 . PMID 17570143.
- ^ Gillis, Jesse; Paul Pavlidis (abril de 2013). "Caracterización del estado del arte en la asignación computacional de la función génica: lecciones de la primera evaluación crítica de la anotación funcional (CAFA)" (PDF) . BMC Bioinformatics . 14 (Suppl 3): S15. doi : 10.1186/1471-2105-14-s3-s15 . PMC 3633048 . PMID 23630983.
Enlaces externos
- Información para participar en el desafío CAFA del Grupo de interés especial en predicción de funciones automatizadas